Ranking de IA

Las mejores IA para tareas de agente

Aquí el modelo no contesta una pregunta, hace el trabajo: edita archivos en un sistema operativo, busca, completa tareas en un entorno de trabajo. Por eso los porcentajes son bajos incluso en los modelos fuertes, y no se pueden comparar con las puntuaciones de la selección de conocimientos: es un trabajo distinto, no una fuerza distinta.

32 modelos en la tabla
32 considerados en el cálculo
9 junio 2026 lanzamiento del modelo más nuevo aquí
7 agosto 2026 último recálculo
# Modelo Desarrollador Puntuación por tareas 0–100, ajustado por cobertura Acceso$ / 1M Salida$ / 1M Contextotokens APEX-Agents DeepResearch Bench BALROG Cybench The Agent Company Conjuntosmedido
1 Claude Opus 4.6 Anthropic 40,67 46,22 $5 $25 1.000K 32,4 55,3 93 4
2 Claude 4.5 Opus Anthropic 40,11 43,63 $5 $25 200K 20,7 43,5 82 6
3 Claude Sonnet 4.5 Anthropic 39,89 44,02 $3 $15 1.000K 52,6 60 5
4 Claude 4.1 Opus Anthropic 38,89 45,1 $15 $75 200K 49,7 42 3
5 Gemini 3.1 Pro Preview Google DeepMind 37,42 45,25 $2 $12 1.049K 33,5 57 2
6 Claude 4 Opus Anthropic 36,54 43,5 $15 $75 200K 49 38 2
7 Claude Sonnet 4.6 Anthropic 36,52 39,99 $3 $15 1.000K 23,7 54,9 4
8 Kimi K2.5 Moonshot AI (Kimi) 34,22 38,85 $0,35 $1,7 262K 14,4 2
9 Grok 4 xAI 32,85 34,16 $3 $15 256K 15,2 47,9 43,6 43 5
10 Gemini 3 Flash Preview Google DeepMind 32,82 36,05 $0,5 $3 1.049K 24 48,1 2
11 Claude 4 Sonnet Anthropic 32,61 33,82 $3 $15 1.000K 9,3 47,8 35 33,1 5
12 GPT 5.4 2026-03-05 OpenAI 32,56 35,55 $2,5 $15 1.050K 36 35,1 2
13 Gemini 3 Pro Preview Google DeepMind 31,72 32,79 $2 $12 1.049K 31,5 58,1 4
14 Claude Sonnet 3.7 Anthropic 31,58 32,58 $3 $15 200K 43,6 20 30,9 4
15 Gemini 2.5 Pro Preview 0506 Google DeepMind 30,34 31,1 $1,25 $10 1.049K 31,9 30,3 2
16 Claude Opus 4.8 Anthropic 30,14 30,42 $5 $25 1.000K 42,5 50,2 4
17 Claude Fable 5 Anthropic 30,07 30,55 $10 $50 1.000K 45 2
18 GPT 5.4 Mini 2026-03-17 OpenAI 30,01 30,43 $0,75 $4,5 272K 24,6 36,3 2
19 o3 2025-04-16 OpenAI 29,46 29,4 $2 $8 200K 17,2 46,6 4
20 Claude 3.5 Sonnet 2024-10-22 Anthropic 28,94 28,3 $3 $15 200K 32,6 24 2
21 GPT 5 2025-08-07 OpenAI 28,84 28,54 $1,25 $10 272K 18,3 55,1 32,8 5
22 Claude Opus 4.7 Anthropic 27,82 26,05 $5 $25 1.000K 33,9 2
23 Gemini 2.5 Pro Google DeepMind 27,75 26,54 $1,25 $10 1.049K 6,6 49,7 3
24 Gemini 3.1 Flash Lite Google DeepMind 27,14 24,7 $0,25 $1,5 1.049K 13 36,4 2
25 Claude Haiku 4.5 Anthropic 24,82 20,05 $1 $5 200K 8,9 31,2 2
26 Gemini 2.5 Flash Google DeepMind 23,62 17,65 $0,3 $2,5 1.049K 1,8 33,5 2
27 Llama 3.1 70B Meta AI 23,49 17,4 $0,12 $0,3 131K 27,9 6,9 2
28 Grok 3 xAI 22,69 15,8 $3 $15 131K 2,1 29,5 2
29 Kimi K2.6 Moonshot AI (Kimi) 20,67 11,75 $0,22 $1,14 262K 18,9 2
30 Qwen2.5 72B Instruct Alibaba (Qwen) 20,27 10,95 $1,4 $5,6 131K 16,2 5,7 2
31 Llama 3.1 405B Instruct Meta AI 18,52 7,45 $0,12 $0,3 128K 7,5 7,4 2
32 GPT-4o (2024-11-20) OpenAI 15,21 8,03 $2,5 $10 128K 1,1 12,5 8,6 4

La tabla se desplaza en horizontal: no caben todas las columnas.

Las columnas de la derecha son los sumandos de la puntuación, llevados a una escala común de 0 a 100 según la dispersión real entre los modelos medidos. Sumados con los pesos indicados, dan la cifra de la columna principal: en ellos se ve en qué exactamente un modelo superó a otro. Un guion significa «no medido», no cero. Se muestran los cinco conjuntos de tareas más completos de 9; el resto está en la ficha del modelo.

Qué comprueba cada conjunto de tareas
APEX-Agents
modelos medidos: 47
BALROG
entornos de juego modelos medidos: 22
Cybench
tareas de ciberseguridad modelos medidos: 19
DeepResearch Bench
investigación profunda modelos medidos: 22
GDPval
tareas de profesiones reales modelos medidos: 11
OSWorld
trabajo en un sistema operativo, primera versión modelos medidos: 8
OSWorld 2.0
trabajo en un sistema operativo modelos medidos: 6
Remote Labor Index
encargos de una plataforma de freelance modelos medidos: 10
The Agent Company
tareas de trabajo en un entorno de oficina modelos medidos: 13

La columna «conjuntos» indica sobre cuántos conjuntos de tareas se ha calculado la puntuación de este modelo. Cuantos más haya, más fiable es la cifra: una puntuación sobre dos conjuntos está más dispersa que sobre seis, y el ajuste por cobertura tiene en cuenta justamente eso.

El precio es el más bajo entre los proveedores del modelo, tarifa base, sin tarifas por lotes ni reducidas. La entrada y la salida se muestran por separado a propósito: en la mayoría de los modelos la salida cuesta varias veces más que la entrada, y la factura final depende de qué predomine en la tarea.

Epoch AI — licencia CC-BY · fuente original
По данным Epoch AI