Cómo responden los modelos precisamente en español: la puntuación se construye con comparaciones a ciegas en las que personas eligieron la mejor respuesta en español. Es una selección sobre la lengua, no sobre la capacidad: un modelo fuerte en la clasificación general puede ceder aquí ante otro que maneja mejor la formulación española.
| # | Modelo | Desarrollador | Arena Score, español | Acceso$ / 1M | Salida$ / 1M | Contextotokens |
|---|---|---|---|---|---|---|
| 1 | Claude Opus 4.6 | Anthropic | 1.511,71 1.497–1.526 | $5 | $25 | 1.000K |
| 2 | Claude Fable 5 ≈ | Anthropic | 1.504,09 1.477–1.531 | $10 | $50 | 1.000K |
| 3 | Gemini 3.1 Pro Preview ≈ | Google DeepMind | 1.479,93 1.467–1.493 | $2 | $12 | 1.049K |
| 4 | Muse Spark 1.1 ≈ | Meta AI | 1.479,03 1.444–1.514 | $1,25 | $4,25 | 1.049K |
| 5 | ERNIE 5.1 ≈ | Baidu (Ernie) | 1.475,26 1.456–1.494 | $0,75 | $3 | 119K |
| 6 | GLM 5.2 ≈ | Zhipu AI / Z.ai | 1.475,02 1.450–1.500 | $0,42 | $1,32 | 1.049K |
| 7 | Claude Opus 4.7 ≈ | Anthropic | 1.473,23 1.457–1.489 | $5 | $25 | 1.000K |
| 8 | Gemini 3.5 Flash ≈ | Google DeepMind | 1.471,19 1.440–1.502 | $1,5 | $9 | 1.049K |
| 9 | Gemini 2.5 Pro ≈ | Google DeepMind | 1.469,59 1.457–1.482 | $1,25 | $10 | 1.049K |
| 10 | Gemini 3 Pro ≈ | Google DeepMind | 1.469,46 1.450–1.489 | $1,6 | $9,6 | 1.049K |
| 11 | Inkling ≈ | Thinking Machines Lab | 1.466,98 1.425–1.509 | $1,87 | $4,68 | 1.049K |
| 12 | MiMo V2.5 Pro ≈ | Xiaomi | 1.463,75 1.446–1.482 | $0,44 | $0,87 | 1.050K |
| 13 | Qwen3 Max Preview ≈ | Alibaba (Qwen) | 1.463,37 1.441–1.486 | $1,2 | $6 | 256K |
| 14 | Kimi K2.6 ≈ | Moonshot AI (Kimi) | 1.463,27 1.446–1.481 | $0,22 | $1,14 | 262K |
| 15 | Claude Sonnet 4.6 ≈ | Anthropic | 1.462,54 1.447–1.478 | $3 | $15 | 1.000K |
| 16 | Qwen3.7 Plus ≈ | Alibaba (Qwen) | 1.461,46 1.439–1.484 | $0,5 | $3 | 1.000K |
| 17 | Gemini 3 Flash ≈ | Google DeepMind | 1.460,41 1.439–1.481 | $0,4 | $2,4 | 1.049K |
| 18 | Seed 2.0 Pro ≈ | ByteDance (Doubao) | 1.458,9 1.445–1.473 | $0,5 | $3 | 131K |
| 19 | Gemma 4 31B ≈ | Google DeepMind | 1.457,33 1.419–1.496 | $0,14 | $0,4 | 262K |
| 20 | GLM 5.1 ≈ | Zhipu AI / Z.ai | 1.456,35 1.437–1.475 | $0,06 | $0,22 | 205K |
| 21 | Claude Sonnet 4.5 ≈ | Anthropic | 1.455,76 1.442–1.470 | $3 | $15 | 1.000K |
| 22 | MiMo V2 Pro ≈ | Xiaomi | 1.454,24 1.432–1.476 | $0,44 | $0,87 | 1.049K |
| 23 | Kimi K2.5 Thinking TEE ≈ | Moonshot AI (Kimi) | 1.453,89 1.439–1.469 | $0,3 | $1,9 | 256K |
| 24 | GPT-5.6 Terra ≈ | OpenAI | 1.453,31 1.413–1.493 | $2 | $12 | 1.050K |
| 25 | Claude 4.5 Opus ≈ | Anthropic | 1.453,21 1.438–1.468 | $5 | $25 | 200K |
| 26 | Qwen3.6 Max Preview ≈ | Alibaba (Qwen) | 1.452,39 1.415–1.490 | $1,3 | $7,8 | 262K |
| 27 | GLM 4.5 ≈ | Zhipu AI / Z.ai | 1.450,57 1.426–1.475 | $0,2 | $0,8 | 131K |
| 28 | DeepSeek V4 Pro ≈ | DeepSeek | 1.450,48 1.433–1.468 | $0,44 | $0,87 | 1.049K |
| 29 | GLM 5V Turbo ≈ | Zhipu AI / Z.ai | 1.450,15 1.412–1.489 | $0,7 | $3,1 | 203K |
| 30 | Qwen3.5 397B-A17B ≈ | Alibaba (Qwen) | 1.449,69 1.434–1.465 | $0,6 | $3,6 | 262K |
| 31 | Grok 4.5 ≈ | xAI | 1.449,5 1.412–1.487 | $2 | $6 | 500K |
| 32 | Claude Opus 4.8 ≈ | Anthropic | 1.449,21 1.429–1.469 | $5 | $25 | 1.000K |
| 33 | Qwen3 Next 80B A3B Instruct ≈ | Alibaba (Qwen) | 1.449,16 1.424–1.474 | $0,15 | $1,2 | 262K |
| 34 | Grok 4.20 (Reasoning) ≈ | xAI | 1.448,44 1.433–1.464 | $2 | $6 | 2.000K |
| 35 | Mistral Large 3 ≈ | Mistral AI | 1.447,3 1.430–1.464 | $0,5 | $1,5 | 256K |
| 36 | Grok 4.20 Multi Agent Beta 0309 ≈ | xAI | 1.446,92 1.431–1.462 | $2 | $6 | 2.000K |
| 37 | GLM 5 ≈ | Zhipu AI / Z.ai | 1.446,57 1.427–1.466 | $0,48 | $1,9 | 205K |
| 38 | Claude 4.1 Opus ≈ | Anthropic | 1.444,59 1.430–1.459 | $15 | $75 | 200K |
| 39 | Longcat Flash Chat ≈ | Meituan | 1.444,1 1.412–1.476 | — | — | 131K |
| 40 | DeepSeek V3.2 Exp ≈ | DeepSeek | 1.441,73 1.408–1.475 | $0,22 | $0,33 | 164K |
| 41 | DeepSeek V4 Flash ≈ | DeepSeek | 1.438,41 1.421–1.456 | $0,14 | $0,28 | 1.049K |
| 42 | GLM 4.6 ≈ | Zhipu AI / Z.ai | 1.436,04 1.416–1.457 | $0,29 | $1,14 | 205K |
| 43 | ChatGPT 4o Latest ≈ | OpenAI | 1.435,92 1.421–1.451 | $5 | $15 | 128K |
| 44 | MiMo V2 Omni ≈ | Xiaomi | 1.435,01 1.410–1.460 | $0,14 | $0,28 | 262K |
| 45 | Qwen3.6 Plus ≈ | Alibaba (Qwen) | 1.432,89 1.416–1.450 | $0,5 | $3 | 1.000K |
| 46 | Claude Sonnet 5 ≈ | Anthropic | 1.432,53 1.404–1.461 | $2 | $10 | 1.000K |
| 47 | GPT-5.6 Luna ≈ | OpenAI | 1.431,67 1.393–1.471 | $0,2 | $1,2 | 1.050K |
| 48 | GPT-5.2 Chat ≈ | OpenAI | 1.431,17 1.412–1.451 | $1,75 | $14 | 128K |
| 49 | GPT-5.5 Instant ≈ | OpenAI | 1.429,62 1.407–1.452 | $5 | $30 | 400K |
| 50 | Mistral Medium 3.1 ≈ | Mistral AI | 1.429,58 1.416–1.443 | $0,4 | $2 | 262K |
| 51 | MiniMax M3 ≈ | MiniMax | 1.428,58 1.407–1.450 | $0,3 | $1,2 | 1.049K |
| 52 | Gemini 3.1 Flash Lite Preview ≈ | Google DeepMind | 1.424,66 1.410–1.440 | $0,25 | $1,5 | 1.049K |
| 53 | Qwen3 235B A22B Instruct 2507 ≈ | Alibaba (Qwen) | 1.424,58 1.412–1.437 | $0,1 | $0,1 | 262K |
| 54 | Grok 4.1 ≈ | xAI | 1.423,99 1.409–1.439 | $2 | $10 | 200K |
| 55 | DeepSeek V3.2 ≈ | DeepSeek | 1.422,11 1.404–1.440 | $0,28 | $0,4 | 164K |
| 56 | Step 3.5 Flash ≈ | StepFun | 1.419,82 1.404–1.435 | $0,1 | $0,3 | 262K |
| 57 | Claude Haiku 4.5 ≈ | Anthropic | 1.419,11 1.406–1.432 | $1 | $5 | 200K |
| 58 | Gemini 2.5 Flash ≈ | Google DeepMind | 1.419,02 1.407–1.431 | $0,3 | $2,5 | 1.049K |
| 59 | Qwen3.5 122B-A10B ≈ | Alibaba (Qwen) | 1.418,53 1.398–1.439 | $0,4 | $3,2 | 262K |
| 60 | MiMo V2 Flash ≈ | Xiaomi | 1.417,54 1.400–1.435 | $0,14 | $0,28 | 262K |
| 61 | Nemotron 3 Super ≈ | NVIDIA | 1.417,52 1.384–1.451 | $0,2 | $0,8 | 1.000K |
| 62 | GLM 4.7 ≈ | Zhipu AI / Z.ai | 1.416,62 1.384–1.449 | $0,15 | $0,8 | 205K |
| 63 | Grok 4 ≈ | xAI | 1.413,5 1.394–1.433 | $3 | $15 | 256K |
| 64 | MiMo V2.5 ≈ | Xiaomi | 1.413,26 1.395–1.431 | $0,14 | $0,28 | 1.050K |
| 65 | Qwen3.5 27B ≈ | Alibaba (Qwen) | 1.412,42 1.391–1.434 | $0,3 | $2,4 | 262K |
| 66 | Grok 4.1 Fast Reasoning ≈ | xAI | 1.412,18 1.396–1.429 | $0,2 | $0,5 | 2.000K |
| 67 | DeepSeek V3.1 ≈ | DeepSeek | 1.412,11 1.380–1.444 | $0,2 | $0,7 | 164K |
| 68 | GPT-5.6 Sol ≈ | OpenAI | 1.411,99 1.374–1.450 | $5 | $30 | 1.050K |
| 69 | Grok 4 Fast Reasoning ≈ | xAI | 1.411,24 1.385–1.437 | $0,2 | $0,5 | 2.000K |
| 70 | MiniMax M2.7 ≈ | MiniMax | 1.409,44 1.393–1.426 | $0,3 | $1,2 | 205K |
| 71 | Qwen3 VL 235B A22B Instruct ≈ | Alibaba (Qwen) | 1.409,22 1.379–1.439 | $0,4 | $1,6 | 262K |
| 72 | Kimi K2 Thinking Turbo ≈ | Moonshot AI (Kimi) | 1.407,87 1.392–1.423 | $1,15 | $8 | 262K |
| 73 | DeepSeek R1 0528 ≈ | DeepSeek | 1.406,14 1.368–1.444 | $0,25 | $0,25 | 164K |
| 74 | Ling Flash 2.0 ≈ | Ant Group (Ling) | 1.402,17 1.364–1.441 | $0,14 | $0,57 | 131K |
| 75 | Grok 4.3 ≈ | xAI | 1.401,89 1.384–1.419 | $1,25 | $2,5 | 1.000K |
| 76 | Mistral Medium 3.5 ≈ | Mistral AI | 1.401,7 1.369–1.434 | $1,5 | $7,5 | 262K |
| 77 | Qwen3.5 Flash ≈ | Alibaba (Qwen) | 1.399,29 1.384–1.415 | $0,09 | $0,36 | 1.000K |
| 78 | 2025) ≈ | Google DeepMind | 1.398,72 1.377–1.420 | $0,3 | $2,5 | 1.049K |
| 79 | Qwen3 Max 2025-09-23 ≈ | Alibaba (Qwen) | 1.397,75 1.368–1.428 | $0,86 | $3,43 | 258K |
| 80 | Qwen3 30B A3B Instruct 2507 ≈ | Alibaba (Qwen) | 1.392,66 1.369–1.417 | $0,05 | $0,19 | 262K |
| 81 | Qwen3.5 35B A3B ≈ | Alibaba (Qwen) | 1.391,67 1.371–1.413 | $0,25 | $2 | 262K |
| 82 | Qwen3 235B A22B Thinking-2507 ≈ | Alibaba (Qwen) | 1.390,57 1.345–1.436 | $0,1 | $0,1 | 262K |
| 83 | GPT 5 Chat ≈ | OpenAI | 1.387,59 1.366–1.410 | $1,25 | $10 | 128K |
| 84 | MiMo V2 Flash (Thinking) ≈ | Xiaomi | 1.385,84 1.354–1.418 | $0,1 | $0,31 | 256K |
| 85 | Qwen3 VL 235B A22B Thinking ≈ | Alibaba (Qwen) | 1.385,04 1.352–1.418 | $0,4 | $4 | 262K |
| 86 | GPT OSS 120B ≈ | OpenAI | 1.384,44 1.362–1.407 | $0,03 | $0,14 | 131K |
| 87 | o3 2025-04-16 ≈ | OpenAI | 1.384,08 1.365–1.403 | $2 | $8 | 200K |
| 88 | Kimi K2 0905 Preview ≈ | Moonshot AI (Kimi) | 1.380,79 1.347–1.415 | $0,6 | $2,5 | 262K |
| 89 | Step 3 ≈ | StepFun | 1.380,53 1.338–1.424 | $0,21 | $0,57 | 66K |
| 90 | DeepSeek Reasoner ≈ | DeepSeek | 1.375,56 1.323–1.429 | $0,55 | $2,19 | 164K |
| 91 | GLM 4.5 Air ≈ | Zhipu AI / Z.ai | 1.372,48 1.350–1.395 | $0,11 | $0,29 | 131K |
| 92 | GPT-5.3 Chat (latest) ≈ | OpenAI | 1.372,21 1.353–1.391 | $1,75 | $14 | 128K |
| 93 | Nemotron 3 Nano 30B A3B ≈ | NVIDIA | 1.369,55 1.336–1.403 | $0,05 | $0,2 | 262K |
| 94 | GPT 4.1 2025-04-14 ≈ | OpenAI | 1.368,54 1.349–1.388 | $2 | $8 | 1.048K |
| 95 | Mistral Medium 3 ≈ | Mistral AI | 1.365,42 1.338–1.393 | $0,4 | $2 | 131K |
| 96 | Qwen 3 235b A22B ≈ | Alibaba (Qwen) | 1.363,03 1.334–1.392 | $0,7 | $2,8 | 131K |
| 97 | Gemini 2.5 Flash Lite Preview ≈ | Google DeepMind | 1.361,88 1.339–1.384 | $0,1 | $0,4 | 1.049K |
| 98 | Nova 2 Lite ≈ | Amazon | 1.361,55 1.319–1.405 | $0,3 | $2,5 | 1.000K |
| 99 | GLM 4.7 Flash ≈ | Zhipu AI / Z.ai | 1.358,45 1.326–1.391 | $0,04 | $0,3 | 203K |
| 100 | Grok 3 Mini ≈ | xAI | 1.355,7 1.322–1.390 | $0,3 | $0,5 | 131K |
La tabla se desplaza en horizontal: no caben todas las columnas.
El precio es el más bajo entre los proveedores del modelo, tarifa base, sin tarifas por lotes ni reducidas. La entrada y la salida se muestran por separado a propósito: en la mayoría de los modelos la salida cuesta varias veces más que la entrada, y la factura final depende de qué predomine en la tarea.
El signo ≈ marca los modelos cuyo intervalo de confianza se solapa con el de la fila de arriba. Aquí hay 99 modelos — su orden entre sí no está determinado por los datos disponibles.
El intervalo de confianza de la mitad de los modelos supera 42,4 puntos — es decir, unas 27 filas adyacentes de la tabla. Dentro de ese grupo el orden no lo marcan los datos, sino quién votó esta vez; los datos sostienen la diferencia entre el principio y el final de la lista, pero no la vecindad de los puestos. Votos por modelo aquí — mediana 842: cuantos menos hay, más ancho es el intervalo.
Arena (LMArena)
— licencia CC-BY-4.0 · fuente original
По данным Arena (LMArena)