Recursos

Ranking de redes neuronales

Modelos de IA, los precios de sus proveedores y rankings basados en mediciones independientes. Bajo cada tabla se indica de dónde sale la cifra, quién la midió, cuándo y hasta qué punto se puede confiar en ella.

2219modelos
144desarrolladores
257proveedores de API
9fuentes de datos

Último recálculo: 7 agosto 2026

Las mejores IA

Puntuación global

  1. 1 Claude Opus 5 99,44
  2. 2 Claude Opus 4.6 98,59
  3. 3 Claude Fable 5 97,57

La clasificación general: cinco capacidades reunidas en una sola puntuación, para comparar los modelos en su conjunto y no por una única tarea. Se construye con comparaciones a ciegas hechas por personas reales, así que responde a qué modelo prefieren más a menudo, no a cuántas tareas resolvió. Para una habilidad concreta, la selección dedicada es más precisa.

de 235 modelos 99 sin diferencia significativa

IA para programación

Puntuación por tareas

  1. 1 Claude Opus 4.7 59,79
  2. 2 Claude Opus 4.6 59,43
  3. 3 GPT 5.4 2026-03-05 57,49

Cuántas tareas de programación resolvió realmente el modelo en conjuntos de pruebas fijos: un resultado verificable, no una opinión. La selección tiene un contrapunto, basado en votos humanos a ciegas: el orden allí es distinto, y la diferencia entre las dos listas dice más que cualquiera de ellas por separado.

de 41 modelos

IA para razonamiento

Puntuación por tareas

  1. 1 GPT-5.6 Sol 71,53
  2. 2 Claude Opus 5 65,91
  3. 3 Gemini 3.1 Pro Preview 64,89

Tareas de razonamiento donde la respuesta es correcta o incorrecta: se cuenta la parte de problemas resueltos, no las respuestas que gustan. Al lado hay una comprobación cruzada, con votos humanos a ciegas. La lógica es donde preferencia y problema resuelto más se separan: un razonamiento bien redactado gusta incluso cuando su respuesta es errónea.

de 91 modelos

IA por amplitud de conocimientos

Puntuación por tareas

  1. 1 Gemini 3 Flash Preview 55,84
  2. 2 Qwen3.6 Max Preview 55,18
  3. 3 GPT-5.6 Sol 54,72

Una prueba de conocimientos factuales con preguntas que tienen una única respuesta correcta. Se distingue de las selecciones vecinas en que aquí el modelo no razona ni escribe código: recuerda. La lectura alternativa sobre el mismo tema viene de los votos humanos a ciegas.

de 79 modelos

IA para matemáticas

Puntuación por tareas

  1. 1 Claude Fable 5 74,77
  2. 2 GPT-5.6 Sol 72,1
  3. 3 Claude Opus 5 71,39

La parte de problemas matemáticos resueltos, desde nivel olimpiada hasta nivel investigación. Los porcentajes son más bajos que en otras selecciones, y es una propiedad de los problemas, no de los modelos: compararlos con las cifras de la selección de conocimientos no tiene sentido. La otra vara de medir viene de los votos humanos a ciegas.

de 88 modelos

IA para tareas de agente

Puntuación por tareas

  1. 1 Claude Opus 4.6 40,67
  2. 2 Claude 4.5 Opus 40,11
  3. 3 Claude Sonnet 4.5 39,89

Aquí el modelo no contesta una pregunta, hace el trabajo: edita archivos en un sistema operativo, busca, completa tareas en un entorno de trabajo. Por eso los porcentajes son bajos incluso en los modelos fuertes, y no se pueden comparar con las puntuaciones de la selección de conocimientos: es un trabajo distinto, no una fuerza distinta.

de 32 modelos

IA para español

Arena Score, español

  1. 1 Claude Opus 4.6 1.511,71
  2. 2 Claude Fable 5 1.504,09
  3. 3 Gemini 3.1 Pro Preview 1.479,93

Cómo responden los modelos precisamente en español: la puntuación se construye con comparaciones a ciegas en las que personas eligieron la mejor respuesta en español. Es una selección sobre la lengua, no sobre la capacidad: un modelo fuerte en la clasificación general puede ceder aquí ante otro que maneja mejor la formulación española.

de 184 modelos 99 sin diferencia significativa

IA para inglés

Arena Score, inglés

  1. 1 Claude Opus 4.6 1.505,8
  2. 2 Claude Opus 5 1.500,16
  3. 3 Claude Fable 5 1.498,82

La misma comparación a ciegas, pero en inglés. Se lee mejor junto a la selección de español: la distancia entre los dos puestos de un mismo modelo muestra cuánto pierde fuera de la lengua en la que más lo entrenaron.

de 233 modelos 99 sin diferencia significativa

IA para francés

Arena Score, francés

  1. 1 Claude Opus 5 1.522,24
  2. 2 Claude Fable 5 1.519,66
  3. 3 GPT-5.6 Terra 1.503,02

Comparación a ciegas de respuestas en francés. Necesita una selección propia porque el orden de los modelos cambia notablemente de una lengua a otra, y la clasificación general no muestra esa diferencia.

de 185 modelos 99 sin diferencia significativa

Las IA más baratas

Precio, $ por 1M de tokens

  1. 1 Llama 3.2 1b Instruct 0,01
  2. 2 Ling 2.6 Flash 0,02
  3. 3 Google Gemma 2 0,02

El precio del acceso por API por millón de tokens, en dólares, según la oferta más barata entre los proveedores. Entrada y salida se reúnen en una sola cifra: la salida suele costar varias veces más, y ordenar los modelos solo por el precio de entrada pondría arriba algo distinto del más barato.

de 1508 modelos

IA multimodales

Arena Score, imágenes

  1. 1 Claude Fable 5 1.334,18
  2. 2 Claude Opus 5 1.328,68
  3. 3 Gemini 3.6 Flash 1.315,75

Hasta qué punto el modelo entiende una imagen junto con el texto: comparación a ciegas de respuestas a peticiones que llevan una imagen adjunta. No confundir con la generación de imágenes: allí el modelo dibuja, aquí mira.

de 90 modelos 84 sin diferencia significativa

IA para generar imágenes

Arena Score, generación

  1. 1 GPT Image 2 1.384,81
  2. 2 Mai Image 2.5 1.256,56
  3. 3 Nano Banana 2 Lite 1.249,66

Comparación a ciegas de imágenes terminadas: las personas eligen la mejor sin saber qué modelo la dibujó. Es un juicio del resultado a ojo, no una comprobación contra una consigna; por eso la diferencia entre puestos vecinos la mayoría de las veces no es estadísticamente significativa.

de 33 modelos 19 sin diferencia significativa

IA para generar vídeo

Arena Score, vídeo

  1. 1 Sora 2 Pro 1.365,62
  2. 2 Sora 2 1.337,11
  3. 3 Seedance v1.5 Pro 1.256,99

La misma comparación a ciegas que con las imágenes, pero para vídeo. Aquí hay diez veces menos modelos que en las selecciones de texto, y los primeros puestos se separan del resto con más claridad, simplemente porque los participantes son pocos.

de 7 modelos 2 sin diferencia significativa

IA para desarrollo web

Arena Score, web

  1. 1 Claude Opus 5 1.704,67
  2. 2 Kimi K3 1.675,56
  3. 3 Claude Fable 5 1.630,02

Peticiones sobre maquetación y aplicaciones web, valoradas a ciegas por personas. Se distingue de la selección de programación en la medida: allí se cuentan tareas resueltas, aquí qué resultado prefirió la gente. Para la web eso se acerca más al asunto, porque el aspecto del resultado es parte de lo que se juzga.

de 77 modelos 70 sin diferencia significativa

IA para escribir textos

Arena Score, texto

  1. 1 Claude Opus 5 1.510,88
  2. 2 Claude Fable 5 1.498,96
  3. 3 Gemini 3 Pro 1.481,7

Textos literarios y escritura libre, valorados a ciegas por personas: un trabajo así no tiene respuesta correcta, de modo que la preferencia es la medida más honesta disponible. También hay un segundo criterio, de una pasada de tareas puntuadas; mide otra cosa y da otro orden.

de 236 modelos 99 sin diferencia significativa

Las mejores IA abiertas

Puntuación global

  1. 1 Kimi K3 99,5
  2. 2 MiMo V2.5 Pro 99,36
  3. 3 GLM 5.1 97,55

La misma puntuación global que la clasificación general, pero solo entre modelos de pesos abiertos: los que se pueden descargar y ejecutar en hardware propio. La selección muestra cuánto se rezagan los modelos abiertos respecto a los cerrados, y en qué tareas no se rezagan en absoluto.

de 106 modelos 99 sin diferencia significativa

Fuentes de datos

El catálogo, los precios y las evaluaciones se recogen de fuentes abiertas; el derecho de reproducción se comprueba en la licencia antes de que una cifra llegue al sitio. Bajo cada tabla se indica quién midió lo que muestra y cuándo. Las cifras que no se pueden publicar las usamos solo para contrastar y no las mostramos en el sitio.