xAI

Grok 4

Tipo
modelo de lenguaje
Contexto
256K tokens
Salida máxima
16K
Lanzado el
9 julio 2025
Cadena para la API
grok-4-0709

Precios por proveedor

Proveedor Entrada, $ por 1M Salida, $ por 1M En nuestros datos desde
Jiekou.AI $2,7 $13,5 31 jul. 2026
Abacus.AI $3 $15 31 jul. 2026
xAI $3 $15 31 jul. 2026

Se muestra solo la tarifa base y solo precios por token. Las tarifas por lotes, reducidas o en caché, así como los precios por imagen o por segundo de vídeo, no entran en esta tabla: no se pueden poner en la misma columna que un precio por millón de tokens.

La fecha de la última columna es el día en que este precio entró por primera vez en nuestra recogida. El precio puede ser más antiguo: antes de ese día simplemente no lo registrábamos. Desde entonces no ha cambiado; si no, en su lugar habría una fila nueva con una fecha nueva.

Resultados de las mediciones

Conjunto de tareas Resultado Condiciones de ejecución Medido por
Arena Score en francés 1.425,25 1.399–1.452
Arena Score, matemáticas 1.424,24 1.412–1.437
Arena Score en inglés 1.418,4 1.413–1.423
Arena Score, preguntas expertas 1.417,67 1.404–1.431
Arena Score, diálogo de varios turnos 1.415,59 1.408–1.423
Arena Score en español 1.413,5 1.394–1.433
Arena Score en ruso 1.412,96 1.401–1.425
Arena Score, consultas largas 1.410,19 1.404–1.417
Arena Score, general 1.409,91 1.406–1.414
Arena Score, programación 1.408,98 1.402–1.416
Arena Score, consultas difíciles 1.408,55 1.404–1.414
Arena Score, escritura creativa 1.398,43 1.390–1.407
Arena Score, seguimiento de instrucciones 1.387,31 1.381–1.393
Arena Score, trabajo con imágenes 1.208,77 1.201–1.216
Arena Score, comprensión de esquemas 1.203,03 1.190–1.216
Arena Score, reconocimiento de texto en imagen 1.194,52 1.186–1.203
Fiction.LiveBench — retención de contexto largo 94,4 % Fiction.live leaderboard
Mock AIME 2024–2025 — problemas de olimpiada 83,98 % · con andamiaje ajustado Epoch evaluations
GPQA Diamond — preguntas de nivel de posgrado 82,67 % · con andamiaje ajustado Epoch evaluations
Aider Polyglot — ediciones de código en seis lenguajes 79,6 % · con andamiaje ajustado Aider LLM Leaderboards
Escritura creativa (evaluación de Lech Mazur) 76,9 % lechmazur/writing Github repository
ARC-AGI — generalización a patrones nuevos 66,67 % · con andamiaje ajustado
SimpleBench — preguntas con trampa 52,6 % SimpleBench Leaderboard
SimpleQA Verified — exactitud factual 47,9 % Epoch evaluations
DeepResearch Bench — investigación profunda 47,9 % DeepResearchBench Leaderboard
WeirdML — tareas inusuales de aprendizaje automático 45,73 % WeirdML Leaderboard
GeoBench — localización de un lugar a partir de una foto 45 % GeoBench leaderboard
BALROG — entornos de juego 43,6 % Balrog Leaderboard
Cybench — tareas de ciberseguridad 43 % · con andamiaje ajustado Grok 4 Model Card autoinformado
Terminal-Bench — trabajo en la línea de comandos 27,2 % · con andamiaje ajustado Terminal-Bench v2 Leaderboard
Problemas de ajedrez 24,24 % Epoch evaluations
GDPval — tareas de profesiones reales 21,1 % esfuerzo: high
ARC-AGI-2 15,98 %
APEX-Agents 15,2 %