grok-4-0709| Proveedor | Entrada, $ por 1M | Salida, $ por 1M | En nuestros datos desde |
|---|---|---|---|
| Jiekou.AI | $2,7 | $13,5 | 31 jul. 2026 |
| Abacus.AI | $3 | $15 | 31 jul. 2026 |
| xAI | $3 | $15 | 31 jul. 2026 |
Se muestra solo la tarifa base y solo precios por token. Las tarifas por lotes, reducidas o en caché, así como los precios por imagen o por segundo de vídeo, no entran en esta tabla: no se pueden poner en la misma columna que un precio por millón de tokens.
La fecha de la última columna es el día en que este precio entró por primera vez en nuestra recogida. El precio puede ser más antiguo: antes de ese día simplemente no lo registrábamos. Desde entonces no ha cambiado; si no, en su lugar habría una fila nueva con una fecha nueva.
| Conjunto de tareas | Resultado | Condiciones de ejecución | Medido por |
|---|---|---|---|
| Arena Score en francés | 1.425,25 1.399–1.452 | — | — |
| Arena Score, matemáticas | 1.424,24 1.412–1.437 | — | — |
| Arena Score en inglés | 1.418,4 1.413–1.423 | — | — |
| Arena Score, preguntas expertas | 1.417,67 1.404–1.431 | — | — |
| Arena Score, diálogo de varios turnos | 1.415,59 1.408–1.423 | — | — |
| Arena Score en español | 1.413,5 1.394–1.433 | — | — |
| Arena Score en ruso | 1.412,96 1.401–1.425 | — | — |
| Arena Score, consultas largas | 1.410,19 1.404–1.417 | — | — |
| Arena Score, general | 1.409,91 1.406–1.414 | — | — |
| Arena Score, programación | 1.408,98 1.402–1.416 | — | — |
| Arena Score, consultas difíciles | 1.408,55 1.404–1.414 | — | — |
| Arena Score, escritura creativa | 1.398,43 1.390–1.407 | — | — |
| Arena Score, seguimiento de instrucciones | 1.387,31 1.381–1.393 | — | — |
| Arena Score, trabajo con imágenes | 1.208,77 1.201–1.216 | — | — |
| Arena Score, comprensión de esquemas | 1.203,03 1.190–1.216 | — | — |
| Arena Score, reconocimiento de texto en imagen | 1.194,52 1.186–1.203 | — | — |
| Fiction.LiveBench — retención de contexto largo | 94,4 % | — | Fiction.live leaderboard |
| Mock AIME 2024–2025 — problemas de olimpiada | 83,98 % | · con andamiaje ajustado | Epoch evaluations |
| GPQA Diamond — preguntas de nivel de posgrado | 82,67 % | · con andamiaje ajustado | Epoch evaluations |
| Aider Polyglot — ediciones de código en seis lenguajes | 79,6 % | · con andamiaje ajustado | Aider LLM Leaderboards |
| Escritura creativa (evaluación de Lech Mazur) | 76,9 % | — | lechmazur/writing Github repository |
| ARC-AGI — generalización a patrones nuevos | 66,67 % | · con andamiaje ajustado | — |
| SimpleBench — preguntas con trampa | 52,6 % | — | SimpleBench Leaderboard |
| SimpleQA Verified — exactitud factual | 47,9 % | — | Epoch evaluations |
| DeepResearch Bench — investigación profunda | 47,9 % | — | DeepResearchBench Leaderboard |
| WeirdML — tareas inusuales de aprendizaje automático | 45,73 % | — | WeirdML Leaderboard |
| GeoBench — localización de un lugar a partir de una foto | 45 % | — | GeoBench leaderboard |
| BALROG — entornos de juego | 43,6 % | — | Balrog Leaderboard |
| Cybench — tareas de ciberseguridad | 43 % | · con andamiaje ajustado | Grok 4 Model Card autoinformado |
| Terminal-Bench — trabajo en la línea de comandos | 27,2 % | · con andamiaje ajustado | Terminal-Bench v2 Leaderboard |
| Problemas de ajedrez | 24,24 % | — | Epoch evaluations |
| GDPval — tareas de profesiones reales | 21,1 % | esfuerzo: high | — |
| ARC-AGI-2 | 15,98 % | — | — |
| APEX-Agents | 15,2 % | — | — |