azure/gpt-5.2-2025-12-11| Proveedor | Entrada, $ por 1M | Salida, $ por 1M | En nuestros datos desde |
|---|---|---|---|
| Microsoft Foundry | $1,75 | $14 | 31 jul. 2026 |
| OpenAI | $1,75 | $14 | 31 jul. 2026 |
Se muestra solo la tarifa base y solo precios por token. Las tarifas por lotes, reducidas o en caché, así como los precios por imagen o por segundo de vídeo, no entran en esta tabla: no se pueden poner en la misma columna que un precio por millón de tokens.
La fecha de la última columna es el día en que este precio entró por primera vez en nuestra recogida. El precio puede ser más antiguo: antes de ese día simplemente no lo registrábamos. Desde entonces no ha cambiado; si no, en su lugar habría una fila nueva con una fecha nueva.
| Conjunto de tareas | Resultado | Condiciones de ejecución | Medido por |
|---|---|---|---|
| Mock AIME 2024–2025 — problemas de olimpiada | 96,11 % | esfuerzo: none · con andamiaje ajustado | Epoch evaluations |
| GPQA Diamond — preguntas de nivel de posgrado | 88,53 % | esfuerzo: none · con andamiaje ajustado | Epoch evaluations |
| ARC-AGI — generalización a patrones nuevos | 86,2 % | esfuerzo: xhigh · con andamiaje ajustado | ARC Prize Leaderboard |
| SWE-bench Verified — corrección de errores en repositorios | 73,76 % | esfuerzo: high · con andamiaje ajustado | Epoch evaluations |
| WeirdML — tareas inusuales de aprendizaje automático | 72,2 % | esfuerzo: xhigh | WeirdML Leaderboard |
| FrontierMath, niveles 1–3 | 67,4 % | esfuerzo: xhigh | Epoch evaluations |
| Terminal-Bench — trabajo en la línea de comandos | 64,9 % | esfuerzo: medium · con andamiaje ajustado | Terminal-Bench v2 Leaderboard |
| ARC-AGI-2 | 52,91 % | esfuerzo: xhigh | — |
| GDPval — tareas de profesiones reales | 49,7 % | esfuerzo: none | — |
| Problemas de ajedrez | 46,34 % | esfuerzo: none | Epoch evaluations |
| DeepResearch Bench — investigación profunda | 41,12 % | esfuerzo: low | https://drb.futuresearch.ai/#drb autoinformado |
| SimpleQA Verified — exactitud factual | 38,9 % | esfuerzo: medium | Epoch evaluations |
| SimpleBench — preguntas con trampa | 34,96 % | esfuerzo: high | SimpleBench Leaderboard |
| APEX-Agents | 34,4 % | esfuerzo: xhigh | — |
| FrontierMath, nivel 4 — problemas de investigación | 31,7 % | esfuerzo: xhigh | Epoch evaluations |
| GSO-Bench — optimización de código | 27,4 % | esfuerzo: high | GSO Leaderboard |
| Humanity’s Last Exam — preguntas de nivel experto | 24,16 % | — | — |
| Remote Labor Index — encargos de una plataforma de freelance | 2,5 % | esfuerzo: medium | — |