azure/o3-2025-04-16El proveedor ha declarado obsoleto este modelo. Todavía responde, pero es mejor no empezar proyectos nuevos con él.
| Proveedor | Entrada, $ por 1M | Salida, $ por 1M | En nuestros datos desde |
|---|---|---|---|
Microsoft Foundry
azure/o3-2025-04-16
|
$2 | $8 | 31 jul. 2026 |
| OpenAI | $2 | $8 | 31 jul. 2026 |
Microsoft Foundry
azure/us/o3-2025-04-16
|
$2,2 | $8,8 | 31 jul. 2026 |
Se muestra solo la tarifa base y solo precios por token. Las tarifas por lotes, reducidas o en caché, así como los precios por imagen o por segundo de vídeo, no entran en esta tabla: no se pueden poner en la misma columna que un precio por millón de tokens.
Un mismo proveedor aparece varias veces si vende este modelo con identificadores distintos y a precios distintos, por ejemplo con distinta precisión de pesos. El identificador se indica junto al nombre. Las ofertas idénticas llegadas de dos fuentes con grafías distintas se unen en una sola fila.
La fecha de la última columna es el día en que este precio entró por primera vez en nuestra recogida. El precio puede ser más antiguo: antes de ese día simplemente no lo registrábamos. Desde entonces no ha cambiado; si no, en su lugar habría una fila nueva con una fecha nueva.
| Conjunto de tareas | Resultado | Condiciones de ejecución | Medido por |
|---|---|---|---|
| Arena Score en francés | 1.445,04 1.422–1.468 | — | — |
| Arena Score, matemáticas | 1.424,48 1.415–1.434 | — | — |
| Arena Score en inglés | 1.414,47 1.410–1.419 | — | — |
| Arena Score, general | 1.409,5 1.406–1.413 | — | — |
| Arena Score en ruso | 1.408,32 1.399–1.418 | — | — |
| Arena Score, programación | 1.408,19 1.402–1.414 | — | — |
| Arena Score, diálogo de varios turnos | 1.404,93 1.398–1.412 | — | — |
| Arena Score, consultas difíciles | 1.401,88 1.397–1.407 | — | — |
| Arena Score, preguntas expertas | 1.400,18 1.389–1.412 | — | — |
| Arena Score en español | 1.384,08 1.365–1.403 | — | — |
| Arena Score, consultas largas | 1.370,54 1.364–1.377 | — | — |
| Arena Score, seguimiento de instrucciones | 1.367,67 1.362–1.373 | — | — |
| Arena Score, escritura creativa | 1.359,4 1.352–1.367 | — | — |
| Arena Score, comprensión de esquemas | 1.218,28 1.206–1.230 | — | — |
| Arena Score, reconocimiento de texto en imagen | 1.218,19 1.210–1.226 | — | — |
| Arena Score, trabajo con imágenes | 1.215,41 1.209–1.222 | — | — |
| MATH, nivel de dificultad cinco | 97,77 % | esfuerzo: high · con andamiaje ajustado | Epoch evaluations |
| Fiction.LiveBench — retención de contexto largo | 88,9 % | esfuerzo: medium | Fiction.live leaderboard |
| Escritura creativa (evaluación de Lech Mazur) | 83,9 % | esfuerzo: medium | lechmazur/writing Github repository |
| Mock AIME 2024–2025 — problemas de olimpiada | 83,87 % | esfuerzo: low · con andamiaje ajustado | Epoch evaluations |
| Aider Polyglot — ediciones de código en seis lenguajes | 81,3 % | esfuerzo: medium · con andamiaje ajustado | Aider LLM Leaderboards |
| GPQA Diamond — preguntas de nivel de posgrado | 75,76 % | esfuerzo: low · con andamiaje ajustado | Epoch evaluations |
| CadEval — construcción de modelos CAD con código | 74 % | esfuerzo: medium | CadEval Dashboard |
| GeoBench — localización de un lugar a partir de una foto | 74 % | esfuerzo: high | GeoBench leaderboard |
| SWE-bench Verified — corrección de errores en repositorios | 62,32 % | esfuerzo: medium · con andamiaje ajustado | Epoch evaluations |
| ARC-AGI — generalización a patrones nuevos | 60,8 % | esfuerzo: high · con andamiaje ajustado | ARC Prize Leaderboard |
| SimpleQA Verified — exactitud factual | 53 % | esfuerzo: high | Epoch evaluations |
| WeirdML — tareas inusuales de aprendizaje automático | 52,42 % | esfuerzo: high | WeirdML Leaderboard |
| DeepResearch Bench — investigación profunda | 46,6 % | esfuerzo: medium | DeepResearchBench Leaderboard |
| SimpleBench — preguntas con trampa | 43,72 % | esfuerzo: high | SimpleBench Leaderboard |
| GDPval — tareas de profesiones reales | 30,8 % | esfuerzo: medium | — |
| Problemas de ajedrez | 23,19 % | esfuerzo: low | Epoch evaluations |
| OSWorld — trabajo en un sistema operativo, primera versión | 23 % | esfuerzo: medium · con andamiaje ajustado | OS World Website |
| APEX-Agents | 17,2 % | esfuerzo: high | — |
| Humanity’s Last Exam — preguntas de nivel experto | 16,3 % | esfuerzo: high | — |
| GSO-Bench — optimización de código | 8,8 % | esfuerzo: high | GSO Leaderboard |
| ARC-AGI-2 | 6,53 % | esfuerzo: high | — |
| CritPt — problemas de física | 1,4 % | esfuerzo: high | — |