OpenAI

o3 2025-04-16

Tipo
modelo de lenguaje
Contexto
200K tokens
Salida máxima
100K
Cadena para la API
azure/o3-2025-04-16

El proveedor ha declarado obsoleto este modelo. Todavía responde, pero es mejor no empezar proyectos nuevos con él.

Precios por proveedor

Proveedor Entrada, $ por 1M Salida, $ por 1M En nuestros datos desde
Microsoft Foundry azure/o3-2025-04-16 $2 $8 31 jul. 2026
OpenAI $2 $8 31 jul. 2026
Microsoft Foundry azure/us/o3-2025-04-16 $2,2 $8,8 31 jul. 2026

Se muestra solo la tarifa base y solo precios por token. Las tarifas por lotes, reducidas o en caché, así como los precios por imagen o por segundo de vídeo, no entran en esta tabla: no se pueden poner en la misma columna que un precio por millón de tokens.

Un mismo proveedor aparece varias veces si vende este modelo con identificadores distintos y a precios distintos, por ejemplo con distinta precisión de pesos. El identificador se indica junto al nombre. Las ofertas idénticas llegadas de dos fuentes con grafías distintas se unen en una sola fila.

La fecha de la última columna es el día en que este precio entró por primera vez en nuestra recogida. El precio puede ser más antiguo: antes de ese día simplemente no lo registrábamos. Desde entonces no ha cambiado; si no, en su lugar habría una fila nueva con una fecha nueva.

Resultados de las mediciones

Conjunto de tareas Resultado Condiciones de ejecución Medido por
Arena Score en francés 1.445,04 1.422–1.468
Arena Score, matemáticas 1.424,48 1.415–1.434
Arena Score en inglés 1.414,47 1.410–1.419
Arena Score, general 1.409,5 1.406–1.413
Arena Score en ruso 1.408,32 1.399–1.418
Arena Score, programación 1.408,19 1.402–1.414
Arena Score, diálogo de varios turnos 1.404,93 1.398–1.412
Arena Score, consultas difíciles 1.401,88 1.397–1.407
Arena Score, preguntas expertas 1.400,18 1.389–1.412
Arena Score en español 1.384,08 1.365–1.403
Arena Score, consultas largas 1.370,54 1.364–1.377
Arena Score, seguimiento de instrucciones 1.367,67 1.362–1.373
Arena Score, escritura creativa 1.359,4 1.352–1.367
Arena Score, comprensión de esquemas 1.218,28 1.206–1.230
Arena Score, reconocimiento de texto en imagen 1.218,19 1.210–1.226
Arena Score, trabajo con imágenes 1.215,41 1.209–1.222
MATH, nivel de dificultad cinco 97,77 % esfuerzo: high · con andamiaje ajustado Epoch evaluations
Fiction.LiveBench — retención de contexto largo 88,9 % esfuerzo: medium Fiction.live leaderboard
Escritura creativa (evaluación de Lech Mazur) 83,9 % esfuerzo: medium lechmazur/writing Github repository
Mock AIME 2024–2025 — problemas de olimpiada 83,87 % esfuerzo: low · con andamiaje ajustado Epoch evaluations
Aider Polyglot — ediciones de código en seis lenguajes 81,3 % esfuerzo: medium · con andamiaje ajustado Aider LLM Leaderboards
GPQA Diamond — preguntas de nivel de posgrado 75,76 % esfuerzo: low · con andamiaje ajustado Epoch evaluations
CadEval — construcción de modelos CAD con código 74 % esfuerzo: medium CadEval Dashboard
GeoBench — localización de un lugar a partir de una foto 74 % esfuerzo: high GeoBench leaderboard
SWE-bench Verified — corrección de errores en repositorios 62,32 % esfuerzo: medium · con andamiaje ajustado Epoch evaluations
ARC-AGI — generalización a patrones nuevos 60,8 % esfuerzo: high · con andamiaje ajustado ARC Prize Leaderboard
SimpleQA Verified — exactitud factual 53 % esfuerzo: high Epoch evaluations
WeirdML — tareas inusuales de aprendizaje automático 52,42 % esfuerzo: high WeirdML Leaderboard
DeepResearch Bench — investigación profunda 46,6 % esfuerzo: medium DeepResearchBench Leaderboard
SimpleBench — preguntas con trampa 43,72 % esfuerzo: high SimpleBench Leaderboard
GDPval — tareas de profesiones reales 30,8 % esfuerzo: medium
Problemas de ajedrez 23,19 % esfuerzo: low Epoch evaluations
OSWorld — trabajo en un sistema operativo, primera versión 23 % esfuerzo: medium · con andamiaje ajustado OS World Website
APEX-Agents 17,2 % esfuerzo: high
Humanity’s Last Exam — preguntas de nivel experto 16,3 % esfuerzo: high
GSO-Bench — optimización de código 8,8 % esfuerzo: high GSO Leaderboard
ARC-AGI-2 6,53 % esfuerzo: high
CritPt — problemas de física 1,4 % esfuerzo: high