OpenAI

GPT 4.1 2025-04-14

Tipo
modelo de lenguaje
Contexto
1.048K tokens
Salida máxima
33K
Cadena para la API
azure/gpt-4.1-2025-04-14

El proveedor ha declarado obsoleto este modelo. Todavía responde, pero es mejor no empezar proyectos nuevos con él.

Precios por proveedor

Proveedor Entrada, $ por 1M Salida, $ por 1M En nuestros datos desde
Microsoft Foundry azure/gpt-4.1-2025-04-14 $2 $8 31 jul. 2026
OpenAI $2 $8 31 jul. 2026
Microsoft Foundry azure/us/gpt-4.1-2025-04-14 $2,2 $8,8 31 jul. 2026

Se muestra solo la tarifa base y solo precios por token. Las tarifas por lotes, reducidas o en caché, así como los precios por imagen o por segundo de vídeo, no entran en esta tabla: no se pueden poner en la misma columna que un precio por millón de tokens.

Un mismo proveedor aparece varias veces si vende este modelo con identificadores distintos y a precios distintos, por ejemplo con distinta precisión de pesos. El identificador se indica junto al nombre. Las ofertas idénticas llegadas de dos fuentes con grafías distintas se unen en una sola fila.

La fecha de la última columna es el día en que este precio entró por primera vez en nuestra recogida. El precio puede ser más antiguo: antes de ese día simplemente no lo registrábamos. Desde entonces no ha cambiado; si no, en su lugar habría una fila nueva con una fecha nueva.

Resultados de las mediciones

Conjunto de tareas Resultado Condiciones de ejecución Medido por
Arena Score, diálogo de varios turnos 1.396,99 1.390–1.404
Arena Score en inglés 1.390,3 1.386–1.395
Arena Score, programación 1.390,24 1.384–1.397
Arena Score, consultas largas 1.382,97 1.377–1.389
Arena Score, consultas difíciles 1.382,46 1.378–1.387
Arena Score, general 1.382,06 1.378–1.386
Arena Score en francés 1.381,97 1.359–1.405
Arena Score en ruso 1.373,25 1.363–1.384
Arena Score en español 1.368,54 1.349–1.388
Arena Score, matemáticas 1.367,35 1.357–1.378
Arena Score, seguimiento de instrucciones 1.366,42 1.361–1.372
Arena Score, escritura creativa 1.363,66 1.356–1.371
Arena Score, preguntas expertas 1.363,58 1.352–1.375
Arena Score, reconocimiento de texto en imagen 1.217,28 1.209–1.226
Arena Score, comprensión de esquemas 1.214,97 1.202–1.228
Arena Score, trabajo con imágenes 1.209,86 1.203–1.217
MATH, nivel de dificultad cinco 83,01 % · con andamiaje ajustado Epoch evaluations
GeoBench — localización de un lugar a partir de una foto 72 % GeoBench leaderboard
Fiction.LiveBench — retención de contexto largo 63,9 % Fiction.live leaderboard
GPQA Diamond — preguntas de nivel de posgrado 55,89 % · con andamiaje ajustado Epoch evaluations
Aider Polyglot — ediciones de código en seis lenguajes 52,4 % · con andamiaje ajustado Aider LLM Leaderboards
SWE-bench Verified — corrección de errores en repositorios 48,54 % · con andamiaje ajustado Epoch evaluations
CadEval — construcción de modelos CAD con código 42 % CadEval Dashboard
WeirdML — tareas inusuales de aprendizaje automático 39,04 % WeirdML Leaderboard
Mock AIME 2024–2025 — problemas de olimpiada 38,27 % · con andamiaje ajustado Epoch evaluations
DeepResearch Bench — investigación profunda 29,31 %
SimpleBench — preguntas con trampa 12,4 % SimpleBench Leaderboard
ARC-AGI — generalización a patrones nuevos 5,5 % · con andamiaje ajustado ARC Prize Leaderboard
Humanity’s Last Exam — preguntas de nivel experto 0,63 %
ARC-AGI-2 0,42 %