Anthropic

Claude 4.1 Opus

Tipo
modelo de lenguaje
Contexto
200K tokens
Salida máxima
32K
Lanzado el
5 agosto 2025
Conocimientos hasta
marzo 2025
Cadena para la API
claude-opus-4-1-20250805

Precios por proveedor

Proveedor Entrada, $ por 1M Salida, $ por 1M En nuestros datos desde
Jiekou.AI $13,5 $67,5 31 jul. 2026
NanoGPT $14,994 $75,004 31 jul. 2026
302.AI $15 $75 31 jul. 2026
Abacus.AI $15 $75 31 jul. 2026
Amazon Bedrock $15 $75 2 ago. 2026
Anthropic $15 $75 31 jul. 2026
Helicone $15 $75 31 jul. 2026
LLM Gateway $15 $75 31 jul. 2026
Merge Gateway $15 $75 31 jul. 2026

Se muestra solo la tarifa base y solo precios por token. Las tarifas por lotes, reducidas o en caché, así como los precios por imagen o por segundo de vídeo, no entran en esta tabla: no se pueden poner en la misma columna que un precio por millón de tokens.

La fecha de la última columna es el día en que este precio entró por primera vez en nuestra recogida. El precio puede ser más antiguo: antes de ese día simplemente no lo registrábamos. Desde entonces no ha cambiado; si no, en su lugar habría una fila nueva con una fecha nueva.

Resultados de las mediciones

Conjunto de tareas Resultado Condiciones de ejecución Medido por
Arena Score, programación 1.473,09 1.468–1.478
Arena Score, consultas largas 1.445,19 1.440–1.450
Arena Score en español 1.444,59 1.430–1.459
Arena Score, diálogo de varios turnos 1.441,82 1.436–1.448
Arena Score, consultas difíciles 1.441,49 1.438–1.445
Arena Score, seguimiento de instrucciones 1.433,82 1.429–1.439
Arena Score en inglés 1.428,72 1.425–1.433
Arena Score en francés 1.427,47 1.410–1.445
Arena Score, preguntas expertas 1.425,18 1.415–1.435
Arena Score en ruso 1.422,37 1.414–1.430
Arena Score, matemáticas 1.421,84 1.413–1.430
Arena Score, general 1.417,42 1.414–1.420
Arena Score, escritura creativa 1.410,22 1.404–1.416
Arena Score, desarrollo web 1.388,74 1.378–1.400
Escritura creativa (evaluación de Lech Mazur) 84,7 % lechmazur/writing Github repository
SWE-bench Verified — corrección de errores en repositorios 73,35 % · con andamiaje ajustado Epoch evaluations
GPQA Diamond — preguntas de nivel de posgrado 69,7 % presupuesto de razonamiento: 27K · con andamiaje ajustado Epoch evaluations
Mock AIME 2024–2025 — problemas de olimpiada 68,86 % presupuesto de razonamiento: 27K · con andamiaje ajustado Epoch evaluations
SimpleBench — preguntas con trampa 52 % SimpleBench Leaderboard
DeepResearch Bench — investigación profunda 49,7 % DeepResearchBench Leaderboard
GDPval — tareas de profesiones reales 43,6 %
WeirdML — tareas inusuales de aprendizaje automático 42,76 % presupuesto de razonamiento: 16K WeirdML Leaderboard
Cybench — tareas de ciberseguridad 42 % · con andamiaje ajustado Cybench leaderboard
Terminal-Bench — trabajo en la línea de comandos 38 % · con andamiaje ajustado Terminal-Bench v2 Leaderboard
SimpleQA Verified — exactitud factual 34,8 % presupuesto de razonamiento: 27K Epoch evaluations
FrontierMath, niveles 1–3 12,63 % presupuesto de razonamiento: 32K Epoch evaluations
Humanity’s Last Exam — preguntas de nivel experto 7,06 %
FrontierMath, nivel 4 — problemas de investigación 2,44 % presupuesto de razonamiento: 32K Epoch evaluations
Problemas de ajedrez 2,15 % Epoch evaluations