Anthropic

Claude 4 Opus

Tipo
modelo de lenguaje
Contexto
200K tokens
Salida máxima
32K
Lanzado el
14 mayo 2025
Conocimientos hasta
marzo 2025
Cadena para la API
claude-opus-4-20250514

Precios por proveedor

Proveedor Entrada, $ por 1M Salida, $ por 1M En nuestros datos desde
Jiekou.AI $13,5 $67,5 31 jul. 2026
NanoGPT $14,994 $75,004 31 jul. 2026
302.AI $15 $75 31 jul. 2026
Abacus.AI $15 $75 31 jul. 2026
Amazon Bedrock $15 $75 2 ago. 2026
Anthropic $15 $75 1 ago. 2026
Merge Gateway $15 $75 31 jul. 2026

Se muestra solo la tarifa base y solo precios por token. Las tarifas por lotes, reducidas o en caché, así como los precios por imagen o por segundo de vídeo, no entran en esta tabla: no se pueden poner en la misma columna que un precio por millón de tokens.

La fecha de la última columna es el día en que este precio entró por primera vez en nuestra recogida. El precio puede ser más antiguo: antes de ese día simplemente no lo registrábamos. Desde entonces no ha cambiado; si no, en su lugar habría una fila nueva con una fecha nueva.

Resultados de las mediciones

Conjunto de tareas Resultado Condiciones de ejecución Medido por
Arena Score, programación 1.401,8 1.395–1.409
Arena Score, consultas largas 1.401,79 1.395–1.409
Arena Score, diálogo de varios turnos 1.385,96 1.378–1.393
Arena Score en ruso 1.380,6 1.369–1.392
Arena Score en inglés 1.376,69 1.371–1.382
Arena Score, consultas difíciles 1.375,85 1.370–1.381
Arena Score, escritura creativa 1.374,61 1.366–1.383
Arena Score, matemáticas 1.373,35 1.362–1.384
Arena Score, seguimiento de instrucciones 1.372,89 1.366–1.379
Arena Score, preguntas expertas 1.371,29 1.359–1.384
Arena Score, general 1.364,57 1.360–1.369
Arena Score en francés 1.364,46 1.339–1.390
Arena Score en español 1.350,89 1.330–1.372
Arena Score, reconocimiento de texto en imagen 1.179,05 1.163–1.195
Arena Score, trabajo con imágenes 1.175,62 1.163–1.189
Arena Score, comprensión de esquemas 1.175,37 1.150–1.201
MATH, nivel de dificultad cinco 85,05 % · con andamiaje ajustado Epoch evaluations
Escritura creativa (evaluación de Lech Mazur) 83,6 % presupuesto de razonamiento: 16K lechmazur/writing Github repository
Aider Polyglot — ediciones de código en seis lenguajes 72 % · con andamiaje ajustado Aider LLM Leaderboards
SWE-bench Verified — corrección de errores en repositorios 70,66 % · con andamiaje ajustado Epoch evaluations
GPQA Diamond — preguntas de nivel de posgrado 68,35 % presupuesto de razonamiento: 16K · con andamiaje ajustado Epoch evaluations
Mock AIME 2024–2025 — problemas de olimpiada 64,41 % presupuesto de razonamiento: 27K · con andamiaje ajustado Epoch evaluations
Fiction.LiveBench — retención de contexto largo 61,1 % Fiction.live leaderboard
SimpleBench — preguntas con trampa 50,56 % presupuesto de razonamiento: 12K SimpleBench Leaderboard
DeepResearch Bench — investigación profunda 49 % presupuesto de razonamiento: 2K DeepResearchBench Leaderboard
GeoBench — localización de un lugar a partir de una foto 49 % presupuesto de razonamiento: 32K GeoBench leaderboard
WeirdML — tareas inusuales de aprendizaje automático 43,4 % presupuesto de razonamiento: 16K WeirdML Leaderboard
Cybench — tareas de ciberseguridad 38 % · con andamiaje ajustado Cybench leaderboard
ARC-AGI — generalización a patrones nuevos 35,7 % presupuesto de razonamiento: 16K · con andamiaje ajustado ARC Prize Leaderboard
ARC-AGI-2 8,61 % presupuesto de razonamiento: 16K
GSO-Bench — optimización de código 6,9 % GSO Leaderboard
Humanity’s Last Exam — preguntas de nivel experto 6,22 %
CritPt — problemas de física 0,3 %