Anthropic

Claude 4 Sonnet

Tipo
modelo de lenguaje
Contexto
1.000K tokens
Salida máxima
64K
Lanzado el
29 septiembre 2025
Conocimientos hasta
marzo 2025
Cadena para la API
claude-sonnet-4-20250514

Precios por proveedor

Proveedor Entrada, $ por 1M Salida, $ por 1M En nuestros datos desde
Jiekou.AI $2,7 $13,5 31 jul. 2026
NanoGPT $2,992 $14,994 31 jul. 2026
302.AI $3 $15 31 jul. 2026
Abacus.AI $3 $15 31 jul. 2026
Amazon Bedrock $3 $15 2 ago. 2026
Anthropic $3 $15 1 ago. 2026
Merge Gateway $3 $15 31 jul. 2026

Se muestra solo la tarifa base y solo precios por token. Las tarifas por lotes, reducidas o en caché, así como los precios por imagen o por segundo de vídeo, no entran en esta tabla: no se pueden poner en la misma columna que un precio por millón de tokens.

La fecha de la última columna es el día en que este precio entró por primera vez en nuestra recogida. El precio puede ser más antiguo: antes de ese día simplemente no lo registrábamos. Desde entonces no ha cambiado; si no, en su lugar habría una fila nueva con una fecha nueva.

Resultados de las mediciones

Conjunto de tareas Resultado Condiciones de ejecución Medido por
Arena Score, consultas largas 1.379,71 1.372–1.387
Arena Score, programación 1.379,68 1.372–1.387
Arena Score en francés 1.363,66 1.337–1.390
Arena Score, diálogo de varios turnos 1.363,52 1.356–1.371
Arena Score, matemáticas 1.357,74 1.346–1.369
Arena Score, consultas difíciles 1.354,2 1.349–1.360
Arena Score en español 1.350,72 1.329–1.373
Arena Score, seguimiento de instrucciones 1.350,14 1.343–1.357
Arena Score en inglés 1.345,71 1.340–1.351
Arena Score en ruso 1.344,73 1.333–1.356
Arena Score, escritura creativa 1.339,09 1.330–1.348
Arena Score, general 1.337,9 1.334–1.342
Arena Score, preguntas expertas 1.333,62 1.320–1.347
Arena Score, comprensión de esquemas 1.178,16 1.150–1.207
Arena Score, trabajo con imágenes 1.175,73 1.162–1.190
Arena Score, reconocimiento de texto en imagen 1.173,12 1.156–1.191
MATH, nivel de dificultad cinco 84,37 % · con andamiaje ajustado Epoch evaluations
Escritura creativa (evaluación de Lech Mazur) 81,4 % presupuesto de razonamiento: 16K lechmazur/writing Github repository
GPQA Diamond — preguntas de nivel de posgrado 72,25 % presupuesto de razonamiento: 59K · con andamiaje ajustado Epoch evaluations
Mock AIME 2024–2025 — problemas de olimpiada 71,08 % presupuesto de razonamiento: 59K · con andamiaje ajustado Epoch evaluations
Aider Polyglot — ediciones de código en seis lenguajes 61,3 % · con andamiaje ajustado Aider LLM Leaderboards
DeepResearch Bench — investigación profunda 47,8 % presupuesto de razonamiento: 2K DeepResearchBench Leaderboard
Fiction.LiveBench — retención de contexto largo 46,9 % Fiction.live leaderboard
WeirdML — tareas inusuales de aprendizaje automático 46,11 % presupuesto de razonamiento: 16K WeirdML Leaderboard
OSWorld — trabajo en un sistema operativo, primera versión 43,9 % · con andamiaje ajustado OS World Website
ARC-AGI — generalización a patrones nuevos 40 % presupuesto de razonamiento: 16K · con andamiaje ajustado ARC Prize Leaderboard
GeoBench — localización de un lugar a partir de una foto 37 % GeoBench leaderboard
Cybench — tareas de ciberseguridad 35 % · con andamiaje ajustado Cybench leaderboard
SimpleBench — preguntas con trampa 34,6 % presupuesto de razonamiento: 12K SimpleBench Leaderboard
The Agent Company — tareas de trabajo en un entorno de oficina 33,1 % TheAgentCompany leaderboard
APEX-Agents 9,3 %
ARC-AGI-2 5,93 % presupuesto de razonamiento: 16K
GSO-Bench — optimización de código 4,9 % GSO Leaderboard
Humanity’s Last Exam — preguntas de nivel experto 3,11 %
CritPt — problemas de física 0,29 %