Anthropic

Claude 3.5 Sonnet 2024-10-22

Tipo
modelo de lenguaje
Contexto
200K tokens
Salida máxima
8K
Cadena para la API
vercel_ai_gateway/anthropic/claude-3-5-sonnet-20241022

Precios por proveedor

Proveedor Entrada, $ por 1M Salida, $ por 1M En nuestros datos desde
vercel_ai_gateway $3 $15 1 ago. 2026
Amazon Bedrock $3 $15 2 ago. 2026

Se muestra solo la tarifa base y solo precios por token. Las tarifas por lotes, reducidas o en caché, así como los precios por imagen o por segundo de vídeo, no entran en esta tabla: no se pueden poner en la misma columna que un precio por millón de tokens.

La fecha de la última columna es el día en que este precio entró por primera vez en nuestra recogida. El precio puede ser más antiguo: antes de ese día simplemente no lo registrábamos. Desde entonces no ha cambiado; si no, en su lugar habría una fila nueva con una fecha nueva.

Resultados de las mediciones

Conjunto de tareas Resultado Condiciones de ejecución Medido por
Arena Score, programación 1.342,87 1.337–1.348
Arena Score, diálogo de varios turnos 1.325,58 1.320–1.331
Arena Score, consultas largas 1.311,8 1.306–1.317
Arena Score en inglés 1.307,74 1.304–1.312
Arena Score, matemáticas 1.306,76 1.300–1.313
Arena Score, consultas difíciles 1.305,53 1.301–1.310
Arena Score en ruso 1.304,29 1.297–1.311
Arena Score en francés 1.301,79 1.280–1.323
Arena Score, general 1.297,79 1.295–1.301
Arena Score, seguimiento de instrucciones 1.297,5 1.293–1.302
Arena Score, escritura creativa 1.291,87 1.286–1.298
Arena Score en español 1.283,4 1.264–1.303
Arena Score, preguntas expertas 1.264,39 1.255–1.274
Arena Score, reconocimiento de texto en imagen 1.138,75 1.120–1.158
Arena Score, comprensión de esquemas 1.132,28 1.101–1.164
Arena Score, trabajo con imágenes 1.125,48 1.118–1.133
Escritura creativa (evaluación de Lech Mazur) 80,3 % lechmazur/writing Github repository
GeoBench — localización de un lugar a partir de una foto 62 % GeoBench leaderboard
MATH, nivel de dificultad cinco 56,95 % · con andamiaje ajustado Epoch evaluations
Aider Polyglot — ediciones de código en seis lenguajes 51,6 % · con andamiaje ajustado Aider LLM Leaderboards
CadEval — construcción de modelos CAD con código 48 % CadEval Dashboard
GPQA Diamond — preguntas de nivel de posgrado 40,4 % · con andamiaje ajustado Epoch evaluations
WeirdML — tareas inusuales de aprendizaje automático 39,97 % WeirdML Leaderboard
BALROG — entornos de juego 32,6 % Balrog Leaderboard
SimpleBench — preguntas con trampa 29,68 % SimpleBench Leaderboard
The Agent Company — tareas de trabajo en un entorno de oficina 24 % TheAgentCompany experiment results github
Mock AIME 2024–2025 — problemas de olimpiada 8,38 % · con andamiaje ajustado Epoch evaluations
GSO-Bench — optimización de código 4,6 % GSO Leaderboard
Humanity’s Last Exam — preguntas de nivel experto 0 %