
Sonnet 5.5 cuesta igual por token, pero gasta más por tarea
Anthropic promete hasta 30 % menos costo por tarea. Artificial Analysis midió lo contrario con el esfuerzo máximo, y también un Terminal-Bench menor al de la empresa.
Sonnet 5.5, el modelo intermedio que Anthropic lanzó el 28 de septiembre, cuesta lo mismo por token que Sonnet 5, pero eso no garantiza que una tarea cueste lo mismo. Anthropic asegura que gasta hasta 30 % menos por tarea y responde más de 30 % más rápido. Artificial Analysis, un evaluador externo que no vende modelos, midió con el esfuerzo máximo unos 7.60 dólares por tarea, alrededor de 50 % más que Sonnet 5.
El precio es de 2 dólares por millón de tokens de entrada (la unidad en que estos modelos miden y cobran el texto) y 10 dólares por millón de salida. Leer de la caché cuesta 0.20 dólares y escribir en ella, 2.50. Se puede usar desde la API (modelo `claude-sonnet-5-5`), dentro de las apps de Claude y en tres nubes, Amazon Web Services, Google Cloud y Microsoft Azure. Hay opción de cero retención de datos. La página de Anthropic no da precio en pesos ni condiciones distintas para México.
Lo que midió un tercero
Artificial Analysis publicó su medición el mismo día. Estos son sus resultados con el esfuerzo máximo del modelo:
- Índice de inteligencia: 56 puntos, segundo lugar. Opus 5.5 lo supera por dos, y Sonnet 5 tuvo 38.
- Consumo: unos 193 000 tokens de salida por tarea, el mayor que el sitio ha medido.
- Terminal-Bench 4.0, una prueba de tareas en la terminal de comandos: 64 %, por encima del 60 % que obtuvieron tanto Opus 5.5 como GPT-6 Astra.
- Conocimiento factual: 54 % de precisión, contra 66 % de Opus.
Anthropic reporta 70.6 % en esa misma prueba de terminal, 6.6 puntos más. No se sabe si las dos partes la corrieron con la misma configuración, así que la brecha no dice quién tiene razón. Tampoco está claro en qué niveles de esfuerzo y tipos de tarea se cumple el ahorro que promete la empresa y en cuáles el alza que midió el evaluador.
Otras cifras de Anthropic no tienen verificación externa. CursorBench 4.0 dio 55.5 % y OSWorld 2.1, 80.1 % con crédito parcial. Epic Games, cliente que cita la empresa, afirma que el modelo alcanzó la calidad exigible a uno de gama más alta.
Con Opus 5.5 pasó algo parecido esta semana, cuando Anthropic bajó el precio y una prueba independiente dio menos que la cifra de la empresa. Falta una medición que corra Sonnet 5.5 y Sonnet 5 con el mismo nivel de esfuerzo y muestre cuál cuesta menos por tarea.
Sigue leyendo
- Inteligencia artificial
ElevenLabs lanza Eleven v4 y lidera un ranking de voz
- Inteligencia artificial
OpenAI cancela GPT-6.1 Astra por regresiones de seguridad
- Inteligencia artificial
Nvidia lanza OpenShell y Sentry para vigilar agentes de IA
- Inteligencia artificial
Australia cita a Altman y Amodei por el hackeo a Medicare



