Noticias con acento.

Editor de código con líneas de JavaScript numeradas del 205 al 215 sobre fondo oscuro y el rótulo "Writing 4,520 tokens" en la parte superior.
Inteligencia artificial

Sonnet 5.5 cuesta igual por token, pero gasta más por tarea

Anthropic promete hasta 30 % menos costo por tarea. Artificial Analysis midió lo contrario con el esfuerzo máximo, y también un Terminal-Bench menor al de la empresa.

Compartir

Sonnet 5.5, el modelo intermedio que Anthropic lanzó el 28 de septiembre, cuesta lo mismo por token que Sonnet 5, pero eso no garantiza que una tarea cueste lo mismo. Anthropic asegura que gasta hasta 30 % menos por tarea y responde más de 30 % más rápido. Artificial Analysis, un evaluador externo que no vende modelos, midió con el esfuerzo máximo unos 7.60 dólares por tarea, alrededor de 50 % más que Sonnet 5.

El precio es de 2 dólares por millón de tokens de entrada (la unidad en que estos modelos miden y cobran el texto) y 10 dólares por millón de salida. Leer de la caché cuesta 0.20 dólares y escribir en ella, 2.50. Se puede usar desde la API (modelo `claude-sonnet-5-5`), dentro de las apps de Claude y en tres nubes, Amazon Web Services, Google Cloud y Microsoft Azure. Hay opción de cero retención de datos. La página de Anthropic no da precio en pesos ni condiciones distintas para México.

Lo que midió un tercero

Artificial Analysis publicó su medición el mismo día. Estos son sus resultados con el esfuerzo máximo del modelo:

  • Índice de inteligencia: 56 puntos, segundo lugar. Opus 5.5 lo supera por dos, y Sonnet 5 tuvo 38.
  • Consumo: unos 193 000 tokens de salida por tarea, el mayor que el sitio ha medido.
  • Terminal-Bench 4.0, una prueba de tareas en la terminal de comandos: 64 %, por encima del 60 % que obtuvieron tanto Opus 5.5 como GPT-6 Astra.
  • Conocimiento factual: 54 % de precisión, contra 66 % de Opus.

Anthropic reporta 70.6 % en esa misma prueba de terminal, 6.6 puntos más. No se sabe si las dos partes la corrieron con la misma configuración, así que la brecha no dice quién tiene razón. Tampoco está claro en qué niveles de esfuerzo y tipos de tarea se cumple el ahorro que promete la empresa y en cuáles el alza que midió el evaluador.

Otras cifras de Anthropic no tienen verificación externa. CursorBench 4.0 dio 55.5 % y OSWorld 2.1, 80.1 % con crédito parcial. Epic Games, cliente que cita la empresa, afirma que el modelo alcanzó la calidad exigible a uno de gama más alta.

Con Opus 5.5 pasó algo parecido esta semana, cuando Anthropic bajó el precio y una prueba independiente dio menos que la cifra de la empresa. Falta una medición que corra Sonnet 5.5 y Sonnet 5 con el mismo nivel de esfuerzo y muestre cuál cuesta menos por tarea.

Compartir

Sigue leyendo

Usamos Google Analytics 4, de Google LLC, para saber cuánta gente nos lee y qué notas le interesan. Solo si aceptas, se guardan las cookies _ga y _ga_S137BJ57VS, con un identificador aleatorio que dura hasta dos años, y los datos de tu visita se envían a servidores de Google en Estados Unidos. Puedes rechazarlas sin perder nada: el periódico funciona igual. Guardamos tu decisión doce meses y puedes cambiarla cuando quieras desde el pie de página. Más información sobre cookies