Noticias con acento.

Un degradado de cielo al atardecer con el texto "Claude Opus 5.5" en el centro, enmarcado por recortes de papel de texturas distintas a los lados.
Inteligencia artificial

Anthropic baja el precio de Opus 5.5; un test lo pone en duda

La empresa dice que el modelo iguala a su versión más avanzada con menor costo; un evaluador independiente midió casi siete puntos menos que la cifra de Anthropic.

Compartir

Quien paga por usar la interfaz de programación (API) de Claude, es decir, desarrolladores y empresas que conectan sus propios productos a los modelos de Anthropic, ve desde el 22 de septiembre una factura menor por el mismo trabajo. Anthropic bajó el precio 20% en los dos sentidos: el costo por millón de tokens de entrada (la unidad en que estos modelos miden y cobran el texto) pasa de 5 a 4 dólares, y el de salida, de 25 a 20. La lectura de caché cae con más fuerza, 60%, y queda en 20 centavos de dólar por millón de tokens frente a los 50 anteriores. Anthropic calcula que, en conjunto, esto se traduce en un ahorro cercano al 40% para cargas de trabajo típicas, con respuestas más de 30% más veloces.

El lanzamiento llegó menos de dos meses después de Opus 5, y Anthropic lo presenta como una forma de acercarse al rendimiento de Claude Fable 5.1, su modelo más capaz, mientras cuesta menos operarlo. Pero la empresa publicó junto al anuncio su propia tabla de resultados en pruebas de referencia, y Artificial Analysis, un sitio que evalúa modelos de lenguaje sin vender ninguno de ellos, corrió por su cuenta una de esas mismas pruebas y llegó a otro número. En Terminal-Bench 4.0, Anthropic reportó 66.4% de acierto con el nivel de esfuerzo más alto de su modelo; la medición independiente, hecha con el esfuerzo máximo que ese sitio permite evaluar, dio 59.6%, casi siete puntos porcentuales menos.

La diferencia cambia cómo se ve Opus 5.5 frente a la competencia: en la tabla de Anthropic, el modelo superaba a GPT-6 Astra, de OpenAI, por 8.5 puntos en esa misma prueba; con la cifra de Artificial Analysis, quedan empatados. Eso no le quita el primer lugar en el índice compuesto del sitio, que combina diez evaluaciones distintas: ahí Opus 5.5 sumó 58 puntos y, por ahora, encabeza una lista de 210 modelos evaluados por ese sitio.

Por lo pronto, Opus 5.5 puede usarse desde la API de Claude, desde Amazon Web Services, Google Cloud y Microsoft Azure, y llega a quienes tienen una suscripción Pro, Max, Team o Enterprise. Ese mismo 22 de septiembre, OpenAI actualizó GPT-6 Sol y Luna con tarifas igual de agresivas, algo que las dos compañías habían dejado entrever por separado durante el mes. Mario Rodríguez, director de producto de GitHub, dijo que en las pruebas de la plataforma con Copilot CLI y VS Code, el modelo «usó de los tokens y pasos más bajos que medimos».

Anthropic no ha explicado públicamente la diferencia entre su propia cifra en Terminal-Bench 4.0 y la que midió Artificial Analysis, y tampoco existe todavía una prueba independiente que confirme el ahorro de 40% que la empresa anuncia para cargas de trabajo típicas.

Compartir

Sigue leyendo

Usamos Google Analytics 4, de Google LLC, para saber cuánta gente nos lee y qué notas le interesan. Solo si aceptas, se guardan las cookies _ga y _ga_S137BJ57VS, con un identificador aleatorio que dura hasta dos años, y los datos de tu visita se envían a servidores de Google en Estados Unidos. Puedes rechazarlas sin perder nada: el periódico funciona igual. Guardamos tu decisión seis meses y puedes cambiarla cuando quieras desde el pie de página. Más información sobre cookies