Noticias con acento.

Una pantalla de teléfono muestra la interfaz de una conversación con un asistente de inteligencia artificial.
Inteligencia artificial

OpenAI mide con psicólogos cómo responden sus chatbots en crisis

MentalHealthBench compara a ChatGPT con Claude y Gemini con criterios de más de 80 especialistas, pero la evaluación la hizo la propia OpenAI, no un tercero.

Compartir

Quien use ChatGPT, o cualquier otro asistente de inteligencia artificial, para hablar de un problema emocional sigue sin una evaluación de un tercero que garantice que la respuesta fue la adecuada. El banco de pruebas que OpenAI presentó este 24 de septiembre para medir justo eso lo calificó la propia empresa, con sus modelos entre los mejor puntuados de la comparación.

El proyecto se llama MentalHealthBench. El conjunto lo arman 1 215 conversaciones sintéticas, calificadas con 5 262 criterios que escribieron ochenta y tantos psicólogos y psiquiatras con licencia, repartidos en 22 países y cerca de 20 subespecialidades clínicas. Cada conversación pasó por tres pares de ojos clínicos: dos expertos anotan por separado qué debería incluir una buena respuesta y un tercero resuelve donde no coinciden. Poco más de la mitad de los casos son consultas sin urgencia; el resto se reparte entre alta gravedad y emergencias reales.

Con su propio banco de pruebas, OpenAI comparó sus modelos contra los de la competencia y publicó estos resultados:

  • **GPT-6 Astra**: 57.3 %
  • **GPT-6 Sol**: 53.9 %
  • **Claude Opus 5.5** (Anthropic): 52.4 %
  • **GPT-6 Luna**: 50.2 %
  • **GPT-4o**: 32.1 %
  • **Gemini 2.5 Pro** (Google): 29.5 %

El propio análisis técnico que revisó la metodología, publicado por el sitio especializado NxCode, señala la grieta del método: el puntaje solo dice si la respuesta tocó los puntos de la rúbrica, no qué le pasó a la persona después de leerla. Ahí mismo se reporta que respuestas breves escritas por clínicos humanos sacaron apenas 38.5 % con la misma rúbrica, muy por debajo de los modelos, y que la coincidencia entre lo que la rúbrica llamó "buena respuesta" y lo que prefirieron los usuarios de las conversaciones simuladas fue de solo 51.5 %.

El lanzamiento llega mientras crece el escrutinio público y regulatorio en Estados Unidos sobre cómo manejan los chatbots las conversaciones sobre crisis emocionales. El detalle que cambia la lectura de la tabla de arriba es quién arma la prueba: OpenAI presenta el proyecto como un estándar clínico abierto, pero sigue siendo ella quien decide qué modelos entran, en qué versión y bajo qué reglas se les mide.

Ningún laboratorio ni universidad ajenos a OpenAI han corrido MentalHealthBench sobre los mismos modelos, y la empresa no ha dicho si actualizará las versiones evaluadas conforme salgan nuevas ediciones de ChatGPT, Claude o Gemini.

Compartir

Sigue leyendo

Usamos Google Analytics 4, de Google LLC, para saber cuánta gente nos lee y qué notas le interesan. Solo si aceptas, se guardan las cookies _ga y _ga_S137BJ57VS, con un identificador aleatorio que dura hasta dos años, y los datos de tu visita se envían a servidores de Google en Estados Unidos. Puedes rechazarlas sin perder nada: el periódico funciona igual. Guardamos tu decisión seis meses y puedes cambiarla cuando quieras desde el pie de página. Más información sobre cookies