
OpenAI mide con psicólogos cómo responden sus chatbots en crisis
MentalHealthBench compara a ChatGPT con Claude y Gemini con criterios de más de 80 especialistas, pero la evaluación la hizo la propia OpenAI, no un tercero.
Quien use ChatGPT, o cualquier otro asistente de inteligencia artificial, para hablar de un problema emocional sigue sin una evaluación de un tercero que garantice que la respuesta fue la adecuada. El banco de pruebas que OpenAI presentó este 24 de septiembre para medir justo eso lo calificó la propia empresa, con sus modelos entre los mejor puntuados de la comparación.
El proyecto se llama MentalHealthBench. El conjunto lo arman 1 215 conversaciones sintéticas, calificadas con 5 262 criterios que escribieron ochenta y tantos psicólogos y psiquiatras con licencia, repartidos en 22 países y cerca de 20 subespecialidades clínicas. Cada conversación pasó por tres pares de ojos clínicos: dos expertos anotan por separado qué debería incluir una buena respuesta y un tercero resuelve donde no coinciden. Poco más de la mitad de los casos son consultas sin urgencia; el resto se reparte entre alta gravedad y emergencias reales.
Con su propio banco de pruebas, OpenAI comparó sus modelos contra los de la competencia y publicó estos resultados:
- **GPT-6 Astra**: 57.3 %
- **GPT-6 Sol**: 53.9 %
- **Claude Opus 5.5** (Anthropic): 52.4 %
- **GPT-6 Luna**: 50.2 %
- **GPT-4o**: 32.1 %
- **Gemini 2.5 Pro** (Google): 29.5 %
El propio análisis técnico que revisó la metodología, publicado por el sitio especializado NxCode, señala la grieta del método: el puntaje solo dice si la respuesta tocó los puntos de la rúbrica, no qué le pasó a la persona después de leerla. Ahí mismo se reporta que respuestas breves escritas por clínicos humanos sacaron apenas 38.5 % con la misma rúbrica, muy por debajo de los modelos, y que la coincidencia entre lo que la rúbrica llamó "buena respuesta" y lo que prefirieron los usuarios de las conversaciones simuladas fue de solo 51.5 %.
El lanzamiento llega mientras crece el escrutinio público y regulatorio en Estados Unidos sobre cómo manejan los chatbots las conversaciones sobre crisis emocionales. El detalle que cambia la lectura de la tabla de arriba es quién arma la prueba: OpenAI presenta el proyecto como un estándar clínico abierto, pero sigue siendo ella quien decide qué modelos entran, en qué versión y bajo qué reglas se les mide.
Ningún laboratorio ni universidad ajenos a OpenAI han corrido MentalHealthBench sobre los mismos modelos, y la empresa no ha dicho si actualizará las versiones evaluadas conforme salgan nuevas ediciones de ChatGPT, Claude o Gemini.
Sigue leyendo
- Inteligencia artificial
Altman y Amodei llegan al Consejo de Seguridad de la ONU pidiendo vigilancia externa para sus propias empresas de IA
- Inteligencia artificial
Amazon abre su asistente de vendedores a Claude
- Inteligencia artificial
Gemini ya puede hacer llamadas por ti, pero solo en Pixel 11
- Inteligencia artificial
Claude descubre en solitario un sistema similar a CRISPR



