AI RACE— La carrera de la IA
Research

OpenAI lanza MentalHealthBench, un benchmark abierto para conversaciones de salud mental impulsadas por IA

OpenAI presentó MentalHealthBench el 23 de septiembre de 2026, un benchmark de acceso público creado junto a más de 80 profesionales certificados de la salud mental para evaluar las respuestas de la IA en escenarios cotidianos, de alta gravedad y de emergencia.

23/09/2026, 17:00
Research

OpenAI introduce un nuevo estándar para el apoyo a la salud mental mediante IA

El 23 de septiembre de 2026, OpenAI anunció el lanzamiento de MentalHealthBench, un benchmark de código abierto diseñado para medir cómo responden los sistemas de IA en conversaciones realistas sobre salud mental. El benchmark fue cocreado junto a una cohorte global de más de 80 psicólogos y psiquiatras certificados provenientes de 22 países, que hablan 19 idiomas y representan cerca de 20 subespecialidades de la salud mental. OpenAI afirmó que la herramienta permitirá a investigadores y desarrolladores evaluar el comportamiento de los modelos en cuanto a seguridad, búsqueda de contexto, preservación de la autonomía del usuario y orientación práctica.

Cómo funciona MentalHealthBench y qué revela

MentalHealthBench evalúa la IA a través de tres niveles de gravedad: conversaciones cotidianas no agudas, situaciones de alta gravedad que indican una angustia significativa y emergencias que requieren apoyo inmediato en el mundo real. Los escenarios abarcan adultos, adolescentes (de 13 a 17 años), cuidadores y profesionales clínicos, y se generan mediante conversaciones sintéticas que preservan la privacidad y reflejan patrones de uso del mundo real, incluyendo a veces detalles de contexto como una pérdida familiar reciente.

Cada diálogo sintético es revisado por al menos tres expertos; los criterios que reciben la aprobación de al menos dos expertos y ninguna objeción de un tercero pasan a formar parte de la rúbrica final. Las rúbricas asignan puntuaciones ponderadas de -10 a +10, premiando conductas beneficiosas (por ejemplo, hacer preguntas aclaratorias u ofrecer reflexiones empáticas) y penalizando las perjudiciales (por ejemplo, especulaciones o consejos inseguros). Un evaluador automatizado, GPT-5.6 Sol, califica las respuestas de los modelos frente a estos criterios elaborados por expertos.

OpenAI evaluó una variedad de modelos contemporáneos, incluida la oferta más reciente de cada proveedor a la fecha de publicación. Los resultados muestran una mejora constante en el manejo de conversaciones sobre salud mental, aunque OpenAI recalca que ChatGPT sigue siendo un complemento —no un reemplazo— de la terapia profesional.

En un estudio de usuarios paralelo, 44 adultos de 16 países y 14 idiomas evaluaron las respuestas de los modelos a conversaciones sintéticas no agudas. Los participantes destacaron la importancia del tono y de contar con pasos prácticos a seguir, mientras que los expertos dieron mayor relevancia a la recopilación de contexto y a la interpretación de señales ambiguas. El estudio no alteró las puntuaciones derivadas de los expertos en el benchmark, pero brindó una perspectiva valiosa sobre las preferencias de los usuarios.

Diversas declaraciones subrayan la intención de la iniciativa:

“La salud mental existe en un continuo, desde el bienestar y el estrés cotidiano hasta la crisis aguda. Los sistemas de IA que interactúan con las personas en ese rango deben fundamentarse tanto en la ciencia clínica como en la experiencia vivida; no solo para reconocer en qué punto del continuo se encuentra alguien, sino para saber cómo responder adecuadamente en cualquier momento”. – Dr. Arthur Evans, CEO de la American Psychological Association
“Como psiquiatra en ejercicio, escucho con frecuencia cómo los pacientes utilizan herramientas como ChatGPT para entender mejor su salud mental y comprometerse más a fondo con su atención. Aportar mi experiencia clínica a este trabajo me permite contribuir más allá del hospital, ayudando a asegurar que esta tecnología empodere a las personas mientras aborda la salud mental con el cuidado y la responsabilidad que merece”. – Dr. Kevin La Moureaux

OpenAI también está ampliando sus salvaguardas en materia de salud mental: enlaces más completos a recursos de crisis, la función Trusted Contact para apoyo en el mundo real y un producto dedicado, ChatGPT for Teens, con protecciones adicionales. La compañía señala que MentalHealthBench se basa en esfuerzos previos fundamentados en el criterio clínico, tales como HealthBench y HealthBench Professional, y estará disponible de manera abierta para que la comunidad pueda examinarlo, mejorarlo y ampliarlo.

Implicaciones para la industria y esfuerzos colaborativos

Al publicar MentalHealthBench, OpenAI se une a un movimiento creciente hacia herramientas de evaluación transparentes y compartidas para la seguridad y el bienestar en la IA. El benchmark complementa otras iniciativas, como subvenciones para nuevas investigaciones en salud mental, colaboraciones con la Partnership on AI y el apoyo a proyectos independientes como el marco de evaluación de salud mental de Transluce. El lanzamiento abierto de OpenAI invita a competidores y grupos académicos a evaluar sus modelos de manera comparativa, elevando potencialmente el estándar general del soporte en salud mental mediado por IA en toda la industria.

◗ Fuentes

OpenAI News23/9

Historias relacionadas