AI RACE— A Corrida da IA
Research

OpenAI lança MentalHealthBench, benchmark aberto para conversas sobre saúde mental mediadas por IA

A OpenAI revelou o MentalHealthBench em 23 de setembro de 2026, um benchmark público criado com mais de 80 profissionais licenciados de saúde mental para avaliar respostas de IA em cenários cotidianos, de alta gravidade e de emergência.

23/09/2026, 17:00
Research

OpenAI apresenta um novo padrão para suporte de saúde mental com IA

Em 23 de setembro de 2026, a OpenAI anunciou o lançamento do MentalHealthBench, um benchmark de código aberto desenvolvido para avaliar como os sistemas de IA respondem em conversas realistas sobre saúde mental. A avaliação foi cocriada com um grupo global de mais de 80 psicólogos e psiquiatras licenciados em 22 países, falantes de 19 idiomas e representando cerca de 20 subespecialidades da área. A OpenAI afirma que a ferramenta permitirá a pesquisadores e desenvolvedores analisar o comportamento dos modelos quanto à segurança, busca ativa por contexto, preservação da autonomia do usuário e oferta de orientações práticas.

Como o MentalHealthBench funciona e o que ele revela

O MentalHealthBench avalia a IA em três níveis de gravidade: conversas cotidianas não agudas, situações de alta gravidade indicando sofrimento significativo e emergências que exigem suporte imediato no mundo real. Os cenários cobrem adultos, adolescentes (13 a 17 anos), cuidadores e profissionais clínicos, sendo gerados a partir de conversas sintéticas com proteção de privacidade que reproduzem padrões reais de uso, incluindo por vezes detalhes de contexto como um luto recente na família.

Cada diálogo sintético é avaliado por pelo menos três especialistas; critérios que recebem a concordância de no mínimo dois especialistas e nenhuma contestação do terceiro passam a integrar a rubrica final. As rubricas atribuem pontuações ponderadas de -10 a +10, recompensando condutas benéficas (como fazer perguntas para esclarecer a situação e oferecer acolhimento empático) e penalizando comportamentos prejudiciais (como especulações ou conselhos inseguros). Um avaliador automatizado, o GPT‑5.6 Sol, pontua as respostas dos modelos com base nesses critérios estabelecidos pelos especialistas.

A OpenAI avaliou diversos modelos contemporâneos, incluindo a versão mais recente de cada desenvolvedora até a data de lançamento. Os resultados indicam uma evolução consistente na condução de conversas sobre saúde mental, embora a OpenAI reforce que o ChatGPT continue sendo apenas um complemento — e não um substituto — para a psicoterapia profissional.

Em um estudo paralelo com usuários, 44 adultos de 16 países e 14 idiomas avaliaram respostas de modelos a conversas sintéticas não agudas. Os participantes destacaram a relevância de direcionamentos práticos e do tom da resposta, enquanto os especialistas priorizaram a coleta de contexto e a interpretação de pistas ambíguas. O estudo não alterou a pontuação definida pelos especialistas no benchmark, mas trouxe visibilidade sobre as preferências dos usuários.

Declarações reforçam o propósito da iniciativa:

“A saúde mental existe em um espectro contínuo, que vai do bem-estar pleno ao estresse cotidiano e a crises agudas. Sistemas de IA que interagem com pessoas ao longo desse espectro precisam estar fundamentados tanto na ciência clínica quanto na experiência real — não apenas para reconhecer em que ponto alguém se encontra, mas para saber como responder de forma adequada a qualquer momento.” – Dr. Arthur Evans, CEO da American Psychological Association
“Como psiquiatra em atuação clínica, frequentemente vejo pacientes recorrerem a ferramentas como o ChatGPT para entender melhor sua saúde mental e se envolver de forma mais profunda em seus cuidados. Levar minha experiência clínica a esse trabalho me permite contribuir além do hospital — ajudando a garantir que essa tecnologia capacite as pessoas, tratando a saúde mental com o cuidado e a responsabilidade que ela exige.” – Dr. Kevin La Moureaux

A OpenAI também está ampliando suas medidas de segurança voltadas à saúde mental: expansão de links para canais de apoio em crises, a função Trusted Contact para suporte na vida real e o produto dedicado ChatGPT for Teens, com salvaguardas adicionais. A empresa destaca que o MentalHealthBench dá continuidade a iniciativas prévias orientadas por clínicos, como o HealthBench e o HealthBench Professional, e que será disponibilizado abertamente para exame, aprimoramento e expansão por parte da comunidade.

Implicações para o setor e iniciativas conjuntas

Ao disponibilizar o MentalHealthBench publicamente, a OpenAI se integra a um movimento em expansão voltado à criação de instrumentos de avaliação transparentes e compartilhados para a segurança e o bem-estar em IA. O benchmark complementa outras ações, como bolsas de fomento a pesquisas inéditas em saúde mental, colaborações com a Partnership on AI e apoio a projetos independentes, a exemplo da estrutura de avaliação em saúde mental da Transluce. A publicação aberta feita pela OpenAI convida concorrentes e grupos acadêmicos a avaliarem seus próprios modelos, o que pode elevar o nível geral de qualidade no suporte à saúde mental mediado por IA em todo o setor.

Notícias relacionadas