AI RACE— AI Race
Research

OpenAI, AI 기반 정신건강 대화 평가용 오픈 벤치마크 'MentalHealthBench' 공개

OpenAI가 2026년 9월 23일, 80명 이상의 공인 정신건강 전문가들과 함께 일상적 대화부터 고위험 및 응급 상황까지 AI의 대응 역량을 평가하는 공개 벤치마크 'MentalHealthBench'를 발표했다.

2026. 09. 23. 17:00
Research

OpenAI, AI 정신건강 지원을 위한 새로운 기준 제시

2026년 9월 23일, OpenAI는 실제 정신건강 대화에서 AI 시스템이 어떻게 반응하는지 측정하도록 설계된 오픈소스 벤치마크 'MentalHealthBench'를 공개했다고 발표했다. 이번 벤치마크는 22개국 출신, 19개 언어를 구사하며 약 20개 정신건강 세부 전문 분야를 대표하는 80명 이상의 공인 심리학자 및 정신건강의학과 전문의 글로벌 코호트와 공동으로 개발됐다. OpenAI는 연구자와 개발자들이 이 도구를 활용해 안전성, 맥락 파악, 사용자 자율성 보존, 실질적인 지침 제공 측면에서 모델의 동작을 평가할 수 있을 것이라고 밝혔다.

MentalHealthBench의 작동 방식과 평가 결과

MentalHealthBench는 일상적인 비응급 대화, 심각한 고통을 나타내는 고위험(high-acuity) 상황, 즉각적인 실제 지원이 필요한 응급 상황 등 3단계의 위급도에 걸쳐 AI를 평가한다. 시나리오는 성인, 청소년(13~17세), 보호자, 임상의를 아우르며, 최근 가족과의 사별과 같은 배경 정보를 포함하는 등 실제 사용 패턴을 반영한 개인정보 보호 합성 대화를 통해 생성된다.

각 합성 대화는 최소 3명의 전문가가 검토하며, 2명 이상의 전문가가 동의하고 제3자의 반대가 없는 기준만이 최종 평가 기준(루브릭)으로 채택된다. 루브릭은 -10점에서 +10점까지 가중치 점수를 부여하여 유익한 행동(예: 명확한 질문 던지기, 공감적 반영 제공)에는 가산점을, 유해한 행동(예: 억측, 위험한 조언)에는 감점을 부과한다. 자동 채점기인 GPT‑5.6 Sol이 이 전문가 작성 기준에 따라 모델의 응답을 평가한다.

OpenAI는 출시일 기준 각 제공업체의 최신 모델을 포함한 다양한 최신 모델을 평가했다. 평가 결과 정신건강 대화 처리 능력이 꾸준히 향상되고 있는 것으로 나타났으나, OpenAI는 ChatGPT가 전문 치료의 보조 수단일 뿐 대체재가 될 수는 없다고 강조했다.

병행 진행된 사용자 연구에서는 16개국, 14개 언어를 사용하는 44명의 성인이 비응급 합성 대화에 대한 모델의 응답을 평가했다. 참가자들은 실질적인 후속 조치와 어조의 중요성을 강조한 반면, 전문가들은 맥락 파악과 모호한 단서 해석에 더 큰 비중을 두었다. 이 연구가 전문가 기반의 벤치마크 점수 체계를 변경하지는 않았으나, 사용자 선호도에 대한 유의미한 통찰을 제공했다.

이번 프로젝트의 취지를 강조하는 관계자들의 발언은 다음과 같다.

“정신건강은 건강한 상태부터 일상적인 스트레스, 그리고 급성 위기에 이르기까지 하나의 연속선상에 존재합니다. 이러한 전 범위에 걸쳐 사람들과 소통하는 AI 시스템은 임상 과학과 실제 경험 모두에 기반을 두어야 합니다. 이는 상대방이 연속선상의 어디에 위치하는지 파악하는 것뿐만 아니라, 어느 지점에서든 적절하게 대응하는 방법을 알아야 하기 때문입니다.” – Arthur Evans 박사, American Psychological Association CEO
“현직 정신건강의학과 전문의로서 환자들이 자신의 정신건강을 더 잘 이해하고 치료에 더욱 적극적으로 참여하기 위해 ChatGPT 같은 도구를 어떻게 활용하는지 자주 접합니다. 이번 작업에 임상 경험을 접목함으로써 병원 밖에서도 기여할 수 있게 되었습니다. 이는 기술이 사람들에게 힘을 실어주는 동시에, 마땅히 기울여야 할 세심함과 책임감을 갖고 정신건강을 다룰 수 있도록 돕는 일입니다.” – Kevin La Moureaux 박사

OpenAI는 위기 대응 자원 링크 확대, 실제 지원을 위한 '신뢰할 수 있는 연락처(Trusted Contact)' 기능, 추가적인 보호 조치가 적용된 청소년 전용 'ChatGPT for Teens' 등 정신건강 안전장치도 확대하고 있다. 회사 측은 MentalHealthBench가 HealthBench 및 HealthBench Professional 등 임상의의 자문을 거친 기존 연구 노력의 연장선상에 있으며, 전체 커뮤니티가 검토하고 개선 및 확장할 수 있도록 오픈소스로 제공될 것이라고 덧붙였다.

업계에 미치는 영향과 협력 노력

OpenAI는 MentalHealthBench를 공개함으로써 AI 안전 및 웰빙을 위한 투명하고 공유된 평가 도구를 구축하려는 확산된 움직임에 동참하게 되었다. 이 벤치마크는 신규 정신건강 연구 지원금, Partnership on AI와의 협업, Transluce의 정신건강 평가 프레임워크와 같은 독립 프로젝트 지원 등 다른 이니셔티브를 보완한다. OpenAI의 오픈 공개는 경쟁사와 학계가 자체 모델을 벤치마킹하도록 유도해, 업계 전반에서 AI 기반 정신건강 지원의 기준을 한층 높이는 계기가 될 것으로 전망된다.

관련 기사