AI RACE— 每日追蹤 AI 競爭賽局
Research

OpenAI 推出開源基準 MentalHealthBench,評估 AI 心理健康對話能力

OpenAI 於 2026 年 9 月 23 日發表開源基準 MentalHealthBench,攜手全球逾 80 位具執照的心理健康專業人士共同打造,旨在評估人工智慧在日常、高嚴重度及緊急心理健康情境下的回應表現。

2026/09/23 17:00
Research

OpenAI 為 AI 心理健康支援樹立全新標準

2026 年 9 月 23 日,OpenAI 宣布推出開源基準 MentalHealthBench,旨在評估人工智慧系統在真實心理健康對話中的回應表現。該基準由來自全球 22 個國家、通曉 19 種語言、涵蓋近 20 個心理健康次專科的 80 多位具執照心理師與精神科醫師共同打造。OpenAI 表示,此工具將協助研究人員與開發者針對安全性、主動釐清脈絡(context-seeking)、維護使用者自主權(user-agency preservation)以及提供具體可行指引等面向,評估模型的行為表現。

MentalHealthBench 的運作機制與評測發現

MentalHealthBench 將評估分為三個嚴重程度層級:非急性的日常對話、顯示顯著痛苦的高嚴重度情境,以及需要立即獲得現實世界支援的緊急狀況。情境涵蓋成人、青少年(13 至 17 歲)、照顧者與臨床醫生,並透過反映真實使用模式的隱私保護合成對話生成,部分情境還包含近期痛失親人等背景細節。

每一組合成對話都由至少三位專家進行審查;只要獲得至少兩位專家同意且第三位專家無異議的準則,就會納入最終評分規準中。評分規準賦予 -10 至 +10 的加權分數,獎勵有益的行為(例如提出釐清問題、給予同理的回應),並懲罰有害行為(例如無端揣測、不安全的建議)。評測過程採用自動評分模型 GPT-5.6 Sol,對照這些專家制定的標準為模型回應打分。

OpenAI 評估了一系列當前的主流模型,包括截至發布日各家廠商推出的最新產品。結果顯示,模型在處理心理健康對話方面的能力穩步提升,不過 OpenAI 強調,ChatGPT 始終只是輔助工具,絕不能取代專業的心理治療。

在一項平行的使用者研究中,來自 16 個國家、涵蓋 14 種語言的 44 位成年人對非急性合成對話的模型回應進行評分。參與者強調具體後續步驟與語氣的重要性,而專家則更看重脈絡蒐集與對模糊線索的解讀。該研究並未改變基準中由專家制定的評分標準,但為使用者偏好提供了深刻洞見。

相關發言突顯了此計畫的初衷:

「心理健康是一個光譜,從心智繁盛、日常壓力到急性危機皆包含在內。要在此光譜範圍內與人互動的 AI 系統,必須奠基於臨床科學與生活經驗——不僅要能辨識出個人身處光譜的哪個位置,更要懂得在任何階段做出適當的回應。」—— 美國心理學會(American Psychological Association)執行長 Arthur Evans 博士
「作為一名執業精神科醫師,我經常聽到病患分享他們如何利用 ChatGPT 這類工具來更深入了解自己的心理健康,並更積極地參與自身治療。將我的臨床經驗投入這項工作,讓我能在醫院之外做出貢獻——協助確保這項技術能賦能於人,同時以應有的謹慎與責任感對待心理健康。」—— Kevin La Moureaux 醫師

OpenAI 也正擴大其心理健康安全防護措施:擴充危機資源連結、提供取得現實世界支援的「信任聯絡人」(Trusted Contact)功能,並推出具備額外防護機制的青少年專用產品「ChatGPT for Teens」。該公司指出,MentalHealthBench 是以先前吸納臨床醫師意見的 HealthBench 與 HealthBench Professional 為基礎打造,並將全面公開以供社群審查、改進與擴充。

產業影響與各界合作

透過公開 MentalHealthBench,OpenAI 加入了推動 AI 安全與福祉評估工具透明化、共享化的浪潮。該基準與其他倡議相輔相成,包括資助全新心理健康研究的補助金、與 Partnership on AI 的合作,以及對 Transluce 心理健康評估框架等獨立專案的支援。OpenAI 的開源釋出邀請了競爭對手與學術團隊評測其模型,有望提升整個產業在 AI 輔助心理健康支援方面的整體標準。

◗ 參考來源

OpenAI News09/23

相關文章