AI RACE— The AI Race
Research

OpenAI、AI駆動型メンタルヘルス対話のためのオープンベンチマーク「MentalHealthBench」を発表

OpenAIは2026年9月23日、80名以上の認定メンタルヘルス専門家と共同で作成した、日常的な対話から高度な危機、緊急事態までのAI応答を評価する公開ベンチマーク「MentalHealthBench」を発表した。

2026/09/23 17:00
Research

OpenAI Introduces a New Standard for AI Mental‑Health Support

2026年9月23日、OpenAIはMentalHealthBenchのリリースを発表した。このオープンソースベンチマークは、AIシステムが実際的なメンタルヘルス対話にどのように応答するかを測定することを目的としている。ベンチマークは、22か国にわたる80名以上の認定心理学者・精神科医から構成される国際的な協力体制で共同作成され、19言語に対応し、約20のメンタルヘルス専門分野を網羅している。OpenAIは、本ツールにより研究者や開発者が安全性、文脈取得、ユーザーエージェンシーの保持、実践的な指針といった観点でモデルの挙動を評価できると述べている。

How MentalHealthBench Works and What It Reveals

MentalHealthBenchは、AIを非急性の日常会話、高度な苦痛を示す高急性シナリオ、そして即時の実世界支援が必要な緊急事態という3つの急性度レベルで評価する。シナリオは成人、13〜17歳のティーンエイジャー、介護者、臨床医を対象とし、プライバシーを保護した合成対話を用いて実際の利用パターンを再現して生成される。場合によっては、最近の家族の死別といった背景情報が含まれることもある。

各合成対話は最低3名の専門家によってレビューされ、少なくとも2名の合意が得られ、かつ3名目から矛盾が指摘されなかった基準が最終ルーブリックに組み込まれる。ルーブリックは‑10から+10までの加重スコアを付与し、質問の明確化や共感的な反映といった有益な行動を高く評価し、推測や安全性の欠如した助言など有害な行動を減点する。自動採点器であるGPT‑5.6 Solが、これら専門家が作成した基準に基づきモデルの応答を採点する。

OpenAIは、リリース時点で各ベンダーが提供する最新モデルを含む、複数の現行モデルを評価した。その結果、メンタルヘルス対話の処理能力は着実に向上していることが示されたが、ChatGPTはあくまで専門的な治療の補助であり、代替ではないと強調している。

並行して実施されたユーザー調査では、16か国・14言語を話す44名の成人が非急性の合成対話に対するモデルの応答を評価した。参加者は実践的な次のステップやトーンの重要性を指摘したのに対し、専門家は文脈取得や曖昧なサインの解釈に重きを置いた。本調査はベンチマークの専門家主導のスコアリングを変更するものではないが、ユーザーの嗜好に関する洞察を提供した。

「メンタルヘルスは繁栄から日常的なストレス、急性危機までの連続体として存在する。その全域にわたって人々と関わるAIシステムは、臨床科学と実体験の両方に根ざしていなければならない—単に個人がどの位置にいるかを認識するだけでなく、あらゆる時点で適切に応答できるようにするためだ。」 – アーサー・エヴァンス博士、米国心理学会CEO
「臨床精神科医として、患者がChatGPTのようなツールを使って自分のメンタルヘルスをより深く理解し、ケアに積極的に関わろうとしている話をよく聞く。私の臨床経験をこの取り組みに活かすことで、病院の枠を超えて技術が人々を支援し、メンタルヘルスを相応しい配慮と責任をもって扱うことに貢献できる。」 – ケビン・ラ・ムーロー博士

OpenAIはメンタルヘルス保護策も拡充しており、危機対応リソースへのリンクを増やし、実世界の支援を提供するTrusted Contact機能を導入、さらに追加保護を備えたティーンエイジャー向けChatGPT製品を提供する。同社は、MentalHealthBenchがこれまでの臨床医主導の取り組みであるHealthBenchやHealthBench Professionalを踏み台にしていることを指摘し、コミュニティが検証・改良・拡張できるようオープンに提供するという。

Industry Implications and Collaborative Efforts

MentalHealthBenchを公開することで、OpenAIはAIの安全性とウェルビーイングに関する透明で共有可能な評価ツールへの関心が高まる潮流に加わった。このベンチマークは、新たなメンタルヘルス研究への助成金、Partnership on AIとの協働、Transluceのメンタルヘルス評価フレームワークといった独立プロジェクトへの支援など、他の取り組みを補完するものだ。OpenAIのオープンリリースは競合他社や学術団体に自社モデルのベンチマークを促し、業界全体でAIが媒介するメンタルヘルス支援の基準を引き上げる可能性を秘めている。

関連記事

Research

中国製AIモデルが機微な質問を厳格に検閲し、蒸留先モデルへもバイアスが波及している実態が調査で判明

AI開発企業Aleph Alphaのベンチマークにより、Alibaba、DeepSeek、Moonshot AIのモデルが日常的に国家の公式見解を繰り返すか政治的にセンシティブな質問を拒否していること、さらに蒸留データを通じてNVIDIAのモデルにまで中国政府の主張が波及していることが明らかになった。

一昨日