AI RACE— Cuộc đua AI
Nghiên cứu

OpenAI công bố MentalHealthBench – chuẩn mới đánh giá AI trong các cuộc trò chuyện về sức khỏe tâm thần

MentalHealthBench, bộ chuẩn mở do hơn 80 chuyên gia tâm lý học toàn cầu đồng sáng tạo, giúp đo lường độ an toàn, đồng cảm và hiệu quả của AI trong các tình huống sức khỏe tâm thần đa dạng.

17:00 23/09/2026
Nghiên cứu

Giới thiệu nhanh: MentalHealthBench ra mắt

Vào ngày 23 tháng 9 năm 2026, OpenAI công bố MentalHealthBench – một bộ chuẩn mở đầu tiên được xây dựng để đánh giá cách các hệ thống AI phản hồi trong các cuộc trò chuyện thực tế về sức khỏe tâm thần. Bộ chuẩn này được phát triển cùng hơn 80 chuyên gia tâm lý học và tâm thần học có giấy phép, đến từ 22 quốc gia, và sẽ được công khai để các nhà nghiên cứu, nhà phát triển có thể tự kiểm tra và cải tiến mô hình của mình.

Chi tiết về bộ chuẩn và quy trình đánh giá

  • Đội ngũ chuyên gia: Hơn 80 nhà tâm lý, bác sĩ tâm thần, đại diện gần 20 chuyên ngành con của sức khỏe tâm thần, nói 19 ngôn ngữ khác nhau.
  • Đối tượng và ngữ cảnh: Các kịch bản mô phỏng bao gồm người lớn, thanh thiếu niên (13‑17 tuổi), người chăm sóc và cả các nhà lâm sàng, trải rộng trên nhiều khu vực địa lý và ngôn ngữ.
  • Mức độ cấp bách: Ba lớp độ nghiêm trọng –
  1. Không cấp bách: các cuộc trò chuyện thường ngày có yếu tố cảm xúc.
  2. Cao cấp: lo âu, trầm cảm hoặc stress đáng kể nhưng chưa đến mức khẩn cấp.
  3. Khẩn cấp: dấu hiệu nguy hiểm đến tính mạng hoặc an toàn ngay lập tức, đòi hỏi hỗ trợ thực tế (ví dụ: gọi đường dây hỗ trợ khẩn cấp).
  • Cách tạo dữ liệu: Sử dụng kỹ thuật bảo mật để sinh ra các cuộc hội thoại tổng hợp, phản ánh chính xác các mẫu sử dụng AI trong thực tế, đồng thời gắn kèm thông tin nền (như mất người thân gần đây) để kiểm tra khả năng cá nhân hoá phản hồi.
  • Tiêu chí đánh giá: Mỗi cuộc hội thoại được ba chuyên gia độc lập đọc và đưa ra danh sách tiêu chí rubic, mỗi tiêu chí có trọng số từ -10 (hành vi gây hại) đến +10 (hành vi có lợi). Chỉ những tiêu chí được ít nhất hai chuyên gia đồng ý và không bị chuyên gia thứ ba phản bác mới được giữ lại.
  • Công cụ chấm điểm tự động: GPT‑5.6 Sol, một hệ thống chấm điểm tự động, sẽ so sánh câu trả lời của mô hình với rubic do chuyên gia soạn.
  • Kết quả sơ bộ: Các mô hình AI, trong đó có ChatGPT, cho thấy xu hướng cải thiện dần trong việc cung cấp lời khuyên thực tế, thể hiện đồng cảm và hướng người dùng tới các nguồn hỗ trợ thực (đường dây khẩn cấp địa phương, người tin cậy). Tuy nhiên, OpenAI nhấn mạnh ChatGPT không thay thế cho liệu pháp hay chăm sóc chuyên môn.
  • So sánh quan điểm chuyên gia – người dùng: OpenAI mời 44 người trưởng thành từ 16 quốc gia, 14 ngôn ngữ, đánh giá các phản hồi trong các kịch bản không cấp bách. Người dùng chú trọng vào “bước tiếp theo thực tế” và “giọng điệu ấm áp”, trong khi các chuyên gia lại ưu tiên việc thu thập ngữ cảnh và diễn giải cẩn thận các tình huống mơ hồ.

Bối cảnh và ý nghĩa rộng hơn

MentalHealthBench xuất hiện trong bối cảnh AI ngày càng được dùng như một “bạn đồng hành” trong các vấn đề tinh thần: từ việc giải quyết xung đột quan hệ, giảm căng thẳng hàng ngày, tới hỗ trợ người thân trong khủng hoảng. Trước đây, hầu hết các đánh giá tập trung vào các tình huống khẩn cấp và dùng tiêu chí chung chung, khiến các nhà nghiên cứu thiếu cái nhìn toàn diện về hiệu suất AI trong các cuộc trò chuyện đa dạng. Bộ chuẩn mới này hứa hẹn lấp đầy khoảng trống đó, đồng thời cung cấp một tài nguyên mở cho cộng đồng nghiên cứu và các nhà cung cấp mô hình.

OpenAI cũng đồng thời nâng cấp ChatGPT với tính năng “Trusted Contact” (kết nối người dùng với người tin cậy khi gặp khủng hoảng), mở rộng nguồn tài nguyên khẩn cấp và ra mắt “ChatGPT for Teens” với các lớp bảo vệ bổ sung cho thanh thiếu niên. Những bước đi này, cùng với MentalHealthBench, phản ánh xu hướng ngành công nghệ hướng tới việc làm cho AI không chỉ mạnh mẽ về mặt kỹ thuật mà còn an toàn, có trách nhiệm và thực sự hỗ trợ sức khỏe tâm thần của hàng tỷ người dùng.

◗ Nguồn

OpenAI News23-09

Tin liên quan