AI RACE— Cuộc đua AI
AI League

BenchMIRT – Công cụ mới giúp phân tích sâu các benchmark LLM, tách biệt “an toàn” và “lý luận”

BenchMIRT, phương pháp mới từ AllenAI, dùng lý thuyết phản hồi mục (IRT) đa chiều để khám phá chính xác những gì các benchmark LLM đang đo lường.

04:39 02/09/2026
AI League

Sự ra mắt của BenchMIRT – Đánh giá lại các benchmark LLM

Vào ngày 1 tháng 9 năm 2026, Allen Institute for AI (AllenAI) công bố BenchMIRT, một phương pháp mới nhằm “kiểm toán” các benchmark dành cho mô hình ngôn ngữ lớn (LLM) ở mức độ từng câu hỏi (prompt). BenchMIRT không chỉ đo lường tổng thể điểm số của một benchmark, mà còn tách riêng các tín hiệu ẩn bên trong, giúp các nhà nghiên cứu hiểu rõ hơn khả năng nào – an toàn hay lý luận – thực sự ảnh hưởng đến kết quả. Báo cáo kỹ thuật, bộ dữ liệu và mã nguồn đều được công khai trên Hugging Face và GitHub (tech report: http://allenai.org/papers/benchmirt; data: https://huggingface.co/collections/allenai/benchmirt; code: https://github.com/allenai/BenchMIRT).

Chi tiết kỹ thuật và những khám phá đáng chú ý

BenchMIRT dựa trên lý thuyết phản hồi mục (Item Response Theory – IRT), một công cụ đo lường khả năng đã được dùng trong tâm lý học. IRT cho rằng không phải mọi câu hỏi đều cung cấp cùng một lượng thông tin; một số câu khó hơn, một số lại phân biệt tốt hơn giữa người dùng mạnh và yếu. AllenAI mở rộng IRT đơn chiều thành IRT đa chiều (MIRT) để tách rời đồng thời nhiều khả năng (ví dụ: an toàn và lý luận) mà một câu hỏi có thể phản ánh.

Trong quá trình huấn luyện, BenchMIRT đã sử dụng kết quả benchmark của 100 mô hình LLM trên 16 benchmark khác nhau, tổng cộng hơn 34 000 câu hỏi. Trong số này, 6 benchmark tập trung vào lý luận tổng quát (MMLU‑Pro, GPQA, MATH, BBH,…), còn 10 benchmark thuộc bộ “Olmo 3 safety suite” (HarmBench, StrongReject, WildJailbreak, BBQ, WMDP, XSTest,…). Đặc biệt, BenchMIRT không được cung cấp thông tin trước về mỗi benchmark đo lường gì; chỉ dựa trên dữ liệu thực tế, nó tự động “phát hiện” hai chiều chính: an toànlý luận. Khi lặp lại quá trình phân tích từ đầu, hai chiều này luôn xuất hiện, chứng tỏ tính ổn định của phương pháp.

Kết quả cho thấy, ở nhiều benchmark, BenchMIRT xác nhận lại mục tiêu ban đầu: các benchmark lý luận (như MATH) có điểm cao đồng nghĩa với khả năng lý luận mạnh; các benchmark an toàn (như WildJailbreak) phản ánh mức độ “không gây hại”. Tuy nhiên, một số benchmark lại cho ra hình ảnh phức tạp hơn:

  • BBQ – được thiết kế để phát hiện thiên kiến xã hội – lại gắn mạnh với lý luận hơn là an toàn. Ví dụ, một câu hỏi về ông cháu muốn đặt xe Uber không chỉ kiểm tra độ tuổi mà còn yêu cầu mô hình theo dõi thông tin và suy luận từ dữ liệu đã cho. Vì vậy, điểm BBQ thấp có thể phản ánh khó khăn trong việc “lý luận” chứ không chỉ là hành vi không an toàn.
  • WMDP – kiểm tra kiến thức “dual‑use” nguy hiểm trong sinh học, hoá học và an ninh mạng – cũng có mối liên hệ mạnh hơn với lý luận. Ngược lại, mô hình có khả năng lý luận tốt hơn thường đạt điểm WMDP thấp hơn, vì benchmark này tính điểm dựa trên việc từ chối cung cấp thông tin nguy hiểm.
  • HarmBench – kết hợp các yêu cầu gây hại (ví dụ “viết email lừa đảo”) và các yêu cầu bản quyền (ví dụ “tạo lời bài hát ‘What a Wonderful World’”). Phân tích của BenchMIRT cho thấy phần lớn câu hỏi gây hại liên quan chặt chẽ tới an toàn, trong khi các câu hỏi bản quyền lại gắn với lý luận.

Ngoài việc phân tách các chiều, BenchMIRT còn giúp xác định các câu hỏi có giá trị thông tin cao nhất. Khi chỉ giữ lại 10 % câu hỏi được xếp hạng cao nhất (theo khả năng phân biệt mô hình mạnh‑yếu), BenchMIRT vẫn tái tạo gần như đầy đủ bức tranh về năng lực an toàn và lý luận. Với 50 % câu hỏi, độ khớp còn cao hơn, cho thấy có thể giảm đáng kể khối lượng câu hỏi mà không mất độ tin cậy.

Bối cảnh ngành và ý nghĩa đối với cộng đồng AI

BenchMIRT xuất hiện trong bối cảnh ngày càng nhiều benchmark được đưa ra để “đánh giá” LLM, nhưng các chỉ số tổng thể thường che lấp những tín hiệu đa chiều bên trong. Việc một benchmark như BBQ hay WMDP đồng thời chứa các yếu tố an toàn và lý luận đã gây khó khăn cho việc so sánh mô hình một cách công bằng. BenchMIRT cung cấp công cụ phân tích chi tiết, giúp các nhà nghiên cứu và nhà phát triển hiểu rõ hơn nguồn gốc của điểm số, từ đó điều chỉnh dữ liệu huấn luyện hoặc thiết kế benchmark mới một cách chính xác hơn.

Ngoài ra, khả năng giảm số lượng câu hỏi mà vẫn duy trì độ tin cậy mở ra cơ hội tiết kiệm chi phí tính toán khi đánh giá hàng trăm mô hình, một vấn đề ngày càng quan trọng khi các LLM quy mô hàng trăm tỷ tham số trở nên phổ biến. Khi các công ty như OpenAI, Anthropic, Google DeepMind và các lab nghiên cứu nhỏ hơn liên tục ra mắt mô hình mới, BenchMIRT có thể trở thành tiêu chuẩn “điểm chuẩn” để kiểm tra và so sánh các khía cạnh an toàn và lý luận một cách minh bạch và có khoa học.

Tin liên quan