AI của nhóm đại học đánh bại kỳ thủ Stratego vĩ đại nhất lịch sử với chi phí chưa tới 8.000 USD
Các nhà nghiên cứu từ CMU, NYU, Stanford và MIT phát triển thành công Ataraxos – hệ thống AI đầu tiên đạt đẳng cấp siêu phàm trong cờ Stratego, đánh bại huyền thoại Pim Niemeijer với tỉ lệ thắng 85% dù chi phí huấn luyện chưa bằng 1/500 dự án triệu đô của DeepMind.
AI chinh phục một trong những "thành trì" cờ bàn cuối cùng của con người
Trong bài báo khoa học vừa được công bố trên tạp chí Nature, nhóm nghiên cứu đến từ Đại học Carnegie Mellon (CMU), Đại học New York (NYU), Stanford và MIT đã giới thiệu Ataraxos – hệ thống trí tuệ nhân tạo đầu tiên đạt đẳng cấp vượt trội con người trong bộ môn cờ chiến thuật Stratego. Trong chuỗi 20 ván đấu chính thức, Ataraxos đã đánh bại Pim Niemeijer với thành tích áp đảo: 15 ván thắng, 1 ván thua và 4 ván hòa.
Pim Niemeijer được giới chuyên môn công nhận là kỳ thủ vĩ đại nhất mọi thời đại của Stratego. Ông từng giành 4 chức vô địch thế giới, 15 danh hiệu vô địch quốc gia Hà Lan, 2 chức vô địch thế giới trực tuyến và giữ vị trí số một trên bảng xếp hạng toàn cầu hơn 600 tuần. Khác với cờ vua hay cờ vây vốn là các trò chơi có thông tin hoàn hảo (hai bên nhìn thấy toàn bộ bàn cờ), Stratego là bài toán cực khó với AI vì có yếu tố thông tin ẩn: mỗi bên úp 40 quân cờ khi dàn trận, tạo ra hơn 10^33 cách xếp quân khả dĩ. Cấp bậc quân cờ chỉ lộ diện khi hai bên chạm trán trực tiếp, và mục tiêu tối thượng là bắt được lá cờ của đối phương.
Ngân sách học thuật đánh bại dự án triệu USD nhờ thuật toán tối ưu
Điểm gây kinh ngạc nhất của Ataraxos nằm ở hiệu quả chi phí. Trước đây, Google DeepMind từng nỗ lực giải bài toán Stratego bằng hệ thống DeepNash nhưng không thể vượt qua các kỳ thủ hàng đầu (tại giải vô địch thế giới 2023, DeepNash thua phần lớn cao thủ, bao gồm cả Niemeijer). DeepNash khi đó cần tới 1.024 nút TPU chạy liên tục trong 2 đến 3 tháng, ước tính tiêu tốn khoảng 3 đến 4,5 triệu USD theo thời giá năm 2025. Ngược lại, nhóm nghiên cứu liên trường chỉ mất chưa đầy 8.000 USD tiền điện toán: Ataraxos chỉ cần 1 tuần huấn luyện trên 16 GPU Nvidia H100, cộng thêm 4 ngày trên 4 GPU cho mạng niềm tin (belief network).
Theo tác giả chính Samuel Sokota, hệ thống chỉ dùng lượng tài nguyên tính toán bằng 1/500, số ván tự chơi (self-play) bằng 1/30 và dữ liệu mẫu huấn luyện bằng 1/100 so với DeepNash. Thành quả này đến từ bộ mô phỏng GPU tự viết và hai kỹ thuật cốt lõi:
- Cơ chế điều chuẩn (Regularization) linh hoạt: Ataraxos tự học 100% qua việc tự đấu với chính mình mà không cần dữ liệu từ con người. Trong giai đoạn đầu, hệ thống bị ép phải đa dạng hóa tối đa cách xếp quân và nước đi để tránh bị khóa vào một chiến thuật cố định hay dễ bị bắt bài. Áp lực này được ví như "bình ắc quy năng lượng": nhóm nghiên cứu nới lỏng dần áp lực khi quá trình huấn luyện tiến triển, chuyển từ học bước nhảy lớn sang tinh chỉnh cẩn trọng, giúp thuật toán không rơi vào vòng lặp hỗn loạn.
- Mạng niềm tin (Belief network) dự đoán quân cờ ẩn: Trước mỗi nước đi, mạng này sẽ phán đoán những quân cờ chưa lộ diện của đối thủ, mô phỏng các trạng thái bàn cờ có thể xảy ra và thực hiện một bước học bổ sung ngay trong thời gian thực để đưa ra quyết định tối ưu.
Để đảm bảo tính công bằng, chuỗi 20 ván đấu với Niemeijer được chia đều trong 3 tuần nhằm tránh việc kỳ thủ bị kiệt sức. Niemeijer nhận 1.000 USD thù lao tham gia, cộng thêm 100 USD cho mỗi ván thắng và 50 USD cho mỗi ván hòa. Đáng chú ý, AI còn chịu bất lợi lớn về mặt cấu trúc: trong khi Niemeijer có thể nghiên cứu và thay đổi lối đánh theo thời gian để khắc chế AI, Ataraxos hoàn toàn không tự điều chỉnh theo phong cách của ông. Dù vậy, AI vẫn đạt tỷ lệ thắng tương đương 85% (tính ván hòa bằng nửa ván thắng) – một con số chưa từng có ở đẳng cấp cao nhất. Tại sự kiện biểu diễn thuộc Giải vô địch thế giới Stratego 2025, mô hình này tiếp tục áp đảo khi thắng 38 trên tổng số 40 ván trước các kỳ thủ dự giải.
Lời giải mới cho các bài toán thông tin bất đối xứng trong đời thực
Các đối thủ con người nhận xét lối chơi của Ataraxos cực kỳ khó đoán. Mô hình sẵn sàng tung ra những đòn "bluff" (đòn lừa) mà con người đánh giá là quá mạo hiểm, và khi bị dẫn trước, nó phòng thủ cù cưa tới mức khiến đối thủ ức chế. Các quân cờ của AI dường như luôn xuất hiện chuẩn xác ở những vị trí then chốt như thể gặp may mắn kỳ lạ.
Không dừng lại ở Stratego, nhóm nghiên cứu đã áp dụng phương pháp này sang nhiều trò chơi phức tạp khác và đều thu về kết quả vượt trội:
- Biến thể Barrage Stratego: AI thắng 4 chuỗi trận (mỗi chuỗi 50 ván) trước 3 trong số 4 kỳ thủ xếp hạng cao nhất thế giới (đều từng 2 lần vô địch thế giới biến thể này).
- Trò chơi bài hợp tác Hanabi: Lập kỷ lục điểm số mới ở mọi biến thể, trong đó bản 2 người chơi chỉ cần tài nguyên tính toán bằng 1/100 so với kỷ lục trước đó.
- Đấu địa chủ (Dou dizhu): Đánh bại hai hệ thống chuẩn mực hàng đầu hiện nay là PerfectDou và DouZero.
Kết quả này chứng minh rằng lượng thông tin ẩn khổng lồ không còn là rào cản bất khả thi đối với các thuật toán học tăng cường và tìm kiếm. Nhóm nghiên cứu nhấn mạnh phương pháp của họ có thể mở đường cho việc ứng dụng AI vào các bài toán chiến lược đời thực chứa nhiều thông tin bất đối xứng như dự báo thị trường tài chính, đàm phán thương mại hay mô phỏng xung đột quân sự, miễn là xây dựng được môi trường giả lập đủ nhanh và chuẩn xác. Nhóm nghiên cứu hiện đã mở mã nguồn công khai của Ataraxos.

