Các mô hình AI vẫn còn yếu trong các bài đố trí tuệ: Bạn có thể vượt qua chúng không?
Các thử nghiệm mới cho thấy AI vẫn chưa giải được hết các câu đố logic và hình ảnh, trong khi con người vẫn giữ lợi thế ở một số lĩnh vực.
Sự kiện chính
Kể từ những ngày đầu của trí tuệ nhân tạo, các trò chơi và câu đố luôn là công cụ đo lường khả năng tiến bộ của máy móc. Gần đây, một loạt các nghiên cứu đã công bố kết quả mới về khả năng giải các câu đố của các mô hình ngôn ngữ lớn (LLM). Đặc biệt, nhóm nhà khoa học từ Đại học Columbia đã chứng minh rằng, dù có sự cải tiến đáng kể, các mô hình AI vẫn chỉ giải đúng khoảng 18 % các câu đố “Connections” của New York Times vào cuối năm 2024, nhưng đã đạt gần mức hoàn hảo vào đầu năm 2025. Những con số này không chỉ phản ánh tốc độ phát triển nhanh chóng của AI, mà còn cho thấy những điểm yếu còn tồn tại, đặc biệt trong các bài toán không gian, trí nhớ và suy luận trừu tượng.
Chi tiết các thí nghiệm và kết quả
- Lịch sử gắn liền với trò chơi: Thuật ngữ “machine learning” lần đầu được Arthur Samuel, nhà khoa học IBM, đưa ra trong một bài báo năm 1959, mô tả thuật toán học chơi cờ tỉ phú. Từ đó, cờ vua và cờ vây đã trở thành những bệ phóng quan trọng cho AI.
- Câu đố “Connections” của NYT: Vào cuối 2024, nhóm nghiên cứu Columbia (tên các nhà khoa học không được công bố) thử nghiệm các mô hình AI hiện đại trên bộ câu đố “Connections” – một dạng đòi hỏi người chơi phải liên kết các từ ngữ theo các chủ đề ẩn. Kết quả cho thấy các mô hình chỉ đạt 18 % độ chính xác. Tuy nhiên, chỉ sau sáu tháng, một số mô hình mới được huấn luyện lại đã có khả năng giải gần như hoàn hảo, chứng tỏ tốc độ học hỏi siêu nhanh của chúng.
- Khó khăn trong suy luận không gian: Các bài toán “mental rotation” – yêu cầu người tham gia xác định xem hai hình ảnh có phải là cùng một vật thể được quay góc khác nhau hay không – vẫn là thách thức lớn đối với LLM. Mặc dù các mô hình hiện nay có thể xử lý đầu vào hình ảnh, chúng vẫn không thể “quay” một vật thể 3D một cách chính xác như kiến trúc sư hay kỹ sư cơ khí.
- Trí nhớ và khả năng thích nghi: Một nghiên cứu hợp tác giữa Google và Đại học Illinois Urbana‑Champaign (2024) đã đưa ra các biến thể nhẹ của câu đố “Knights and Knaves” (khiến một số nhân vật luôn nói thật, một số luôn nói dối). Khi các biến thể này gần giống với dữ liệu mà mô hình đã thấy trong quá trình huấn luyện, chúng thường phản hồi dựa trên ký ức đã lưu, bỏ qua những khác biệt tinh tế, dẫn đến sai lầm.
- SimpleBench và các câu hỏi “đánh lừa”: SimpleBench là tập hợp các câu đố được thiết kế để kiểm tra khả năng suy luận logic. Ví dụ, một câu hỏi yêu cầu tính số lượng viên đá băng được bỏ vào chảo trong ba phút đầu, với trung bình mỗi phút là năm viên. Các mô hình hàng đầu vẫn gặp khó khăn trong việc nhận diện các mối quan hệ ẩn và đưa ra đáp án sai.
- ARC‑AGI – thách thức trừu tượng: Trong benchmark ARC‑AGI, các mô hình phải suy ra quy tắc chung từ một loạt các lưới màu. Khi các lưới được cung cấp dưới dạng hình ảnh, AI thường thất bại; nhưng nếu chuyển thành chuỗi số mô tả màu sắc, hiệu suất được cải thiện đáng kể. Dù vậy, ngay cả khi trả lời đúng, các mô hình thường dựa vào các quy tắc phức tạp, không thể khái quát, trong khi con người dùng những khái niệm trực quan đơn giản.
Các kết quả này cho thấy, dù AI đang “đánh bại” con người trong nhiều trò chơi trí tuệ như cờ vua hay Go, nhưng vẫn còn những “điểm yếu” rõ rệt trong việc xử lý hình ảnh không gian, nhận diện các chi tiết thay đổi nhẹ và suy luận trừu tượng.
Bối cảnh và triển vọng
Những thử nghiệm gần đây khẳng định rằng các câu đố không chỉ là công cụ đo lường tiến bộ công nghệ mà còn là “gương phản chiếu” những giới hạn hiện tại của AI. Khi các mô hình ngôn ngữ lớn ngày càng được mở rộng quy mô và dữ liệu huấn luyện, chúng nhanh chóng cải thiện độ chính xác trên các bài kiểm tra như “Connections”. Tuy nhiên, các nghiên cứu của Columbia, Google‑UIUC và các benchmark như ARC‑AGI cho thấy rằng việc đạt được trí tuệ “đúng nghĩa” – khả năng hiểu và áp dụng các quy tắc một cách linh hoạt – vẫn còn là một thách thức.
Trong bối cảnh cạnh tranh giữa các ông lớn công nghệ (OpenAI, Google DeepMind, Anthropic) và các phòng thí nghiệm nhỏ đang đưa ra các mô hình mới, việc khai thác các dạng câu đố đa dạng sẽ tiếp tục là một tiêu chuẩn quan trọng để đánh giá sự tiến bộ. Đồng thời, chúng cũng mở ra cơ hội cho các nhà nghiên cứu tập trung vào cải thiện khả năng suy luận không gian và trừu tượng, hai lĩnh vực mà con người vẫn giữ ưu thế. Nếu bạn có niềm đam mê giải đố, hãy thử sức mình – có thể bạn sẽ là người đầu tiên “đánh bại” AI trong một vòng đấu.