AI RACE— Cuộc đua AI
Nghiên cứu

Google DeepMind ra mắt Dream-RSI: Giúp AI tự tiến hóa bằng cách "mơ" lại các lần thử trước

Phương pháp Dream-RSI của Google DeepMind cho phép tác tử AI tự tối ưu hóa chiến lược giải toán và viết code bằng cách tái hiện dữ liệu tìm kiếm cũ, cắt giảm đáng kể tài nguyên tính toán.

18:08 19/09/2026
Nghiên cứu

Cơ chế "mơ" giúp AI tối ưu tìm kiếm mà không tốn tài nguyên

Các nhà nghiên cứu tại Google và Google DeepMind vừa giới thiệu phương pháp mới mang tên "Dream-RSI", cho phép các tác tử AI (AI agent) tự cải thiện khả năng giải quyết các bài toán phức tạp mà không tiêu tốn thêm chi phí tính toán đắt đỏ. Thay vì thay đổi trọng số của mô hình ngôn ngữ nền tảng, kỹ thuật này tập trung nâng cấp cách AI đưa ra quyết định khi tìm kiếm lời giải.

Quá trình tự hoàn thiện đệ quy của AI thường hoạt động theo vòng lặp: đề xuất giải pháp, đánh giá kết quả, rút kinh nghiệm và thử lại. Tuy nhiên, ở các tác vụ phức tạp, không gian tìm kiếm quá lớn khiến AI dễ lãng phí năng lượng vào những nhánh cụt. Các giải pháp hiện nay hoặc dùng chiến lược cố định (dễ lặp lại sai lầm), hoặc vừa tìm kiếm vừa điều chỉnh (đòi hỏi chạy thử nghiệm trực tiếp rất tốn kém).

Dream-RSI giải quyết bài toán này bằng cách ghi lại toàn bộ cây tìm kiếm (search tree) từ các lượt chạy trước. Nhóm nghiên cứu ví quy trình này như việc thám hiểm một vùng đất lạ: sau khi đã lạc đường và lập được bản đồ trong đầu ở lần đi đầu tiên, bạn có thể tự vạch ra lộ trình mới tối ưu hơn mà không cần phải đi lại từng ngã rẽ ngoài đời thực. Trong Dream-RSI, AI agent "mơ" bằng cách phát lại hàng nghìn kịch bản giả định trên dữ liệu lịch sử đã lưu để kiểm tra xem nếu chọn rẽ nhánh khác thì kết quả ra sao. Do không phải gọi lại mô hình hay chạy các bước đánh giá mới, AI có thể thử nghiệm hàng ngàn chiến lược thay thế với chi phí gần như bằng không trước khi áp dụng chiến lược tốt nhất vào lượt chạy thật tiếp theo.

Vượt trội các thư viện chuyên dụng và tiết kiệm hơn 2 lần tài nguyên

Nhóm tác giả đã tiến hành thử nghiệm Dream-RSI trên hai mô hình Gemini 3.1 Pro và Gemini 3.7 Flash thông qua 8 tác vụ thuộc ba lĩnh vực khác nhau, so sánh trực tiếp với chiến lược tìm kiếm cố định cùng điều kiện xuất phát.

Ở bài toán viết chương trình tối ưu cho phép tính thống kê ứng dụng trong bộ gene (genomics) và tài chính, đoạn mã do Dream-RSI tạo ra đạt tốc độ xử lý nhanh hơn cả hai thư viện chuẩn phổ biến hiện nay là sklearnglmnet trên toàn bộ 6 tập dữ liệu kiểm thử. Khi kết hợp với Gemini 3.1 Pro, thời gian thực thi trung bình của thuật toán giảm từ 3.587 mili-giây xuống còn 2.931 mili-giây, trong khi số lượt thử nghiệm cần thiết giảm từ 550 xuống còn 317 lần. Đáng chú ý, hệ thống cạnh tranh SimpleTES cần tới 51.200 lần chạy để giải quyết bài toán, gấp nhiều lần con số 317 của Dream-RSI.

Hiệu quả tương tự cũng được ghi nhận ở các bài toán tối ưu hóa toán học và viết kernel cho vi xử lý đồ họa (GPU). Trên hai tác vụ GPU, Dream-RSI đạt hiệu năng tương đương nhưng giảm số lần sinh mã tới 2,43 lần. Ở hai tác vụ GPU khác, phương pháp này mang lại hiệu năng cao gấp 2,09 lần trong cùng một mức ngân sách tính toán. Phân tích sâu hơn cho thấy chiến lược mà AI học được sẽ tự động giảm số lần thử khi đang tiến triển tốt, và chỉ tăng cường độ tìm kiếm trở lại khi quá trình cải thiện bị chững lại.

Tuy nhiên, nghiên cứu cũng chỉ ra một giới hạn đáng chú ý: việc cô đọng lịch sử thành các chỉ dẫn tường minh (explicit instructions) để ép AI tìm kiếm theo hướng chỉ định lại khiến hiệu năng trên một tác vụ GPU sụt giảm. Theo nhóm nghiên cứu, các chỉ dẫn quá chi tiết có thể vô tình thu hẹp không gian khám phá, ngăn AI thử nghiệm các hướng tiếp cận đột phá. Nhóm tác giả hiện đã công bố mã nguồn dự án trên GitHub để cộng đồng cùng nghiên cứu.

Cuộc đua tự cải thiện đệ quy trong giới AI

Khả năng tự hoàn thiện đệ quy (Recursive Self-Improvement - RSI) đang trở thành tâm điểm của nghiên cứu AI biên giới, cũng là nguyên nhân khiến CEO Dario Amodei của Anthropic liên tục đưa ra những cảnh báo về tốc độ phát triển chóng mặt của công nghệ này.

Trước Dream-RSI, Google DeepMind từng công bố AlphaEvolve vào năm 2025, sử dụng Gemini Flash để đề xuất mã nguồn, Gemini Pro để phân tích và giải thuật tiến hóa để chọn lọc phiên bản tốt nhất. Dream-RSI tiến thêm một bước khi nằm ở tầng giám sát bên trên, trực tiếp tối ưu hóa bản thân chiến lược tìm kiếm thay vì chỉ chọn lọc giải pháp.

Nhiều tổ chức nghiên cứu khác cũng đang tiếp cận bài toán RSI theo các hướng đi riêng. AutoTTS sử dụng tác tử lập trình để tìm thuật toán điều phối luồng suy luận của mô hình ngôn ngữ trong môi trường mô phỏng, vượt qua các phương pháp thiết kế thủ công. Google Research phát triển WikiSkill, ghi lại thành bại vào một trang wiki để làm cẩm nang cho agent. Ở mức độ can thiệp sâu hơn, Meta đang phát triển dự án Hyperagents, cho phép các tác tử AI tự viết lại chính cơ chế kiểm soát tiến trình tự cải thiện của bản thân.

◗ Nguồn

The Decoder19-09

Tin liên quan