Google ra mắt RRSI: Giải pháp chặn AI agent tự cải tiến "học vẹt" benchmark
Các nhà nghiên cứu từ Google Cloud AI cùng các trường đại học vừa giới thiệu RRSI, khung điều chuẩn giúp ngăn AI agent tự hành học vẹt bài kiểm tra, đồng thời cắt giảm tới 30% tài nguyên tính toán khi vận hành.
Trong các hệ thống trí tuệ nhân tạo hiện đại, phần lớn các bước tiến về hiệu năng gần đây không đến từ việc cập nhật trọng số mô hình gốc, mà bắt nguồn từ việc tinh chỉnh "harness" — bộ khung hỗ trợ bao gồm câu lệnh (prompt), tích hợp công cụ, luồng công việc (workflow), logic xử lý và bộ nhớ để định hướng quyết định của agent trong thời gian chạy. Dù việc tự động hóa quá trình viết lại các harness này thông qua cơ chế tự cải tiến đệ quy (recursive self-improvement) đang ngày càng phổ biến, nó lại tạo ra một điểm yếu cố hữu: các agent nhanh chóng "học vẹt" các tác vụ đánh giá, dẫn đến điểm số huấn luyện tăng ảo nhưng khả năng khái quát hóa lại rất kém trên các bài toán thực tế chưa từng gặp.
Để giải quyết thách thức này, các nhà nghiên cứu từ Google Cloud AI Research cùng nhiều trường đại học đối tác đã giới thiệu RRSI (Regularized Recursive Self-Improvement of Agent Harnesses - Tự cải tiến đệ quy có điều chuẩn cho Agent Harness). Kỹ thuật này thiết lập các rào chắn kiểm soát nghiêm ngặt xuyên suốt chu trình tự tối ưu hóa, đảm bảo agent khái quát hóa hiệu quả trên các tác vụ mới, đồng thời hạ thấp chi phí tính toán.
Cái bẫy quá khớp (overfitting) trong các bộ khung tự tinh chỉnh
Harness đóng vai trò như bộ não vận hành bao quanh một mô hình ngôn ngữ lớn (LLM) đã bị đóng băng trọng số. Nó quyết định liệu agent có kiểm tra đúng file trước khi sửa đổi hay không, có khả năng tự phục hồi sau lỗi hay không, và có xuất ra kết quả đúng cấu trúc hay không. Trước đây, các kỹ sư thường phải dành hàng giờ để chẩn đoán thủ công các chuỗi hành động thất bại và vá lại các chỉ dẫn trong harness.
Các quy trình tự cải tiến đệ quy gần đây đã tự động hóa vòng lặp này bằng cách chỉ định một LLM tự viết lại chính harness của mình dựa trên phản hồi về hiệu năng. Tuy nhiên, việc liên tục tinh chỉnh dựa trên một bộ benchmark kiểm thử cố định sẽ khiến hệ thống bị quá khớp. Các agent bắt đầu hình thành những mẫu tìm kiếm chỉ phục vụ cho một bài kiểm tra duy nhất, thiên vị những phương án thành công chỉ nhờ may rủi, và tích lũy những logic phức tạp không cần thiết nhằm đẩy điểm benchmark lên cao mà không mang lại năng lực thực tế. Khi đối mặt với tác vụ mới, hiệu năng thường giậm chân tại chỗ, thậm chí tụt dốc xuống dưới mức ban đầu chưa tối ưu.
Điều chuẩn hóa thông qua "ngân sách chỉnh sửa" và mô hình phản biện khắt khe
RRSI can thiệp vào hai mắt xích then chốt trong vòng lặp tối ưu hóa nhưng vẫn giữ cho harness khả năng chỉnh sửa hoàn toàn: giai đoạn đề xuất thay đổi và giai đoạn chấp thuận thay đổi.
Để kiểm soát giai đoạn đề xuất, hệ thống áp dụng một "ngân sách chỉnh sửa" thu hẹp dần. Ở những vòng tối ưu đầu tiên, hệ thống cho phép viết lại harness trên diện rộng mang tính hệ thống. Càng về các vòng sau, ngân sách càng co lại, giới hạn hệ thống chỉ được thực hiện những chỉnh sửa nhỏ, theo dạng mô-đun để có thể dễ dàng truy vết tác động. RRSI cũng lưu lại lịch sử các lần lặp trước đó nhằm ngăn việc thử lại các chiến lược đã thất bại; nếu đà cải thiện chững lại, nó sẽ chủ động tìm tòi những phân đoạn chưa từng được chỉnh sửa trong harness.
Trước khi bất kỳ đề xuất sửa đổi nào được tích hợp, một mô hình phản biện (critic model) chuyên trách sẽ đánh giá đoạn mã đó. Mô hình này sẽ lọc bỏ những đề xuất có hành vi "hardcode" tên tác vụ, tạo đường vòng để vượt qua benchmark cụ thể hoặc làm rò rỉ lời giải. Ngoài ra, RRSI còn áp dụng một quy tắc về hiệu năng: mọi thay đổi làm tăng chi phí tính toán đều sẽ bị từ chối trừ khi mang lại mức tăng độ chính xác rõ rệt, đồng thời các thành phần dư thừa, không còn hữu ích sẽ bị cắt tỉa.
Khả năng khái quát hóa trên các benchmark chưa từng thấy
Nhóm nghiên cứu đã đánh giá RRSI cùng một mô hình cơ sở chưa qua chỉnh sửa và bốn phương pháp tối ưu hóa tự động hiện có trên 8 bộ benchmark khác nhau, bao gồm các lĩnh vực thiết kế kỹ thuật, môi trường văn phòng tự động và lập trình phần mềm. Mô hình nền tảng Claude Opus 4.8 được giữ nguyên trạng thái đóng băng trọng số trong suốt quá trình thử nghiệm.
Kết quả đánh giá cho thấy những ưu thế vượt trội của phương pháp có điều chuẩn:
- Khái quát hóa bền vững: RRSI ghi nhận mức tăng điểm lên tới 14,1 điểm trên các tác vụ huấn luyện và tăng tới 4,7 điểm trên 5 bộ benchmark chưa từng thấy trước đó, dẫn đầu là mức tăng 4,7 điểm trên JobBench.
- Không bị tụt dưới mức cơ sở: Khác với các phương pháp cạnh tranh — trong đó có hai phương pháp bị tụt hiệu năng xuống dưới cả bộ khung ban đầu khi gặp các benchmark mới — RRSI duy trì mức tăng trưởng dương trên toàn bộ các tác vụ mới.
- Tối ưu chi phí tính toán: Các harness thành phẩm sử dụng ít hơn khoảng 30% lượng token khi vận hành so với các giải pháp không áp dụng điều chuẩn.
Dù mức tăng điểm trên benchmark huấn luyện của RRSI thấp hơn các phương pháp không bị giới hạn, sự đánh đổi này đã trực tiếp ngăn chặn tình trạng "học vẹt" vốn làm tê liệt các phương pháp khác.
Khả năng chuyển giao linh hoạt giữa các mô hình
Các nhà nghiên cứu còn phát hiện ra rằng harness được tinh chỉnh qua quy trình này cũng mang lại lợi ích cho các mô hình có năng lực thấp hơn. Cụ thể, một harness kỹ thuật phần mềm ban đầu được tối ưu hóa bằng Gemini 3.5 Flash đã giúp nâng độ chính xác của Gemini 3.1 Flash Lite từ 11,2 lên 14,6 điểm mà không cần bất kỳ sự tinh chỉnh riêng biệt nào cho tác vụ. Điều này cho thấy các luồng quy trình có cấu trúc mà hệ thống tìm ra có thể chuyển hóa thành những cải tiến vận hành mang tính tổng quát, thay vì chỉ là những mánh khóe riêng biệt cho từng mô hình.
Nhóm tác giả lưu ý rằng nghiên cứu hiện tại chỉ tập trung vào các harness bao quanh các mô hình nền tảng đóng băng trọng số, chưa áp dụng cho các kịch bản cập nhật trọng số trực tiếp. Toàn bộ mã nguồn của khung làm việc RRSI hiện đã được công khai trên GitHub.



