AI RACE— Cuộc đua AI
AI League

Nhân viên nghiên cứu của Anthropic hé lộ AI tự cải thiện hiệu suất căn chỉnh

Bài báo mới của Anthropic cho thấy hệ thống AI tự động có thể nâng cao độ phù hợp trên 10 tiêu chuẩn mà không làm giảm hiệu năng tổng thể, mở ra khả năng tự cải tiến đệ quy.

02:30 29/08/2026
AI League

Sự kiện chính

Vào ngày 28‑8‑2026, công ty AI Anthropic công bố một bài báo khoa học mang tiêu đề “Automated Researchers Can Reliably Mitigate Alignment Failures”. Bài viết, do Chen Yueh‑Han – một thành viên của chương trình Fellows tại Anthropic – dẫn đầu, trình bày cách một hệ thống AI tự động (gọi là Automated Alignment Researcher – AAR) có thể cải thiện khả năng căn chỉnh (alignment) của mô hình ngôn ngữ trên mười tiêu chuẩn kiểm tra khác nhau, mà không làm suy giảm hiệu suất chung của mô hình. Đây là một trong những bằng chứng đầu tiên cho thấy việc tự động hoá quá trình căn chỉnh sau khi huấn luyện (post‑training) có thể trở nên thực tiễn trong thời gian tới.

Chi tiết kỹ thuật và kết quả

Bài báo mô tả quy trình hoạt động của AAR một cách chi tiết. Mỗi “nhà nghiên cứu” tự động sẽ thực hiện ba bước cơ bản:

  1. Tìm kiếm tài liệu – Hệ thống quét toàn bộ kho tài liệu khoa học và các báo cáo kỹ thuật hiện có, trích xuất các phương pháp đã được công bố liên quan tới việc cải thiện căn chỉnh mô hình.
  2. Đề xuất phương pháp – Dựa trên các nguồn thông tin thu thập được, AAR đề xuất một chiến lược mới (hoặc kết hợp các chiến lược) để giải quyết một hành vi không phù hợp cụ thể.
  3. Huấn luyện ngắn hạn – Mô hình được huấn luyện lại trong vòng 30 phút theo phương pháp vừa đề xuất. Sau đó, hệ thống đánh giá kết quả trên bộ tiêu chuẩn tương ứng và quyết định giữ lại hoặc loại bỏ phương pháp đó.

Quy trình này được lặp lại qua nhiều vòng, mỗi vòng tăng dần độ khó của các tiêu chuẩn. Khi một phương pháp chứng tỏ hiệu quả, nó được lưu giữ và dùng làm nền tảng cho các vòng tiếp theo; ngược lại, các phương pháp kém hiệu quả sẽ bị loại bỏ. Nhờ cách tiếp cận này, AAR đã cải thiện được tất cả mười tiêu chuẩn mà nhóm nghiên cứu đưa ra, đồng thời không gây giảm sút bất kỳ chỉ số hiệu năng nào khác của mô hình.

Bài báo trích dẫn một số câu nói nổi bật:

  • Overall, these results provide early evidence that automated alignment post‑training could become practical in the near term.”
  • The best AAR method beats what experienced humans propose, on average within six hours.”
  • Human guided research directions do not lead to stronger performance.”

Về mặt chi phí, AAR được ước tính tiêu tốn khoảng 4 USD mỗi giờ cho việc gọi API inference, trong khi một nhà nghiên cứu con người thường nhận 150 USD mỗi giờ cho cùng một công việc. Điều này không chỉ làm giảm đáng kể chi phí mà còn tăng tốc độ thử nghiệm: một vòng nghiên cứu hoàn chỉnh chỉ mất khoảng sáu giờ, thời gian mà các chuyên gia con người thường cần vài ngày để hoàn thành.

Tuy nhiên, bài báo cũng thừa nhận một số hạn chế. Đầu tiên, hiệu quả của AAR phụ thuộc vào mức độ phản ánh thực tế của các tiêu chuẩn căn chỉnh; nếu các benchmark không đại diện đúng mục tiêu căn chỉnh, kết quả có thể sai lệch. Thứ hai, việc duy trì và cập nhật liên tục các tiêu chuẩn và kho tài liệu là một công việc không hề nhẹ, đòi hỏi nguồn lực và cơ chế quản lý chặt chẽ.

Bối cảnh và triển vọng

Việc “đào tạo mô hình AI bằng các mô hình AI khác” đang trở thành xu hướng mạnh mẽ trong cộng đồng các phòng thí nghiệm mới (neolabs). Các công ty như OpenAI, Google DeepMind và các startup đang đầu tư vào các phương pháp meta‑learning và tự‑tối ưu hoá để giảm phụ thuộc vào dữ liệu và công sức của con người. Trong bối cảnh này, kết quả của Anthropic là một bước tiến quan trọng hướng tới tự cải tiến đệ quy (recursive self‑improvement) – một khái niệm được nhiều nhà nghiên cứu xem là bước ngoặt tiếp theo trong sự phát triển của trí tuệ nhân tạo.

Nếu các mô hình có thể tự cải thiện quá trình căn chỉnh của chính mình, khả năng mở rộng và tối ưu hoá quy trình nghiên cứu AI sẽ tăng mạnh, thậm chí có thể khiến các nhà nghiên cứu con người trở nên “lạc hậu”. Bài báo của Anthropic không tránh né vấn đề này; thay vào đó, nó so sánh trực tiếp AAR với các nhà nghiên cứu con người và chỉ ra rằng “phương pháp tốt nhất của AAR thắng những gì các nhà nghiên cứu có kinh nghiệm đề xuất, trung bình trong vòng sáu giờ”. Điều này đặt ra một câu hỏi lớn cho ngành: liệu trong tương lai gần, các nhóm nghiên cứu AI sẽ chuyển sang dựa hệt vào các “nhà nghiên cứu tự động” để thực hiện các thí nghiệm và cải tiến mô hình?

Mặc dù còn tồn tại những thách thức về độ tin cậy của benchmark và việc duy trì kho tài liệu, nhưng kết quả thực nghiệm đã cho thấy tiềm năng to lớn. Khi các tiêu chuẩn căn chỉnh ngày càng được chuẩn hoá và mở rộng, khả năng áp dụng AAR trên quy mô lớn sẽ càng thực tiễn, đồng thời giảm đáng kể chi phí và thời gian phát triển. Đây là một tín hiệu mạnh mẽ cho thấy ngành AI đang tiến tới một giai đoạn mới, nơi tự động hoá nghiên cứu có thể trở thành tiêu chuẩn mới, mở ra những cơ hội và thách thức chưa từng có.

◗ Nguồn

TechCrunch29-08

Tin liên quan

AI League

Các nhà mod đưa công nghệ AI DLSS 5 của Nvidia vào mọi tựa game

Sau khi mã DLSS 5 rò rỉ từ bản early‑access của NBA 2K27, cộng đồng modders đã tự tay tích hợp “Neural Rendering” vào Control, Skyrim, GTA V và nhiều tựa game khác, tạo ra hiệu ứng đồ họa mới nhưng cũng gây tranh cãi về hiệu năng và thẩm mỹ.

6 giờ trước