AI RACE— 每日追蹤 AI 競爭賽局
Research

Google 發表 RRSI 框架,防止具自我改進能力的 AI Agent 死記評測基準

來自 Google Cloud AI 與多所大學的研究團隊推出名為 RRSI 的正則化框架,防止自主 AI Agent 在測試任務上過度專精,同時還能減少 30% 的執行期運算資源消耗。

2026/10/04 19:40
Research

在現代人工智慧系統中,近期的效能提升多半並非源於更新底層模型的權重,而是來自於完善「Harness」(外圍架構)——即由提示詞、工具整合、工作流程、邏輯與記憶所構成的鷹架,這些元素主導了 Agent 在執行階段的各項決策。雖然透過遞迴自我改進(recursive self-improvement)來自動重寫這些架構的做法日益受到重視,但它也帶來了一個棘手的弊病:Agent 會迅速死記評測任務,導致訓練得分虛高,面對未見過的全新問題時泛化能力卻相當低落。

為了解決這項挑戰,Google Cloud AI Research 與多所合作大學的研究人員提出了 RRSI(Regularized Recursive Self-Improvement of Agent Harnesses,代理架構之正則化遞迴自我改進)。這項技術在自我最佳化的循環中導入了嚴格的護欄機制,確保 Agent 能夠有效泛化至新任務,同時降低運算成本。

自我精進架構中的過度擬合陷阱

Harness 就像環繞在凍結大型語言模型周圍的運作大腦,引導 Agent 在修改檔案前是否檢查了正確內容、能否在發生錯誤時平順地恢復,並輸出結構化結果。過去,工程師往往得耗費數小時手動診斷失敗的執行軌跡,並修補 Harness 中的指令。

近期的遞迴自我改進管線則將此流程自動化,透過讓 LLM 根據效能回饋來重寫自身的 Harness。然而,針對一組固定的測試基準反覆微調會導致系統產生過度擬合(Overfitting)。Agent 會發展出專門針對特定基準測試的搜尋模式、獎勵純粹靠運氣成功的候選方案,並累積不必要的複雜度——這雖能拉高測試跑分,卻無法賦予真正的實用能力。面對全新任務時,其效能往往停滯不前,甚至跌破最初未經最佳化的基準線。

透過「編輯預算」與「嚴格評判者」實現正則化

RRSI 在維持 Harness 完全可編輯的同時,於最佳化迴圈中的兩個關鍵節點介入:提出修改建議時,以及採納修改建議時。

為了控制提案階段,該系統實施了逐步縮減的「編輯預算」(edit budget)。在最佳化初期,允許對 Harness 進行較廣泛、系統性的重寫;隨著輪次推進,預算逐漸縮減,限制系統只能進行影響範圍易於追蹤的微小模組化修改。RRSI 還會記錄過往疊代的歷史紀錄,以防止重複嘗試失敗的策略;若改進進入停滯期,它會特意探索 Harness 中尚未被編輯過的部分。

在任何提議的修改合併之前,會有一個專門的評判模型(critic model)評估該程式碼。評判者會過濾掉寫死(hardcode)任務名稱、特定基準測試的應急變通做法(workaround)或外洩解答的提案。此外,RRSI 還執行了一項效率規則:除非能帶來可量測的準確度提升,否則會駁回增加更多運算開銷的修改,並修剪掉過時且無用的組件。

在未見過的基準測試中展現泛化能力

研究團隊在涵蓋工程設計、Agent 辦公環境與軟體編寫等 8 項基準測試中,將 RRSI 與未修改的基準線以及 4 種現有的自動化最佳化方法進行了評估。測試全程中,底層模型 Claude Opus 4.8 均維持凍結狀態。

評估結果顯示出此正則化方法的顯著優勢:

  • 持續的泛化能力: RRSI 在訓練任務上最高提升了 14.1 分,並在 5 個未見過的基準測試中取得高達 4.7 分的成長,其中在 JobBench 上大幅提升了 4.7 分。
  • 絕不退步跌破基準線: 與競爭方法不同(其中兩種方法在未見過的基準測試中甚至退化至初始基準架構以下),RRSI 在所有未曾接觸的任務上均維持了正向提升。
  • 運算效率: 相較於未經正則化的方案,最終產生的 Harness 在執行階段節省了約 30% 的 Token 用量。

儘管 RRSI 在訓練基準測試上的成長幅度小於無限制的方法,但這種取捨直接避免了導致其他方法失效的死記問題。

跨模型移植性

研究人員還發現,透過此流程精進的 Harness 同樣能讓能力較弱的模型受益。最初使用 Gemini 3.5 Flash 最佳化的軟體工程 Harness,在無需任何針對特定任務調校的情況下,就將 Gemini 3.1 Flash Lite 的準確度從 11.2 分提升至 14.6 分。這顯示出該系統所發掘出的結構化工作流程,能轉化為通用型的運作效能提升,而非僅限於特定模型的特例偏好。

作者指出,目前的研究僅著眼於包覆凍結基礎模型的外圍架構,而非涉及直接更新權重的場景。RRSI 框架的程式碼已於 GitHub 上公開釋出。

◗ 參考來源

The Decoder10/04

相關文章