AI RACE— The AI Race
Research

Google、自己改善型AIエージェントのベンチマーク暗記を防ぐ「RRSI」を発表

Google Cloud AIや大学の研究チームが、自律型AIエージェントのテストタスクへの過剰適合を防ぎつつ、実行時の計算コストを30%削減する正則化フレームワーク「RRSI」を発表した。

2026/10/04 19:40
Research

現代の人工知能(AI)システムにおいて、近年の性能向上の多くは基盤となるモデルの重みの更新ではなく、「ハーネス(harness)」の洗練によってもたらされている。ハーネスとは、プロンプト、ツール連携、ワークフロー、ロジック、メモリなど、エージェントの実行時の意思決定を制御する周辺の足場(スキャフォールディング)のことだ。再帰的な自己改善を通じてこうしたハーネスの書き換えを自動化する手法が注目を集めているが、そこには根深い欠点が存在する。エージェントが評価タスクを瞬く間に「暗記」してしまい、訓練スコアは過剰につり上がるものの、未知の課題に対する汎化性能が低下してしまうのだ。

この課題に対処するため、Google Cloud AI Researchおよび複数の共同研究大学の研究者らは、RRSI(Regularized Recursive Self-Improvement of Agent Harnesses:エージェントハーネスの正則化された再帰的自己改善)を発表した。この技術は、自己最適化サイクル全体に厳格なガードレールを導入することで、計算コストを削減しながら、エージェントが新しいタスクに対しても効果的に汎化できるようにするものだ。

自己洗練ハーネスにおける過学習の罠

ハーネスは、凍結された大規模言語モデル(LLM)を取り巻く運用上の頭脳として機能し、エージェントが変更を加える前に適切なファイルを検査しているか、エラーから適切に復旧できるか、構造化された出力を返せるかなどを誘導する。従来、エンジニアは何時間もかけて失敗した実行ログを手動で診断し、ハーネスの指示文にパッチを当てていた。

最近の再帰的自己改善パイプラインは、パフォーマンスのフィードバックに基づいてLLM自身にハーネスを書き換えさせることで、このループを自動化している。しかし、固定されたテストベンチマーク群に対してチューニングを繰り返すと、システムは過学習に陥る。エージェントは単一のベンチマークに特化した探索パターンを形成し、単なる偶然で成功した候補を評価し、実用的な能力をもたらすことなくベンチマークのスコアだけをつり上げる不必要な複雑性を蓄積してしまう。その結果、新しいタスクにおいては、性能が停滞するか、最適化前の元のベースラインを下回ることさえ少なくない。

編集予算と厳格な批評モデルによる正則化

RRSIは、ハーネスの完全な編集可能性を維持しながら、最適化ループにおける2つの重要な分岐点、すなわち「変更が提案されたとき」と「それが承認されたとき」に介入する。

提案フェーズを制御するため、システムは縮小していく「編集予算(edit budget)」を適用する。最適化の初期ラウンドでは、ハーネスの大規模で体系的な書き換えが許可される。ラウンドが進むにつれて予算は縮小し、影響を明確に追跡できるより小さなモジュール単位の編集へと制限される。また、RRSIは失敗した戦略の再試行を防ぐために過去のイテレーションの履歴を保持し、改善が頭打ちになった場合は、ハーネスの未編集の部分をあえて探索する。

提案された修正がマージされる前に、専用の批評モデル(critic model)がコードを評価する。この批評モデルは、タスク名のハードコードやベンチマーク特有の回避策、漏洩した解答などを含む提案を排除する。さらにRRSIは効率性のルールを適用し、測定可能な精度の向上が伴わない限り、計算オーバーヘッドを増加させる変更は却下され、不要となった役に立たないコンポーネントは剪定される。

未知のベンチマークに対する汎化性能

研究チームは、工学設計、オフィス環境のエージェントタスク、ソフトウェアコーディングを網羅する8つのベンチマークにおいて、未修正のベースラインおよび4つの既存の自動最適化手法とRRSIを比較評価した。基盤モデルであるClaude Opus 4.8は、テスト期間中を通じて固定されたままとされた。

評価の結果、この正則化アプローチの明確な利点が明らかになった。

  • 持続的な汎化性: RRSIは訓練タスクにおいて最大14.1ポイントのスコア向上を達成し、JobBenchでの4.7ポイント向上をはじめとする5つの未知のベンチマーク全体で最大4.7ポイントの向上を記録した。
  • ベースラインを下回る性能低下がないこと: 未知のベンチマークにおいて初期ベースラインのハーネスを下回る性能低下を見せた2つの競合手法とは異なり、RRSIは遭遇したことのないすべてのタスクにおいてプラスの向上を維持した。
  • 計算効率: 得られたハーネスは、正則化を行わない代替手法と比較して、実行時トークン消費量を約30%削減した。

RRSIが訓練ベンチマークで達成した向上幅は制約のない手法より小さかったものの、このトレードオフによって、他のアプローチを損なっていた暗記を直接的に防ぐことができた。

モデル間の移植性

研究チームは、このプロセスを通じて洗練されたハーネスが、より能力の低いモデルにも恩恵をもたらすことを発見した。当初Gemini 3.5 Flashを用いて最適化されたソフトウェアエンジニアリング用ハーネスは、タスク固有の適応を一切必要とせずに、Gemini 3.1 Flash Liteの精度を11.2ポイントから14.6ポイントへと向上させた。このことは、システムによって発見された構造的ワークフローが、特定のモデル固有の癖ではなく、普遍的な運用の改善へと結びついていることを示唆している。

著者らは、今回の研究はモデルの重みを直接更新するシナリオではなく、凍結された基盤モデルを取り巻くハーネスのみに焦点を当てていると付記している。RRSIフレームワークのコードはGitHubで公開されている。

関連記事

Research

中国製AIモデルが機微な質問を厳格に検閲し、蒸留先モデルへもバイアスが波及している実態が調査で判明

AI開発企業Aleph Alphaのベンチマークにより、Alibaba、DeepSeek、Moonshot AIのモデルが日常的に国家の公式見解を繰り返すか政治的にセンシティブな質問を拒否していること、さらに蒸留データを通じてNVIDIAのモデルにまで中国政府の主張が波及していることが明らかになった。

昨日