AI RACE— The AI Race
Research

NvidiaのSoL-Piシステム、制御ロジック最適化でAIエージェントのトークン使用量を半減

Nvidiaの研究者は、AIコーディングエージェントの制御ハーネスを書き換える自動システムSoL-Piを開発し、タスク性能を犠牲にせずトークン消費をほぼ半減させた。

2026/09/26 17:30
Hệ thống SoL‑Pi của Nvidia giảm tới nửa lượng token tiêu thụ của các agent lập trình nhờ tối ưu “harness”

自動ハーネス最適化でエージェントのトークンコストを削減

Nvidiaの研究者は、自治的AIコーディングエージェントが使用する制御層(ハーネスと呼ばれる)を自動的に最適化するシステムSoL-Piを発表した。2026年9月26日に掲載された論文によれば、本フレームワークはエージェントのトークン使用量を44.7〜49%削減し、タスク精度はベースラインとほぼ同等に保つことができる。

AIエージェントが監督なしで長大なワークフローを実行すると、単純なモデルクエリが長い推論チェーンやツール呼び出しの繰り返し、実行フィードバックループへと蓄積され、コストが急激に増大する。従来の効率化手法は量子化や高速アテンションカーネル、より小型モデルへの置換といったモデルレベルの最適化に焦点を当てるが、SoL-Piはエージェントが状態を追跡し、ツールを実行し、コンテキストを圧縮する基盤となるハーネス自体を対象とする。再帰的自己改善の原理に基づき、本フレームワークは研究用エージェントを用いてCodex、Claude Code、OpenClawといったツールの実行トレースを観測し、より軽量な制御ロジックを提案、サンドボックス環境で候補変更を自動評価する。

四つの主要メカニズムとベンチマーク性能

軽量な制御コードを探索するため、Nvidiaは535の実行可能環境(495件のGitHub Issue‑Pull‑Requestペアと40件の合成テストケースを含む)で3,000回以上、60,000件以上のエージェント‑環境相互作用を実施した。自動システムが訓練タスクに過適合するのを防ぐため、研究者はEdgeBenchベンチマークを除外し、検索フィードバックと最終評価を厳密に分離した。EdgeBenchの公開タスク51件のうち、11件は一次的な候補検証に使用し、残りの40件はブラインドでの最終テストにのみ用いた。

自動探索の結果、以下の四つの独立した運用メカニズムが抽出された。

  • Action Fusion: コード編集とテスト実行といった連続した二つのステップを単一のアクションに統合し、言語モデルへの呼び出しを一回分削減する。
  • Online Context Compact: 計画ステップ直後に不要な蓄積コンテキストを削除する。
  • ObservationPack: 長大なツール出力をアーカイブし、以降の処理で簡潔な要約に置き換える。
  • Evidence-Preserving Reducer: 大規模なエラーログやテスト出力を低コストの二次モデルに回し、重要な所見を抽出する。自動検証ステップにより、抜け落ちた重要情報を復元できる。

EdgeBenchにおいて、四つすべてのメカニズムを組み合わせたSoL-Piの最も効率的な構成はトークン消費を49%削減し、ベースラインのPiハーネス性能の93.7%を達成した。テスト実行コストは$1,339から$894へと低減された。単一の最強メカニズムのみを採用した性能重視バリアントは、元のPiハーネススコアを5.3%上回りつつトークン使用量も削減した。現在のAPI料金を基に算出すると、ネイティブなCodexおよびClaude Codeハーネスと比較して時間当たり$8.75〜$13.50、標準的なPi設定と比較して$4.36〜$5.71の運用コスト削減が見込める。

研究者は当初、GPT-5.6 Solでシステムを開発し、後にAnthropicのOpus 5へ構造的変更なしで移植した。その結果、ベースラインPi性能の94.3%を維持した。EdgeBench以外でも、SoL-PiはTerminal‑Bench 4のCPUタスク63件中15件を解決し、標準的なCodexおよびPiが解決した18件に対しコストを25%削減した。IMO 2026ベンチマークのLean 4による形式的数学検証タスクでは、6問中3問を最も低コストで解決した。さらに、20体のSoL-Piワーカーによるスウォーム実験では、カーネル最適化でトップ成果を上げつつ、ベースラインPiスウォームに比べコストを26.8%削減した。

エージェントオーバーヘッド増大に伴う業界需要の高まり

SoL-Piの開発は、自治的エージェントワークフローがもたらすコスト膨張に直面するソフトウェアチームの状況と時期を同じくしている。OpenRouterのアナリストPeter Walkerは、エージェント系トークン消費が2026年2月以降で14倍に増加し、そのうち約70%がキャッシュされたプロンプト由来であると指摘した。ハーネスの構造的影響は、ツールベンダーComposioが8月に実施した評価でも明らかになった。DeepSeek V4 FlashをClaude CodeやOh My Piを含む4つのフレームワーク構成で走らせた結果、同一モデルを使用しながらもタスクあたりコストがほぼ3倍に変動した。

しかし、ハーネスの過激な削減は技術的トレードオフを伴う。コンテキストウィンドウを短縮するとプロンプトキャッシュの再利用が阻害され、理論上のトークン削減効果が相殺されるケースがある。さらに、別途行われたコンテキスト圧縮に関する研究では、圧縮されたプロンプトが元のユーザー指示の平均17%しか保持できないことが示された。マルチエージェント設計でもスケーリング限界が指摘されており、Codex開発者Eric Provencherは、2つ以上のサブエージェントを展開すると、出力品質の向上が見込めないままトークンが消費されると警告している。今後に向けて、Nvidiaの研究者は広範なタスクライブラリを横断したハーネスの事前学習を提案し、将来システムにおける再帰的効率向上を実現したいと考えている。

関連記事

Research

中国製AIモデルが機微な質問を厳格に検閲し、蒸留先モデルへもバイアスが波及している実態が調査で判明

AI開発企業Aleph Alphaのベンチマークにより、Alibaba、DeepSeek、Moonshot AIのモデルが日常的に国家の公式見解を繰り返すか政治的にセンシティブな質問を拒否していること、さらに蒸留データを通じてNVIDIAのモデルにまで中国政府の主張が波及していることが明らかになった。

一昨日