Nvidia 的 SoL-Pi 系統透過最佳化控制邏輯將 AI 代理的 Token 用量減半
Nvidia 研究人員開發了 SoL-Pi,一套自動化系統,重新編寫 AI 程式碼代理的控制 harness,將 Token 消耗降低近一半,同時不影響任務表現。

自動化 Harness 最佳化大幅降低代理 Token 成本
Nvidia 研究人員推出了 SoL-Pi,一套自動最佳化自主 AI 程式碼代理所使用之控制層(亦稱 harness)的系統。該框架於 2026 年 9 月 26 日發表的論文中指出,能將代理的 Token 用量削減 44.7% 至 49%,同時保持任務精準度與基線設定大致相同。
當 AI 代理在未受監督的情況下執行長時間工作流程時,成本會因為簡單的模型查詢累積成長長的推理鏈、重複的工具呼叫與執行回饋迴路而急速上升。傳統的效能技術多聚焦於模型層面的最佳化,例如量化、更快的注意力核心或換用較小的模型;而 SoL-Pi 則針對管理代理狀態追蹤、工具執行與上下文壓縮的底層 harness。此框架以遞迴自我改進的原則為基礎,利用研究代理觀察 Codex、Claude Code 與 OpenClaw 等工具的執行軌跡,提出更精簡的控制邏輯,並在沙盒環境中自動評估候選變更。
四大關鍵機制與基準表現
為了尋找更精簡的控制程式碼,Nvidia 執行了超過 3,000 次測試,累計超過 60,000 次代理與環境的互動,涵蓋 535 個可執行環境,其中包括 495 組 GitHub issue‑pull‑request 配對與 40 個合成測試案例。為避免自動化系統對訓練任務過度擬合,研究人員嚴格將搜尋回饋與最終評估分離,保留 EdgeBench 基準作為測試集。EdgeBench 的 51 項公開任務中,有 11 項用於一次性的候選驗證,其餘 40 項則僅供盲測最終測試使用。
自動化搜尋產生了四種不同的運作機制:
- Action Fusion:將兩個連續步驟(例如程式碼編輯與測試執行)合併為單一動作,省去一次完整的語言模型呼叫。
- Online Context Compact:在規劃步驟之後直接裁剪非必要的累積上下文。
- ObservationPack:將冗長的工具輸出存檔,並在後續處理階段以簡潔摘要取代。
- Evidence-Preserving Reducer:將龐大的錯誤日誌與測試輸出導向成本較低的次要模型以抽取關鍵資訊,並搭配自動驗證步驟,若遺漏則恢復關鍵細節。
在 EdgeBench 上,結合四項機制的 SoL-Pi 最佳配置將 Token 用量削減 49%,同時達到基線 Pi harness 93.7% 的效能,測試執行成本從 $1,339 降至 $894。僅選取單一最強機制的效能導向變體則比原始 Pi harness 提升 5.3%,且仍能降低 Token 用量。依照目前的 API 價格,作者估算相較於原生 Codex 與 Claude Code harness,可節省每小時 $8.75 至 $13.50;相較於標準 Pi 設定,則可節省每小時 $4.36 至 $5.71。
研究人員最初以 GPT-5.6 Sol 開發此系統,後續直接移植至 Anthropic 的 Opus 5,未做結構性修改,仍保有基線 Pi 效能的 94.3%。在 EdgeBench 之外,SoL-Pi 在 Terminal‑Bench 4 上解決了 63 個 CPU 任務中的 15 個(相較於標準 Codex 與 Pi 解決的 18 個),成本降低 25%。在 IMO 2026 基準的 Lean 4 正式數學驗證任務中,SoL-Pi 以最低的每題成本解決了 6 題中的 3 題。此外,包含 20 個 SoL-Pi 工作者的群體實驗在核心最佳化上取得最佳成果,成本較基線 Pi 群體下降 26.8%。
隨著代理開銷增加,產業需求激增
SoL-Pi 的開發正值軟體團隊因自主代理工作流程而面臨成本急遽上升的時刻。OpenRouter 分析師 Peter Walker 指出,自 2026 年 2 月以來,代理的 Token 消耗已增加 14 倍,其中近 70% 來自快取的提示詞。工具公司 Composio 在 8 月的評估中突顯了 harness 的結構性影響,該公司在四種框架設定(包括 Claude Code 與 Oh My Pi)下執行 DeepSeek V4 Flash,發現即使使用完全相同的底層模型,解決單一任務的成本仍相差近三倍。
然而,積極的 harness 縮減會帶來技術上的權衡。縮短上下文視窗可能會破壞提示快取的重用,偶爾會抵消理論上的 Token 節省。另有研究指出,壓縮後的提示詞平均僅保留 17% 的原始使用者指令。多代理設計亦面臨擴展瓶頸;Codex 開發者 Eric Provencher 最近警告,部署超過兩個子代理幾乎必然會燃燒 Token,且不會提升輸出品質,因為代理會耗費過多計算資源相互驗證彼此的工作。展望未來,Nvidia 研究人員建議在廣泛的任務庫上預訓練 harness,以在未來系統中建立遞迴式的效能提升。

