AI RACE— AI Race
Research

Nvidia의 SoL-Pi 시스템, 제어 로직 최적화로 AI 에이전트 토큰 사용량 절반 감소

Nvidia 연구진이 AI 코딩 에이전트의 제어 하네스를 재작성해 토큰 소비를 거의 절반으로 줄이면서 작업 성능은 유지하는 자동화 시스템 SoL-Pi를 개발했다.

2026. 09. 26. 17:30
Hệ thống SoL‑Pi của Nvidia giảm tới nửa lượng token tiêu thụ của các agent lập trình nhờ tối ưu “harness”

자동화된 하네스 최적화, 에이전트 토큰 비용 절감

Nvidia 연구진은 자율 AI 코딩 에이전트가 사용하는 제어 레이어(하네스)를 자동으로 최적화하는 시스템 SoL-Pi를 소개했다. 2026년 9월 26일 발표된 논문에 따르면, 이 프레임워크는 에이전트 토큰 사용량을 44.7~49% 감소시키면서 작업 정확도는 기존 설정과 거의 동일하게 유지한다.

AI 에이전트가 장기간 워크플로우를 무감독으로 실행하면, 단순 모델 호출이 긴 추론 체인, 반복적인 도구 호출, 실행 피드백 루프로 이어지면서 비용이 급격히 늘어난다. 기존 효율화 기법은 양자화, 빠른 어텐션 커널, 소형 모델 교체 등 모델 수준 최적화에 초점을 맞추지만, SoL-Pi는 에이전트가 상태를 추적하고 도구를 실행하며 컨텍스트를 압축하는 방식을 관리하는 하네스 자체를 목표로 한다. 재귀적 자기 개선 원리를 기반으로, 이 프레임워크는 연구용 에이전트를 활용해 Codex, Claude Code, OpenClaw와 같은 도구의 실행 트레이스를 관찰하고, 보다 간결한 제어 로직을 제안한 뒤 샌드박스 환경에서 후보 변경을 자동 평가한다.

네 가지 핵심 메커니즘 및 벤치마크 성능

보다 간결한 제어 코드를 탐색하기 위해 Nvidia는 3,000회 이상의 실행(총 60,000여 개의 에이전트‑환경 상호작용)과 535개의 실행 가능한 환경을 활용했다. 여기에는 495개의 GitHub 이슈‑풀 리퀘스트 쌍과 40개의 합성 테스트 케이스가 포함된다. 자동화 시스템이 학습 과제에 과적합되는 것을 방지하기 위해, 연구진은 EdgeBench 벤치마크를 최종 평가와 완전히 분리했다. EdgeBench의 51개 공개 과제 중 11개는 후보 검증용으로 일회성 사용했으며, 나머지 40개는 블라인드 최종 테스트에만 사용했다.

자동 탐색을 통해 네 가지 독립적인 운영 메커니즘이 도출되었다:

  • Action Fusion(액션 융합): 코드 편집과 테스트 실행처럼 연속적인 두 단계를 하나의 액션으로 합쳐 전체 언어 모델 호출을 제거한다.
  • Online Context Compact(온라인 컨텍스트 압축): 계획 단계 직후에 불필요한 누적 컨텍스트를 바로 정리한다.
  • ObservationPack(관찰 패키지): 길고 복잡한 도구 출력을 보관하고, 이후 처리 단계에서는 간결한 요약본으로 대체한다.
  • Evidence-Preserving Reducer(증거 보존 축소기): 대용량 오류 로그와 테스트 출력을 비용이 낮은 보조 모델에 전달해 핵심 결과만 추출하고, 자동 검증 단계를 통해 놓친 중요한 세부 정보를 복구한다.

EdgeBench에서 SoL-Pi의 가장 효율적인 설정(네 메커니즘 모두 적용)은 토큰 소비를 49% 줄이면서 베이스라인 Pi 하네스 성능의 93.7%를 달성했으며, 전체 테스트 실행 비용을 $1,339에서 $894로 낮췄다. 성능 중심 변형으로 가장 강력한 단일 메커니즘만 선택했을 경우, 원래 Pi 하네스 점수를 5.3% 상회하면서도 토큰 사용량을 감소시켰다. 현재 API 요금을 기준으로, 저자들은 네이티브 Codex 및 Claude Code 하네스 대비 시간당 $8.75~$13.50, 표준 Pi 설정 대비 $4.36~$5.71의 운영 비용 절감을 예상한다.

연구진은 초기 시스템을 GPT-5.6 Sol로 개발한 뒤 구조적 변경 없이 Anthropic의 Opus 5로 이식했으며, 베이스라인 Pi 성능의 94.3%를 유지했다. EdgeBench 외에도 SoL-Pi는 Terminal‑Bench 4의 CPU 과제 63개 중 15개를 해결했으며(표준 Codex와 Pi는 18개 해결), 비용은 25% 절감했다. IMO 2026 벤치마크의 Lean 4 수학 검증 과제에서는 6문제 중 3문제를 가장 낮은 비용으로 해결했다. 또한 20개의 SoL-Pi 워커가 참여한 스웜 실험에서는 커널 최적화에서 최고 성과를 내면서 베이스라인 Pi 스웜 대비 비용을 26.8% 절감했다.

에이전트 오버헤드 증가에 따라 산업 수요 급증

SoL-Pi 개발은 소프트웨어 팀이 자율 에이전트 워크플로우로 인한 비용 급증에 직면하면서 이루어졌다. OpenRouter 분석가 Peter Walker는 2026년 2월 이후 에이전트 토큰 소비가 14배 증가했으며, 그 중 거의 70%가 캐시된 프롬프트에서 비롯된다고 지적했다. 하네스 구조적 영향은 8월에 툴링 기업 Composio가 수행한 평가에서도 강조되었는데, 이들은 DeepSeek V4 Flash를 Claude Code와 Oh My Pi 등 네 가지 프레임워크 설정에 적용해 동일 모델임에도 불구하고 과제당 비용 차이가 거의 3배에 달한다는 결과를 얻었다.

하지만 공격적인 하네스 축소는 기술적 트레이드오프를 동반한다. 컨텍스트 윈도우를 짧게 하면 프롬프트 캐시 재사용이 방해받아 이론적인 토큰 절감 효과가 상쇄될 수 있다. 또한 별도 연구에 따르면 압축된 프롬프트는 초기 사용자 지시의 평균 17%만을 보존한다. 멀티‑에이전트 설계에서도 확장성 한계가 드러난다; Codex 개발자 Eric Provencher는 두 개 이상의 서브‑에이전트를 배치하면 거의 항상 토큰을 소모하면서도 출력 품질이 개선되지 않는다고 경고했다. Nvidia 연구진은 향후 시스템에서 재귀적 효율성을 확보하기 위해 광범위한 과제 라이브러리를 대상으로 하네스를 사전 학습(pre‑training)할 것을 제안하고 있다.

관련 기사