AI RACE— A Corrida da IA
Research

Sistema SoL-Pi da Nvidia Reduz pela Metade o Uso de Tokens de Agentes de IA ao Otimizar a Lógica de Controle

Pesquisadores da Nvidia desenvolveram o SoL-Pi, um sistema automatizado que reescreve o harness de controle para agentes de codificação de IA, reduzindo o consumo de tokens em quase metade sem sacrificar o desempenho das tarefas.

26/09/2026, 17:30
Hệ thống SoL‑Pi của Nvidia giảm tới nửa lượng token tiêu thụ của các agent lập trình nhờ tối ưu “harness”

Otimização Automatizada do Harness Reduz Custos de Tokens dos Agentes

Pesquisadores da Nvidia apresentaram o SoL-Pi, um sistema que otimiza automaticamente a camada de controle — conhecida como harness — usada por agentes autônomos de codificação de IA. Detalhado em um artigo publicado em 26 de setembro de 2026, a estrutura reduz o uso de tokens dos agentes em 44,7 a 49 por cento, mantendo a precisão das tarefas aproximadamente igual às configurações de referência.

À medida que agentes de IA operam de forma não supervisionada em fluxos de trabalho extensos, os custos aumentam drasticamente, pois consultas simples ao modelo se transformam em longas cadeias de raciocínio, chamadas repetidas de ferramentas e ciclos de feedback de execução. Enquanto técnicas padrão de eficiência focam em otimizações ao nível do modelo — como quantização, kernels de atenção mais rápidos ou substituição por modelos menores — o SoL-Pi tem como alvo o harness subjacente que gerencia como os agentes rastreiam estado, executam ferramentas e comprimem o contexto. Baseado em princípios de auto‑melhoria recursiva, a estrutura usa um agente de pesquisa para observar rastros de execução de ferramentas como Codex, Claude Code e OpenClaw, propor uma lógica de controle mais enxuta e avaliar automaticamente as mudanças candidatas em ambientes sandbox.

Quatro Mecanismos Principais e Desempenho em Benchmark

Para buscar um código de controle mais enxuto, a Nvidia realizou mais de 3.000 execuções, totalizando mais de 60.000 interações agente‑ambiente em 535 ambientes executáveis, que incluíam 495 pares de issue‑pull‑request do GitHub e 40 casos de teste sintéticos. Para impedir que o sistema automatizado se ajustasse excessivamente às tarefas de treinamento, os pesquisadores isolaram rigorosamente o feedback de busca da avaliação final, reservando o benchmark EdgeBench. Dos 51 tarefas públicas do EdgeBench, 11 foram usadas para validação única de candidatos, enquanto as 40 restantes foram mantidas estritamente para teste final não‑cego.

A busca automatizada gerou quatro mecanismos operacionais distintos:

  • Action Fusion: Mescla duas etapas sequenciais, como edição de código e execução de testes, em uma única ação para eliminar uma chamada completa ao modelo de linguagem.
  • Online Context Compact: Reduz o contexto acumulado não essencial imediatamente após as etapas de planejamento.
  • ObservationPack: Arquiva saídas extensas de ferramentas e as substitui por resumos concisos nas etapas de processamento subsequentes.
  • Evidence-Preserving Reducer: Redireciona grandes logs de erro e saídas de testes através de um modelo secundário mais barato para extrair os principais achados, apoiado por uma etapa de verificação automatizada que recupera detalhes críticos caso sejam perdidos.

No EdgeBench, a configuração mais eficiente do SoL-Pi — combinando os quatro mecanismos — reduziu o consumo de tokens em 49 por cento, alcançando 93,7 por cento do desempenho do harness Pi de referência, diminuindo o custo total das execuções de teste de US$ 1.339 para US$ 894. Uma variante focada em desempenho, selecionando apenas o mecanismo mais forte, superou a pontuação do harness Pi original em 5,3 por cento, ainda reduzindo o uso de tokens. Com as tarifas atuais de API, os autores estimam economias operacionais por hora de US$ 8,75 a US$ 13,50 em comparação com os harnesses nativos do Codex e Claude Code, e de US$ 4,36 a US$ 5,71 por hora em relação às configurações padrão do Pi.

Os pesquisadores inicialmente desenvolveram o sistema usando o GPT-5.6 Sol e, posteriormente, transferiram-no para o Opus 5 da Anthropic sem modificações estruturais, mantendo 94,3 por cento do desempenho de referência do Pi. Além do EdgeBench, o SoL-Pi resolveu 15 de 63 tarefas de CPU no Terminal-Bench 4 — comparado a 18 resolvidas pelo Codex e Pi padrão — com uma redução de custo de 25 por cento. Em tarefas formais de verificação matemática em Lean 4 do benchmark IMO 2026, o SoL-Pi resolveu três de seis problemas ao menor custo por tarefa resolvida. Além disso, um experimento de enxame envolvendo 20 trabalhadores SoL-Pi alcançou os melhores resultados em otimização de kernel, reduzindo os custos em 26,8 por cento em comparação com um enxame Pi de referência.

Demanda da Indústria Dispara à Medida que a Sobrecarga de Agentes Aumenta

O desenvolvimento do SoL-Pi ocorre enquanto equipes de software enfrentam custos inflacionados impulsionados por fluxos de trabalho de agentes autônomos. O analista da OpenRouter, Peter Walker, observou que o consumo de tokens por agentes aumentou 14 vezes desde fevereiro de 2026, com quase 70 por cento desse volume proveniente de prompts em cache. O impacto estrutural dos harnesses foi destacado em uma avaliação de agosto da empresa de ferramentas Composio, que executou o DeepSeek V4 Flash em quatro configurações de framework — incluindo Claude Code e Oh My Pi — e constatou que o custo por tarefa resolvida variou quase três vezes, apesar de usar exatamente o mesmo modelo subjacente.

Entretanto, o corte agressivo de harnesses apresenta trade‑offs técnicos. Encortar janelas de contexto pode interromper a reutilização de cache de prompts, ocasionalmente anulando a economia teórica de tokens. Além disso, estudos separados sobre compressão de contexto mostram que prompts condensados preservam, em média, apenas 17 por cento das instruções iniciais do usuário. Projetos multi‑agente também encontram limites de escalabilidade; o desenvolvedor do Codex, Eric Provencher, alertou recentemente que implantar mais de dois sub‑agentes quase sempre consome tokens sem melhorar a qualidade da saída, já que os agentes gastam computação excessiva validando o trabalho uns dos outros. Olhando para o futuro, os pesquisadores da Nvidia propõem pré‑treinar harnesses em bibliotecas amplas de tarefas para estabelecer ganhos de eficiência recursiva em sistemas futuros.

Notícias relacionadas