Google apresenta RRSI para impedir que agentes de IA com autoaperfeiçoamento memorizem benchmarks
Pesquisadores do Google Cloud AI e de universidades apresentaram o RRSI, um framework de regularização que impede agentes autônomos de IA de se sobreespecializarem em tarefas de teste, reduzindo o custo computacional de execução em 30%.
Em sistemas modernos de inteligência artificial, grande parte dos ganhos recentes de desempenho não vem da atualização dos pesos dos modelos subjacentes, mas do refinamento do "harness" — a estrutura envolvente de prompts, integrações de ferramentas, fluxos de trabalho, lógica e memória que dita as decisões de um agente em tempo de execução. Embora a automação da reescrita desses harnesses por meio de autoaperfeiçoamento recursivo tenha ganhado força, ela cria uma desvantagem persistente: os agentes memorizam rapidamente suas tarefas de avaliação, gerando pontuações infladas no treinamento, mas uma generalização fraca em problemas inéditos.
Para enfrentar esse desafio, pesquisadores do Google Cloud AI Research e de várias universidades parceiras apresentaram o RRSI (Regularized Recursive Self-Improvement of Agent Harnesses). A técnica introduz salvaguardas rigorosas ao longo de todo o ciclo de auto-otimização, garantindo que os agentes generalizem de forma eficaz para novas tarefas, ao mesmo tempo em que reduzem os custos computacionais.
A armadilha do overfitting em harnesses autorrefináveis
Um harness atua como o cérebro operacional em torno de um modelo de linguagem grande congelado, orientando se o agente examina os arquivos corretos antes de modificá-los, se recupera de erros de forma adequada e entrega respostas estruturadas. Tradicionalmente, engenheiros passavam horas diagnosticando manualmente trajetórias com falha e corrigindo instruções do harness.
Pipelines recentes de autoaperfeiçoamento recursivo automatizam esse ciclo ao instruir um LLM a reescrever seu próprio harness com base no feedback de desempenho. No entanto, o ajuste repetido em relação a um conjunto fixo de benchmarks de teste faz com que o sistema sofra overfitting. Os agentes desenvolvem padrões de busca específicos para um único benchmark, recompensam candidatos que obtêm sucesso puramente por sorte e acumulam complexidade desnecessária que infla os números do benchmark sem agregar capacidade real. Em tarefas inéditas, o desempenho frequentemente estagna ou cai abaixo da linha de base original não otimizada.
Regularização por meio de orçamentos de edição e um crítico rigoroso
O RRSI intervém em duas etapas críticas no ciclo de otimização, mantendo o harness totalmente editável: quando as mudanças são propostas e quando são aceitas.
Para controlar a fase de proposta, o sistema impõe um "orçamento de edição" decrescente. As rodadas iniciais de otimização permitem reescritas mais amplas e sistêmicas do harness. Conforme as rodadas avançam, o orçamento encolhe, restringindo o sistema a edições menores e modulares cujos impactos possam ser claramente rastreados. O RRSI também mantém um histórico de iterações passadas para evitar a repetição de estratégias que falharam e, se a melhoria estagnar, explora deliberadamente segmentos não editados do harness.
Antes que qualquer modificação proposta seja incorporada, um modelo crítico dedicado avalia o código. Esse crítico filtra propostas que inserem diretamente no código referências a nomes de tarefas, soluções paliativas específicas para benchmarks ou vazamentos de soluções. Além disso, o RRSI impõe uma regra de eficiência: mudanças que introduzem uma sobrecarga computacional maior são rejeitadas, a menos que venham acompanhadas de ganhos mensuráveis de precisão, e componentes obsoletos e inúteis são descartados.
Generalização em benchmarks inéditos
A equipe de pesquisa avaliou o RRSI em comparação com uma linha de base não modificada e quatro métodos de otimização automatizada existentes em oito benchmarks, abrangendo design de engenharia, ambientes de escritório com agentes e programação de software. O modelo subjacente, o Claude Opus 4.8, permaneceu congelado durante todos os testes.
A avaliação revelou vantagens claras para a abordagem regularizada:
- Generalização sustentada: O RRSI alcançou aumentos de pontuação de até 14,1 pontos em tarefas de treinamento e ganhos de até 4,7 pontos em cinco benchmarks inéditos, liderados por um avanço de 4,7 pontos no JobBench.
- Sem regressão abaixo da linha de base: Ao contrário dos métodos concorrentes — dois dos quais tiveram desempenho inferior ao harness da linha de base inicial em benchmarks inéditos —, o RRSI manteve ganhos positivos em todas as tarefas nunca vistas.
- Eficiência computacional: Os harnesses resultantes utilizaram aproximadamente 30% menos tokens em tempo de execução do que as alternativas não regularizadas.
Embora o RRSI tenha gerado ganhos menores nos benchmarks de treinamento em comparação com métodos irrestritos, esse equilíbrio evitou diretamente a memorização que prejudicou as outras abordagens.
Portabilidade entre modelos
Os pesquisadores descobriram que os harnesses refinados por meio desse processo também beneficiam modelos menos capacitados. Um harness de engenharia de software inicialmente otimizado com o Gemini 3.5 Flash melhorou a precisão do Gemini 3.1 Flash Lite de 11,2 para 14,6 pontos, sem a necessidade de nenhuma adaptação específica para a tarefa. Isso sugere que os fluxos de trabalho estruturais descobertos pelo sistema se traduzem em melhorias operacionais generalizadas, e não em particularidades exclusivas de um único modelo.
Os autores destacaram que o estudo atual foca exclusivamente em harnesses aplicados sobre modelos fundacionais congelados, e não em cenários que envolvem atualizações diretas de pesos. O código do framework RRSI foi disponibilizado publicamente no GitHub.

