AI RACE— AI Race
Research

구글, 자가 개선 AI 에이전트의 벤치마크 단순 암기 막는 'RRSI' 공개

구글 클라우드 AI와 대학 연구진이 자율형 AI 에이전트의 테스트 과제 과적합을 방지하고 런타임 연산량을 30% 절감하는 정규화 프레임워크 RRSI를 발표했다.

2026. 10. 04. 19:40
Research

현대 인공지능(AI) 시스템에서 최근 확인되는 성능 향상의 상당 부분은 기반 모델의 가중치 업데이트가 아닌, '하네스(harness)'의 개선에서 비롯된다. 하네스란 에이전트의 런타임 의사결정을 좌우하는 프롬프트, 도구 연동, 워크플로, 로직, 메모리 등 주변 스캐폴딩(scaffolding)을 통칭한다. 재귀적 자가 개선(recursive self-improvement)을 통해 이러한 하네스의 재작성을 자동화하는 방식이 주목받고 있지만, 에이전트가 평가 과제를 빠르게 단순 암기해 훈련 점수만 부풀려지고 새로운 문제에 대한 일반화 성능은 떨어지는 고질적인 한계가 발생하고 있다.

이 문제를 해결하기 위해 구글 클라우드 AI 리서치(Google Cloud AI Research)와 산학 협력 연구진은 'RRSI(Regularized Recursive Self-Improvement of Agent Harnesses)'를 발표했다. 이 기법은 자가 최적화 주기 전반에 엄격한 가드레일을 도입해, 연산 비용을 낮추면서도 에이전트가 새로운 과제에 효과적으로 일반화되도록 보장한다.

자가 개선 하네스의 과적합 함정

하네스는 고정된(frozen) 대형언어모델(LLM)을 감싸는 운영 두뇌 역할을 하며, 에이전트가 파일을 수정하기 전에 올바른 파일을 검토하는지, 오류 발생 시 유연하게 복구하는지, 구조화된 결과물을 산출하는지 등을 제어한다. 이전에는 엔지니어가 실패 궤적을 수동으로 분석하고 하네스 지침을 수정하는 데 수 시간을 쏟아야 했다.

최근의 재귀적 자가 개선 파이프라인은 LLM이 성능 피드백을 기반으로 자체 하네스를 재작성하도록 지시해 이 과정을 자동화한다. 그러나 고정된 테스트 벤치마크 제품군을 상대로 튜닝을 반복하다 보면 시스템이 과적합되기 쉽다. 에이전트가 특정 벤치마크에만 국한된 탐색 패턴을 학습하거나, 순전히 운으로 성공한 후보군에 보상을 부여하고, 실질적인 역량 향상 없이 벤치마크 점수만 끌어올리는 불필요한 복잡성을 누적하기 때문이다. 그 결과 완전히 새로운 과제에서는 성능이 정체되거나 최적화 전의 초기 기준선보다 오히려 떨어지는 현상이 빈번히 발생한다.

편집 예산과 엄격한 크리틱을 통한 정규화

RRSI는 하네스의 자유로운 수정 가능성을 유지하면서도, 최적화 루프의 두 가지 핵심 지점인 '변경 사항 제안 시점'과 '수락 시점'에 개입한다.

제안 단계를 제어하기 위해 시스템은 점진적으로 축소되는 '편집 예산(edit budget)'을 적용한다. 최적화 초기 라운드에는 하네스에 대한 폭넓고 체계적인 재작성을 허용한다. 하지만 라운드가 진행될수록 예산이 줄어들며, 영향도를 명확히 추적할 수 있는 소규모의 모듈형 편집만 가능하도록 제한한다. 또한 RRSI는 실패한 전략을 다시 시도하지 않도록 과거 반복 작업의 이력을 유지하며, 개선이 정체되면 하네스 내에서 아직 편집되지 않은 영역을 의도적으로 탐색한다.

제안된 수정 사항이 병합되기 전에는 전담 크리틱(비평) 모델이 코드를 평가한다. 크리틱은 과제 이름을 하드코딩하거나 벤치마크 전용 우회책을 쓰거나 해법이 유출된 제안을 걸러낸다. 나아가 RRSI는 효율성 규칙을 적용해 측정 가능한 정확도 향상이 뒷받침되지 않는 연산 오버헤드 유발 변경을 거부하며, 쓸모없고 도움이 되지 않는 컴포넌트는 가지치기(pruning)한다.

미지의 벤치마크 전반에 걸친 일반화 성능

연구진은 엔지니어링 설계, 에이전트형 사무 환경, 소프트웨어 코딩을 망라하는 8개 벤치마크에서 수정되지 않은 기준선 및 기존 자동 최적화 방식 4종을 대상으로 RRSI를 평가했다. 기반 모델인 Claude Opus 4.8은 테스트 내내 동결된 상태를 유지했다.

평가 결과, 정규화된 접근 방식의 뚜렷한 장점이 입증됐다.

  • 지속적인 일반화: RRSI는 훈련 과제에서 최대 14.1점의 점수 상승을 달성했으며, JobBench에서의 4.7점 상승을 필두로 5개의 미접점 벤치마크 전반에서 최대 4.7점의 성능 향상을 기록했다.
  • 기준선 이하 하락 방지: 미접점 벤치마크에서 2개 방식의 성능이 초기 기준 하네스 밑으로 떨어졌던 경쟁 방식들과 달리, RRSI는 접해보지 않은 모든 과제에서 일관되게 플러스 성과를 유지했다.
  • 연산 효율성: 결과 하네스는 비정규화 대안 방식 대비 런타임 토큰을 약 30% 적게 소비했다.

RRSI가 무제한 방식보다 훈련 벤치마크 점수 상승 폭 자체는 작았지만, 이러한 상충 관계(trade-off)는 다른 접근법들의 성능을 저해했던 단순 암기 현상을 직접적으로 차단하는 효과를 낳았다.

모델 간 이식성

연구진은 이 과정을 통해 개선된 하네스가 성능이 비교적 낮은 모델에도 이점을 제공한다는 사실을 발견했다. Gemini 3.5 Flash를 사용해 초기 최적화된 소프트웨어 엔지니어링 하네스는 과제별 맞춤 튜닝 없이도 Gemini 3.1 Flash Lite의 정확도를 11.2점에서 14.6점으로 끌어올렸다. 이는 시스템이 찾아낸 구조적 워크플로가 특정 모델에만 국한된 편향이 아니라, 일반화된 운영 효율 개선으로 이어진다는 점을 시사한다.

저자들은 이번 연구가 직접적인 가중치 업데이트 시나리오가 아닌, 동결된 파운데이션 모델을 감싸는 하네스에만 전적으로 초점을 맞췄다고 덧붙였다. RRSI 프레임워크의 코드는 GitHub에 공개되어 있다.

관련 기사