AI RACE— AI Race
Research

인간이 여전히 AI 지원 모델 개발에서 주도권을 잡는다, 연구 결과 밝혀

푸단대 연구팀이 700건 이상의 작업 로그를 분석한 결과, AI 에이전트가 대부분의 일상적인 단계를 담당하지만 전략적 의사결정은 인간이 압도적으로 수행한다.

2026. 09. 27. 22:18
Các tác nhân AI thực hiện phần lớn công việc trong phát triển mô hình, nhưng quyết định cuối vẫn do con người đưa ra

사건 개요, 참여자 및 시점

2026년 9월 27일, 중국 푸단대 연구진은 인간 참가자와 AI 에이전트가 새로운 에이전시 언어 모델인 Atria Dawn Preview를 구축하기 위해 어떻게 협업했는지를 조사한 연구를 발표했다. 이번 조사에서는 모델 개발 파이프라인에서 작업한 56명의 참가자가 생성한 700건 이상의 작업 로그를 분석했다.

연구 주요 결과

  • AI 참여는 거의 보편적: 검토된 작업 중 96.5 %에서 AI 에이전트가 사용되었다.
  • 에이전트 의존도 증가: 4주에 걸쳐 에이전트 행동 대비 인간 입력의 중앙값 비율이 11에서 28.5로 상승했으며, 이는 프로젝트가 진행될수록 참가자들이 더 많은 작업을 에이전트에 넘겼음을 나타낸다.
  • AI가 가능하게 만든 작업: AI 지원으로 완료된 455개 작업 중 151개(약 1/3)는 AI 없이는 실행 불가능하다고 판단되었으며, 이는 56명 중 27명의 참가자들이 공통적으로 느낀 점이다.
  • 의사결정 분담: 방법 및 파라미터 선택에 있어 “AI가 제안하고 인간이 선택”이 전체 상호작용의 55.4 %를 차지했다. 인간은 방법/파라미터 결정의 85.5 %와 목표·범위에 대한 최종 결정의 93.4 %를 내렸으며, AI는 방법/파라미터 결정에 9.2 %만 기여했고 최종 선택에서는 한 자릿수 비율에 머물렀다.
  • 문제 상황에서 인간 개입: 난이도가 기록된 588개 작업 중 76 %에서 인간이 개입했으며, 주로 컨텍스트 추가(35.2 %)와 문제 진단 및 방법 전환(34.7 %)이었다. 에이전트는 어려운 작업의 23 %를 스스로 해결했다. 완전한 인간 인수는 0.7 %에 불과했고, 부분 편집은 3.2 %였다.
  • 피드백 루프: 인간 피드백을 받은 후 AI는 75.4 %의 경우 자체 출력을 수정했으며, 이는 판단보다 실행 단계가 병목임을 시사한다.
  • AI 역할의 진화: 저자들은 AI가 인간이 설정한 목표 안에서 계획을 초안하고 조정하는 현재 단계까지 세 가지 단계—연구 대상, 작업 수준 도구, 프로젝트 파트너—를 제시한다. 가설적인 네 번째 단계는 재귀적 자기 개선을 포함하지만, 연구에서는 현재 모델이 후속 모델 설계 능력은 향상되지 않은 채 훈련 작업에서는 개선될 수 있다고 언급한다.
  • 무비판 승인 위험: 논문은 에이전트가 더 긴 작업 체인을 처리함에 따라 인간 감독이 단순 “무비판 승인” 수준으로 떨어질 수 있다고 경고한다. 특히 참가자들이 편의를 위해 에이전트를 자율적으로 운영할 경우 이러한 위험이 커진다.

산업적 맥락 및 관련 동향

이번 연구 결과는 재귀적 자기 개선을 둘러싼 격렬한 논쟁이 한창인 시점에 발표되었다. Anthropic의 CEO인 Dario Amodei는 AI 연구에 속도 제한을 요구하며, 현재 Anthropic에서는 인간이 연구 방향 결정에 차지하는 비중이 한 자릿수에 불과하다고 지적했다. OpenAI는 개발 주기 전반에 걸쳐 GPT‑5.6 Sol을 활용하고 있으며, Google과 DeepMind는 Dream‑RSI와 같은 에이전트를 사용해 대체 검색 전략을 탐색하고 있지만 모델 자체를 재설계하는 데는 쓰지 않는다. 최근 천 명이 넘는 AI 산업 종사자들이 자사의 AI 연구가 완전 자동화 직전이라고 경고했다. 프린스턴 대학과 영국 AI 보안 연구소가 공동으로 수행한 별도 연구도 푸단대 결과와 일치하며, 최첨단 모델이 연구 엔지니어링에서는 뛰어나지만 궁극적으로 중요한 고차원 판단에서는 부족함을 드러낸다.

관련 기사