AI RACE— AI Race
Research

FRI 연구 "AI 발전 속도, 최고 전문가들의 예측보다 수년 앞서"

예측연구소(FRI)의 중간 보고서에 따르면 주요 연구자, 경제학자, 슈퍼포캐스터들이 수학, 바이러스학, 매출 성장 등 여러 분야에서 AI 혁신의 속도를 크게 과소평가한 것으로 나타났다.

2026. 09. 25. 02:18
Nghiên cứu của FRI: Giới chuyên gia hàng đầu đã đánh giá quá thấp tốc độ phát triển của AI

예측 패널, 전망과 현실 사이의 거대한 격차 확인

예측연구소(FRI, Forecasting Research Institute)가 발표한 중간 보고서에 따르면, 주요 인공지능(AI) 전문가, 경제학자, 전문 예측가들이 AI 분야 전반의 기술적·재무적 혁신 속도를 크게 과소평가한 것으로 나타났다. 2022년 중반부터 축적된 설문 조사를 바탕으로 한 이번 연구 결과는 과거의 미래 예측치와 지난 수년간 달성된 실제 이정표를 비교 분석했다.

이번 평가는 컴퓨터 과학자 76명, 업계 전문가 76명, 경제학자 68명, AI 정책 분석가 119명 등 전문가 339명을 대상으로 진행된 FRI의 '종단적 전문가 AI 패널(LEAP, Longitudinal Expert AI Panel)' 조사를 중심으로 이뤄졌다. 컴퓨터 과학자 그룹에는 상위 20개 대학 교수 30명과 세계에서 가장 많이 인용된 AI 연구자 200인 중 10명이 포함됐다. 이들의 전망치는 검증된 예측 정확도 기록을 보유한 범용 예측가 그룹인 '슈퍼포캐스터(superforecasters)'의 전망과 함께 비교 평가됐다. 두 그룹 모두에서 중간값(중위수) 예측치는 주요 역량 도약 시점을 실제 도달 시기보다 일관되게 수년 뒤로 예상했다.

수학·과학·매출 부문, 예측치 대폭 상회

가장 극명한 차이는 고급 수학 분야에서 나타났다. 2025년 7월, 인공지능 시스템은 국제수학올림피아드(IMO)에서 금메달 수준의 성과를 거뒀다. 이 이정표는 전문가 예측 중간값보다 5년, 슈퍼포캐스터들의 예상보다는 꼬박 10년 일찍 달성됐다. 2022년 설문 당시 전문가들은 해당 시점에 금메달급 성과가 나올 확률을 8.6%로 보았고, 슈퍼포캐스터들은 2.3%의 가능성만을 부여했다. 실제 실현된 모든 벤치마크 성과 전반에서 전문가들이 부여한 평균 확률은 24.6%였던 반면, 슈퍼포캐스터들은 9.7%에 그쳤다.

다른 고급 기술 벤치마크에서도 유사한 격차가 확인됐다.

  • 밀레니엄 문제(Millennium Prize Problem): AI가 밀레니엄 문제를 해결했을 가능성을 시사하는 징후(공식 검증 기준은 아직 평가 중)가 나타난 가운데, FRI는 2025년 8월과 9월 설문 조사에서 AI가 2027년 말까지 이러한 문제를 해결할 확률의 중간값이 전문가 그룹에서 단 10%, 슈퍼포캐스터 그룹에서는 5.4%에 불과했다고 지적했다.
  • 바이러스학 및 사이버 보안: AI 시스템이 바이러스학 역량 테스트(Virology Capabilities Test) 문제 해결 벤치마크에서 엘리트 팀 수준에 도달할 시점을 묻는 질문에 전문가들의 중간 예상 시점은 2030년, 슈퍼포캐스터는 2034년이었다. 그러나 FRI는 이 기준선이 2025년 4월경 이미 충족된 것으로 보인다고 밝혔다. 사이버 보안 벤치마크에서도 이와 유사한 과소평가가 나타났다.
  • 재무적 성장: 예측가들은 상업적 확장 속도 역시 제대로 내다보지 못했다. 전문가들은 2026년 말까지 단일 AI 기업의 최고 연간 반복 매출(ARR)이 중간값 기준 200억 달러에 이를 것으로 예측했으며, 경제학자들은 160억 달러, 슈퍼포캐스터들은 250억 달러로 내다봤다. 그러나 실제 보고된 수치는 2026년 7월 기준 650억 달러에 도달하며 이 같은 기대를 뛰어넘었고, Anthropic은 2026년 9월까지 약 1,000억 달러의 추정 ARR을 달성했다.

모든 부문에서 예측이 빗나가며 뒤처진 것은 아니었다. 예측가들은 습식 실험실(wet-lab) 생물학 작업에 대한 AI의 단기적 영향을 과대평가했다. 바이러스학자들은 AI 지원을 받을 경우 작업 완료율이 40%에 달할 것으로 예상했으나, 소규모 대조 시험 결과 LLM과 웹 검색을 활용한 실험 참가자들의 작업 완료율은 5.2%에 불과했다. 이는 인터넷 검색만을 활용한 실험군의 성공률인 6.6%보다도 소폭 낮은 수치였다. 또한 예측가들은 자율주행차 보급 속도도 더 빠를 것으로 예상해, 2027년까지 무인 자율주행차가 미국 차량 호출 서비스 운행의 7.3%를 차지할 것으로 전망했으나 LLM 지원 기반 예측치는 2.5% 수준에 머물렀다.

높아진 기대치와 더 빠른 추적 방식 도입

기술적 진보로 개발 일정이 대폭 단축됨에 따라 설문 조사에 참여한 전문가들도 전망치를 상향 조정했다. 9개월간 AI가 전기의 역사적 영향력에 맞먹는 '세기의 기술'이 될 확률에 대해 전문가들이 매긴 평균 확률은 31%에서 36%로 상승했다. 슈퍼포캐스터들 역시 같은 기간 추정치를 28%에서 35%로 끌어올렸다.

압축된 개발 주기에 발맞추기 위해 FRI는 2040년까지 가파른 발전을 예상하는 전담 패널 집단을 집중 조명하고, 지속적으로 업데이트되는 모델 생성 예측치를 도입할 계획이다. 연구소는 ForecastBench에서 평가된 자동화 시스템이 특정 질문 범주에서는 이미 슈퍼포캐스터와 필적하는 수준이라고 밝혔다.

FRI는 또한 이번 중간 연구 결과에 내재된 구조적 한계점도 함께 짚었다. 모델이 예정보다 일찍 이정표를 달성하는 순간 과소평가는 즉각 명백해지는 반면, 과대평가는 설정된 기한이 만료될 때까지 미확인 상태로 남기 때문에 초기 평가에서는 필연적으로 과소평가 사례에 더 큰 비중이 실릴 수밖에 없다는 설명이다.

관련 기사