첨단 AI 성능 구현 비용, 연간 최대 13분의 1 수준으로 급감
Epoch AI와 MIT의 연구에 따르면 알고리즘 발전, 하드웨어 가격 하락, 치열한 시장 경쟁이 맞물리면서 특정 벤치마크 점수를 달성하는 데 드는 비용이 전례 없는 속도로 급락하고 있는 것으로 나타났다.

역사적인 속도로 급락하는 AI 벤치마크 달성 비용
주요 인공지능(AI) 벤치마크에서 정해진 성능 수준을 달성하는 데 드는 비용이 과거의 어떤 혁신 기술보다 빠른 속도로 하락하고 있다. AI 트렌드를 추적하는 연구 기관인 Epoch AI의 조사에 따르면, 2023년 이후 주요 벤치마크에서 특정 성능 수준에 도달하는 비용은 분기당 평균 47%씩 감소해 연간 약 13분의 1 수준으로 떨어진 것으로 나타났다.
Hans Gundlach가 이끄는 MIT 연구진의 병렬 연구 역시 2024년 4월부터 2025년 11월 사이 AI 평가 플랫폼 Artificial Analysis의 데이터를 바탕으로 유사한 흐름을 추적했다. MIT 연구팀은 더 폭넓은 모델군에 걸쳐 연간 비용이 5배에서 10배(1/5~1/10 수준) 하락하는 것을 관측했다. 이러한 수치는 과거 수준의 역량을 재현하는 시장 가격이 급락했음을 보여주지만, 연구진은 새로운 추론 아키텍처의 막대한 연산 요구량으로 인해 복잡한 작업에서 최고 성능의 최첨단 모델을 구동하는 비용은 오히려 증가할 수 있다고 지적했다.
알고리즘 발전, 하드웨어, 가격 경쟁의 세부 분석
과거 첨단 모델의 성능에 도달하는 데 필요한 운영 비용의 하락세는 가파르다. Epoch AI는 2025년 초 박사급 과학 벤치마크인 GPQA Diamond에서 질문당 약 30센트의 추정 비용으로 75%의 정확도를 기록한 OpenAI의 o3 모델을 조명했다. 이후 18개월 만에 GPT-5.6 제품군의 한 모델은 질문당 단 0.04센트로 동일한 점수를 달성하며 비용을 725분의 1로 줄였다. Epoch AI는 이러한 변화의 규모를 체감할 수 있도록, 만약 자동차 제조 분야가 동일한 속도로 개선된다면 5만 유로짜리 차량 가격이 70유로 미만으로 떨어지는 셈이라고 설명했다. OpenAI의 저비용 모델인 GPT-6 Sol과 Luna의 출시는 기준 비용이 계속해서 낮아지고 있음을 보여준다.
하지만 시장 가격이 오로지 알고리즘 개선만을 반영하는 것은 아니다. MIT 연구진이 오픈 모델을 조사하고 저렴해진 하드웨어와 공격적인 가격 경쟁의 영향을 배제해 시장 역학을 분리해 낸 결과, 순수 알고리즘 효율성 개선율은 연간 약 3배(비용 3분의 1 수준)로 계산됐다. Epoch AI가 제시한 더 높은 수치인 13배는 하드웨어 개선과 경쟁적 할인 요인을 분리하지 않은 전체 시장 환경을 반영한 결과다.
아울러 벤치마크 점수가 높아졌다고 해서 반드시 시스템이 더 효율화되었음을 의미하는 것은 아니다. MIT 연구진은 최신 추론 모델들이 문제 해결 시 대규모의 추가 테스트 시간 연산(test-time compute)을 투입해 정확도를 높이는 경우가 많으며, 이로 인해 기본 토큰 가격이 하락하더라도 질의당 연산량과 비용은 오히려 늘어날 수 있음을 발견했다.
테스트 시간 연산, '벤치맥싱', 그리고 실제 현장의 기회비용
이러한 엇갈린 지표들은 단순 벤치마크 점수와 실제 배포 비용 간의 괴리가 커지고 있음을 부각한다. 종합 벤치마크 결과는 데이터, 아키텍처, 훈련 효율성, 테스트 시간 연산의 개선을 한데 아우르기 때문에 최고 수준의 점수가 실제로는 더 높은 실행 비용을 감추고 있을 수 있다. 연구진은 개발자들이 공개 테스트에만 특화되도록 시스템을 최적화하는 이른바 '벤치맥싱(benchmaxxing)' 현상도 지적한다. Epoch AI는 이를 고려하기 위해 비공개 테스트인 'Mystery Game Puzzles'를 도입했는데, 이 벤치마크에서의 비용 하락률은 표본 중 가장 느리게 나타났다. 이는 비공개 테스트에 대한 최적화가 덜 이뤄졌거나 작업 형식 자체의 차이 때문인 것으로 풀이된다.
기업 도입 담당자에게 전반적인 가격 하락이 모델 선택의 절대적 기준이 되지는 않는다. 토큰당 비용 지표보다 운영상의 요구사항이 더 중요하게 작용하는 경우가 많기 때문이다. 가격이 크게 저렴하더라도 지연 시간(latency)이 긴 모델은 실시간 고객 상담 챗봇에 적합하지 않으며, 속도가 느린 추론 모델은 자동화 파이프라인의 병목 현상을 유발할 수 있다. 반대로 더 비싼 첨단 모델을 도입하더라도 뛰어난 초회 정확도 덕분에 반복 질의나 오류 수정 루프가 필요 없어진다면, 결과적으로 전체 운영 비용은 더 낮아질 수도 있다.

