대학 연구진, 단 8천 달러 연산 비용으로 '스트라테고' 정복한 초인적 AI 개발
CMU, NYU, 스탠퍼드, MIT 공동 연구진이 8천 달러 미만의 고효율 학습 파이프라인을 구축해 보드게임의 전설 핌 니메이어를 꺾은 초인적 스트라테고 AI 'Ataraxos'를 개발했다.
스트라테고 최강 그랜드마스터 상대로 압도적 승리
카네기멜론 대학교(Carnegie Mellon University), 뉴욕 대학교(New York University), 스탠퍼드 대학교(Stanford University), 매사추세츠 공과대학교(MIT)로 구성된 공동 연구진이 인간의 직관이 기계를 앞서던 마지막 고전 보드게임 중 하나인 '스트라테고(Stratego)'에서 초인적인 수준에 도달한 최초의 인공지능(AI)을 개발했다. 국제 학술지 '네이처(Nature)'에 게재된 논문에 따르면, 'Ataraxos'라는 이름의 이 시스템은 네덜란드 챔피언 핌 니메이어(Pim Niemeijer)와의 공식 20경기 맞대결에서 15승 1패 4무라는 압도적인 성적을 거뒀다.
니메이어는 세계 챔피언십 4회 우승, 네덜란드 국내 대회 15회 우승, 온라인 세계 챔피언십 2회 우승, 600주 이상 세계 랭킹 1위 유지 등 스트라테고 역사상 가장 독보적인 선수로 꼽힌다. 1997년 이후 모든 세계 챔피언십에 출전해 온 베테랑 선수 조지 프랑카(George Franka) 역시 그의 위상을 인정했다. 이번 AI의 성과는 최정상급 인간 선수를 상대로 전례 없는 85%의 유효 승률을 기록한 것이다. 세계 챔피언십 준우승을 3차례 차지한 막스 룰로프스(Max Roelofs)는 게임 규칙상 리스크가 매우 커 일반적인 경기에서는 승패 차이가 극히 근소하게 갈린다고 설명했다.
8천 달러 학습 파이프라인과 인게임 전략의 비밀
스트라테고는 양측 플레이어가 각각 40개의 숨겨진 말을 10^33개 이상의 가능한 초기 배치 조합으로 구성하기 때문에 막대한 연산 장벽이 존재한다. 오프닝 패의 조합이 1,326개에 불과한 텍사스 홀덤 포커와 달리, 스트라테고는 말이 보드 위에서 충돌하기 전까지 계급이 감춰져 있다. 이 때문에 모델은 과거의 행동이 미래 선택의 가치를 좌우하는 방대한 비공개 정보를 추론해내야 한다.
Ataraxos는 인간의 대국 기록에 의존하지 않고 전적으로 자가 대진(self-play)을 통해 학습하며 초인적인 수준에 도달했다. 제1저자인 새뮤얼 소코타(Samuel Sokota) 연구원과 연구진은 학습 초기에 강력한 정규화(regularization)를 적용해 알고리즘이 예측 가능하고 공략당하기 쉬운 행동 패턴에 갇히는 것을 방지했다. 모델은 초기에 큰 보폭으로 말의 배치와 움직임의 광범위한 변형을 탐색한 뒤, 연구진이 점차 이를 미세하고 정교한 조정으로 좁혀 나갔다. 연구진은 이러한 역학을 학습이 혼돈에 빠지지 않도록 막는 '에너지 비축분'에 비유했다. 수를 둘 때 Ataraxos는 통합된 신념 네트워크(belief network)를 활용해 숨겨진 상대 말의 계급을 추론하고, 향후 발생 가능한 게임 시나리오를 생성하며, 해당 결정을 위한 맞춤형 학습 업데이트를 즉각 계산한다.
전체 시스템은 대학 연구실의 예산 제약 속에서 맞춤 제작된 GPU 시뮬레이터를 통해 학습됐다. 기본 시스템은 Nvidia H100 GPU 16대에서 1주일간 학습한 후, 신념 네트워크 보정을 위해 4대의 GPU에서 4일간 추가 학습을 진행했으며, 2025년 기준 비용은 8천 달러 미만에 불과했다.
니메이어와의 3주간의 대국 시리즈 동안 인간 챔피언에게는 구조적 이점이 있었다. 그는 여러 경기를 치르며 AI를 분석하고 적응할 준비 시간이 있었던 반면, Ataraxos는 완전히 고정된 상태여서 니메이어의 플레이 스타일에 적응할 수 없었다. 세계 챔피언 3회 수상자인 빈센트 더부르(Vincent de Boer)는 시리즈 내 적응 능력의 부재를 머신에 있어 중대한 핸디캡이라고 평가했다. 한편 최고의 동기부여를 위해 니메이어에게는 1천 달러의 참가비와 함께 승리당 100달러, 무승부당 50달러의 성과급이 지급됐다.
상대 선수들은 AI의 플레이 스타일이 혼란스럽고 예측하기 극도로 어렵다고 묘사한다. Ataraxos는 고위험 블러핑을 일상적으로 시도하고, 정밀한 말 배치를 선보이며, 불리한 상황에 처하면 끈질기게 지연 전술을 구사한다. 2025 스트라테고 세계 챔피언십 기간 동안 열린 별도의 이벤트 경기에서 이 시스템은 토너먼트급 참가자들을 상대로 40경기 중 38승을 거뒀다.
DeepMind를 뛰어넘고 불완전 정보 게임 전반으로 확장
이번 학계의 성과는 빅테크 기업들의 과거 시도에 정면으로 도전장을 던진다. Google DeepMind는 DeepNash 모델을 통해 이 게임에 도전한 바 있으나, TPU 노드 1,024대를 2~3개월간 구동해야 했으며 이는 2025년 기준 연산 비용으로 약 300만~450만 달러에 달하는 규모다. DeepNash는 2023년 세계 챔피언십에서 28경기 중 19승을 거뒀지만, 니메이어를 비롯한 최정상급 인간 선수들에게는 지속적으로 패배했다. 반면 Ataraxos 연구진은 DeepNash의 약 500분의 1 수준의 연산 비용, 30분의 1의 자가 대진 판수, 100분의 1의 학습 데이터만으로 이를 달성했다. 두 AI 시스템 간의 맞대결도 추진됐으나, DeepMind 측에서 DeepNash 소프트웨어가 더 이상 작동하지 않는다고 밝히면서 성사되지 못했다.
이 기반 아키텍처는 불완전 정보가 특징인 다양한 게임 환경에서도 그 효과를 입증했다.
- 변형 규칙인 '배리지 스트라테고(Barrage Stratego)'에서 이 알고리즘은 세계 4강권 선수 3명(모두 2회 우승 경력 보유)을 상대로 50경기 시리즈를 네 차례 모두 승리로 이끌었다.
- 협력형 카드 게임인 '하나비(Hanabi)'에서는 모든 변형 모드에서 벤치마크 기록을 경신했으며, 기존 최고 수준(SOTA) 모델 대비 연산량을 100분의 1 수준으로 줄이며 2인용 버전을 완벽히 풀어냈다.
- 중국의 인기 카드 게임인 '투디주(Dou dizhu)'에서도 기존 벤치마크인 PerfectDou와 DouZero를 앞섰다.
연구진은 방대한 양의 비공개 정보가 더 이상 강화학습과 탐색 알고리즘에 있어 극복 불가능한 장벽이 아니라고 강조했다. 또한 신뢰할 수 있는 시뮬레이터만 구축된다면 이러한 패러다임이 금융 시장, 외교 협상, 군사적 충돌과 같은 현실 세계 환경으로 확장될 수 있을 것이라고 제시했다. 다만 연구진은 한 가지 기술적 한계점으로 Ataraxos의 탐색이 단일 학습 스텝만을 시뮬레이션하기 때문에, 추론 시 연산 시간을 늘린다고 해서 성능이 단순히 비례해 확장되지는 않는다는 점을 지적했다. Ataraxos의 소스 코드는 공개된 상태다.

