AI RACE— 每日追蹤 AI 競爭賽局
Research

學術團隊以 8,000 美元運算預算打造超越人類水準的《西洋陸軍棋》AI

來自 CMU、NYU、史丹佛大學與 MIT 的研究人員打造出 Ataraxos,這款 AI 透過成本不到 8,000 美元的高效率訓練流程,在《西洋陸軍棋》(Stratego)中擊敗了傳奇棋手 Pim Niemeijer。

2026/10/01 19:58
Research

決定性壓倒頂尖大師,創下 Stratego 歷史新里程碑

由卡內基美隆大學(Carnegie Mellon University)、紐約大學(New York University)、史丹佛大學(Stanford University)與麻省理工學院(MIT)組成的聯合研究團隊,成功開發出首個在《西洋陸軍棋》(Stratego)中達到超越人類水準的人工智慧。這款遊戲是少數人類直覺仍勝過機器的經典棋類遊戲之一。這項發表於《Nature》期刊的研究詳細介紹著名為 Ataraxos 的系統,它在正式的 20 局對決中迎戰荷蘭冠軍 Pim Niemeijer,最終以 15 勝 1 敗 4 和的壓倒性戰績取勝。

Niemeijer 被公認為 Stratego 史上最具統治力的選手,坐擁 4 屆世界冠軍、15 座荷蘭全國冠軍、2 座線上世界冠軍,並位居世界排名第一超過 600 週——自 1997 年以來參加過每屆世界錦標賽的資深選手 George Franka 也證實了這項輝煌紀錄。面對人類頂尖競爭,該 AI 展現出前所未見的 85% 有效勝率;曾三度奪得世界錦標賽亞軍的 Max Roelofs 指出,由於遊戲機制帶來的巨大風險,一般頂尖選手之間的勝負差距往往極為微小。

揭密 8,000 美元訓練架構與遊戲對弈策略

Stratego 構成了極高的運算門檻,因為雙方選手必須在超過 10^33 種可能的初始布局中排列 40 枚隱蔽的棋子。與僅有 1,326 種起手牌組合的德州撲克(Texas Hold'em)不同,Stratego 的棋子軍階在雙方棋子於棋盤上交鋒之前都是隱藏的,這要求模型必須在龐大的隱藏資訊中進行推理,且歷史行動將直接決定未來決策的價值。

Ataraxos 在完全不依賴人類對弈紀錄的情況下達到了超越人類的水準,純粹透過自我對弈(self-play)進行學習。第一作者 Samuel Sokota 與團隊在訓練初期導入了強力正規化(regularization),以防止演算法陷入可被預測或利用的行為模式。該模型一開始以較大的步長廣泛探索各種陣型與走法,隨後研究人員逐步將其收斂為細緻的微調——他們將這種動態機制比作一種「能量儲備」,能防止學習過程退化失控為混亂。在執行走棋時,Ataraxos 會運用整合的信念網路(belief network)推論敵方隱藏棋子的軍階,生成潛在的對弈情境,並專門為該次決策計算具體的學習更新。

整個系統在學術預算受限的情況下,利用客製化設計的 GPU 模擬器完成訓練。基礎系統僅使用 16 顆 NVIDIA H100 GPU 訓練了一週,隨後使用 4 顆 GPU 花費 4 天校準信念網路,以 2025 年的價格計算,成本不到 8,000 美元。

在與 Niemeijer 長達三週的系列賽中,這位人類冠軍握有結構性優勢:他有時間在多場比賽中準備並針對 AI 調整策略,而 Ataraxos 則保持完全靜態,無法在賽事中主動適應 Niemeijer 的打法。三屆世界冠軍 Vincent de Boer 形容,這種在系列賽中無法即時調適的特性,對機器而言是一項嚴重的劣勢。為確保選手維持最高競賽動力,Niemeijer 除了獲得 1,000 美元的出場費之外,每獲勝一場還可得 100 美元獎金,打平則獲 50 美元。

對手形容該 AI 的棋風令人眼花繚亂且極難預測。Ataraxos 經常進行高風險的虛張聲勢(bluff),展現精準的走位布局,並在落後時採取頑強的拖延戰術。在 2025 年 Stratego 世界錦標賽期間的另一場表演賽中,該系統面對錦標賽級別的競爭對手,在 40 局中贏下了 38 局。

超越 DeepMind,擴展至更多不完全資訊博弈

這項學術突破直接向科技巨頭過去的成果發起挑戰。Google DeepMind 先前曾以 DeepNash 模型挑戰這款遊戲,當時動用了 1,024 個 TPU 節點運行兩到三個月——換算為 2025 年的運算成本估計達 300 萬至 450 萬美元。雖然 DeepNash 在 2023 年世界錦標賽中贏得了 28 場比賽中的 19 場,但面對包括 Niemeijer 在內的頂尖人類選手時卻屢屢落敗。Ataraxos 團隊所花費的運算成本僅約 DeepNash 的五百分之一、自我對弈局數的三十分之一,以及訓練樣本數的百分之一。原本提議讓這兩套 AI 系統進行正面交鋒,但在 DeepMind 表示 DeepNash 軟體已無法運作後,該計畫未能成行。

其底層架構已被證實可有效應用於多種具備不完全資訊特徵的博弈環境:

  • 在 Barrage Stratego 變體中,該演算法在與三位曾獲得兩次冠軍的前四強選手進行的四次 50 局系列賽中全數獲勝。
  • 在合作型卡牌遊戲《花火》(Hanabi)中,該方法刷新了所有變體的基準紀錄,在雙人版本中以比先前最佳技術少兩個數量級的運算量完成了求解。
  • 在熱門撲克牌遊戲「鬥地主」中,其表現超越了現有的基準模型 PerfectDou 與 DouZero。

作者群主張,龐大的隱藏資訊對強化學習(reinforcement learning)與搜尋演算法而言,已不再是不可逾越的障礙。他們指出,只要能構建出可靠的模擬環境,該範式就能延伸應用至金融市場、外交談判與軍事衝突等真實世界場景。研究人員也提到目前的一項技術限制:由於 Ataraxos 的搜尋僅模擬單一學習步驟,因此其效能無法單純透過在推論階段增加運算時間來進行擴展。Ataraxos 的程式碼目前已公開釋出。

◗ 參考來源

The Decoder10/01

相關文章