AI RACE— The AI Race
Research

わずか8000ドルの計算コストで人間超えのボードゲーム「Stratego」AIを大学研究チームが開発

CMU、NYU、スタンフォード大、MITの研究チームが、8000ドル未満の高効率なトレーニングパイプラインを用いて、Strategoの伝説的王者ピム・ニーメイヤー氏を圧倒するAI「Ataraxos」を開発した。

2026/10/01 19:58
Research

Stratego屈指のグランドマスターに圧勝

カーネギーメロン大学(CMU)、ニューヨーク大学(NYU)、スタンフォード大学、MITにまたがる共同研究チームが、人間の直観が機械を圧倒していた最後の古典的ボードゲームの1つである「Stratego」において、人間を凌駕するレベルに達した初の人工知能を開発した。学術誌『Nature』に掲載された論文によると、「Ataraxos」と名付けられたこのシステムは、オランダの王者ピム・ニーメイヤー(Pim Niemeijer)氏との公式な20番勝負に挑み、15勝1敗4引き分けという圧倒的な成績を収めた。

ニーメイヤー氏は、世界選手権優勝4回、オランダ国内タイトル獲得15回、オンライン世界選手権優勝2回、世界ランキング1位の座に通算600週間以上君臨するなど、Stratego史上最も圧倒的な強さを誇るプレイヤーとして広く知られている。その実績は、1997年以降すべての世界選手権に出場しているベテラン競技者のジョージ・フランカ(George Franka)氏も認めるものだ。世界選手権で3度の準優勝を誇るマックス・ルールフス(Max Roelofs)氏は、ゲームシステム上強いられるリスクの高さゆえに通常の競技レベルでは勝敗の差が極めて紙一重になると指摘しているが、そうしたトップクラスの人類を相手に、今回のAIの成績は実質勝率85%という前例のない驚異的な記録となった。

8000ドルのトレーニングパイプラインとゲーム内戦略の内幕

Strategoでは、両プレイヤーが伏せられた40個の駒を10の33乗通り以上におよぶ初期配置パターンの中から並べるため、計算上きわめて巨大な障壁が存在する。スターティングハンドの組み合わせがわずか1326通りのテキサスホールデム・ポーカーとは異なり、Strategoでは盤上で敵味方の駒がぶつかるまで駒の階級(ランク)が伏せられている。そのため、過去の行動が将来の選択の価値を左右するような、膨大な隠れ情報(不完全情報)のなかで推論を行うことがモデルに求められる。

Ataraxosは、人間の対局ログに依存することなく、完全に自己対戦のみを通じて人間超えのレベルに到達した。筆頭著者のサミュエル・ソコタ(Samuel Sokota)氏らのチームは、トレーニング初期に強力な正則化を適用することで、アルゴリズムが予測可能で付け入る隙のある行動パターンに固執するのを防いだ。モデルは当初、大きなステップサイズで配置や指し手の多様なバリエーションを探索し、研究チームはそれを徐々に絞り込んで緻密で小さな調整へと移行させた。研究者たちはこの力学を、学習がカオスへと崩壊するのを防ぐ「エネルギー貯蔵庫」に例えている。手を打つ際、Ataraxosは統合された信念ネットワーク(belief network)を展開して隠された相手の駒のランクを推論し、将来のゲームシナリオを生成した上で、その局面の決定に特化したターゲット学習アップデートを計算する。

システム全体は、学術研究の予算的制約の下、独自に開発されたGPUシミュレータを用いて訓練された。ベースシステムは16基のNvidia H100 GPUで1週間訓練され、その後4基のGPUで4日間かけて信念ネットワークの調整が行われた。2025年の価格換算でかかった費用は8000ドル未満に収まっている。

ニーメイヤー氏との3週間にわたる対局シリーズにおいて、人間のチャンピオン側には構造的な優位性があった。彼は連戦を通じてAIの対策を練り、アジャストする時間があったのに対し、Ataraxosは完全に静的な状態のままで、ニーメイヤー氏のプレイスタイルに適応する機能を持たなかったからだ。世界選手権を3度制したヴィンセント・デ・ブール(Vincent de Boer)氏は、シリーズ内での適応能力の欠如はマシンにとって深刻なハンディキャップであったと評している。最高のモチベーションを維持するため、ニーメイヤー氏には1000ドルの参加費に加え、1勝ごとに100ドル、引き分け1回ごとに50ドルの成果報酬が支払われた。

対戦相手たちは、このAIのプレイスタイルを「幻惑的で極めて予測困難」と評する。Ataraxosは日常的にハイリスクなブラフを仕掛け、精密な駒配置を見せ、劣勢に陥った際には粘り強い時間稼ぎの戦術を展開する。2025年のStratego世界選手権で行われた別のエキシビションでは、トーナメントレベルの強豪を相手に40戦中38勝を挙げた。

DeepMindを凌駕し、不完全情報ゲーム全体へと拡張

この学術チームによるブレークスルーは、巨大テック企業によるこれまでの取り組みに真っ向から挑戦するものだ。Google DeepMindは「DeepNash」モデルでこのゲームに挑戦したが、1024ノードのTPUを2〜3カ月稼働させる必要があり、2025年換算で推定300万〜450万ドルの計算コストがかかっていた。DeepNashは2023年の世界選手権で28戦中19勝を挙げたものの、ニーメイヤー氏をはじめとするトップクラスの人類には一貫して敗れていた。これに対しAtaraxosチームは、DeepNashの約500分の1の計算コスト、30分の1の自己対戦対局数、100分の1の訓練サンプル数でこれを成し遂げた。両AIシステムによる直接対決も提案されたが、DeepMind側がDeepNashのソフトウェアはすでに動作しないと回答したため、実現には至らなかった。

この基盤アーキテクチャは、不完全情報を特徴とする他の複数のゲーム環境でも有効性が実証されている。

  • Strategoの変種ルール「Barrage」において、いずれも2度の優勝経験を持つトップ4プレイヤー3名を相手に、50ゲームの対局シリーズで4度勝利を収めた。
  • 協力型カードゲーム「Hanabi」では、全バリアントでベンチマーク記録を塗り替え、従来の最高水準(SOTA)と比べて計算量を2桁削減しながら2人プレイ版を解いた。
  • 中国で人気のカードゲーム「Dou dizhu」では、既存のベンチマークであるPerfectDouやDouZeroを上回るスコアを記録した。

著者らは、膨大な隠れ情報の存在はもはや強化学習や探索アルゴリズムにとって克服不可能な壁ではないと主張している。信頼性の高いシミュレータさえ構築できれば、金融市場や外交交渉、軍事衝突といった現実世界の環境にもこのパラダイムを拡張できると示唆している。一方で研究者らは、現在の技術的な制約として、Ataraxosの探索が単一の学習ステップのみをシミュレートする仕様であるため、推論時により多くの計算時間を費やしても単純に性能をスケールアップさせることができない点を挙げた。Ataraxosのコードは一般に公開されている。

関連記事

Research

中国製AIモデルが機微な質問を厳格に検閲し、蒸留先モデルへもバイアスが波及している実態が調査で判明

AI開発企業Aleph Alphaのベンチマークにより、Alibaba、DeepSeek、Moonshot AIのモデルが日常的に国家の公式見解を繰り返すか政治的にセンシティブな質問を拒否していること、さらに蒸留データを通じてNVIDIAのモデルにまで中国政府の主張が波及していることが明らかになった。

一昨日