Equipe acadêmica cria IA sobre-humana de Stratego com orçamento computacional de US$ 8.000
Pesquisadores da CMU, NYU, Stanford e MIT criaram o Ataraxos, uma IA que superou a lenda dos jogos de tabuleiro Pim Niemeijer no Stratego usando um pipeline de treinamento eficiente que custou menos de US$ 8.000.
Vitória decisiva sobre o principal grande mestre de Stratego
Um coletivo de pesquisa que reúne a Carnegie Mellon University, a New York University, a Stanford University e o MIT desenvolveu a primeira inteligência artificial a atingir domínio sobre-humano no Stratego, um dos últimos jogos de tabuleiro clássicos em que a intuição humana ainda superava as máquinas. Detalhado em um artigo publicado na revista Nature, o sistema, batizado de Ataraxos, enfrentou o campeão holandês Pim Niemeijer em um confronto oficial de 20 partidas e conquistou um retrospecto impressionante de 15 vitórias, uma derrota e quatro empates.
Niemeijer é amplamente considerado o jogador mais dominante da história do Stratego, acumulando quatro campeonatos mundiais, 15 títulos nacionais holandeses, dois campeonatos mundiais online e mais de 600 semanas no topo do ranking global — um histórico confirmado pelo competidor veterano George Franka, que disputou todas as edições do campeonato mundial desde 1997. O desempenho da IA se traduz em uma taxa de vitória efetiva sem precedentes de 85% contra competidores humanos de elite, em um cenário no qual o três vezes vice-campeão mundial Max Roelofs destacou que as margens competitivas padrão costumam ser mínimas devido aos altos riscos impostos pelas mecânicas do jogo.
Por dentro do pipeline de treinamento de US$ 8.000 e da estratégia de jogo
O Stratego representa uma barreira computacional imensa porque ambos os competidores organizam 40 peças ocultas em mais de 10^33 configurações iniciais possíveis. Ao contrário do poker Texas Hold’em, que possui apenas 1.326 combinações de mãos iniciais, o Stratego oculta as patentes das unidades até que peças adversárias colidam no tabuleiro, exigindo que os modelos raciocinem em meio a vastos volumes de informações ocultas, onde ações históricas ditam o valor de escolhas futuras.
O Ataraxos alcançou seu padrão sobre-humano sem depender de históricos de partidas humanas, aprendendo inteiramente por meio de self-play. O primeiro autor, Samuel Sokota, e sua equipe impediram que o algoritmo ficasse preso a comportamentos previsíveis e exploráveis aplicando uma forte regularização logo no início do treinamento. O modelo explorou inicialmente amplas variações de formações e jogadas com passos maiores, que os pesquisadores reduziram gradualmente para ajustes menores e refinados — uma dinâmica comparada por eles a uma reserva de energia que impede que o aprendizado degenere em caos. Para executar jogadas, o Ataraxos utiliza uma rede de crenças integrada para inferir as patentes das peças adversárias ocultas, gera cenários prospectivos de jogo e calcula uma atualização de aprendizado direcionada especificamente para essa decisão.
Todo o sistema foi treinado sob restrições de orçamento acadêmico usando um simulador para GPU desenvolvido sob medida. O sistema base foi treinado durante uma semana em 16 GPUs Nvidia H100, seguido por quatro dias em quatro GPUs para calibrar a rede de crenças, custando menos de US$ 8.000 a preços de 2025.
Durante a série de três semanas contra Niemeijer, o campeão humano contava com vantagens estruturais: ele teve tempo para se preparar e se ajustar à IA ao longo de vários confrontos, enquanto o Ataraxos permaneceu completamente estático e incapaz de se adaptar ao estilo de jogo de Niemeijer. O tricampeão mundial Vincent de Boer descreveu essa falta de adaptação ao longo da série como uma desvantagem séria para a máquina. Para garantir motivação máxima, Niemeijer recebeu uma taxa de participação de US$ 1.000, além de bônus por desempenho de US$ 100 por vitória e US$ 50 por empate.
Os adversários descrevem o estilo de jogo da IA como desorientador e excepcionalmente difícil de prever. O Ataraxos executa blefes de alto risco rotineiramente, demonstra um posicionamento cirúrgico de peças e adota táticas obstinadas de protelação quando fica em desvantagem. Em uma exibição separada durante o Campeonato Mundial de Stratego de 2025, o sistema venceu 38 de 40 partidas contra concorrentes de nível competitivo.
Superando a DeepMind e escalando em jogos de informação imperfeita
O avanço acadêmico desafia diretamente iniciativas anteriores de gigantes da tecnologia. A Google DeepMind abordou o jogo com seu modelo DeepNash, que exigiu 1.024 nós de TPU funcionando de dois a três meses — totalizando custos computacionais estimados entre US$ 3 milhões e US$ 4,5 milhões a preços de 2025. Embora o DeepNash tenha vencido 19 de 28 partidas no Campeonato Mundial de 2023, ele perdeu de forma consistente para os melhores jogadores humanos, incluindo Niemeijer. A equipe do Ataraxos operou com cerca de 1/500 dos custos computacionais do DeepNash, 1/30 do volume de partidas em self-play e 1/100 dos exemplos de treinamento. Um confronto direto proposto entre os dois sistemas de IA nunca se concretizou, após a DeepMind informar que o software do DeepNash já não está mais funcional.
A arquitetura subjacente provou ser eficaz em múltiplos ambientes de jogos caracterizados por informação imperfeita:
- Na variante Barrage Stratego, o algoritmo venceu quatro séries de 50 partidas contra três jogadores do top 4, todos bicampeões.
- No jogo cooperativo de cartas Hanabi, o método quebrou recordes de benchmark em todas as variantes, resolvendo a edição para dois jogadores com duas ordens de grandeza a menos de processamento computacional em relação ao estado da arte anterior.
- No popular jogo de cartas chinês Dou dizhu, ele superou os benchmarks consolidados PerfectDou e DouZero.
Os autores sustentam que vastos volumes de informações ocultas não são mais um obstáculo intransponível para o aprendizado por reforço e algoritmos de busca. Eles sugerem que o paradigma pode ser estendido a ambientes do mundo real, como mercados financeiros, negociações diplomáticas e conflitos militares, desde que simuladores confiáveis possam ser construídos. Os pesquisadores apontaram uma limitação técnica atual: como a busca do Ataraxos simula apenas um único passo de aprendizado, seu desempenho não pode ser simplesmente ampliado com tempo computacional adicional durante a inferência. O código do Ataraxos foi disponibilizado publicamente.

