Un equipo académico crea una IA sobrehumana para Stratego con un presupuesto de cómputo de 8.000 dólares
Investigadores de CMU, NYU, Stanford y el MIT han creado Ataraxos, una IA que venció a la leyenda del juego de mesa Pim Niemeijer en Stratego mediante un eficiente proceso de entrenamiento que costó menos de 8.000 dólares.
Victoria decisiva sobre el máximo gran maestro de Stratego
Un colectivo de investigación integrado por la Universidad Carnegie Mellon, la Universidad de Nueva York, la Universidad de Stanford y el MIT ha desarrollado la primera inteligencia artificial en alcanzar un nivel sobrehumano en Stratego, uno de los últimos juegos de mesa clásicos donde la intuición humana superaba a las máquinas. Detallado en un artículo publicado en Nature, el sistema, bautizado como Ataraxos, se enfrentó al campeón neerlandés Pim Niemeijer en un duelo oficial a 20 partidas y logró un contundente balance de 15 victorias, una derrota y cuatro empates.
Niemeijer es considerado por la mayoría como el jugador más dominante en la historia de Stratego, con cuatro campeonatos mundiales, 15 títulos nacionales de los Países Bajos, dos campeonatos mundiales en línea y más de 600 semanas en la cima de la clasificación global; un palmarés respaldado por el veterano competidor George Franka, quien ha disputado todos los mundiales desde 1997. El rendimiento de la IA se traduce en una tasa de victoria efectiva sin precedentes del 85 por ciento frente a la élite humana, en un contexto donde el tres veces subcampeón mundial Max Roelofs señaló que los márgenes competitivos habituales son extremadamente estrechos debido a los altos riesgos que imponen las mecánicas del juego.
Los secretos del entrenamiento de 8.000 dólares y su estrategia en partida
Stratego plantea una inmensa barrera computacional debido a que ambos competidores despliegan 40 piezas ocultas en más de 10^33 configuraciones iniciales posibles. A diferencia del póquer Texas Hold’em, que contiene apenas 1.326 combinaciones de manos iniciales, Stratego oculta el rango de las unidades hasta que las piezas rivales colisionan en el tablero, lo que exige a los modelos razonar a partir de enormes volúmenes de información oculta donde las acciones pasadas determinan el valor de las decisiones futuras.
Ataraxos alcanzó su nivel sobrehumano sin recurrir a registros de partidas humanas, aprendiendo exclusivamente mediante juego autónomo (self-play). El autor principal, Samuel Sokota, y su equipo evitaron que el algoritmo cayera en patrones predecibles y explotables aplicando una fuerte regularización al inicio del entrenamiento. En un principio, el modelo exploró amplias variaciones de configuraciones y movimientos con pasos de gran tamaño, que los investigadores redujeron gradualmente hacia ajustes más pequeños y precisos; una dinámica que compararon con una reserva de energía que evita que el aprendizaje degenere en el caos. Para ejecutar movimientos, Ataraxos despliega una red de creencias integrada que infiere los rangos de las piezas rivales ocultas, genera escenarios hipotéticos de partida y calcula una actualización de aprendizaje dirigida específicamente a esa decisión.
Todo el sistema se entrenó bajo las restricciones presupuestarias del ámbito académico mediante un simulador de GPU diseñado a medida. El sistema base se entrenó durante una semana en 16 GPU Nvidia H100, seguido de cuatro días en cuatro GPU para calibrar la red de creencias, con un costo inferior a los 8.000 dólares a precios de 2025.
Durante la serie de tres semanas contra Niemeijer, el campeón humano contó con ventajas estructurales: dispuso de tiempo para prepararse y adaptarse a la IA a lo largo de múltiples partidas, mientras que Ataraxos se mantuvo completamente estático e incapaz de adaptarse al juego de Niemeijer. El tricampeón mundial Vincent de Boer calificó esta falta de adaptación a lo largo de la serie como una desventaja considerable para la máquina. Para garantizar la máxima motivación, Niemeijer recibió una tarifa de participación de 1.000 dólares junto con primas por rendimiento de 100 dólares por victoria y 50 dólares por empate.
Sus rivales describen el estilo de juego de la IA como desorientador y excepcionalmente difícil de prever. Ataraxos recurre habitualmente a faroles de alto riesgo, exhibe un posicionamiento de piezas milimétrico y emplea tácticas de dilación obstinadas cuando se encuentra en desventaja. En una exhibición paralela durante el Campeonato Mundial de Stratego de 2025, el sistema ganó 38 de 40 partidas contra competidores de nivel de torneo.
Superando a DeepMind y escalando en juegos de información imperfecta
Este avance académico desafía frontalmente los intentos previos de los gigantes tecnológicos. Google DeepMind abordó el juego con su modelo DeepNash, que requirió 1.024 nodos de TPU funcionando entre dos y tres meses, lo que supuso un costo de cómputo estimado de entre 3 y 4,5 millones de dólares a precios de 2025. Aunque DeepNash ganó 19 de 28 partidas en el Campeonato Mundial de 2023, perdió sistemáticamente frente a jugadores humanos de primer nivel, incluido Niemeijer. El equipo de Ataraxos operó con aproximadamente 1/500 del gasto de cómputo de DeepNash, 1/30 del volumen de partidas en self-play y 1/100 de los ejemplos de entrenamiento. La propuesta de un enfrentamiento directo entre ambos sistemas de IA nunca llegó a concretarse, luego de que DeepMind indicara que el software de DeepNash ya no se encuentra operativo.
La arquitectura subyacente ha demostrado su eficacia en múltiples entornos de juego caracterizados por la información imperfecta:
- En la variante Barrage de Stratego, el algoritmo se impuso en cuatro series de 50 partidas frente a tres de los cuatro mejores jugadores del mundo, todos ellos bicampeones.
- En el juego cooperativo de cartas Hanabi, el método batió récords de referencia en todas las variantes y resolvió la edición para dos jugadores con dos órdenes de magnitud menos de cómputo que el estado del arte anterior.
- En el popular juego de cartas chino Dou dizhu, superó a las referencias existentes, PerfectDou y DouZero.
Los autores sostienen que los inmensos volúmenes de información oculta ya no son un obstáculo insuperable para el aprendizaje por refuerzo y los algoritmos de búsqueda. Sugieren que este paradigma puede extrapolarse a entornos del mundo real como mercados financieros, negociaciones diplomáticas y conflictos militares, siempre que puedan construirse simuladores confiables. Los investigadores señalaron una limitación técnica actual: dado que la búsqueda de Ataraxos solo simula un único paso de aprendizaje, su rendimiento no puede escalarse simplemente asignándole más tiempo de cómputo durante la inferencia. El código de Ataraxos se ha publicado de forma abierta.

