Por Canuto  

Ataraxos, un sistema creado por investigadores de Carnegie Mellon, NYU, Stanford y MIT, ganó 15 de 20 partidas contra Pim Niemeijer, considerado el jugador más laureado de Stratego. El equipo afirma que entrenó la IA por menos de USD $8.000 y que su método también obtuvo resultados destacados en otros juegos con información oculta.
***

  • Ataraxos venció a Niemeijer con 15 victorias, una derrota y cuatro empates en una serie de 20 partidas.
  • El entrenamiento requirió una semana en 16 GPU Nvidia H100 y cuatro días adicionales en cuatro GPU, con un costo estimado inferior a USD $8.000.
  • Los investigadores también probaron el método en Barrage, Hanabi y Dou dizhu, aunque reconocen límites en la búsqueda usada por Ataraxos.


Ataraxos derrota al mejor jugador de Stratego con una fracción del costo de DeepMind

Una inteligencia artificial desarrollada por investigadores de Carnegie Mellon, la Universidad de Nueva York, Stanford y el MIT superó a Pim Niemeijer, considerado el jugador más laureado de Stratego. En una serie oficial de 20 partidas, Ataraxos consiguió 15 victorias, sufrió una derrota y empató cuatro veces, un resultado que, según sus autores, marca un rendimiento superior al humano en este juego.

El dato también destaca por los recursos que el equipo destinó al entrenamiento: los investigadores estiman que el cómputo costó menos de USD $8.000 a precios de 2025. El resultado llama la atención en un campo donde los juegos con información oculta han ofrecido retos persistentes para la IA, y reaviva la comparación con DeepNash, un sistema anterior de DeepMind que no logró imponerse a los mejores jugadores.

Una victoria sobre el jugador más laureado

Niemeijer, de Países Bajos, acumuló cuatro campeonatos mundiales, 15 títulos nacionales neerlandeses y dos campeonatos mundiales en línea, además de pasar más de 600 semanas en la cima del ranking mundial. George Franka, quien ha competido en todas las ediciones del campeonato mundial desde 1997, lo describió como el mejor jugador de Stratego de todos los tiempos.

El equipo repartió los encuentros a lo largo de tres semanas para reducir la fatiga y dar tiempo a Niemeijer para prepararse. El jugador sabía que Ataraxos no ajustaría su estrategia en respuesta a su estilo, pero aun así tenía incentivos para competir con seriedad: recibió USD $1.000 por participar, USD $100 por cada victoria y USD $50 por cada empate.

Al contar cada empate como media victoria, los investigadores calcularon una tasa efectiva de triunfos del 85%, cifra que calificaron de inédita en la cima competitiva de Stratego. La serie no fue una demostración aislada ante un rival ocasional: enfrentó al sistema con un jugador de palmarés excepcional bajo condiciones que, de acuerdo con el artículo publicado en Nature, buscaban evitar el cansancio y permitir la preparación.

La adaptación entre partidas inclinaba la serie a favor del humano en un aspecto importante: Niemeijer podía observar el comportamiento de la IA y ajustar sus decisiones, mientras Ataraxos no podía aprender de su contrincante durante el enfrentamiento. El triple campeón mundial Vincent de Boer consideró que esa limitación representaba una desventaja relevante para el sistema.

Por qué Stratego complica el trabajo de la IA

Stratego enfrenta a dos jugadores que colocan en secreto sus 40 piezas antes de iniciar la partida. El rango de cada pieza solo se revela cuando choca con una pieza rival, y el objetivo consiste en capturar la bandera del oponente; según los investigadores, el número de disposiciones posibles supera los 1033.

Ese diseño obliga a decidir sin conocer por completo el tablero enemigo, de modo que el valor de una jugada depende tanto de las posibles continuaciones como de la información acumulada durante la partida. Samuel Sokota, primer autor del trabajo, explicó que los métodos derivados de la IA de póker habían resuelto problemas similares cuando la cantidad de información oculta era menor, pero que Stratego amplía considerablemente esa dificultad.

Como referencia, en Texas Hold’em existen 1.326 manos iniciales posibles, y el artículo señala que el costo computacional de esos métodos crece con la cantidad de información escondida. Por esa razón, los investigadores describen Stratego como uno de los últimos grandes juegos competitivos de tablero en los que las personas todavía mantenían una ventaja sobre las máquinas.

La incertidumbre no solo se traduce en adivinar qué pieza enfrenta a cada unidad propia. Una estrategia sólida también debe evitar patrones que el contrincante pueda detectar y explotar, por lo que la aleatoriedad tiene un papel central; un sistema que repita una respuesta previsible puede regalar información y facilitar que el adversario anticipe sus planes.

Menos cómputo y una forma distinta de aprender

DeepMind había intentado resolver el desafío con DeepNash, un sistema entrenado durante dos o tres meses en 1.024 nodos TPU. Los autores de Ataraxos estiman que esa escala equivaldría a entre USD $3 millones y USD $4,5 millones en costos de cómputo a precios de 2025, aunque no realizaron una comparación directa entre ambos sistemas.

Ataraxos necesitó una semana de entrenamiento en 16 GPU Nvidia H100 y otros cuatro días en cuatro GPU para su red de creencias. A partir de los precios de 2025, sus creadores sitúan el costo por debajo de USD $8.000 y calculan que emplearon cerca de una quinientava parte del cómputo, una treintava parte de las partidas de autojuego y una centésima parte de los ejemplos de entrenamiento atribuidos a DeepNash.

Los investigadores atribuyen parte del ahorro a un simulador de GPU diseñado para el proyecto y a una mayor eficiencia en el uso de muestras. Sokota señaló que el equipo trabajó con recursos académicos de computación y acumuló herramientas y ajustes técnicos durante años, una experiencia que ayudó a hacer viable el entrenamiento con una infraestructura mucho más reducida.

Los autores indicaron que ofrecieron construir la infraestructura necesaria para una comparación directa, pero que DeepMind respondió que no era posible porque el código de DeepNash ya no funcionaba. En el campeonato mundial de Stratego de 2023, DeepNash ganó 19 de 28 partidas, aunque perdió contra la mayoría de los mejores jugadores, incluido Niemeijer.

La regularización ayuda a evitar estrategias rígidas

Ataraxos aprendió sin datos de partidas humanas y entrenó jugando contra sí mismo. Según los investigadores, una pieza clave fue regular cuánto debía variar el sistema: esa presión lo lleva a explorar distintas disposiciones y movimientos, en vez de aferrarse demasiado pronto a una estrategia fija que sus rivales podrían explotar.

El equipo redujo gradualmente esa presión durante el entrenamiento y ajustó el tamaño de los pasos de aprendizaje. Al principio, Ataraxos diversificó más sus decisiones y avanzó con cambios amplios; posteriormente, pasó a jugar de forma más deliberada y a modificar su política en pasos pequeños.

Los autores comparan esa regulación con una reserva de energía para aprender. Si el sistema la consume demasiado rápido, puede progresar con rapidez al comienzo, pero pierde capacidad para seguir mejorando y corre el riesgo de volverse fácil de anticipar; ajustar la intensidad con el tiempo busca evitar tanto el estancamiento como un aprendizaje errático.

La IA también usa una red de creencias para estimar qué piezas ocultas podría tener el rival. Antes de cada jugada, genera estados posibles del tablero a partir de esas predicciones, simula movimientos candidatos y aplica un paso adicional de aprendizaje para esa decisión; el equipo sostiene que trabajos previos evitaban una búsqueda de este tipo por su complejidad con tanta información oculta.

Resultados en otros juegos y límites del método

Los investigadores aplicaron el mismo enfoque a Barrage, una variante de Stratego, y ganaron cuatro series de 50 partidas contra tres de los cuatro jugadores mejor clasificados, todos bicampeones mundiales de esa modalidad. En Hanabi, un juego cooperativo de cartas, el sistema estableció nuevos récords en cada variante y, en la versión para dos jugadores, necesitó dos órdenes de magnitud menos de cómputo que el sistema que lideraba antes.

En Dou dizhu, un juego de cartas chino, Ataraxos también derrotó a PerfectDou y DouZero, que los investigadores identifican como los sistemas de referencia anteriores. La variedad de pruebas respalda la propuesta de que el método no depende exclusivamente de las reglas particulares de Stratego, aunque los resultados de cada juego corresponden a sus propias condiciones de evaluación.

Durante una exhibición en el Campeonato Mundial de Stratego de 2025, Ataraxos ganó 38 de 40 partidas contra participantes del torneo. Algunos jugadores describieron su estilo como difícil de leer: la IA ejecutaba faroles que las personas juzgaban demasiado arriesgados y, cuando iba perdiendo, bloqueaba el juego con una obstinación que ciertos rivales consideraban poco deportiva.

Los autores sostienen que grandes cantidades de información oculta ya no constituyen necesariamente un obstáculo para el aprendizaje por refuerzo y la búsqueda, y mencionan los mercados financieros, los conflictos militares y las negociaciones como situaciones estratégicas con información imperfecta. Sin embargo, reconocen que su búsqueda solo imita un paso de aprendizaje, por lo que el rendimiento no mejora indefinidamente al añadir más tiempo de cómputo; un método más sofisticado podría cambiar ese límite, y el equipo publicó el código de Ataraxos.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín