# Ataraxos écrase le meilleur joueur mondial au Stratego

> Ataraxos, conçu par le MIT et trois universités, bat les meilleurs joueurs de Stratego avec moins d’un trentième des parties d’entraînement.

Type : Actualité IA · Catégorie : Tendances · Publié le 2026-10-02 · Signal IA - Order & Chaos · Secteur : Cybersécurité
Source : https://www.orderchaos.eu/signal-ia/actu/ataraxos-detrone-les-champions-humains-du-stratego
Tags : ia, jeux stratégiques, apprentissage automatique, prise de décision

---

## En résumé

- Ataraxos a battu les meilleurs joueurs humains de Stratego avec un score de 39-2.
- Le système utilise moins d’un centième des exemples d’entraînement de DeepNash.
- Les chercheurs veulent ajouter des mesures d’interprétabilité avant toute adoption.

**Le signal :** Ataraxos a battu le meilleur joueur mondial de Stratego sur un score de 15-1-4.

**Ataraxos domine Stratego.** Des chercheurs du MIT, de Carnegie Mellon, de l’Université de New York et de Stanford ont développé un système capable de battre les meilleurs joueurs humains de Stratego. Le résultat a été publié le 30 septembre 2026 dans *Nature*. Ataraxos a battu le joueur le mieux classé au monde sur un score de 15-1-4. Il a aussi obtenu un bilan de 39-2 contre des joueurs de haut niveau lors du championnat du monde de Stratego. Le système s’attaque à un jeu de stratégie à information imparfaite. Les identités des pièces adverses restent cachées jusqu’à leur confrontation. [Lire l’article du MIT](https://news.mit.edu/2026/game-playing-ai-stratego-new-champ-0930).

**Un espace de jeu immense.** Chaque joueur place 40 pièces sur son côté du plateau avant de tenter de capturer le drapeau adverse. Une pièce élimine l’autre selon son rang après une collision. Les configurations possibles dépassent 10 puissance 66, soit un nombre présenté comme exponentiellement supérieur à celui des positions d’échecs. Les systèmes précédents, dont DeepNash de Google DeepMind, nécessitaient des opérations complexes et coûteuses. Leurs entraînements avaient coûté plusieurs millions de dollars, sans parvenir à battre les meilleurs joueurs humains. Gabriele Farina, chercheur principal du MIT, estime que les méthodes issues du poker ne passent pas à cette échelle.

## Ataraxos réduit le coût d’entraînement

**Deux méthodes complémentaires.** Ataraxos apprend d’abord grâce à un apprentissage par renforcement en auto confrontation. Il joue de nombreuses parties contre lui-même pour construire une stratégie de référence. Les chercheurs ont conçu des algorithmes visant à accélérer cet apprentissage sans explorer chaque coup possible. Selon Gabriele Farina, le système atteint une force de jeu strictement supérieure à DeepNash avec moins d’un centième de ses exemples d’entraînement. Il utilise aussi moins d’un trentième de ses parties d’auto confrontation. Ces chiffres décrivent une amélioration d’efficacité mesurée par les chercheurs, et non une estimation de performances futures. La publication est disponible dans [Nature](https://www.nature.com/articles/s41586-026-11036-y).

**Une planification au dernier moment.** Ataraxos combine sa stratégie de référence avec une planification effectuée pendant chaque partie. Un modèle génératif estime les identités probables des pièces cachées de l’adversaire. Le système évalue ensuite plusieurs choix futurs avant de sélectionner son prochain mouvement. Gabriele Farina explique que cette méthode cherche l’état de plateau le plus plausible au lieu de deviner sans information. Les chercheurs attribuent à cette utilisation du modèle génératif la capacité d’Ataraxos à dépasser les performances humaines. Ils ont aussi adapté le système à Barrage Stratego, une variante plus rapide, ainsi qu’à Hanabi et Dou dizhu.

## Les chercheurs visent l’interprétabilité

**Des performances sur plusieurs jeux.** Ataraxos a atteint des performances supérieures à celles des humains dans les trois autres jeux testés par l’équipe. Hanabi est un jeu de cartes coopératif réunissant plusieurs participants. Dou dizhu oppose deux joueurs coopérant contre un troisième. Ces adaptations servent à évaluer la généralité de la méthode au-delà du Stratego. Les auteurs évoquent des usages possibles pour des problèmes comportant des informations cachées, notamment les négociations commerciales, les manœuvres militaires et la [cybersécurité](/signal-ia/actu/1password-alerte-lia-echoue-a-securiser). Ces applications sont présentées comme des possibilités d’adaptation, et non comme des déploiements réalisés. Ars Technica [analyse aussi ces résultats](https://arstechnica.com/science/2026/10/ai-finally-beat-the-best-stratego-player-in-history-and-did-it-on-a-budget/).
