Microsoft fait bondir un modèle 9B avec Echoverse
Industrie #chatgpt 3 min · 18 septembre 2026

Microsoft fait bondir un modèle 9B avec Echoverse

Par Arthur Dekeyser

En résumé

1

Microsoft a construit douze mondes d’entraînement pour agents informatiques.

2

Un modèle 9B a progressé de 36,5 % à 67,1 % après entraînement.

3

Microsoft publie quatre mondes avec leur code, leurs données et leurs évaluateurs.

💡

Le signal : Microsoft entraîne un modèle 9B sur douze mondes Echoverse et fait progresser son score de 36,5 % à 67,1 %.

NEWSLETTER BUSINESS & IA

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés

Microsoft présente Echoverse. Le groupe a construit douze mondes d’entraînement pour agents capables d’utiliser des interfaces informatiques. Dix mondes reproduisent des domaines complets, tandis que deux ciblent des capacités précises. Ces derniers travaillent notamment les sélecteurs de dates et les filtres imbriqués, sous plusieurs formes. Entraîné sur les douze mondes, un modèle de 9 milliards de paramètres a fait progresser son score de 36,5 % à 67,1 %. Ce résultat le place à quatorze points de GPT-5.4, selon l’expérimentation présentée par Microsoft. L’entreprise publie également quatre mondes avec leur code, leurs données et leurs évaluateurs ancrés dans l’état réel des applications. Echoverse détaille cette approche.

Les mondes reproduisent les conséquences. Une capture d’écran montre l’interface, mais elle ne montre pas toujours ce qu’une action provoque. Dans Echoverse, un clic peut modifier un état sauvegardé, transmettre un message ou échouer face à une page bloquée. Les environnements synthétiques recréent ces conséquences dans une base de données contrôlée. Les essais peuvent être réinitialisés sans toucher à un compte réel. Chaque monde associe une application, des tâches et un évaluateur. L’évaluation compare le résultat à l’état de référence de la base. Elle vérifie ainsi les changements réels, plutôt que l’apparence des pixels. Cette architecture vise les systèmes fermés comme la messagerie, la banque, les dossiers médicaux et les consoles internes.

Microsoft entraîne douze mondes spécialisés

La profondeur guide l’entraînement. Microsoft distingue la fidélité comportementale, la cohérence de l’état, la profondeur des processus, la vérification par les données et la valeur du domaine. Un message envoyé doit apparaître chez son destinataire. Une réunion annulée doit disparaître des deux calendriers. Une première décision doit aussi limiter les actions suivantes. Les dix mondes complets couvrent la communication, la coordination, la création technique, les opérations, les dossiers réglementés, les transactions, les communautés, les médias et les voyages. EchoStay utilise des données issues d’InsideAirbnb. EchoForum repose sur un corpus public de 2,55 millions de commentaires. EchoBank et EchoCare simulent des écritures autorisées et des historiques d’audit.

Les contrôles deviennent transférables. Les agents rencontrent souvent les mêmes difficultés d’interface, notamment avec les sélecteurs de dates et les filtres imbriqués. Microsoft a donc créé deux mondes de capacité qui varient une interaction ciblée. L’entraînement sur des formes différentes doit permettre au modèle d’utiliser cette compétence dans des domaines absents de ses données d’entraînement. Les essais comparant des versions superficielles et profondes d’un même site montrent une régression sur les versions superficielles. Le modèle progresse sur les versions profondes. Microsoft décrit aussi une boucle d’amélioration conjointe. Les échecs servent à enrichir le modèle, tandis que les défauts du monde, des tâches ou de l’évaluateur sont corrigés.

Microsoft publie quatre mondes Echoverse

La vérification repose sur la base. Chaque tâche reçoit une réponse calculée depuis la base de données lors de sa génération. Une lecture est évaluée par équivalence sémantique. Ainsi, une valeur de 287,62 dollars peut satisfaire une réponse indiquant 288 dollars. Une écriture est évaluée par la différence entre l’état avant et l’état après. Une tâche de lecture-écriture obtient le plus faible des deux scores. Microsoft utilise ensuite l’apprentissage par renforcement avec cet évaluateur comme récompense. Cette méthode améliore les performances sur des tâches conservées pour l’évaluation. Elle apprend aussi à l’agent à atteindre son objectif en moins d’étapes. Les quatre mondes publiés sont disponibles sur GitHub et Hugging Face.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs abonnés

À lire aussi