En résumé
Microsoft a construit douze mondes d’entraînement pour les agents capables d’utiliser des interfaces.
Le modèle 9B augmente son score de 36,5 % à 67,1 % après entraînement sur ces mondes.
Microsoft publie quatre mondes avec leur code, leurs données et leurs évaluateurs ancrés dans l’état applicatif.
Le signal : Le modèle 9B passe de 36,5 % à 67,1 % après entraînement sur les douze mondes Echoverse de Microsoft.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
Microsoft Research a construit douze mondes d’entraînement pour les agents capables d’utiliser des interfaces informatiques. Dix mondes reproduisent des domaines complets, tandis que deux ciblent des capacités précises. Ces derniers déclinent un même contrôle sous plusieurs formes, notamment les sélecteurs de dates et les filtres imbriqués. Les environnements reproduisent le comportement d’applications, contiennent des données réalistes et maintiennent un état cohérent entre écrans et utilisateurs. Entraîné sur les douze mondes, un modèle de 9 milliards de paramètres fait presque doubler son score de base, de 36,5 % à 67,1 %. Ce résultat le rapproche à quatorze points de GPT-5.4.
Les mondes simulés permettent d’entraîner les agents sans utiliser les versions actives d’applications sensibles. Une action peut modifier un compte réel, envoyer un message ou produire une conséquence difficile à annuler. Les systèmes visés incluent la messagerie, les calendriers, les services bancaires, les dossiers de santé et les consoles internes. Echoverse reconstruit ces usages dans une application synthétique dotée d’une base contrôlée, réinitialisable et vérifiable. Chaque monde associe un environnement, des tâches et un évaluateur. L’évaluateur compare le résultat à l’état réel de la base, plutôt qu’à une capture d’écran. Microsoft présente cette architecture dans son article de recherche.
La profondeur prime sur le nombre brut d’environnements dans l’approche Echoverse. Un monde utile doit respecter le comportement des contrôles, des permissions et des erreurs. Il doit aussi conserver un état cohérent, avec des conséquences visibles entre écrans et utilisateurs. Les workflows doivent garder leurs dépendances, tandis que la vérification doit s’appuyer sur l’état applicatif. Microsoft oppose ces mondes profonds à des versions superficielles d’un même site. Le modèle entraîné sur les versions superficielles régresse sur celles-ci. Il progresse en revanche sur les versions profondes. Les dix domaines complets couvrent notamment la communication, les opérations techniques, les transactions, les dossiers réglementés, les communautés, les médias et les voyages.
La fabrique Echoverse génère d’abord une application FastAPI et SQLite sous une interface React. Elle transforme des scénarios initiaux en spécifications, puis en affirmations vérifiables sur les routes, l’état et les comportements. Chaque affirmation est testée sur l’application en fonctionnement. Les composants défaillants sont réparés dans la base, le serveur ou l’interface avant la validation du monde. Les tâches sont ensuite ancrées dans les données présentes. Des analyseurs vérifient la réalité des entités, la plausibilité des objectifs et leur difficulté. Un agent exécute aussi chaque objectif dans le navigateur. Les échecs sont classés par couche, puis corrigés et réévalués contre l’état de la base.
La vérification ancrée attribue à chaque tâche une réponse issue d’une requête SQL exécutée lors de la génération. Une lecture est évaluée selon l’équivalence sémantique avec la valeur stockée. Ainsi, 288 dollars valide une réponse de 287,62 dollars. Une écriture est vérifiée par la différence réelle entre l’état avant et l’état après l’action. Une tâche de lecture-écriture reçoit le score le plus faible des deux composantes. Microsoft utilise ensuite GPT-5.4 pour résoudre les tâches. Les trajectoires validées par l’évaluateur alimentent l’entraînement supervisé. L’apprentissage par renforcement utilise également cet évaluateur comme récompense et améliore la performance sur des tâches conservées, avec moins d’étapes nécessaires.
Microsoft publie quatre mondes avec leur code, leurs données et leurs évaluateurs ancrés. Le dépôt microsoft/Echoverse sur GitHub fournit les ressources logicielles associées au projet. Les jeux de données sont également proposés sur Hugging Face. Les douze mondes comprennent EchoMail, EchoCalendar, EchoChat, EchoML, EchoForge, EchoBank, EchoCare, EchoForum, EchoTunes et EchoStay pour les domaines complets. EchoStay s’appuie sur des données InsideAirbnb. EchoForum repose sur un corpus public de 2,55 millions de commentaires. Microsoft décrit enfin une boucle d’évolution conjointe, dans laquelle le modèle, les tâches, l’environnement et les évaluateurs progressent après chaque série de tests.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés