Microsoft fait bondir son modèle 9B avec Echoverse
#chatgpt 3 min · 29 septembre 2026

Microsoft fait bondir son modèle 9B avec Echoverse

Par Arthur Dekeyser

En résumé

1

Microsoft a construit douze mondes synthétiques pour entraîner des agents utilisant des interfaces informatiques.

2

Le score du modèle 9B passe de 36,5 % à 67,1 % après entraînement sur ces mondes.

3

Microsoft publie quatre mondes avec leur code, leurs données et leurs évaluateurs ancrés dans l’état des applications.

💡

Le signal : Le modèle 9B entraîné sur les douze mondes Echoverse passe de 36,5 % à 67,1 %, à quatorze points de GPT-5.4.

NEWSLETTER BUSINESS & IA

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés

Microsoft construit douze mondes. Le groupe a présenté Echoverse, une infrastructure destinée à entraîner des agents capables d’utiliser des applications informatiques. Elle comprend douze mondes d’entraînement, dont dix mondes spécialisés par domaine et deux mondes consacrés à des capacités précises. Ces derniers travaillent notamment les sélecteurs de dates et les filtres imbriqués, sous plusieurs formes. Un modèle de 9 milliards de paramètres entraîné sur l’ensemble passe de 36,5 % à 67,1 % sur le score mesuré. Ce résultat le place à quatorze points de GPT-5.4. Microsoft décrit ces environnements dans son article de recherche publié le 29 septembre 2026.

Les mondes reproduisent les conséquences. Echoverse ne se limite pas à afficher des écrans. Chaque monde associe une application, un état de données, des actions, des tâches et un vérificateur. Une action peut modifier une base de données, affecter un autre utilisateur ou changer un écran ultérieur. Les environnements synthétiques permettent de réinitialiser rapidement l’état et d’évaluer le résultat depuis les données internes. Microsoft cite des usages fermés comme la messagerie, la banque, les dossiers de santé et les consoles techniques. Les versions publiques instables ne conviennent pas à un entraînement répété, car leurs pages, données et dates évoluent.

Microsoft mesure les actions réelles

La profondeur guide l’entraînement. Les mondes Echoverse cherchent à préserver cinq propriétés. Les contrôles, permissions et erreurs doivent suivre la logique du produit. L’état doit rester cohérent entre écrans et utilisateurs. Les choix initiaux doivent contraindre les étapes suivantes. La vérification doit porter sur l’état de l’application, plutôt que sur les pixels. Enfin, le flux de travail doit présenter une valeur métier. Les dix mondes de domaine couvrent la communication, la coordination, la création technique, les opérations, les dossiers réglementés, les transactions, les communautés, les médias et le voyage. EchoForum repose notamment sur un corpus public de 2,55 millions de commentaires.

Le vérificateur interroge la base. Chaque tâche reçoit une réponse générée par une requête SQL sur la base réelle. Une lecture est évaluée selon l’équivalence sémantique avec la valeur stockée. Une écriture est évaluée selon la différence entre l’état avant et l’état après. Une valeur de 287,62 dollars peut ainsi être validée comme 288 dollars pour une lecture, tandis qu’une fermeture de ticket exige la modification réelle de la ligne correspondante. Les tâches sont régénérées à partir des entités présentes dans l’application. Des analyseurs testent ensuite leur plausibilité, leur difficulté et leur exécution dans l’interface réelle.

Echoverse coévolue avec les modèles

La boucle corrige plusieurs couches. Le pipeline transforme des scénarios initiaux en spécifications, puis en applications construites avec un serveur FastAPI, une base SQLite et une interface React. Chaque affirmation vérifiable est testée dans l’environnement actif. Les corrections peuvent concerner la base, le serveur, l’interface, le texte de tâche ou le vérificateur. Les tâches qui réussissent deviennent des données d’entraînement supervisé après résolution par GPT-5.4. Microsoft indique que l’apprentissage par renforcement utilise ensuite le vérificateur comme récompense. Cette méthode améliore les performances sur des tâches conservées et apprend à l’agent à atteindre son objectif en moins d’étapes.

Quatre mondes sont publiés. Microsoft met à disposition quatre environnements avec leur code, leurs données et leurs évaluateurs ancrés dans l’état de l’application. Le dépôt Echoverse sur GitHub accompagne cette publication. Les jeux de données sont également accessibles sur Hugging Face. L’équipe présente Echoverse comme une boucle qui améliore simultanément le modèle, l’environnement, les tâches et les vérificateurs. Les résultats rapportés comparent des constructions profondes et superficielles d’un même site. Le modèle progresse sur les premières et régresse sur les secondes, selon l’expérience décrite par Microsoft.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs abonnés

À lire aussi