# Avec Echoverse, Microsoft double presque le score d’un agent IA

> Microsoft a créé douze mondes synthétiques pour entraîner les agents à utiliser des interfaces complexes, avec un modèle 9B passant de 36,5 % à 67,1 %.

Type : Actualité IA · Catégorie : Outils · Publié le 2026-08-18 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/microsoft-fait-bondir-un-modele-de-365-pourcent-a-671-pourcent
Tags : agents, entraînement, interfaces, simulation, modèles, chatgpt

---

## En résumé

- Microsoft a construit douze mondes d’entraînement pour les agents utilisant des interfaces informatiques.
- Le score d’un modèle 9B passe de 36,5 % à 67,1 % après entraînement sur ces mondes.
- Echoverse publie quatre environnements avec leur code, leurs données et leurs vérificateurs.

**Le signal :** Echoverse fait passer un modèle 9B de 36,5 % à 67,1 % grâce à douze environnements synthétiques vérifiés sur leur état réel.

**Microsoft publie Echoverse** le 18 août 2026 pour entraîner des [agents](/signal-ia/actu/claude-mythos-franchit-un-cap-cyber-deepseek-v4-riposte) capables d’utiliser des applications informatiques complexes. Le projet rassemble douze mondes d’entraînement, dont dix environnements métiers et deux mondes dédiés à des capacités précises. Un modèle de 9 milliards de paramètres entraîné sur les douze mondes fait presque doubler son score. Il passe de 36,5 % à 67,1 %. Ce résultat le place à quatorze points de GPT-5.4, selon Microsoft Research. La publication présente aussi quatre mondes avec leur code, leurs données et leurs évaluateurs vérifiés. La [présentation originale de Microsoft](https://www.microsoft.com/en-us/research/blog/echoverse-deep-evolving-environments-for-computer-use-agents/) détaille cette approche.

**Les mondes reproduisent** des applications avec un état persistant, des données réalistes et des conséquences réelles pour chaque action. Une capture d’écran montre une interface, mais elle ne révèle pas toujours l’effet d’un clic sur une base de données. Echoverse reconstruit donc des systèmes synthétiques contrôlés, réinitialisables et évaluables depuis leurs données internes. Les applications simulées couvrent notamment la messagerie, les calendriers, les conversations, la banque, les dossiers de santé, les outils techniques, les forums, la musique et les voyages. Les workflows conservent les permissions, les dépendances et les historiques. Une réservation EchoStay peut ainsi modifier plusieurs écrans, utilisateurs et étapes du processus.

## Echoverse cible les faiblesses récurrentes

**Les douze environnements** combinent deux formats. Les dix mondes de domaine préservent la profondeur des workflows métiers. Les deux mondes de capacité isolent une interaction difficile et la déclinent sous plusieurs formes. Microsoft cite notamment les sélecteurs de dates et les filtres imbriqués. L’entraînement sur ces contrôles variés aide le modèle à les utiliser dans des domaines absents de ses données d’entraînement. L’équipe compare aussi des versions superficielles et profondes des mêmes sites. Le modèle régresse avec les versions superficielles, mais progresse avec les versions profondes. Ces observations soutiennent l’importance de la fidélité comportementale, au-delà du simple nombre de pages.

**La vérification repose** sur l’état de la base de données, plutôt que sur l’apparence des pixels. Chaque tâche reçoit une réponse issue d’une requête SQL exécutée lors de sa génération. Une lecture est évaluée par équivalence sémantique. Une écriture est évaluée par la différence observée avant et après l’action. Une tâche qui affirme fermer un ticket échoue si la ligne correspondante ne change pas. Echoverse utilise ensuite ce vérificateur comme récompense pour l’apprentissage par renforcement. Microsoft indique que cette méthode améliore les performances sur des tâches non vues et réduit le nombre d’étapes nécessaires. Le [rapport technique](https://www.microsoft.com/en-us/research/publication/echoverse-deep-evolving-environments-for-[training](/signal-ia/actu/scenesmith-du-mit-lentrainement-robotique-redefini-1784714716230)-computer-use-agents-at-scale/) décrit le dispositif.

**La boucle améliore** simultanément le modèle, le monde simulé, les tâches et les vérificateurs. Le pipeline génère une application avec un backend FastAPI, une base SQLite et une interface React. Il teste ensuite des affirmations concernant les routes, l’état et les comportements. Les blocages doivent être corrigés avant la validation du monde. Les tâches sont regénérées depuis les données présentes dans l’application. Des analyseurs vérifient alors la réalité des entités, la plausibilité des objectifs et leur faisabilité dans l’interface. Chaque échec est attribué à une couche précise, comme la base, le backend, le frontend, le texte de tâche ou le vérificateur. Microsoft publie le code sur [GitHub](https://github.com/microsoft/Echoverse).
