# Microsoft ouvre Orchard, son cadre ouvert pour les agents IA

> Microsoft publie Orchard, un cadre ouvert qui atteint 69,7 % sur SWE-bench Verified avec environ 3 milliards de paramètres actifs.

Type : Actualité IA · Catégorie : Outils · Publié le 2026-09-10 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/microsoft-ouvre-orchard-son-cadre-dagents-ia-a-697-pourcent
Tags : agents, code ouvert, entraînement, modèles, microsoft, claude, agents-ia, benchmark

---

## En résumé

- Microsoft publie Orchard comme cadre ouvert pour entraîner et évaluer des agents.
- Orchard-SWE atteint 69,7 % sur SWE-bench Verified avec environ 3 milliards de paramètres actifs.
- Orchard-GUI et Orchard-Claw obtiennent respectivement 68,4 % et 59,6 % sur leurs évaluations.

**Le signal :** Orchard-SWE atteint 69,7 % sur SWE-bench Verified avec environ 3 milliards de paramètres actifs.

**Microsoft publie Orchard.** Microsoft Research présente Orchard comme un cadre ouvert destiné à la recherche sur les agents IA évolutifs et économiques. Son composant central, Orchard Env, fournit un service d’environnements réutilisables pour entraîner et évaluer des agents. L’infrastructure repose sur Kubernetes et crée, gère ou supprime des milliers de composants isolés en parallèle. Elle couvre la collecte de données, les phases d’apprentissage par renforcement et l’évaluation. Microsoft publie aussi trois recettes spécialisées, Orchard-SWE, Orchard-GUI et Orchard-Claw. Le projet comprend leurs données d’[entraînement](/signal-ia/actu/orchard-swe-atteint-697-pourcent-sur-swe-bench-verified) et leurs méthodes d’évaluation. Le [dépôt Orchard sur GitHub](https://github.com/microsoft/Orchard) rassemble ces composants ouverts.

**Un service mutualise les environnements.** Orchard Env sépare l’environnement d’exécution du cadre d’entraînement utilisé. Le même service prend en charge des agents de programmation, de navigation web et d’assistance personnelle. Il fonctionne aussi avec plusieurs systèmes d’agents et plusieurs étapes du cycle d’apprentissage. Un proxy léger enregistre les appels du modèle produits par le système utilisé. Chaque déploiement s’exécute ensuite dans son propre conteneur. Cette méthode permet un entraînement directement dans des systèmes comme Codex, OpenClaw et ZeroClaw. [Microsoft](/signal-ia/actu/microsoft-muscle-son-offensive-pour-dominer-lia-dentreprise) cite aussi Claude Code comme exemple de système d’agent sophistiqué. Les chercheurs peuvent ainsi réutiliser les environnements, les pipelines de données et les évaluations entre plusieurs tâches.

## Orchard-SWE progresse sur SWE-bench

**Orchard-SWE atteint 69,7 %.** Cette recette utilise Mini-SWE-Agent pour résoudre des problèmes dans de véritables bases de code. Elle a été entraînée avec 107 000 interactions distillées depuis MiniMax-M2.5 et Qwen3.5-397B. Le modèle part d’un résultat de 61,4 % sur SWE-bench Verified. Balanced Adaptive Rollout le porte à 69,1 %. Les techniques de récompense dense conduisent ensuite à 69,7 %. Orchard-SWE utilise environ 3 milliards de paramètres actifs. Un modèle de valeur de 4 milliards de paramètres, entraîné sur des trajectoires issues de 20 expériences, reclasse les solutions candidates. Cette étape porte le résultat à 73 %. Microsoft rapproche ce score de systèmes plus de dix fois plus grands.

**Orchard-GUI réduit les données.** Cette recette entraîne un modèle vision-langage de 4 milliards de paramètres pour la navigation web. Elle utilise 400 démonstrations distillées et 2 200 tâches ouvertes. Le modèle obtient 74,1 % sur WebVoyager, 67,0 % sur Online-Mind2Web et 64,0 % sur DeepShop. Sa moyenne atteint 68,4 %. Microsoft présente ce résultat comme l’un des meilleurs obtenus par un agent graphique ouvert. Orchard-Claw cible les tâches d’assistance personnelle, avec 200 tâches synthétiques. Sur Claw-Eval, il réussit 59,6 % des tâches en trois essais maximum. Avec le système ZeroClaw, ce taux atteint 73,9 %. Le [jeu de données Orchard sur Hugging Face](https://huggingface.co/datasets/microsoft/Orchard) accompagne ces travaux.

## Les agents progressent dans leurs harnais

**Le déploiement influence les résultats.** Orchard-Claw a été entraîné avec ReACT, ZeroClaw, OpenClaw et Codex. Dans le harnais Codex, son taux de réussite passe de 18,6 % sans entraînement à 51,5 % après l’entraînement Orchard. Cette comparaison concerne le même agent dans un système de déploiement réel. Orchard permet également d’enregistrer les appels effectués par ces harnais pendant chaque trajectoire. Les données produites servent ensuite à l’entraînement. Microsoft présente cette compatibilité comme une réponse à l’écart entre une boucle d’entraînement simplifiée et l’environnement réellement utilisé. Le cadre doit ainsi gérer plusieurs tours de raisonnement, l’usage d’outils et les connexions à des systèmes externes.

**Microsoft ouvre la pile complète.** Orchard réunit l’environnement [Kubernetes](/signal-ia/actu/orchard-de-microsoft-atteint-697-pourcent-sur-swe-bench), les recettes d’entraînement, les jeux de données et les méthodes d’évaluation. Microsoft indique que les équipes peuvent ajouter des références, des systèmes d’agents ou des algorithmes sans reconstruire l’infrastructure sous-jacente. Les trajectoires produites pendant l’apprentissage par renforcement peuvent aussi alimenter des modèles de valeur. Dans Orchard-SWE, 20 expériences précédentes servent déjà à entraîner un modèle de valeur compact. Cette approche conserve des trajectoires qui seraient normalement écartées. Microsoft Research présente cette réutilisation comme une direction pour accumuler l’expérience des agents. Les travaux sont documentés dans l’[article de Microsoft Research](https://www.microsoft.com/en-us/research/blog/orchard-an-open-framework-for-scalable-agentic-ai/).
