Microsoft ouvre Orchard pour tester ses agents IA à 69,7 %

Microsoft ouvre Orchard pour tester ses agents IA à 69,7 %

Par Arthur Dekeyser

En résumé

1

Microsoft publie Orchard, un cadre en code ouvert pour les agents IA.

2

Orchard-SWE atteint 69,7 % sur SWE-bench Verified avec environ 3 milliards de paramètres actifs.

3

Orchard entraîne des agents dans des systèmes comme Codex, OpenClaw et ZeroClaw.

💡

Le signal : Orchard-SWE atteint 69,7 % sur SWE-bench Verified avec environ 3 milliards de paramètres actifs.

NEWSLETTER BUSINESS & IA

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés

Microsoft publie Orchard le 18 septembre 2026 comme un cadre en code ouvert pour la recherche sur les agents IA. Son service central, Orchard Env, fournit des environnements réutilisables pour entraîner et évaluer ces systèmes. La même infrastructure prend en charge des agents de développement logiciel, de navigation web et d’assistance personnelle. Orchard peut aussi entraîner les agents directement dans des systèmes de déploiement comme Codex, OpenClaw et ZeroClaw. Microsoft publie avec le cadre trois recettes spécialisées, Orchard-SWE, Orchard-GUI et Orchard-Claw. L’entreprise met également à disposition les données d’entraînement et les méthodes d’évaluation utilisées pour ces modèles. Consulter l’annonce de Microsoft Research.

Le service repose sur Kubernetes et crée, gère puis supprime des milliers de composants isolés en parallèle. Orchard Env couvre la collecte de données, les déploiements d’apprentissage par renforcement et l’évaluation. Il prend en charge le codage, la navigation web et l’utilisation d’outils sans modifier l’environnement sous-jacent. Un proxy léger enregistre les appels du système de déploiement comme données d’entraînement. Chaque exécution se déroule dans son propre conteneur. Les chercheurs peuvent donc entraîner un agent dans le système où il sera déployé. Orchard prend notamment en charge Codex, OpenClaw et ZeroClaw, ainsi que plusieurs autres systèmes d’agents.

Orchard entraîne les agents dans leurs systèmes

Orchard-SWE atteint 69,7 % sur SWE-bench Verified avec environ 3 milliards de paramètres actifs. Son score de départ était de 61,4 %. La méthode atteint 69,1 % après Balanced Adaptive Rollout, puis 69,7 % avec des techniques de récompense dense. Un modèle de valeur de 4 milliards de paramètres fait progresser le résultat à 73 % en classant plusieurs solutions candidates. L’entraînement utilise 107 000 interactions issues de MiniMax-M2.5 et Qwen3.5-397B. Ces interactions couvrent de nombreux problèmes GitHub. Orchard-SWE repose sur Mini-SWE-Agent et apprend aussi à partir de portions productives d’essais incomplets. Microsoft le compare à des systèmes de pointe plus de dix fois plus grands.

Orchard-GUI utilise 4 milliards de paramètres pour naviguer sur le web. Son entraînement combine 400 démonstrations distillées et 2 200 tâches ouvertes. Le modèle atteint 74,1 % sur WebVoyager, 67,0 % sur Online-Mind2Web et 64,0 % sur DeepShop. Sa moyenne s’établit à 68,4 %. Orchard-Claw cible les tâches d’assistant personnel avec 200 tâches synthétiques. Sur Claw-Eval, il réussit 59,6 % des tâches avec trois tentatives possibles. Le taux monte à 73,9 % avec le système ZeroClaw. Dans le système Codex, l’entraînement Orchard fait progresser le taux de réussite de 18,6 % à 51,5 %.

Microsoft publie données et méthodes

Le dépôt Orchard est disponible sur GitHub, avec un jeu de données d’entraînement publié sur Hugging Face. Microsoft présente l’environnement réutilisable comme un moyen de générer des données, d’exécuter des déploiements d’apprentissage par renforcement et d’évaluer les modèles sans reconstruire l’infrastructure. Le projet conserve aussi les trajectoires produites pendant les entraînements. Vingt expériences antérieures alimentent déjà le modèle de valeur utilisé par Orchard-SWE. Microsoft indique que ces trajectoires peuvent devenir des actifs persistants pour les modèles suivants. L’entreprise prévoit également d’étudier des agents web entraînés avec davantage d’échelle et peu de données annotées.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs abonnés

À lire aussi