Orchard-SWE de Microsoft décroche 69,7 % sur SWE-bench

Orchard-SWE de Microsoft décroche 69,7 % sur SWE-bench

Par Arthur Dekeyser

En résumé

1

Microsoft Research présente Orchard comme un framework en code ouvert pour les agents IA.

2

Orchard-SWE atteint 69,7 % sur SWE-bench Verified avec environ 3 milliards de paramètres actifs.

3

Orchard Env réutilise des environnements Kubernetes pour entraîner et évaluer plusieurs types d’agents.

💡

Le signal : Orchard-SWE atteint 69,7 % sur SWE-bench Verified avec environ 3 milliards de paramètres actifs.

NEWSLETTER BUSINESS & IA

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés

Microsoft Research présente Orchard le 2 septembre 2026 comme un framework en code ouvert consacré à la recherche sur les agents IA. Son infrastructure centrale, Orchard Env, fournit un service d’environnements réutilisables pour entraîner et évaluer des agents dans plusieurs domaines. Le système couvre notamment le développement logiciel, la navigation web et les assistants personnels. Microsoft indique aussi qu’Orchard peut entraîner des agents directement dans des environnements de déploiement comme Codex, OpenClaw et ZeroClaw. Le projet publie son service d’environnement, ses méthodes d’entraînement, ses données et ses procédures d’évaluation. L’objectif affiché consiste à rendre la recherche agentique plus reproductible et moins dépendante d’infrastructures propriétaires.

Orchard Env mutualise l’infrastructure grâce à une base Kubernetes légère. Le service crée, gère et supprime des milliers de composants isolés en parallèle. Il prend en charge la collecte de données, les déploiements d’apprentissage par renforcement et l’évaluation des modèles. Orchard Env fonctionne avec plusieurs types de tâches et plusieurs systèmes d’agents, sans modification de l’environnement sous-jacent. Les équipes peuvent ainsi ajouter des références, des systèmes d’agents ou des algorithmes d’entraînement sans reconstruire toute l’infrastructure. Le framework utilise aussi un proxy léger pour enregistrer les appels de modèles effectués par un environnement réel. Chaque déploiement s’exécute dans son propre conteneur.

Orchard entraîne trois familles d’agents

Orchard-SWE atteint 69,7 % sur SWE-bench Verified, contre 61,4 % pour sa base initiale. Le résultat atteint 73 % avec une nouvelle sélection par modèle de valeur. Le système utilise environ 3 milliards de paramètres actifs et s’appuie sur Mini-SWE-Agent. Son entraînement a distillé 107 000 interactions issues de MiniMax-M2.5 et Qwen3.5-397B, sur des problèmes GitHub. Orchard-SWE exploite aussi des portions utiles de tentatives incomplètes, plutôt que de les écarter. Pour l’apprentissage par renforcement, Microsoft combine Balanced Adaptive Rollout, la distillation au fil des décisions et un modèle de récompense du processus. Un modèle de valeur de 4 milliards de paramètres classe ensuite plusieurs solutions candidates.

Orchard-GUI atteint 68,4 % en moyenne sur trois références de navigation web. Le modèle visuel-langagier utilise 4 milliards de paramètres, 400 démonstrations distillées et 2 200 tâches ouvertes. Il obtient 74,1 % sur WebVoyager, 67 % sur Online-Mind2Web et 64 % sur DeepShop. Orchard-Claw cible les tâches d’assistant personnel, comme les courriels, les calendriers et la recherche d’information. Entraîné sur 200 tâches synthétiques, il réussit 59,6 % des tâches de Claw-Eval avec trois tentatives maximum. Avec le système ZeroClaw, ce taux atteint 73,9 %. Dans l’environnement Codex, l’entraînement fait progresser le taux de réussite de 18,6 % à 51,5 %.

Microsoft publie les données et méthodes

Le dépôt Orchard rassemble l’environnement, les flux d’entraînement et les jeux de données associés. Microsoft Research publie ces ressources pour permettre à d’autres équipes de construire et d’étudier des agents en code ouvert. Le projet présente aussi la réutilisation des trajectoires comme une piste de travail. Les trajectoires produites pendant vingt expériences précédentes ont déjà servi à entraîner le modèle de valeur d’Orchard-SWE. Cette méthode conserve des expériences qui seraient habituellement supprimées après un entraînement. Orchard-GUI fournit également un exemple d’efficacité avec un volume limité de supervision manuelle. Le dépôt GitHub d’Orchard et le jeu de données publié sur Hugging Face donnent accès aux composants annoncés.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs abonnés

À lire aussi