Microsoft ouvre Orchard, à 69,7 % sur SWE-bench

Microsoft ouvre Orchard, à 69,7 % sur SWE-bench

Par Arthur Dekeyser

En résumé

1

Microsoft Research publie Orchard, un cadre ouvert pour entraîner et évaluer des agents IA.

2

Orchard-SWE atteint 69,7 % sur SWE-bench Verified avec environ 3 milliards de paramètres actifs.

3

Orchard entraîne des agents directement dans des environnements comme Codex, OpenClaw et ZeroClaw.

💡

Le signal : Orchard-SWE atteint 69,7 % sur SWE-bench Verified avec environ 3 milliards de paramètres actifs.

NEWSLETTER BUSINESS & IA

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés

Microsoft Research publie Orchard, un cadre ouvert pour la recherche sur les agents IA évolutifs et moins coûteux. Le projet repose sur Orchard Env, un service d’environnements réutilisables destiné à entraîner et évaluer des agents. Cette infrastructure prend en charge plusieurs domaines, dont le développement logiciel, la navigation web et l’assistance personnelle. Elle fonctionne aussi avec des environnements de déploiement comme Codex, OpenClaw et ZeroClaw. Microsoft Research publie également les modèles, les flux d’entraînement, les données et les méthodes d’évaluation associés. Orchard-SWE atteint 69,7 % sur SWE-bench Verified, avec environ 3 milliards de paramètres actifs. Le score monte à 73 % avec un reclassement par modèle de valeur.

Les infrastructures propriétaires constituent le problème auquel Orchard veut répondre. Les agents avancés nécessitent souvent des environnements isolés, des chaînes d’entraînement et des jeux de données fermés. Ces composants rendent les expériences difficiles à reproduire pour les chercheurs. Orchard Env sépare l’environnement d’exécution du cadre d’entraînement. Sa base Kubernetes crée, gère et supprime des milliers de composants isolés en parallèle. Le service couvre la collecte de données, les déploiements d’apprentissage par renforcement et l’évaluation. Il prend aussi en charge le codage, la navigation web et l’utilisation d’outils. Les équipes peuvent ainsi ajouter des références, des systèmes d’agents ou des algorithmes sans reconstruire toute l’infrastructure.

Orchard Env mutualise les environnements

Les vrais environnements de déploiement occupent une place centrale dans Orchard. Les agents modernes utilisent des systèmes capables de gérer le raisonnement en plusieurs tours, les outils et les connexions externes. Parmi les systèmes cités figurent Claude Code, Codex et OpenClaw. Les outils d’entraînement ouverts travaillent souvent avec une version simplifiée de ces systèmes. Orchard utilise un proxy léger qui enregistre les appels du système comme données d’entraînement. Chaque déploiement s’exécute dans son propre conteneur. L’agent peut donc être entraîné directement dans l’environnement prévu pour son déploiement. Le cadre prend notamment en charge OpenClaw, Codex et ZeroClaw, ainsi que plusieurs environnements simultanément.

Orchard-SWE combine plusieurs techniques pour entraîner un agent de développement logiciel. Les chercheurs ont distillé 107 000 interactions issues de MiniMax-M2.5 et Qwen3.5-397B. Ces interactions couvrent de nombreux problèmes GitHub. Le système apprend aussi à partir des parties utiles de tentatives incomplètes. Son score passe de 61,4 % à 69,1 % avec Balanced Adaptive Rollout, puis à 69,7 % grâce aux récompenses denses. Un modèle de valeur compact de 4 milliards de paramètres reclasse ensuite plusieurs solutions candidates. Orchard-GUI entraîne un modèle vision-langage de 4 milliards de paramètres avec 400 démonstrations et 2 200 tâches ouvertes. Il obtient une moyenne de 68,4 % sur trois références web.

Trois recettes ciblent des tâches réelles

Orchard-Claw vise les tâches d’assistance personnelle, comme les courriels, les calendriers et la recherche d’informations. Le modèle a été entraîné avec 200 tâches synthétiques. Sur Claw-Eval, il réussit 59,6 % des tâches avec trois tentatives maximum. Ce taux atteint 73,9 % avec le système d’agent ZeroClaw. L’entraînement utilise ReACT, ZeroClaw, OpenClaw et Codex, plutôt qu’une seule boucle simplifiée. Avec l’environnement Codex, le taux de réussite passe de 18,6 % pour le modèle non entraîné à 51,5 % après l’entraînement Orchard. Microsoft Research publie la pile complète, incluant le service d’environnement, les chaînes d’entraînement et les jeux de données, via GitHub et Hugging Face.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs abonnés

À lire aussi