En résumé
GitHub propose HydraFusion comme préversion de recherche dans Copilot CLI.
Le système choisit entre trois workflows selon chaque tâche de programmation.
TerminalBench 2.1 affiche 67 % de coût estimé en moins et 4,9 points de qualité en plus.
Le signal : HydraFusion réduit le coût estimé de 67 % sur TerminalBench 2.1, avec 4,9 points de qualité supplémentaires.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
GitHub lance HydraFusion comme préversion de recherche dans Copilot CLI, le 7 septembre 2026. Le système ne traite plus le choix du modèle comme un réglage unique. Il construit plutôt un plan d’exécution pour chaque demande de programmation. Un modèle peut rédiger une solution, tandis qu’un second la critique. Une barrière de qualité peut aussi déclencher une escalade vers un modèle plus puissant. Les modèles proviennent de plusieurs fournisseurs. Le développeur sélectionne HydraFusion une seule fois, comme n’importe quel autre modèle. La fonctionnalité est disponible pour tous les forfaits GitHub Copilot, mais uniquement dans Copilot CLI. Elle ne propose ni poids ouverts ni voie d’hébergement autonome.
L’accès passe par trois commandes dans Copilot CLI. L’utilisateur doit exécuter /update, puis activer /experimental on, avant d’utiliser /model pour sélectionner « HydraFusion (Research Preview) ». La facturation repose sur les jetons consommés par les modèles appelés pendant le workflow. Chaque modèle applique son tarif standard. GitHub positionne HydraFusion après la sélection automatique de modèle, lancée plus tôt en 2026. Cette sélection associait déjà une tâche à un modèle jugé adapté. HydraFusion étend cette logique au choix du workflow. Il examine des signaux liés au raisonnement, à la génération de code, au débogage et à l’utilisation d’outils.
Le mode Single confie directement la tâche à un modèle sélectionné. Il privilégie la vitesse en limitant l’exécution à un seul appel. Le mode Cascade demande d’abord à un modèle efficace de produire une solution. Une barrière de qualité accepte cette réponse ou l’escalade vers un modèle plus puissant. Le mode Critique fait rédiger une première réponse, puis demande à un modèle indépendant d’une autre famille de la relire. Le modèle rédacteur révise ensuite une seule fois. Ce mécanisme reprend le principe de Rubber Duck. GitHub présente ces trois modes comme des compromis distincts entre qualité et coût. HydraFusion sélectionne actuellement l’un d’eux pour chaque demande.
Le runtime applique cinq garde-fous pour les tâches sur dépôt. Il comptabilise chaque étape, notamment la rédaction, la critique, la révision, l’escalade, la nouvelle tentative et le repli. Chaque étape dispose d’un délai maximal et d’une annulation explicite. Les critiques s’exécutent dans des contextes sans outils et ne peuvent pas modifier le dépôt. Une annulation ou un échec de validation empêche l’application d’un correctif. Avant l’exécution, le système vérifie les liaisons de modèles, les comportements de repli et leur disponibilité. En interne, il journalise le rôle, le résultat, le coût, la latence et les diagnostics de chaque étape.
Les évaluations portent sur trois tests de programmation agentique. L’équipe GitHub a utilisé Claude Opus 5 et GPT-5.6 Sol comme références, avec un niveau de raisonnement moyen pour tous les modèles. Les résultats sont comparés à Opus 5. Sur TerminalBench 2.1, le coût estimé baisse de 67 %, tandis que la qualité vérifiée progresse de 4,9 points. Sur DeepSWE, le coût diminue de 36 %, avec une qualité inférieure de 1,5 point. Sur CheckpointBench, le coût baisse de 65 %, pour une qualité inférieure de 0,1 point. Ce dernier ensemble interne provient de sessions Copilot réelles et s’appuie sur des validations publiques immuables.
HydraFusion reste ciblé sur Copilot CLI et la préversion de recherche. Son principe consiste à choisir une séquence de modèles, plutôt qu’un modèle unique, pour chaque tâche. Les trois configurations disponibles sont Single, Cascade et Critique. Les résultats publiés montrent un avantage simultané de coût estimé et de qualité sur TerminalBench 2.1. Ils montrent aussi une légère baisse de qualité sur DeepSWE et CheckpointBench, avec des réductions de coût estimé de 36 % et 65 %. Les utilisateurs peuvent consulter la présentation publiée par GitHub, la documentation de Copilot CLI et la discussion communautaire. Pour aller plus loin, consultez notre guide sur réduire ses coûts grâce à l’IA.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés