# Après 700 requêtes, Michelin désactive l’Auto de Copilot

> Michelin désactive par défaut le mode Auto de GitHub Copilot après 700 requêtes, jugeant son routage variable et ses économies parfois insuffisantes.

Type : Actualité IA · Catégorie : Outils · Publié le 2026-09-22 · Signal IA - Order & Chaos · Secteur : Industrie
Source : https://www.orderchaos.eu/signal-ia/actu/apres-700-requetes-michelin-coupe-le-mode-auto-de-github-copilot
Tags : github copilot, développement, coûts, routage, michelin, claude, chatgpt, copilot

---

## En résumé

- Michelin a analysé environ 700 requêtes GitHub Copilot avant de désactiver le mode Auto par défaut.
- Le même prompt a coûté 0,23 crédit avec MAI-Flash et 3,24 crédits avec GPT-5.6 Terra.
- GitHub a ensuite ajouté les niveaux Efficiency, Balance et Intelligence au mode Auto.

**Le signal :** Michelin a observé jusqu’à 3,24 crédits pour un même prompt, contre 0,23 selon le modèle choisi.

**Michelin désactive** par défaut la sélection automatique du modèle dans GitHub [Copilot](/signal-ia/actu/github-lance-hydrafusion-67-pourcent-de-cout-en-moins). La décision intervient après une expérimentation portant sur environ 700 requêtes. Michelin a testé des demandes simples, des tâches vérifiables et des sessions de chat à sept tours. L’analyse a montré que le choix du modèle s’effectue côté serveur. Un classifieur attribue chaque requête selon quatre axes. Il évalue le raisonnement nécessaire, la quantité de code, le diagnostic ou débogage, et l’usage d’outils. Ces scores définissent une fourchette de modèles. GitHub Copilot semble ensuite sélectionner un modèle dans cette fourchette. Michelin détaille ses résultats dans [son retour d’expérience](https://blogit.michelin.io/copilot-auto-mode-off-by-default/).

**Le routage varie** selon le modèle finalement retenu. Pour un même prompt destiné à renommer une variable, le mode Auto a choisi MAI-Flash ou GPT-5.6 Terra. Le premier choix a coûté 0,23 crédit. Le second a coûté 3,24 crédits. Le routeur n’a jamais retenu de petit modèle lorsque le score de [raisonnement](/signal-ia/actu/atett-dirige-40-pourcent-de-ses-usages-ia-vers-des-modeles-ouverts) atteignait 0,55. Il l’a fait 41 fois sur 46 lorsque le score restait inférieur à 0,3. Entre ces seuils, le modèle a changé dans 14 cas sur 19. Michelin observe donc une sélection sensible aux scores, mais variable d’une répétition à l’autre pour certaines requêtes.

## Les scores ignorent le contexte

**Le contexte pèse peu** dans le classement observé par Michelin. Sur 12 tâches, les scores sont restés identiques dans un dossier vide et dans un espace de travail contenant des fichiers d’instructions et des serveurs MCP. Le modèle a pourtant changé dans trois cas. Michelin a aussi testé des formulations destinées à modifier le classement. L’ajout de « Complex architecture question » a peu fait évoluer les scores. La formulation inverse, présentant la demande comme simple, a produit sept déclassements sur 12 tâches. Un remplissage neutre a davantage réduit le score de raisonnement. Celui-ci est passé successivement à 0,29, 0,26, 0,24 et 0,21.

**Les sessions coûtent** davantage lorsque leur première question oriente le modèle vers une gamme supérieure. Michelin a posé les mêmes sept questions dans deux ordres. Une question difficile en ouverture a conduit à [Claude](/signal-ia/actu/diogo-almeida-lance-jev-lia-qui-decide-sans-rediger) Sonnet ou GPT Sol, pour un coût moyen de 13,7 crédits. Une question simple en ouverture a souvent conduit à GPT Luna, pour un coût moyen de 0,78 crédit. Lorsqu’un modèle change pendant la session, le cache est vidé. Le contexte doit alors être renvoyé. GitHub promet une remise de 10 % avec le mode Auto. Michelin a mesuré 11,9 % d’économie moyenne pour Claude Sonnet 5 sur six requêtes identiques.

## Michelin compare trois stratégies

**Le modèle manuel** apparaît préférable pour certaines tâches unitaires testées par Michelin. L’expérimentation considère GPT Luna comme un choix défendable pour les tâches quotidiennes des développeurs. Selon Michelin, ce modèle produit les mêmes résultats que le mode Auto, avec un coût inférieur de 6 à 18 fois. Cette conclusion concerne un catalogue de 11 modèles autorisés, une version de l’interface en ligne de commande et un abonnement donnés. Michelin précise également que Luna était absent au début de l’expérience. Le constructeur ne présente pas son travail comme un benchmark général. GitHub a fait évoluer son offre pendant la période étudiée, ce qui limite la comparaison dans le temps.

**HydraFusion orchestre** plusieurs modèles au lieu de sélectionner une seule réponse. Cette option expérimentale génère un plan, puis attribue chaque phase à un modèle. Sur les tâches simples, elle a presque toujours choisi GPT Sol. Sur les tâches en cascade, Luna ébauchait le travail, tandis que GPT Sol jugeait et corrigeait. La correction représentait 72 à 90 % du coût de la session. Dans deux cas, HydraFusion a utilisé Claude Opus 5 pour l’ébauche et la révision. Ces sessions ont coûté 16 et 28 crédits, contre 3 crédits avec le mode Auto. Michelin décrit donc HydraFusion comme un mécanisme de qualité coûteux. GitHub a ensuite ajouté les niveaux [Efficiency, Balance et Intelligence](https://github.blog/changelog/2026-09-14-configure-cost-and-quality-in-copilot-auto-model-selection/?ref=blogit.michelin.io).
