OpenAI réduit de 90 % le coût des agents GPT-6
#copilot #ia-code 3 min · 23 septembre 2026

OpenAI réduit de 90 % le coût des agents GPT-6

Par Arthur Dekeyser

En résumé

1

OpenAI applique des remises allant jusqu’à 90 % sur les jetons d’entrée réutilisés.

2

Le tableau de bord mesure les taux de réussite et compare les jetons mis en cache.

3

Manus a fait passer son taux de cache d’environ 85 % à plus de 90 %.

💡

Le signal : OpenAI annonce jusqu’à 90 % de remise sur les jetons d’entrée mis en cache avec GPT-6.

NEWSLETTER BUSINESS & IA

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés

OpenAI améliore GPT-6. Le 22 septembre 2026, OpenAI a présenté une nouvelle gestion du cache pour la famille GPT-6. Elle vise les agents persistants qui travaillent plusieurs heures sur des tâches complexes. Ces agents peuvent notamment refactoriser des bases de code ou produire des documents et présentations documentés. Leurs applications enchaînent plusieurs requêtes API. Ces requêtes reprennent souvent les mêmes instructions, outils et éléments de contexte. OpenAI réutilise ce contexte partagé pour éviter de recalculer certaines données. Cette approche réduit les temps de réponse. Elle permet aussi des remises allant jusqu’à 90 % sur les jetons d’entrée mis en cache. OpenAI détaille cette évolution.

Le cache devient mesurable. Avec GPT-6, les préfixes partagés éligibles bénéficient d’une remise lorsqu’ils sont réutilisés dans une fenêtre de 30 minutes. OpenAI indique que ce système améliore les taux de réussite par défaut. Le nouveau tableau de bord du cache affiche la part des entrées servie depuis le cache. Il suit aussi les taux dans le temps. Un graphique compare les jetons mis en cache et ceux nécessitant un traitement nouveau. Les développeurs peuvent ainsi observer les baisses de performance après une modification applicative. OpenAI présente cet outil comme un moyen d’évaluer directement l’effet des changements sur le cache. Les agents persistants disposent donc d’un suivi plus précis de leurs requêtes API.

OpenAI outille le diagnostic du cache

Les erreurs deviennent analysables. OpenAI propose un outil de diagnostic pour examiner les défauts de réutilisation. Il compare une requête avec une réponse récente. Cette comparaison identifie les changements de modèle, d’outils, de réglages ou d’entrée. Un exemple fourni par OpenAI attribue un défaut à la modification des outils. Il estime alors 5 629 jetons réutilisables affectés. Le même volume apparaît parmi les jetons non servis depuis le cache. Cette mesure aide à évaluer la taille de l’impact observé. Les équipes peuvent ensuite rechercher une optimisation dans leur intégration. Le tableau de bord et le diagnostic sont accessibles depuis les outils de cache présentés par OpenAI dans son annonce.

Les contrôles gagnent en précision. Les développeurs peuvent choisir les préfixes à conserver grâce à des points d’ancrage explicites. OpenAI recommande aussi de stabiliser les définitions, schémas et ordres des outils. Les outils non nécessaires peuvent rester définis, puis être désactivés avec allowed_tools ou tool_choice. De nouvelles instructions peuvent être ajoutées vers la fin du contexte. Sur GPT-6, le niveau de raisonnement peut changer entre deux réponses sans casser le cache. Une mise à jour de configuration ajuste alors l’effort demandé. La préchauffe prépare enfin les instructions, outils ou documents de référence avant la première question. Le traitement quitte ainsi le temps d’attente de l’utilisateur.

Les utilisateurs mesurent des gains concrets

GitHub Copilot réduit le retraitement. Mario Rodriguez, directeur produit chez GitHub, affirme que le cache joue un rôle important dans les expériences de Copilot. Selon lui, la part des jetons nécessitant un traitement nouveau a diminué de plus de 50 %. Cette évolution concerne des milliards de requêtes adressées aux modèles OpenAI. Il compare ce niveau à la référence précédente de l’entreprise. GitHub associe également cette baisse à une pile d’inférence plus efficace. Rodriguez mentionne un temps plus court avant la première réponse pour les développeurs. OpenAI rapporte aussi les résultats d’autres utilisateurs. Manus est passé d’environ 85 % à plus de 90 % de réussite du cache en moins d’une semaine.

D’autres équipes réduisent leurs coûts. Arian Hanifi indique que le tableau de bord et le diagnostic ont amélioré les taux de cache de quelques points. Son équipe rapporte une baisse de coûts de 20 %. Elle reçoit également des alertes lorsque le cache se rompt de manière inattendue. Pour Strawberry Browser, Eugene Mikhantyev rapporte une hausse de 83 % à 91 % sur les évaluations. Les écritures de cache ont diminué d’environ deux tiers. Les coûts d’inférence ont baissé de 36 % avec la même charge. Ces résultats sont attribués à l’utilisation de points d’ancrage explicites. Les recommandations de configuration sont disponibles dans l’annonce d’OpenAI. Pour aller plus loin, consultez notre guide sur réduire ses coûts grâce à l’IA.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs abonnés

À lire aussi