DeepSeek V4.1-Flash divise par 437 la mémoire des agents IA
#deepseek #agents-ia 2 min · 10 septembre 2026

DeepSeek V4.1-Flash divise par 437 la mémoire des agents IA

Par Arthur Dekeyser

En résumé

1

DeepSeek V4.1-Flash traite des contextes pouvant atteindre un million de tokens.

2

Le modèle divise par 437 la taille globale du cache KV par token face à DeepSeek-V1.

3

DeepSeek a entraîné V4.1-Flash sur 45 000 milliards de tokens de textes et d’images.

💡

Le signal : DeepSeek V4.1-Flash réduit le cache KV par token d’un facteur 437 face à DeepSeek-V1.

NEWSLETTER BUSINESS & IA

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés

DeepSeek lance V4.1-Flash, son nouveau modèle d’intelligence artificielle, le 10 septembre 2026. Le modèle réduit les coûts d’exploitation liés au traitement des textes longs en diminuant la taille de son tampon mémoire. Il divise aussi par deux la puissance de calcul nécessaire à l’entrée des données. V4.1-Flash compte 552 milliards de paramètres et traite des contextes allant jusqu’à un million de tokens. DeepSeek présente donc une architecture conçue pour les usages nécessitant une mémoire importante. La présentation officielle du modèle est disponible sur Hugging Face, tandis que le rapport technique détaille ses caractéristiques.

Le cache diminue fortement par rapport aux versions précédentes. La taille globale du cache KV par token est 437 fois plus faible que celle de DeepSeek-V1. Ce cache conserve des informations nécessaires au traitement progressif d’un contexte long. DeepSeek affirme que le tampon placé dans la mémoire rapide des processeurs graphiques utilise désormais environ un quart de l’espace occupé par DeepSeek-V4-Flash. Cette réduction vise directement les coûts d’exploitation des agents traitant de longues séquences. Elle accompagne la capacité annoncée à gérer jusqu’à un million de tokens. Le modèle V4-Flash avait déjà reçu la mise à jour 0731 à la fin juillet.

DeepSeek réduit les besoins mémoire

Les données structurent aussi l’entraînement de V4.1-Flash. DeepSeek indique avoir utilisé un ensemble de 45 000 milliards de tokens, couvrant des textes et des images. Selon l’entreprise, les principaux gains ne proviennent pas de nouveaux algorithmes. Ils résultent plutôt de données plus nombreuses et mieux contrôlées, ainsi que de tâches et d’environnements d’entraînement renforcés. Cette explication attribue donc la progression annoncée à la composition du processus d’apprentissage. Le modèle combine cette base d’entraînement avec 552 milliards de paramètres. Ces chiffres décrivent une infrastructure destinée à absorber des volumes importants de données et des contextes pouvant atteindre un million de tokens.

Le calendrier financier de DeepSeek a également évolué. En juin, l’entreprise a levé environ 7,4 milliards de dollars lors de sa première levée de fonds externe. Cette opération intervient avant la sortie de V4.1-Flash, annoncée le 10 septembre 2026. DeepSeek avait aussi actualisé V4-Flash avec la version 0731 à la fin juillet. Le nouveau modèle s’inscrit donc dans une séquence de mises à jour rapprochées. Un article de Reuters rapporte par ailleurs l’implication de CITIC Securities dans le dossier boursier national de DeepSeek.

DeepSeek maintient un écart annoncé

Les limites persistent selon DeepSeek pour les agents mobilisés sur des tâches scientifiques exigeantes. L’entreprise reconnaît qu’un écart net demeure face aux modèles de très grande taille dans ce type de travail. Cette réserve accompagne les gains annoncés sur la mémoire, le calcul d’entrée et les longs contextes. V4.1-Flash apporte donc surtout des indicateurs précis sur l’efficacité matérielle. Son cache KV par token est réduit d’un facteur 437 face à DeepSeek-V1. Son tampon en mémoire rapide représenterait environ un quart de celui de DeepSeek-V4-Flash, selon DeepSeek. Ces éléments positionnent le modèle sur la maîtrise des ressources plutôt que sur une promesse générale de supériorité.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs abonnés

À lire aussi