En résumé
DeepSeek V3.2 adopte une architecture hybride pour alterner discussion générale et raisonnement.
Le mécanisme DeepSeek Sparse Attention réduit sélectivement le contexte traité par le modèle.
DeepSeek V3 et R1 utilisent l’attention latente multi-tête pour réduire la mémoire du cache KV.
Le signal : DeepSeek V3.2 associe l’attention parcimonieuse DSA à un modèle hybride combinant discussion générale et raisonnement.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
DeepSeek V3.2 est le nouveau modèle phare à poids ouverts présenté par l’équipe DeepSeek. Sebastian Raschka l’analyse dans un article publié le 3 décembre 2025, mis à jour le 1er janvier 2026. Le modèle affiche des performances annoncées au niveau de GPT-5 et Gemini 3.0 Pro dans la comparaison citée par l’auteur. Cette publication examine son évolution depuis DeepSeek V3, lancé en décembre 2024. Elle détaille aussi l’architecture, l’attention parcimonieuse et les méthodes d’apprentissage par renforcement. Le modèle V3.2 arrive après plusieurs versions intermédiaires, dont V3.1 et V3.2-Exp. L’analyse complète est disponible dans l’article technique de Sebastian Raschka.
La chronologie DeepSeek V3 n’a pas immédiatement rencontré le succès lors de son lancement en décembre 2024. DeepSeek R1, construit sur la même architecture, a ensuite renforcé la visibilité de l’écosystème. R1 a utilisé V3 comme modèle de base pour développer des capacités de raisonnement. DeepSeek a aussi publié V3.1 et V3.2-Exp avant V3.2. L’auteur relie V3.2-Exp à la préparation de l’infrastructure d’inférence et de déploiement. Cette version expérimentale introduisait déjà une attention parcimonieuse nécessitant du code personnalisé. L’équipe a également traversé une période de transition entre des puces NVIDIA et Huawei, avant de revenir, selon l’auteur, à des puces NVIDIA.
Le modèle hybride DeepSeek V3 était un modèle de base, tandis que DeepSeek R1 était un modèle de raisonnement dédié. V3.1 a ensuite réuni la discussion générale et le raisonnement dans un même modèle. Les utilisateurs peuvent changer de mode grâce au modèle de conversation. Cette approche diffère d’un modèle dédié, conçu pour un seul usage principal. Qwen3 avait auparavant adopté une logique hybride, avec un basculement activé par des balises dans le tokenizer. Certaines équipes ont ensuite publié séparément des modèles de discussion et de raisonnement. Selon l’analyse, DeepSeek semble donc être passé d’un modèle dédié avec R1 à une architecture hybride avec V3.1 et V3.2.
L’architecture V3 DeepSeek V3 repose sur deux éléments techniques principaux, le mélange d’experts et l’attention latente multi-tête. Cette dernière, déjà introduite avec DeepSeek V2, réduit la mémoire nécessaire au cache clé-valeur. Les tenseurs de clés et de valeurs sont compressés dans un espace de dimension inférieure avant leur stockage. Ils sont ensuite reprojetés vers leur taille initiale pendant l’inférence. Cette opération ajoute une multiplication matricielle supplémentaire, mais diminue l’usage mémoire. Les requêtes sont également compressées pendant l’entraînement, sans l’être pendant l’inférence. DeepSeek R1 conserve cette architecture, mais applique une recette d’entraînement différente, centrée sur le raisonnement.
L’apprentissage renforcé DeepSeek R1 a utilisé l’apprentissage par renforcement avec récompenses vérifiables. Cette méthode permet au modèle d’apprendre à partir de réponses contrôlables symboliquement ou par programme. Les mathématiques et le code constituent les exemples cités. L’algorithme GRPO simplifie l’algorithme PPO utilisé dans certains dispositifs d’alignement. GRPO supprime le modèle critique, puis l’apprentissage avec récompenses vérifiables retire aussi le modèle de récompense. Des outils symboliques, comme des calculatrices ou des compilateurs, fournissent alors les récompenses vérifiables. La mise à niveau R1-0528 a conservé l’architecture de V3 et R1. DeepSeek l’a décrite comme une mise à jour mineure, liée notamment à l’entraînement complémentaire.
L’attention DSA DeepSeek V3.2-Exp a été entraîné à partir de DeepSeek V3.1-Terminus. Cette version de base correspondait à une amélioration limitée du point de contrôle V3.1. L’ajout principal est DeepSeek Sparse Attention, ou DSA. Ce mécanisme combine un indexeur rapide et un sélecteur de tokens. Son objectif consiste à réduire sélectivement le contexte traité par le modèle. Le rapport technique décrit ainsi des gains d’efficacité pendant l’entraînement et l’inférence, particulièrement pour les contextes longs. V3.2-Exp n’a pas dominé les évaluations lors de sa sortie. L’auteur l’interprète comme une version expérimentale destinée à préparer les outils nécessaires au déploiement de DeepSeek V3.2. Le rapport technique de DeepSeek documente cette évolution.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés