En résumé
DeepSeek a publié V4.1 Flash le 10 septembre 2026.
Le modèle atteint 88,1 sur CyberGym, contre 83,1 % pour Claude Mythos Preview.
CyberGym mesure la reproduction de failles mémoire connues dans du code C et C++.
Le signal : DeepSeek V4.1 Flash atteint 88,1 sur CyberGym, contre 83,1 % pour Claude Mythos Preview.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
Publication récente. DeepSeek a publié V4.1 Flash le 10 septembre 2026. En septembre 2026, le modèle atteint un score de 88,1 sur CyberGym. DeepSeek affirme ainsi que V4.1 Flash est meilleur que Claude Mythos en cybersécurité. Cette comparaison s’appuie sur des résultats attribués à DeepSeek et Anthropic. L’écart porte sur une évaluation précise, plutôt que sur une mesure générale de toutes les capacités de cybersécurité. L’annonce place donc V4.1 Flash face à Claude Mythos Preview, présenté avec un résultat antérieur. Le sujet concerne directement l’évaluation de modèles capables de reproduire certaines failles dans du code. Lire l’article source.
Un écart mesuré. Claude Mythos Preview avait atteint 83,1 % sur CyberGym en avril 2026, selon Anthropic. Le score attribué à V4.1 Flash atteint 88,1 en septembre 2026, selon DeepSeek. La comparaison oppose donc deux résultats obtenus à des dates différentes et attribués à leurs éditeurs respectifs. CyberGym mesure la reproduction de failles mémoire connues dans du code C et C++. Ce périmètre décrit une capacité ciblée, liée à des vulnérabilités déjà identifiées. L’article rappelle toutefois qu’un score plus haut ne signifie pas nécessairement un modèle plus fort. La performance observée doit donc être lue comme un résultat sur CyberGym, et non comme un classement universel des modèles.
Une architecture imposante. V4.1 Flash compte 552 milliards de paramètres, selon DeepSeek. Parmi eux, 8 milliards sont actifs en lecture et 16 milliards sont actifs en génération. Ces chiffres décrivent la taille annoncée du modèle et la part activée selon l’opération considérée. Ils ne constituent pas, à eux seuls, une mesure de performance en cybersécurité. Le résultat de 88,1 concerne CyberGym, tandis que les paramètres décrivent l’architecture de V4.1 Flash. Cette distinction sépare la composition du modèle de son résultat sur une évaluation donnée. Elle permet aussi de replacer l’annonce dans deux dimensions distinctes : la capacité revendiquée sur un test et la structure technique présentée par DeepSeek.
Un autre résultat apparaît. V4.1 Flash obtient moins de la moitié du score de GPT-5.6 Sol sur ExploitGym, selon l’article. ExploitGym constitue donc une autre évaluation que CyberGym. Le résultat sur ExploitGym ne permet pas de déduire le score exact de V4.1 Flash, ni celui de GPT-5.6 Sol. Il montre seulement un écart relatif rapporté par l’article. Cette différence empêche de résumer les performances du modèle à son seul résultat de 88,1 sur CyberGym. Les deux évaluations portent sur des cadres distincts. Relire la comparaison des résultats.
Une vérification attendue. L’article indique que les scores de DeepSeek n’ont pas été reproduits par des tiers. Il appelle aussi à des évaluations indépendantes pour confirmer les performances annoncées. Cette réserve concerne l’interprétation du résultat attribué à V4.1 Flash. Elle ne modifie pas le score de 88,1 rapporté pour CyberGym, mais elle encadre sa portée. DeepSeek revendique un avantage sur Claude Mythos à partir de cette mesure. L’article rapporte également que les performances de V4.1 Flash sont vraiment intéressantes. Pour l’instant, les éléments cités réunissent une annonce de publication, deux scores CyberGym, une architecture déclarée et un résultat relatif sur ExploitGym.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés