En résumé
L’AISI mesure un écart réduit entre plusieurs modèles ouverts et propriétaires en cybersécurité.
Kimi K3 affiche 2,8 billions de paramètres et des performances proches de modèles propriétaires.
Demis Hassabis propose un organisme américain chargé de tester les modèles d’IA frontière.
Le signal : L’AISI mesure un écart cyber de 4,3 mois entre GLM-5.2 et Claude Opus 4.6.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
L’AISI mesure un rapprochement entre modèles ouverts et propriétaires en cybersécurité. L’institut britannique a comparé leurs capacités sur 70 évaluations spécialisées. GLM-5.2 se rapproche de Claude Opus 4.6, lancé 4,3 mois auparavant. DeepSeek V4-Pro se situe entre Claude Opus 4.5 et GPT-5. Ces résultats concernent des capacités cyber étroites. L’écart observé devient inférieur à celui mesuré pendant la majeure partie de 2025. Il atteignait alors six à dix mois. L’AISI prévoit aussi de tester Kimi K3 lorsque ses poids seront publiés. Cette évolution rapproche des modèles diffusés ouvertement de la frontière propriétaire sur certains usages cyber précis.
Les cyberranges résistent davantage à ce rapprochement. Sur The Last Ones, GLM-5.2 atteint le niveau de Claude Opus 4.5, sorti moins de sept mois avant lui. DeepSeek V4-Pro reste sous Sonnet 4.5, modèle situé sept mois avant sa sortie. L’AISI observe donc un écart plus important pour les opérations longues que pour les tâches étroites. Ces exercices évaluent la capacité à enchaîner plusieurs compétences jusqu’à une opération complète. L’institut estime que les défenseurs disposent d’une courte période de préparation avant une diffusion plus large de capacités cyber avancées. L’analyse de l’AISI détaille ces comparaisons.
Kimi présente un modèle de 2,8 billions de paramètres, conçu par l’entreprise chinoise Kimi. Ses résultats égalent ou approchent ceux de plusieurs modèles propriétaires sur les évaluations utilisées par le secteur. Kimi K3 reste derrière Claude Fable 5 et GPT 5.6 Sol sur la performance globale. Il les dépasse toutefois régulièrement dans la série d’évaluations présentée par son équipe. Cette performance comporte une limite rapportée par l’analyse d’Import AI. Le modèle pourrait avoir été fortement optimisé pour les tests de référence. Ses poids doivent être publiés dans les semaines suivantes, avec un article de recherche consacré au modèle. Kimi décrit son approche et ses résultats.
Kimi automatise aussi certaines tâches liées à la conception de systèmes informatiques. Le modèle a développé MiniTriton, un compilateur inspiré de Triton. Ce logiciel comprend une représentation intermédiaire au niveau des tuiles, des passes d’optimisation et une génération de code PTX. Sur les tests de performance pris en charge, MiniTriton égale ou dépasse Triton et torch.compile. Kimi K3 a également conçu une puce destinée à un petit modèle reposant sur sa propre architecture. Lors d’une exécution autonome de 48 heures, il a construit, optimisé et vérifié cette puce. Le processus utilisait des outils EDA à code ouvert et la bibliothèque Nangate 45 nanomètres.
Hassabis propose un organisme américain chargé d’évaluer les capacités des modèles frontière. Le fondateur de DeepMind le compare à la FINRA, organisation de réglementation professionnelle du secteur financier. Cette structure développerait des protocoles d’évaluation avec des agences fédérales et les laboratoires nationaux américains. Elle examinerait notamment les sujets liés à la sécurité nationale. Les laboratoires développant ces modèles seraient encouragés à documenter leurs systèmes, renforcer leur cybersécurité et vérifier leur personnel. Dans un premier temps, ils partageraient volontairement leurs modèles jusqu’à 30 jours avant leur lancement. Une formalisation légale pourrait suivre après validation des protocoles. Demis Hassabis présente cette proposition.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés