# GLM-5.2 se rapproche à 4,3 mois de Claude Opus 4.6

> L’AISI observe un écart cyber réduit entre modèles ouverts et propriétaires, tandis que Kimi K3 atteint des performances de niveau frontière.

Type : Actualité IA · Catégorie : Tendances · Publié le 2026-09-08 · Signal IA - Order & Chaos · Secteur : Cybersécurité
Source : https://www.orderchaos.eu/signal-ia/actu/laisi-voit-lecart-se-reduire-kimi-k3-atteint-la-frontiere
Tags : modèles ouverts, cybersécurité, régulation, chine, évaluations, claude, chatgpt, deepseek

---

## En résumé

- L’AISI constate que l’écart cyber entre modèles ouverts et propriétaires se réduit.
- Kimi K3 atteint des performances de niveau frontière sur plusieurs évaluations.
- Demis Hassabis propose un organisme de standards pour tester les modèles avancés.

**Le signal :** L’AISI mesure un écart de 4,3 mois entre GLM-5.2 et Claude Opus 4.6 sur 70 évaluations cyber.

**L’AISI mesure** un rapprochement entre [modèles ouverts](/signal-ia/actu/anthropic-atteint-73-pourcent-en-cybersecurite-la-chine-accelere) et propriétaires dans les capacités de cybersécurité. L’institut britannique a comparé plusieurs systèmes sur 70 évaluations ciblées. GLM-5.2 se situe à 4,3 mois de Claude Opus 4.6, selon cette analyse. DeepSeek-V4-Pro se place entre Claude Opus 4.5 et GPT-5. Ces modèles ouverts accusaient généralement un retard de six à dix mois pendant la majeure partie de 2025. L’écart observé cette année est donc plus court. L’AISI prévoit aussi de tester Kimi K3 avec la même méthode, lorsque ses poids seront publiés. Les résultats portent sur des capacités cyber précises, plutôt que sur une mesure générale des modèles.

**Les cyberranges résistent** davantage à ce rapprochement. Sur l’épreuve The Last Ones, GLM-5.2 atteint le niveau d’Opus 4.5, publié moins de sept mois auparavant. [DeepSeek](/signal-ia/actu/aisi-voit-lecart-cyber-entre-ia-ouvertes-et-fermees-fondre)-V4-Pro reste sous Sonnet 4.5, présenté comme un modèle situé sous la frontière cyber. L’AISI indique que l’écart est plus important sur cette épreuve longue que sur les tâches étroites. Ces tests évaluent la capacité à enchaîner plusieurs compétences pour accomplir une opération complète. L’institut estime que les défenseurs disposent d’un délai court avant que des capacités cyber actuelles deviennent accessibles sans les mêmes garde-fous. Son analyse complète est publiée sur le [site de l’AISI](https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber).

## L’AISI compare les modèles cyber

**Kimi K3 progresse** aussi sur les modèles de frontière. Le système chinois compte 2,8 billions de paramètres. Selon Kimi, il affiche des résultats de niveau frontière sur sa suite d’évaluations. Il dépasse régulièrement les autres modèles testés, tout en restant derrière Claude Fable 5 et GPT 5.6 Sol sur les performances globales. Les auteurs signalent toutefois une certaine fragilité, compatible avec une optimisation poussée autour des évaluations. Les poids de Kimi K3 doivent être publiés dans les semaines suivantes, avec un article de recherche. Kimi présente également MiniTriton, un compilateur proche de Triton, avec une couche intermédiaire et une génération de code PTX. Le [billet consacré à Kimi K3](https://www.kimi.com/blog/kimi-k3) détaille ces démonstrations.

**Kimi construit aussi** des outils liés au matériel. Dans un essai autonome de 48 heures, Kimi K3 a conçu, optimisé et vérifié une puce pour un nano-modèle utilisant sa propre architecture. L’expérience reposait sur des outils de conception électronique au code ouvert et la bibliothèque Nangate 45 nm. Kimi affirme également que MiniTriton atteint des performances comparables ou supérieures à Triton et torch.compile sur les tests compatibles. Ces démonstrations illustrent des tâches où un modèle contribue à développer des composants logiciels ou matériels. Elles ne constituent pas une preuve d’utilisation de ces procédés pour entraîner Kimi K3. La publication annoncée des poids permettra d’examiner ces capacités plus directement.

## Demis Hassabis propose des standards

**[Demis Hassabis](/signal-ia/actu/les-modeles-ouverts-reduisent-lecart-cyber-avec-les-prives) propose** un organisme américain de standards pour les modèles avancés. Le fondateur de DeepMind le compare à la Financial Industry Regulatory Authority, une organisation autorégulée supervisée par le gouvernement fédéral. Cette structure développerait des protocoles d’évaluation avec les agences fédérales et les laboratoires nationaux américains. Elle testerait notamment les capacités liées à la sécurité nationale. Les protocoles serviraient aussi à définir ce qu’est un modèle de frontière. Dans un premier temps, les laboratoires partageraient volontairement leurs modèles avec l’organisme jusqu’à 30 jours avant leur publication. Une formalisation légale pourrait suivre lorsque les méthodes seraient jugées robustes. Hassabis présente cette proposition dans [son texte publié sur X](https://x.com/demishassabis/status/2076957440109625718).
