Claude Mythos atteint 73 % aux tests de cybersécurité

Claude Mythos atteint 73 % aux tests de cybersécurité

Par Arthur Dekeyser

En résumé

1

Anthropic a franchi le test cyber TLO dans trois essais sur dix.

2

Quatre laboratoires chinois ont publié des modèles de code ouverts en douze jours.

3

Les agents réussissent mieux dans les tâches bornées que dans les marchés adversariaux.

💡

Le signal : Anthropic atteint 73 % sur les tâches cyber expertes, tandis que quatre modèles chinois de code ouverts arrivent en douze jours.

NEWSLETTER BUSINESS & IA

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés

Anthropic franchit un seuil. Le modèle Claude Mythos Preview a réussi le test « The Last Ones » de l’AI Security Institute britannique. Cette simulation couvre la reconnaissance d’un réseau d’entreprise jusqu’à la prise complète du domaine. Le test représente généralement 20 heures de travail humain spécialisé. Mythos a réussi les dix étapes dans trois essais sur dix. Il a aussi atteint 73 % de réussite sur les tâches destinées aux experts. L’institut précise toutefois que l’évaluation ne comprend ni défense active ni outils défensifs. Ces résultats ne démontrent donc pas une efficacité contre des cibles durcies. Le rapport de l’AI Security Institute détaille cette mesure.

OpenAI suit trois semaines plus tard. GPT-5.5 a obtenu deux réussites complètes sur dix dans la même évaluation. Son score sur les tâches expertes atteint 71,4 %. Les deux modèles partagent la limite liée à l’absence de défenseurs. L’AI Security Institute estime que la capacité offensive des modèles de pointe double désormais tous les quatre mois. Elle doublait en sept mois à la fin de 2025. Les fournisseurs de cybersécurité fondés sur des signatures statiques ou des règles font face à cette accélération. CrowdStrike, Palo Alto et Microsoft Defender disposent déjà d’une couche d’orchestration intégrée. Leur évolution dépend toutefois d’architectures natives de l’IA, selon l’analyse publiée.

Les modèles chinois réduisent l’écart

Quatre laboratoires publient. Z.ai, MiniMax, Moonshot et DeepSeek ont lancé GLM-5.1, M2.7, Kimi K2.6 et DeepSeek V4 dans une fenêtre de douze jours. Ces modèles à poids ouverts ont atteint un plafond de capacités comparable sur le développement logiciel autonome. Leur coût d’inférence reste inférieur à celui des modèles occidentaux de pointe. Aucun ne coûte plus du tiers de Claude Opus 4.7. Le modèle de Zhipu a accompagné son lancement d’une hausse de 15,92 % du cours de l’action. MiniMax a montré M2.7 s’optimisant sur plus de 100 cycles. Kimi a présenté une trace de 12 heures consacrée au portage d’un moteur vers Zig.

Les évaluations divergent. L’évaluation transversale CAISI du NIST place V4 environ huit mois derrière le modèle américain de pointe. La fiche de modèle de DeepSeek situe pourtant V4-Pro au niveau de Claude Opus 4.6 et GPT-5.4. Ces écarts viennent des évaluateurs et des protocoles utilisés. Le décalage de six à neuf mois ne décrit donc plus correctement le développement logiciel autonome chinois. Plusieurs modèles chinois à poids ouverts figurent déjà parmi les plus performants dans cette capacité. Cette situation rend décisifs le choix de l’évaluateur, l’architecture d’exécution et le banc de test. Elle déplace aussi la comparaison au-delà de la seule puissance brute.

Les agents affrontent des marchés réels

Les résultats varient fortement. Anthropic a organisé Project Deal pendant une semaine dans ses bureaux de San Francisco. Soixante-neuf agents soutenus par des employés ont parcouru plus de 500 annonces. Ils ont conclu 186 transactions représentant 4 000 dollars. Les agents Opus 4.5 ont obtenu de meilleurs prix et choix que ceux utilisant Haiku 4.5. Les propriétaires des modèles moins performants ne connaissaient pas leur désavantage. KellyBench a produit un résultat opposé dans une saison de 38 semaines de Premier League. Tous les modèles de pointe ont perdu de l’argent en moyenne. Trois combinaisons seulement, sur 24, ont évité la ruine. Opus 4.6 a obtenu un score de sophistication de 32,6 %.

Les tâches bornées résistent mieux. Ramp indique que ses agents d’approvisionnement travaillent déjà trois fois plus vite. L’entreprise rapporte aussi une baisse de 16 % des coûts fournisseurs. Ces résultats contrastent avec KellyBench, qui soumet les agents à la non-stationnarité et au risque financier réel. Les bancs de test fondés sur des consignes propres et des vérificateurs objectifs peuvent donc surestimer les capacités observées. Project Deal montre aussi que les marchés entre agents peuvent favoriser les modèles supérieurs sans que les utilisateurs le voient. L’avantage peut alors se cumuler avec l’accès au meilleur calcul. Les usages administratifs bornés apparaissent ainsi plus solides que les marchés ouverts adversariaux.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs abonnés

À lire aussi