Par Arthur Dekeyser
En résumé
GLM-5.3 réussit des détournements complets du flux de contrôle dans 4 % des essais.
Claude Mythos Preview atteint 6 % de réussite sur les tâches évaluées.
Claude Opus 4.6 et GLM-5.2 ne réussissent aucun essai du benchmark.
Le signal : Claude Mythos Preview réussit 6 % des tâches, contre 4 % pour GLM-5.3.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
Le 29 septembre 2026, plusieurs modèles ont été évalués sur le benchmark Binary Exploitation. L’évaluation portait sur 100 tâches tirées aléatoirement. GLM-5.3 a développé des détournements complets du flux de contrôle dans 4 % des essais. Claude Mythos Preview a atteint 6 % sur le même ensemble. Ces résultats mesurent donc une réussite observée sur des tâches d’exploitation binaire. Ils ne constituent pas une prévision de performances futures. L’évaluation a été présentée le 29 septembre 2026. L’analyse de Simon Willison reprend les résultats attribués à Anthropic Frontier Red Team. Le benchmark compare plusieurs modèles sur un protocole identique de 100 tâches aléatoires.
Les deux modèles récents se distinguent des modèles précédents dans cette comparaison. Claude Mythos Preview réussit 6 % des essais. GLM-5.3 réussit 4 % des essais. Claude Opus 4.6 et GLM-5.2 ne réussissent aucun essai. La comparaison porte sur des détournements complets du flux de contrôle. Elle ne porte pas sur une moyenne générale de cybersécurité. Les pourcentages correspondent aux essais réussis dans l’évaluation. Le résultat de Claude Mythos Preview dépasse celui de GLM-5.3 de deux points de pourcentage. Les deux modèles affichent toutefois des taux inférieurs à 10 % sur ces 100 tâches. Le compte rendu original détaille cette comparaison entre quatre modèles.
Anthropic Frontier Red Team affirme qu’un seuil significatif a clairement été franchi dans les performances de ces modèles. Cette déclaration est attribuée à l’équipe, et non présentée comme une mesure supplémentaire. Les chiffres disponibles dans l’évaluation sont 4 % pour GLM-5.3 et 6 % pour Claude Mythos Preview. Les modèles précédents cités, Claude Opus 4.6 et GLM-5.2, ne réussissent aucun essai. L’écart entre les générations apparaît donc dans les résultats observés sur ce benchmark. Le terme « seuil significatif » vient de l’équipe Anthropic Frontier Red Team. Il ne remplace pas les taux mesurés. Les 100 tâches aléatoires forment la base commune de cette comparaison publiée le 29 septembre 2026.
Les résultats chiffrés montrent une réussite non nulle pour GLM-5.3 et Claude Mythos Preview. GLM-5.3 développe un détournement complet dans quatre essais sur 100, selon son taux de 4 %. Claude Mythos Preview atteint six essais sur 100, selon son taux de 6 %. Claude Opus 4.6 et GLM-5.2 n’en réussissent aucun. Cette lecture traduit les pourcentages en nombres d’essais correspondants. Elle conserve le périmètre de l’évaluation, limité à 100 tâches aléatoires. Les chiffres ne décrivent pas d’autres modèles. Ils ne mesurent pas non plus d’autres types de vulnérabilités. La comparaison reste centrée sur le benchmark Binary Exploitation et le détournement complet du flux de contrôle.
La prochaine lecture de ces résultats concerne donc la comparaison entre les modèles cités. Claude Mythos Preview arrive devant GLM-5.3 avec 6 % contre 4 %. Claude Opus 4.6 et GLM-5.2 restent à 0 % dans les essais rapportés. Anthropic Frontier Red Team qualifie cette évolution de franchissement clair d’un seuil significatif. Cette qualification accompagne les résultats, sans modifier leur mesure. L’évaluation du 29 septembre 2026 fournit un cadre commun aux quatre modèles. Les performances sont exprimées par la proportion d’essais réussis. Le benchmark utilise 100 tâches choisies aléatoirement. La publication de Simon Willison permet de retrouver les chiffres et l’attribution de cette déclaration.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés