Claude Mythos réussit une simulation cyber offensive clé

Claude Mythos réussit une simulation cyber offensive clé

Par Arthur Dekeyser

En résumé

1

Claude Mythos Preview a réussi trois simulations cyber de bout en bout sur dix.

2

Quatre laboratoires chinois ont publié des modèles de programmation à poids ouverts en douze jours.

3

Les agents réussissent mieux dans les tâches d’entreprise bornées que dans les marchés adversariaux.

💡

Le signal : Claude Mythos Preview réussit 3 simulations cyber sur 10, tandis que DeepSeek V4 rejoint les meilleurs modèles de programmation agentique.

NEWSLETTER BUSINESS & IA

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés

Nathan Benaich publie le numéro de mai 2026 de sa lettre State of AI, consacré aux développements d’avril. L’analyse signale un franchissement de seuil dans les opérations cyber offensives. Claude Mythos Preview, modèle d’Anthropic, a réussi la simulation « The Last Ones » de l’AI Security Institute britannique dans trois cas sur dix. Cette évaluation couvre la reconnaissance jusqu’à la prise de contrôle complète d’un domaine. Le modèle a aussi obtenu 73 % sur des tâches de niveau expert. L’institut précise toutefois que la simulation ne comporte ni défense active ni outil défensif. Les résultats ne prouvent donc pas l’efficacité contre des cibles réellement durcies. Lire l’évaluation de l’AISI.

OpenAI suit rapidement avec GPT-5.5, évalué trois semaines après Claude Mythos Preview. Le modèle a réussi deux simulations de bout en bout sur dix et obtenu 71,4 % sur les tâches expertes. La même réserve s’applique, car les défenseurs restent absents de l’environnement testé. Selon l’AISI, la capacité offensive des modèles de pointe double désormais tous les quatre mois. Le rythme était de sept mois fin 2025. Nathan Benaich estime que les outils fondés sur des signatures statiques et des règles subissent une pression croissante. Il cite CrowdStrike, Palo Alto et Microsoft Defender comme plateformes disposant déjà d’une couche d’orchestration défensive. Leur capacité à fournir des architectures natives reste déterminante, selon son analyse.

Claude Mythos accélère le cyber offensif

Microsoft réorganise aussi son alliance avec OpenAI, conclue en 2019 pour 1 milliard de dollars puis portée à 13 milliards. Microsoft reste le principal partenaire infonuagique d’OpenAI, avec une priorité donnée à Azure lorsque le support est disponible. OpenAI peut désormais diversifier ses fournisseurs de calcul, notamment avec Oracle et CoreWeave. La licence de propriété intellectuelle de Microsoft reste non exclusive jusqu’en 2032. Le partage de revenus est associé à des seuils de capacités plus précis, plutôt qu’à une clause générale sur l’intelligence artificielle générale. Microsoft distribue également les modèles de pointe sur Foundry, dont Opus 4.7 d’Anthropic dès son lancement. Claude est disponible sur AWS, Google Cloud et Azure.

Les centres de données rencontrent cependant une opposition locale croissante. Au moins onze États américains ont proposé des textes restrictifs sur ces infrastructures. Un projet de moratoire fédéral, porté par les sénateurs Sanders et Ocasio-Cortez, pourrait suspendre les nouvelles constructions jusqu’à l’adoption de protections environnementales et sociales. Sam Altman a de son côté proposé un « New Deal » de la superintelligence, comprenant des garanties d’achat public et des investissements énergétiques. Le débat politique mentionne aussi CHIPS Act 2.0, l’accélération des permis de transmission par la FERC et la coordination du DoE et du DoD pour installer des centres près de capacités nucléaires. Ces éléments décrivent des propositions et des mesures en discussion.

Quatre laboratoires chinois publient

La programmation agentique a connu quatre sorties chinoises sur douze jours. Z.ai a publié GLM-5.1, MiniMax M2.7, Moonshot Kimi K2.6 et DeepSeek V4 en poids ouverts. Leurs capacités atteignent un niveau similaire sur l’ingénierie agentique, avec un coût d’inférence inférieur à celui des modèles occidentaux de pointe. Aucun ne coûte plus du tiers d’Opus 4.7. L’évaluation CAISI du NIST place toutefois V4 environ huit mois derrière le meilleur modèle américain sur son agrégat interdomaines. La fiche de modèle de DeepSeek annonce de son côté une parité entre V4-Pro, Opus 4.6 et GPT-5.4. Selon Benaich, l’écart dépend donc de l’évaluateur, du cadre d’exécution et du test choisi.

Les marchés réels distinguent les tâches bornées des environnements adversariaux. Dans Project Deal, Anthropic a fait fonctionner 69 agents soutenus par des employés pendant une semaine. Ils ont examiné plus de 500 annonces et conclu 186 transactions, pour un total de 4 000 dollars. Les agents Opus 4.5 ont négocié de meilleurs prix et choix que les agents Haiku 4.5. KellyBench a produit un résultat opposé dans les paris sur 38 semaines de Premier League. Tous les modèles de pointe ont perdu en moyenne, et seulement trois combinaisons modèle-graine sur 24 ont évité la ruine. Opus 4.6, meilleur participant, a obtenu un score de sophistication de 32,6 %. Lire la source originale.

Les usages bornés restent mieux maîtrisés. Les agents d’approvisionnement de Ramp fonctionnent trois fois plus vite et réduisent de 16 % les coûts des fournisseurs, selon les résultats cités par Benaich. En robotique, le modèle π0.7 de Physical Intelligence transfère ses compétences entre plusieurs plateformes sans réentraînement propre à chaque robot. Il égale ou dépasse des politiques spécialisées sur la préparation d’un expresso et la lessive. Il combine aussi ces compétences dans des séquences de cuisine inédites. ML-Master 2.0 a atteint un taux de médailles de 56,44 % sur MLE-Bench avec une limite de 24 heures. Ces résultats suggèrent des progrès mesurés, mais les expériences adversariales montrent encore des limites fortes.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs abonnés

À lire aussi