# Nathan Benaich voit les IA franchir un cap offensif

> Nathan Benaich décrit une accélération de l’IA offensive, du codage chinois et des agents, avec des écarts nets entre marchés encadrés et adversariaux.

Type : Actualité IA · Catégorie : Tendances · Publié le 2026-10-02 · Signal IA - Order & Chaos · Secteur : Cybersécurité
Source : https://www.orderchaos.eu/signal-ia/actu/nathan-benaich-revele-les-limites-des-agents-ia
Tags : ia, cybersécurité, agents, chine, robotique, claude, chatgpt, deepseek

---

## En résumé

- Claude Mythos Preview a réussi trois simulations offensives sur dix.
- Quatre laboratoires chinois ont publié des modèles de codage en douze jours.
- Les agents progressent dans les marchés encadrés mais échouent face au risque réel.

**Le signal :** Claude Mythos Preview a réussi 3 simulations cyber sur 10, tandis que quatre modèles chinois ont publié leurs poids ouverts en 12 jours.

**Nathan Benaich** a publié le 4 mai 2026 son bilan des développements d’avril dans l’intelligence artificielle. Il y décrit trois mouvements précis : le franchissement d’un seuil par les capacités cyber offensives, l’accélération chinoise dans le codage et les performances contrastées des [agents](/signal-ia/actu/anthropic-franchit-un-cap-deepseek-v4-rejoint-le-sommet-chinois). L’AI Security Institute a évalué Claude Mythos Preview d’Anthropic sur sa simulation « The Last Ones ». Le modèle a réussi trois parcours complets sur dix. Il a aussi atteint 73 % de réussite sur les tâches destinées aux experts. La simulation couvre la reconnaissance d’un réseau jusqu’à sa prise de contrôle complète. Elle représente habituellement vingt heures de travail humain spécialisé. [Lire l’analyse de l’AISI](https://www.aisi.gov.uk/blog/our-evaluation-of-claude-mythos-previews-cyber-capabilities).

**Les évaluations cyber** comportent toutefois une limite opérationnelle importante. La simulation de l’AISI ne comprend ni défense active ni outils défensifs. Ses résultats ne démontrent donc pas l’efficacité du modèle contre des cibles renforcées. L’institut indique aussi que ses tests distinguent difficilement les modèles avancés sans couches défensives adversariales. GPT-5.5 d’OpenAI a ensuite obtenu deux réussites complètes sur dix. Il a atteint 71,4 % sur les tâches expertes, trois semaines après Mythos. Selon l’AISI, la capacité offensive des modèles avancés double désormais tous les quatre mois. Elle doublait tous les sept mois à la fin de 2025. Cette progression place les architectures de défense au centre du débat sectoriel.

## Les modèles chinois accélèrent le codage en douze jours

**Quatre laboratoires chinois** ont publié des modèles de codage à poids ouverts dans une fenêtre de douze jours. Z.ai a lancé GLM-5.1, MiniMax a présenté M2.7, Moonshot a publié Kimi K2.6 et [DeepSeek](/signal-ia/actu/anthropic-atteint-73-pourcent-en-cybersecurite-la-chine-accelere) a diffusé V4. Ces modèles ont atteint un niveau similaire sur le développement logiciel agentique. Leur coût d’inférence reste inférieur à celui des modèles occidentaux avancés. Aucun ne coûte plus d’un tiers de Claude Opus 4.7. Le lancement de GLM-5.1 a fait progresser l’action de Zhipu de 15,92 % à la clôture. MiniMax a montré M2.7 en optimisation autonome de son cadre pendant plus de 100 cycles. Kimi a présenté douze heures d’utilisation continue d’outils.

**Les comparaisons varient** selon les évaluateurs et les critères retenus. L’évaluation CAISI du NIST place DeepSeek V4 environ huit mois derrière le modèle avancé américain de référence sur son agrégat interdomaines. La fiche de modèle de DeepSeek positionne toutefois V4-Pro au niveau d’Opus 4.6 et de GPT-5.4. Ces résultats décrivent des mesures différentes. Le cadre d’évaluation, l’architecture d’outils et le banc d’essai influencent donc le classement. Benaich estime que l’ancien écart de six à neuf mois ne décrit plus le codage agentique. Plusieurs des modèles les plus performants dans cette capacité sont désormais chinois et disponibles avec leurs poids ouverts.

## Les agents résistent mal au risque : trois combinaisons sur 24 évitent la ruine

**Les marchés encadrés** ont fourni un résultat plus favorable aux agents. Anthropic a transformé son siège de San Francisco en économie interne pendant une semaine. Soixante-neuf agents soutenus par des employés ont parcouru plus de 500 annonces. Ils ont conclu 186 transactions pour un total de 4 000 dollars. Les agents Opus 4.5 ont systématiquement mieux négocié les prix et la sélection que les agents Haiku 4.5. Les propriétaires des modèles moins performants ne percevaient pas cet écart. L’expérience suggère que la qualité du modèle peut créer une prime difficilement visible dans un marché d’agents. Elle met aussi en évidence l’avantage cumulatif associé aux meilleurs moyens de calcul.

**Le test KellyBench** a produit un résultat inverse dans un environnement adversarial. Les agents devaient gérer une mise pendant une saison de 38 semaines de Premier League. Ils utilisaient des données historiques de paris. Tous les modèles avancés ont terminé en perte en moyenne. Seules trois combinaisons de modèle et de graine sur 24 ont évité la ruine. Opus 4.6, meilleur participant, a obtenu un score de sophistication de 32,6 %. Le test oppose ces résultats aux tâches d’entreprise bornées. Les agents d’approvisionnement de Ramp fonctionnent déjà trois fois plus vite. Ils réduisent aussi les coûts des fournisseurs de 16 %. Les agents restent donc plus solides dans les processus contrôlés.

## La robotique progresse avec π0.7, évalué sur plusieurs plateformes

**La [robotique](/signal-ia/actu/claude-trebuche-en-cyberdefense-la-chine-accelere) progresse** avec le modèle π0.7 de Physical Intelligence. Une même série de paramètres a été évaluée sur plusieurs plateformes. Elle a transféré sans apprentissage supplémentaire des compétences vers des tâches et des appareils inconnus. π0.7 a égalé ou dépassé des politiques spécialisées affinées par renforcement pour préparer un espresso et gérer du linge. Il a ensuite combiné ces compétences dans des séquences de cuisine inédites. Le modèle suit des instructions en langage naturel sur différents matériels. ML-Master 2.0 a aussi atteint un taux de médailles de 56,44 % sur MLE-Bench avec un budget de 24 heures. Ces résultats prolongent l’étude des agents sur des horizons de plusieurs jours.

**Les recherches scientifiques** montrent cependant des faiblesses persistantes du raisonnement automatisé. Une étude de l’université Friedrich Schiller d’Iéna a analysé 25 000 exécutions d’agents dans huit domaines scientifiques. Le modèle de base expliquait 41,4 % de la variance observée, contre 1,5 % pour l’architecture d’outils. Les agents ignoraient les preuves dans 68 % des traces. Ils révisaient leurs croyances après réfutation dans seulement 26 % des cas. Les exemples de raisonnements réussis ne supprimaient pas ces défauts. Cette étude distingue ainsi l’exécution d’un flux de travail et une véritable démarche d’enquête. Le bilan de Nathan Benaich rassemble ces résultats dans [State of AI](https://nathanbenaich.substack.com/p/state-of-ai-may-2026).
