Nathan Benaich observe une IA chinoise en accélération

Nathan Benaich observe une IA chinoise en accélération

Par Arthur Dekeyser

En résumé

1

Claude Mythos Preview réussit trois simulations cyber sur dix.

2

Quatre laboratoires chinois lancent des modèles de codage en douze jours.

3

Les agents progressent dans les tâches bornées mais échouent face au risque réel.

💡

Le signal : Claude Mythos Preview réussit 3 simulations cyber sur 10, tandis que quatre modèles chinois de codage sortent en 12 jours.

NEWSLETTER BUSINESS & IA

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés

Nathan Benaich publie le 4 mai 2026 une nouvelle édition de son analyse mensuelle de l’intelligence artificielle. Le texte couvre les évolutions observées en avril dans la politique, la recherche, l’industrie et les start-up. Il met en avant trois mouvements mesurables. Les capacités offensives en cybersécurité progressent rapidement. Quatre laboratoires chinois lancent des modèles de codage à poids ouverts en douze jours. Les agents obtiennent des résultats dans des marchés bornés, mais perdent pied face au risque réel. L’analyse cite aussi des avancées en robotique et en recherche automatisée. Elle relie ainsi des démonstrations techniques à des expérimentations conduites dans des environnements opérationnels.

Une progression cyber Anthropic Claude Mythos Preview a franchi les 32 étapes de l’évaluation « The Last Ones » de l’AI Security Institute. Le modèle a terminé la simulation de prise de contrôle d’un réseau d’entreprise dans 3 cas sur 10. Il a obtenu 73 % sur les tâches destinées aux experts. OpenAI GPT-5.5 a ensuite réussi 2 simulations sur 10, avec 71,4 % sur ces tâches. L’évaluation ne comprenait toutefois ni défense active ni outil défensif. L’institut estime que les capacités offensives des modèles de pointe doublent désormais tous les quatre mois. Elles doublaient tous les sept mois fin 2025. (Évaluation de l’AISI)

Les modèles chinois accélèrent le codage

Quatre lancements Z.ai, MiniMax, Moonshot et DeepSeek ont publié GLM-5.1, M2.7, Kimi K2.6 et DeepSeek V4 sur une période de douze jours. Ces modèles ont atteint un niveau proche sur l’ingénierie logicielle agentique, avec un coût d’inférence inférieur à celui des modèles occidentaux de pointe. Aucun ne coûtait plus du tiers de Claude Opus 4.7. Le test CAISI du NIST place V4 environ huit mois derrière le meilleur modèle américain sur son évaluation multidomaine. La fiche de DeepSeek revendique toutefois une parité entre V4-Pro, Opus 4.6 et GPT-5.4. L’écart dépend donc de l’évaluateur, du scénario et de l’architecture d’agent.

Des marchés contrastés Anthropic a organisé Project Deal pendant une semaine dans ses bureaux de San Francisco. Soixante-neuf agents liés à des employés ont parcouru plus de 500 annonces et conclu 186 transactions, pour un total de 4 000 dollars. Les agents Opus 4.5 ont négocié de meilleurs prix et choix que les agents Haiku 4.5. Dans KellyBench, les modèles ont géré une mise sur 38 semaines de Premier League. Tous ont perdu en moyenne, et seulement 3 des 24 combinaisons modèle-graine ont évité la ruine. Opus 4.6 a obtenu un score de sophistication de 32,6 %. Ramp rapporte néanmoins des achats trois fois plus rapides et une baisse de 16 % des coûts fournisseurs.

La robotique et la recherche progressent

Des agents spécialisés Le modèle robotique π0.7 de Physical Intelligence transfère ses compétences à des tâches et des robots jamais vus. Il égale ou dépasse des politiques spécialisées entraînées par renforcement pour préparer un expresso et gérer du linge. Il combine ensuite ces compétences dans des tâches de cuisine en plusieurs étapes. Le modèle suit aussi des instructions en langage naturel sur plusieurs matériels, sans nouvel entraînement propre à chaque robot. ML-Master 2.0 vise des travaux autonomes de plusieurs jours. Avec un budget de 24 heures sur MLE-Bench, il obtient un taux de médailles de 56,44 %, présenté comme un meilleur résultat.

Des limites persistantes Une étude de l’université Friedrich-Schiller d’Iéna analyse 25 000 exécutions d’agents dans huit domaines scientifiques. Le modèle de base explique 41,4 % de la variance expliquée, contre 1,5 % pour l’architecture d’agent. Les agents ignorent les preuves dans 68 % des traces. Ils révisent leurs croyances après réfutation dans seulement 26 % des cas. Les résultats montrent donc une différence entre exécuter un flux de travail et raisonner scientifiquement. Microsoft Research et Browserbase proposent par ailleurs un vérificateur universel pour les agents utilisant un ordinateur. Leur approche sépare les récompenses de processus et de résultat, puis distingue les échecs contrôlables des autres.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs abonnés

À lire aussi