En résumé
Claude Mythos Preview a réussi trois simulations offensives sur dix.
Quatre laboratoires chinois ont publié des modèles de codage en douze jours.
Les agents réussissent mieux dans les marchés bornés que dans les environnements adversariaux.
Le signal : Claude Mythos Preview réussit 3 simulations sur 10, tandis que DeepSeek V4 rejoint le sommet chinois du codage agentique.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
Anthropic franchit un seuil. L’AI Security Institute britannique indique que Claude Mythos Preview est le premier modèle à réussir sa série TLO en cybersécurité offensive. Cette simulation couvre la reconnaissance d’un réseau d’entreprise jusqu’à la prise de contrôle complète d’un domaine. Elle représente généralement vingt heures de travail humain spécialisé. Mythos a réussi trois essais sur dix. Il a aussi atteint 73 % de réussite sur les tâches destinées aux experts. L’évaluation ne comprenait toutefois ni défense active ni outils défensifs. Ces résultats ne démontrent donc pas une efficacité contre des cibles renforcées. L’Institut estime néanmoins que la capacité offensive des modèles de pointe double désormais tous les quatre mois.
GPT-5.5 suit rapidement. OpenAI a obtenu deux résolutions complètes sur dix, trois semaines après l’évaluation de Mythos. Le modèle a atteint 71,4 % sur les tâches expertes. L’évaluation conserve la même limite, car aucun défenseur n’était présent dans la simulation. L’AI Security Institute juge que les évaluations actuelles distinguent mal les modèles de pointe. Elle appelle à ajouter des couches défensives adversariales. Cette accélération met sous pression les fournisseurs fondés sur des signatures statiques et des règles. CrowdStrike, Palo Alto et Microsoft Defender disposent toutefois d’une couche d’orchestration nécessaire aux agents défensifs. Leur évolution dépend désormais d’architectures natives de l’IA, plutôt que d’un simple ajout à des systèmes existants.
Microsoft diversifie ses modèles. L’accord renégocié avec OpenAI maintient Microsoft comme partenaire infonuagique principal. Les produits OpenAI arrivent d’abord sur Azure, sauf indisponibilité du service. Microsoft conserve aussi une licence non exclusive sur la propriété intellectuelle jusqu’en 2032. OpenAI peut maintenant diversifier ses fournisseurs de calcul, notamment avec Oracle et CoreWeave. Microsoft diffuse par ailleurs les modèles de pointe sur Foundry, dont Opus 4.7 d’Anthropic dès son lancement. Claude est également disponible sur AWS, Google Cloud et Azure. Cette évolution accompagne un investissement politique accru dans le calcul, l’énergie et les centres de données. Onze États américains ont proposé des restrictions visant ces infrastructures.
La Chine réduit l’écart. Z.ai, MiniMax, Moonshot et DeepSeek ont publié GLM-5.1, M2.7, Kimi K2.6 et DeepSeek V4 en douze jours. Ces quatre modèles atteignent un niveau comparable en ingénierie agentique, avec un coût d’inférence inférieur à celui des modèles occidentaux. Aucun ne coûte plus d’un tiers de Claude Opus 4.7. Le benchmark CAISI du NIST place toutefois V4 environ huit mois derrière le modèle américain de pointe. La fiche de DeepSeek présente V4-Pro à parité avec Opus 4.6 et GPT-5.4. Ces écarts reflètent des évaluateurs différents. Le cadre « six à neuf mois de retard » ne décrit donc plus le codage agentique chinois.
Les marchés testent les agents. Anthropic a organisé une économie interne durant une semaine à San Francisco. Soixante-neuf agents soutenus par des employés ont parcouru plus de 500 annonces. Ils ont conclu 186 transactions pour un montant total de 4 000 dollars. Les agents Opus 4.5 ont systématiquement mieux négocié que ceux utilisant Haiku 4.5. General Reasoning a proposé un test plus difficile avec KellyBench. Les agents devaient gérer une mise pendant 38 semaines de championnat anglais, à partir de données historiques de paris. Tous les modèles de pointe ont perdu en moyenne. Seules trois combinaisons modèle-graine sur 24 ont évité la ruine. Opus 4.6 n’a obtenu qu’un score de sophistication de 32,6 %.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés