Anthropic voit le code fusionné bondir, Zurich bat un champion
Industrie #agents-ia #benchmark 3 min · 9 septembre 2026

Anthropic voit le code fusionné bondir, Zurich bat un champion

Par Arthur Dekeyser

En résumé

1

SocioHack évalue 72 environnements sociaux simulés pour tester le contournement des règles.

2

Anthropic observe une multiplication par huit du code fusionné en 2026.

3

Des drones entraînés par renforcement dépassent un pilote humain à plus de 22 mètres par seconde.

💡

Le signal : Anthropic observe 8 fois plus de lignes de code fusionnées en 2026 qu’entre 2021 et 2024.

NEWSLETTER BUSINESS & IA

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés

Trois signaux convergent. Une étude de Kings College London, Fudan University et de l’Alan Turing Institute présente SocioHack, un benchmark de 72 environnements sociaux simulés. Anthropic observe parallèlement huit fois plus de lignes de code fusionnées en 2026 qu’entre 2021 et 2024. Enfin, l’Université de Zurich et Google DeepMind entraînent des drones capables de dépasser un pilote humain champion. Ces travaux portent sur trois formes différentes de performance des systèmes d’IA. SocioHack mesure la recherche de failles dans des règles. Anthropic décrit une accélération interne du développement. Les drones évaluent une conduite physique multi-agents à grande vitesse. Lire l’analyse originale.

SocioHack formalise le contournement. Le benchmark regroupe 32 environnements historiques, 20 synthétiques et 20 fictionnels. Les environnements historiques reconstruisent des règles antérieures à des corrections réglementaires. Les auteurs indiquent que des modèles entraînés par renforcement retrouvent ces stratégies avec 61,25 % de rappel et 90,85 % de précision. Les scénarios portent notamment sur les droits miniers sous-marins, les ventes d’alcool et les points de cartes bancaires. D’autres environnements testent les revenus scolaires, la performance universitaire et les algorithmes sociaux. Les auteurs définissent ce phénomène comme la découverte de stratégies conformes aux règles, mais contraires à leur intention institutionnelle. Les environnements restent simulés, sans déploiement direct dans le monde réel.

SocioHack teste 72 environnements

Anthropic documente une accélération. Jack Clark distingue une version maximaliste de l’amélioration récursive, où un système conçoit son successeur, et une version plus opérationnelle. Cette seconde définition concerne l’accélération cumulative de la productivité d’un laboratoire. Selon son analyse, Anthropic a fusionné huit fois plus de lignes de code en 2026 qu’en 2021-2024. La tendance aurait commencé en 2025 avant d’accélérer nettement en 2026. Clark rapporte aussi des signes préliminaires d’amélioration sur certaines tâches difficiles d’ingénierie et de recherche. Il précise que ces observations ne démontrent pas une amélioration récursive complète. L’article d’Anthropic présente cette réflexion autour de l’amélioration récursive dans un billet de l’Anthropic Institute.

Les drones gagnent en course. Des chercheurs de l’Université de Zurich et de Google DeepMind ont entraîné des quadricoptères par apprentissage par renforcement. Les agents dépassent un pilote humain de niveau champion à plus de 22 mètres par seconde. Ils réduisent aussi de 50 % le taux de collisions par rapport à des références mono-agent. L’entraînement utilise 5 500 itérations et 200 millions d’interactions simulées. Une seule carte NVIDIA RTX 4090 a fourni environ 27 heures de calcul. Les agents apprennent par auto-jeu à bloquer, céder lors d’un dépassement dangereux et intégrer le sillage aérodynamique. Les chercheurs ont validé ces comportements lors de courses réunissant des systèmes autonomes et Marvin Schaepper, quintuple champion suisse de course de drones. Voir l’étude sur arXiv.

Zurich valide le pilotage multi-agent

La validation physique reste connectée. Les équipes ont entraîné et évalué les politiques dans Flightmare, intégré au cadre Agilicious. Elles ont modélisé le souffle des hélices avec une simulation particulaire et utilisé une randomisation des paramètres. Cette méthode modifie notamment la dynamique des appareils et leurs conditions initiales. Aucun entraînement spécifique au monde réel n’a été ajouté. Les quadricoptères reposent sur des plateformes Agilicious identiques, pesant 220 ± 3 grammes. Leur rapport poussée-poids atteint 6,5, avec des hélices de trois pouces. Le système fonctionnait via un ordinateur distant et pilotait les drones par réseau. Lors de cinq essais en un contre un, la politique a terminé toutes les courses, contre 53,33 % pour le pilote humain.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs abonnés

À lire aussi