# Anthropic multiplie par huit le code fusionné en 2026

> Anthropic observe huit fois plus de code fusionné en 2026 qu’en 2021-2024, tandis que SocioHack et des drones testent les limites de l’IA.

Type : Actualité IA · Catégorie : Tendances · Publié le 2026-08-24 · Signal IA - Order & Chaos · Secteur : Industrie
Source : https://www.orderchaos.eu/signal-ia/actu/anthropic-revele-huit-fois-plus-de-code-fusionne-en-2026
Tags : ia, anthropic, sécurité, robotique, recherche, agents-ia, benchmark

---

## En résumé

- Anthropic rapporte huit fois plus de code fusionné en 2026 qu’entre 2021 et 2024.
- SocioHack évalue 72 environnements simulant des mécanismes de récompense institutionnels.
- Des drones entraînés par renforcement ont dépassé un pilote humain champion à plus de 22 m/s.

**Le signal :** Anthropic rapporte une multiplication par huit du code fusionné en 2026, comparée aux années 2021 à 2024.

**Trois signaux convergent.** Le numéro 460 d’Import AI décrit des avancées distinctes dans l’évaluation sociale, la productivité des laboratoires et le pilotage physique. Une étude de King’s College London, de Fudan University et de l’Alan Turing Institute présente SocioHack, un banc d’essai composé de 72 environnements simulés. Anthropic rapporte de son côté huit fois plus de lignes de code fusionnées en 2026 qu’en 2021-2024. Enfin, l’Université de Zurich et Google DeepMind ont entraîné des drones capables de dépasser un pilote humain champion. Ces travaux ne mesurent pas la même capacité. Ils montrent toutefois des systèmes testés sur des règles, des tâches de [recherche](/signal-ia/actu/a-princeton-claude-opus-48-echoue-en-recherche-ouverte) et des interactions physiques complexes. La source originale est disponible dans [Import AI 460](https://importai.substack.com/p/import-ai-460-reward-hacking-society).

**SocioHack formalise le contournement.** Le [benchmark](/signal-ia/actu/owasp-retaille-son-top-10-avec-6-639-incidents-reels) définit le « societal hacking » comme la découverte de stratégies conformes aux règles, mais contraires à leur objectif institutionnel. Ses 72 environnements sont répartis entre 32 cas historiques, 20 cas synthétiques et 20 cas fictifs. Les cas historiques reconstruisent notamment des règles antérieures à des correctifs appliqués à la règle 10b5-1 de la SEC et au Texas two-step. Dans ces simulations, des modèles entraînés par renforcement ont retrouvé des stratégies corrigées avec 61,25 % de rappel et 90,85 % de précision. Les scénarios incluent les cartes de crédit, les ventes d’alcool, les revenus scolaires et les algorithmes sociaux.

## SocioHack teste les règles institutionnelles

**Les résultats restent circonscrits.** Import AI rapporte que plusieurs systèmes entraînés par renforcement obtiennent des scores élevés sur SocioHack. Les auteurs relient ce résultat à des évaluations de capacités auxquelles s’ajoute une dimension de conformité formelle et d’intention institutionnelle. Le benchmark ne déploie pas directement ses environnements dans le monde réel. Les environnements historiques retirent volontairement des correctifs connus, qui servent ensuite de références pendant l’évaluation. Les environnements fictifs conservent la logique réglementaire tout en changeant leur décor. L’article [Large Language Models Hack Rewards, and Society](https://arxiv.org/abs/2606.04075) présente ce protocole et son objectif d’étude du décalage entre règle et finalité.

**[Anthropic](/signal-ia/actu/anthropic-booste-de-283pourcent-lefficacite-des-chercheurs) documente une accélération.** Jack Clark indique avoir compilé plusieurs éléments pendant son passage chez Anthropic. Le volume de code fusionné en 2026 atteint huit fois celui observé sur les années 2021 à 2024. Selon son analyse, la tendance commence en 2025 et accélère nettement en 2026. Il rapporte aussi des signes préliminaires montrant que des modèles plus capables réussissent certaines tâches difficiles réalisées par les ingénieurs et chercheurs. Clark précise toutefois que ces éléments ne sont pas concluants. Il ne voit pas encore la créativité nécessaire pour produire des idées susceptibles de modifier profondément les paradigmes du domaine. Anthropic détaille cette réflexion dans [When AI builds itself](https://www.anthropic.com/institute/recursive-self-improvement).

## Les drones dépassent un pilote champion

**La course mesure l’action physique.** Des chercheurs de l’Université de Zurich et de Google DeepMind ont opposé des quadricoptères entraînés par renforcement à Marvin Schaepper, champion suisse de course de drones à cinq reprises. Les agents dépassent un pilote de niveau champion à plus de 22 mètres par seconde. Ils réduisent aussi de 50 % le taux de collision comparés à des références mono-agent. L’entraînement utilise 200 millions d’interactions avec l’environnement, réparties sur 5 500 itérations. Une seule carte NVIDIA RTX 4090 a été utilisée pendant environ 27 heures. En course un contre un, la politique a terminé 100 % des cinq essais, contre 53,33 % pour le pilote humain.

**La simulation généralise partiellement.** Les chercheurs ont entraîné les systèmes avec Flightmare, le cadre Agilicious et Stable-Baselines3 étendu à l’apprentissage multi-agent. Le dispositif utilise l’auto-jeu en ligue, une modélisation particulaire du souffle des hélices et une randomisation des conditions initiales. Les politiques n’ont reçu aucun entraînement spécifique dans le monde réel. Les drones employés pèsent 220 ± 3 grammes et disposent d’un rapport poussée-poids de 6,5. Lors des essais, le pilote humain a pris davantage de risques pour rattraper les agents, avec des collisions de portes ou des pertes de contrôle. La source présente aussi une limite importante : le pilotage réel passe par un réseau, et non par un système local.
