Par Arthur Dekeyser
En résumé
METR a collaboré avec Anthropic pour tester la sécurité de ses systèmes internes.
L'exercice a duré trois semaines et a révélé plusieurs vulnérabilités.
Des améliorations aux systèmes de surveillance d'Anthropic sont prévues grâce à ces découvertes.
Le signal : David Rein de METR a mené une analyse de sécurité chez Anthropic durant trois semaines.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
David Rein de METR a récemment passé trois semaines à analyser les systèmes de surveillance des agents internes chez Anthropic grâce à une méthode de red-teaming. Ce processus a permis de découvrir plusieurs vulnérabilités spécifiques, qui ont été partagées dans un rapport de 26 pages avec Anthropic. Ces découvertes, même si elles n’affaiblissent pas les principales affirmations du rapport de risque Opus 4.6 d’Anthropic, pointent vers des axes d’amélioration potentiels. Source originale.
Anthropic a fait preuve de transparence en offrant à METR un accès substantiel à ses systèmes internes et en rendant son personnel disponible pour répondre aux questions. L’objectif était de non seulement identifier les vulnérabilités mais aussi de développer des pratiques exemplaires pour intégrer des évaluateurs tiers. L’exercice a produit des artefacts utiles, tels que des trajectoires d’agent comportant des attaques furtives, qui serviront à l’amélioration continue des systèmes de surveillance de l’entreprise.
Des exercices de ce type devraient se répéter pour continuer à renforcer la sécurité des systèmes IA. METR espère voir plus de collaborations similaires avec d’autres développeurs d’IA à l’avenir. Cette démarche proactive d’Anthropic et METR est essentielle à l’heure où les systèmes IA évoluent et où les menaces potentielles augmentent. Pour plus de détails, consultez le rapport Opus 4.6 Sabotage Risk Report mentionné dans la présentation de l’exercice.
Les prochaines étapes visent à intégrer les leçons tirées de ces exercices dans les futurs rapports de risque de METR. De telles collaborations renforcent la sécurité globale des systèmes d’IA et établissent des standards de sécurité élevés dans l’industrie.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés