Par Arthur Dekeyser
En résumé
Anthropic a testé un système automatisé sur 10 comportements mal alignés.
L’Automated Alignment Researcher a amélioré chaque benchmark sans dégrader les performances générales.
Le système coûte environ 4 dollars par heure, contre 150 dollars pour un chercheur humain.
Le signal : L’Automated Alignment Researcher d’Anthropic coûte environ 4 dollars par heure, contre 150 dollars pour ses chercheurs humains.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
Anthropic publie vendredi 28 août un article consacré à l’amélioration automatisée de l’alignement des modèles. Le système évalué porte le nom d’Automated Alignment Researcher, ou AAR. Il a travaillé sur 10 benchmarks correspondant à des comportements spécifiques considérés comme mal alignés. Selon l’article, les systèmes automatisés ont amélioré les performances sur chacun de ces benchmarks. Ils n’ont pas dégradé les performances générales du modèle pendant ces essais. L’étude est dirigée par Chen Yueh-Han, chercheur du programme de fellows d’Anthropic. Elle décrit une méthode d’entraînement qui automatise plusieurs étapes habituellement réalisées par des chercheurs humains. Lire l’article d’Anthropic fournit le détail de cette approche.
La méthode reproduit une partie du déroulement traditionnel de la recherche en IA. Chaque système automatisé parcourt la littérature disponible. Il propose ensuite une méthode adaptée au benchmark étudié. Il entraîne le modèle avec cette méthode pendant 30 minutes. Le processus augmente progressivement le benchmark au fil de plusieurs itérations. Les méthodes jugées efficaces sont conservées. Les méthodes inefficaces sont abandonnées. Cette sélection permet au système de fonctionner rapidement et à grande échelle, selon le contenu de l’article. Anthropic présente ces résultats comme des éléments préliminaires indiquant que l’entraînement automatisé de l’alignement pourrait devenir pratique prochainement. La publication ne décrit donc pas un modèle entièrement autonome, mais un dispositif expérimental dédié à l’alignement.
Les résultats opposent aussi l’AAR aux orientations proposées par des chercheurs humains expérimentés. L’article affirme que la meilleure méthode produite par l’AAR dépasse, en moyenne, les méthodes proposées par ces chercheurs après six heures. Il indique également que les orientations dirigées par des humains n’aboutissent pas à de meilleures performances. Cette comparaison porte sur les benchmarks d’alignement utilisés dans l’étude. Elle ne mesure pas une supériorité générale dans tous les travaux de recherche en IA. Anthropic chiffre par ailleurs le coût d’inférence de l’AAR à environ 4 dollars par heure. Le coût indiqué pour ses chercheurs humains atteint 150 dollars par heure. TechCrunch rapporte ces résultats dans son article du 28 août.
L’étude évoque une étape vers l’amélioration récursive des systèmes d’IA. Cette expression désigne ici la possibilité qu’un modèle améliore ses propres méthodes d’entraînement. L’article indique que l’AAR pourrait devenir pratique prochainement pour l’entraînement automatisé de l’alignement. Il avance aussi que des modèles capables d’améliorer cet entraînement pourraient ensuite améliorer plus largement les pratiques d’entraînement. Le texte présente cette extension comme une possibilité, et non comme un résultat établi par l’expérience. TechCrunch relie cette idée à l’hypothèse que les chercheurs humains puissent devenir obsolètes. Cette hypothèse figure dans le débat autour de l’amélioration récursive, mais l’expérience publiée porte uniquement sur 10 benchmarks d’alignement et leurs performances.
Les limites restent directement liées aux critères utilisés pour évaluer les modèles. Le système ne fonctionne que si les benchmarks représentent correctement les objectifs réels d’alignement, selon l’article. La conception et la maintenance de ces benchmarks demandent encore un travail important. Leur extension constitue également une tâche à maintenir. Le système dépend par ailleurs de la littérature utilisée par les chercheurs automatisés. Cette littérature doit elle aussi être entretenue et enrichie. Ces conditions encadrent la portée des résultats publiés par Anthropic. Elles signifient que l’amélioration observée concerne les comportements mesurés par les benchmarks de l’étude. Elles ne suffisent pas à établir une amélioration générale de tous les aspects de l’alignement.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés