Par Arthur Dekeyser
En résumé
Deux auteurs experts ont rejeté les articles produits par les agents.
Les agents ont dépensé moins de la moitié de leur budget d’API.
Les évaluations ombre testent des questions inédites avec des experts du domaine.
Le signal : Deux articles générés par des agents frontier ont été rejetés sans ambiguïté après six jours et plusieurs milliers de dollars de calcul.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
Deux expériences Sayash Kapoor, Arvind Narayanan et leurs collaborateurs ont testé des agents d’IA de pointe sur deux questions de recherche inédites. Chaque agent devait produire un article répondant à la question principale d’un article scientifique non publié. Les agents ont reçu plusieurs milliers de dollars de crédits API, des ressources de calcul et six jours de temps réel. Les auteurs originaux ont ensuite examiné les travaux produits. Ils ont rejeté sans ambiguïté les deux articles des agents. L’équipe a consacré plus de cent heures à l’analyse des journaux d’exécution. Cette approche vise à évaluer une recherche ouverte, plutôt que des tâches étroites dont le succès se vérifie rapidement.
Les tests classiques Les évaluations récentes montrent que les agents progressent sur des tâches à réussite facilement vérifiable. Ces résultats ont alimenté l’hypothèse d’une automatisation prochaine de la recherche en IA. Kapoor et Narayanan soulignent toutefois que la recherche scientifique exige souvent davantage. Les chercheurs doivent tester des hypothèses prometteuses, revenir sur une piste et envisager des approches inhabituelles. Le succès n’est pas toujours immédiatement observable. Leur méthode, appelée « shadow evaluation », fait travailler un agent sur une étude existante, sans lui donner accès aux résultats publiés. Des experts ayant travaillé plusieurs mois sur la question évaluent ensuite le résultat obtenu.
Un jugement insuffisant Les journaux montrent que les agents ont proposé des directions jugées intéressantes par les experts. Ils les ont rapidement abandonnées après avoir utilisé des données de faible qualité ou synthétiques. Les agents ont aussi terminé les deux expériences avec moins de 50 % du budget API consommé. Plusieurs heures restaient avant la date limite. Ils pouvaient pourtant suivre leur consommation et avaient reçu l’instruction d’utiliser leurs ressources. Les outils d’auto-évaluation ont identifié plusieurs problèmes relevés ensuite par les experts. Les agents ont surtout ajouté des réserves à leurs résultats existants. Ils ont également maintenu des pistes de recherche peu prometteuses.
Des consignes ignorées Les deux agents ont retiré leurs objectifs de recherche les plus ambitieux dès le premier jour. Aucun n’a ensuite modifié fondamentalement son approche. Ils n’ont pas respecté des règles précises sur la durée d’exploration, la fréquence des évaluations automatisées et la longueur maximale des articles. Les auteurs interprètent ces comportements comme des limites de jugement, de créativité et de retour en arrière. Ils indiquent aussi que leurs conclusions restent provisoires. L’étude ne porte que sur deux articles. Les évaluateurs savent que les textes sont générés par une IA. La conception et l’interprétation comportent donc une part de flexibilité.
Des tests à poursuivre L’équipe prévoit de répéter régulièrement ces évaluations ombre. Elle souhaite augmenter la taille de l’échantillon, tester de nouveaux modèles et examiner des améliorations de leur environnement d’exécution. Elle envisage aussi d’intégrer des collaborateurs adverses dans les prochaines équipes. Cette démarche doit mesurer la vitesse à laquelle un entraînement ciblé ou des améliorations techniques peuvent réduire les limites observées. Les auteurs veulent notamment distinguer un manque de créativité d’une incapacité à intégrer utilement les retours. Leur article présente la recherche ouverte comme un goulet d’étranglement encore non résolu pour l’automatisation complète de la recherche en IA. Ils précisent que son rôle exact dans l’auto-amélioration récursive reste à établir.
Une progression inégale Kapoor et Narayanan estiment que les agents pourraient continuer à progresser rapidement sur les tâches vérifiables, comme l’amélioration de l’efficacité des systèmes existants. Ils ne concluent pas que cette progression entraînera une auto-amélioration récursive générale ou une accélération explosive. D’autres limites pourraient aussi intervenir, notamment le calcul et la collecte de données issues d’expériences réelles. Les auteurs citent également les environnements d’apprentissage par renforcement et les infrastructures énergétiques des centres de données comme exemples de contraintes devenues importantes. Selon leur analyse, la loi d’Amdahl limiterait l’accélération globale si une composante lente restait indispensable. L’article complet est disponible sur Normal Tech, tandis que les travaux de Sayash Kapoor sont également accessibles en ligne.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés