# Kapoor et Narayanan retoquent les articles des agents IA

> Sayash Kapoor et Arvind Narayanan ont testé deux agents sur des recherches ouvertes : les auteurs experts ont rejeté leurs deux articles.

Type : Actualité IA · Catégorie : Tendances · Publié le 2026-09-18 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/les-agents-ia-echouent-au-test-de-kapoor-et-narayanan
Tags : agents, recherche, automatisation, alignement, agents-ia

---

## En résumé

- Sayash Kapoor et Arvind Narayanan ont évalué deux agents sur des questions de recherche ouvertes.
- Les experts ont rejeté les deux articles produits après six jours et plusieurs milliers de dollars de calcul.
- Les agents ont mal utilisé leurs ressources et n’ont pas corrigé leurs approches après des retours négatifs.

**Le signal :** Deux agents ont dépensé moins de 50 % de leur budget d’API avant l’échéance, puis leurs deux articles ont été rejetés.

**Deux [agents](/signal-ia/actu/agents-ia-executent-des-sms-efficacite-prouvee) évalués** Sayash Kapoor et Arvind Narayanan ont testé des agents d’IA de pointe sur une recherche ouverte. L’expérience visait deux questions principales tirées de travaux universitaires non publiés. Les auteurs originaux ont demandé aux agents de rédiger les articles correspondants. Chaque agent disposait de plusieurs milliers de dollars de crédits d’API et de calcul. Il bénéficiait aussi de six jours calendaires pour conduire l’étude. Les auteurs experts ont ensuite examiné les textes produits. Ils ont rejeté sans ambiguïté les deux articles des agents. L’équipe a consacré plus de cent heures à l’analyse des journaux d’exécution. Cette méthode est présentée dans l’essai publié par [Sayash Kapoor et Arvind Narayanan](https://www.normaltech.ai/p/ai-agents-cant-yet-do-open-ended) le 5 août 2026.

**Les repères restent étroits** Les évaluations récentes testent surtout des tâches dont la réussite est facilement vérifiable. Ces exercices montrent que les agents peuvent progresser dans certains domaines précis. La [recherche](/signal-ia/actu/jakub-pachocki-appelle-openai-a-freiner-ses-agents) en IA comporte toutefois des questions dont la réponse n’est pas immédiatement vérifiable. Les chercheurs doivent alors tester des hypothèses prometteuses, revenir sur leurs choix ou explorer des pistes inhabituelles. Les auteurs de l’étude ont conçu les « shadow evaluations » pour reproduire cette situation. L’agent travaille sur une étude existante, inaccessible en ligne et inconnue de son entraînement. Des experts ayant travaillé plusieurs mois sur la question évaluent ensuite directement le résultat obtenu.

## Deux articles rejetés par les experts

**Les agents ont mal jugé** Les agents ont parfois proposé des directions jugées intéressantes par les experts. Ils les ont ensuite abandonnées rapidement après avoir utilisé des données de faible qualité ou synthétiques. Les deux exécutions se sont terminées avec moins de 50 % du budget d’API dépensé. Elles ont aussi conservé plusieurs heures avant la date limite. Les agents pouvaient pourtant suivre leur consommation et avaient reçu l’instruction d’utiliser leur budget. Ils ont également abandonné leurs objectifs les plus ambitieux dès le premier jour. Après cette décision, aucun des deux n’a modifié fondamentalement son approche. Ces comportements ont limité leur capacité à explorer des solutions concurrentes.

**Les retours n’ont pas suffi** Les outils d’auto-évaluation des agents avaient identifié plusieurs problèmes relevés ensuite par les experts. Les agents n’ont pourtant pas traité ces objections avec une nouvelle stratégie. Face aux retours négatifs, ils ont surtout ajouté des réserves à leurs résultats existants. Ils ont aussi maintenu des directions de recherche jugées peu prometteuses. Les agents ont par ailleurs ignoré des consignes concrètes sur le temps d’exploration, la fréquence des évaluations et la longueur maximale des articles. Les auteurs signalent plusieurs limites à leur méthode, dont un échantillon de seulement deux articles et la flexibilité nécessaire à la conception de chaque évaluation.

## Les limites restent à mesurer

**Les auteurs poursuivront les tests** Kapoor, Narayanan et leurs collaborateurs prévoient de répéter régulièrement ces évaluations. Ils veulent augmenter la taille de l’échantillon, tester de nouveaux modèles et étudier des améliorations de leur environnement d’exécution. Ils envisagent aussi d’intégrer des collaborateurs adverses dans l’équipe centrale. Les résultats actuels restent donc provisoires. Ils indiquent néanmoins que les agents de pointe rencontrent encore des difficultés dans la recherche ouverte. Les auteurs distinguent cette capacité des tâches vérifiables, comme l’amélioration de l’efficacité des systèmes existants. Ils observent que les progrès peuvent être rapides dans ces tâches, sans établir qu’ils conduisent à une amélioration récursive générale.

**Les goulets restent multiples** L’étude identifie la recherche ouverte comme un goulet d’étranglement possible pour l’[automatisation](/signal-ia/actu/sayash-kapoor-et-arvind-narayanan-rejettent-deux-agents-ia) complète de la recherche en IA. Les auteurs citent aussi les limites de calcul et la collecte de données issues d’expériences réelles. Ils relient cette question à la loi d’Amdahl : accélérer cent fois les parties automatisables peut produire un gain global réduit si un composant plus lent bloque l’ensemble. Cette conséquence reste conditionnelle aux résultats futurs. Les auteurs veulent mesurer la vitesse à laquelle l’entraînement ciblé et les améliorations d’environnement peuvent réduire les défauts de créativité et de jugement observés. [L’essai complet](https://www.normaltech.ai/p/ai-agents-cant-yet-do-open-ended) détaille leur méthode et leurs réserves.
