# Les agents IA de Kapoor et Narayanan échouent en recherche

> Sayash Kapoor et Arvind Narayanan ont testé deux agents IA sur des recherches ouvertes : les experts ont rejeté leurs deux articles.

Type : Actualité IA · Catégorie : Tendances · Publié le 2026-09-10 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/les-experts-recalent-les-agents-ia-de-kapoor-et-narayanan
Tags : agents ia, recherche, automatisation, superintelligence, agents-ia

---

## En résumé

- Sayash Kapoor et Arvind Narayanan ont évalué deux agents IA sur des questions de recherche ouvertes.
- Les experts ont rejeté les deux articles produits après six jours et plusieurs milliers de dollars de calcul.
- Les chercheurs prévoient de répéter ces évaluations avec davantage de modèles et de participants.

**Le signal :** Deux agents IA ont consommé moins de 50 % de leur budget API avant le rejet de leurs articles par les chercheurs.

**Deux articles rejetés.** Sayash Kapoor et Arvind Narayanan ont testé la capacité d’agents IA avancés à conduire une [recherche](/signal-ia/actu/apple-etablit-la-p-completude-des-requetes-booleennes) ouverte. Leur étude, publiée le 5 août 2026, s’appuie sur deux articles non publiés. Les auteurs de ces travaux ont formulé leurs questions de recherche principales. Les agents ont ensuite tenté d’y répondre pendant six jours. L’équipe leur a accordé plusieurs milliers de dollars en crédits d’API et en ressources de calcul. Les auteurs originaux ont évalué les articles produits. Ils ont rejeté sans ambiguïté les deux textes. L’équipe de recherche a ensuite analysé les journaux d’exécution pendant plus de cent heures. Cette méthode vise une capacité plus large que les tâches dont le succès se vérifie rapidement.

**Des tests plus ouverts.** Les évaluations existantes mesurent surtout des tâches étroites et vérifiables. Elles ont montré que des agents progressaient sur ce type de problèmes au cours de l’année écoulée. Ces résultats ont alimenté des hypothèses sur une possible [automatisation](/signal-ia/actu/alvys-automatise-le-fret-avec-ses-agents-ia-foundry) de la recherche en IA. Kapoor et Narayanan soulignent toutefois que la recherche ouverte exige plusieurs décisions difficiles. Les chercheurs doivent tester des hypothèses prometteuses, revenir sur des pistes faibles et envisager des approches nouvelles. Le succès n’est pas toujours immédiatement observable. Leur méthode, appelée « shadow evaluation », fait suivre à l’agent une étude originale. Elle permet aussi à des experts ayant travaillé plusieurs mois sur la question d’examiner directement le résultat.

## Les agents épuisent mal leurs ressources

**Des jugements insuffisants.** Les agents ont proposé des directions jugées impressionnantes par les experts. Ils les ont pourtant rapidement écartées après avoir utilisé des données de faible qualité ou synthétiques. Les deux expériences se sont terminées avec moins de 50 % du budget d’API dépensé. Plusieurs heures restaient également avant l’échéance. Les agents pouvaient suivre leur consommation et avaient reçu pour consigne d’utiliser leurs ressources. Ils n’ont donc pas exploité entièrement le temps ni les crédits attribués. L’équipe rapporte aussi une mauvaise réaction aux retours. Les autoévaluations des agents avaient identifié plusieurs problèmes relevés ensuite par les experts. Les systèmes ont surtout ajouté des réserves à leurs résultats ou maintenu des pistes peu prometteuses.

**Des consignes peu suivies.** Les agents ont abandonné leurs objectifs de recherche les plus ambitieux dès le premier jour. Aucun n’a ensuite modifié fondamentalement son approche. Ils n’ont pas respecté plusieurs instructions concrètes sur le temps consacré à l’exploration. Ils ont aussi ignoré la fréquence demandée pour les contrôles par des outils d’autoévaluation. Les limites strictes de longueur des articles n’ont pas été suivies non plus. Les chercheurs distinguent plusieurs interprétations possibles de ces observations. Certains collaborateurs estiment que les agents manquent de créativité. D’autres évoquent plutôt un verrouillage épistémique et une mauvaise intégration des retours. L’équipe a recherché des collaborateurs ne partageant pas tous les mêmes hypothèses initiales.

## Les évaluations doivent encore s’élargir

**Des limites méthodologiques.** Les experts savaient que les articles venaient d’une IA. Ils pouvaient donc préférer l’approche suivie dans leur propre travail. L’étude ne porte que sur deux articles, car chaque [évaluation](/signal-ia/actu/decodo-revele-le-talon-dachille-des-agents-ia) demande une analyse approfondie. La conception, l’exécution et l’interprétation laissent aussi une marge de décision aux chercheurs. Les auteurs indiquent que leurs positions sur l’amélioration récursive et la superintelligence peuvent influencer l’étude. Ils décrivent leurs désaccords et les mesures prises pour les examiner. Pour les prochaines évaluations, ils envisagent d’intégrer des collaborateurs adversariaux. L’équipe prévoit également d’augmenter l’échantillon, de tester de nouveaux modèles et d’améliorer les dispositifs qui encadrent les agents. [Lire l’étude originale](https://www.normaltech.ai/p/ai-agents-cant-yet-do-open-ended) et [suivre Sayash Kapoor](https://substack.com/@sayash).
