Par Arthur Dekeyser
En résumé
DEEPAMBIGQA contient 3 600 questions multi-hop, dont la moitié exige de résoudre explicitement une ambiguïté de nom.
GPT-5 atteint seulement 0,13 en exact match sur les questions ambiguës et 0,21 sur les questions non ambiguës.
Les auteurs proposent DEEPAMBIGQAGEN, un pipeline fondé sur des corpus textuels et un graphe de connaissances lié.
Le signal : Sur les 3 600 questions de DEEPAMBIGQA, GPT-5 n'atteint que 0,13 en exact match lorsque les noms sont ambigus.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs
Les grands modèles de langage (LLM) équipés d’outils de recherche montrent des capacités prometteuses pour répondre à des questions ouvertes. Ils rencontrent toutefois des difficultés lorsqu’une question exige à la fois de lever une ambiguïté sur un nom et de réunir des informations dispersées au fil de plusieurs étapes de raisonnement. C’est le problème étudié par le papier DeepAmbigQA: Ambiguous Multi-hop Questions for Benchmarking LLM Answer Completeness, publié en août 2026 dans les domaines des bases de connaissances, de la recherche, ainsi que du traitement automatique de la parole et du langage naturel.
L’exemple donné par les auteurs est la question suivante : « Which actor from the film Heat won at least one Academy Award? » Pour y répondre complètement, un système doit d’abord distinguer plusieurs films portant le même titre, puis examiner un ensemble important d’acteurs avant de rassembler et d’intégrer les éléments de preuve pertinents. Selon les auteurs, les benchmarks existants évaluent rarement ces deux difficultés de manière conjointe.
Pour répondre à cette limite, l’équipe présente DEEPAMBIGQAGEN, un pipeline automatique de génération de données. Celui-ci construit des tâches de questions-réponses à partir de corpus textuels et d’un graphe de connaissances lié. Les questions produites sont conçues pour être naturelles et vérifiables, tout en intégrant systématiquement une ambiguïté de nom et un raisonnement en plusieurs étapes.
À partir de ce pipeline, les chercheurs ont constitué DEEPAMBIGQA, un jeu de données comprenant 3 600 questions. Toutes nécessitent un raisonnement multi-hop, c’est-à-dire l’enchaînement de plusieurs étapes pour établir une réponse. La moitié des questions impose explicitement de résoudre une ambiguïté de nom. Le benchmark vise ainsi moins la seule capacité à trouver une information que la capacité à collecter un ensemble de réponses et à le restituer de façon complète.
Les expériences indiquent que même GPT-5, présenté dans le papier comme un modèle de pointe, produit des réponses incomplètes. Il obtient un score exact de 0,13 sur les questions ambiguës, contre 0,21 sur les questions non ambiguës. Les auteurs en déduisent que les systèmes de question-réponse doivent encore gagner en robustesse pour les tâches de collecte d’informations et de complétude des réponses. Ce résultat s’inscrit dans une tendance plus large : les chatbots LLM cherchent encore leur objectif et les méthodes d’évaluation existantes, comme MMLU, les vérificateurs et les juges fondés sur des modèles, ne captent pas toutes les dimensions de performance nécessaires. Jiabao Ji, Min Li, Priyanshu Kumar, Shiyu Chang et Saloni Potdar signent cette étude. Jiabao Ji et Shiyu Chang sont affiliés à l’Université de Californie à Santa Barbara, tandis que le travail a été réalisé alors que Jiabao Ji travaillait chez Apple.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs