# Google met au jour le trou de mémoire des IA de pointe

> Google montre que les LLM de pointe encodent 95 à 98 % des faits testés, mais peinent à en rappeler jusqu’à 34 % directement.

Type : Actualité IA · Catégorie : Tendances · Publié le 2026-08-18 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/google-revele-le-talon-dachille-des-modeles-de-pointe
Tags : ia, google, llm, référencement, recherche, chatgpt, gemini, raisonnement

---

## En résumé

- Google estime que les LLM de pointe encodent 95 à 98 % des faits testés.
- Les modèles rappellent moins bien un fait lorsque la question inverse l’ordre sujet-objet appris.
- Le raisonnement supplémentaire récupère 40 à 65 % des faits auparavant impossibles à rappeler directement.

**Le signal :** Google identifie le rappel, plutôt que l’encodage, comme un obstacle majeur des LLM de pointe, avec 26 à 34 % de faits non rappelés.

**Google publie** une nouvelle étude sur le rappel factuel des grands modèles de langage. Les chercheurs ont testé des modèles de pointe, dont Gemini-3-Pro et GPT-5. Ils constatent que ces modèles encodent 95 à 98 % des faits étudiés. Pourtant, ils ne rappellent pas directement 26 à 34 % de ces faits lorsqu’une question leur est posée. Même avec une étape de [raisonnement](/signal-ia/actu/google-deepmind-gemini-robotics-2-bouscule-la-robotique), 11 à 12 % restent difficiles à rappeler. L’étude indique ainsi que le rappel représente plus de 70 % des erreurs de GPT-5.2. Google présente ces résultats dans l’article [Empty Shelves or Lost Keys?](https://arxiv.org/pdf/2602.14080), consacré à la factualité paramétrique.

**Le rappel bloque** l’accès à des informations déjà apprises pendant l’entraînement. Les chercheurs définissent l’information paramétrique comme celle que le modèle a encodée depuis des pages web, des livres, des paroles, du code ou des instructions. Leur résultat écarte donc, pour ces modèles de pointe, l’idée que chaque erreur vient d’un manque d’informations apprises. L’encodage est décrit comme proche de la saturation, tandis que le rappel ne l’est pas. Cette distinction sépare la présence d’un fait dans le modèle de sa récupération lors d’une requête. [L’explication de Google](https://research.[google](/signal-ia/actu/llm-gemini-033-prend-en-charge-gemini-37-flash)/blog/empty-shelves-or-lost-keys-recall-is-the-bottleneck-for-parametric-factuality/) reprend cette conclusion.

## Les entités inversées compliquent le rappel

**L’ordre appris** influence la facilité de récupération d’un fait. Dans une phrase source, le sujet est l’entité qui apparaît d’abord, tandis que l’objet apparaît ensuite. Google donne l’exemple suivant : Oasis a joué son premier concert au Boardwalk club. Oasis constitue le sujet, et le Boardwalk club constitue l’objet. Une question demandant le sujet correspond à une question directe. Une question demandant l’objet depuis l’entité opposée constitue une question inversée. Les modèles rappellent moins bien le fait lorsque la requête inverse cet ordre rencontré pendant l’entraînement. L’étude ne précise toutefois pas le mécanisme expliquant précisément cette différence.

**Le choix multiple** fournit un indice supplémentaire sur la nature du problème. Lorsqu’une réponse correspondant aux entités inversées apparaît parmi plusieurs options, le modèle peut reconnaître le fait. Les chercheurs utilisent ce résultat pour montrer que l’information est encodée et identifiable. Ils ne donnent pas d’explication à cette capacité de reconnaissance en choix multiple. La reformulation des questions a, de son côté, un effet insignifiant sur le rappel. L’ordre sujet-objet produit donc une différence plus visible que la formulation employée. Les modèles rencontrent aussi davantage de difficultés avec les faits rares. L’écart d’encodage entre faits populaires et rares reste limité, mais l’écart de rappel augmente.

## Le raisonnement récupère des faits encodés

**Le raisonnement supplémentaire** permet aux modèles de retrouver 40 à 65 % des faits encodés qu’ils ne rappelaient pas directement. Cette méthode ne résout toutefois pas entièrement le problème. Elle coûte davantage en calcul, selon les chercheurs. Il faut aussi déterminer quand déclencher cette étape supplémentaire. Google indique enfin que l’augmentation de la taille des modèles de pointe ne constitue pas une solution au problème du rappel. Ces résultats déplacent donc l’attention vers l’accès aux connaissances déjà présentes. Ils ne démontrent pas qu’une architecture ou une méthode précise résoudra durablement cette limite. L’étude mesure un comportement observé sur les faits testés.
