Par Arthur Dekeyser
En résumé
Les chercheurs ont exposé une faille dans les LLM lors de l'ICML 2026.
Des attaques exploitent des confusions dans le traitement des instructions.
Les rôles joués par les texte dans les LLM rendent ces modèles vulnérables.
Le signal : Les chercheurs Cui et Ye démontrent des failles critiques dans les LLM lors de la conférence ICML 2026.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
Une faille fondamentale dans le fonctionnement des grands modèles de langage (LLM) les rend vulnérables aux attaques, selon une équipe de chercheurs qui a présenté ses conclusions à l’International Conference on Machine Learning (ICML). Cette vulnérabilité touche le processus par lequel les LLM identifient l’origine des instructions qu’ils reçoivent, ce qui permet aux attaquants de manipuler les modèles pour produire des informations sensibles qu’ils ont été formés à ne pas divulguer, comme des instructions pour synthétiser de la cocaïne ou saboter un avion commercial.
Les attaques identifiées par les chercheurs Jasmine Cui et Charles Ye démontrent que les LLM peuvent être trompés en utilisant un style textuel précis qui imite leurs propres notes internes. Parmi les exemples fournis, des modèles comme GPT-5 réagissent à des instructions basées sur des prétextes triviaux, exposant un risque important pour la sécurité des systèmes qui reposent sur cette technologie. Les chercheurs ont montré que ces types d’attaques ne se limitent pas aux modèles existants, mais peuvent potentiellement affecter les versions futures, soulignant une vulnérabilité persistante dans l’architecture même des modèles.
L’efficacité des attaques de type pensée en chaîne a été mise en évidence par Cui et Ye. Ils ont révélé un nouveau type d’attaque baptisé “chaîne de pensée forgée”, qui consiste à manipuler le LLM en altérant le contexte d’exécution des instructions. Dans leurs expériences, remplacer les balises attribuant un rôle aux textes ne modifie pas le comportement du modèle, ce qui signifie que l’identification des rôles par le LLM repose davantage sur le style du texte que sur les balises structurantes. Cette découverte est cruciale car elle indique que les méthodes de sécurité conventionnelles, qui s’appuient sur des balises et des formats spécifiques, peuvent être inefficaces.
Le défi de rendre ces modèles invulnérables est renforcé par le fait que les attaques ne peuvent jamais être totalement évitées. Les attaques surviennent malgré les entraînements sophistiqués visés à renforcer leur résistance. Les chercheurs ont découvert que peu importe le nombre d’exceptions programmées, le problème fondamental de l’identification incorrecte des rôles persiste. Cela implique que les efforts pour sécuriser les LLM nécessitent une approche fondamentalement nouvelle qui pourrait impliquer une révision complète de la base théorique qui sous-tend ces modèles.
Les entreprises investissent dans ce qu’elles appellent le “red-teaming”, c’est-à-dire l’encadrement de modèles pour identifier et combler les failles, souvent avec l’aide de modèles spécialistes comme GPT-Red d’OpenAI. Cependant, malgré ces efforts, les modèles continuent de se tromper lorsqu’ils sont confrontés à des textes imitant des instructions internes. Florian Tramèr, expert en cybersécurité à l’ETH de Zurich, note que même si les modèles avancés sont plus résistants qu’avant, cela reste insuffisant pour des cas très sensibles. Il souligne que les modèles doivent évoluer au-delà des simples correctifs pour atteindre une vraie robustesse.
Pour découvrir davantage sur les failles fondamentales des LLM et les débats autour de leur sécurité, vous pouvez consulter l’article original sur MIT Technology Review. Ainsi, à travers ces discussions approfondies, on comprend l’urgence d’une action collective dans la communauté de la recherche en intelligence artificielle, visant à repenser les structures de sécurité des LLM et à empêcher leur exploitation future.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés