Lilian Weng double son guide sur les Transformers
3 min · 9 septembre 2026

Lilian Weng double son guide sur les Transformers

Par Arthur Dekeyser

En résumé

1

Lilian Weng publie une version 2.0 de son panorama des architectures Transformer.

2

La nouvelle édition est environ deux fois plus longue que le texte de 2020.

3

Le dossier présente l’attention, les encodages positionnels et plusieurs pistes d’efficacité.

💡

Le signal : Lilian Weng présente une version 2.0 de son panorama Transformer, environ deux fois plus longue que l’édition de 2020.

NEWSLETTER BUSINESS & IA

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés

Une refonte substantielle Lilian Weng publie une version 2.0 de son article consacré à la famille Transformer. Cette nouvelle édition reprend et enrichit son texte de 2020. Elle représente environ deux fois sa longueur précédente. L’autrice indique avoir réorganisé la hiérarchie des sections. Elle ajoute également des travaux plus récents sur les architectures Transformer. Le dossier couvre les notations, les bases du Transformer, l’attention et l’auto-attention. Il présente aussi les encodages positionnels, les contextes longs et l’attention efficace. La page rassemble enfin des développements consacrés à l’apprentissage par renforcement. Lire la version 2.0 de Lilian Weng

Le Transformer originel Le Transformer de Vaswani et ses coauteurs utilise une architecture encodeur-décodeur. Son encodeur produit une représentation fondée sur l’attention. Il contient une pile de six modules identiques. Chaque module associe une attention multi-têtes et un réseau entièrement connecté appliqué point par point. Des connexions résiduelles et une normalisation de couche entourent ces sous-modules. Le décodeur reprend une structure proche, avec deux sous-modules d’attention multi-têtes. Son premier sous-module est masqué. Cette opération empêche les positions de consulter les éléments futurs. Des variantes simplifiées ont ensuite obtenu de bonnes performances avec BERT côté encodeur et GPT côté décodeur.

Lilian Weng détaille l’attention

Des poids appris L’attention permet au modèle de sélectionner les données pertinentes pour produire une prédiction. Des poids appris déterminent généralement une moyenne pondérée des valeurs. L’auto-attention utilise d’autres parties du même échantillon pour traiter une observation. Le Transformer s’appuie sur une attention à produit scalaire mise à l’échelle. Celle-ci combine des matrices de requêtes, de clés et de valeurs. Le score utilise le produit scalaire entre une requête et une clé, divisé par la racine de la dimension des clés. L’attention multi-têtes répète ce calcul sur plusieurs sous-espaces. Les sorties sont ensuite concaténées, puis transformées linéairement.

L’ordre des séquences L’auto-attention est invariante par permutation. Le modèle doit donc recevoir une information sur la position des éléments. L’encodage positionnel possède la même dimension que les représentations d’entrée. Il peut ainsi être ajouté directement à celles-ci. Le Transformer originel prévoit un encodage sinusoïdal et un encodage appris. Le premier associe différentes dimensions à des sinusoïdes de longueurs d’onde distinctes. Le second attribue à chaque position un vecteur appris. Shaw et ses coauteurs ajoutent des informations positionnelles relatives aux clés et aux valeurs. Transformer-XL encode également les écarts de position entre requêtes et clés. Voir l’article fondateur du Transformer

Plusieurs pistes prolongent les Transformers

Des architectures spécialisées La version 2.0 présente plusieurs méthodes pour traiter des contextes plus longs. Transformer-XL encode les positions relatives entre segments. RoPE, proposé par Su et ses coauteurs, injecte une information positionnelle relative au moyen d’une rotation. Le dossier examine aussi la mémoire de contexte et la mémoire externe non différentiable. D’autres sections portent sur les scores d’attention améliorés par la distance. Elles décrivent également des modèles récurrents et des mécanismes d’adaptation. L’attention peut être rendue plus efficace avec des contextes locaux, des contextes espacés ou une combinaison de contextes locaux et globaux. Consulter les travaux de Transformer-XL

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs abonnés

À lire aussi