En résumé
Lilian Weng enrichit son panorama des architectures Transformer avec une version 2.0.
Le mécanisme d’attention sélective pondère les vecteurs de valeur selon les requêtes et les clés.
Les encodages positionnels ajoutent l’ordre des tokens à une opération d’auto-attention insensible aux permutations.
Le signal : La version 2.0 de Lilian Weng double la longueur du panorama Transformer publié trois ans après l’édition de 2020.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
Version enrichie Lilian Weng publie une version 2.0 de son panorama consacré à la famille Transformer. Cette édition reprend et restructure son article de 2020. Elle ajoute aussi des sections consacrées à des travaux plus récents. L’autrice présente cette nouvelle version comme un ensemble qui englobe l’ancienne. Le texte atteint environ deux fois la longueur du précédent. Son sommaire couvre les bases du Transformer, l’attention, les encodages positionnels, les contextes longs et l’attention efficace. Il aborde également la modélisation adaptative et les Transformers pour l’apprentissage par renforcement. La publication sert ainsi de cartographie technique des principales extensions proposées depuis environ trois ans. Lire l’article de Lilian Weng.
Architecture de base Le Transformer original de Vaswani et ses coauteurs repose sur une architecture encodeur-décodeur. L’encodeur produit une représentation fondée sur l’attention. Cette représentation permet de localiser une information dans un contexte étendu. L’architecture initiale empile six modules identiques. Chaque module associe une auto-attention multi-tête et un réseau entièrement connecté appliqué à chaque position. Des connexions résiduelles et une normalisation de couche entourent ces sous-modules. Le décodeur reprend une structure proche, mais il contient deux sous-modules d’attention multi-tête. Son premier sous-module est masqué. Ce masque empêche une position de consulter les positions futures. Les versions encodeur seul, comme BERT, et décodeur seul, comme GPT, ont ensuite été utilisées pour le langage.
Calcul des scores L’auto-attention permet au modèle de sélectionner des éléments d’un même échantillon. Elle produit une moyenne pondérée des vecteurs de valeur. Le poids dépend du produit scalaire entre une requête et une clé correspondante. La formule applique ensuite une fonction softmax. Pour une séquence de longueur L, la matrice d’auto-attention possède une forme L × L. L’attention multi-tête divise les représentations en sous-espaces. Elle calcule plusieurs attentions à produit scalaire mis à l’échelle, en parallèle. Les sorties obtenues sont concaténées, puis transformées par une matrice linéaire. Les matrices de poids sont apprises pendant l’entraînement. Cette organisation permet donc de traiter plusieurs sous-espaces de représentation dans un même module.
Ordre des tokens L’auto-attention est insensible aux permutations. Le modèle doit donc recevoir une information d’ordre distincte. L’encodage positionnel possède la même dimension que l’incorporation d’entrée. Il peut ainsi être ajouté directement à cette représentation. Le Transformer original utilise notamment un encodage sinusoïdal. Chaque dimension correspond à une sinusoïde d’une longueur d’onde différente. Les longueurs d’onde s’étendent de 2π à 10000 × 2π. D’autres méthodes apprennent directement les positions absolues. Elles peuvent aussi apprendre un encodage différent pour chaque couche. L’encodage relatif de Shaw représente plutôt l’écart entre deux positions. Sa valeur est limitée à une distance maximale k, créant 2k + 1 étiquettes relatives distinctes. Voir l’article fondateur.
Contexte étendu La version 2.0 rassemble plusieurs approches destinées aux séquences longues et à l’attention efficace. Transformer-XL encode la position relative entre une requête et une clé. Son mécanisme sépare les informations de contenu et de position dans le calcul du score. Il ajoute aussi deux biais entraînables, l’un pour le contenu et l’autre pour la localisation. Rotary Position Embedding, ou RoPE, encode la position absolue avec une matrice de rotation. Cette méthode fait tourner les caractéristiques selon un angle proportionnel à l’indice de position. Le texte présente également la mémoire externe non différentiable, les scores d’attention améliorés par la distance et les architectures récurrentes. Consulter Transformer-XL.
Méthodes spécialisées Le panorama traite enfin de plusieurs stratégies pour réduire ou adapter les calculs d’attention. L’attention creuse limite les connexions selon des motifs définis. Ces motifs peuvent utiliser un contexte local fixe ou des positions espacées. Une combinaison de contextes locaux et globaux est également présentée. L’attention fondée sur le contenu sélectionne les positions selon leurs représentations. L’attention de faible rang constitue une autre famille évoquée. Le texte couvre aussi les fenêtres d’attention adaptatives et la profondeur adaptative. Ces méthodes sont regroupées avec les Transformers destinés à l’apprentissage par renforcement. L’ensemble élargit donc l’article de 2020 vers des mécanismes positionnels, des contextes longs et des calculs plus ciblés.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés