En résumé
Lilian Weng a restructuré et enrichi son panorama des architectures Transformer.
La version 2.0 couvre notamment le codage positionnel et les contextes plus longs.
Les mécanismes d’attention multi-têtes répartissent le calcul entre plusieurs sous-espaces.
Le signal : Lilian Weng présente une version 2.0 de son panorama Transformer, environ deux fois plus longue que l’édition publiée en 2020.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
Version enrichie Lilian Weng présente une version 2.0 de son article consacré à la famille Transformer. Cette nouvelle édition reprend et réorganise son article de 2020. Elle ajoute également des travaux plus récents sur les architectures Transformer. Selon l’autrice, cette version constitue un sur-ensemble de l’ancienne. Le texte est désormais environ deux fois plus long. Sa table des matières couvre les bases du Transformer, l’attention, les architectures encodeur-décodeur et le codage positionnel. Elle aborde aussi les contextes plus longs, l’attention efficace et l’apprentissage par renforcement. L’article source est disponible sur le site de Lilian Weng.
Fondations techniques L’article rappelle que le Transformer original de Vaswani et ses coauteurs utilise une architecture encodeur-décodeur. L’encodeur empile six modules identiques. Chaque module comprend une attention auto-régressive multi-têtes et un réseau feed-forward appliqué à chaque élément de la séquence. Le décodeur reprend une structure similaire avec deux sous-modules d’attention. Son premier sous-module est masqué afin d’empêcher chaque position d’accéder aux positions futures. Des connexions résiduelles et une normalisation de couche entourent les sous-modules. Le texte distingue aussi les variantes encodeur seul, comme BERT, et décodeur seul, comme GPT, utilisées pour la modélisation du langage. L’article cite le papier original de Vaswani et al.. Wikipédia est également référencée pour l’analogie avec les méthodes non locales (https://en.wikipedia.org/wiki/Non-local_means).
Attention répartie L’auto-attention permet au modèle de pondérer les éléments d’un même échantillon. Le Transformer utilise une attention à produit scalaire mise à l’échelle. Les matrices de requêtes, de clés et de valeurs produisent une matrice d’attention de dimension L par L pour une séquence de longueur L. Le mécanisme multi-têtes divise ensuite les représentations en plusieurs sous-espaces. Chaque tête calcule son attention en parallèle. Les sorties sont concaténées, puis transformées par une matrice linéaire. Les matrices par tête ont notamment des dimensions liées à d et à h, où d désigne la taille du modèle et h le nombre de têtes. Tous les poids sont appris pendant l’entraînement. Ce fonctionnement est illustré par la figure 2 de Vaswani et al..
Positions encodées L’auto-attention est invariante par permutation. Le modèle a donc besoin d’un codage positionnel pour recevoir l’information d’ordre. Le Transformer original considère un codage sinusoïdal et un codage appris. Le codage sinusoïdal associe à chaque dimension une sinusoïde de longueur d’onde différente. Les longueurs d’onde vont de 2π à 10000 fois 2π. Le codage appris attribue à chaque position un vecteur entraînable. Des travaux cités dans l’article permettent aussi un apprentissage différent selon la couche. Le codage relatif de Shaw et ses coauteurs introduit l’information de position dans les clés et les valeurs. Il borne la position relative à une valeur maximale k, produisant 2k + 1 étiquettes possibles. L’autrice cite également Shaw et al. et les travaux de Al-Rfou et al..
Relations positionnelles Transformer-XL encode la position relative entre une requête et une clé. L’article décrit cette approche comme une reparamétrisation du produit scalaire entre clés et requêtes. Elle remplace la position absolue de la clé par un vecteur dépendant de l’écart entre les positions. Elle sépare aussi l’information de contenu et l’information de localisation dans les matrices de clés. Deux paramètres entraînables représentent des biais globaux de contenu et de position. Rotary Position Embedding, présenté par Su et ses coauteurs en 2021, utilise une matrice de rotation. Cette rotation applique un angle proportionnel à l’indice de position. L’article consacre enfin des sections aux contextes plus longs, à la mémoire externe, à l’attention creuse et à l’attention de faible rang.
Des voies d’optimisation multiples Ces différentes variantes cherchent à améliorer la capacité des modèles à conserver et exploiter l’information dans des séquences plus longues. Elles modifient soit la représentation de la position, soit la structure du calcul d’attention, soit la manière dont la mémoire est réutilisée. L’ensemble montre que la famille Transformer continue d’évoluer autour de plusieurs compromis : précision, coût de calcul, longueur du contexte et stabilité de l’apprentissage.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés