En résumé
Lilian Weng refond son panorama des architectures Transformer.
La version 2.0 couvre l’attention, la mémoire et les encodages positionnels.
Le texte présente des variantes pour les longs contextes et l’apprentissage par renforcement.
Le signal : La version 2.0 de Lilian Weng double la longueur de son panorama publié en 2020 et intègre plusieurs architectures récentes.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
Version refondue Lilian Weng présente la version 2.0 de son article consacré à la famille Transformer. Cette édition reprend et enrichit son texte publié en 2020. Elle réorganise la hiérarchie des sections et ajoute des travaux plus récents. L’autrice indique que cette nouvelle version constitue un superset de l’ancienne. Elle représente environ deux fois sa longueur. Le panorama couvre les bases du Transformer, l’attention et l’auto-attention. Il traite aussi des architectures encodeur-décodeur, des représentations positionnelles et des contextes longs. La dernière partie aborde notamment l’attention efficace, les motifs clairsemés et les Transformers appliqués à l’apprentissage par renforcement. Lire l’article de Lilian Weng.
Mécanisme central Le Transformer utilise une architecture encodeur-décodeur dans sa forme initiale, présentée par Vaswani et ses coauteurs en 2017. L’auto-attention permet au modèle d’utiliser différentes parties d’un même échantillon pour produire une prédiction. L’attention produit une somme pondérée des vecteurs de valeur. Les poids dépendent du produit scalaire entre une requête et une clé, avec une mise à l’échelle par la racine de la dimension des clés. L’attention multi-tête répartit ensuite les entrées dans plusieurs sous-espaces traités en parallèle. Les sorties sont concaténées, puis transformées linéairement. L’article renvoie au papier fondateur du Transformer.
Ordre des séquences L’auto-attention est invariante par permutation. Le modèle a donc besoin d’un encodage positionnel pour recevoir l’information d’ordre. L’encodage positionnel possède la même dimension que les représentations d’entrée. Il peut ainsi être ajouté directement à ces représentations. Le Transformer initial proposait un encodage sinusoïdal, construit avec des fonctions sinus et cosinus de longueurs d’onde différentes. D’autres travaux ont utilisé des encodages positionnels appris. Ces vecteurs peuvent représenter chaque position absolue. Al-Rfou et ses coauteurs ont aussi étudié un apprentissage différent selon les couches. L’article présente également les encodages relatifs et leurs représentations apprenables.
Positions relatives Shaw et ses coauteurs ont intégré l’information positionnelle relative dans les matrices de clés et de valeurs. La position relative maximale est limitée par une valeur absolue k. Cette limitation produit 2k + 1 étiquettes relationnelles distinctes et permet de généraliser à des longueurs de séquence inédites. Transformer-XL, présenté par Dai et ses coauteurs en 2019, encode plutôt l’écart entre deux positions. Son mécanisme sépare l’information de contenu et l’information de localisation. Il utilise aussi deux paramètres entraînables pour les biais globaux. RoPE, proposé par Su et ses coauteurs en 2021, encode la position par une rotation proportionnelle à l’indice de position.
Mémoire et efficacité La version 2.0 examine plusieurs approches destinées aux contextes longs. Elle décrit une mémoire de contexte, une mémoire externe non différentiable et des scores d’attention renforcés par la distance. Une autre section présente une attention adaptative dont l’étendue peut varier. Le texte aborde aussi des modèles dont la profondeur s’adapte. Pour réduire le coût de l’attention, l’article recense des mécanismes efficaces et des motifs clairsemés. Ces motifs comprennent des contextes locaux fixes, des contextes parcourus par pas et des combinaisons de contextes locaux et globaux. Le panorama couvre enfin l’attention fondée sur le contenu et l’attention de faible rang.
Applications et références L’article ne se limite pas aux modèles de langage. Il consacre une section aux Transformers pour l’apprentissage par renforcement. La présentation relie également les architectures aux composants fondamentaux du modèle original. L’encodeur est décrit comme une pile de six modules identiques. Chaque module contient une couche d’auto-attention multi-tête et un réseau d’alimentation directe appliqué élément par élément. Le décodeur ajoute une seconde sous-couche d’attention et masque la première pour empêcher l’accès aux positions futures. Les références citées incluent Vaswani, Shaw, Dai, Su, Gehring et Al-Rfou. Consulter les références arXiv citées.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés