The Transformer Family 2.0 double son analyse du Transformer
3 min · 17 septembre 2026

The Transformer Family 2.0 double son analyse du Transformer

Par Arthur Dekeyser

En résumé

1

La version 2.0 réorganise et enrichit l’analyse publiée en 2020.

2

Le Transformer utilise l’attention pour pondérer les valeurs selon les requêtes et les clés.

3

Les encodages relatifs et rotatifs ajoutent des informations de position aux séquences.

💡

Le signal : La version 2.0 de The Transformer Family est environ deux fois plus longue que l’édition de 2020.

NEWSLETTER BUSINESS & IA

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés

Version enrichie La version 2.0 de The Transformer Family réorganise et enrichit un article publié en 2020. L’auteur indique que cette nouvelle édition est un surensemble de l’ancienne. Elle atteint environ deux fois sa longueur. Le texte présente des améliorations d’architecture proposées depuis la précédente publication. Il restructure aussi la hiérarchie des sections. Le contenu couvre les bases du Transformer, l’attention, les encodages positionnels et les architectures adaptées aux contextes longs. Il aborde également l’attention efficace, les motifs d’attention creux et les applications aux systèmes d’apprentissage par renforcement. Cette synthèse s’appuie notamment sur l’article fondateur de Vaswani et al., publié sur arXiv.

Mécanisme central Le Transformer classique repose sur une architecture encodeur-décodeur, couramment utilisée dans plusieurs modèles de traduction automatique. Des versions simplifiées ont ensuite obtenu de bonnes performances en modélisation du langage. BERT utilise uniquement un encodeur, tandis que GPT utilise uniquement un décodeur. L’attention permet au modèle de sélectionner des éléments d’un ensemble de données pour produire une prédiction. L’auto-attention utilise d’autres parties du même échantillon. Elle reste toutefois invariante par permutation, car elle opère sur un ensemble. Le Transformer emploie une attention par produit scalaire normalisé. Les requêtes, les clés et les valeurs déterminent ensuite une moyenne pondérée des vecteurs de valeur.

Les têtes répartissent l’attention

Calcul parallèle L’attention multi-tête divise les entrées en plusieurs sous-espaces. Chaque tête calcule en parallèle une attention par produit scalaire normalisé. Les sorties obtenues sont ensuite concaténées, puis transformées linéairement vers les dimensions attendues. Les matrices de poids des requêtes, des clés et des valeurs sont apprises pendant l’entraînement. Dans l’architecture classique, l’encodeur comprend une pile de six modules identiques. Chaque module contient une couche d’auto-attention multi-tête et un réseau entièrement connecté appliqué point par point. Des connexions résiduelles et une normalisation de couche entourent chaque sous-module. Le décodeur ajoute une seconde sous-couche d’attention multi-tête et masque la première pour empêcher l’accès aux positions futures.

Ordre des tokens L’auto-attention ne fournit pas directement l’ordre des éléments, puisque son opération est invariante par permutation. Le Transformer ajoute donc une matrice d’encodage positionnel aux représentations d’entrée. Cette matrice possède les mêmes dimensions que les plongements d’entrée. L’édition classique présente un encodage sinusoïdal et un encodage appris. Le premier associe chaque dimension à une sinusoïde de longueur d’onde différente. Les longueurs d’onde vont de 2π à 10000 × 2π. Le second attribue à chaque position un vecteur appris. Cet encodage peut également être appris différemment selon la couche, comme le décrivent Gehring et al. et Al-Rfou et al..

Les positions deviennent relatives

Nouvelles représentations Les encodages relatifs placent l’information de position dans les calculs d’attention. Shaw et al. incorporent cette information aux matrices des clés et des valeurs. La position relative maximale est limitée par une valeur absolue k. Cette limitation fournit 2k + 1 étiquettes relationnelles distinctes et permet au modèle de généraliser à des longueurs de séquence non vues. Transformer-XL encode plutôt le décalage entre une requête et une clé. Sa reparamétrisation sépare l’information de contenu et l’information de position. Elle utilise aussi deux paramètres entraînables pour les biais globaux de contenu et de localisation. Transformer-XL formalise cette approche dans des séquences segmentées.

Rotation des représentations Rotary Position Embedding, ou RoPE, encode la position absolue avec une matrice de rotation. Cette méthode multiplie les matrices de clés et de valeurs de chaque couche d’attention par cette rotation. L’objectif mathématique consiste à faire dépendre le produit interne de la position relative entre deux éléments. RoPE représente alors la position relative comme une rotation dans l’espace euclidien. L’angle de rotation dépend de l’indice de position. Cette approche s’ajoute à l’ensemble des méthodes présentées dans la version 2.0, qui traite aussi la mémoire de contexte, les fenêtres d’attention adaptatives et les formes d’attention efficaces. Le texte poursuit ensuite vers les motifs locaux, striés, globaux et fondés sur le contenu.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs abonnés

À lire aussi