# Lilian Weng refond son guide Transformer, deux fois plus long

> Lilian Weng enrichit son guide sur les Transformers avec une version deux fois plus longue, couvrant attention, mémoire et encodage positionnel.

Type : Actualité IA · Catégorie : Outils · Publié le 2026-09-01 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/lilian-weng-devoile-la-version-20-de-son-guide-transformer
Tags : transformers, attention, modèles de langage, encodage positionnel, benchmark

---

## En résumé

- Lilian Weng enrichit son guide consacré aux architectures Transformer.
- L’attention multi-tête répartit le calcul sur plusieurs sous-espaces en parallèle.
- Les encodages positionnels fournissent l’ordre absent de l’auto-attention.

**Le signal :** Lilian Weng présente une Version 2.0 de son guide, environ deux fois plus longue que l’édition de 2020.

**Version enrichie** Lilian Weng présente la version 2.0 de son article consacré à la famille des [Transformers](/signal-ia/actu/apple-revolutionne-laudio-synthese-16x-acceleree). Cette nouvelle édition reprend et réorganise son texte de 2020. Elle ajoute des sections sur des améliorations architecturales publiées depuis la première version. L’autrice indique que cette édition constitue un surensemble de l’ancienne. Elle précise aussi qu’elle est environ deux fois plus longue. Le guide couvre les bases du Transformer, l’attention, les architectures encodeur-décodeur et plusieurs méthodes d’encodage positionnel. Il aborde également les contextes plus longs, la mémoire, l’attention efficace et l’apprentissage par renforcement. [Lire la version 2.0 de Lilian Weng](https://lilianweng.github.io/posts/2023-01-27-the-transformer-family-v2/). La publication est datée du 1er septembre 2026 dans cette édition.

**Architecture fondatrice** Le Transformer original, présenté par Vaswani et ses coauteurs en 2017, repose sur une architecture encodeur-décodeur. L’encodeur produit une représentation fondée sur l’attention. Le décodeur récupère ensuite des informations dans cette représentation encodée. Dans le modèle vanilla, l’encodeur comprend une pile de six modules identiques. Chaque module associe une auto-attention multi-tête et un réseau entièrement connecté appliqué point par point. Des connexions résiduelles et une normalisation de couche entourent les sous-modules. Le décodeur possède deux sous-modules d’attention multi-tête. Son premier sous-module est masqué, afin d’empêcher chaque position d’accéder aux positions futures. Des versions simplifiées ont ensuite été utilisées pour BERT et GPT.

## L’attention répartit les représentations

**Calcul de l’attention** L’auto-attention compare les éléments d’une même séquence. Elle utilise des matrices de requêtes, de clés et de valeurs. Le score entre une requête et une clé repose sur leur produit scalaire, divisé par la racine carrée de la dimension des clés. Une fonction softmax transforme ensuite ces scores en poids. La sortie correspond à une somme pondérée des vecteurs de valeurs. La matrice d’auto-attention possède une dimension L par L pour une séquence de longueur L. L’attention multi-tête répète ce calcul sur plusieurs sous-espaces. Les sorties indépendantes sont concaténées, puis transformées par une projection linéaire. [Voir l’article fondateur](https://arxiv.org/abs/1706.03762).

**Ordre des séquences** L’auto-attention est invariante par permutation. Elle ne fournit donc pas directement l’ordre des éléments d’une séquence. Les Transformers ajoutent une matrice d’encodage positionnel aux représentations d’entrée. Le Transformer original étudie les encodages sinusoïdaux et les encodages appris. L’encodage sinusoïdal associe chaque dimension à une sinusoïde de longueur d’onde différente. Ces longueurs d’onde vont de 2π à 10000 fois 2π. L’encodage appris attribue un vecteur entraînable à chaque position absolue. Il peut aussi être appris différemment selon la couche. Shaw et ses coauteurs introduisent un encodage relatif, limité par une distance maximale k. Cette limitation fournit 2k plus 1 étiquettes relatives distinctes.

## Les positions deviennent relatives

**Mémoire segmentée** Transformer-XL encode les positions relatives entre une requête et une clé. Cette approche utilise l’écart de position i-j entre les deux éléments. Son score d’attention sépare l’information de contenu et l’information de position. La méthode remplace l’encodage absolu de la clé par un encodage relatif. Elle introduit aussi deux paramètres entraînables, l’un pour le contenu et l’autre pour la position. Enfin, elle sépare la matrice des clés en deux matrices. La première traite l’information de contenu. La seconde traite l’information de localisation. RoPE, présenté par Su et ses coauteurs en 2021, encode la position absolue avec une matrice de rotation. Cette rotation injecte une information positionnelle relative dans chaque couche d’attention. [Consulter les travaux sur Transformer-XL](https://arxiv.org/abs/1901.02860).

**Panorama technique** Le guide étend son classement aux méthodes destinées aux contextes plus longs. Il traite la mémoire contextuelle et la mémoire externe non différentiable. Il présente également des scores d’attention renforcés par la distance et des mécanismes rendant le modèle récurrent. D’autres sections portent sur l’attention adaptative, la longueur d’attention adaptative et la profondeur adaptative. La partie consacrée à l’efficacité décrit les motifs d’attention parcimonieux. Elle distingue les contextes locaux fixes, les contextes espacés et les combinaisons de contextes locaux et globaux. Le texte aborde enfin l’attention fondée sur le contenu, l’attention de faible rang et les Transformers pour l’apprentissage par renforcement. [Références complémentaires sur BERT](https://arxiv.org/abs/1705.03122).
