# Lilian Weng double son guide sur les Transformers

> Lilian Weng enrichit son panorama des architectures Transformer avec une version 2.0 deux fois plus longue et de nouveaux travaux récents.

Type : Actualité IA · Catégorie : Outils · Publié le 2026-09-09 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/lilian-weng-enrichit-son-panorama-transformer-en-version-20
Tags : transformer, attention, architectures, modèles de langage

---

## En résumé

- Lilian Weng publie une version 2.0 de son panorama des architectures Transformer.
- La nouvelle édition est environ deux fois plus longue que le texte de 2020.
- Le dossier présente l’attention, les encodages positionnels et plusieurs pistes d’efficacité.

**Le signal :** Lilian Weng présente une version 2.0 de son panorama Transformer, environ deux fois plus longue que l’édition de 2020.

**Une refonte substantielle** Lilian Weng publie une version 2.0 de son article consacré à la famille Transformer. Cette nouvelle édition reprend et enrichit son texte de 2020. Elle représente environ deux fois sa longueur précédente. L’autrice indique avoir réorganisé la hiérarchie des sections. Elle ajoute également des travaux plus récents sur les [architectures](/signal-ia/actu/lilian-weng-devoile-son-panorama-transformer-20) Transformer. Le dossier couvre les notations, les bases du Transformer, l’attention et l’auto-attention. Il présente aussi les encodages positionnels, les contextes longs et l’attention efficace. La page rassemble enfin des développements consacrés à l’apprentissage par renforcement. [Lire la version 2.0 de Lilian Weng](https://lilianweng.github.io/posts/2023-01-27-the-transformer-family-v2/)

**Le [Transformer](/signal-ia/actu/discoformer-reduit-lerreur-du-kde-de-plus-de-37-fois) originel** Le Transformer de Vaswani et ses coauteurs utilise une architecture encodeur-décodeur. Son encodeur produit une représentation fondée sur l’attention. Il contient une pile de six modules identiques. Chaque module associe une attention multi-têtes et un réseau entièrement connecté appliqué point par point. Des connexions résiduelles et une normalisation de couche entourent ces sous-modules. Le décodeur reprend une structure proche, avec deux sous-modules d’attention multi-têtes. Son premier sous-module est masqué. Cette opération empêche les positions de consulter les éléments futurs. Des variantes simplifiées ont ensuite obtenu de bonnes performances avec BERT côté encodeur et GPT côté décodeur.

## Lilian Weng détaille l’attention

**Des poids appris** L’attention permet au modèle de sélectionner les données pertinentes pour produire une prédiction. Des poids appris déterminent généralement une moyenne pondérée des valeurs. L’auto-attention utilise d’autres parties du même échantillon pour traiter une observation. Le Transformer s’appuie sur une attention à produit scalaire mise à l’échelle. Celle-ci combine des matrices de requêtes, de clés et de valeurs. Le score utilise le produit scalaire entre une requête et une clé, divisé par la racine de la dimension des clés. L’attention multi-têtes répète ce calcul sur plusieurs sous-espaces. Les sorties sont ensuite concaténées, puis transformées linéairement.

**L’ordre des séquences** L’auto-attention est invariante par permutation. Le modèle doit donc recevoir une information sur la position des éléments. L’[encodage positionnel](/signal-ia/actu/lilian-weng-devoile-la-version-20-de-son-guide-transformer) possède la même dimension que les représentations d’entrée. Il peut ainsi être ajouté directement à celles-ci. Le Transformer originel prévoit un encodage sinusoïdal et un encodage appris. Le premier associe différentes dimensions à des sinusoïdes de longueurs d’onde distinctes. Le second attribue à chaque position un vecteur appris. Shaw et ses coauteurs ajoutent des informations positionnelles relatives aux clés et aux valeurs. Transformer-XL encode également les écarts de position entre requêtes et clés. [Voir l’article fondateur du Transformer](https://arxiv.org/abs/1706.03762)

## Plusieurs pistes prolongent les Transformers

**Des architectures spécialisées** La version 2.0 présente plusieurs méthodes pour traiter des contextes plus longs. Transformer-XL encode les positions relatives entre segments. RoPE, proposé par Su et ses coauteurs, injecte une information positionnelle relative au moyen d’une rotation. Le dossier examine aussi la mémoire de contexte et la mémoire externe non différentiable. D’autres sections portent sur les scores d’attention améliorés par la distance. Elles décrivent également des modèles récurrents et des mécanismes d’adaptation. L’attention peut être rendue plus efficace avec des contextes locaux, des contextes espacés ou une combinaison de contextes locaux et globaux. [Consulter les travaux de Transformer-XL](https://arxiv.org/abs/1901.02860)
