# Lilian Weng détaille quatre leviers pour accélérer BERT

> Lilian Weng recense distillation, quantification et élagage pour réduire la mémoire, les calculs et la latence des grands modèles transformeurs.

Type : Actualité IA · Catégorie : Outils · Publié le 2026-10-01 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/distilbert-allege-bert-et-accelere-linference-de-71-pourcent
Tags : optimisation, transformeurs, quantification, distillation, inférence, llm, inference

---

## En résumé

- La distillation transfère les capacités d’un modèle enseignant vers un modèle étudiant plus compact.
- La quantification réduit la précision numérique, mais les activations extrêmes compliquent les formats bas débit.
- DistilBERT conserve 97 % des performances de BERT tout en réduisant ses paramètres de 40 %.

**Le signal :** DistilBERT réduit de 40 % les paramètres de BERT et accélère l’inférence de 71 %.

**Lilian Weng synthétise** les méthodes d’optimisation de l’inférence des grands modèles transformeurs dans un article publié le 10 janvier 2023, puis mis à jour le 24 janvier. Ces modèles obtiennent des résultats de pointe, mais leur utilisation coûte cher en temps et en mémoire. L’article examine la distillation, la [quantification](/signal-ia/actu/distilbert-accelere-linference-de-71-pourcent-avec-moins-de-parametres), l’élagage et plusieurs modifications propres aux transformeurs. Trois objectifs structurent cette analyse : réduire l’empreinte mémoire, diminuer la complexité des calculs et raccourcir la latence. La synthèse couvre aussi le parallélisme, le déport temporaire vers le processeur, la constitution de lots et les améliorations des mécanismes d’attention. [Lire l’article original de Lilian Weng](https://lilianweng.github.io/posts/2023-01-10-inference-optimization/).

**La mémoire domine** certains scénarios de génération autoregressive. Le cache KV doit rester en mémoire pendant le décodage. Avec une taille de lot de 512 et une longueur de contexte de 2 048, ce cache atteint 3 To, soit trois fois la taille du modèle. Le coût du mécanisme d’attention augmente aussi quadratiquement avec la longueur de la séquence. La génération limite en outre le parallélisme, car elle s’exécute étape par étape. Le parallélisme des composants et des données permet toutefois de répartir des modèles de plusieurs milliers de milliards de paramètres sur de nombreux processeurs graphiques. Le déport vers le processeur économise de la mémoire, mais augmente la latence.

## La distillation compacte les modèles

**Le modèle étudiant** apprend à reproduire les sorties d’un modèle enseignant préentraîné. La [distillation](/signal-ia/actu/distilbert-accelere-lia-sans-sacrifier-les-performances) utilise généralement une distribution de probabilités adoucie par une température élevée. Lorsque des étiquettes sont disponibles, l’objectif combine cette perte de distillation avec une perte supervisée. DistilBERT constitue un exemple précoce : il réduit de 40 % le nombre de paramètres de BERT, conserve 97 % de ses performances sur des tâches en aval et fonctionne 71 % plus vite. Son préentraînement associe distillation, apprentissage supervisé et perte d’alignement des états cachés. Cette méthode peut aussi être combinée avec la quantification, l’élagage ou la parcimonie, en utilisant le modèle dense original comme enseignant.

**La précision varie** selon la méthode de quantification retenue. La quantification après entraînement convertit les poids une fois le modèle convergé, sans apprentissage supplémentaire. Elle coûte généralement moins cher à mettre en œuvre. La quantification pendant l’entraînement peut obtenir de meilleures performances, mais elle demande davantage de ressources et des données représentatives. Les activations posent une difficulté particulière : leurs valeurs extrêmes peuvent être environ cent fois supérieures aux autres. Pour les modèles OPT dépassant 6,7 milliards de paramètres, ces valeurs apparaissent dans toutes les couches. LLM.int8() conserve certains éléments extrêmes en FP16 et quantifie les autres en INT8.

## Les activations imposent des compromis

**Les formats bas débit** ne garantissent pas automatiquement une accélération réelle. Certains noyaux graphiques ne prennent pas en charge des multiplications comme INT4 × FP16. Une quantification théoriquement efficace peut donc ne produire aucun gain lors de l’inférence. Les méthodes à précision mixte utilisent 16 bits pour certaines activations problématiques et 8 bits ailleurs. Q-BERT applique une quantification par groupes et exploite des informations de second ordre issues du spectre de la matrice de Hess. ZeroQuant quantifie les poids par groupes et les activations par jetons, avec un noyau personnalisé. Ces choix déplacent le compromis entre précision, coût de calcul et prise en charge matérielle. [Voir Q-BERT sur arXiv](https://arxiv.org/abs/2006.05525).

**Les prochaines options** concernent l’élagage et l’architecture des [transformeurs](/signal-ia/actu/distilbert-allege-bert-de-40-pourcent-et-accelere-linference-de-71-pourcent). L’élagage supprime des paramètres, tandis que la parcimonie N:M impose une structure de zéros exploitable par certains matériels. L’article recense aussi l’amélioration du routage des modèles à experts multiples, l’optimisation des noyaux et les changements de l’attention. Les motifs d’attention parcimonieux peuvent réduire les calculs associés aux longues séquences. La mémoire récurrente et des conceptions économes en mémoire ciblent également le décodage. L’autrice présente ces techniques comme des voies complémentaires pour réduire mémoire, opérations et latence. Les choix doivent rester liés à l’architecture cible et aux noyaux disponibles. [Consulter EffectiveTransformer](https://github.com/bytedance/effective_transformer).
