# Lilian Weng dévoile comment alléger l’inférence des LLM

> Lilian Weng décrit distillation, quantification et élagage pour réduire mémoire, calcul et latence des grands modèles transformeurs.

Type : Actualité IA · Catégorie : Outils · Publié le 2026-09-17 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/lilian-weng-revele-les-cles-pour-accelerer-les-grands-modeles
Tags : transformeurs, inférence, quantification, distillation, élagage, llm, inference

---

## En résumé

- La distillation transfère les compétences d’un grand modèle vers un modèle étudiant plus petit.
- La quantification réduit la précision numérique, mais les activations présentent des valeurs aberrantes difficiles à traiter.
- L’optimisation vise à réduire la mémoire utilisée, le nombre d’opérations et la latence d’inférence.

**Le signal :** DistilBERT réduit de 40 % les paramètres de BERT tout en conservant 97 % de ses performances et en accélérant l’inférence de 71 %.

**Lilian Weng décrit** plusieurs méthodes pour rendre l’inférence des grands modèles transformeurs moins coûteuse. Son article, publié le 10 janvier 2023 puis actualisé le 24 janvier, traite de distillation, [quantification](/signal-ia/actu/distilbert-accelere-lia-sans-sacrifier-les-performances), élagage et adaptations architecturales. Ces approches cherchent à réduire l’empreinte mémoire, la complexité de calcul et la latence. Le problème vient notamment de la taille croissante des modèles et de leurs états intermédiaires. Pour un lot de 512 séquences et un contexte de 2 048 tokens, le cache KV atteint 3 To. Ce volume représente trois fois la taille du modèle dans l’exemple cité. Le décodage ajoute une contrainte, car la génération autorégressive limite la parallélisation. ([Article de Lilian Weng](https://lilianweng.github.io/posts/2023-01-10-inference-optimization/))

**Les objectifs restent concrets** pour les équipes qui déploient ces modèles. La première cible consiste à utiliser moins de processeurs graphiques et moins de mémoire. La deuxième vise à diminuer le nombre d’opérations en virgule flottante. La troisième concerne directement le temps d’[inférence](/signal-ia/actu/lilian-weng-devoile-les-cles-pour-accelerer-les-transformers). Le parallélisme répartit les composants et les données sur plusieurs processeurs graphiques, jusqu’à permettre l’exécution d’un modèle de plusieurs milliers de milliards de paramètres. Le déport mémoire transfère temporairement certaines données vers le processeur, mais augmente la latence. Le regroupement intelligent des lots peut aussi supprimer le remplissage inutile. EffectiveTransformer compacte ainsi des séquences consécutives dans un même lot. ([Dépôt EffectiveTransformer](https://github.com/bytedance/effective_transformer))

## DistilBERT compresse le modèle enseignant

**La [distillation](/signal-ia/actu/distilbert-accelere-linference-de-71-pourcent-avec-moins-de-parametres) transfère** les sorties d’un modèle enseignant vers un modèle étudiant moins coûteux. L’étudiant apprend généralement à reproduire les distributions de probabilités produites par l’enseignant. Lorsque des étiquettes existent, l’entraînement combine cette perte de distillation avec une fonction supervisée. DistilBERT illustre cette méthode sur BERT. Il réduit le nombre de paramètres de 40 %, conserve 97 % des performances de BERT sur des tâches aval après ajustement, et fonctionne 71 % plus vite. Son entraînement combine distillation souple, apprentissage supervisé et perte de similarité cosinus entre états cachés. La distillation peut aussi être associée à la quantification, à l’élagage ou à une sparsité accrue. ([Travail fondateur sur la distillation](https://arxiv.org/abs/1503.02531))

**La quantification présente** deux voies principales. La quantification après entraînement convertit les poids vers une précision plus basse sans nouvel entraînement. Elle demande généralement moins de ressources que la quantification consciente de l’entraînement. Cette dernière intervient pendant le pré-entraînement ou l’ajustement, et peut obtenir de meilleures performances avec des données représentatives. Une précision réduite ne garantit toutefois pas une accélération réelle. Certains produits matriciels, comme INT4 par FP16, ne disposent pas toujours d’un noyau adapté sur processeur graphique. Les activations posent aussi problème. Une quantification simple en 8 bits peut dégrader fortement les performances, car leurs amplitudes varient beaucoup. Dans OPT, des valeurs aberrantes apparaissent au-delà de 6,7 milliards de paramètres.

## La précision mixte traite les valeurs aberrantes

**Les méthodes spécialisées** conservent une précision supérieure pour certaines valeurs ou activations sensibles. GOBO repère les valeurs aberrantes des poids en suivant leur moyenne et leur écart-type par couche. Les autres valeurs sont réparties dans des intervalles, dont les indices et centroïdes sont conservés. Bondarenko et ses collègues utilisent 16 bits pour certaines activations problématiques et 8 bits ailleurs dans BERT. LLM.int8() conserve en FP16 une petite fraction de caractéristiques d’activation très élevées, tandis que les autres valeurs passent en INT8. Q-BERT applique une quantification par groupes et s’appuie sur le spectre de la matrice hessienne pour attribuer une précision supérieure aux paramètres sensibles. GPTQ formule également la quantification comme une minimisation d’erreur.
