# DistilBERT compresse BERT de 40 % et accélère l’inférence de 71 %

> DistilBERT réduit de 40 % les paramètres de BERT, conserve 97 % de ses performances et accélère l’inférence de 71 %.

Type : Actualité IA · Catégorie : Outils · Publié le 2026-09-24 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/distilbert-allege-bert-de-40-pourcent-et-accelere-linference-de-71-pourcent
Tags : inférence, transformeurs, quantification, distillation, optimisation, llm, inference

---

## En résumé

- DistilBERT réduit les paramètres de BERT de 40 %.
- Le modèle conserve 97 % des performances de BERT sur des tâches aval.
- La distillation, la quantification et l’élagage réduisent les coûts d’inférence.

**Le signal :** DistilBERT conserve 97 % des performances de BERT tout en réduisant ses paramètres de 40 % et en accélérant l’exécution de 71 %.

**Les [transformeurs](/signal-ia/actu/distilbert-accelere-lia-sans-sacrifier-les-performances) coûtent cher.** Les grands modèles de transformeurs obtiennent des résultats de pointe sur de nombreuses tâches, mais leur entraînement et leur utilisation restent très coûteux. Leur inférence mobilise beaucoup de mémoire et de temps. Pour un lot de 512 séquences et une longueur de contexte de 2 048 tokens, le cache KV atteint 3 To. Ce volume représente trois fois la taille du modèle dans l’exemple présenté. L’attention augmente aussi quadratiquement avec la longueur de la séquence. La génération autoregressive limite enfin le parallélisme. Ces contraintes ralentissent l’adoption de modèles puissants pour des usages à grande échelle. [Lire l’analyse complète](https://lilianweng.github.io/posts/2023-01-10-inference-optimization/).

**DistilBERT montre une voie.** La [distillation](/signal-ia/actu/lilian-weng-devoile-les-cles-pour-accelerer-les-transformers) transfère les compétences d’un modèle enseignant coûteux vers un modèle étudiant plus petit. Le modèle étudiant apprend à reproduire les sorties du modèle enseignant à partir d’une fonction de perte dédiée. Lorsque les étiquettes existent, l’entraînement peut aussi combiner cette perte avec une entropie croisée supervisée. DistilBERT constitue un premier résultat notable de cette approche. Il réduit de 40 % le nombre de paramètres de BERT, conserve 97 % de ses performances sur des tâches aval et fonctionne 71 % plus rapidement. Sa pré-entraînement combine distillation souple, apprentissage supervisé et perte d’alignement des vecteurs d’état caché.

## Les méthodes réduisent trois coûts

**Trois objectifs structurent l’optimisation.** Les méthodes cherchent à réduire l’empreinte mémoire, la complexité de calcul et la latence d’inférence. Le parallélisme répartit les composants du modèle et les données sur plusieurs processeurs graphiques. Cette approche permet d’exécuter un modèle de plusieurs milliers de milliards de paramètres. Le déport mémoire transfère temporairement certaines données vers le processeur central, mais augmente la latence. Le regroupement intelligent assemble des séquences consécutives et supprime le remplissage inutile dans un lot. Les techniques de compression incluent la distillation, la [quantification](/signal-ia/actu/distilbert-accelere-linference-de-71-pourcent-avec-moins-de-parametres) et l’élagage. Des changements d’architecture ciblent aussi les couches d’attention pour accélérer le décodage. [EffectiveTransformer](https://github.com/bytedance/effective_transformer) illustre le regroupement de séquences.

**La quantification exige des compromis.** La quantification après entraînement convertit les poids vers une précision plus faible sans nouvel entraînement. La quantification consciente de l’entraînement intervient pendant le pré-entraînement ou l’ajustement et peut obtenir de meilleurs résultats, avec davantage de calcul et des données représentatives. Une quantification simple en basse précision, comme huit bits, peut fortement dégrader les performances à cause de l’amplitude dynamique des activations. Dans les modèles OPT dépassant 6,7 milliards de paramètres, des valeurs aberrantes apparaissent dans toutes les couches. Certaines activations atteignent une amplitude environ 100 fois supérieure à celle de la majorité des valeurs. Le support des noyaux matériels reste déterminant pour obtenir une accélération réelle.

## Les activations imposent une précision mixte

**La précision mixte cible les valeurs aberrantes.** L’approche LLM.int8() conserve en FP16 une petite fraction des activations atypiques et quantifie les autres valeurs en INT8. Les lignes et colonnes sont mises à l’échelle selon leur maximum absolu avant la quantification. GOBO détecte également les valeurs aberrantes en suivant la moyenne et l’écart-type de chaque couche. Les valeurs atypiques restent dans leur forme originale, tandis que les autres sont réparties dans plusieurs intervalles. D’autres méthodes affinent encore la granularité. Q-BERT applique une quantification par groupes et une précision mixte fondée sur la sensibilité estimée par le spectre de Hessien. ZeroQuant associe quantification par groupes des poids et quantification par token des activations.

**Les combinaisons élargissent les options.** La distillation peut être combinée avec la quantification, l’élagage ou la sparsification. Dans cette configuration, le modèle enseignant reste dense et en pleine précision. Le modèle étudiant devient quantifié, élagué ou plus clairsemé. L’optimisation peut donc agir simultanément sur le nombre de paramètres, leur précision et la structure du calcul. Les méthodes spécifiques à l’architecture ajoutent des pistes sur l’attention, la mémoire récurrente et les motifs d’attention clairsemés. Le choix dépend toutefois des objectifs retenus, entre mémoire, nombre d’opérations et latence. Les travaux cités incluent [la distillation de connaissances](https://arxiv.org/abs/1503.02531), [LLM.int8()](https://arxiv.org/abs/2208.07339) et [GPTQ](https://arxiv.org/abs/2211.05102).
