DistilBERT compresse BERT de 40 % et accélère l’inférence de 71 %
3 min · 24 septembre 2026

DistilBERT compresse BERT de 40 % et accélère l’inférence de 71 %

Par Arthur Dekeyser

En résumé

1

DistilBERT réduit les paramètres de BERT de 40 %.

2

Le modèle conserve 97 % des performances de BERT sur des tâches aval.

3

La distillation, la quantification et l’élagage réduisent les coûts d’inférence.

💡

Le signal : DistilBERT conserve 97 % des performances de BERT tout en réduisant ses paramètres de 40 % et en accélérant l’exécution de 71 %.

NEWSLETTER BUSINESS & IA

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés

Les transformeurs coûtent cher. Les grands modèles de transformeurs obtiennent des résultats de pointe sur de nombreuses tâches, mais leur entraînement et leur utilisation restent très coûteux. Leur inférence mobilise beaucoup de mémoire et de temps. Pour un lot de 512 séquences et une longueur de contexte de 2 048 tokens, le cache KV atteint 3 To. Ce volume représente trois fois la taille du modèle dans l’exemple présenté. L’attention augmente aussi quadratiquement avec la longueur de la séquence. La génération autoregressive limite enfin le parallélisme. Ces contraintes ralentissent l’adoption de modèles puissants pour des usages à grande échelle. Lire l’analyse complète.

DistilBERT montre une voie. La distillation transfère les compétences d’un modèle enseignant coûteux vers un modèle étudiant plus petit. Le modèle étudiant apprend à reproduire les sorties du modèle enseignant à partir d’une fonction de perte dédiée. Lorsque les étiquettes existent, l’entraînement peut aussi combiner cette perte avec une entropie croisée supervisée. DistilBERT constitue un premier résultat notable de cette approche. Il réduit de 40 % le nombre de paramètres de BERT, conserve 97 % de ses performances sur des tâches aval et fonctionne 71 % plus rapidement. Sa pré-entraînement combine distillation souple, apprentissage supervisé et perte d’alignement des vecteurs d’état caché.

Les méthodes réduisent trois coûts

Trois objectifs structurent l’optimisation. Les méthodes cherchent à réduire l’empreinte mémoire, la complexité de calcul et la latence d’inférence. Le parallélisme répartit les composants du modèle et les données sur plusieurs processeurs graphiques. Cette approche permet d’exécuter un modèle de plusieurs milliers de milliards de paramètres. Le déport mémoire transfère temporairement certaines données vers le processeur central, mais augmente la latence. Le regroupement intelligent assemble des séquences consécutives et supprime le remplissage inutile dans un lot. Les techniques de compression incluent la distillation, la quantification et l’élagage. Des changements d’architecture ciblent aussi les couches d’attention pour accélérer le décodage. EffectiveTransformer illustre le regroupement de séquences.

La quantification exige des compromis. La quantification après entraînement convertit les poids vers une précision plus faible sans nouvel entraînement. La quantification consciente de l’entraînement intervient pendant le pré-entraînement ou l’ajustement et peut obtenir de meilleurs résultats, avec davantage de calcul et des données représentatives. Une quantification simple en basse précision, comme huit bits, peut fortement dégrader les performances à cause de l’amplitude dynamique des activations. Dans les modèles OPT dépassant 6,7 milliards de paramètres, des valeurs aberrantes apparaissent dans toutes les couches. Certaines activations atteignent une amplitude environ 100 fois supérieure à celle de la majorité des valeurs. Le support des noyaux matériels reste déterminant pour obtenir une accélération réelle.

Les activations imposent une précision mixte

La précision mixte cible les valeurs aberrantes. L’approche LLM.int8() conserve en FP16 une petite fraction des activations atypiques et quantifie les autres valeurs en INT8. Les lignes et colonnes sont mises à l’échelle selon leur maximum absolu avant la quantification. GOBO détecte également les valeurs aberrantes en suivant la moyenne et l’écart-type de chaque couche. Les valeurs atypiques restent dans leur forme originale, tandis que les autres sont réparties dans plusieurs intervalles. D’autres méthodes affinent encore la granularité. Q-BERT applique une quantification par groupes et une précision mixte fondée sur la sensibilité estimée par le spectre de Hessien. ZeroQuant associe quantification par groupes des poids et quantification par token des activations.

Les combinaisons élargissent les options. La distillation peut être combinée avec la quantification, l’élagage ou la sparsification. Dans cette configuration, le modèle enseignant reste dense et en pleine précision. Le modèle étudiant devient quantifié, élagué ou plus clairsemé. L’optimisation peut donc agir simultanément sur le nombre de paramètres, leur précision et la structure du calcul. Les méthodes spécifiques à l’architecture ajoutent des pistes sur l’attention, la mémoire récurrente et les motifs d’attention clairsemés. Le choix dépend toutefois des objectifs retenus, entre mémoire, nombre d’opérations et latence. Les travaux cités incluent la distillation de connaissances, LLM.int8() et GPTQ.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs abonnés

À lire aussi