Apple compresse 2,8 fois ses encodeurs audio en local
Formation 3 min · 1 octobre 2026

Apple compresse 2,8 fois ses encodeurs audio en local

Par Arthur Dekeyser

En résumé

1

Apple compresse un encodeur audio neuronal utilisé par la dictée système.

2

La distillation vise le latent précédant la quantification et le pont vers le modèle de langage.

3

Le modèle étudiant conserve un écart inférieur à 1,9 % de WER relatif dans cinq cas sur six.

💡

Le signal : La méthode d’Apple atteint une compression de 2,8 fois avec seulement 1,9 % de WER relatif supplémentaire.

NEWSLETTER BUSINESS & IA

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés

Apple présente en septembre 2026 une méthode pour compresser les encodeurs audio neuronaux utilisés par la dictée système. Le travail porte sur des appareils Apple exécutant la transcription entièrement en local. Un encodeur transforme de courtes fenêtres de forme d’onde en représentations consommées par le modèle de langage. Les chercheurs remplacent la supervision classique par une distillation dans l’espace latent. L’étudiant apprend à reproduire le latent précédant la quantification. À 2,8 fois de compression, il reste à moins de 1,9 % de taux d’erreur de mots relatif du modèle enseignant dans cinq des six couples évalués. La méthode améliore aussi de 3,9 % un encodeur indépendant de capacité identique.

La dictée transmet sa représentation audio à un modèle fondamental via un tokenizer. Ce composant encode les fenêtres de forme d’onde avant leur lecture par le modèle de langage. Le modèle utilise une activation éparse issue de l’Instruction-Following Pruning. Seul un petit sous-ensemble d’experts occupe alors la mémoire vive à un instant donné. Le tokenizer permanent partage cette mémoire avec ces experts. Son nombre de paramètres influence donc directement la consommation électrique et la latence. Apple étudie ainsi une réduction de taille sans réglage complémentaire après distillation. Les résultats concernent un tokenizer préentraîné séparément et un tokenizer entraîné conjointement avec un modèle de langage.

Apple distille le latent audio

Le nouvel objectif ne porte ni sur le token discret, ni sur la distribution de sortie. L’entraînement cible le latent avant le quantificateur. Cette représentation constitue le dernier élément partagé par les deux interfaces de tokens prises en charge. L’encodeur étudiant régresse le latent de l’enseignant pour chaque trame. Les chercheurs utilisent une fonction de perte fondée sur l’erreur quadratique. Une seule couche affine absorbe la différence de largeur entre les deux encodeurs. Le même procédé couvre donc les deux interfaces de tokens. Il s’applique également aux deux modes d’entraînement étudiés par l’équipe. Cette position du latent réduit la dépendance au mécanisme situé après sa production.

Les résultats reposent sur cinq des six couples enseignant-étudiant évalués avec une compression de 2,8 fois. Dans ces cinq cas, le modèle distillé reste dans une marge de 1,9 % de WER relatif par rapport à son enseignant. Aucun réglage fin n’est appliqué après la distillation. Le gain atteint 3,9 % en comparaison avec un tokenizer entraîné indépendamment et doté d’une capacité identique. Le WER mesure ici la différence relative de taux d’erreur de mots entre les modèles comparés. Apple présente ces résultats dans un article publié en septembre 2026. Prasanth Yadla et Mohammad Samragh Razlighi contribuent à parts égales à ce travail.

Une compression testée sur six couples

L’équipe réunit des chercheurs affiliés à Apple, NVIDIA et Anthropic. Les auteurs incluent Prasanth Yadla, Mohammad Samragh Razlighi, Dongseong Hwang, Mingbin Xu et Yuanyuan Zhang. Chung-Cheng Chiu et Yongqiang Wang figurent également parmi les contributeurs. Yongqiang Wang est indiqué comme affilié à NVIDIA. Yuan Liu est indiqué comme affilié à Anthropic. Le travail compte aussi Zhen Huang et Xiaodan Zhuang parmi ses auteurs. La publication relève des domaines « Methods and Algorithms » et « Speech and Natural Language Processing ». Elle est disponible sur la page de recherche d’Apple et dans sa version arXiv.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs abonnés

À lire aussi