Apple divise par 2,8 la taille de ses encodeurs audio
3 min · 26 septembre 2026

Apple divise par 2,8 la taille de ses encodeurs audio

Par Arthur Dekeyser

En résumé

1

Apple compresse un encodeur audio neuronal utilisé par la dictée sur ses appareils.

2

La méthode entraîne l’étudiant à reproduire la représentation latente du modèle enseignant.

3

Le modèle compressé atteint 2,8 fois de compression avec une perte relative de WER limitée.

💡

Le signal : Apple obtient une compression de 2,8 fois avec un écart relatif de WER inférieur à 1,9% dans cinq des six paires évaluées.

NEWSLETTER BUSINESS & IA

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés

Apple publie une méthode Apple présente une méthode de compression pour les encodeurs audio neuronaux utilisés par la dictée système sur ses appareils. L’étude est publiée en septembre 2026 dans les domaines des méthodes algorithmiques et du traitement de la parole. La dictée fonctionne entièrement sur l’appareil. Elle transmet ensuite la parole transcrite à un modèle fondamental par l’intermédiaire d’un tokenizer. Cet encodeur convertit de courtes fenêtres du signal audio en représentations exploitées par le modèle de langage. Les auteurs étudient une distillation qui vise cette représentation interne, plutôt que les tokens discrets ou la distribution de sortie. La publication est disponible sur le site de recherche d’Apple.

La mémoire reste partagée Le tokenizer fonctionne en continu et utilise la même mémoire que le modèle de langage. Ce modèle active seulement un petit sous-ensemble de ses experts avec l’Instruction-Following Pruning. Le tokenizer doit donc cohabiter avec ces experts en mémoire vive. Son nombre de paramètres intervient directement dans la puissance consommée et la latence. Apple cible ainsi un composant toujours actif dans une architecture exécutée localement. La méthode concerne deux interfaces de tokens prises en charge par les auteurs. Elle s’applique aussi à un tokenizer préentraîné séparément, ou à un tokenizer entraîné conjointement avec un modèle de langage. Le cadre cherche donc une recette commune entre ces configurations.

Apple distille la représentation latente

L’étudiant apprend le latent L’entraînement fait régresser l’encodeur étudiant vers le latent produit par l’enseignant pour chaque trame audio. Les auteurs utilisent une fonction objectif fondée sur l’erreur quadratique. Ils n’entraînent que l’encodeur étudiant. Une couche affine absorbe la différence de largeur entre les deux modèles. La cible se situe avant le quantificateur et le pont vers le modèle de langage. Les deux interfaces de tokens partagent cette représentation. Cette position permet d’utiliser la même recette pour les deux interfaces étudiées. La distillation ne supervise donc ni le token discret, ni la distribution de sortie. Elle supervise la dernière représentation commune aux deux interfaces de tokens.

La compression atteint 2,8 fois Avec une compression de 2,8 fois, l’étudiant distillé reste à moins de 1,9% d’écart relatif en taux d’erreur de mots par rapport à son enseignant. Ce résultat apparaît dans cinq des six paires enseignant-étudiant évaluées. Aucun réglage fin n’est appliqué après la distillation. Le même étudiant améliore aussi de 3,9% en relatif un tokenizer entraîné indépendamment avec une capacité identique. Ces chiffres comparent donc trois éléments précis : l’enseignant, l’étudiant distillé et un tokenizer indépendant de même capacité. Les auteurs rapportent ces mesures sans présenter la compression comme une égalité parfaite entre les modèles.

Les résultats couvrent six paires

La méthode vise les deux interfaces Le choix du latent comme cible couvre les deux interfaces de tokens prises en charge par l’étude. Il couvre également deux modes de préparation du tokenizer : un préentraînement seul et un entraînement conjoint avec un modèle de langage. Les résultats portent sur six paires enseignant-étudiant. Cinq paires restent dans une marge relative de 1,9% en WER après une compression de 2,8 fois. La sixième paire ne figure pas dans cette marge annoncée. L’étudiant ne reçoit aucun réglage fin après la distillation. Les auteurs comparent enfin sa performance à celle d’un tokenizer indépendant ayant la même capacité, avec une amélioration relative de 3,9%.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs abonnés

À lire aussi