Apple : Siri bouscule l'audio avec des Transformers 16x
2 min · 29 juillet 2026

Apple : Siri bouscule l'audio avec des Transformers 16x

Par Arthur Dekeyser

En résumé

1

Apple introduit des Diffusion Transformers pour améliorer la synthèse audio réelle sur ses appareils.

2

Les nouvelles méthodes permettent à Siri de fonctionner 16 fois plus rapidement que les technologies existantes.

3

La qualité audio de Siri s'améliore, avec un MOS en hausse de 0,28 point en moyenne, grâce à l'architecture avancée.

💡

Le signal : Apple a développé des Diffusion Transformers permettant une synthèse audio 16 fois plus rapide avec 21MB de mémoire.

RAPPORT STRATÉGIQUE

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs

Apple développe une nouvelle architecture audio qui transforme l’expérience utilisateur sur ses appareils. Grâce à l’utilisation de Diffusion Transformers, Siri Expressive Voices est désormais capable de produire une synthèse vocale en temps réel directement sur l’appareil. Cette avancée est rendue possible par le modèle fondationnel très puissant d’Apple, l’AFM 3 Core Advanced, permettant ainsi une configuration vocale riche et flexible pour les utilisateurs.

Une innovation majeure dans la gestion de la mémoire a été introduite. Le dispositif utilise un détokeniseur qui transforme les jetons audio sémantiques en son de haute qualité tout en respectant les contraintes strictes de mémoire imposées par le co-processeur Apple Matrix. Cette approche permet un traitement de l’audio environ 16 fois plus rapide que les standards actuels en temps réel, avec une utilisation maximale de seulement 21MB de mémoire vive et 329MB de ressources embarquées sur l’appareil.

Des résultats impressionnants ont été démontrés, notamment grâce aux études exhaustives menées sur cette technologie. En effectuant une quantification vectorielle résiduelle avec un design en trois composants, cette méthode simplifie le processus de synthèse en utilisant un unique décodeur de profondeur, contrairement aux architectures multi-décodeurs antérieures. L’attention avec glissement en fenêtre causal et la mise en cache des valeurs des clés permettent une complexité mémoire constante, indépendamment de la longueur des séquences traitées.

Les performances de Siri bénéficient d’une amélioration notable, avec un score MOS accrus de 0,28 point au global, et même de 0,42 point pour les dialogues conviviaux comparés à l’ancien système. Cette avancée positionne Siri en tant que leader en matière de qualité d’assistance vocale autonome et ouvre de nouvelles possibilités de personnalisation, grâce aux curseurs d’expressivité et de rythme disponibles sur les appareils Apple.

La portée pour les entreprises et utilisateurs est significative. Pour les firmes adoptant ces appareils, c’est l’assurance d’une meilleure interaction homme-machine, essentielle pour accroître l’engagement des consommateurs et optimiser la satisfaction client. Cette technologie illustre la capacité d’Apple à pousser les limites de l’innovation dans le domaine de l’intelligence artificielle mobile.

Apple s’impose ainsi face à ses concurrents en présentant une solution plus sophistiquée et plus efficace sur le marché. En développant un modèle de 1 milliard de paramètres, le potentiel de ses applications dépasse largement celui des précédentes offres, consolidant sa position de leader technologique.

Pour en savoir plus sur cette innovation et ses implications, retrouvez l’article original et la publication technique associée.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs

À lire aussi