En résumé
Apple utilise un détokeniseur avancé qui convertit les tokens audio sémantiques en un son haute fidélité avec un faible usage de mémoire.
Le système atteint environ 10ms par étape de génération sur l'Apple Matrix Coprocessor, 16 fois plus rapide que le temps réel.
Une architecture améliorée a permis d'augmenter le score MOS de +0,28, renforçant la qualité perçue de la synthèse vocale.
Le signal : Apple a déployé un détokeniseur innovant sur l'AMX, permettant une synthèse audio streaming 16x plus rapide que le temps réel.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs
Apple dévoile un détokeniseur pour Siri qui permet la synthèse vocale en temps réel avec haute fidélité en utilisant les Transformers de diffusion découplés. Selon Apple, cette nouvelle architecture est capable de fonctionner dans les contraintes de calcul et de mémoire de l’Apple Matrix Coprocessor (AMX), atteignant environ 10ms par étape de génération audio, soit environ 16 fois plus rapide que le temps réel. Cette innovation alimente les nouvelles voix expressives de Siri, offrant une synthèse vocale riche et configurable entièrement en local sur les appareils Apple. Lire l’étude complète.
Avant ce développement, la synthèse vocale reposait sur des architectures multi-décodeurs gourmandes en mémoire, comme les transformateurs et GAN classiques. Le nouveau système combine un encodeur de flux, un décodeur temporel et un décodeur de profondeur pour convertir les tokens audio sémantiques en vecteurs de quantification résiduels, optimisant ainsi le processus.
Les avancées techniques se reflètent par un pic de mémoire utilisé de seulement ∼21MB et 329MB d’actifs sur l’appareil, remplaçant l’échelle linéaire et quadratique de la mémoire des approches précédentes. Les tests d’évaluation audio ont montré une amélioration du score de l’opinion moyenne (MOS) de +0,28, passant de 3,87 à 4,15, démontrant la fidélité tout en améliorant l’efficacité calculatoire.
Implications des résultats incluent une meilleure performance lors de la synthèse vocale continue de 20 à 320 secondes tout en maintenant une faible empreinte mémoire. Cela pourrait transformer l’interaction utilisateur avec les dispositifs Apple, rendant les assistants vocaux plus naturels et réactifs.
Pour les entreprises françaises, cette technologie pourrait influencer la création d’applications vocales intégrées, rendant les solutions plus performantes, avec une meilleure qualité audio et une intégration fluide dans les systèmes Apple. Les développeurs peuvent adapter l’usage des assistants vocaux à divers contextes, optimisant la personnalisation.
Le positionnement concurrentiel de ce système découle des collaborations entre Apple et Google pour affiner les modèles de fondation. Cette approche collaborative et centrée sur l’appareil contraste avec d’autres acteurs du marché qui peuvent privilégier les solutions basées sur le cloud, offrant un avantage pour ceux souhaitant une intégration locale avec une faible latence.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs