NVIDIA enrichit Magpie TTS avec 12 langues et voix variées
#open-source 3 min · 14 août 2026

NVIDIA enrichit Magpie TTS avec 12 langues et voix variées

Par Arthur Dekeyser

En résumé

1

Magpie Multilingual TTS prend en charge 12 langues, dont l’arabe standard moderne, le coréen et le portugais brésilien.

2

Le modèle atteint un TTFA de 32 ms en flux unique sur B200 et 239 ms à 64 flux simultanés.

3

Ses poids ouverts permettent un déploiement privé, l’adaptation avec NeMo et le contrôle direct de la latence.

💡

Le signal : Sur B200, NVIDIA Magpie TTS génère un premier signal audio en 32 ms en flux unique.

RAPPORT STRATÉGIQUE

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs

NVIDIA ouvre douze langues

NVIDIA présente Magpie Multilingual TTS, un modèle de synthèse vocale de 364 millions de paramètres distribué avec des poids ouverts. Il prend en charge 12 langues : anglais, espagnol, français, allemand, italien, vietnamien, mandarin, hindi, japonais, arabe standard moderne, coréen et portugais brésilien. Les trois dernières ont été ajoutées dans cette version, publiée le 10 août 2026.

Chaque langue propose des voix masculines et féminines grâce à une représentation multilingue partagée des locuteurs. Magpie améliore aussi la gestion du changement de langue en hindi et en japonais. Le traitement IPA grapheme-to-phoneme et les dictionnaires de prononciation personnalisés doivent faciliter la prononciation de noms, de termes techniques et de contenus multilingues. Les développeurs peuvent ainsi utiliser une même base pour des agents de support client, des assistants de santé, des copilotes d’entreprise, des systèmes de traduction ou d’autres applications conversationnelles.

Magpie réduit le délai audio

Dans une chaîne vocale, le temps de génération de la parole constitue la dernière étape avant la réponse entendue par l’utilisateur. NVIDIA mesure ce délai avec le Time to First Audio, ou TTFA, qui correspond au temps entre le début de la génération et l’arrivée du premier son. Sur une machine B200, Magpie atteint 32 ms en flux unique, contre 47 ms sur H100, 53 ms sur DGX Spark et 79 ms sur A100.

À 64 flux simultanés, le TTFA atteint 239 ms sur B200, avec un débit de 319,81 fois le temps réel. Les mesures proviennent de la documentation de performance NVIDIA TTS NIM v26.07, à partir de trois essais moyens réalisés sur site. Le NIM est un conteneur optimisé pour servir le modèle sur les GPU de l’entreprise, tandis que le checkpoint ouvert disponible sur Hugging Face sert notamment à la recherche et à l’adaptation par fine-tuning. Les deux options fonctionnent sur une infrastructure contrôlée par le déployeur.

NVIDIA combine vitesse et contrôle

Magpie accélère l’inférence avec deux évolutions architecturales. Le frame stacking permet au décodeur de prédire deux trames audio à chaque étape au lieu d’une, ce qui réduit de moitié le nombre d’itérations. Un local transformer modélise ensuite les dépendances entre les tokens générés simultanément afin de préserver la qualité audio. Ces méthodes sont décrites dans l’article « Frame-Stacked Local Transformers for Efficient Multi-Codebook Speech Generation », présenté à ICASSP 2026.

La nouvelle version progresse également sur plusieurs indicateurs. En français, le taux d’erreur de caractères passe de 2,70 % à 1,54 %, tandis que la similarité de locuteur progresse de 0,703 à 0,747. En espagnol, le CER baisse de 1,14 % à 0,60 % et le SSIM monte de 0,715 à 0,793. L’allemand voit son CER passer de 0,66 % à 0,80 %, avec un SSIM en hausse de 0,626 à 0,742. Les nouveaux modèles affichent des CER de 1,62 % en arabe, 2,69 % en coréen et 2,91 % en portugais brésilien, établissant des références initiales pour de futures améliorations.

Les poids ouverts permettent enfin de déployer Magpie dans une infrastructure privée ou isolée, de mesurer et d’optimiser directement la latence, d’adapter la prononciation et les voix avec NeMo, puis de dimensionner le service selon la charge et le matériel utilisés. NVIDIA positionne ainsi Magpie comme une base ouverte pour garder le contrôle du pipeline vocal, des données et du déploiement.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs

À lire aussi