Muse de Meta distingue plus de vingt voix en temps réel
#gemini #open-source 3 min · 2 septembre 2026

Muse de Meta distingue plus de vingt voix en temps réel

Par Arthur Dekeyser

En résumé

1

Meta lance Muse Voice Transcribe pour la transcription audio en temps réel.

2

Le modèle distingue plus de 20 locuteurs et 25 langues validées au lancement.

3

Meta facture l'API 3 dollars pour 1 000 minutes audio.

💡

Le signal : Meta propose Muse Voice Transcribe à 3 dollars pour 1 000 minutes audio via son API de modèles.

NEWSLETTER BUSINESS & IA

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés

Meta lance Muse Voice Transcribe, son premier modèle audio fonctionnant en temps réel. Le modèle transcrit des dictées et des conversations avec plus de 20 locuteurs, selon Meta. Il traite aussi plusieurs langues au sein d’une même session. Meta a présenté cette capacité le 1er septembre 2026, par l’intermédiaire de Mark Zuckerberg. Une démonstration montre le modèle distinguer automatiquement plusieurs intervenants. Elle montre aussi des changements de langue pendant une conversation. Muse Voice Transcribe détecte même le « code-switching ». Cette expression désigne des phrases qui combinent des mots issus de plusieurs langues. Meta indique que le modèle est déployé dès aujourd’hui dans ses services et outils associés. Lire l’article original.

Le modèle combine plusieurs fonctions audio dans un seul système. Muse Voice Transcribe réalise la diarisation des locuteurs et la détection de fin de parole nativement. Il adapte aussi son délai de traitement selon la difficulté des mots. Mark Zuckerberg explique que le modèle attend davantage face aux termes difficiles. Il valide plus rapidement les mots simples. Cette méthode doit améliorer la précision de chaque unité transcrite, selon son explication. Meta indique également un entraînement sur plus de 70 langues. Vingt-cinq langues sont validées au lancement. Le modèle doit gérer des sessions d’une heure avec plus de 20 locuteurs. Il vise ainsi des échanges audio longs et multilingues.

Meta déploie son modèle audio

Les premiers usages concernent déjà la dictée dans l’application Meta AI pour Mac. Cette application peut alimenter des fonctions vocales dans d’autres logiciels. Muse Voice Transcribe doit donc y prendre en charge les fonctions de dictée proposées par ces services. Meta rend aussi le modèle accessible aux développeurs dans Muse Code et via son API de modèles. L’accès à l’API coûte 3 dollars pour 1 000 minutes audio. Meta propose en parallèle une version de démonstration de Muse Transcribe sur son blog de recherche. La page de présentation officielle décrit les fonctions du modèle et son déploiement. Voir la présentation de Meta.

Google arrive moins d’une semaine avant Meta avec Gemini 3.5 Transcribe. Le modèle de Google affiche des capacités similaires pour l’audio, d’après l’article d’Engadget. Google prévoit d’intégrer son modèle dans Android, puis dans Chrome. Meta a déjà annoncé des usages dans son application de bureau et dans Muse Code. L’entreprise n’a pas indiqué d’intégration équivalente dans ses services phares. Cette différence concerne le calendrier de distribution présenté pour chaque modèle. Meta privilégie pour l’instant l’application Meta AI pour Mac, son environnement de développement et son API. Les développeurs peuvent donc tester Muse Voice Transcribe sans attendre une intégration générale dans les services Meta.

Meta accélère les sorties de MSI

Le laboratoire MSI présente Muse Voice Transcribe comme sa première capacité audio en temps réel. Meta Superintelligence Lab a aussi publié plusieurs modèles et outils au cours des dernières semaines. La société a notamment introduit son premier agent spécialisé dans le codage. Elle a également lancé un modèle à poids ouverts et l’application Meta AI pour Mac. Muse Voice Transcribe s’inscrit dans cette série de sorties récentes. Les démonstrations publiques mettent l’accent sur la distinction des locuteurs, les changements de langue et la dictée. Les développeurs peuvent consulter la démonstration publiée par Meta et accéder au modèle via l’API.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs abonnés

À lire aussi