En résumé
Alibaba lance cinq modèles pour la reconnaissance, la synthèse vocale et les interactions en temps réel.
Le modèle ASR-Next identifie plusieurs locuteurs avec horodatage et détecte les émotions et les bruits.
Alibaba réduit les prix de la synthèse vocale d’environ 70 % et ceux de l’ASR jusqu’à 95 %.
Le signal : Alibaba lance cinq modèles Qwen Audio 3.1 et réduit les tarifs ASR jusqu’à 95 %, le 23 septembre 2026.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
Alibaba lance Qwen Audio 3.1 le 23 septembre 2026. La nouvelle gamme réunit cinq modèles dédiés à l’audio. Elle couvre la reconnaissance automatique de la parole, la synthèse vocale et l’interaction en temps réel. Alibaba présente ainsi plusieurs fonctions audio au sein d’une même famille de modèles. La reconnaissance automatique de la parole vise notamment les usages multilingues et les dialectes. La gamme comprend aussi des modèles capables de produire de la voix, des effets sonores et des arrière-plans audio. Le lancement est annoncé par Alibaba dans une publication consacrée à Qwen Audio 3.1. Lire l’annonce d’Alibaba Qwen.
La reconnaissance progresse avec une version ASR améliorée. Alibaba indique qu’elle renforce la compréhension des langues et des dialectes. Le modèle nettoie automatiquement les mots de remplissage et les répétitions. Cette fonction concerne directement les transcriptions produites par le système. Alibaba lance également ASR-Next, une déclinaison qui ajoute l’identification de plusieurs locuteurs. Elle associe cette identification à des horodatages. ASR-Next détecte aussi les émotions, les sons ambiants et les bruits de machines. Ces capacités distinguent la parole, les caractéristiques vocales et les éléments sonores présents dans un enregistrement. La fiche du modèle ASR est disponible sur Qwen Cloud.
La synthèse vocale constitue un autre volet de Qwen Audio 3.1. Le modèle TTS prend en charge la synthèse multilingue. Il permet aussi un transfert naturel de voix entre plusieurs langues. Alibaba ajoute TTS-Next à la gamme. Ce modèle associe un modèle de langage à une approche par diffusion. Il génère, en une seule passe, de la voix, des effets sonores et des sons d’arrière-plan. La gamme distingue donc une fonction de synthèse multilingue et une fonction de génération audio plus large. Ces deux modèles appartiennent aux cinq nouveautés annoncées par Alibaba le 23 septembre 2026. La présentation technique de Qwen Audio.
Le modèle temps réel permet de parler et d’écouter simultanément. Il accepte une interruption instantanée pendant l’échange. Alibaba indique aussi que ce modèle détecte une réponse empathique lorsque l’utilisateur est identifié comme étant de mauvaise humeur. Cette fonction complète les modèles de reconnaissance et de synthèse de la gamme. Qwen Audio 3.1 rassemble ainsi des capacités de transcription, de génération vocale et d’interaction directe. Les cinq modèles couvrent ces trois catégories annoncées par Alibaba. La publication du 23 septembre 2026 présente cette gamme comme un lancement coordonné. Le modèle temps réel ajoute donc une interaction conversationnelle aux fonctions audio déjà détaillées.
Les tarifs diminuent selon trois niveaux annoncés par Alibaba. Le prix de la synthèse vocale baisse d’environ 70 %. Le tarif du service temps réel recule d’environ 85 %. La réduction atteint jusqu’à 95 % pour la reconnaissance automatique de la parole. Ces pourcentages concernent les services audio associés à la nouvelle gamme Qwen Audio 3.1. Alibaba relie ainsi le lancement des modèles à une nouvelle grille tarifaire. Les baisses ne s’appliquent pas au même niveau selon la fonction utilisée. La synthèse vocale, le temps réel et la reconnaissance vocale disposent chacun d’un pourcentage annoncé séparément par Alibaba le 23 septembre 2026.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés