En résumé
Amazon SageMaker AI héberge Qwen3-TTS-12Hz-1.7B-Base sur un endpoint temps réel géré.
Le modèle clone une voix depuis quelques secondes d’audio et son transcript, sans réentraînement.
Qwen3-TTS couvre dix langues et conserve l’identité vocale lors d’une génération multilingue.
Le signal : Qwen3-TTS-12Hz-1.7B-Base clone une voix avec quelques secondes d’audio sur une instance NVIDIA L4 de 24 Go.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
Amazon SageMaker déploie Qwen3-TTS Le modèle Qwen3-TTS-12Hz-1.7B-Base est désormais déployable depuis Amazon SageMaker JumpStart vers un endpoint d’inférence temps réel. Il génère une nouvelle phrase dans la voix d’un locuteur à partir d’un court enregistrement de référence et de son transcript. Aucun réentraînement n’est nécessaire pour cette opération. L’approche vise notamment les équipes médias, les formateurs et les développeurs d’applications. Amazon SageMaker AI prend en charge le provisionnement de l’infrastructure, la surveillance de l’état et la mise à l’échelle automatique. Les données audio restent dans l’environnement AWS géré par l’utilisateur. Lire l’article technique d’AWS.
Qwen couvre dix langues La famille Qwen3-TTS est développée par l’équipe Qwen d’Alibaba Cloud. Elle prend en charge le chinois, l’anglais, le japonais, le coréen, l’allemand, le français, le russe, le portugais, l’espagnol et l’italien. Le modèle utilise le tokenizer vocal Qwen3-TTS-Tokenizer-12Hz et prend en charge la génération en flux. La variante Base capture le timbre, la hauteur et la cadence d’un locuteur. Elle peut ensuite appliquer ces caractéristiques à un nouveau texte. Le clonage fonctionne aussi entre langues. Une voix enregistrée dans une langue peut donc produire un texte dans une autre, tout en conservant l’identité vocale. Le modèle est disponible sur Hugging Face.
Une architecture en deux étapes Le déploiement utilise un conteneur de service vLLM-Omni sur une instance GPU. Le client envoie une requête HTTP contenant le texte cible, l’audio de référence encodé en base64 et son transcript. La première étape, appelée talker, produit les jetons vocaux à partir du texte et de la voix. La seconde, appelée code2wav, transforme ces jetons en forme d’onde. L’endpoint renvoie un fichier audio dans le format demandé. Le conteneur génère une sortie WAV mono à 24 kHz dans l’exemple présenté. JumpStart fournit les artefacts du modèle et le conteneur préconfiguré. L’utilisateur n’écrit donc pas de gestionnaire d’inférence personnalisé.
Une instance L4 suffit Le guide utilise une instance ml.g6.4xlarge équipée d’un GPU NVIDIA L4 de 24 Go. Le réglage SM_VLLM_GPU_MEMORY_UTILIZATION doit être fixé à 0,45. Les deux étapes partagent en effet le même GPU et réservent chacune cette fraction de mémoire. Leur réservation cumulée atteint ainsi 0,90, en laissant environ 10 % de marge. Les journaux CloudWatch indiquent 3,66 Gio pour les poids du talker et 0,45 Gio pour ceux de code2wav. Le cache KV du talker réserve 6,08 Gio. Le budget associé atteint 56 928 jetons. Le modèle 1,7 milliard de paramètres tient donc sur cette configuration documentée.
Une route configure la requête L’endpoint SageMaker expose le chemin /invocations. Le conteneur redirige ce chemin vers le gestionnaire de complétion par défaut. Pour atteindre la synthèse vocale, la requête doit ajouter l’attribut personnalisé route=/v1/audio/speech. Le corps utilise un schéma de parole compatible avec OpenAI. Il doit définir task_type sur Base, puis fournir ref_audio et ref_text. L’audio de référence doit être transmis comme URI data:audio/wav;base64. AWS recommande une conversion préalable en WAV mono à 24 kHz. La réponse peut demander le format WAV. Une requête convient à une phrase ou à un passage court. Les contenus longs doivent être découpés par phrase ou paragraphe.
Des usages multilingues documentés Le clonage vocal peut soutenir la localisation de contenus en conservant la voix du locuteur original. Il peut aussi produire des réponses cohérentes pour un centre de contact ou un assistant virtuel. Les formations en ligne et les livres audio peuvent utiliser la voix d’un formateur ou d’un auteur. Les équipes créatives peuvent tester des dialogues avant une production en studio. La génération en flux associe par ailleurs reconnaissance vocale et synthèse à faible latence pour des agents conversationnels interactifs. Le modèle CustomVoice répond à un autre besoin. Il génère des voix parmi un ensemble prédéfini, tandis que Base accepte une référence audio fournie par l’utilisateur. Le SDK Python SageMaker est disponible sur GitHub.
Le suivi passe par CloudWatch Le déploiement nécessite un compte AWS, des permissions IAM et un environnement SageMaker Studio, un notebook ou une installation locale du SDK Python. Il faut aussi disposer d’un quota suffisant pour l’instance GPU choisie. Après l’appel à deploy, l’endpoint met plusieurs minutes à atteindre l’état InService. Son état peut être consulté dans la console SageMaker AI ou avec l’API describe_endpoint. Les journaux Amazon CloudWatch permettent de suivre la mémoire consommée par les deux étapes. Les métriques CloudWatch servent également à surveiller l’endpoint et à ajuster sa taille. Cette configuration fournit ainsi un chemin géré pour tester le clonage vocal temps réel.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés