NVIDIA Audex : un modèle unique fusionne audio et texte
3 min · 8 juillet 2026

NVIDIA Audex : un modèle unique fusionne audio et texte

Par Arthur Dekeyser

En résumé

1

Audex combine reconnaissance vocale et génération audio en un seul modèle.

2

Il préserve les capacités textuelles de Nemotron-Cascade-2.

3

Le modèle Audex est basé sur une architecture MoE.

💡

Le signal : NVIDIA introduit Audex, un modèle qui intègre compréhension audio et texte sans perte de performance textuelle.

RAPPORT STRATÉGIQUE

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs

NVIDIA dévoile Audex, un modèle de langage multimodal qui intègre à la fois compréhension audio et texte. Ce modèle, dénommé Nemotron-Labs-Audex-30B-A3B, vise à unifier plusieurs capacités telles que la reconnaissance vocale et la traduction en un modèle unique. Il maintient les performances textuelles de son prédécesseur Nemotron-Cascade-2.

Audex s’appuie sur une architecture MoE (Mixture of Experts) pour accomplir sa tâche. Cette approche permet d’exécuter efficacement des opérations complexes en unifiant divers processus, de la conversion texte-parole (TTS) à la génération audio. Même avec ces ajouts, le modèle conserve la qualité du traitement textuel observée sur son socle Nemotron-Cascade-2, n’affichant que des régressions mineures.

Le lancement positionne Audex comme un outil polyvalent dans le domaine de l’intelligence audio et textuelle. Ses capacités avancées en reconnaissance et génération ouvrent de nouvelles perspectives pour les applications nécessitant des interactions vocales fluides et intégrées. Le modèle espère ainsi combler le fossé entre différents formats de données.

Selon la source, ce développement pourrait conduire à des améliorations significatives dans l’efficacité des systèmes d’assistance vocale et des plateformes de traduction. Grâce à ses avancées, Audex pourrait être adopté par divers secteurs nécessitant une intelligence artificielle capable de traiter des données audio et texte simultanément.

Pour plus de détails, voir l’article ici.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs

À lire aussi