NVIDIA arme les médias contre les vidéos synthétiques
3 min · 18 septembre 2026

NVIDIA arme les médias contre les vidéos synthétiques

Par Arthur Dekeyser

En résumé

1

NVIDIA étend sa suite AI for Media avec des outils d’analyse vidéo et audio en temps réel.

2

Le détecteur vidéo synthétique atteint 99,3 % de précision sur les contenus texte-vers-vidéo.

3

Les acteurs du sport peuvent personnaliser des modèles multimodaux avec leurs propres vidéos et annotations.

💡

Le signal : NVIDIA annonce une précision de 99,3 % pour son détecteur vidéo synthétique sur les contenus texte-vers-vidéo.

NEWSLETTER BUSINESS & IA

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs abonnés

NVIDIA élargit sa suite NVIDIA AI for Media à l’occasion de l’IBC 2026, organisée du 11 au 14 septembre à Amsterdam. L’entreprise présente des kits de développement logiciel accélérés par GPU, des microservices NVIDIA NIM, des guides et des architectures pour les médias. Ces outils ciblent la production en direct, le sport, l’information et la diffusion en continu. Ils servent notamment à analyser les mouvements, vérifier l’authenticité des vidéos, améliorer les images et localiser les programmes. L’IBC réunit plus de 44 000 participants issus de plus de 170 pays. Le salon accueille également plus de 1 300 expositions réparties dans au moins 14 halls et espaces extérieurs. NVIDIA détaille cette annonce.

Le détecteur SVD évalue la probabilité qu’une vidéo soit authentique ou générée par une IA. Depuis sa première publication, le microservice NVIDIA Synthetic Video Detector atteint 99,3 % de précision pour les contenus texte-vers-vidéo. Il atteint aussi 97,7 % pour les contenus image-vers-vidéo. Dalet l’intègre à un processus sécurisé hébergé dans le cloud pour les organisations de presse. Les équipes éditoriales peuvent soumettre des séquences, puis examiner les scores et les métadonnées depuis l’interface Dalet. TwelveLabs rend également disponible Compliance by TwelveLabs. Cette application intègre SVD et ses signaux d’authenticité au niveau des images. Elle aide les équipes à examiner des contenus selon des règles régionales ou personnalisées.

Les partenaires intègrent SVD

Wowza distribue SVD dans son Wowza Video Intelligence Framework. Sa technologie Wowza Streaming Engine équipe plus de 35 000 déploiements vidéo dans plus de 170 pays. Le cadre doit analyser des flux vidéo en direct et extraire des données sur les objets, les scènes et les signes de génération artificielle. Il peut fonctionner sur site, en périphérie, dans le cloud, dans des environnements hybrides ou totalement isolés. NVIDIA présente aussi 3D Body Pose, qui estime les positions et les angles des articulations humaines à partir d’une seule caméra. Les organisations sportives peuvent exploiter ces données pour le suivi des joueurs, l’analyse biomécanique, les ralentis, l’arbitrage et la sécurité.

Les effets vidéo regroupent plusieurs fonctions dans un même flux de traitement. Video Frame Generation crée des images intermédiaires et peut doubler ou quadrupler la cadence vidéo. Ross Video l’intègre à Rio Replay pour produire des ralentis sportifs assistés par IA jusqu’à six fois. Le développement vise une interpolation huit fois. Video Super Resolution agrandit les vidéos en réduisant le bruit, le flou et les artefacts de compression. NVIDIA TrueHDR convertit une vidéo à gamme dynamique standard vers une sortie à grande gamme dynamique, jusqu’à environ 2 000 nits. VSR, VFG et TrueHDR peuvent être combinés pour la diffusion, le transcodage, le jeu vidéo et la création de contenu.

Les modèles sportifs gagnent en précision

La localisation progresse avec les microservices NVIDIA LipSync et Active Speaker Detection. LipSync adapte les mouvements de la bouche à une piste audio cible. La fonction conserve la pose de la tête, les clignements et les mouvements du corps. Sa nouvelle version améliore la gestion des obstructions faciales. Active Speaker Detection ajoute la détection d’activité vocale et ne nécessite plus de séparation des locuteurs pour plusieurs pistes audio. NDI utilise NVIDIA AI for Media pour proposer la traduction en temps réel, le doublage synchronisé et l’adaptation linguistique régionale. Studio Voice ajoute enfin des profils de microphone pour réduire le bruit ambiant et la réverbération, puis façonner le rendu vocal.

Les architectures ouvertes s’appuient sur Holoscan for Media et Media Exchange Layer. Holoscan for Media fournit une architecture de référence et un environnement pour construire des fonctions de production en direct pilotées par logiciel. MXL permet aux applications d’échanger de la vidéo, de l’audio et des données dans des environnements distribués. NVIDIA présente aussi ses Sports Intelligence Playbooks. Ces cadres couvrent la préparation des données, l’ajustement, l’inférence, l’évaluation, l’optimisation et le déploiement. Lors de premiers tests, la précision à choix multiples est passée d’environ 53 % à 94 %. L’évaluation ouverte est passée d’environ 5,7 % à 66 % sur des séquences inédites. Machina Sports intègre ces playbooks à ses données et infrastructures sportives.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs abonnés

À lire aussi