Par Arthur Dekeyser
En résumé
Cosmos3-Super avec Physis-Lang arrive premier sur Physics-IQ Verified.
Le jeu final d’entraînement rassemble 183 000 vidéos filtrées ou récupérées.
Physis-Lang dépasse Veo 3.1 sur PhyGenBench et Physics-IQ Verified.
Le signal : Cosmos3-Super avec Physis-Lang obtient 48,2 ± 1,4 sur Physics-IQ Verified le 29 septembre 2026.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
NVIDIA annonce Physis-Lang, un langage physique auto-évolutif évalué avec Cosmos3. Au 29 septembre 2026, sa version Cosmos3-Super occupe la première place du classement Physics-IQ Verified. Elle obtient 48,2 ± 1,4. La version Cosmos3-Nano arrive deuxième avec 43,3 ± 1,5. Ces résultats situent les deux déclinaisons en tête de ce classement consacré au raisonnement physique dans les vidéos. L’annonce intervient le 30 septembre 2026. La présentation de Physis-Lang est disponible sur le site du projet. Le classement Physics-IQ Verified permet de consulter les scores associés à cette évaluation.
Le jeu final d’entraînement de Physis-Lang rassemble 183 000 vidéos. Il comprend 71 000 vidéos filtrées depuis WISA-80K. Il ajoute 112 000 séquences récupérées. Le développement a également fait progresser le score Caption F1. Celui-ci est passé de 78,64 à l’itération 1 à 87,82 à l’itération 9. Cette progression mesure l’évolution enregistrée pendant les étapes de développement. Le dispositif repose donc sur un volume vidéo réparti entre filtrage et récupération. Les chiffres publiés associent cette construction du jeu final à une amélioration mesurée de la qualité des légendes. Le processus comporte neuf itérations recensées.
Les comparaisons avec Veo 3.1 de Google couvrent trois benchmarks. Sur PhyGenBench, Physis-Lang obtient 71,04 contre 65,63 pour Veo 3.1. Sur Physics-IQ Verified, il atteint 43,41 contre 34,99. Sur VideoPhy-2, il obtient 68,02 contre 68,87. Physis-Lang dépasse donc Veo 3.1 sur les deux premiers résultats comparés. Le score de VideoPhy-2 est inférieur de 0,85 point à celui de Veo 3.1. Le dépôt PhyGenBench fournit un accès à l’un des référentiels d’évaluation cités. Ces mesures distinguent les performances selon le benchmark utilisé.
Le réglage local de Physis-Lang a ajouté un gain de performance de +4,76. Cette configuration locale ne comporte aucun coût d’API commerciale, selon le résultat communiqué. Le chiffre décrit un écart de performance obtenu après la mise en place de ce réglage. Il ne correspond pas aux scores de 48,2 ou 43,3 publiés pour le classement Physics-IQ Verified. Les différentes mesures doivent donc être lues séparément. Le classement concerne Cosmos3-Super et Cosmos3-Nano. Les comparaisons avec Veo 3.1 concernent PhyGenBench, Physics-IQ Verified et VideoPhy-2. Le gain local constitue une mesure distincte des scores affichés sur ces trois évaluations.
Les résultats publiés rassemblent ainsi un classement, un jeu d’entraînement et trois comparaisons. Cosmos3-Super avec Physis-Lang arrive premier sur Physics-IQ Verified avec 48,2 ± 1,4 au 29 septembre 2026. Cosmos3-Nano arrive deuxième avec 43,3 ± 1,5. Le corpus final compte 183 000 vidéos, dont 71 000 filtrées depuis WISA-80K et 112 000 récupérées. Le score Caption F1 passe de 78,64 à 87,82 entre les itérations 1 et 9. Enfin, la configuration locale ajoute +4,76 sans coût d’API commerciale. L’article de présentation est consultable sur MarkTechPost.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés