En résumé
Le modèle compressé réduit les paramètres de 120,7B à 75,3B.
Le modèle atteint un débit serveur 2,03x supérieur au modèle Super.
Sur un H100, la simultanéité des requêtes passe de 1 à 8.
Le signal : NVIDIA présente le modèle Nemotron-Labs-3-Puzzle-75B-A9B qui double le débit serveur.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs
NVIDIA a lancé Nemotron-Labs-3-Puzzle-75B-A9B. Ce modèle est une version compressée de Nemotron-3-Super, utilisant une compression structurelle et une récupération de la connaissance. Le modèle original de 120,7 milliards de paramètres a été réduit à 75,3 milliards de paramètres.
La compression de ce modèle hybride améliore significativement le débit serveur. Avec uniquement 9,3 milliards de paramètres actifs, il atteint un débit 2,03 fois supérieur à celui de Nemotron-3-Super. Cette performance est obtenue en maintenant un débit utilisateur constant à 100 tokens par seconde.
Sur un seul nœud 8xB200, le modèle gère une plus grande charge d’utilisateurs. En testant sur un H100, le nombre de requêtes simultanées traitées est passé d’un maximum de 1 à 8, ce qui accroît la capacité de traitement des systèmes équipés.
Cette innovation pourrait avoir des répercussions sur les applications IA à grande échelle. Le modèle est conçu pour maximiser l’efficacité matérielle tout en maintenant la qualité de service, même avec une réduction drastique des paramètres totaux.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs