NVIDIA Nemotron 3 : efficacité serveur doublée
2 min · 10 juillet 2026

NVIDIA Nemotron 3 : efficacité serveur doublée

Par Arthur Dekeyser

En résumé

1

NVIDIA a lancé le modèle compressé Nemotron 3 Puzzle 75B A9B, améliorant l'efficacité serveur.

2

La technique de compression et distillation permet une réduction des paramètres actifs du modèle.

3

Sur un GPU H100, il gère 8 requêtes simultanées, contre 1 précédemment, pour un million de jetons.

💡

Le signal : Nemotron 3 Puzzle 75B A9B de NVIDIA offre un débit serveur 2,03 fois meilleur que Nemotron 3 Super.

RAPPORT STRATÉGIQUE

Vous appréciez ce genre d'analyse ?

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.

+11 000 fondateurs

NVIDIA a récemment annoncé le lancement du modèle Nemotron-Labs-3-Puzzle-75B-A9B, une version avancée et compressée de son prédécesseur, le Nemotron 3 Super. Ce modèle représente une avancée significative dans le traitement par serveur, offrant un débit d’exécution 2,03 fois supérieur. Source.

Le modèle Nemotron 3 Puzzle se distingue par sa méthode de compression structurelle, couplée à des phases courtes de récupération appelées distillation des connaissances. Ce processus a permis de réduire les paramètres totaux de son prédécesseur de 120,7 milliards à 75,3 milliards, moyennant 9,3 milliards seulement de paramètres actifs contre 12,8 milliards auparavant.

Sur le plan technique, le modèle est d’une efficacité remarquable fonctionnant sur une configuration à 8 nœuds B200, offrant un débit de 100 tok/s par utilisateur. Il est capable de gérer jusqu’à 8 requêtes simultanées sur un seul GPU H100 pour un million de jetons, une augmentation notable par rapport à une seule requête précédemment possible.

Les implications sont prometteuses pour les secteurs dépendant de l’IA, avec des performances en hausse pour les entreprises cherchant à améliorer et intensifier leurs capacités de traitement. Ce modèle promet d’accélérer des applications complexes et délicates grâce à son efficacité améliorée.

Grâce à ces avancées, NVIDIA renforce sa position sur le marché des modèles d’IA haute performance, apportant des solutions de traitement concurrentielles pour les environnements d’IA à grande échelle.

Gardez un coup d'avance en IA et tech.

Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.

+11 000 fondateurs

À lire aussi