# NVIDIA : Nemotron-Labs 75B double le débit des serveurs

> Le modèle compressé de NVIDIA double le débit serveur avec une réduction significative des paramètres.

Type : Actualité IA · Catégorie : Outils · Publié le 2026-07-09 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/nvidia-lance-nemotron-labs-3-puzzle-75b-a9b-compresse
Tags : nvidia, compression, débit, inference

---

## En résumé

- Le modèle compressé réduit les paramètres de 120,7B à 75,3B.
- Le modèle atteint un débit serveur 2,03x supérieur au modèle Super.
- Sur un H100, la simultanéité des requêtes passe de 1 à 8.

**Le signal :** NVIDIA présente le modèle Nemotron-Labs-3-Puzzle-75B-A9B qui double le débit serveur.

**NVIDIA a lancé** Nemotron-Labs-3-Puzzle-75B-A9B. Ce modèle est une version compressée de [Nemotron-3-Super](/signal-ia/actu/nvidia-reduit-les-couts-dia-avec-nemotron-3-ultra), utilisant une compression structurelle et une récupération de la connaissance. Le modèle original de 120,7 milliards de paramètres a été réduit à 75,3 milliards de paramètres.

**La compression de** ce modèle hybride améliore significativement le débit serveur. Avec uniquement 9,3 milliards de paramètres actifs, il atteint un débit 2,03 fois supérieur à celui de Nemotron-3-Super. Cette performance est obtenue en maintenant un débit utilisateur constant à 100 tokens par seconde.

**Sur un seul** nœud 8xB200, le modèle gère une plus grande charge d'utilisateurs. En testant sur un H100, le nombre de requêtes simultanées traitées est passé d'un maximum de 1 à 8, ce qui accroît la capacité de traitement des systèmes équipés.

**Cette innovation pourrait** avoir des répercussions sur [les applications IA à grande échelle](/signal-ia/actu/loop-engineering-redefinit-lutilisation-des-agents-ia). Le modèle est conçu pour maximiser l'efficacité matérielle tout en maintenant la qualité de service, même avec une réduction drastique des paramètres totaux.
