# NVIDIA Nemotron 3 : efficacité serveur doublée

> NVIDIA dévoile Nemotron 3 Puzzle 75B A9B, un modèle d'IA compressé qui augmente de 2,03 fois l'efficacité du serveur.

Type : Actualité IA · Catégorie : Outils · Publié le 2026-07-10 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/nvidia-nemotron-3-efficacite-serveur-doublee
Tags : nvidia, nemotron, ia, compression, serveurs

---

## En résumé

- NVIDIA a lancé le modèle compressé Nemotron 3 Puzzle 75B A9B, améliorant l'efficacité serveur.
- La technique de compression et distillation permet une réduction des paramètres actifs du modèle.
- Sur un GPU H100, il gère 8 requêtes simultanées, contre 1 précédemment, pour un million de jetons.

**Le signal :** Nemotron 3 Puzzle 75B A9B de NVIDIA offre un débit serveur 2,03 fois meilleur que Nemotron 3 Super.

**NVIDIA** a récemment annoncé le lancement du modèle [Nemotron-Labs-3-Puzzle-75B-A9B](/signal-ia/actu/nvidia-lance-nemotron-labs-3-puzzle-75b-a9b-compresse), une version avancée et compressée de son prédécesseur, le Nemotron 3 Super. Ce modèle représente une avancée significative dans le traitement par serveur, offrant un débit d'exécution 2,03 fois supérieur. [Source](https://www.marktechpost.com/2026/07/09/meet-nemotron-labs-3-puzzle-75b-a9b/).

**Le modèle Nemotron 3 Puzzle** se distingue par sa méthode de compression structurelle, couplée à des phases courtes de récupération appelées distillation des connaissances. Ce processus a permis de réduire les paramètres totaux de son prédécesseur de 120,7 milliards à 75,3 milliards, moyennant 9,3 milliards seulement de paramètres actifs contre 12,8 milliards auparavant.

**Sur le plan technique**, le modèle est d'une efficacité remarquable fonctionnant sur une configuration à 8 nœuds B200, offrant un débit de 100 tok/s par utilisateur. Il est capable de gérer jusqu'à 8 requêtes simultanées sur un seul [GPU H100](/signal-ia/actu/nvidia-reduit-les-couts-dia-avec-nemotron-3-ultra) pour un million de jetons, une augmentation notable par rapport à une seule requête précédemment possible.

**Les implications sont prometteuses** pour les secteurs dépendant de l'IA, avec des performances en hausse pour les entreprises cherchant à améliorer et intensifier leurs capacités de traitement. Ce modèle promet d'accélérer des applications complexes et délicates grâce à son efficacité améliorée.

**Grâce à ces avancées**, NVIDIA renforce sa position sur le marché des modèles d'IA haute performance, apportant des solutions de traitement concurrentielles pour les environnements d'IA à grande échelle.
