En résumé
NVIDIA rend Nemotron 3.5 Lightning accessible depuis Amazon SageMaker JumpStart.
Le modèle active 3 milliards de paramètres sur 30 milliards au total.
NVIDIA rapporte jusqu’à quatre fois plus de débit et 30 % de rapidité supplémentaire.
Le signal : NVIDIA propose Nemotron 3.5 Lightning dans SageMaker JumpStart, avec 30 milliards de paramètres dont 3 milliards actifs.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
NVIDIA rend disponible Nemotron 3.5 Lightning dans Amazon SageMaker JumpStart le 18 août 2026. Le modèle vise les workloads agentiques à fort volume et les exécutions spécialisées rapides. NVIDIA le présente comme le modèle ouvert le plus rapide de sa catégorie pour les agents actifs en continu. La société rapporte jusqu’à quatre fois plus de débit et jusqu’à 30 % de rapidité supplémentaire dans l’exécution des tâches. Amazon permet son déploiement sans configuration manuelle de l’infrastructure de service. Cette disponibilité donne accès à un modèle public conçu pour les appels fréquents des agents. La documentation officielle détaille le lancement et les étapes de déploiement dans Amazon SageMaker JumpStart.
Le modèle combine 30 milliards de paramètres au total, dont 3 milliards actifs à chaque passage. Son architecture hybride Mixture-of-Experts limite ainsi les paramètres mobilisés pendant l’inférence. Nemotron 3.5 Lightning possède une fenêtre de contexte pouvant atteindre 1 million de tokens. Il prend du texte en entrée et produit du texte en sortie. NVIDIA indique aussi l’utilisation du décodage spéculatif DFlash pour réduire la latence par token. Le modèle provient d’une distillation de NVIDIA Nemotron 3 Ultra. Il a été développé avec la Nemotron Coalition et entraîné sur des jeux de données ouverts. Les organisations peuvent personnaliser ses poids et les conserver après un post-entraînement avec NVIDIA NeMo.
Les agents répartissent leurs appels selon le niveau de capacité requis. La planification d’un workflow complexe peut demander un modèle de pointe. La classification d’une alerte, l’extraction d’un formulaire ou la vérification d’une règle peuvent utiliser un modèle spécialisé. Nemotron 3.5 Lightning vise cette partie à fort volume des workflows agentiques. Son contexte d’un million de tokens permet de conserver l’état accumulé pendant une session longue. NVIDIA NeMo Switchyard peut router chaque étape vers un modèle choisi dans un ensemble disponible. Lightning peut alors traiter les tâches spécialisées lorsque sa vitesse et sa précision correspondent au besoin. Cette approche distingue les étapes exigeant un raisonnement avancé des appels répétitifs et ciblés.
Les évaluations publiées comparent les versions BF16 et NVFP4 sur plusieurs benchmarks. En BF16, Nemotron 3.5 Lightning obtient 81,94 sur MMLU Pro et 75,44 sur GPQA Diamond. Il atteint aussi 51,56 sur SWE-bench Verified et 85,37 sur PinchBench. La version NVFP4 obtient respectivement 81,62, 75,57, 52,80 et 83,43. NVIDIA mesure ces résultats avec un protocole commun et précise qu’ils peuvent différer des chiffres déclarés par d’autres fournisseurs. Les recettes et commandes d’évaluation sont publiées dans NeMo Gym. Le modèle est présenté pour des assistants personnels, la finance, la cybersécurité, les télécoms et le commerce de détail.
Amazon propose plusieurs accès à Nemotron 3.5 Lightning dans SageMaker JumpStart. Les utilisateurs peuvent rechercher le modèle dans SageMaker Studio, choisir sa fiche, sélectionner une instance puis lancer le déploiement. Les identifiants sont huggingface-reasoning-nemotron-3-5-lightning-30b-a3b-nvfp4 pour NVFP4 et huggingface-reasoning-nemotron-3-5-lightning-30b-a3b-bf16 pour BF16. Le déploiement nécessite un compte AWS, des permissions adaptées et un quota GPU suffisant. La source cite notamment ml.g6e.12xlarge, ml.p4d.24xlarge et ml.p5.48xlarge. L’endpoint doit afficher le statut InService avant l’inférence. Les utilisateurs peuvent aussi passer par la page Hugging Face ou le SDK Python SageMaker. L’endpoint doit être supprimé après usage pour éviter des frais continus.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés