# NVIDIA accélère les agents IA avec Nemotron dans SageMaker

> NVIDIA rend Nemotron 3.5 Lightning disponible dans Amazon SageMaker JumpStart, avec jusqu’à 4 fois plus de débit pour les agents à fort volume.

Type : Actualité IA · Catégorie : Outils · Publié le 2026-08-18 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/nvidia-ouvre-nemotron-35-lightning-a-sagemaker
Tags : nvidia, sagemaker, agents, modèles ouverts, infrastructure, raisonnement, inference

---

## En résumé

- NVIDIA rend Nemotron 3.5 Lightning accessible depuis Amazon SageMaker JumpStart.
- Le modèle active 3 milliards de paramètres sur 30 milliards au total.
- NVIDIA rapporte jusqu’à quatre fois plus de débit et 30 % de rapidité supplémentaire.

**Le signal :** NVIDIA propose Nemotron 3.5 Lightning dans SageMaker JumpStart, avec 30 milliards de paramètres dont 3 milliards actifs.

**NVIDIA rend disponible** Nemotron 3.5 Lightning dans Amazon SageMaker JumpStart le 18 août 2026. Le modèle vise les workloads agentiques à fort volume et les exécutions spécialisées rapides. NVIDIA le présente comme le [modèle ouvert](/signal-ia/actu/alpamayo-2-pulverise-gpt-4o-de-232-pts-sur-lingoqa) le plus rapide de sa catégorie pour les agents actifs en continu. La société rapporte jusqu’à quatre fois plus de débit et jusqu’à 30 % de rapidité supplémentaire dans l’exécution des tâches. Amazon permet son déploiement sans configuration manuelle de l’infrastructure de service. Cette disponibilité donne accès à un modèle public conçu pour les appels fréquents des agents. La documentation officielle détaille le lancement et les étapes de déploiement dans [Amazon SageMaker JumpStart](https://aws.amazon.com/blogs/machine-learning/nvidia-nemotron-3-5-lightning-now-available-in-amazon-sagemaker-jumpstart/).

**Le modèle combine** 30 milliards de paramètres au total, dont 3 milliards actifs à chaque passage. Son architecture hybride Mixture-of-Experts limite ainsi les paramètres mobilisés pendant l’inférence. Nemotron 3.5 Lightning possède une fenêtre de contexte pouvant atteindre 1 million de tokens. Il prend du texte en entrée et produit du texte en sortie. [NVIDIA](/signal-ia/actu/amazon-et-nvidia-redessinent-le-paysage-energetique) indique aussi l’utilisation du décodage spéculatif DFlash pour réduire la latence par token. Le modèle provient d’une distillation de NVIDIA Nemotron 3 Ultra. Il a été développé avec la Nemotron Coalition et entraîné sur des jeux de données ouverts. Les organisations peuvent personnaliser ses poids et les conserver après un post-entraînement avec NVIDIA NeMo.

## NVIDIA cible les étapes fréquentes

**Les agents répartissent** leurs appels selon le niveau de capacité requis. La planification d’un workflow complexe peut demander un modèle de pointe. La classification d’une alerte, l’extraction d’un formulaire ou la vérification d’une règle peuvent utiliser un modèle spécialisé. Nemotron 3.5 Lightning vise cette partie à fort volume des workflows agentiques. Son contexte d’un million de tokens permet de conserver l’état accumulé pendant une session longue. NVIDIA NeMo Switchyard peut router chaque étape vers un modèle choisi dans un ensemble disponible. Lightning peut alors traiter les tâches spécialisées lorsque sa vitesse et sa précision correspondent au besoin. Cette approche distingue les étapes exigeant un [raisonnement](/signal-ia/actu/olix-33-milliards-pour-defier-nvidia-en-ia) avancé des appels répétitifs et ciblés.

**Les évaluations publiées** comparent les versions BF16 et NVFP4 sur plusieurs benchmarks. En BF16, Nemotron 3.5 Lightning obtient 81,94 sur MMLU Pro et 75,44 sur GPQA Diamond. Il atteint aussi 51,56 sur SWE-bench Verified et 85,37 sur PinchBench. La version NVFP4 obtient respectivement 81,62, 75,57, 52,80 et 83,43. NVIDIA mesure ces résultats avec un protocole commun et précise qu’ils peuvent différer des chiffres déclarés par d’autres fournisseurs. Les recettes et commandes d’évaluation sont publiées dans [NeMo Gym](https://docs.nvidia.com/nemo/gym/about/). Le modèle est présenté pour des assistants personnels, la finance, la cybersécurité, les télécoms et le commerce de détail.

## SageMaker simplifie le déploiement

**Amazon propose plusieurs accès** à Nemotron 3.5 Lightning dans SageMaker JumpStart. Les utilisateurs peuvent rechercher le modèle dans SageMaker Studio, choisir sa fiche, sélectionner une instance puis lancer le déploiement. Les identifiants sont `huggingface-reasoning-nemotron-3-5-lightning-30b-a3b-nvfp4` pour NVFP4 et `huggingface-reasoning-nemotron-3-5-lightning-30b-a3b-bf16` pour BF16. Le déploiement nécessite un compte AWS, des permissions adaptées et un quota GPU suffisant. La source cite notamment `ml.g6e.12xlarge`, `ml.p4d.24xlarge` et `ml.p5.48xlarge`. L’endpoint doit afficher le statut `InService` avant l’inférence. Les utilisateurs peuvent aussi passer par la page Hugging Face ou le SDK Python SageMaker. L’endpoint doit être supprimé après usage pour éviter des frais continus.
