# Amazon SageMaker muscle l’inférence avec 13 nouveautés

> Amazon SageMaker AI a lancé 13 capacités en 2026 pour accélérer le déploiement, réduire les délais et mieux observer l’inférence générative.

Type : Actualité IA · Catégorie : Outils · Publié le 2026-09-21 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/amazon-sagemaker-accelere-linference-avec-13-avancees
Tags : sagemaker, inférence, modèles génératifs, aws, gpu, llama, inference

---

## En résumé

- Amazon SageMaker AI a livré 13 capacités nouvelles depuis le début de 2026.
- Les recommandations d’inférence ont doublé le débit de GPT-OSS-20B à latence identique.
- Le routage par préfixe a réduit jusqu’à 77 % le TTFT médian sur Llama 3.1 70B.

**Le signal :** Amazon SageMaker AI a livré 13 nouvelles capacités en 2026 sur ses endpoints et HyperPod Inference.

**Amazon SageMaker AI** a livré 13 nouvelles capacités depuis le début de 2026 pour l’inférence de [modèles génératifs](/signal-ia/actu/apple-compresse-ses-modeles-generatifs-avec-idea-prune). Ces lancements couvrent deux voies de déploiement. Les endpoints administrés par AWS prennent en charge le provisionnement des GPU, la mise à l’échelle et le suivi opérationnel. SageMaker HyperPod Inference cible les équipes qui veulent un contrôle Kubernetes sur des grappes de GPU dédiées. Les modèles génératifs peuvent peser des dizaines ou des centaines de gigaoctets. Leurs exigences de latence se mesurent en jetons par seconde. Les démarrages à froid peuvent durer plusieurs minutes. [AWS détaille ces lancements](https://aws.amazon.com/blogs/machine-learning/amazon-sagemaker-inference-2026-year-to-date-launches-in-review/).

**Deux voies d’exploitation** structurent l’offre 2026. Les endpoints se déploient via la console, le SDK ou l’interface en ligne de commande. AWS assure alors l’[infrastructure](/signal-ia/actu/salesforce-divise-par-huit-ses-couts-avec-sagemaker) et les opérations. HyperPod Inference repose sur une pile Kubernetes administrée par l’équipe. Elle accepte notamment kubectl, Terraform, la console, le SDK et l’interface en ligne de commande. Les endpoints proposent une interface compatible OpenAI. HyperPod accepte HTTP, gRPC et des équilibreurs de charge personnalisés. Les endpoints conviennent aux déploiements rapides avec peu de charge opérationnelle. HyperPod vise les déploiements Kubernetes, hybrides ou multicloud nécessitant davantage de personnalisation.

## SageMaker automatise le choix matériel

**Les recommandations d’[inférence](/signal-ia/actu/baseten-accelere-linference-jusqua-10-fois)** automatisent le filtrage, l’optimisation et la mesure des configurations. SageMaker analyse l’architecture, la taille et les besoins mémoire du modèle. Il applique ensuite des techniques comme le décodage spéculatif EAGLE 3.0, l’optimisation des noyaux et le parallélisme tensoriel. Il mesure les résultats sur une infrastructure GPU réelle avec NVIDIA AIPerf. Le rapport fournit le TTFT, la latence interjetons, les percentiles P50, P90 et P99, le débit et une projection des coûts. Dans un exemple présenté par AWS, GPT-OSS-20B a atteint deux fois plus de jetons par seconde à latence identique. La génération de recommandations ne coûte rien en supplément.

**La capacité GPU** bénéficie aussi de listes prioritaires pouvant contenir jusqu’à cinq types d’instances. SageMaker essaie le premier type disponible lors de la création, de l’extension et de la réduction d’un endpoint. Les métriques CloudWatch par type d’instance permettent d’ajuster les politiques de mise à l’échelle. Chaque entrée peut utiliser une configuration optimisée différente. Les recommandations d’inférence peuvent générer ces configurations pour chaque matériel. La mise en cache des conteneurs réduit également les délais lors des extensions. Avec Qwen3-8B sur ml.g6.2xlarge, le démarrage est passé de 525 à 258 secondes. AWS indique une réduction de 51 %.

## AWS améliore le suivi des requêtes

**L’observabilité détaillée** ajoute plus de 100 métriques d’inférence via OpenTelemetry natif. Les nouveaux endpoints l’activent par défaut. Les données arrivent dans les deux minutes suivant le statut InService. Le tableau de bord CloudWatch suit le TTFT, la latence interjetons, le débit, l’utilisation du cache KV et la profondeur de file. Il affiche aussi l’utilisation des GPU, la mémoire, la température et le stockage. Des informations concernent la répartition entre zones de disponibilité et les différentes phases des démarrages à froid. Un point de terminaison compatible PromQL permet d’interroger ces métriques depuis Amazon Managed Grafana ou un outil compatible.

**Le routage par préfixe** dirige les requêtes partageant un début de prompt vers la même instance. Cette approche favorise la réutilisation du cache KV pour les instructions système, les documents récupérés ou l’historique conversationnel. Sur Llama 3.1 70B réparti sur sept instances, le TTFT P90 a baissé de 33 à 37 % avec des préfixes de 8 000 jetons. Le TTFT P50 a diminué de 71 à 77 %. Le taux d’utilisation du cache KV est passé d’environ 25 % à 82 %. La stratégie ajoute entre 1,3 et 1,9 milliseconde par requête. Elle s’active dans la configuration de l’endpoint, sans modification du conteneur.
