# Baseten lève 13 milliards et repense l’inférence IA

> Baseten a levé 13 milliards de dollars en série F et détaille avec Philip Kiely et Ali Taha les méthodes d’inférence à grande échelle.

Type : Actualité IA · Catégorie : Outils · Publié le 2026-08-20 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/baseten-accelere-linference-jusqua-10-fois
Tags : inférence, modèles ouverts, gpu, quantification, baseten, kimi, inference

---

## En résumé

- Baseten présente l’inférence comme une discipline distincte de l’entraînement.
- La quantification du modèle GLM-5.2 a augmenté le débit de 20 % sans dégrader sa qualité mesurée.
- Le routage conscient du cache peut réutiliser une partie des calculs d’une requête de 200 000 tokens.

**Le signal :** Baseten affirme que l’inférence optimisée peut accélérer certains modèles jusqu’à 10 fois.

**Baseten change d’échelle.** L’entreprise a levé 13 milliards de dollars en série F, selon la présentation de Latent Space. Philip Kiely et Ali Taha y décrivent l’[inférence](/signal-ia/actu/baseten-bouscule-hugging-face-avec-kimi-k3) comme une discipline d’ingénierie distincte. Cette discipline transforme des poids entraînés en produit rapide, fiable et abordable à grande échelle. L’épisode a été publié le 3 août 2026. Il détaille les mécanismes situés après la génération d’un premier token. Les intervenants abordent notamment le routage du cache, la quantification et le parallélisme entre plusieurs processeurs graphiques. Baseten figure ainsi parmi les sociétés d’infrastructure mises en avant par l’émission. [Épisode complet sur Latent Space](https://www.latent.space/p/inference-eng).

**Une requête mobilise plusieurs étapes.** Pour une demande de 200 000 tokens, Philip Kiely décrit d’abord un routage conscient du cache. Le système cherche une instance possédant des entrées déjà calculées. Il tente aussi de trouver des unités disponibles pour le préremplissage. Sur certains modèles, Baseten sépare le préremplissage du décodage. Un groupe de processeurs traite alors l’entrée et crée le cache KV. Un autre groupe produit ensuite les tokens de façon itérative. Un modèle spéculatif peut proposer des tokens avant le modèle principal. Son efficacité dépend toutefois du taux d’acceptation des propositions. Les déploiements dédiés peuvent aussi devenir moins coûteux pour des volumes de millions de tokens.

## Baseten sépare préremplissage et décodage

**Les optimisations s’additionnent.** L’épisode cite des gains de 20 %, 100 % ou 200 % selon les optimisations d’inférence. Baseten vise aussi des modèles jusqu’à 10 fois plus rapides après optimisation du service. La [quantification](/signal-ia/actu/distilbert-allege-bert-de-40-pourcent-et-accelere-son-execution-de-71-pourcent) constitue un exemple précis. Dans une expérience récente sur GLM-5.2, une quantification plus poussée a conservé la qualité mesurée. Elle a simultanément augmenté le débit de 20 %. Ali Taha explique que les erreurs introduites dans différentes couches peuvent s’annuler. Une méthode fondée sur l’analyse de Fourier atteint également 20 % de débit supplémentaire sur GLM-5.2. Elle maintient la qualité sur les évaluations aval, selon les informations publiées.

**Les architectures se recomposent.** Baseten a greffé l’encodeur visuel de [Kimi](/signal-ia/actu/kimi-k3-256k-lia-qui-reduit-vos-couts-de-moitie) sur GLM-5.2 sans modifier le modèle linguistique sous-jacent. Les intervenants évoquent aussi le remplacement de couches inefficaces par des composants issus d’autres architectures. Ces modifications doivent préserver la fidélité du modèle. Elles doivent également éviter des échecs non déterministes liés au matériel, aux noyaux logiciels ou aux conditions de course. L’épisode traite de NVIDIA Dynamo, du parallélisme tensoriel, expert et pipeline. Il aborde aussi Rubin, les puces spécialisées et les méga-noyaux. La disponibilité de mémoire reste une contrainte pour les très grands modèles, notamment Kimi K3 et les systèmes nécessitant du matériel de classe GB300.

## GLM-5.2 optimise ses propres noyaux

**La vidéo reste limitée.** Le podcast compare les modèles autorégressifs et les modèles de diffusion. Il décrit le coût quadratique de l’attention pour la vidéo longue. La génération autorégressive peut aussi accumuler une dérive de qualité au fil des images. Les intervenants indiquent que la vidéo ouverte reste derrière Veo et Kling. Ils évoquent des systèmes combinant potentiellement architectures autorégressives et diffusion. La discussion revient ensuite sur l’entraînement et l’inférence. Elle décrit des boucles de déploiement, d’évaluation et d’amélioration continue. GLM-5.2 aurait même contribué à optimiser les noyaux qui le servent. Le cache KV persistant est également présenté comme une piste pour l’apprentissage continu et la mémoire du modèle.
