# Nvidia lance le rack Groq 3 LPX chez Nebius cette année

> Nvidia annonce la production complète du rack Groq 3 LPX, issu d’une acquisition de 20 milliards de dollars, avec un déploiement prévu cette année.

Type : Actualité IA · Catégorie : Secteur · Publié le 2026-08-25 · Signal IA - Order & Chaos
Source : https://www.orderchaos.eu/signal-ia/actu/nvidia-deploie-ses-racks-groq-3-lpx-cette-annee
Tags : nvidia, groq, inférence, semi-conducteurs, cloud, benchmark, inference

---

## En résumé

- Nvidia produit désormais entièrement son rack Groq 3 LPX.
- Nebius déploiera ces racks avec les systèmes Vera et Rubin avant la fin de l’année.
- Nvidia destine principalement Groq 3 LPX aux charges d’inférence sensibles à la latence.

**Le signal :** Le rack Nvidia Groq 3 LPX atteint 3 400 tokens par seconde selon un benchmark d’Artificial Analysis.

**Nvidia accélère** La société a annoncé lundi la production complète de son rack Groq 3 LPX. Cette étape commercialise la technologie issue de sa plus importante acquisition. Nvidia avait acheté les actifs de la jeune pousse Groq pour 20 milliards de dollars en décembre. Dion Harris, directeur principal chez Nvidia, a indiqué que le rack serait déployé cette année chez Nebius. Il fonctionnera aux côtés des processeurs centraux Vera et des processeurs graphiques Rubin. Nvidia prépare donc une disponibilité client rapide après l’opération. Cette annonce intervient alors que les systèmes d’[inférence](/signal-ia/actu/nvidia-annonce-jusqua-30-fois-plus-de-debit-par-megawatt) doivent répondre aux demandes avec moins de délai, notamment pour les usages de programmation et les agents logiciels.

**La latence devient** [Nvidia](/signal-ia/actu/olix-fractile-et-etched-levent-plus-de-15-milliard) associe cette demande à la capacité de servir rapidement les unités générées par un modèle. Selon Dion Harris, les fournisseurs d’informatique en nuage peuvent proposer des niveaux de service premium aux clients qui exigent une latence réduite. Le Groq 3 LPX vise principalement la phase de décodage, qui intervient lors de la génération des réponses. Son architecture intègre 500 mégaoctets de mémoire SRAM directement sur la puce. Cette mémoire vise à réduire les goulots d’étranglement liés aux échanges de données. Nvidia présente ainsi Groq comme un processeur spécialisé pour une partie précise des charges, plutôt que comme un remplacement général des processeurs graphiques.

## Nvidia déploie Groq chez Nebius

**Un rack spécialisé** Nvidia assemble 256 puces Groq 3 dans chaque rack LPX. La société revendique un débit de 3 400 tokens par seconde, sur la base d’un [benchmark](/signal-ia/actu/alpamayo-2-pulverise-gpt-4o-de-232-pts-sur-lingoqa) d’Artificial Analysis. Les puces Groq sont fabriquées par Samsung, tandis que Taiwan Semiconductor Manufacturing Co. produit les processeurs graphiques Nvidia. Cette organisation distingue les chaînes industrielles des deux familles de composants. Nvidia augmente également les livraisons de ses systèmes Vera Rubin, dont la production a commencé plus tôt cette année. Le rack Groq 3 sera donc associé à une infrastructure comprenant plusieurs catégories de processeurs. Nebius doit mettre cette combinaison en ligne avant la fin de 2026.

**La concurrence s’organise** Advanced Micro Devices a annoncé cette année l’intégration de ses systèmes à l’échelle du rack avec des puces de Cerebras. Cette entreprise spécialisée dans les processeurs d’inférence est récemment entrée en Bourse. OpenAI présente de son côté un mode Ultrafast promettant actuellement 750 tokens par seconde, avec une technologie Cerebras. [OpenAI détaille ce mode](https://openai.com/index/previewing-ultrafast/). Le débit annoncé pour Groq 3 LPX dépasse donc cette promesse selon les chiffres publiés dans la source. Ces annonces montrent plusieurs approches autour de l’inférence à faible latence. Nvidia reste toutefois exposée à cette comparaison avant son prochain point financier.

## Nvidia maintient les GPU au centre

**Les GPU restent centraux** Dion Harris a déclaré que les puces à faible latence ne remplaçaient pas les processeurs graphiques. Ces derniers assurent l’entraînement et l’inférence, tout en restant adaptables aux nouvelles technologies et aux nouveaux modèles. Nvidia réserve plutôt Groq au décodage et aux charges nécessitant une réponse rapide. Lors de la présentation de Vera Rubin et Groq 3 en mars, Jensen Huang a projeté 1 000 milliards de dollars de ventes cumulées pour Blackwell et Vera Rubin jusqu’en 2027. Il a aussi indiqué qu’un quart de l’espace de data center consacré au code serait alloué aux puces Groq. [La source originale de CNBC rapporte ces annonces](https://www.cnbc.com/2026/08/24/nvidia-says-groq-racks-will-be-online-this-year-after-20-billion-deal.html).
