Par Arthur Dekeyser
En résumé
CoreWeave rend les systèmes NVIDIA Vera Rubin NVL72 disponibles sur son cloud.
Cognition mesure jusqu’à 4,8 fois plus de débit de jetons sur Vera Rubin NVL72.
CoreWeave Forge relie formation, évaluation et amélioration continue des agents.
Le signal : Cognition mesure jusqu’à 4,8 fois plus de débit de jetons avec Vera Rubin NVL72 que sur GB200 NVL72.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
CoreWeave annonce la disponibilité des systèmes NVIDIA Vera Rubin NVL72 sur son cloud. L’annonce a été faite pendant CoreWeave Fully Connected, organisé cette semaine à San Francisco. Ces systèmes intègrent le réseau Ethernet Spectrum-X 102.4T. Cognition, laboratoire d’IA appliquée derrière l’ingénieur logiciel Devin, est le premier client à exécuter des charges de production sur Vera Rubin. CoreWeave proposera aussi NVIDIA Vera, un processeur conçu pour les agents d’IA. L’entreprise lance enfin CoreWeave Forge, un environnement relié pour former, évaluer et améliorer les modèles et les agents. Cette offre prolonge près d’une décennie de co-ingénierie entre CoreWeave et NVIDIA.
Cognition exploite CoreWeave pour la formation, l’apprentissage par renforcement et l’inférence de production de Devin. L’entreprise est passée à plusieurs milliers de processeurs graphiques sur CoreWeave en neuf mois. CoreWeave a reçu ses premiers racks Vera Rubin NVL72 de production plus tôt ce mois-ci. Cognition a ensuite comparé Vera Rubin NVL72 à une configuration GB200 NVL72. Le test utilisait des tâches issues de FrontierCode et des agents chargés de les résoudre. Sur les charges SWE-2, Cognition a observé jusqu’à 4,8 fois plus de débit total de jetons. Selon Silas Alberti, membre fondateur de Cognition, le coût par jeton compte pour les tâches de programmation agentique.
Le cloud comprend plusieurs moyens d’exploitation de cette capacité. Les clients en accès anticipé peuvent utiliser Vera Rubin NVL72 sur CoreWeave Cloud. CoreWeave indique avoir installé un cluster de production pour Cognition en quelques jours. Cette installation résulte d’un travail conjoint entre NVIDIA et CoreWeave, de l’infrastructure aux jetons servis. Les capacités peuvent être administrées avec CoreWeave Kubernetes Service, SUNK, CoreWeave Mission Control, CoreWeave Sandboxes et CoreWeave Inference. NVIDIA Vera doit aussi rejoindre CoreWeave Cloud. Dans un rack, son déploiement rassemble 128 processeurs et 11 264 cœurs, pour plus de 11 000 environnements concurrents à raison d’un cœur par environnement.
Les tests montrent plus de trois fois moins de temps de démarrage pour les environnements d’agents sur les processeurs NVIDIA Vera. CoreWeave Sandboxes fournit ces environnements isolés pour l’apprentissage par renforcement, l’usage d’outils et l’évaluation des modèles. Les tests indiquent aussi un gain de performance de 1,7 fois sur Vera pour les tâches réussies de Terminal-Bench. Les environnements peuvent fonctionner sur une infrastructure sans serveur ou sur celle utilisée pour la formation. CoreWeave indique que les appels d’outils, les exécutions d’apprentissage par renforcement et les évaluations disposent ainsi d’un environnement isolé. Les commutateurs Spectrum-X et les processeurs de données BlueField-4 assurent les communications des agents.
Forge unifie plusieurs composants dans un environnement consacré à l’amélioration continue des modèles et des agents. La plateforme réunit Weights & Biases, l’expertise de post-formation d’OpenPipe et le projet de carnet marimo. Elle reste ouverte aux modèles, aux architectures logicielles et aux clouds. CoreWeave ARIA est désormais disponible de manière générale pour analyser les exécutions, proposer des expériences et recommander des modifications de code. Agent Lens transforme l’observabilité des agents en informations d’amélioration continue. CoreWeave annonce une détection des défaillances améliorée de 20 % et une correction réalisée à moitié du coût. Serverless RL s’exécute 1,4 fois plus vite, avec un coût inférieur de 40 % à une configuration autogérée.
NVIDIA Dynamo alimente le service d’inférence administré de CoreWeave et RL Rollouts, actuellement en aperçu privé. RL Rollouts charge de nouveaux points de contrôle dans un déploiement actif sans redéploiement. Canva, Capital One et MasterClass figurent parmi les premières entreprises utilisant Forge. Les modèles ouverts NVIDIA Nemotron donnent aux équipes un accès direct à la personnalisation et au déploiement de modèles de raisonnement et de modèles multimodaux. Dans le secteur de la santé, Ennoble Care a sélectionné CoreWeave pour l’inférence clinique. Ce prestataire accompagne environ 50 000 patients Medicare à besoins élevés dans 15 États et prévoit d’utiliser des GPU NVIDIA RTX PRO 6000 réservés pour ses agents cliniques.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés
À lire aussi