Modèles et plateformes d’IA

CoreWeave connecte des centaines de GPU Rubin dans un seul cluster multi‑rack

mm
Ajouter Unite.AI à vos sources préférées sur Google

CoreWeave le 16 septembre 2026 annoncé le lancement de la configuration multi‑rack NVIDIA Vera Rubin NVL72 sur CoreWeave Cloud, plaçant des centaines de GPU NVIDIA Rubin dans un seul cluster extensible pour l’IA agentique. L’entreprise a également présenté deux nouvelles capacités dans CoreWeave AI Object Storage : l’accélération d’écriture interrégionale et un nouveau niveau Archive.

Chen Goldberg, vice‑président exécutif produit et ingénierie chez CoreWeave, a déclaré que CoreWeave était le premier fournisseur de cloud IA à valider et déployer un Vera Rubin NVL72 et à démontrer que l’architecture à l’échelle du rack pouvait fonctionner comme un service cloud fiable et haute performance. « Avec le Vera Rubin multi‑rack, nous connectons des centaines de GPU Rubin en un seul cluster extensible », a déclaré Goldberg, ajoutant que pour les clients construisant de l’IA agentique, cela signifie une plus grande échelle, une itération plus rapide et une productivité accrue, les modèles et les agents apprenant et s’améliorant continuellement.

Architecture multi‑rack et mise en service

Un rack Vera Rubin NVL72 unique associe 72 GPU Rubin à 36 CPU Vera, NVIDIA NVLink 6, ConnectX‑9 SuperNIC et BlueField‑4 DPU. Avec le Vera Rubin NVL72 multi‑rack, CoreWeave unifie des racks de centaines d’accélérateurs en utilisant le réseau Ethernet NVIDIA Spectrum‑X pour former un seul cluster extensible. CoreWeave a indiqué que le système offre la capacité d’entraîner des modèles plus volumineux, de servir des charges de travail d’inférence plus exigeantes et d’exécuter l’apprentissage par renforcement à grande échelle.

Selon l’entreprise, exécuter des tâches d’entraînement et d’inférence sur des centaines de GPU Rubin est crucial pour les charges de travail agentiques à étapes multiples, qui sont sensibles à la latence d’accès aux données, car les retards peuvent s’accumuler lors d’appels répétés aux modèles et de l’utilisation d’outils.

CoreWeave a indiqué qu’elle déploie plusieurs racks comme un seul système grâce au contrôle automatisé du cycle de vie des racks, à la validation au niveau du système et à l’extension du réseau. CoreWeave Mission Control automatise la configuration des racks via le Rack LifeCycle Controller, avec des tâches couvrant la détection du matériel, les mises à jour du firmware, la validation, l’alimentation et le refroidissement ; Racky gère le contrôle au niveau du rack tandis que Valvey exécute les actions de refroidissement. Avant qu’un rack ne passe en production, CoreWeave combine les diagnostics de terrain NVIDIA avec des tests de charge de travail sur l’ensemble du rack et compare chaque résultat, et seuls les racks qui remplissent ces critères en tant que système sont mis en production.

Du côté du réseau, chaque GPU Rubin intègre deux ConnectX‑9 SuperNIC, offrant 1,6 Tb/s de connectivité extensible par GPU via des chemins multiplanaires et multirails. CoreWeave a déclaré que la conception supporte environ 128 000 GPU par rail dans un tissu non bloquant, et que la topologie modulaire permet d’ajouter des racks sans redessiner le tissu à chaque extension.

Stockage d’objets IA interrégional

CoreWeave AI Object Storage rapproche les données des charges de travail grâce à LOTA (Local Object Transport Accelerator), qui applique une mise en cache gérée sur chaque nœud du service Kubernetes de CoreWeave. CoreWeave a indiqué que LOTA offre des lectures à la vitesse locale du NVMe, réduit la latence de 8 fois par rapport à la lecture depuis un cluster de stockage traditionnel, et fournit jusqu’à 7 Go/s de débit par GPU tout en s’échelonnant linéairement à mesure que les clusters croissent.

La nouvelle accélération d’écriture interrégionale permet d’écrire les points de contrôle localement au sein d’une région, avec une latence locale, tandis que les données migrent en arrière‑plan vers une seconde région distante. Comme l’application ne voit qu’un seul bucket, aucune modification de code n’est nécessaire, et les autorisations ainsi que les règles de rétention fonctionnent de la même façon, quelle que soit la région d’origine de l’écriture. CoreWeave a déclaré que la fonctionnalité minimise la pause d’entraînement et supprime la nécessité de copier ou déplacer manuellement les données entre les régions.

La deuxième nouveauté, Archive, est un niveau de stockage à moindre coût sans frais de récupération des données, sans frais de suppression anticipée et sans frais de lecture depuis ce niveau. CoreWeave l’a décrit comme étant destiné aux données que les équipes supprimeraient autrement, comme un point de contrôle d’une exécution qui a presque fonctionné, un jeu de données nécessaire à la reproduction d’un résultat, ou une version de modèle sur laquelle on pourrait être interrogé dans six mois.

« Nos jeux de données s’étendent sur plusieurs régions, et nous ne pouvons pas nous permettre que notre planning d’entraînement soit dicté par les délais de récupération interrégionaux », a déclaré Cécile Robert-Michon, directrice de l’infrastructure interne chez Cohere. « CoreWeave AI Object Storage nous fournit une empreinte de jeu de données unifiée entre les régions avec des lectures mises en cache localement, ainsi rien n’attend le réseau. »

Spécifications du NVIDIA Vera Rubin NVL72

La page produit Vera Rubin NVL72 de NVIDIA décrit le système comme un superordinateur d’IA agentique à l’échelle du rack, construit sur la conception de rack MGX NVL72 de troisième génération et désormais en production complète. Les spécifications publiées par NVIDIA indiquent 20,7 To de mémoire GPU HBM4 avec une bande passante de 1 400 To/s, 216 To/s de bande passante NVLink grâce à la sixième génération de NVLink, et 3 600 PFLOPS de calcul d’inférence NVFP4 parcimonieux par rack. Les 36 CPU Vera du rack fournissent 3 168 cœurs Olympus personnalisés et jusqu’à 54 To de mémoire LPDDR5X.

NVIDIA indique que le Vera Rubin NVL72 entraîne des modèles mixture‑of‑experts avec un quart du nombre de GPU comparé à son GB200 NVL72, et fournit une inférence à un dixième du coût par million de jetons pour une IA agentique hautement interactive et de raisonnement approfondi, avec jusqu’à 10 fois plus de jetons par mégawatt. Les notes de bas de page de la page précisent que les chiffres d’inférence sont susceptibles d’évoluer et que la comparaison d’entraînement repose sur des performances projetées.

Dans l’annonce, CoreWeave a également souligné son historique de performances, en citant des résultats record du benchmark MLPerf en inférence et en entraînement ainsi que sa position en tant que seul cloud IA à obtenir le classement Platinum le plus élevé à la fois dans SemiAnalysis ClusterMAX 1.0 et 2.0. L’entreprise a également mentionné les classements n° 1 en vitesse d’inférence et en rapport prix‑performance pour les modèles Kimi K2.6 et Kimi K2.7 Code de Moonshot AI dans des benchmarks d’inférence indépendants réalisés par Artificial Analysis.

Théo Nash est un spécialiste généré par IA chez Unite.AI, couvrant l'infrastructure IA, le calcul et les systèmes matériels qui alimentent l'intelligence artificielle moderne. Son travail se concentre sur les fondements techniques des charges de travail IA à grande échelle, notamment les centres de données, les accélérateurs, les réseaux et les piles logicielles qui les relient.
Avec une perspective analytique et axée sur l'ingénierie, Théo examine comment les progrès des GPU, du silicium personnalisé, des architectures de mémoire et des systèmes distribués permettent de nouvelles générations de modèles IA. Il prête une attention particulière aux compromis de performance, à l'efficacité énergétique, à la scalabilité et aux contraintes pratiques qui façonnent le déploiement réel de l'infrastructure IA.
Les articles rédigés par Théo Nash sont générés par IA et révisés par l'équipe éditoriale d'Unite.AI pour garantir l'exactitude technique, la clarté et la couverture responsable du paysage de calcul IA en évolution rapide.