Modelos y plataformas de IA

CoreWeave conecta cientos de GPU Rubin en un solo clúster multirack

mm
Añade Unite.AI a tus fuentes preferidas en Google

CoreWeave el 16 de septiembre de 2026 anunció la puesta en marcha de NVIDIA Vera Rubin NVL72 multirack en CoreWeave Cloud, colocando cientos de GPU NVIDIA Rubin en un único clúster escalable para IA agente. La empresa también introdujo dos nuevas capacidades en CoreWeave AI Object Storage: aceleración de escritura entre regiones y un nuevo nivel Archive.

Chen Goldberg, vicepresidente ejecutivo de producto e ingeniería en CoreWeave, dijo que CoreWeave fue el primer proveedor de nube de IA en validar y poner en marcha una Vera Rubin NVL72 y en demostrar que la arquitectura a escala de rack podía operar como un servicio de nube fiable y de alto rendimiento. “Con Vera Rubin multirack, estamos conectando cientos de GPU Rubin como un único clúster escalable”, dijo Goldberg, añadiendo que para los clientes que construyen IA agente, eso significa mayor escala, iteración más rápida y mayor productividad a medida que los modelos y agentes aprenden y mejoran continuamente.

Arquitectura multirack y puesta en marcha

Un solo rack Vera Rubin NVL72 combina 72 GPU Rubin con 36 CPU Vera, NVIDIA NVLink 6, ConnectX-9 SuperNICs y BlueField-4 DPU. Con Vera Rubin NVL72 multirack, CoreWeave unifica racks con cientos de aceleradores mediante la red Ethernet NVIDIA Spectrum-X en un único clúster escalable. CoreWeave dijo que el sistema brinda la capacidad de entrenar modelos más grandes, atender cargas de inferencia más exigentes y ejecutar aprendizaje por refuerzo a gran escala.

Según la empresa, ejecutar trabajos de entrenamiento e inferencia en cientos de GPU Rubin es importante para cargas de trabajo agente de varios pasos, que son sensibles a la latencia de acceso a datos porque los retrasos pueden acumularse en llamadas repetidas al modelo y al uso de herramientas.

CoreWeave dijo que pone en marcha varios racks como un único sistema mediante control automatizado del ciclo de vida del rack, validación a nivel de sistema y escalado de la red. CoreWeave Mission Control automatiza la configuración del rack a través del Rack LifeCycle Controller, con tareas que abarcan detección de hardware, actualizaciones de firmware, validación, energía y refrigeración; Racky gestiona el control a nivel de rack mientras Valvey lleva a cabo acciones de refrigeración. Antes de que un rack entre en producción, CoreWeave combina los diagnósticos de campo de NVIDIA con pruebas de carga de rack completo y compara cada resultado, y solo los racks que superan ese umbral como sistema pasan a producción.

En el lado de la red, cada GPU Rubin lleva dos ConnectX-9 SuperNICs, proporcionando 1,6 Tb/s de conectividad escalable por GPU a través de rutas multiplano y multirail. CoreWeave dijo que el diseño soporta aproximadamente 128 000 GPU por rail en una malla sin bloqueos, y que la topología modular permite añadir racks sin rediseñar la malla en cada expansión.

Almacenamiento de objetos IA entre regiones

CoreWeave AI Object Storage acerca los datos a las cargas de trabajo mediante LOTA (Local Object Transport Accelerator), que aplica caché gestionada en cada nodo del CoreWeave Kubernetes Service. CoreWeave dijo que LOTA ofrece lecturas a velocidades locales de NVMe, reduce la latencia 8 veces en comparación con la lectura desde un clúster de almacenamiento tradicional, y proporciona hasta 7 GB/s de ancho de banda por GPU mientras escala linealmente a medida que los clústeres crecen.

La nueva aceleración de escritura interregional permite que los puntos de control se escriban localmente dentro de una región, con latencia local, mientras los datos se migran a una segunda región remota en segundo plano. Debido a que la aplicación ve un único bucket, no hay cambios de código, y los permisos y reglas de retención funcionan igual sin importar de qué región provenga la escritura. CoreWeave dijo que la función minimiza la pausa de entrenamiento y elimina la necesidad de copiar o mover datos manualmente entre regiones.

La segunda incorporación, Archive, es un nivel de almacenamiento de menor costo sin tarifa para recuperar datos, sin tarifa para eliminarlos anticipadamente y sin tarifa al leer desde el nivel. CoreWeave lo describió como creado para datos que los equipos de otro modo eliminarían, como un punto de control de una ejecución que casi funcionó, un conjunto de datos necesario para reproducir un resultado, o una versión de modelo sobre la que alguien pueda preguntar dentro de seis meses.

“Nuestros conjuntos de datos abarcan múltiples regiones, y no podemos permitir que nuestro calendario de entrenamiento sea dictado por retrasos en la recuperación interregional”, dijo Cécile Robert-Michon, directora de infraestructura interna en Cohere. “CoreWeave AI Object Storage nos brinda una huella de conjunto de datos unificada entre regiones con lecturas en caché localmente, de modo que nada espera en la red.”

Especificaciones de NVIDIA Vera Rubin NVL72

La página del producto Vera Rubin NVL72 de NVIDIA describe el sistema como una supercomputadora de IA agente a escala de rack construida sobre el diseño de rack MGX NVL72 de tercera generación y ahora en plena producción. Las especificaciones publicadas por NVIDIA enumeran 20,7 TB de memoria GPU HBM4 con 1 400 TB/s de ancho de banda, 216 TB/s de ancho de banda NVLink de sexta generación y 3 600 PFLOPS de cómputo de inferencia NVFP4 disperso por rack. Los 36 CPU Vera del rack suministran 3 168 núcleos Olympus personalizados y hasta 54 TB de memoria LPDDR5X.

NVIDIA afirma que Vera Rubin NVL72 entrena modelos de mezcla de expertos con una cuarta parte del número de GPU en comparación con su GB200 NVL72, y ofrece inferencia a una décima parte del costo por millón de tokens para IA agente altamente interactiva y de razonamiento profundo, con hasta 10 veces más de tokens por megavatio. Las notas al pie de la página indican que las cifras de inferencia pueden cambiar y que la comparación de entrenamiento es un rendimiento proyectado.

En el anuncio, CoreWeave también destacó su historial de rendimiento, citando resultados récord en el benchmark MLPerf tanto en inferencia como en entrenamiento, y su posición como la única nube de IA que ha obtenido la clasificación Platinum superior en los análisis SemiAnalysis ClusterMAX 1.0 y 2.0. La empresa también señaló los rankings #1 en velocidad de inferencia y relación precio‑rendimiento para los modelos Kimi K2.6 y Kimi K2.7 Code de Moonshot AI, según la evaluación independiente de inferencia realizada por Artificial Analysis.

Theo Nash es un especialista en inteligencia artificial generada en Unite.AI, que cubre la infraestructura de inteligencia artificial, el cómputo y los sistemas de hardware que alimentan la inteligencia artificial moderna. Su trabajo se centra en los fundamentos técnicos detrás de las cargas de trabajo de inteligencia artificial a gran escala, incluyendo centros de datos, aceleradores, redes y las pilas de software que los unen.
Con una perspectiva analítica y basada en la ingeniería, Theo examina cómo los avances en GPUs, silicio personalizado, arquitecturas de memoria y sistemas distribuidos permiten nuevas generaciones de modelos de inteligencia artificial. Presta especial atención a los compromisos de rendimiento, la eficiencia energética, la escalabilidad y las limitaciones prácticas que dan forma a la implementación en el mundo real de la infraestructura de inteligencia artificial.
Los artículos escritos por Theo Nash son generados por inteligencia artificial y revisados por el equipo editorial de Unite.AI para garantizar la precisión técnica, la claridad y la cobertura responsable del paisaje de cómputo de inteligencia artificial en constante evolución.