AI 모델 및 플랫폼

CoreWeave, NVIDIA Vera CPU 베어 메탈을 랙 규모로 운영

mm
Unite.AI를 Google의 선호 소스에 추가

CoreWeave는 2026년 9월 30일에 NVIDIA Vera CPU를 도입해 컴퓨팅 포트폴리오를 확장할 것이라고 발표했으며, 이를 AI 에이전트를 위해 설계된 최초의 CPU라고 설명하고, 에이전시 AI와 강화 학습 워크로드를 위해 랙 규모에서 베어 메탈로 프로세서를 운영할 예정이라고 밝혔다.

이 소식은 샌프란시스코에서 열린 CoreWeave의 AI 클라우드 컨퍼런스인 Fully Connected에서 공유되었으며, 회사는 이 행사가 4,500명 이상의 고객, 파트너, 개발자 및 AI 리더를 한데 모은다고 밝혔다. Fully Connected 2026은 2026년 9월 29일부터 10월 1일까지 모스코네 사우스, 747 하워드 스트리트에서 개최된다.

에이전시 AI 뒤의 CPU 작업

CoreWeave는 에이전시 AI가 실행, 관찰, 정제, 개선, 평가의 연속적인 루프를 통해 작동한다고 설명한다. 이 루프 내에서 GPU는 모델 학습과 추론을 담당하고, CPU는 각 단계 주변의 작업—격리된 샌드박스, 강화 학습 환경, 도구 호출, 코드 실행, 데이터 파이프라인—을 수행한다.

CoreWeave는 데이터 전처리 파이프라인과 강화 학습 훈련 에피소드에 대한 수요가 급증하고 예측하기 어렵다고 언급했다. 루프의 한 단계가 한 시간 동안 수천 개의 환경을 요구했다가 다음 실행 전까지 거의 없을 수 있다. 사후 학습 및 에이전시 워크로드가 증가함에 따라 CPU 집약적인 작업이 AI 루프의 속도를 점점 더 좌우하게 되며, 인프라는 이러한 수요에 맞는 밀도와 수요 변화에 따라 확장할 수 있는 유연성을 모두 필요로 한다고 회사는 말했다.

회사는 Vera CPU가 CoreWeave의 다른 인프라와 동일하게 베어 메탈에서, 동일한 플랫폼, 소비 모델 및 경제 구조 하에 운영된다고 밝혔다.

랙 규모 배포 및 CoreWeave 샌드박스

CoreWeave는 에이전시 AI의 핵심 성능 지표 중 하나가 팀이 동시에 실행할 수 있는 격리된 에이전트 환경의 수이며, 그 수가 증가해도 샌드박스당 성능이 일관되게 유지되는지를 꼽는다. 랙 규모 Vera 배포는 하나의 랙에 128개의 CPU와 11,264개의 코어를 탑재하고, BlueField-4 DPU와 Spectrum‑X 이더넷 스위치를 통해 Vera 노드를 연결한다; 이를 통해 11,000개가 넘는 동시 환경을 수용할 수 있다고 회사는 전했다.

CoreWeave는 Sandboxes 제품이 이러한 에이전트를 완전한 하드웨어 격리 상태로 배포하며, 지원하는 훈련 작업 바로 옆에 배치된다고 설명한다. 테스트 결과에 따르면 NVIDIA Vera CPU에서 에이전트 샌드박스 시작 시간이 x86 CPU 대비 3배 이상 빨라졌다.

“일반 목적 인프라스트럭처가 에이전트형 AI의 병목 현상을 초래한다; Vera는 이를 가속화하도록 명시적으로 설계된 최초의 CPU다,” 라고 CoreWeave의 제품 및 엔지니어링 담당 부사장 Chen Goldberg가 회사 발표에서 말했다. Goldberg는 CoreWeave 플랫폼이 CoreWeave Sandboxes와 같은 제품을 통해 Vera를 기본적으로 지원하며, 팀이 운영상의 마찰 없이 수천 개의 격리된 환경을 즉시 구축할 수 있다고 밝혔다.

Signal65의 사장 겸 총괄 매니저인 Ryan Shrout는 에이전트 사이클의 점점 더 큰 비중이 CPU 작업이며, 사후 학습 및 에이전시 배포가 확대될수록 그 비중은 더욱 증가할 것이라고 말했다. 그는 주변 플랫폼이 팀이 해당 용량을 실제로 활용할 수 있는지를 결정하며, 운영상의 차이는 이미 존재하는 오케스트레이션 하에 훈련 플릿과 함께 베어 메탈에서 CPU 작업을 실행하는 데서 비롯된다고 강조했다.

CoreWeave는 launched CoreWeave Sandboxes를 2026년 5월 14일에 출시했으며, 이는 AI 연구자와 플랫폼 팀이 강화 학습, 에이전트 도구 사용, 모델 평가를 수행할 수 있는 안전하고 격리된 실행 레이어를 제공한다. 이 서비스는 고객이 자체 CoreWeave 인프라를 CoreWeave Kubernetes Service를 통해 이용하거나, Weights & Biases를 통한 서버리스 런타임으로 사용할 수 있다. 또한 Python SDK에는 세션 관리, 스토리지 통합, 모니터링 도구가 포함된다. CoreWeave는 기본적으로 각 샌드박스가 완전히 격리된 가상 환경에서 동작하므로, 하나의 샌드박스에서 발생한 오류나 runaway 프로세스가 다른 샌드박스로 전파되지 않는다고 명시한다.

CoreWeave는 또한 추론 및 학습 분야에서 MLPerf 벤치마크 결과와, SemiAnalysis ClusterMAX에서 연속 세 차례 플래티넘 최고 등급을 획득한 유일한 AI 클라우드라는 입지를 강조했다.

NVIDIA Vera CPU 사양

NVIDIA의 Vera CPU 제품 페이지는 이 프로세서가 에이전트형 AI 뒤의 CPU 작업 및 강화 학습을 위해 설계되었다고 설명한다: 코드 실행, 도구 사용, 샌드박싱, 분석, 데이터 파이프라인, 모델을 넘어선 오케스트레이션. NVIDIA에 따르면 Vera는 88개의 맞춤형 Olympus 코어를 탑재하고 있으며, Spatial Multithreading을 통해 파티션된 코어 자원으로 176개의 스레드를 생성한다.

메모리 대역폭은 LPDDR5X 기준 초당 최대 1.2테라바이트에 달하며, 메모리 용량은 최대 1.5TB라고 NVIDIA가 밝혔다. 2세대 NVIDIA Scalable Coherency Fabric은 88개의 코어, 캐시, 메모리, I/O, NVLink‑C2C를 단일 컴퓨트 다이에서 연결해 3.4TB/s의 절반 대역폭을 제공한다. 또한 NVLink‑C2C는 Vera CPU와 NVIDIA GPU 간에 최대 1.8TB/s의 일관된 대역폭을 제공한다고 회사는 전한다.

NVIDIA는 Vera가 에이전트 추론 루프의 컴파일, 코드 분석 및 Python 툴체인 워크로드를 선도적인 x86 CPU보다 최대 1.8배 빠르게 실행하며, LPDDR5X 메모리 서브시스템이 DDR5를 탑재한 선도적인 x86 CPU 대비 대역폭은 2배, 코어당 대역폭은 3배 제공한다고 밝혔습니다. 제품 페이지에서는 이러한 상대 성능 수치가 측정된 데이터에 기반하며 최신 세대 x86 CPU를 기준으로 하고, 변경될 수 있다고 명시하고 있습니다.

NVIDIA는 Vera를 가속화 시스템용 호스트 CPU(예: Vera Rubin NVL72 및 HGX Vera Rubin NVL8 플랫폼)와 에이전트 AI, 강화 학습, 데이터 처리 및 분석을 위한 독립형 CPU로 모두 포지셔닝합니다. 회사에 따르면 NVIDIA MGX 기반의 Vera CPU Rack은 최대 256개의 Vera CPU를 탑재하고 22.5K 이상의 동시 환경을 운영합니다. Vera Rubin NVL72는 72개의 Rubin GPUs, 36개의 Vera CPUs, ConnectX-9 SuperNICs, 그리고 BlueField-4 DPUs를 하나의 랙 규모 플랫폼에 결합합니다.

Theo Nash은 Unite.AI에서 AI 생성 전문가로서 AI 인프라, 컴퓨팅 및 현대 인공지능을 구동하는 하드웨어 시스템을 다룹니다. 그의 작업은 대규모 AI 워크로드의 기술적 기반에 초점을 맞추며, 데이터 센터, 가속기, 네트워킹 및 이를 연결하는 소프트웨어 스택을 포함합니다.

분석적이고 엔지니어링 중심의 관점으로 Theo는 GPU, 맞춤형 실리콘, 메모리 아키텍처 및 분산 시스템의 진보가 새로운 세대의 AI 모델을 어떻게 가능하게 하는지 검토합니다. 그는 성능 트레이드오프, 에너지 효율성, 확장성 및 AI 인프라의 실제 배포를 형성하는 실질적인 제약 조건에 특히 주목합니다.

Theo Nash가 작성한 기사들은 AI가 생성했으며, Unite.AI의 편집팀이 검토하여 빠르게 진화하는 AI 컴퓨팅 환경에 대한 기술적 정확성, 명확성 및 책임 있는 보도를 보장합니다.