AI 모델 및 플랫폼
CoreWeave, NVIDIA Vera CPU 베어 메탈을 랙 규모로 운영

CoreWeave는 2026년 9월 30일에 NVIDIA Vera CPU를 도입해 컴퓨팅 포트폴리오를 확장할 것이라고 발표했으며, 이를 AI 에이전트를 위해 설계된 최초의 CPU라고 설명하고, 에이전시 AI와 강화 학습 워크로드를 위해 랙 규모에서 베어 메탈로 프로세서를 운영할 예정이라고 밝혔다.
이 소식은 샌프란시스코에서 열린 CoreWeave의 AI 클라우드 컨퍼런스인 Fully Connected에서 공유되었으며, 회사는 이 행사가 4,500명 이상의 고객, 파트너, 개발자 및 AI 리더를 한데 모은다고 밝혔다. Fully Connected 2026은 2026년 9월 29일부터 10월 1일까지 모스코네 사우스, 747 하워드 스트리트에서 개최된다.
에이전시 AI 뒤의 CPU 작업
CoreWeave는 에이전시 AI가 실행, 관찰, 정제, 개선, 평가의 연속적인 루프를 통해 작동한다고 설명한다. 이 루프 내에서 GPU는 모델 학습과 추론을 담당하고, CPU는 각 단계 주변의 작업—격리된 샌드박스, 강화 학습 환경, 도구 호출, 코드 실행, 데이터 파이프라인—을 수행한다.
CoreWeave는 데이터 전처리 파이프라인과 강화 학습 훈련 에피소드에 대한 수요가 급증하고 예측하기 어렵다고 언급했다. 루프의 한 단계가 한 시간 동안 수천 개의 환경을 요구했다가 다음 실행 전까지 거의 없을 수 있다. 사후 학습 및 에이전시 워크로드가 증가함에 따라 CPU 집약적인 작업이 AI 루프의 속도를 점점 더 좌우하게 되며, 인프라는 이러한 수요에 맞는 밀도와 수요 변화에 따라 확장할 수 있는 유연성을 모두 필요로 한다고 회사는 말했다.
회사는 Vera CPU가 CoreWeave의 다른 인프라와 동일하게 베어 메탈에서, 동일한 플랫폼, 소비 모델 및 경제 구조 하에 운영된다고 밝혔다.
랙 규모 배포 및 CoreWeave 샌드박스
CoreWeave는 에이전시 AI의 핵심 성능 지표 중 하나가 팀이 동시에 실행할 수 있는 격리된 에이전트 환경의 수이며, 그 수가 증가해도 샌드박스당 성능이 일관되게 유지되는지를 꼽는다. 랙 규모 Vera 배포는 하나의 랙에 128개의 CPU와 11,264개의 코어를 탑재하고, BlueField-4 DPU와 Spectrum‑X 이더넷 스위치를 통해 Vera 노드를 연결한다; 이를 통해 11,000개가 넘는 동시 환경을 수용할 수 있다고 회사는 전했다.
CoreWeave는 Sandboxes 제품이 이러한 에이전트를 완전한 하드웨어 격리 상태로 배포하며, 지원하는 훈련 작업 바로 옆에 배치된다고 설명한다. 테스트 결과에 따르면 NVIDIA Vera CPU에서 에이전트 샌드박스 시작 시간이 x86 CPU 대비 3배 이상 빨라졌다.
“일반 목적 인프라스트럭처가 에이전트형 AI의 병목 현상을 초래한다; Vera는 이를 가속화하도록 명시적으로 설계된 최초의 CPU다,” 라고 CoreWeave의 제품 및 엔지니어링 담당 부사장 Chen Goldberg가 회사 발표에서 말했다. Goldberg는 CoreWeave 플랫폼이 CoreWeave Sandboxes와 같은 제품을 통해 Vera를 기본적으로 지원하며, 팀이 운영상의 마찰 없이 수천 개의 격리된 환경을 즉시 구축할 수 있다고 밝혔다.
Signal65의 사장 겸 총괄 매니저인 Ryan Shrout는 에이전트 사이클의 점점 더 큰 비중이 CPU 작업이며, 사후 학습 및 에이전시 배포가 확대될수록 그 비중은 더욱 증가할 것이라고 말했다. 그는 주변 플랫폼이 팀이 해당 용량을 실제로 활용할 수 있는지를 결정하며, 운영상의 차이는 이미 존재하는 오케스트레이션 하에 훈련 플릿과 함께 베어 메탈에서 CPU 작업을 실행하는 데서 비롯된다고 강조했다.
CoreWeave는 launched CoreWeave Sandboxes를 2026년 5월 14일에 출시했으며, 이는 AI 연구자와 플랫폼 팀이 강화 학습, 에이전트 도구 사용, 모델 평가를 수행할 수 있는 안전하고 격리된 실행 레이어를 제공한다. 이 서비스는 고객이 자체 CoreWeave 인프라를 CoreWeave Kubernetes Service를 통해 이용하거나, Weights & Biases를 통한 서버리스 런타임으로 사용할 수 있다. 또한 Python SDK에는 세션 관리, 스토리지 통합, 모니터링 도구가 포함된다. CoreWeave는 기본적으로 각 샌드박스가 완전히 격리된 가상 환경에서 동작하므로, 하나의 샌드박스에서 발생한 오류나 runaway 프로세스가 다른 샌드박스로 전파되지 않는다고 명시한다.
CoreWeave는 또한 추론 및 학습 분야에서 MLPerf 벤치마크 결과와, SemiAnalysis ClusterMAX에서 연속 세 차례 플래티넘 최고 등급을 획득한 유일한 AI 클라우드라는 입지를 강조했다.
NVIDIA Vera CPU 사양
NVIDIA의 Vera CPU 제품 페이지는 이 프로세서가 에이전트형 AI 뒤의 CPU 작업 및 강화 학습을 위해 설계되었다고 설명한다: 코드 실행, 도구 사용, 샌드박싱, 분석, 데이터 파이프라인, 모델을 넘어선 오케스트레이션. NVIDIA에 따르면 Vera는 88개의 맞춤형 Olympus 코어를 탑재하고 있으며, Spatial Multithreading을 통해 파티션된 코어 자원으로 176개의 스레드를 생성한다.
메모리 대역폭은 LPDDR5X 기준 초당 최대 1.2테라바이트에 달하며, 메모리 용량은 최대 1.5TB라고 NVIDIA가 밝혔다. 2세대 NVIDIA Scalable Coherency Fabric은 88개의 코어, 캐시, 메모리, I/O, NVLink‑C2C를 단일 컴퓨트 다이에서 연결해 3.4TB/s의 절반 대역폭을 제공한다. 또한 NVLink‑C2C는 Vera CPU와 NVIDIA GPU 간에 최대 1.8TB/s의 일관된 대역폭을 제공한다고 회사는 전한다.
NVIDIA는 Vera가 에이전트 추론 루프의 컴파일, 코드 분석 및 Python 툴체인 워크로드를 선도적인 x86 CPU보다 최대 1.8배 빠르게 실행하며, LPDDR5X 메모리 서브시스템이 DDR5를 탑재한 선도적인 x86 CPU 대비 대역폭은 2배, 코어당 대역폭은 3배 제공한다고 밝혔습니다. 제품 페이지에서는 이러한 상대 성능 수치가 측정된 데이터에 기반하며 최신 세대 x86 CPU를 기준으로 하고, 변경될 수 있다고 명시하고 있습니다.
NVIDIA는 Vera를 가속화 시스템용 호스트 CPU(예: Vera Rubin NVL72 및 HGX Vera Rubin NVL8 플랫폼)와 에이전트 AI, 강화 학습, 데이터 처리 및 분석을 위한 독립형 CPU로 모두 포지셔닝합니다. 회사에 따르면 NVIDIA MGX 기반의 Vera CPU Rack은 최대 256개의 Vera CPU를 탑재하고 22.5K 이상의 동시 환경을 운영합니다. Vera Rubin NVL72는 72개의 Rubin GPUs, 36개의 Vera CPUs, ConnectX-9 SuperNICs, 그리고 BlueField-4 DPUs를 하나의 랙 규모 플랫폼에 결합합니다.












