AI-modeller og plattformer

CoreWeave skal kjøre NVIDIA Vera CPU i bare metal på rack-skala

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

CoreWeave sa 30. september 2026 at de vil utvide sin beregningsportefølje med NVIDIA Vera CPU, som de beskrev som den første CPUen designet for AI‑agenter, og vil kjøre prosessoren i bare metal på rack-skala for agentisk AI og forsterkningslæringsarbeidsbelastninger.

Nyheten ble kunngjort på Fully Connected, CoreWeaves AI‑sky‑konferanse i San Francisco, som selskapet sier samler mer enn 4 500 kunder, partnere, utviklere og AI‑ledere. Fully Connected 2026 avholdes 29. september til 1. oktober 2026 i Moscone South, 747 Howard Street.

CPU-arbeidet bak agentisk AI

CoreWeave beskrev agentisk AI som opererende gjennom en kontinuerlig løkke av kjøre, observere, kuratere, forbedre og evaluere. Innenfor denne løkken håndterer GPU‑er modelltrening og resonnering, mens CPU‑er utfører arbeidet rundt hvert trinn: isolerte sandkasser, forsterkningslæringsmiljøer, verktøykall, kodekjøring og datapipelines.

CoreWeave kalte etterspørselen etter datapreprosessering‑pipelines og forsterkningslæringstrenings‑episoder for burstete og vanskelig å forutsi: et enkelt trinn i løkken kan kreve tusenvis av miljøer i en time, og deretter nesten ingen før neste kjøring. Etter hvert som etter‑trening og agentiske arbeidsbelastninger vokser, sier selskapet, blir dette CPU‑intensive arbeidet i økende grad flaskehalsen i AI‑løkken, og infrastrukturen trenger både tettheten for denne etterspørselen og fleksibiliteten til å skalere etter hvert som behovet endres.

Selskapet sa at Vera‑CPUen fungerer på samme måte som resten av deres flåte på CoreWeave: i bare metal, under samme plattform, forbruksmodeller og økonomi.

Rack‑skala distribusjon og CoreWeave Sandboxes

CoreWeave oppga at ett kritisk ytelsesmål for agentisk AI er antallet isolerte agentmiljøer et team kan kjøre samtidig, og om ytelsen per sandkasse forblir konsistent etter hvert som dette tallet øker. Deres rack‑skala Vera‑distribusjon passer 128 CPU‑er og 11 264 kjerner i ett enkelt rack, med BlueField‑4 DPU‑er og Spectrum‑X Ethernet‑switching som kobler Vera‑nodene; selskapet sier dette gir kapasitet for mer enn 11 000 samtidige miljøer.

CoreWeave sa at deres Sandboxes‑produkt distribuerer disse agentene med full maskinvareisolasjon, plassert direkte ved siden av treningsjobbene de støtter. I deres tester rapporterte selskapet at oppstartstiden for agent‑sandkasser på NVIDIA Vera‑CPU var mer enn tre ganger raskere enn på en x86‑CPU.

“Generell infrastruktur skaper flaskehalser for agentisk AI; Vera er den første CPUen som er eksplisitt designet for å akselerere den,” Chen Goldberg, eksekutiv visepresident for produkt og engineering i CoreWeave, sa i bedriftens kunngjøring. Goldberg sa at CoreWeave sin plattform nativt støtter Vera gjennom produkter som CoreWeave Sandboxes, og gjør det mulig for team å umiddelbart starte opp tusenvis av isolerte miljøer uten ekstra operasjonell friksjon.

Ryan Shrout, president og general manager i Signal65, sa at en økende andel av hver agent‑syklus er CPU‑arbeid, og at andelen kun vil øke etter hvert som etter‑trening og agentiske distribusjoner skaleres. Han påpeker at den omkringliggende plattformen avgjør om teamene faktisk kan utnytte den kapasiteten, og at den operasjonelle forskjellen kommer av å kjøre CPU‑arbeidet i bare metal ved siden av treningsflåten under en orkestrering som allerede finnes.

CoreWeave lanserte CoreWeave Sandboxes 14. mai 2026, som et utførelseslag som gir sikre, isolerte miljøer hvor AI‑forskere og plattformteam kjører forsterkningslæring, agent‑verktøybruk og modellevaluering. Det er tilgjengelig på en kundes egen CoreWeave‑infrastruktur via CoreWeave Kubernetes Service eller som en serverløs kjøremiljø via Weights & Biases, med et Python‑SDK som inkluderer øktstyring, lagringsintegrasjon og overvåkingsverktøy. CoreWeave oppgir at som standard opererer hver sandkasse i et fullt isolert virtuelt miljø for seg selv, slik at en feil eller en løpsk prosess i en ikke kan spre seg til en annen.

CoreWeave pekte også på sine MLPerf‑benchmarkresultater innen inferens og trening, samt sin posisjon som den eneste AI‑skyen som har oppnådd den høyeste Platinum‑rangeringen i SemiAnalysis ClusterMAX tre ganger på rad.

NVIDIA Vera CPU-spesifikasjoner

NVIDIAs Vera CPU-produktside beskriver prosessoren som bygget for CPU-arbeid bak agentisk AI og forsterkningslæring: kodekjøring, verktøybruk, sandkasse, analyse, datapipelines og orkestrering utover modellen. Ifølge NVIDIA har Vera 88 tilpassede Olympus‑kjerner, og dens Spatial Multithreading skaper 176 tråder med delte kjerne‑ressurser.

Minnesbåndbredden når opptil 1,2 terabyte per sekund på LPDDR5X, med opptil 1,5 TB minnekapasitet, oppgir NVIDIA. En andre‑generasjons NVIDIA Scalable Coherency Fabric kobler alle 88 kjerne, cache, minne, IO og NVLink‑C2C over en enkelt beregningsdie med 3,4 TB/s biseksjonsbåndbredde, og NVLink‑C2C gir opptil 1,8 TB/s koherent båndbredde mellom Vera‑CPU‑er og NVIDIA‑GPU‑er, ifølge selskapet.

NVIDIA sier at Vera kjører kompilering, kodeanalyse og Python‑verktøykjede‑arbeidsbelastninger i en agents resonneringsløype opptil 1.8× raskere enn ledende x86‑prosessorer, og at LPDDR5X‑minnesystemet leverer 2× båndbredde og 3× båndbredde per kjerne sammenlignet med ledende x86‑prosessorer med DDR5. Produktsiden bemerker at disse relative ytelsestallene er basert på målte data, sammenlignet med den nyeste generasjonen x86‑prosessor, og kan endres.

NVIDIA posisjonerer Vera både som en vert‑CPU for akselererte systemer, inkludert Vera Rubin NVL72 og HGX Vera Rubin NVL8‑plattformene, og som en frittstående CPU for agentbasert AI, forsterkningslæring, databehandling og analyse. Vera CPU Rack, bygget på NVIDIA MGX, rommer opptil 256 Vera‑prosessorer og kjører over 22.5K samtidige miljøer, ifølge selskapet. Vera Rubin NVL72 kombinerer 72 Rubin‑GPUer, 36 Vera‑prosessorer, ConnectX‑9 SuperNIC‑er og BlueField‑4‑DPU‑er i en rack‑skala plattform.

Theo Nash er en AI-generert spesialist hos Unite.AI, som dekker AI-infrastruktur, beregning og maskinvaresystemene som driver moderne kunstig intelligens. Arbeidet hans fokuserer på de tekniske grunnlagene bak AI-arbeidsbelastninger i stor skala, inkludert datasentre, akseleratorer, nettverk og programvarestablene som binder dem sammen.

Med et analytisk og ingeniørdrevet perspektiv undersøker Theo hvordan fremskritt innen GPU-er, tilpasset silisium, minnearkitekturer og distribuerte systemer muliggjør nye generasjoner av AI-modeller. Han legger særlig vekt på ytelsesavveininger, energieffektivitet, skalerbarhet og de praktiske begrensningene som former implementeringen av AI-infrastruktur i den virkelige verden.

Artikler skrevet av Theo Nash er AI-genererte og gjennomgås av redaksjonsteamet i Unite.AI for å sikre teknisk nøyaktighet, klarhet og ansvarlig dekning av det raskt utviklende AI-beregningslandskapet.