Interviews

Corey Sanders, Senior Vice President for Produkter hos CoreWeave – Intervju-serie

mm
Føj Unite.AI til dine foretrukne kilder på Google

Corey Sanders, Senior Vice President for Produkter hos CoreWeave (CRWV ), leder produktstrategi og -udførelse for en af de hurtigst voksende AI-fokuserede cloud-platforme. Han er ansvarlig for at skabe innovation, forme løsninger sammen med kunder og styrke CoreWeaves position på markedet for AI-infrastruktur. Før CoreWeave tilbragte Sanders to årtier hos Microsoft (MSFT ) i ledende roller, der omfattede cloud-teknologi, branche-specifikke platforme, kommerciel løsningsstrategi og store virksomheds-partnerskaber, med dyb erfaring i at kombinere teknisk udførelse og markedsstrategi.

CoreWeave er en AI-naturlig cloud-leverandør, der er bygget specifikt til høj-ydelsesregning og store kunstig intelligens-arbejdsbyrder. Virksomheden driver en hurtigt udvidende fodaftryk af datacenter i USA og Europa, og leverer GPU-accelereret infrastruktur og software, der er designet til AI-træning, slutledning og avanceret beregningsformål. Ved at fokusere på formål-bygget arkitektur i stedet for generel cloud, er CoreWeave blevet en kritisk infrastruktur-partner for AI-laboratorier og virksomheder, der søger ydelse, skalerbarhed og effektivitet i stor målestok.

I mere end 20 år arbejdede du hos Microsoft med Windows-teknologi, cloud-salgstrategi og Microsoft Cloud for Industrien. Hvad lærte denne udvikling dig om, hvad der virkelig driver virksomheds-adopteringsgrad, og hvordan anvender du disse lærdomme i dag hos CoreWeave?

Virksomheds-adopteringsgrad begynder med at løse et specifikt kunde-problem. Innovation for innovations skyld er ikke nødvendigvis det vigtigste for virksomhederne. Det handler om at sætte sig i deres sted for at forstå, hvad der virkelig plager dem – enten det er omkostningerne til support, operationelle kompleksiteter, forbindelse med kunder eller ledelse af globale hold og nye produktlinjer – og derefter levere tjenester, der hjælper. De er ofte villige til at være innovative i deres tilgang, men den vigtigste overvejelse er at hjælpe dem med at løse deres problem. Den hyppigste fejl, jeg har set i produkt-design, er at blive for optaget af produktets “coolness”. Selvom det har vægt i forbruger-rummet, er virksomheds-kunder til sidst mere bekymrede for nyttighed end coolness.

CoreWeave beskrives ofte som en leverandør af formål-bygget AI-infrastruktur. I praktiske termer, hvad betyder formål-bygget fra et produkt-perspektiv, og hvor kæmper generelle cloud-platforme med AI-arbejdsbyrder?

Det største fordel ved at være formål-bygget er evnen til at fokusere og levere tjenester uden at skulle løse alle generelle brugs-sager. Jeg vil give to eksempler: ét i software og ét i hardware.

På software-siden er vores Object Storage-tilbud med LOTA-cache fokuseret specifikt på cachen til AI-arbejdsbyrder. Det deployer direkte på GPU-noderne, leverer en S3-endpoint for applikationen og responderer til GPU-anmodninger ved at sprede cachen over flere noder. Dette øger gennemstrømningen til GPU op til 7 GB/s, langt over, hvad generelle cloud-platforme tilbyder. Vi kan opnå dette, fordi vi kan træffe design-antagelser omkring AI-specifikke arbejdsbyrder, læse-/skrive-forhold og cluster-layout. Hvis en kunde brugte dette til at hoste en database eller en e-handels-side, ville det ikke have samme effekt. Det er definitionen på formål-bygget software.

Hardware-eksemplet er lignende. Givet vores omfattende deployment af nyeste generation NVIDIA-SKU’er – mange af dem kræver væske-køling – har CoreWeave bygget specifik ekspertise og datacenter-design til at understøtte disse behov. I modsætning til større cloud-platforme, der bygger for ombytnings-evne og derefter tilføjer væske-køling retrospektivt, bygger CoreWeave datacenter fokuseret på AI fra bunden. Dette resulterer i lavere omkostninger og højere tilgængelighed for de nyeste SKU-typer.

Nedenfor er et billede af LOTA-cachen, der er nævnt.

Når kunder først tænker på at skale AI, tror mange, at de kun behøver adgang til GPU’er. Hvad går de typisk hen og opdager, at de mangler, når de begynder at træne eller servere modeller i stor målestok?

Givet kompleksiteten ved at køre arbejdsbyrder på tværs af massive GPU-kluster, bliver de omgivende tjenester de virkelige drivere af succes. Dette inkluderer de åbenlyse, som f.eks. lagring og netværk, men også kritiske operationelle tjenester som overvågning, orkestrering og sikkerhed. Her udmærker CoreWeave sig med vores Mission Control-tilbud. Det giver kunderne en dyb forståelse af node-helbred og kørselstid på tværs af deres flåde, og integrerer denne viden direkte i orkestrerings-motoren. Dette giver kunden mulighed for at behandle deres infrastruktur ikke som 1.000 enkeltstående GPU’er, men som en enkelt, samlet job-enhed.

Hvad er de øverste produkt-prioriteter, du er fokuseret på lige nu for at forbedre kunde-resultater, enten det er ydelse, pålidelighed, omkostnings-forudsigelighed eller udvikler-oplevelse?

I kerne-platformen er vi konstant fokuseret på ydelse, pålidelighed og overvågning. Vi må sikre, at kunder kan køre job i en gentagen, forudsigelig måde, mens de tager fuld fordel af hver enkelt TFLOP i hver GPU. Udover dette arbejder vi på at simplificere onboarding for kunder, der måske ikke er bekendt med hver enkelt funktion i et værktøj som SLURM (som alle bruger, men næsten alle hader). Endelig udvikler vi yderligere tjenester og betalingsmodeller for at gøre det lettere at innovere og starte småt. Lige nu er det overraskende svært at eksperimentere på grund af høje barrierer for indgang, såsom kapacitetsbegrænsninger, tre-års-forpligtelser og behov for specialiserede eksperter bare for at komme i gang. Vi vil bringe innovationens letthed tilbage til AI-platformen.

Da flere AI-arbejdsbyrder skifter fra træning-til inference-til, hvordan påvirker denne overgang infrastruktur-design og produkt-vej-kort-beslutninger?

Det skaber betydelige muligheder for at anvende CoreWeaves eksisterende differentiering til inference-krav. F.eks. kan LOTA-cachen, jeg nævnte, fokuseres på at føde GPU’er under træning; men vi kan tage den samme teknologi, integrere den i ting som KVCache og omdanne den til en kraftfuld inference-differentiering. Ligeledes bliver værktøjer som Mission Control endnu mere essentielle for inference, da overvågning af GPU-helbred er afgørende for at køre højtilgængelige agente-applikationer.

Over de næste ett til to år, hvad vil definere lederskab på AI-cloud-markedet, og hvilke funktioner vil være vigtigst for kunderne?

Jeg tror, at lederskab vil blive defineret af to ting. Den første er at levere den stadigt voksende skala-krav til træning. Dette vil kræve fremskridt i overvågning, sundheds-overvågning og automatisk genoprettelse. Når man flytter fra hundredvis til titusinder af GPU’er fordelt globalt, er manuel respons på fejl en non-starter.

Den anden er at levere de rigtige tjenester til inference- og agente-arbejdsbyrder. Dette kræver globale deployments-funktioner og forretningsmodeller, der opmuntrer til eksperimenter. Denne brugs-mønster hjalp cloud-væksten oprindeligt, og det er blevet tabt i AI-alderen. Vi må bringe det tilbage gennem bedre platform-understøttelse, multi-cloud-funktioner og multi-region-let-brug.

I før ledede du branche-specifikke cloud-initiativer på tværs af sundhedsvesen, detailhandel, finansielle tjenester, fremstillingsindustri og suveræn cloud. Hvilke lærdomme fra disse vertikaler oversætter sig direkte til AI-infrastruktur, og hvilke gør det ikke?

Generations-skift i GPU’er introducerer nye kompleksiteter. Hver ny udgave bringer øget interconnectivitet, højere hukommelse og større effektbehov, alt sammen kræver, at vi genovervejer vores antagelser om, hvordan noder er forbundet, og hvordan software leveres. Vi må forblive ubønhørlige her for at fastholde vores lederskab. På den anden side er området, der forbedres hurtigst, den ren skala af, hvad kunder kan opnå; hastigheden, hvormed de tilpasser sig større beregnings-fodaftryk, er imponerende.

Da AI-datacenter og -kluster fortsætter med at skale, hvilke operationelle udfordringer er sværest at løse i dag, og hvilke af dem forbedres hurtigst?

Generations-skift i GPU’er skaber nye kompleksiteter i design og software. Hver ny GPU-udgave kommer med øget interconnectivitet, højere hukommelse og større effektbehov, alt sammen kræver, at vi genovervejer vores antagelser om, hvordan noder er forbundet, og hvordan software leveres. Vi vil fortsætte med at fokusere på dette arbejde for at fastholde vores lederskabs-position. De, der forbedres hurtigst, er, hvad kunder kan opnå med den voksende skala af beregning.

I AI-infrastruktur går pålidelighed ud over op-time. Hvordan definerer CoreWeave pålidelighed, og hvilke indikatorer afspejler bedst succes set fra kundens perspektiv?

I stor målestok er den største overvejelse for en kunde blot at få jobbet gjort. I massive operationer er enkelt-fejl eller langsommelser forventede. Nøglen er, hvordan vi opdager og responderer automatisk til disse problemer for at sikre, at jobbet bliver færdigt på trods af udfordringerne. Dette er hvorfor vi integrerer Mission Control i højere-niveauer tjenester som SUNK (Slurm på Kubernetes). Det giver kunderne mulighed for at respondere på fejl automatisk uden at tabe timer eller uger af arbejde. For os handler succes ikke kun om node-op-time; det handler om job-succes.

Set fremad, hvilken stor skift i AI-infrastruktur tror du stadig er under-vurderet, enten det er hardware-udvikling, specialisering af stacks, suverænitets-krav eller nye deployments-modeller?

Jeg tror, at opkomsten af Forstærkning-Læring (RL) som en genskabende del af AI-stakken stadig er under-vurderet. Selvom det ikke er et nyt studie-område, blev det over skygget under den første bølge af LLM-udvikling. RL er på vej tilbage og vil spille en vital rolle i at gøre AI-tjenester mere responsive til de skiftende landskaber af deres brugere. Af denne grund er vi meget begejstret for vores server-løse RL-tilbud i dag.

Tak for det gode interview, læsere, der ønsker at lære mere, skal besøge CoreWeave.

Antoine er en visionær leder og medstifter af Unite.AI, drevet af en urokkelig passion for at forme og fremme fremtiden for AI og robotteknologi. En serieiværksætter, han tror, at AI vil være lige så omvæltende for samfundet som elektricitet, og han bliver ofte fanget i at tale om potentialet for omvæltende teknologier og AGI.

Som en futurist, er han dedikeret til at udforske, hvordan disse innovationer vil forme vores verden. Derudover er han grundlægger af Securities.io, en platform, der fokuserer på at investere i skarp teknologi, der gendefinerer fremtiden og omformer hele sektorer.