Interviews

Corey Sanders, Senior Vice President Product bij CoreWeave – Interview Series

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Corey Sanders, Senior Vice President Product bij CoreWeave (CRWV ), leidt de productstrategie en -uitvoering voor een van de snelst groeiende AI-georiënteerde cloudplatforms. Hij is verantwoordelijk voor het opschalen van innovatie, het vormgeven van op maat gemaakte oplossingen met klanten en het versterken van de positie van CoreWeave op de AI-infrastructuurmarkt. Voordat hij bij CoreWeave kwam, werkte Sanders twintig jaar bij Microsoft (MSFT ) in senior leiderschapsfuncties op het gebied van cloudengineering, branche-specifieke platforms, commerciële oplossingsstrategie en grote ondernemingspartnerschappen, met diepe ervaring in het verbinden van technische uitvoering en go-to-marktstrategie.

CoreWeave is een AI-natieve cloudprovider die speciaal is gebouwd voor high-performance computing en grote artificial intelligence-workloads. Het bedrijf exploiteert een snel uitbreidende voetafdruk van datacenters in de VS en Europa, en levert GPU-geaccelereerde infrastructuur en software die zijn ontworpen voor AI-training, inferentie en geavanceerde compute-toepassingen. Door zich te richten op op maat gemaakte architectuur in plaats van algemene cloud, is CoreWeave een kritische infrastructuurpartner geworden voor AI-labs en ondernemingen die prestaties, schaalbaarheid en efficiëntie op grote schaal zoeken.

U hebt meer dan 20 jaar bij Microsoft gewerkt, waar u verschillende functies had, van Windows-engineering tot cloudverkoopstrategie en Microsoft Cloud for Industry. Wat heeft u daarvan geleerd over wat echt de adoptie van ondernemingen drijft, en hoe past u die lessen nu toe bij CoreWeave?

De adoptie van ondernemingen begint met het oplossen van een specifiek klantprobleem. Innovatie omwille van innovatie is niet zo belangrijk voor ondernemingen. Het gaat erom dat u uzelf in hun schoenen zet om te begrijpen wat hen echt dwarszit – of het nu gaat om de kosten van ondersteuning, operationele complexiteit, contact met klanten of het beheer van wereldwijde teams en nieuwe productlijnen – en dan diensten te leveren die helpen. Zij zijn vaak bereid om innovatief te zijn in hun aanpak, maar het meest cruciale overweging is hen helpen hun probleem op te lossen. De meest voorkomende fout die ik heb gezien in productontwerp is te veel opgaan in de coolness van een product. Terwijl dat gewicht heeft in de consumentenruimte, geven ondernemingsklanten uiteindelijk veel meer om functionaliteit dan coolness.

CoreWeave wordt vaak beschreven als een aanbieder van op maat gemaakte AI-infrastructuur. Wat betekent dat in praktische zin vanuit een productperspectief, en waar worstelen algemene cloudplatforms met AI-workloads?

Het grootste voordeel van op maat gemaakt zijn, is de mogelijkheid om diensten te leveren zonder dat u voor elk algemeen gebruik hoeft te oplossen. Ik zal twee voorbeelden geven: een in software en een in hardware.

Aan de softwarekant is onze Object Storage-oplossing met LOTA-cache specifiek gericht op caching voor AI-workloads. Het wordt rechtstreeks op de GPU-knoop punten geïmplementeerd, levert een S3-eindpunt voor de toepassing en reageert op GPU-aanvragen door zijn cache over meerdere knooppunten uit te breiden. Dit verhoogt de doorvoer naar de GPU tot 7 GB/s, ver boven wat algemene cloudplatforms bieden. We kunnen dit bereiken omdat we ontwerpveronderstellingen maken rond AI-specifieke workloads, lees/schrijf-splitsingen en clusterlay-outs. Als een klant dit zou gebruiken voor het hosten van een database of een e-commerce-site, zou het niet hetzelfde effect hebben. Dat is de definitie van op maat gemaakte software.

Het hardware-voorbeeld is vergelijkbaar. Gezien onze uitgebreide implementatie van de nieuwste NVIDIA (NVDA ) -SKU’s – veel waarvan vloeibare koeling vereisen – heeft CoreWeave specifieke expertise en datacenterontwerpen opgebouwd om aan die behoeften te voldoen. In tegenstelling tot grotere clouds die zijn gebouwd voor fungibiliteit en vervolgens achteraf vloeibare koeling moeten toevoegen, bouwt CoreWeave datacenters die specifiek zijn ontworpen voor AI vanaf de grond af. Dit resulteert in lagere kosten en hogere beschikbaarheid voor de nieuwste SKU-typen.

Hieronder ziet u een afbeelding van de LOTA-cache die ik noemde.

Wanneer klanten voor het eerst denken aan het opschalen van AI, denken ze vaak dat ze alleen toegang nodig hebben tot GPUs. Wat realiseren ze meestal dat ze missen zodra ze beginnen met trainen of serveren van modellen op grote schaal?

Gezien de complexiteit van het uitvoeren van workloads over enorme GPU-clusters, worden de omliggende diensten de echte drijvende kracht achter het succes. Dit omvat de voor de hand liggende dingen, zoals opslag en netwerken, maar ook kritieke operationele diensten zoals observatie, orchestratie en beveiliging. Hier schittert CoreWeave echt met onze Mission Control-aanbieding. Het biedt klanten een diepe kennis van knooppuntgezondheid en runtime over hun vloot, en integreert die kennis rechtstreeks in de orchestratie-engine. Dit stelt de klant in staat om zijn infrastructuur niet te behandelen als 1.000 afzonderlijke GPUs, maar als één samenhangend job-entity.

Wat zijn de belangrijkste productprioriteiten waar u zich op dit moment op richt om de resultaten van klanten te verbeteren, of het nu gaat om prestaties, betrouwbaarheid, kostenvoorspelbaarheid of ontwikkelaarservaring?

In het kernplatform zijn we constant gefocust op prestaties, betrouwbaarheid en observatie. We moeten ervoor zorgen dat klanten hun banen op een herhaalbare, voorspelbare manier kunnen uitvoeren, terwijl ze volledig gebruikmaken van elke TFLOP in elke GPU. Daarnaast werken we aan het vereenvoudigen van de onboarding voor klanten die mogelijk niet bekend zijn met elke bel en fluit in een tool zoals SLURM (die iedereen gebruikt, maar bijna iedereen haat). Ten slotte ontwikkelen we extra diensten en factureringsmodellen om het gemakkelijker te maken om te innoveren en klein te beginnen. Op dit moment is experimenteren verrassend moeilijk vanwege hoge toegangsbarrières, zoals capaciteitsbeperkingen, driejarige verbintenissen en de noodzaak van gespecialiseerde experts om alleen maar te beginnen. We willen de gemakkelijkheid van innovatie terugbrengen naar het AI-platform.

Naarmate meer AI-workloads verschuiven van trainingszwaar naar inferentiezwaar, hoe beïnvloedt die overgang de infrastructuurontwerp- en productroadmapbeslissingen?

Het creëert significante kansen om CoreWeave’s bestaande differentiatie toe te passen op inferentie-eisen. Bijvoorbeeld, de LOTA-cache die ik noemde, is gericht op het voeden van GPUs tijdens training; echter, kunnen we diezelfde technologie nemen, integreren in dingen zoals de KVCache en het omzetten in een krachtige inferentie-differentiator. Vergelijkbare tools zoals Mission Control worden nog vitaal voor inferentie, omdat het observeren van GPU-gezondheid cruciaal is voor het uitvoeren van hoog beschikbare agentic-toepassingen.

Over één tot twee jaar, wat zal de leiderschap in de AI-cloudmarkt definiëren, en welke capaciteiten zullen het meest belangrijk zijn voor klanten?

Ik denk dat leiderschap zal worden gedefinieerd door twee dingen. Het eerste is het leveren van de steeds groter wordende schaalvereisten voor training. Dit zal vereisen vooruitgang in observatie, gezondheidsmonitoring en automatische herstel. Wanneer u van honderden naar tienduizenden GPUs distributeert over de hele wereld, is handmatige reactie op storingen geen optie.

Het tweede is het leveren van de juiste diensten voor inferentie- en agentic-workloads. Dit vereist globale implementatiecapaciteiten en bedrijfsmodellen die experimenteren aanmoedigen. Dit gebruikspatroon was wat de cloud oorspronkelijk deed groeien, en het is enigszins verloren gegaan in de leeftijd van AI. We moeten het terugbrengen door betere platformondersteuning, multi-cloud-capaciteiten en multi-regio-eenvoudig gebruik.

U leidde eerder branche-specifieke cloud-initiatieven over de gezondheidszorg, detailhandel, financiële diensten, fabricage en soevereine cloud. Welke lessen uit die verticale markten vertalen zich rechtstreeks naar AI-infrastructuur, en welke niet?

Generatieverschuivingen in GPUs introduceren continue nieuwe complexiteiten. Elke nieuwe release brengt meer interconnectiviteit, hogere geheugen en grotere vermogensbehoeften met zich mee, die ons dwingen onze veronderstellingen over hoe knooppunten zijn verbonden en hoe software wordt geleverd, te herzien. We moeten hier onvermoeibaar in blijven om onze leiderschapspositie te behouden. Aan de andere kant is het gebied dat het snelst verbetert, de schaal van wat klanten kunnen bereiken; de snelheid waarmee ze zich aanpassen aan grotere compute-voetafdrukken, is indrukwekkend.

Naarmate AI-datacenters en -clusters blijven groeien, welke operationele uitdagingen blijken het moeilijkst op te lossen, en welke verbeteren het snelst?

De generatieverschuivingen van de GPUs blijven nieuwe complexiteiten creëren in het ontwerp en de software. Elke nieuwe GPU-release komt met meer interconnectiviteitsmogelijkheden, hogere geheugen, meer vermogensbehoeften, enz., die ons dwingen onze veronderstellingen over hoe knooppunten zijn verbonden, hoe racks worden beheerd en hoe software wordt geleverd, te herzien. We zullen ons moeten blijven concentreren op dit werk om onze leiderschapspositie te behouden. Degenen die het snelst verbeteren, zijn wat klanten kunnen bereiken met de groeiende schaal van compute.

In AI-infrastructuur gaat betrouwbaarheid verder dan uptime. Hoe definieert CoreWeave betrouwbaarheid, en welke indicatoren weerspiegelen het beste succes vanuit het perspectief van de klant?

Op grote schaal is de grootste overweging voor een klant simpelweg het klusje klaren. In enorme operaties zijn individuele storingen of vertragingen te verwachten. De sleutel is hoe we storingen detecteren en automatisch reageren om ervoor te zorgen dat het klusje ondanks de uitdagingen wordt voltooid. Dit is waarom we Mission Control integreren in hogere diensten zoals SUNK (Slurm op Kubernetes). Het stelt klanten in staat om automatisch te reageren op storingen zonder uren of weken van werk te verliezen. Voor ons is succes niet alleen uptime van knooppunten; het is job-succes.

Kijkend naar de toekomst, welke grote verschuiving in AI-infrastructuur denkt u nog ondergewaardeerd is, of het nu gaat om hardware-evolutie, specialisatie van stacks, soevereiniteitsvereisten of nieuwe implementatiemodellen?

Ik geloof dat de komst van Versterking Lerend (RL) als een vernieuwend deel van de AI-stack nog ondergewaardeerd is. Hoewel het geen nieuw studieveld is, werd het grotendeels overschaduwd tijdens de eerste golf van LLM-ontwikkeling. RL maakt een comeback en zal een vitale rol spelen bij het maken van AI-diensten meer responsief op de veranderende landschappen van hun gebruikers. Omdat van dit, zijn we erg enthousiast over de serverless RL-aanbieding die we vandaag hebben.

Bedankt voor het geweldige interview, lezers die meer willen leren, moeten CoreWeave bezoeken.

Antoine is een visionaire leider en medeoprichter van Unite.AI, gedreven door een onwankelbare passie voor het vormgeven en promoten van de toekomst van AI en robotica. Een serieondernemer, hij gelooft dat AI net zo disruptief voor de samenleving zal zijn als elektriciteit, en wordt vaak betrapt op het prijzen van de potentie van disruptieve technologieën en AGI.

Als een futurist, hij is toegewijd aan het onderzoeken van hoe deze innovaties onze wereld zullen vormgeven. Bovendien is hij de oprichter van Securities.io, een platform dat zich richt op het investeren in cutting-edge technologieën die de toekomst herdefiniëren en hele sectoren herschikken.