Intervjuer
Corey Sanders, Senior Vice President Product på CoreWeave – Intervju-serie

Corey Sanders, Senior Vice President Product på CoreWeave (CRWV ), leder produktstrategi och genomförande för en av de snabbast växande AI-fokuserade molnplattformarna. Han ansvarar för att skala innovation, forma lösningar som är specialanpassade för kunder och stärka CoreWeaves position på AI-infrastrukturmarknaden. Innan CoreWeave tillbringade Sanders två decennier på Microsoft (MSFT ) i seniora ledningsroller som omfattade molnteknik, branschspecifika plattformar, kommersiell lösningsstrategi och stora företagspartnerskap, med djup erfarenhet av att kombinera teknisk genomförande och marknadsstrategi.
CoreWeave är en AI-nativ molnleverantör som är byggd specifikt för högpresterande beräkningar och storskaliga artificiella intelligensarbetsbelastningar. Företaget driver ett snabbt växande fotavtryck av datacenter i USA och Europa, och levererar GPU-accelererad infrastruktur och programvara som är utformad för AI-träning, inferens och avancerad beräkning. Genom att fokusera på specialanpassad arkitektur snarare än allmän molntjänst har CoreWeave blivit en kritisk infrastrukturpartner för AI-laboratorier och företag som söker prestanda, skalbarhet och effektivitet i stor skala.
Du tillbringade mer än 20 år på Microsoft och arbetade med Windows-utveckling, molnförsäljningsstrategi och Microsoft Cloud för branscher. Vad lärde du dig av den utvecklingen om vad som verkligen driver företagsadoption, och hur tillämpar du dessa lärdomar idag på CoreWeave?
Företagsadoption börjar med att lösa ett specifikt kundproblem. Innovation för innovations skull är inte så viktigt för företag. Det handlar om att sätta sig i deras skor för att förstå vad som verkligen plågar dem – antingen det är kostnaden för support, operativa komplexiteter, att ansluta till kunder eller hantera globala team och nya produktlinjer – och sedan leverera tjänster som hjälper. De är ofta villiga att vara innovativa i sin approach, men det viktigaste är att hjälpa dem att lösa sitt problem. Det vanligaste misstaget jag har sett i produktutveckling är att bli för upptagen av en produkts “svalhet”. Medan det har vikt i konsumentutrymmet bryr sig företagskunder i slutändan mer om nyttan än svalheten.
CoreWeave beskrivs ofta som att erbjuda specialanpassad AI-infrastruktur. I praktiska termer, vad betyder specialanpassad från ett produkt perspektiv, och var kämpar allmänna molntjänster med AI-arbetsbelastningar?
Den största fördelen med att vara specialanpassad är förmågan att fokusera och leverera tjänster utan att behöva lösa alla allmänna användningsfall. Jag kommer att ge två exempel: ett på programvarusidan och ett på hårdvarusidan.
På programvarusidan är vår Object Storage-tjänst med LOTA-cache fokuserad specifikt på cachelagring för AI-arbetsbelastningar. Den distribueras direkt på GPU-noderna, levererar en S3-slutpunkt för applikationen och svarar på GPU-förfrågningar genom att sprida cachen över flera noder. Detta ökar dataflödet till GPU upp till 7 GB/s, vilket vida överträffar vad allmänna molntjänster erbjuder. Vi kan uppnå detta eftersom vi gör designantaganden kring AI-specifika arbetsbelastningar, läs-/skrivdelningar och klusterlayouter. Om en kund använde detta för att värd för en databas eller en e-handelssajt skulle det inte ha samma effekt. Detta är definitionen av specialanpassad programvara.
Hårdvaruexemplet är liknande. Med tanke på vår omfattande distribution av senaste generationens NVIDIA (NVDA ) -SKU:er – många av vilka kräver vätskekylningsutrustning – har CoreWeave byggt specifik expertis och datacenterdesign för att stödja dessa behov. Till skillnad från större molntjänster som bygger för fungibilitet och sedan måste lägga till vätskekylningsutrustning i efterhand bygger CoreWeave datacenter som är specialanpassade för AI från grunden. Detta resulterar i lägre kostnader och högre tillgänglighet för de senaste SKU-typerna.
Nedan är en bild av LOTA-cachen som nämndes.

När kunder först tänker på att skala AI, tror många att de bara behöver tillgång till GPU:er. Vad inser de vanligtvis att de saknar när de börjar träna eller serva modeller i stor skala?
Med tanke på komplexiteten i att köra arbetsbelastningar över stora GPU-kluster blir de omgivande tjänsterna de verkliga drivkrafterna för framgång. Detta inkluderar de uppenbara, som lagring och nätverk, men också kritiska operativa tjänster som observabilitet, orkestrering och säkerhet. Här lyser CoreWeave med vår Mission Control-tjänst. Den ger kunderna en djup förståelse för nodhälsa och körning över hela flottan, och integrerar den kunskapen direkt i orkestreringsmotorn. Detta tillåter kunden att behandla sin infrastruktur inte som 1 000 enskilda GPU:er, utan som en enda, sammanhängande jobbenhet.
Vilka är de viktigaste produktprioriteringarna du fokuserar på just nu för att förbättra kundresultat, antingen det gäller prestanda, tillförlitlighet, kostnadspredictibilitet eller utvecklarupplevelse?
I den centrala plattformen fokuserar vi ständigt på prestanda, tillförlitlighet och observabilitet. Vi måste se till att kunder kan köra jobb på ett upprepat och förutsägbart sätt samtidigt som de tar fullständig nytta av varje TFLOP i varje GPU. Utöver detta arbetar vi med att förenkla onboarding för kunder som kanske inte är bekanta med varje funktion i ett verktyg som SLURM (som alla använder, men nästan alla hatar). Slutligen utvecklar vi ytterligare tjänster och faktureringsmodeller för att göra det lättare att innovativa och börja smått. Just nu är det förvånansvärt svårt att experimentera på grund av höga inträdesbarriärer, såsom kapacitetsbegränsningar, treårsåtaganden och behovet av specialiserade experter bara för att komma igång. Vi vill återföra innovationslättheten till AI-plattformen.
Medan allt fler AI-arbetsbelastningar skiftar från träningstunga till inferens-tunga, hur påverkar den övergången infrastrukturdesign och produktvägbeslut?
Det skapar betydande möjligheter att applicera CoreWeaves befintliga differentiering på inferenskrav. Till exempel fokuserar LOTA-cachen jag nämnde på att mata GPU:er under träning; men vi kan ta den tekniken, integrera den i saker som KVCache och göra den till en kraftfull inferensdifferentierare. Liknande verktyg som Mission Control blir ännu viktigare för inferens, eftersom att observera GPU-hälsa är avgörande för att köra högt tillgängliga agenter-applikationer.
Under de kommande ett till två åren, vad kommer att definiera ledarskap på AI-molnmarknaden, och vilka funktioner kommer att vara viktigast för kunder?
Jag tror att ledarskap kommer att definieras av två saker. Den första är att leverera den alltmer växande skalakrav för träning. Det kommer att kräva framsteg inom observabilitet, hälsövervakning och automatisk återhämtning. När man flyttar från hundratals till tiotusentals GPU:er distribuerade globalt är manuell respons på fel en icke-fråga.
Den andra är att leverera rätt tjänster för inferens och agenter-arbetsbelastningar. Det kräver globala distributionsförmågor och affärsmodeller som uppmuntrar experiment. Detta användningsmönster var det som hjälpte molnet att växa ursprungligen, och det har delvis gått förlorat i AI-eran. Vi behöver återföra det genom bättre plattformsstöd, multi-molnkapacitet och lättanvändhet i flera regioner.
Du ledde tidigare branschspecifika molninitiativ inom hälsovård, detaljhandel, finansiella tjänster, tillverkning och suverän moln. Vilka lärdomar från dessa vertikaler översätter direkt till AI-infrastruktur, och vilka gör det inte?
Generationsväxlingar i GPU:er introducerar fortfarande nya komplexiteter. Varje ny utgåva bringar ökad interconnectivitet, högre minne och större effektbehov, allt som kräver att vi omprövar våra antaganden om hur noder är anslutna och hur programvara levereras. Vi måste förbli obönhörliga här för att upprätthålla vårt ledarskap. På den andra sidan är det område som förbättras snabbast den renodlade skalan av vad kunder kan åstadkomma; hastigheten med vilken de anpassar sig till större beräkningsfotavtryck är imponerande.
Medan AI-datacenter och kluster fortsätter att skala, vilka operativa utmaningar visar sig vara svårast att lösa idag, och vilka förbättras snabbast?
Generationsväxlingarna i GPU:er skapar fortfarande nya komplexiteter i design och programvara. Varje ny GPU-utgåva kommer med ökad interconnectivitet, högre minne och större effektbehov, allt som kräver att vi omprövar våra antaganden om hur noder är anslutna, hur ställningar hanteras och hur programvara levereras. Vi kommer att behöva fokusera på detta arbete för att säkerställa att vi upprätthåller vårt ledarskap. De som förbättras snabbast är vad kunder kan åstadkomma med den växande skalan av beräkningar.
I AI-infrastruktur går tillförlitlighet utöver drifttid. Hur definierar CoreWeave tillförlitlighet, och vilka indikatorer återspeglar bäst framgång från kundens perspektiv?
I stor skala är den största övervägningen för en kund att helt enkelt få jobbet gjort. I massiva operationer förväntas enskilda fel eller förseningar. Nyckeln är hur vi upptäcker och svarar automatiskt på dessa problem för att säkerställa att jobbet slutförs trots utmaningarna. Det är därför vi integrerar Mission Control i högre nivåtjänster som SUNK (Slurm på Kubernetes). Det tillåter kunder att svara på fel automatiskt utan att förlora timmar eller veckor av arbete. För oss är framgång inte bara om noddrifttid; det handlar om jobbframgång.
Om du ser framåt, vad är den stora förändringen i AI-infrastruktur som du tror fortfarande är underuppskattad, antingen relaterad till hårdvaruutveckling, specialisering av stackar, suveränitetskrav eller nya distributionsmodeller?
Jag tror att framväxten av förstärkt inlärning (RL) som en förnyad del av AI-stacken fortfarande är underuppskattad. Medan det inte är ett nytt studieområde, över skuggades det i stor utsträckning under den första vågen av LLM-utveckling. RL gör comeback och kommer att spela en avgörande roll i att göra AI-tjänster mer responsiva på de föränderliga landskapen för deras användare. Av den anledningen är vi mycket entusiastiska över den serverlösa RL-erbjudandet vi har idag.
Tack för det underbara samtalet, läsare som vill lära sig mer kan besöka CoreWeave.












