Rozhovory

Corey Sanders, Senior Vice President Product at CoreWeave – Rozhovorová série

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Corey Sanders, Senior Vice President Product at CoreWeave (CRWV ), vede produktovou strategii a realizaci pro jednu z nejrychleji rostoucích AI-zaměřených cloudových platforem. Je zodpovědný za škálování inovací, vytváření účelových řešení s zákazníky a posilování pozice CoreWeave na trhu AI infrastruktury. Předtím, než nastoupil do CoreWeave, strávil Sanders dvě desetiletí v Microsoftu ve vedoucích pozicích, které zahrnovaly cloudové inženýrství, průmyslově specifické platformy, komerční řešení a velké podnikové partnerství, s hlubokými zkušenostmi v propojení technické realizace a marketingové strategie.

CoreWeave je AI-rodný cloudový poskytovatel, který je speciálně navržen pro high-performance computing a velké umělě inteligentní zatížení. Společnost provozuje rychle se rozšiřující síť datových center po celých Spojených státech a Evropě, poskytující GPU-urychlenou infrastrukturu a software navržený pro AI školení, inferenci a pokročilé výpočetní použití. Díky zaměření na účelovou architekturu místo obecného cloudu se CoreWeave stal kritickým infrastrukturním partnerem pro AI laboratoře a podniky, které hledají výkon, škálovatelnost a efektivitu ve velkém měřítku.

Strávili jste více než 20 let v Microsoftu, kde jste pracovali napříč inženýrstvím Windows, cloudovými prodejními strategiemi a Microsoft (MSFT ) Cloud for Industry. Co vám tato progrese naučila o tom, co skutečně pohání přijetí podniků, a jak aplikujete tyto lekce dnes v CoreWeave?

Přijetí podniků začíná řešením specifického zákaznického problému. Inovace pro samotnou inovaci nejsou pro podniky tak důležité. Je to o tom, aby se člověk postavil do jejich bot a pochopil, co jim skutečně vadí – zda je to cena podpory, provozní složitosti, spojení se zákazníky nebo řízení globálních týmů a nových produktových linií – a poté dodání služeb, které jim pomohou. Často jsou ochotni být inovativní ve svém přístupu, ale nejdůležitějším úvahám je pomoci jim řešit jejich problém. Nejčastější chyba, kterou jsem viděl v produktovém designu, je to, že se člověk příliš zabývá “coolness” produktu. Ačkoli to má váhu v spotřebitelském prostoru, podnikoví zákazníci se nakonec více zajímají o užitnou hodnotu než o “coolness”.

CoreWeave je často popisován jako poskytovatel účelové AI infrastruktury. Z praktického hlediska, co znamená “účelový” z hlediska produktu, a kde se obecné cloudové platformy potýkají s AI zatíženími?

Největším přínosem účelového designu je schopnost se soustředit a dodávat služby bez nutnosti řešit každý obecný případ použití. Uvedu dva příklady: jeden ze softwaru a jeden z hardwaru.

Na straně softwaru je naše nabídka Object Storage s LOTA cache zaměřena specificky na caching pro AI zatížení. Nasazuje se přímo na GPU uzlech, poskytuje S3 endpoint pro aplikaci a reaguje na GPU požadavky tak, že rozšiřuje svou cache napříč několika uzly. To zvyšuje propustnost na GPU až na 7 GB/s, což daleko přesahuje, co nabízí obecné cloudové platformy. Dokážeme toho dosáhnout, protože děláme designové předpoklady kolem AI-specifických zatížení, read/write splitů a clusterových layoutů. Pokud by zákazník použil tuto službu pro hostování databáze nebo e-commerce webu, neměl by stejný dopad. To je definice účelového softwaru.

Příklad z hardwaru je podobný. Díky našemu rozsáhlému nasazení nejnovějších NVIDIA (NVDA ) SKU – mnoha z nich vyžadují kapalné chlazení – CoreWeave vybudoval specifické odborné znalosti a navrhování datových center, aby tyto potřeby podporovaly. Na rozdíl od větších cloudů, které budují pro fungibilitu a poté musí dodatečně přidat kapalné chlazení, CoreWeave buduje datová centra zaměřená na AI od základu. To vede k nižším nákladům a vyšší dostupnosti pro nejnovější SKU typy.

Níže je obrázek LOTA cache, o kterém jsem se zmínil.

Když zákazníci poprvé uvažují o škálování AI, mnozí si myslí, že potřebují pouze přístup k GPU. Co si obvykle uvědomí, že jim chybí, až začnou školoit nebo obsluhovat modely ve velkém měřítku?

Vzhledem k složitosti běhu zatížení napříč obrovskými GPU klastry se okolní služby stávají skutečnými hnacími silami úspěchu. To zahrnuje zjevné věci, jako je úložiště a síť, ale také kritické provozní služby, jako je pozorovatelnost, orchestrace a zabezpečení. Zde CoreWeave opravdu vyniká s naší nabídkou Mission Control. Poskytuje zákazníkům hluboké povědomí o zdraví uzlu a běhu napříč jejich flotilou, integrující toto poznání přímo do orchestrace. To umožňuje zákazníkovi pohlížet na svou infrastrukturu ne jako na 1 000 jednotlivých GPU, ale jako na jeden, kohezivní entitu úlohy.

Jaké jsou vaše hlavní produktové priority, na kterých se nyní zaměřujete, aby se zlepšily výsledky zákazníků, ať už se jedná o výkon, spolehlivost, předvídatelnost nákladů nebo zkušenosti vývojářů?

V jádru platformy se neustále zaměřujeme na výkon, spolehlivost a pozorovatelnost. Musíme zajistit, aby zákazníci mohli běžet úlohy opakovaným a předvídatelným způsobem, zatímco plně využívají každého TFLOP v každém GPU. Kromě toho pracujeme na zjednodušení procesu onboardingu pro zákazníky, kteří nemusí být seznámeni se všemi funkcemi v nástroji, jako je SLURM (který všichni používají, ale téměř všichni nenávidí). Nakonec vyvíjíme další služby a fakturační modely, aby bylo snazší inovovat a začínat malé. V současné době je experimentování překvapivě obtížné kvůli vysokým bariérám vstupu, jako jsou kapacitní omezení, tříleté závazky a potřeba specializovaných odborníků, aby se mohli vůbec začít. Chceme vrátit snadnost inovací na AI platformu.

Jak přechod AI zatížení z tréninku na inferenci ovlivňuje návrh infrastruktury a rozhodnutí o produktovém roadmapu?

Toto vytváří významné příležitosti pro aplikaci stávající diferenciace CoreWeave na požadavky inferenze. Například LOTA cache, o které jsem se zmínil, se zaměřuje na krmení GPU během tréninku; nicméně, můžeme vzít tutéž technologii, integrovat ji do věcí, jako je KVCache, a proměnit ji v silného diferenciátora pro inferenci. Podobně se nástroje, jako je Mission Control, stávají ještě více vitálními pro inferenci, protože pozorování zdraví GPU je zásadní pro běh vysoce dostupných agentic aplikací.

Co bude definovat vedení na trhu AI cloudu v příštím roce nebo dvou, a které schopnosti budou pro zákazníky nejdůležitější?

Domnívám se, že vedení bude definováno dvěma věcmi. První je dodání stále rostoucích požadavků na škálovatelnost pro trénink. To bude vyžadovat pokroky v pozorovatelnosti, monitorování zdraví a automatickém zotavení. Když se pohybujete od stovek na desítky tisíc GPU distribuovaných globálně, manuální reakce na selhání není možností.

Druhým je dodání správných služeb pro inferenci a agentic zatížení. To vyžaduje globální nasazení a obchodní modely, které podporují experimentování. Tento model použití byl tím, co původně pomohl cloudu růst, a byl trochu ztracen ve věku AI. Musíme ho vrátit zpět prostřednictvím lepší platformové podpory, multi-cloud funkcí a multi-regionální snadnosti použití.

Předtím jste vedl průmyslově specifické cloudové iniciativy napříč zdravotnictvím, maloobchodem, finančními službami, výrobou a suverénním cloudem. Které lekce z těchto vertikálů se přímo vztahují k AI infrastruktuře, a které ne?

Generační posuny v GPU neustále zavádějí nové složitosti. Každé nové vydání přináší zvýšenou interkonectivitu, vyšší paměť a větší potřeby energie, všechny z nich vyžadují, abychom přehodnotili naše předpoklady o tom, jak jsou uzly propojeny a jak je software dodáván. Musíme zde zůstat neústupní, abychom udrželi naše vedení. Na druhé straně se nejrychleji zlepšující oblastí stává čistá škála toho, co mohou zákazníci dosáhnout; rychlost, s níž se přizpůsobují větším výpočetním stopám, je působivá.

Jaké provozní výzvy se při dalším škálování AI datových center a clusterů ukazují jako nejobtížnější k řešení, a které se zlepšují nejrychleji?

Generační posuny v GPU neustále zavádějí nové složitosti v návrhu a softwaru. Každé nové vydání GPU přináší zvýšenou interkonectivitu, vyšší paměť a větší potřeby energie, všechny z nich vyžadují, abychom přehodnotili naše předpoklady o tom, jak jsou uzly propojeny, jak jsou stojany spravovány a jak je software dodáván. Bude nutné se na této práci zaměřit, abychom zajistili, že udržíme své vedoucí postavení. Nejrychleji se zlepšující oblastí je to, co zákazníci mohou dosáhnout se škálováním výpočetních kapacit.

V AI infrastruktuře spolehlivost jde za hranice dostupnosti. Jak CoreWeave definuje spolehlivost, a které indikátory nejlépe odrážejí úspěch z pohledu zákazníka?

Ve velkém měřítku je pro zákazníka nejdůležitější věc prostě dokončit úlohu. V masivních operacích se očekávají jednotlivá selhání nebo zpomalení. Klíčové je, jak detekujeme a automaticky reagujeme na tyto problémy, abychom zajistili, že úloha bude dokončena navzdory výzvám. To je důvod, proč integrujeme Mission Control do vyšších služeb, jako je SUNK (Slurm na Kubernetes). To umožňuje zákazníkům reagovat na selhání automaticky, aniž by ztratili hodiny nebo týdny práce. Pro nás není úspěch pouze o dostupnosti uzlu; je to o úspěchu úlohy.

Pohledem do budoucna, jaká významná změna v AI infrastruktuře je podle vás stále podceňována, ať už se jedná o evoluci hardwaru, specializaci zásobníků, suverénní požadavky nebo nové modely nasazení?

Domnívám se, že příchod učení s posilováním (Reinforcement Learning, RL) jako obnovující se části AI zásobníku je stále podceňován. Ačkoli to není nový studijní obor, byl během počáteční vlny vývoje LLM částečně přehlížen. RL se vrací a bude hrát vitální roli v tom, aby AI služby byly více reagující na měnící se krajiny svých uživatelů. Protože toho, jsme velmi nadšení z naší serverless RL nabídky, kterou máme dnes.

Děkuji za skvělý rozhovor, čtenáři, kteří chtějí se dozvědět více, by měli navštívit CoreWeave.

Antoine je vizionářský líder a spoluzakladatel Unite.AI, který je poháněn neotřesitelnou vášní pro formování a propagaci budoucnosti umělé inteligence a robotiky. Jako sériový podnikatel věří, že umělá inteligence bude mít na společnost stejně disruptivní vliv jako elektřina, a často se chvála na potenciál disruptivních technologií a AGI.