Wywiady

Corey Sanders, Wiceprezes ds. Produktów w CoreWeave – Seria wywiadów

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Corey Sanders, Wiceprezes ds. Produktów w CoreWeave (CRWV ), kieruje strategią produktową i wykonaniem dla jednej z najszybciej rozwijających się platform chmurowych skupionych na sztucznej inteligencji. Jest odpowiedzialny za skalowanie innowacji, tworzenie rozwiązań dostosowanych do potrzeb klientów oraz wzmacnianie pozycji CoreWeave na rynku infrastruktury AI. Przed dołączeniem do CoreWeave, Sanders spędził dwie dekady w Microsoftu na stanowiskach kierowniczych, obejmujących inżynierię chmury, platformy branżowe, strategię rozwiązań komercyjnych oraz partnerstwa przedsiębiorstw, z głębokim doświadczeniem w łączeniu wykonania technicznego z strategią wejścia na rynek.

CoreWeave to dostawca chmury rodzimej dla sztucznej inteligencji, zbudowany specjalnie dla obciążeń wysokowydajnych i dużych skalach sztucznej inteligencji. Firma działa w szybko rozwijającej się sieci centrów danych w Stanach Zjednoczonych i Europie, dostarczając infrastrukturę i oprogramowanie przyspieszane przez GPU, zaprojektowane dla szkolenia AI, inferencji i zaawansowanych przypadków użycia. Poprzez koncentrowanie się na architekturze celowej, a nie na chmurze ogólnego przeznaczenia, CoreWeave stał się kluczowym partnerem infrastrukturalnym dla laboratoriów AI i przedsiębiorstw poszukujących wydajności, skalowalności i efektywności w skali.

Spędziłeś ponad 20 lat w Microsoft (MSFT ), pracując nad inżynierią systemu Windows, strategią sprzedaży chmury i Chmurą Microsoft dla branż. Czego nauczyła Cię ta ewolucja co do tego, co naprawdę napędza przyjęcie przez przedsiębiorstwa, i w jaki sposób stosujesz te lekcje dzisiaj w CoreWeave?

Przyjęcie przez przedsiębiorstwa zaczyna się od rozwiązania konkretnego problemu klienta. Innowacje dla samej innowacji nie są tak naprawdę istotne dla przedsiębiorstw. Chodzi o to, by włożyć się w ich buty i zrozumieć, co ich naprawdę trapi — czy to jest koszt wsparcia, złożoność operacyjna, łączenie się z klientami lub zarządzanie globalnymi zespołami i nowymi liniami produktów — i dostarczanie usług, które im pomagają. Często są skłonne do innowacji w swoim podejściu, ale najważniejszym rozważaniem jest pomoc w rozwiązaniu ich problemu. Najczęstszym błędem, jaki widziałem w projektowaniu produktu, jest za bardzo zaabsorbowanie się “fajnością” produktu. Podczas gdy to ma znaczenie w przestrzeni konsumenckiej, klienci przedsiębiorstw na końcu troszczą się znacznie bardziej o użyteczność niż o “fajność”.

CoreWeave jest często opisywany jako oferujący infrastrukturę AI celowo zaprojektowaną. W praktyce, co oznacza to z punktu widzenia produktu, i gdzie platformy chmurowe ogólnego przeznaczenia mają trudności z obciążeniami AI?

Największą zaletą bycia celowo zaprojektowanym jest możliwość skupienia się i dostarczania usług bez potrzeby rozwiązywania każdego ogólnego przypadku użycia. Dam dwa przykłady: jeden w oprogramowaniu, a drugi w sprzęcie.

Po stronie oprogramowania nasza oferta Object Storage z pamięcią podręczną LOTA jest skoncentrowana specjalnie na pamięci podręcznej dla obciążeń AI. Wdraża się bezpośrednio na węzłach GPU, dostarcza punkt końcowy S3 dla aplikacji i odpowiada na żądania GPU, rozciągając swoją pamięć podręczną na wiele węzłów. Zwiększa to przepływność do GPU do 7 GB/s, znacznie przewyższając to, co oferują chmury ogólnego przeznaczenia. Możemy to osiągnąć, ponieważ robimy założenia projektowe dotyczące obciążeń AI, podziału odczytu i zapisu oraz układów klastra. Jeśli klient użyłby tego do hostowania bazy danych lub strony e-commerce, nie miałoby to tego samego wpływu. To jest definicja oprogramowania celowo zaprojektowanego.

Przykład sprzętowy jest podobny. Biorąc pod uwagę nasze rozległe wdrożenie najnowszych jednostek NVIDIA (NVDA ) — z których wiele wymaga chłodzenia cieczą — CoreWeave zbudował specjalistyczną wiedzę i projekty centrów danych, aby wesprzeć te potrzeby. W przeciwieństwie do większych chmur, które budują dla zamienialności, a następnie muszą dodawać chłodzenie cieczą, CoreWeave buduje centra danych skupione na AI od podstaw. To skutkuje niższymi kosztami i wyższą dostępnością dla najnowszych modeli.

Poniżej znajduje się obraz pamięci podręcznej LOTA, o której wspomniałem.

Gdy klienci po raz pierwszy myślą o skalowaniu AI, wielu z nich uważa, że potrzebują tylko dostępu do GPU. Czego zwykle brakuje im, gdy zaczynają szkolić lub obsługiwać modele w skali?

Biorąc pod uwagę złożoność uruchamiania obciążeń na ogromnych klastrach GPU, otaczające usługi stają się prawdziwymi napędami sukcesu. Obejmuje to oczywiste, takie jak pamięć masowa i sieć, ale także krytyczne usługi operacyjne, takie jak obserwowalność, orchestracja i bezpieczeństwo. To jest miejsce, w którym CoreWeave naprawdę błyszczy z naszą ofertą Mission Control. Dostarcza klientom głębokiej świadomości stanu węzła i czasu wykonywania w całej ich flotylli, integrując tę wiedzę bezpośrednio w silnik orchestracji. Pozwala to klientowi traktować swoją infrastrukturę nie jako 1000 oddzielnych GPU, ale jako jedną, spójną jednostkę zadania.

Jakie są najważniejsze cele produktowe, na które się obecnie koncentrujesz, aby poprawić wyniki klientów, czy to pod względem wydajności, niezawodności, przewidywalności kosztów czy doświadczenia deweloperskiego?

W rdzeniu platformy stale koncentrujemy się na wydajności, niezawodności i obserwowalności. Musimy zapewnić, że klienci mogą uruchamiać zadania w sposób powtarzalny i przewidywalny, korzystając w pełni z każdego TFLOP w każdym GPU. Poza tym pracujemy nad uproszczeniem procesu wdrożenia dla klientów, którzy mogą nie być zaznajomieni z każdym dzwonkiem i sygnałem w narzędziu takim jak SLURM (które wszyscy używają, ale prawie wszyscy nienawidzą). Wreszcie rozwijamy dodatkowe usługi i modele rozliczeniowe, aby ułatwić innowacje i rozpoczęcie od małych kroków. Obecnie eksperymentowanie jest zaskakująco trudne ze względu na wysokie bariery wejścia, takie jak ograniczenia pojemności, zobowiązania trzyletnie i potrzeba specjalistów, aby tylko zacząć. Chcemy przywrócić łatwość innowacji na platformie AI.

Jak przejście od obciążeń szkoleniowych do obciążeń inferencyjnych wpływa na projektowanie infrastruktury i decyzje dotyczące mapy produktowej?

Tworzy to znaczne możliwości zastosowania istniejącej różnicowania CoreWeave do wymagań inferencyjnych. Na przykład, pamięć podręczna LOTA, o której wspomniałem, koncentruje się na zasilaniu GPU podczas szkolenia; jednak możemy wziąć tę samą technologię, zintegrować ją z rzeczami takimi jak KVCache i przekształcić ją w potężny differentiator inferencyjny. Podobnie, narzędzia takie jak Mission Control stają się jeszcze bardziej istotne dla inferencji, ponieważ obserwowanie stanu zdrowia GPU jest kluczowe dla uruchamiania wysoko dostępnych aplikacji agentywnych.

W ciągu najbliższych jednego do dwóch lat, co zdefiniuje przywództwo na rynku chmury AI, a które możliwości będą najważniejsze dla klientów?

Uważam, że przywództwo będzie definiowane przez dwie rzeczy. Po pierwsze, dostarczanie coraz bardziej rosnących wymagań skalowych dla szkolenia. To będzie wymagało postępów w obserwowalności, monitorowaniu stanu zdrowia i automatycznym odzyskiwaniu. Gdy przechodzimy od setek do dziesiątków tysięcy GPU rozproszonych na całym świecie, ręczna reakcja na awarie jest niemożliwa.

Po drugie, dostarczanie odpowiednich usług dla obciążeń inferencyjnych i agentywnych. To wymaga możliwości wdrożenia globalnego oraz modeli biznesowych, które zachęcają do eksperymentowania. Ten wzorzec użycia pomógł w początkowym wzroście chmury, i został częściowo utracony w erze AI. Musimy to przywrócić poprzez lepsze wsparcie platformy, możliwości wielochmurowe i łatwość użycia w wielu regionach.

Poprzednio kierowałeś inicjatywami chmury branżowej w obszarach takich jak opieka zdrowotna, handel detaliczny, usługi finansowe, produkcja i chmura suwerenna. Jakie lekcje z tych pionierów przekładają się bezpośrednio na infrastrukturę AI, a które nie?

Przeskoki pokoleniowe w GPU wprowadzają nowe złożoności. Każde nowe wydanie przynosi zwiększoną łączność, wyższą pamięć i większe potrzeby mocy, wszystkie wymagające ponownego rozważenia naszych założeń dotyczących sposobu, w jaki węzły są połączone i w jaki sposób oprogramowanie jest dostarczane. Musimy pozostać nieustanni w tym zakresie, aby utrzymać nasze przywództwo. Z drugiej strony, obszar, który ulega największym poprawkom, to po prostu skala tego, co klienci mogą osiągnąć; tempo, w jakim adaptują się do większych śladów obliczeniowych, jest imponujące.

Jak centra danych i klastry AI będą nadal rosły, jakie wyzwania operacyjne okazują się najtrudniejsze do rozwiązania dzisiaj, a które poprawiają się najszybciej?

Przeskoki pokoleniowe w GPU nadal tworzą nowe złożoności w projekcie i oprogramowaniu. Każde nowe wydanie GPU przychodzi z zwiększoną łącznością, wyższą pamięcią, większymi potrzebami mocy itd., co wymaga ponownego rozważenia założeń dotyczących sposobu, w jaki węzły są połączone, jak szafy są zarządzane i jak oprogramowanie jest dostarczane. Będziemy musieli nadal koncentrować się na tej pracy, aby zapewnić utrzymanie naszego stanowiska przywódczego. Te, które poprawiają się najszybciej, to to, co klienci są w stanie osiągnąć dzięki rosnącej skali obliczeń.

W infrastrukturze AI, niezawodność wykracza poza czas pracy. Jak CoreWeave definiuje niezawodność, a jakie wskaźniki najlepiej odzwierciedlają sukces z perspektywy klienta?

W skali, największym rozważaniem dla klienta jest po prostu wykonanie zadania. W ogromnych operacjach indywidualne awarie lub spowolnienia są oczekiwane. Kluczem jest to, jak wykrywamy i automatycznie reagujemy na te problemy, aby zapewnić, że zadanie zostanie wykonane pomimo wyzwań. Dlatego integrujemy Mission Control z wyższymi usługami, takimi jak SUNK (Slurm na Kubernetes). Pozwala to klientom reagować na awarie automatycznie bez utraty godzin lub tygodni pracy. Dla nas sukces nie jest tylko kwestią czasu pracy węzła; jest to kwestia powodzenia zadania.

Spójrzając w przyszłość, jaki główny zwrot w infrastrukturze AI wciąż jest niedoceniany, czy to związany z ewolucją sprzętu, specjalizacją stosów, wymaganiami suwerenności czy nowymi modelami wdrożenia?

Uważam, że nadejście Nauczania Przez Wzmocnienie (RL) jako odnowionej części stosu AI jest wciąż niedoceniane. Chociaż nie jest to nowa dziedzina badań, została ona w dużej mierze zdominowana przez pierwszą falę rozwoju LLM. RL powraca i odegra ważną rolę w czynieniu usług AI bardziej responsywnymi na zmieniające się krajobrazy ich użytkowników. Dlatego jesteśmy bardzo podekscytowani naszą ofertą serwerless RL, którą mamy dzisiaj.

Dziękujemy za wspaniały wywiad, czytelnicy, którzy chcą dowiedzieć się więcej, powinni odwiedzić CoreWeave.

Antoine jest wizjonerskim liderem i współzałożycielem Unite.AI, który jest zmotywowany niezachwianą pasją do kształtowania i promowania przyszłości sztucznej inteligencji i robotyki. Jako serialowy przedsiębiorca, wierzy, że sztuczna inteligencja będzie tak samo przełomowa dla społeczeństwa, jak elektryczność, i często jest złapany na tym, że zachwala potencjał przełomowych technologii i AGI.

Jako futurysta, jest poświęcony badaniu, jak te innowacje ukształtują nasz świat. Ponadto, jest założycielem Securities.io, platformy skupiającej się na inwestowaniu w najnowocześniejsze technologie, które zmieniają przyszłość i przebudowują całe sektory.