Wywiady

Christian Stano, Field CTO w Anyscale – Seria wywiadów

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Christian Stano, Field CTO w Anyscale, zbudował karierę na styku dużych skal AI, platform machine learning i rozproszonego przetwarzania. Przed dołączeniem do Anyscale, kierował organizacją platformy AI/ML w Attentive, gdzie skalował infrastrukturę wspierającą personalizację dla ponad pół miliarda subskrybentów i pomógł w przyjęciu systemów obliczeniowych opartych na Ray, co poprawiło prędkość rozwoju, jednocześnie redukując koszty operacyjne. Wcześniej w swojej karierze, pracował w obszarach cyberbezpieczeństwa, architektury chmury i inicjatyw sektora publicznego w organizacjach, w tym Coalfire i Deloitte, gdzie wniósł wkład w jedną z pierwszych platform machine learning amerykańskiego Departamentu Obrony. Jego doświadczenie obejmuje inżynierię platform AI, MLOps, infrastrukturę natywną dla chmury, umożliwianie deweloperom i skalowanie organizacyjne, dając mu głębokie doświadczenie w pomocy przedsiębiorstwom w operacjonalizowaniu AI na skalę produkcyjną.

Anyscale to firma stojąca za Ray, otwartoźródłową ramą obliczeniową szeroko stosowaną do skalowania AI i obciążeń Pythona na klastry procesorów i kart graficznych. Założona przez oryginalnych twórców Ray z RISELab na Uniwersytecie Kalifornijskim w Berkeley, firma koncentruje się na uproszczeniu wdrożenia, orchestracji i zarządzania dużymi skalami infrastruktury AI do szkolenia, inferencji, przetwarzania danych i obciążeń AI. Jej platforma umożliwia organizacjom uruchamianie systemów AI rozproszonych w środowiskach chmury i na miejscu, zapewniając obserwowalność, zarządzanie i optymalizację wydajności zaprojektowaną dla nowoczesnych aplikacji AI. Ray stał się warstwą podstawową w powstającej infrastrukturze AI, pomagając deweloperom skalować obciążenia od jednej maszyny do tysięcy węzłów z minimalnymi zmianami w istniejącym kodzie Pythona.

Pracowałeś w obszarach cyberbezpieczeństwa, platform machine learning sektora publicznego i systemów personalizacji o dużych skalach. Jakie wzorce stale widzisz, gdy organizacje próbują przenieść się z pilotów AI do produkcji?

W różnych branżach pojawiają się trzy wzorce. Po pierwsze, zespoły nie mają niezawodnej, wytyczonej ścieżki od rozwoju do produkcji. Mogą zbudować model w notesie, ale nie ma standaryzowanego sposobu, aby go uruchomić w produkcji. Każde wdrożenie staje się przypadkiem, a każdy błąd jest zaskoczeniem. Po drugie, infrastruktura nie może skalować się wraz z potrzebami. System, który działał w pilocie, zawodzi, gdy karmiony jest rzeczywistymi objętościami danych lub ruchem. Po trzecie, zespoły lecą na ślepo. Brakuje im obserwowalności, aby wiedzieć, jak ich systemy naprawdę działają, gdzie są na granicy awarii i kiedy należy interweniować.

To, co łączy wszystkie trzy, to ten sam podstawowy wyzwanie — zespoły nie mają solidnego modelu mentalnego dla skalowania. Próbują rozwiązać wszystko na raz, zamiast być świadomymi sekwencji. Myślę o tym jako o trzech fazach: spraw, aby działało, spraw, aby było prawidłowe, spraw, aby było szybkie. Te fazy nie są jednorazowymi kamieniami milowymi — są one iteracyjne. Ciągle priorytetowo traktujesz to, co jest złamane teraz, i co zostanie złamane następnie. Zespoły, które odnoszą sukcesy, wiedzą, w jakiej fazie się znajdują i pozostają dyscyplinowane, nie przeskakując do przodu, zanim podstawa nie będzie solidna.

W Anyscale widzimy zespoły na każdym etapie. Niektóre nadal próbują sprawić, aby działało — potrzebują niezawodnej ścieżki od rozwoju do produkcji. Inni mają to, ale toną w złożoności operacyjnej i potrzebują, aby to poprawić. I wiele do nas przychodzi, ponieważ zbudowały coś, co działa, ale nie mogą go przeskalować do poziomu, jaki biznes wymaga. Zjednoczona warstwa obliczeniowa pomaga na każdym etapie, ale punkt wejścia zależy od tego, gdzie ból jest najbardziej ostry.

W Attentive pomogłeś skalować systemy AI wspierające setki milionów użytkowników. Jakie były największe architektoniczne lub organizacyjne bariery, które musiałeś pokonać, aby osiągnąć ten poziom skali?

Największą barierą była krzywa złożoności infrastruktury. Gdy pchaliśmy nasze modele, aby uwzględniały więcej danych i obsługiwały więcej klientów, trafiliśmy na punkt przegięcia obliczeniowego, gdzie nawet największe węzły pionowo skalowane wyrzucały błędy braku pamięci, a naiwne skalowanie poziome nie działało. Nasze obliczenia nie mogły nadążyć za skalą naszych danych.

Naturalną reakcją było warstwowanie narzędzi, aby obejść ograniczenia. Była to moja wewnętrzna książka od poprzednich doświadczeń. Każde narzędzie rozwiązywało wąskie problemy, ale dodawało złożoność operacyjną. Nasz pipeline ML stał się patchworkiem integracji, a każdy nowy przypadek użycia oznaczał więcej szycia, więcej trybów awaryjnych, wyższe koszty i większy nakład pracy dla zespołu platformy.

To, co ostatecznie odblokowało skalę dla nas, było ujednoliceniem przetwarzania danych, szkolenia, inferencji i obsługi na Ray i Anyscale. Wpływ był natychmiastowy: z dramatycznie niższymi kosztami infrastruktury, znacznie szybszymi cyklami szkolenia, nawet gdy rosły objętości danych, i możliwością skalowania modeli do rzędów wielkości większej liczby klientów.

Co skłoniło Cię do dołączenie do Anyscale na tym etapie, i jak widzisz rolę Field CTO w kształtowaniu adopcji AI w przedsiębiorstwach?

Moje doświadczenie z wprowadzeniem Anyscale do Attentive fundamentalnie zmieniło moją książkę budowy platform ML. Przedtem znacząca część inżynierii platformy była kosztem szycia systemów fragmentarycznych. Z Anyscale byliśmy w stanie wyeliminować wiele tego nakładu i zamiast tego skoncentrować się na doświadczeniu deweloperskim, niezawodności i wydajności. Ta zmiana miała ogromny wpływ na produktywność zespołu i wyniki systemu. Dołączenie do Anyscale było okazją do pracy nad tym problemem pełnoetatowo i pomocy innym organizacjom w nawigowaniu przez tę samą transformację. Jako Field CTO, moja rola polega na tym, aby wziąć te prawdziwe lekcje i przekształcić je w powtarzalne wzorce, które nasi klienci mogą zastosować podczas skalowania AI.

Wiele przedsiębiorstw wciąż utknęło w „fazie pilotażu” AI. Z Twojego punktu widzenia, co konkretnie psuje się, gdy firmy próbują skalować te wczesne eksperymenty w systemy produkcyjne?

Gdy firmy przechodzą od eksperymentów AI do produkcji, to, co się psuje, rzadko jest tylko modelem — to otaczający system i operacje. W niektórych przypadkach zespoły wcześnie napotykają limity infrastruktury i nie mogą szkolić ani obsługiwać w skali, jakiej potrzebują. Muszą ograniczyć liczbę klientów lub przypadków użycia, których model obsługuje. Częściej problemy pojawiają się w produkcji przez nieoczekiwane przypadki brzegowe lub zmiany w danych. Jednym z najczęstszych punktów awaryjnych jest pamięć: gdy rozmiar, dystrybucja lub modalność danych zmieniają się, zadania kończą się błędem braku pamięci i awarią. Te problemy są trudne do przewidzenia i jeszcze trudniejsze do automatycznego odzyskiwania. Rzeczywistością jest, że awaria w produkcji AI jest nieunikniona. Celem nie jest całkowite uniknięcie jej, ale szybkie wykrycie, zrozumienie i budowanie samonaprawialnych systemów, aby rozwiązać ją, zanim wpłynie na biznes.

Ray, rozproszona ramą obliczeniowa stworzona przez zespół za Anyscale, zyskuje na popularności jako podstawa obciążeń AI. Dlaczego wykonywanie rozproszone staje się tak krytyczną warstwą w nowoczesnej infrastrukturze AI?

Wykonywanie rozproszone i zarządzanie obciążeniami stały się podstawą dla potoków AI. Współczesne obciążenia AI są z natury równoległe i wymagające zasobów. Szkolenie, inferencja i przetwarzanie danych wymagają koordynacji dużej liczby zadań na procesorach i kartach graficznych, często dynamicznie. W dzisiejszym pejzażu obliczeniowym złożoność zarządzania tymi obciążeniami na rzadkich zasobach jest ogromnym obciążeniem operacyjnym. Tradycyjne systemy nie zostały zaprojektowane z myślą o tym poziomie złożoności lub skali. Ramy takie jak Ray są krytyczne, ponieważ pozwalają zespołom skalować obciążenia bezproblemowo od jednej maszyny do tysięcy węzłów, automatyzując koordynację podstawową. Ta zmiana odzwierciedla szerszy ruch w kierunku obliczeń natywnych AI, gdzie infrastruktura jest zaprojektowana specjalnie dla wzorców obciążeń AI, a nie adaptowana z starszych paradygmatów.

Gdy więcej firm przyjmuje Ray za pośrednictwem platformy Anyscale, jakie różnice widzisz między organizacjami, które standaryzują podejście ujednolicone a tymi, które łączą fragmentaryczne narzędzia?

Różnica między ujednoliconymi platformami a fragmentarycznymi narzędziami ostatecznie sprowadza się do skupienia i wydajności. Gdy zespoły polegają na wielu niepołączonych systemach, spędzają znaczną ilość czasu na łączeniu tych systemów, zarządzaniu niezgodnościami i reagowaniu na awarie w różnych środowiskach. To tworzy nakład operacyjny i spowalnia eksperymentowanie. W przeciwieństwie do tego, ujednolicone podejście pozwala zespołom skoncentrować swoje wysiłki na poprawie jednego systemu, co prowadzi do lepszej niezawodności, silniejszej wydajności i bardziej uporządkowanego doświadczenia deweloperskiego. Uproszcza również procesy on-call i debugowania, ponieważ wzorce są spójne i łatwiejsze do zrozumienia. Rezultatem jest nie tylko efektywność techniczna, ale także klarowność organizacyjna.

Na podstawie Twojego doświadczenia w budowaniu potoków ML od końca do końca, jak ważne jest doświadczenie deweloperskie (DevEx) w przyspieszaniu adopcji AI w zespołach?

Doświadczenie deweloperskie jest jednym z najwyższych obszarów wykorzystania w przyspieszaniu adopcji AI. Gdy zespoły platformowe inwestują w ułatwianie systemów dzięki standaryzowanym przepływom pracy, szablonom i zmniejszeniu tarcia infrastrukturalnego, zwiększają one produktywność każdego inżyniera w organizacji. Jest to szczególnie ważne w AI, gdzie tempo zmian jest ekstremalnie szybkie, a zespoły muszą iterować szybko, aby utrzymać się na szczycie. Ulepszenia doświadczenia deweloperskiego przekładają się bezpośrednio na szybsze eksperymentowanie, szybszy czas dostępu do produkcji i ostatecznie większy wpływ na biznes. Narzędzia do kodowania AI wzmacniają te podstawy DevEx. W wielu ways jest to najbardziej skalowalny sposób zwiększania prędkości w całej organizacji.

Wydajność kosztowa staje się głównym problemem, gdy obciążenia AI skalują. Jakie są niektóre z najbardziej pomijanych sposobów, aby przedsiębiorstwa mogły zmniejszyć koszty infrastruktury bez poświęcania wydajności?

Gdy obciążenia AI skalują, zarządzanie kosztami staje się zarówno bardziej ważne, jak i bardziej złożone. Jednym z najbardziej pomijanych wyzwań jest to, jak szybko koszty mogą eskalować z powodu nieefektywności, szczególnie w infrastrukturze opartej na GPU. Duże klastry mogą uruchomić tysiące węzłów, a jeśli zasoby nie są odpowiednio zarządzane lub wyłączone, koszty gromadzą się szybko. To tworzy rodzaj rozproszenia AI, gdzie użycie obliczeniowe rośnie szybciej, niż zespoły mogą śledzić lub kontrolować. Rozwiązanie tego wymaga połączenia silnego zarządzania, widoczności i automatyzacji, takiej jak automatyczne skalowanie, automatyczne zakończenie i scentralizowane zarządzanie zasobami. Na dużą skalę efektywność kosztowa nie jest tylko problemem operacyjnym, ale fundamentalną częścią projektowania systemu.

Pracowałeś nad wszystkim, od sklepów z cechami po systemy inferencji w czasie rzeczywistym. Jak myślisz, że ewoluuje równowaga między obciążeniami AI wsadowymi a obciążeniami w czasie rzeczywistym?

Równowaga między obciążeniami AI wsadowymi a obciążeniami w czasie rzeczywistym nie zmieniła się fundamentalnie — pozostaje to kwestia wymagań biznesowych. Przetwarzanie wsadowe jest zwykle bardziej efektywne pod względem kosztów i łatwiejsze w obsłudze, co czyni je odpowiednim dla wielu przypadków użycia. Systemy w czasie rzeczywistym są niezbędne, gdy opóźnienia mają bezpośredni wpływ na doświadczenie użytkownika lub wynik biznesowy, tak jak w aplikacjach czatu lub wykrywaniu oszustw. Obie podejścia będą współistnieć, a kluczem dla organizacji jest zbudowanie platform, które mogą obsłużyć każde z nich skutecznie. Decyzja ostatecznie sprowadza się do kompromisów między kosztami, opóźnieniami i niezawodnością.

Spójrzając w przyszłość, jaki jest „dojrzały” przedsiębiorczy platforma AI w ciągu 2-3 lat — i jak narzędzia takie jak Ray i platformy takie jak Anyscale wpisują się w tę przyszłość?

W ciągu najbliższych kilku lat dojrzałe platformy AI przedsiębiorstw będą charakteryzować się kilkoma kluczowymi cechami. Będą one polegać na ujednoliconej infrastrukturze, która wspiera cały cykl życia AI, od przetwarzania danych po szkolenie i inferencję, zamiast zbiorem niepołączonych narzędzi. Będą one miały silne operacje Day 2, z automatyzowaną obserwowalnością, niezawodnością i szybkim debugowaniem. Zarządzanie kosztami będzie przewidywalne i zarządzane, umożliwiając organizacjom skalowanie w sposób zrównoważony. I być może najważniejsze, umożliwią one wysoką prędkość deweloperską, ułatwiając zespołom przejście od pomysłu do produkcji szybko. Platformy takie jak Ray i Anyscale odgrywają centralną rolę w tej przyszłości, dostarczając podstawę AI, która umożliwia ten poziom skali i efektywności.

Dziękuję za wspaniały wywiad, czytelnicy, którzy chcą dowiedzieć się więcej, powinni odwiedzić Anyscale.

Antoine jest wizjonerskim liderem i współzałożycielem Unite.AI, który jest zmotywowany niezachwianą pasją do kształtowania i promowania przyszłości sztucznej inteligencji i robotyki. Jako serialowy przedsiębiorca, wierzy, że sztuczna inteligencja będzie tak samo przełomowa dla społeczeństwa, jak elektryczność, i często jest złapany na tym, że zachwala potencjał przełomowych technologii i AGI.

Jako futurysta, jest poświęcony badaniu, jak te innowacje ukształtują nasz świat. Ponadto, jest założycielem Securities.io, platformy skupiającej się na inwestowaniu w najnowocześniejsze technologie, które zmieniają przyszłość i przebudowują całe sektory.