Wywiady

Kirill Solodskih, współzałożyciel i CEO TheStage AI – seria wywiadów

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Kirill Solodskih, PhD, jest współzałożycielem i CEO TheStage AI, a także doświadczonym badaczem i przedsiębiorcą z ponad dekadą doświadczenia w optymalizacji sieci neuronowych dla aplikacji biznesowych. W 2024 roku współzałożył TheStage AI, które uzyskało 4,5 miliona dolarów dofinansowania w celu pełnej automatyzacji przyspieszania sieci neuronowych na dowolnej platformie sprzętowej.

Poprzednio, jako lider zespołu w Huawei, Kirill kierował przyspieszaniem aplikacji kamer AI dla procesorów Qualcomm (QCOM ) NPUs, przyczyniając się do wydajności smartfonów P50 i P60 oraz uzyskując wiele patentów za swoje innowacje. Jego badania zostały zaprezentowane na wiodących konferencjach, takich jak CVPR i ECCV, gdzie otrzymały nagrody i uznanie branży. Prowadzi również podcast na temat optymalizacji i inferencji AI.

Czym skłoniło Cię do współzałożenia TheStage AI, i jak przeszłeś od akademii i badań do założenia startupu zajmującego się optymalizacją inferencji?

Podstawy dla tego, co ostatecznie stało się TheStage AI, powstały podczas mojej pracy w Huawei, gdzie byłem głęboko zaangażowany w automatyzację wdrożeń i optymalizację sieci neuronowych. Te inicjatywy stały się podstawą dla niektórych z naszych przełomowych innowacji, i to tam zobaczyłem prawdziwe wyzwanie. Uczono modelu jest jedną rzeczą, ale uzyskanie jego efektywnej pracy w świecie rzeczywistym i uczynienie go dostępnym dla użytkowników to coś zupełnie innego. Wdrożenie jest wąskim gardłem, które powstrzymuje wiele dobrych pomysłów od realizacji. Aby uczynić coś takiego jak ChatGPT tak łatwego w użyciu, jest wiele wyzwań związanych z tyłu.

Manualna optymalizacja inferencji była przez długi czas wąskim gardłem w AI. Możesz wyjaśnić, jak TheStage AI automatyzuje ten proces i dlaczego jest to przełom?

TheStage AI rozwiązuje główne wąskie gardło w AI: ręczną kompresję i przyspieszanie sieci neuronowych. Sieci neuronowe mają miliardy parametrów, i określenie, które z nich usunąć w celu poprawy wydajności, jest niemożliwe ręcznie. ANNA (Automatyczny Analizator Sieci Neuronowych) automatyzuje ten proces, identyfikując, które warstwy wykluczyć z optymalizacji, podobnie jak ZIP kompresja była automatyczna.

To zmienia grę, czyniąc adopcję AI szybszą i bardziej przystępną. Zamiast polegać na kosztownych procesach ręcznych, startupy mogą optymalizować modele automatycznie. Technologia daje firmom jasny widok wydajności i kosztów, zapewniając efektywność i skalowalność bez zgadywania.

TheStage AI twierdzi, że redukuje koszty inferencji o 5 razy — co sprawia, że Twoja technologia optymalizacji jest tak skuteczna w porównaniu z tradycyjnymi metodami?

TheStage AI obcina koszty wyjściowe o 5 razy dzięki podejściu optymalizacyjnemu, które wykracza poza tradycyjne metody. Zamiast stosować ten sam algorytm do całej sieci neuronowej, ANNA dzieli ją na mniejsze warstwy i decyduje, jaki algorytm zastosować do każdej części, aby dostarczyć pożądaną kompresję, jednocześnie maksymalizując jakość modelu. Połączenie inteligentnych matematycznych heurystyk z wydajnymi aproksymacjami sprawia, że nasze podejście jest bardzo skalowalne i ułatwia firmom wszelkich rozmiarów adopcję AI. Integrujemy również elastyczne ustawienia kompilatora, aby zoptymalizować sieci pod kątem konkretnego sprzętu, takiego jak iPhone lub NVIDIA GPU. To daje nam więcej kontroli, aby dostroić wydajność, zwiększając szybkość bez utraty jakości.

Jak porównuje się przyspieszanie inferencji TheStage AI z natywnym kompilatorem PyTorch, i jakie korzyści oferuje to AI developerom?

TheStage AI przyspiesza wyjście znacznie bardziej niż natywny kompilator PyTorch. PyTorch używa metody “just-in-time”, która kompiluje model każdym razem, gdy jest uruchamiany. To prowadzi do długich czasów uruchamiania, czasem trwających minuty lub nawet dłużej. W środowiskach skalowalnych może to powodować niewydajności, zwłaszcza gdy nowe GPU muszą być wprowadzane online, aby obsłużyć zwiększony obciążenie użytkowników, co powoduje opóźnienia, które wpływają na doświadczenie użytkownika.

W przeciwieństwie do tego, TheStage AI pozwala na prekompilację modeli, więc gdy model jest gotowy, może być wdrożony natychmiast. To prowadzi do szybszych wdrożeń, poprawy efektywności usług i oszczędności kosztów. Deweloperzy mogą wdrożyć i skalować modele AI szybciej, bez wąskich gardeł tradycyjnej kompilacji, co czyni je bardziej efektywnymi i responsywnymi w przypadku wysokiego obciążenia.

Czy możesz powiedzieć więcej o zestawie narzędzi QLIP TheStage AI i jak poprawia on wydajność modelu, jednocześnie utrzymując jakość?

QLIP, zestaw narzędzi TheStage AI, jest biblioteką Python, która zapewnia podstawowy zestaw prymitywów do szybkiego tworzenia nowych algorytmów optymalizacji dostosowanych do różnego sprzętu, takiego jak GPU i NPU. Zestaw narzędzi obejmuje składniki, takie jak kwantyzacja, przycinanie, specyfikacja, kompilacja i serwisowanie, wszystkie kluczowe dla tworzenia wydajnych i skalowalnych systemów AI.

To, co wyróżnia QLIP, to jego elastyczność. Pozwala inżynierom AI prototypować i wdrażać nowe algorytmy zaledwie kilkoma liniami kodu. Na przykład, niedawny artykuł konferencyjny na temat sieci neuronowych kwantyzowanych może być przekonwertowany w działający algorytm przy użyciu prymitywów QLIP w ciągu kilku minut. To ułatwia deweloperom integrację najnowszych badań w ich modelach bez ograniczeń sztywnych ram.

W przeciwieństwie do tradycyjnych frameworków open-source, które ograniczają Cię do ustalonego zestawu algorytmów, QLIP pozwala każdemu dodać nowe techniki optymalizacji. Ta adaptacyjność pomaga zespołom pozostać na czele dynamicznie ewoluującego krajobrazu AI, poprawiając wydajność, jednocześnie zapewniając elastyczność dla przyszłych innowacji.

Wniosłeś wkład w ramy kwantyzacji AI używane w kamerach P50 i P60 Huawei. Jak ten doświadczenie ukształtowało Twoje podejście do optymalizacji AI?

Mój doświadczenie z ramami kwantyzacji AI dla kamer P50 i P60 Huawei dało mi cenne spostrzeżenia na temat tego, jak optymalizację można usprawnić i skalować. Gdy po raz pierwszy zacząłem pracę z PyTorch, praca z pełnym grafem wykonywania sieci neuronowych była sztywna, a algorytmy kwantyzacji musiały być wdrożone ręcznie, warstwa po warstwie. W Huawei zbudowałem framework, który automatyzował ten proces. Wystarczyło tylko wprowadzić model, a framework automatycznie generował kod dla kwantyzacji, eliminując pracę ręczną.

To skłoniło mnie do zrozumienia, że automatyzacja w optymalizacji AI jest o tym, aby umożliwić szybkość bez poświęcania jakości. Jeden z algorytmów, które opracowałem i opatentowałem, stał się kluczowy dla Huawei, zwłaszcza gdy musieli przejść od procesorów Kirin do Qualcomm z powodu sankcji. Pozwoliło zespołowi szybko dostosować sieci neuronowe do architektury Qualcomm bez utraty wydajności ani dokładności.

Przez usprawnienie i automatyzację procesu, skróciliśmy czas rozwoju z ponad roku do zaledwie kilku miesięcy. To miało ogromny wpływ na produkt używany przez miliony i ukształtowało moje podejście do optymalizacji, koncentrując się na szybkości, efektywności i minimalnej stracie jakości. To jest podejście, które przywożę do ANNY dzisiaj.

Twoje badania zostały zaprezentowane na CVPR i ECCV — jakie są niektóre z najważniejszych przełomów w efektywności AI, których jesteś najbardziej dumny?

Gdy jestem pytany o moje osiągnięcia w efektywności AI, zawsze myślę o naszym artykule, który został wybrany do prezentacji ustnej na CVPR 2023. Bycie wybranym do prezentacji ustnej na takiej konferencji jest rzadkie, ponieważ tylko 12 artykułów jest wybranych. To dodaje do faktu, że AI generatywna zwykle dominuje w światłach reflektorów, a nasz artykuł przyjął inne podejście, koncentrując się na stronie matematycznej, a konkretnie na analizie i kompresji sieci neuronowych.

Rozwinęliśmy metodę, która pomogła nam zrozumieć, ile parametrów sieć neuronowa naprawdę potrzebuje, aby działać efektywnie. Stosując techniki z analizy funkcjonalnej i przechodząc od dyskretnej do ciągłej formuły, byliśmy w stanie osiągnąć dobre wyniki kompresji, jednocześnie zachowując możliwość integracji tych zmian z powrotem do modelu. Artykuł również wprowadził kilka nowych algorytmów, których społeczność nie używała wcześniej i znalazł dalsze zastosowanie.

To był jeden z moich pierwszych artykułów w dziedzinie AI, i co ważne, był to efekt zbiorowych wysiłków naszego zespołu, w tym moich współzałożycieli. Był to znaczący kamień milowy dla nas wszystkich.

Czy możesz wyjaśnić, jak działają Integralne Sieci Neuronowe (INN) i dlaczego są one ważną innowacją w głębokim uczeniu?

Tradycyjne sieci neuronowe używają stałych macierzy, podobnych do arkuszy kalkulacyjnych, gdzie rozmiar i parametry są predeterminowane. INN-y opisują sieci jako funkcje ciągłe, oferując znacznie więcej elastyczności. Wyobraź sobie to jak kołdra z pinezkami na różnych wysokościach, a to reprezentuje ciągłą falę.

To, co sprawia, że INN-y są ekscytujące, to ich zdolność do dynamicznego “kompresowania” lub “rozszerzania” w zależności od dostępnych zasobów, podobnie jak sygnał analogowy jest cyfrowy w dźwięku. Można zmniejszyć sieć bez utraty jakości, a gdy potrzebne, rozszerzyć ją z powrotem bez ponownego szkolenia.

Przetestowaliśmy to, i podczas gdy tradycyjne metody kompresji prowadzą do znacznej utraty jakości, INN-y utrzymują jakość bliską oryginałowi, nawet przy ekstremalnej kompresji. Matematyka za tym jest bardziej niekonwencjonalna dla społeczności AI, ale prawdziwa wartość leży w jej zdolności do dostarczania solidnych, praktycznych wyników z minimalnym wysiłkiem.

TheStage AI pracował nad algorytmami kwantowego annealingu — jak widzisz rolę komputingu kwantowego w optymalizacji AI w najbliższej przyszłości?

Gdy chodzi o komputing kwantowy i jego rolę w optymalizacji AI, kluczowe jest to, że systemy kwantowe oferują całkowicie inne podejście do rozwiązywania problemów, takich jak optymalizacja. Chociaż nie wynaleźliśmy algorytmów kwantowego annealingu od podstaw, firmy takie jak D-Wave dostarczają biblioteki Pythona do budowania algorytmów kwantowych specjalnie dla zadań optymalizacji dyskretnej, które są idealne dla komputerów kwantowych.

Pomysł polega na tym, że nie ładujemy sieci neuronowej bezpośrednio do komputera kwantowego. To nie jest możliwe z bieżącej architektury. Zamiast tego, aproksymujemy, jak sieci neuronowe zachowują się pod różnymi typami degradacji, robiąc je pasującymi do systemu, który kwantowy chip może przetworzyć.

W przyszłości systemy kwantowe mogą skalować i optymalizować sieci z precyzją, której systemy klasyczne mają trudności z dopasowaniem. Zaletą systemów kwantowych jest ich wbudowana równoległość, coś, co systemy klasyczne mogą symulować tylko przy użyciu dodatkowych zasobów. To oznacza, że komputing kwantowy może znacznie przyspieszyć proces optymalizacji, zwłaszcza gdy dowiemy się, jak modelować większe i bardziej złożone sieci skutecznie.

Prawdziwy potencjał leży w używaniu komputingu kwantowego do rozwiązywania ogromnych, skomplikowanych zadań optymalizacyjnych i rozkładania parametrów na mniejsze, bardziej zarządzalne grupy. Z technologiami takimi jak kwant i optyczne komputing, istnieją ogromne możliwości optymalizacji AI, które wykraczają poza to, co komputing tradycyjny może zaoferować.

Jaki jest Twój długoterminowy cel dla TheStage AI? Gdzie widzisz optymalizację inferencji w ciągu najbliższych 5-10 lat?

W długiej perspektywie, TheStage AI ma na celu stać się globalnym Hubem Modelu, gdzie każdy może łatwo uzyskać dostęp do zoptymalizowanej sieci neuronowej z pożądanymi cechami, niezależnie od tego, czy jest to smartphone, czy inny urządzenie. Celem jest zapewnienie doświadczenia “przeciągnij i upuść”, gdzie użytkownicy wprowadzają swoje parametry, a system automatycznie generuje sieć. Jeśli sieć nie istnieje jeszcze, zostanie utworzona automatycznie przy użyciu ANNY.

Naszym celem jest umożliwienie sieciom neuronowym działania bezpośrednio na urządzeniach użytkowników, obcinając koszty o 20 do 30 razy. W przyszłości to mogłoby niemal całkowicie wyeliminować koszty, ponieważ urządzenie użytkownika zajmie się obliczeniami, zamiast polegać na serwerach w chmurze. To, w połączeniu z postępami w kompresji modelu i przyspieszaniu sprzętu, mogłoby uczynić wdrożenie AI znacznie bardziej efektywnym.

Planujemy również zintegrować naszą technologię z rozwiązaniami sprzętowymi, takimi jak sensory, chipy i robotyka, dla aplikacji w dziedzinach takich jak jazda autonomiczna i robotyka. Na przykład, chcemy zbudować kamery AI, które mogą funkcjonować w dowolnym środowisku, niezależnie od tego, czy jest to przestrzeń kosmiczna, czy ekstremalne warunki, takie jak ciemność lub kurz. To uczyni AI użytecznym w szerokim zakresie aplikacji i pozwoli nam tworzyć niestandardowe rozwiązania dla konkretnego sprzętu i przypadków użycia.

Dziękuję za wspaniały wywiad, czytelnicy, którzy chcą dowiedzieć się więcej, powinni odwiedzić TheStage AI.

Antoine jest wizjonerskim liderem i współzałożycielem Unite.AI, który jest zmotywowany niezachwianą pasją do kształtowania i promowania przyszłości sztucznej inteligencji i robotyki. Jako serialowy przedsiębiorca, wierzy, że sztuczna inteligencja będzie tak samo przełomowa dla społeczeństwa, jak elektryczność, i często jest złapany na tym, że zachwala potencjał przełomowych technologii i AGI.

Jako futurysta, jest poświęcony badaniu, jak te innowacje ukształtują nasz świat. Ponadto, jest założycielem Securities.io, platformy skupiającej się na inwestowaniu w najnowocześniejsze technologie, które zmieniają przyszłość i przebudowują całe sektory.