Wywiady

Neetu Pathak, współzałożyciel i CEO Skymel – seria wywiadów

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Neetu Pathak, współzałożyciel i CEO Skymel, prowadzi firmę w rewolucjonizowaniu wnioskowania AI za pomocą innowacyjnej technologii NeuroSplit™. Wraz z CTO Sushant Tripathy, prowadzi misję Skymel, aby poprawić wydajność aplikacji AI, jednocześnie redukując koszty obliczeniowe.

NeuroSplit™ to technologia inferencji adaptacyjnej, która dynamicznie rozdziela obciążenia AI między urządzenia końcowe a serwery w chmurze. Ten podejście wykorzystuje nieaktywne zasoby obliczeniowe na urządzeniach użytkowników, redukując koszty infrastruktury w chmurze o do 60%, przyspieszając prędkość inferencji, zapewniając prywatność danych i umożliwiając płynną skalowalność.

Poprzez optymalizację lokalnej mocy obliczeniowej, NeuroSplit™ pozwala aplikacjom AI działać wydajnie nawet na starszych GPU, znacznie redukując koszty, jednocześnie poprawiając doświadczenie użytkownika.

Co zainspirowało Cię do współzałożenia Skymel, i jakie kluczowe wyzwania w infrastrukturze AI chcieliście rozwiązać za pomocą NeuroSplit?

Inspiracją do Skymel była konwergencja naszych komplementarnych doświadczeń. Podczas pracy w Google (GOOGL ), mój współzałożyciel, Sushant Tripathy, wdrażał modele AI oparte na mowie na miliardach urządzeń z Androidem. Odkrył, że istnieje ogromna ilość nieaktywnych zasobów obliczeniowych na urządzeniach końcowych, ale większość firm nie mogła ich efektywnie wykorzystać z powodu złożonych wyzwań inżynieryjnych związanych z dostępem do tych zasobów bez kompromitowania doświadczenia użytkownika.

Tymczasem, moje doświadczenie w pracy z przedsiębiorstwami i startupami w Redis dało mi głębokie zrozumienie, jak krytyczna jest opóźnienie dla firm. Gdy aplikacje AI stały się bardziej powszechne, stało się jasne, że musimy przenieść przetwarzanie bliżej miejsca, w którym powstają dane, zamiast stale przesyłać dane tam i z powrotem do centrów danych.

To było momentem, w którym Sushant i ja zrealizowaliśmy, że przyszłość nie polega na wyborze między przetwarzaniem lokalnym a chmurowym – ale na stworzeniu inteligentnej technologii, która może bezproblemowo adaptować się między przetwarzaniem lokalnym, chmurowym lub hybrydowym w zależności od konkretnego wnioskowania. To spostrzeżenie doprowadziło nas do założenia Skymel i rozwoju NeuroSplit, przechodząc poza tradycyjne ograniczenia infrastruktury, które hamowały innowacje AI.

Możesz wyjaśnić, jak NeuroSplit dynamicznie optymalizuje zasoby obliczeniowe, jednocześnie zachowując prywatność użytkownika i wydajność?

Jednym z głównych problemów w lokalnym wnioskowaniu AI jest jego statyczne wymagania obliczeniowe – tradycyjnie, uruchamianie modelu AI wymaga tych samych zasobów obliczeniowych, niezależnie od warunków urządzenia lub zachowania użytkownika. Ten podejście “one-size-fits-all” ignoruje fakt, że urządzenia mają różne możliwości sprzętowe, od różnych chipów (GPU, NPU, CPU, XPU) do różnych przepustowości sieci, a użytkownicy mają różne wzorce zachowania w zakresie użycia aplikacji i ładowania.

NeuroSplit nieustannie monitoruje różne parametry urządzenia – od możliwości sprzętowych do bieżącego wykorzystania zasobów, stanu baterii i warunków sieci. Uwzględniamy również wzorce zachowania użytkowników, takie jak ilość innych aplikacji, które są uruchomione, i typowe wzorce użycia urządzenia. Ten kompleksowy monitoring pozwala NeuroSplit na dynamiczne określenie, ile wnioskowania może być bezpiecznie uruchomione na urządzeniu końcowym, optymalizując wskaźniki wydajności dla deweloperów.

Gdy prywatność danych jest najważniejsza, NeuroSplit zapewnia, że surowe dane nigdy nie opuszczają urządzenia, przetwarzając wrażliwe informacje lokalnie, jednocześnie zachowując optymalną wydajność. Nasza zdolność do inteligentnego podziału, przycinania lub odłączania modeli AI pozwala nam zmieścić 50-100 modeli AI w przestrzeni pamięci jednego kwantowanego modelu na urządzeniu końcowym. W praktyce oznacza to, że użytkownicy mogą uruchamiać znacznie więcej aplikacji AI jednocześnie, przetwarzając wrażliwe dane lokalnie, w porównaniu z tradycyjnymi podejściami obliczeniowymi.

Jakie są główne korzyści z adaptacyjnego wnioskowania NeuroSplit dla firm AI, szczególnie tych, które pracują z starszą technologią GPU?

NeuroSplit dostarcza trzy przełomowe korzyści dla firm AI. Po pierwsze, dramatycznie redukuje koszty infrastruktury za pomocą dwóch mechanizmów: firmy mogą wykorzystywać tańsze, starsze GPU, a nasza unikalna zdolność do umieszczenia pełnych i stub modeli na GPU w chmurze umożliwia znacznie wyższe wskaźniki wykorzystania GPU. Na przykład, aplikacja, która zwykle wymaga kilku NVIDIA A100 za 2,74 USD za godzinę, może teraz działać na jednym A100 lub kilku V100 za zaledwie 0,83 USD za godzinę.

Po drugie, znacznie poprawiamy wydajność, przetwarzając dane wejściowe bezpośrednio na urządzeniach użytkowników. Oznacza to, że dane, które ostatecznie trafiają do chmury, są znacznie mniejsze, znacznie redukując opóźnienia sieciowe, jednocześnie zachowując dokładność. Ten hybrydowy podejście daje firmom najlepsze z obu światów – prędkość przetwarzania lokalnego z mocą obliczeniową chmury.

Po trzecie, poprzez przetwarzanie wstępnych danych na urządzeniu końcowym, pomagamy firmom utrzymać silne zabezpieczenia prywatności, nie kompromitując wydajności. Jest to coraz bardziej krytyczne, gdy regulacje dotyczące prywatności stają się bardziej restrykcyjne, a użytkownicy stają się bardziej świadomi prywatności.

Jak rozwiązanie Skymel redukuje koszty wnioskowania AI bez kompromitowania złożoności modelu lub dokładności?

Po pierwsze, poprzez podział poszczególnych modeli AI, rozdzielamy obliczenia między urządzenia użytkowników a chmurę. Pierwsza część działa na urządzeniu końcowym, obsługując 5% do 100% całości obliczeń, w zależności od dostępnych zasobów urządzenia. Tylko pozostałe obliczenia muszą być przetworzone na GPU w chmurze.

Ten podział oznacza, że GPU w chmurze obsługują zmniejszone obciążenie obliczeniowe – jeśli model pierwotnie wymagał pełnego GPU A100, po podziale, to samo obciążenie może wymagać tylko 30-40% pojemności GPU. Pozwala to firmom na korzystanie z bardziej opłacalnych instancji GPU, takich jak V100.

Po drugie, NeuroSplit optymalizuje wykorzystanie GPU w chmurze. Poprzez efektywne rozmieszczenie pełnych modeli i stub modeli (pozostałych części podzielonych modeli) na tym samym GPU w chmurze, osiągamy znacznie wyższe wskaźniki wykorzystania w porównaniu z tradycyjnymi podejściami. Oznacza to, że więcej modeli może działać jednocześnie na tym samym GPU w chmurze, dalej redukując koszty na wnioskowanie.

Co wyróżnia podejście hybrydowe (lokalne + chmura) Skymel spośród innych rozwiązań infrastruktury AI na rynku?

Krajobraz AI jest w fascynującym momencie infleksji. Podczas gdy dzisiaj skupiamy się na skalowaniu ogólnych modeli językowych w chmurze, najbliższe pięć lat zobaczy, jak AI staje się głęboko spersonalizowane i kontekstowo świadome. Nie chodzi tylko o fine-tuning – chodzi o AI, które adaptuje się do konkretnych użytkowników, urządzeń i sytuacji w czasie rzeczywistym.

Ten przełom tworzy dwa główne wyzwania infrastrukturalne. Po pierwsze, tradycyjne podejście do uruchamiania wszystkiego w scentralizowanych centrach danych staje się niewykonalne zarówno technicznie, jak i ekonomicznie. Po drugie, rosnąca złożoność aplikacji AI oznacza, że potrzebujemy infrastruktury, która może dynamicznie optymalizować się w wielu modelach, urządzeniach i lokalizacjach obliczeniowych.

W Skymel budujemy infrastrukturę, która specjalnie rozwiązuje te wyzwania. Nasza technologia umożliwia AI działać tam, gdzie ma to największy sens – czy to na urządzeniu, na którym generowane są dane, w chmurze, gdzie dostępna jest większa moc obliczeniowa, czy inteligentnie podzielone między nimi. Co więcej, podejmujemy te decyzje w czasie rzeczywistym, w zależności od zmieniających się warunków i wymagań.

Jak Agent Orchestrator uzupełnia NeuroSplit, i jaka rolę odgrywa w transformacji strategii wdrożenia AI?

Agent Orchestrator (OA) i NeuroSplit współpracują, aby stworzyć samooptymalizujący się system wdrożenia AI:

1. Deweloperzy ustalają granice:

  • Ograniczenia: dozwolone modele, wersje, dostawcy chmury, strefy, reguły zgodności
  • Cele: docelowa opóźnienie, limity kosztów, wymagania wydajności, potrzeby prywatności

2. OA działa w ramach tych ograniczeń, aby osiągnąć cele:

  • Decyduje, które modele/API mają być używane dla każdego żądania
  • Adaptuje strategie wdrożenia na podstawie wyników w świecie rzeczywistym
  • Robi kompromisy, aby zoptymalizować określone cele
  • Może być ponownie konfigurowany natychmiast, gdy potrzeby się zmieniają

3. NeuroSplit wykonuje decyzje OA:

  • Wykorzystuje telemetrię urządzenia w czasie rzeczywistym, aby zoptymalizować wykonanie
  • Podział przetwarzania między urządzenie a chmurę, gdy jest to korzystne
  • Zapewnia, że każde wnioskowanie działa optymalnie, biorąc pod uwagę bieżące warunki

To jak mieć system AI, który samoczynnie optymalizuje się w ramach określonych reguł i celów, zamiast wymagać ręcznej optymalizacji dla każdego scenariusza.

Twoim zdaniem, jak Agent Orchestrator zmieni sposób wdrożenia AI w różnych branżach?

Rozwiązuje trzy krytyczne wyzwania, które dotąd hamowały adopcję i innowacje AI.

Po pierwsze, pozwala firmom na łatwe korzystanie z najnowszych postępów AI. Z Agentem Orchestrator, można natychmiast wykorzystywać najnowsze modele i techniki bez konieczności przebudowywania infrastruktury. To znacząca przewaga konkurencyjna w świecie, w którym innowacje AI rozwijają się w zastraszającym tempie.

Po drugie, umożliwia dynamiczną, per-żądanie optymalizację wyboru modelu AI. Agent Orchestrator może inteligentnie łączyć i dopasowywać modele z ogromnego ekosystemu, aby dostarczyć najlepsze możliwe wyniki dla każdej interakcji użytkownika. Na przykład, AI do obsługi klienta mogłoby wykorzystywać specjalistyczny model dla pytań technicznych i inny dla pytań dotyczących rozliczeń, dostarczając lepsze wyniki dla każdego typu interakcji.

Po trzecie, maksymalizuje wydajność, jednocześnie minimalizując koszty. Agent automatycznie balansuje między uruchamianiem AI na urządzeniu użytkownika a w chmurze, w zależności od tego, co ma największy sens w danym momencie. Gdy prywatność jest ważna, przetwarza dane lokalnie. Gdy potrzebna jest dodatkowa moc obliczeniowa, wykorzystuje chmurę. Wszystko to dzieje się za kulisami, tworząc płynne doświadczenie dla użytkowników, jednocześnie optymalizując zasoby dla firm.

Jakie informacje zwrotne otrzymaliście dotąd od firm biorących udział w prywatnej betzie Agent Orchestrator?

Informacje zwrotne od naszych uczestników prywatnej bety były bardzo pozytywne! Firmy są zachwycone możliwością wyjścia z lock-in infrastrukturalnego, czy to z powodu modeli własnościowych czy usług hostingowych. Możliwość zabezpieczenia każdej decyzji wdrożeniowej okazała się przełomowa, eliminując straszne miesiące przebudowy, gdy podejście ulega zmianie.

Nasze wyniki wydajności NeuroSplit były niczym niezwykłym – nie możemy się doczekać, aby podzielić się tymi danymi publicznie wkrótce. Co jest szczególnie ekscytujące, to fakt, że sam koncept adaptacyjnego wdrożenia AI zdobył wyobraźnię. Fakt, że AI wdraża się samo, brzmi futurystycznie i nie jest czymś, czego się spodziewano teraz, więc już sam postęp technologiczny wzbudza ekscytację i nowe możliwości, które może stworzyć w przyszłości.

Z szybkim postępem w AI generatywnej, jakie widzisz jako największe przeszkody dla infrastruktury AI, i jak Skymel planuje je rozwiązać?

Idziemy ku przyszłości, której większość ludzi jeszcze nie w pełni zrozumiała: nie będzie jednego dominującego modelu AI, ale miliardy z nich. Nawet jeśli stworzymy najpotężniejszy model AI, nadal będziemy potrzebować spersonalizowanych wersji dla każdej osoby na Ziemi, każdej dostosowanej do unikalnych kontekstów, preferencji i potrzeb. To oznacza co najmniej 8 miliardów modeli, bazując na populacji świata.

To oznacza rewolucyjną zmianę od dzisiejszego podejścia “one-size-fits-all”. Przyszłość wymaga inteligentnej infrastruktury, która może obsłużyć miliardy modeli. W Skymel nie tylko rozwiązujemy dzisiejsze wyzwania wdrożeniowe, ale nasza mapa technologiczna już buduje fundamenty dla tego, co nadchodzi.

Jak wyobrażasz sobie ewolucję infrastruktury AI w ciągu najbliższych pięciu lat, i jaką rolę widzisz dla Skymel w tej ewolucji?

Krajobraz infrastruktury AI ulega fundamentalnej przemianie. Podczas gdy dzisiaj koncentrujemy się na skalowaniu ogólnych modeli językowych w chmurze, najbliższe pięć lat zobaczy, jak AI staje się głęboko spersonalizowane i kontekstowo świadome. Nie chodzi tylko o fine-tuning – chodzi o AI, które adaptuje się do konkretnych użytkowników, urządzeń i sytuacji w czasie rzeczywistym.

To stwarza dwa główne wyzwania infrastrukturalne. Po pierwsze, tradycyjne podejście do uruchamiania wszystkiego w scentralizowanych centrach danych staje się niewykonalne zarówno technicznie, jak i ekonomicznie. Po drugie, rosnąca złożoność aplikacji AI oznacza, że potrzebujemy infrastruktury, która może dynamicznie optymalizować się w wielu modelach, urządzeniach i lokalizacjach obliczeniowych.

W Skymel budujemy infrastrukturę, która specjalnie rozwiązuje te wyzwania. Nasza technologia umożliwia AI działać tam, gdzie ma to największy sens – czy to na urządzeniu, na którym generowane są dane, w chmurze, gdzie dostępna jest większa moc obliczeniowa, czy inteligentnie podzielone między nimi. Co więcej, podejmujemy te decyzje w czasie rzeczywistym, w zależności od zmieniających się warunków i wymagań.

W przyszłości aplikacje AI nie będą definiowane przez rozmiar ich modeli lub ilość dostępnego obliczenia. Będą definiowane przez ich zdolność do dostarczania spersonalizowanych, responsywnych doświadczeń, jednocześnie efektywnie zarządzając zasobami. Naszym celem jest uczynienie tego poziomu inteligentnej optymalizacji dostępnym dla każdej aplikacji AI, niezależnie od skali czy złożoności.

Dziękujemy za wspaniały wywiad, czytelnicy, którzy chcą dowiedzieć się więcej, powinni odwiedzić Skymel.

Antoine jest wizjonerskim liderem i współzałożycielem Unite.AI, który jest zmotywowany niezachwianą pasją do kształtowania i promowania przyszłości sztucznej inteligencji i robotyki. Jako serialowy przedsiębiorca, wierzy, że sztuczna inteligencja będzie tak samo przełomowa dla społeczeństwa, jak elektryczność, i często jest złapany na tym, że zachwala potencjał przełomowych technologii i AGI.

Jako futurysta, jest poświęcony badaniu, jak te innowacje ukształtują nasz świat. Ponadto, jest założycielem Securities.io, platformy skupiającej się na inwestowaniu w najnowocześniejsze technologie, które zmieniają przyszłość i przebudowują całe sektory.