Wywiady

Saurabh Vij, CEO i współzałożyciel MonsterAPI – seria wywiadów

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Saurabh Vij jest CEO i współzałożycielem MonsterAPI. Przedtem pracował jako fizyk cząstek elementarnych w CERN i rozpoznał potencjał obliczeń rozproszonych w projektach takich jak LHC@home.

MonsterAPI wykorzystuje tańsze, komutowane GPU z kopalni kryptowalut do mniejszych, bezczynnych centrów danych, aby zapewnić skalowalną, przystępną infrastrukturę GPU dla uczenia maszynowego, pozwalając deweloperom uzyskać dostęp, dostrajać i wdrożyć modele AI przy znacznie zmniejszonych kosztach, bez konieczności pisania jednej linii kodu.

Przed MonsterAPI, prowadził dwie firmy, w tym jedną, która opracowała noszony urządzenie bezpieczeństwa dla kobiet w Indiach, we współpracy z Rządem Indii i IIT Delhi.

Czy możesz podzielić się historią powstania MonsterGPT?

Nasza misja zawsze brzmiała “pomóc deweloperom w dostrajaniu i wdrażaniu modeli AI w jak najłatwiejszy sposób”. Zrealizowaliśmy, że istnieją wiele złożonych wyzwań, z którymi spotykają się, gdy chcą dostrajać i wdrażać model AI.

Od radzenia sobie z kodem do konfigurowania kontenerów Docker na GPU i skalowania ich na żądanie

I tempa, w jakim rozwija się ekosystem, po prostu dostrajanie nie jest wystarczające. Musi być wykonane w odpowiedni sposób: unikając niedodopasowania, nadmiernego dopasowania, optymalizacji hiperparametrów, wdrażania najnowszych metod, takich jak LORA i Q-LORA, aby wykonywać szybsze i bardziej ekonomiczne dostrajanie. Po dostrajaniu model musi być wdrożony wydajnie.

Spowodowało to, że zrozumieliśmy, iż oferowanie tylko narzędzia dla małej części potoku nie jest wystarczające. Deweloper potrzebuje całego zoptymalizowanego potoku, połączonego z wielkim interfejsem, z którym jest zaznajomiony. Od dostrajania do oceny i ostatecznego wdrożenia swoich modeli.

Zadałem sobie pytanie: Jako były fizyk cząstek elementarnych, rozumiem głęboki wpływ, jaki AI może mieć na pracę naukową, ale nie wiem, gdzie zacząć. Mam innowacyjne pomysły, ale brakuje mi czasu, aby nauczyć się wszystkich umiejętności i niuansów uczenia maszynowego i infrastruktury.

Co, gdybym mógł po prostu porozmawiać z AI, dostarczyć mu swoje wymagania i mieć go zbudować cały potok dla mnie, dostarczając wymagany punkt końcowy API?

To doprowadziło do pomysłu stworzenia systemu opartego na czacie, który pomoże deweloperom w dostrajaniu i wdrażaniu bez wysiłku.

MonsterGPT jest naszym pierwszym krokiem w tej podróży.

Istnieją miliony deweloperów, innowatorów i naukowców jak my, którzy mogliby wykorzystać ten podejście, aby zbudować więcej modeli specyficznych dla ich projektów.

Czy możesz wyjaśnić podstawową technologię za agentem wdrożeniowym Monster API opartym na GPT?

MonsterGPT wykorzystuje zaawansowane technologie, aby wydajnie wdrożyć i dostrajać otwarte modele językowe (LLM) takie jak Phi3 od Microsoftu i Llama 3 od Meta.

  1. RAG z konfiguracją kontekstową: Automatycznie przygotowuje konfiguracje z odpowiednimi hiperparametrami do dostrajania LLM lub wdrażania modeli przy użyciu skalowalnych interfejsów API z MonsterAPI.
  2. LoRA (niskiej rangi adaptacja): Umożliwia wydajne dostrajanie, aktualizując tylko podzbiór parametrów, zmniejszając obciążenie obliczeniowe i wymagania pamięciowe.
  3. Techniki kwantyzacji: Wykorzystuje GPT-Q i AWQ, aby zoptymalizować wydajność modelu, zmniejszając precyzję, co obniża ślad pamięci i przyspiesza inferencję bez znaczącej utraty dokładności.
  4. Silnik vLLM: Zapewnia wysokowydajne obsługę LLM z funkcjami takimi jak ciągłe grupowanie, zoptymalizowane jądra CUDA i algorytmy dekodowania równoległego do efektywnej dużej skali inferencji.
  5. Decentralized GPUs for scale and affordability: Our fine-tuning and deployment workloads run on a network of low-cost GPUs from multiple vendors from smaller data centres to emerging GPU clouds like coreweave for, providing lower costs, high optionality and availability of GPUs to ensure scalable and efficient processing.

Zobacz najnowszy blog o wdrożeniu Llama 3 przy użyciu MonsterGPT:

Jak to upraszcza proces dostrajania i wdrażania?

MonsterGPT zapewnia interfejs czatu z możliwością zrozumienia poleceń w języku naturalnym do uruchamiania, śledzenia i zarządzania pełnymi zadaniami dostrajania i wdrażania. Ta zdolność abstrahuje wiele złożonych kroków, takich jak:

  • Budowanie potoku danych
  • Wyszukiwanie odpowiedniej infrastruktury GPU dla zadania
  • Konfigurowanie odpowiednich hiperparametrów
  • Konfigurowanie środowiska ML z kompatybilnymi frameworkami i bibliotekami
  • Wdrażanie skryptów dostrajania dla LoRA/QLoRA do wydajnego dostrajania z strategiami kwantyzacji.
  • Rozwiązywanie problemów, takich jak brak pamięci i błędy na poziomie kodu.
  • Projektowanie i wdrażanie wielowęzłowego automatycznego skalowania z wysokowydajnymi silnikami obsługi, takimi jak vLLM dla wdrożeń LLM.

Jaki rodzaj interfejsu użytkownika i poleceń mogą spodziewać się deweloperzy podczas interakcji z interfejsem czatu Monster API?

Interfejs użytkownika to prosty interfejs czatu, w którym użytkownicy mogą nakazać agentowi dostrajać LLM do określonego zadania, takiego jak podsumowanie, uzupełnienie czatu, generowanie kodu, pisanie bloga itp., a następnie, po dostrajaniu, GPT może być dalej nakazany wdrożyć LLM i zapytać wdrożony model z interfejsu GPT. Przykłady poleceń obejmują:

  • Dostrajanie LLM do generowania kodu na zestawie X
  • Chcę model dostrajany do pisania bloga
  • Daj mi punkt końcowy API dla modelu Llama 3.
  • Wdrożenie małego modelu do przypadku użycia pisania bloga

Jest to niezwykle przydatne, ponieważ znalezienie odpowiedniego modelu dla projektu może być czasochłonne. Z nowymi modelami pojawiającymi się codziennie, może to prowadzić do wielu wątpliwości.

Jak rozwiązanie Monster API porównuje się pod względem użyteczności i wydajności do tradycyjnych metod wdrażania modeli AI?

Rozwiązanie Monster API znacznie zwiększa użyteczność i wydajność w porównaniu z tradycyjnymi metodami wdrażania modeli AI.

Dla użyteczności:

  1. Automatyczna konfiguracja: Tradycyjne metody często wymagają obszernego ręcznego ustawienia hiperparametrów i konfiguracji, co może być czasochłonne i podatne na błędy. MonsterAPI automatyzuje ten proces przy użyciu RAG z kontekstem, upraszczając ustawienie i zmniejszając prawdopodobieństwo błędów.
  2. Skalowalne interfejsy API: MonsterAPI zapewnia intuicyjne interfejsy API do wdrażania i dostrajania modeli, co sprawia, że jest on dostępny nawet dla użytkowników z ograniczoną wiedzą na temat uczenia maszynowego. Tradycyjne metody często wymagają głębokiej wiedzy technicznej i złożonego kodowania do wdrożenia.
  3. Zintegrowana platforma: Zintegruje cały potok pracy, od dostrajania do wdrożenia, w ramach jednej platformy. Tradycyjne podejścia mogą obejmować rozproszone narzędzia i platformy, co prowadzi do nieefektywności i wyzwań integracyjnych.

Dla wydajności:

MonsterAPI oferuje uproszczony potok dostrajania LoRA z wbudowaną kwantyzacją do efektywnej wykorzystania pamięci i silnika vLLM do osiągania wysokiej wydajności z ciągłym grupowaniem i zoptymalizowanymi jądrami CUDA, na szczycie taniej, skalowalnej i wysoko dostępnej chmury GPU z uproszczonym monitorowaniem i logowaniem.

Cały ten potok zwiększa produktywność deweloperów, umożliwiając tworzenie aplikacji LLM o jakości produkcyjnej, przy jednoczesnym zmniejszeniu potrzeby złożonych umiejętności technicznych.

Czy możesz podać przykłady przypadków użycia, w których Monster API znacznie zmniejszył czas i zasoby potrzebne do wdrożenia modelu?

Firma konsultingowa IT musiała dostrajać i wdrożyć model Llama 3, aby spełnić potrzeby biznesowe swojego klienta. Bez MonsterAPI wymagałoby to zespołu 2-3 inżynierów MLOps z głęboką wiedzą na temat dostrajania hiperparametrów, aby poprawić jakość modelu na podanym zestawie danych, a następnie hostować dostrajany model jako skalowalny punkt końcowy interfejsu API przy użyciu automatycznego skalowania i orchestracji, prawdopodobnie na Kubernetes. Dodatkowo, aby zoptymalizować ekonomię obsługi modelu, chcieli wykorzystać ramy takie jak LoRA do dostrajania i vLLM do obsługi modelu, aby poprawić metryki kosztów, zmniejszając jednocześnie zużycie pamięci. Może to być złożone wyzwanie dla wielu deweloperów i może zająć tygodnie lub nawet miesiące, aby osiągnąć rozwiązanie gotowe do produkcji. Z MonsterAPI byli w stanie eksperymentować z wieloma uruchomieniami dostrajania w ciągu dnia i hostować dostrajany model z najlepszym wynikiem oceny w ciągu kilku godzin, bez konieczności angażowania wielu zasobów inżynieryjnych z głęboką wiedzą na temat MLOps.

Jak podejście Monster API demokratyzuje dostęp do modeli AI generatywnych dla mniejszych deweloperów i startupów?

Mniejsi deweloperzy i startupy często mają trudności z produkcją i wykorzystaniem wysokiej jakości modeli AI z powodu braku kapitału i umiejętności technicznych. Nasze rozwiązania umożliwiają im obniżenie kosztów, uproszczenie procesów i zapewnienie solidnych narzędzi no-code/low-code do wdrażania potoków AI gotowych do produkcji.

Wykorzystując naszą decentralizowaną chmurę GPU, oferujemy tanie i skalowalne zasoby GPU, znacznie zmniejszając barierę kosztową dla wdrożenia modelu o wysokiej wydajności. Zautomatyzowana konfiguracja i dostrajanie hiperparametrów upraszczają proces, eliminując potrzebę głębokiej wiedzy technicznej.

Nasze przyjazne interfejsy API i zintegrowany potok pracy łączą dostrajanie i wdrożenie w jeden, spójny proces, czyniąc zaawansowane technologie AI dostępnymi nawet dla tych z ograniczoną wiedzą. Dodatkowo, wykorzystanie efektywnego dostrajania LoRA i technik kwantyzacji, takich jak GPT-Q i AWQ, zapewnia optymalną wydajność na mniej kosztownym sprzęcie, co jeszcze bardziej obniża koszty wejścia.

To podejście umożliwia mniejszym deweloperom i startupom efektywne wdrażanie i zarządzanie zaawansowanymi modelami AI generatywnymi.

Co widzisz jako następny główny postęp lub funkcję, którą Monster API przyniesie społeczności deweloperów AI?

Pracujemy nad kilkoma innowacyjnymi produktami, aby dalej rozwijać naszą tezę: Pomóc deweloperom dostosowywać i wdrażać modele szybciej, łatwiej i w najbardziej ekonomiczny sposób.

Natychmiastowy następny to pełny asystent MLOps AI, który prowadzi badania nad nowymi strategiami optymalizacji dla LLMOps i integruje je z istniejącymi potokami pracy, aby zmniejszyć wysiłek deweloperów przy tworzeniu nowych i lepszych modeli, a także umożliwić pełną dostosowalność i wdrożenie potoków LLM gotowych do produkcji.

Powiedzmy, że musisz wygenerować 1 milion obrazów na minutę dla swojego przypadku użycia. Może to być niezwykle kosztowne. Tradycyjnie, użyłbyś modelu Stable Diffusion i spędziłbyś godziny, szukając i testując ramy optymalizacyjne, takie jak TensorRT, aby poprawić przepływność bez kompromisowania jakości i opóźnienia wyjścia.

Jednak z agentem MLOps MonsterAPI nie będziesz musiał marnować tych zasobów. Agent znajdzie najlepszą ramę dla Twoich wymagań, wykorzystując optymalizacje, takie jak TensorRT, dostosowane do Twojego konkretnego przypadku użycia.

Jak Monster API planuje kontynuować wspieranie i integrowanie nowych modeli open-source, które pojawiają się?

W 3 głównych sposobach:

  1. Przynieść dostęp do najnowszych modeli open-source
  2. Zapewnić najprostszy interfejs do dostrajania i wdrożenia
  3. Optymalizować cały stos do prędkości i kosztów z najbardziej zaawansowanymi i potężnymi frameworkami i bibliotekami

Nasza misja polega na pomocy deweloperom wszystkich poziomów umiejętności w przyjęciu Gen AI szybciej, zmniejszając czas od pomysłu do dobrze wykończonego i skalowalnego punktu końcowego API.

Będziemy kontynuować nasze starania, aby zapewnić dostęp do najnowszych i najpotężniejszych frameworków i bibliotek, zintegrowanych z bezproblemowym potokiem pracy do wdrażania end-to-end LLMOps. Jesteśmy poświęceni zmniejszaniu złożoności dla deweloperów z naszymi narzędziami no-code, zwiększając tym samym ich produktywność w tworzeniu i wdrażaniu modeli AI.

Aby to osiągnąć, będziemy nieustannie wspierać i integrować nowe modele open-source, ramy optymalizacyjne i biblioteki, monitorując postępy w społeczności AI. Utrzymujemy skalowalną decentralizowaną chmurę GPU i aktywnie angażujemy się z deweloperami w celu wczesnego dostępu i informacji zwrotnej. Wykorzystując zautomatyzowane potoki do bezproblemowej integracji, ulepszając elastyczne interfejsy API i tworząc strategiczne partnerstwa z organizacjami badawczymi AI, zapewniamy, że nasza platforma pozostaje na najwyższym poziomie.

Ponadto zapewniamy kompleksową dokumentację i solidne wsparcie techniczne, umożliwiając deweloperom szybkie przyjęcie i wykorzystanie najnowszych modeli. MonsterAPI utrzymuje deweloperów na czele technologii AI generatywnej, umożliwiając im innowacje i sukces.

Jakie są długoterminowe cele Monster API pod względem rozwoju technologicznego i zasięgu rynkowego?

Długoterminowo, chcemy pomóc 30 milionom inżynierów oprogramowania stać się deweloperami MLOps z pomocą naszego agenta MLOps i wszystkich narzędzi, które budujemy.

To wymagałoby od nas budowy nie tylko pełnoprawnego agenta, ale także wielu podstawowych, własnych technologii wokół frameworków optymalizacyjnych, metod konteneryzacji i orchestracji.

Wierzymy, że połączenie wielkich, prostych interfejsów, 10-krotnie większej wydajności i tanich, decentralizowanych GPU ma potencjał przekształcić produktywność deweloperów i przyspieszyć przyjęcie Gen AI.

Wszystkie nasze badania i starania są skierowane w tym kierunku.

Dziękujemy za wspaniały wywiad, czytelnicy, którzy chcą dowiedzieć się więcej, powinni odwiedzić MonsterAPI.

Antoine jest wizjonerskim liderem i współzałożycielem Unite.AI, który jest zmotywowany niezachwianą pasją do kształtowania i promowania przyszłości sztucznej inteligencji i robotyki. Jako serialowy przedsiębiorca, wierzy, że sztuczna inteligencja będzie tak samo przełomowa dla społeczeństwa, jak elektryczność, i często jest złapany na tym, że zachwala potencjał przełomowych technologii i AGI.

Jako futurysta, jest poświęcony badaniu, jak te innowacje ukształtują nasz świat. Ponadto, jest założycielem Securities.io, platformy skupiającej się na inwestowaniu w najnowocześniejsze technologie, które zmieniają przyszłość i przebudowują całe sektory.