Wywiady

Kismat Singh, współzałożyciel i dyrektor generalny MachGen AI – seria wywiadów

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Kismat Singh, współzałożyciel i dyrektor generalny MachGen AI, jest dyrektorem ds. infrastruktury AI i inżynierii z ponad dwudziestoletnim doświadczeniem w budowaniu systemów wysokowydajnych obliczeń i uczenia maszynowego. Przed współzałożeniem MachGen AI, Singh pełnił funkcję wiceprezesa ds. inżynierii w dziale AI Frameworks w firmie Intel oraz wcześniej zajmował stanowiska starszego inżyniera w NVIDIA, AMD, HP i innych firmach technologicznych. Jego praca obejmowała wkład w biblioteki i kompilatory deep learning, optymalizację frameworków AI oraz usprawnienia odporności treningu na skalę hiperinfrastruktury. W Intel był ściśle zaangażowany w inicjatywy PyTorch firmy i publicznie mówił o udostępnianiu frameworków AI na różnych platformach sprzętowych.

MachGen AI jest firmą zajmującą się infrastrukturą AI, skoncentrowaną na znacznie szybszym i bardziej ekonomicznym uruchamianiu generatywnych modeli obrazu i wideo. Założona przez Kismata Singha i Manoja Krishnana, firma opracowuje wysokowydajny stos inferencji i fine‑tuning specjalnie zaprojektowany dla modeli dyfuzyjnych, zamiast adaptować infrastrukturę pierwotnie stworzoną dla dużych modeli językowych. MachGen optymalizuje obszary takie jak obliczenia uwagi, buforowanie, kernele GPU, zarządzanie pamięcią, równoległość, planowanie i wdrażanie, aby zmniejszyć opóźnienie generacji przy zachowaniu jakości modelu. Jej platforma udostępnia API do generacji tekst‑do‑obrazu, obraz‑do‑obrazu, tekst‑do‑wideo, obraz‑do‑wideo oraz odniesienie‑do‑wideo, a podstawowa technologia ma na celu umożliwienie aplikacji o niskim opóźnieniu, takich jak interaktywne tworzenie treści, awatary w czasie rzeczywistym, gry i spersonalizowana reklama.

Spędziłeś ponad dwie dekady pracując nad wideo, obliczeniami GPU i wydajnością AI, w tym nad TensorRT w NVIDIA, oprogramowaniem AI w Intel, optymalizacją GPU w AMD oraz wcześniejszą pracą nad kodowaniem wideo w czasie rzeczywistym. Co zauważyłeś w tych latach, co ostatecznie przekonało Cię do opuszczenia dużych firm technologicznych i współzałożenia MachGen, oraz dlaczego uznałeś, że inferencja dyfuzyjna jest problemem infrastrukturalnym wartym założenia firmy?

Mój współzałożyciel Manoj i ja graliśmy w badmintona w tej samej siłowni przez prawie 10 lat. Przez większą część tego czasu staraliśmy się zatrudnić drugiego. W końcu uznaliśmy, że łatwiej jest współpracować ze sobą niż ciągle się nawzajem rekrutować.

Powodem, dla którego wybraliśmy ten problem, jest to, że obaj obserwowaliśmy, jak stos inferencji dojrzewa od wewnątrz. Pomagałem budować zespół platformy inferencji NVIDIA, a następnie kierowałem oprogramowaniem AI w Intel. Manoj stworzył infrastrukturę treningu dużych modeli stojącą za PyTorch w Meta. Śledziliśmy lata pracy nad buforowaniem, grupowaniem, planowaniem i kernelami, które przekształciły wczesne systemy badawcze LLM w infrastrukturę produkcyjną obsługującą biliony tokenów.

Dyfuzja znajduje się mniej więcej tam, gdzie trzy lata temu była inferencja LLM. Modele obrazu i wideo rozwijały się szybko, ale systemy je obsługujące pozostają wolne, kosztowne i trudne do skalowania. Większość istniejącej infrastruktury została zaprojektowana pod kątem LLM, a dyfuzja została dodana później.

Trzy czynniki sprawiły, że timing był właściwy: modele stały się wystarczająco dobre, aby budować na nich prawdziwe produkty, problem wymagał dokładnie tych umiejętności, które rozwijaliśmy przez całą karierę, a wpływ jest na tyle duży, że można wokół niego zbudować firmę generacyjną. Gdy wideo, które kiedyś zajmowało kilka minut, może być wygenerowane w kilka sekund przy ułamku kosztów, stają się możliwe interaktywne generowanie, spersonalizowana reklama, awatary w czasie rzeczywistym oraz zupełnie nowe produkty kreatywne.

MachGen twierdzi, że wiele technik, które zrewolucjonizowały inferencję dużych modeli językowych, nie przenosi się czysto na modele dyfuzyjne. Co jest zasadniczo innego w obsłudze modeli obrazu i wideo i gdzie znajdują się największe wąskie gardła wydajności, które tradycyjna infrastruktura AI zwykle pomija?

LLM i modele dyfuzyjne mają zasadniczo różne wzorce obliczeniowe. LLM są autoregresywne, z ciężkim obliczeniowo wstępnym wypełnieniem, po którym następuje dekodowanie token po tokenie, ograniczone pamięcią. Techniki takie jak buforowanie KV oraz rozdzielenie wstępnego wypełniania i dekodowania zostały zaprojektowane wokół tej struktury.

Modele dyfuzyjne są nieautoregresywne i pozostają ograniczone obliczeniowo przez cały proces odszumiania. Generowanie wideo obejmuje także duże ilości danych przestrzennych i czasowych, co generuje odmienny popyt na uwagę, pamięć, komunikację i równoległość.

W rezultacie wiele optymalizacji opracowanych dla LLM nie przenosi się czysto. Konwencjonalne buforowanie KV nie rozwiązuje tego samego problemu, standardowa równoległość może wprowadzać znaczny narzut komunikacyjny, a dostępne otwarto‑źródłowe kernele są znacznie mniej dojrzałe. Scheduler, model pamięci, strategia buforowania, kernele i równoległość muszą być projektowane z myślą o samym dyfuzji. Dlatego zbudowaliśmy MachGen, traktując dyfuzję jako obywatela pierwszej klasy.

MachGen informuje o przybliżonym 4–6‑krotnym niższym opóźnieniu w niektórych modelach obrazu oraz około 6‑krotnych ulepszeniach w kilku modelach wideo przy uruchamianiu oryginalnych, nieoddestylowanych modeli. Jakie są najważniejsze przełomy techniczne stojące za tymi zyskami i jak zapewniacie, że poprawa wydajności nie odbywa się kosztem jakości wyjścia?

Zyski pochodzą z współpracy kilku części stosu. Uwaga dominuje w budżecie obliczeniowym wielu modeli wideo, więc koncentrujemy się na przepisach o niższej precyzji, rzadkiej uwadze i powiązanych technikach. Opracowaliśmy także metody buforowania wykorzystujące redundancję przestrzenną i czasową, wysoko zoptymalizowane kernele dla architektur dyfuzji oraz techniki równoległości zmniejszające narzut komunikacji.

Razem te usprawnienia pozwalają MachGen dostarczyć HiDream w jedną sekundę w porównaniu do sześciu sekund oraz Flux w 1,5 sekundy w porównaniu do 6,2 sekundy. W przypadku wideo, Wan 2.2 działa w 16,5 sekundy w porównaniu do 98 sekund, podczas gdy LTX 2.3 działa w 10,7 sekundy w porównaniu do 67 sekund. Koszty inferencji są również 2–4x niższe dla modeli obrazów i 2–3x niższe dla wideo.

Te wyniki wykorzystują oryginalne, nieoddestylowane modele. Ulepszamy sposób działania modeli, nie poświęcając jakości wyjścia. W przypadku wdrożenia produkcyjnego szybkość, koszt i jakość muszą współdziałać.

Trusted TV jest ciekawym przykładem, ponieważ skrócenie generacji z minut do sekund zmienia więcej niż sam rachunek infrastruktury. Gdy generacja wideo stanie się wystarczająco szybka, aby wyprodukować tysiące kampanii i spersonalizowane warianty kreatywne, jakie nowe modele biznesowe lub doświadczenia produktowe staną się możliwe, a które wcześniej nie były opłacalne?

TrustedTV pomaga firmom tworzyć gotowe do emisji telewizyjnie reklamy przy użyciu AI i umieszczać je na platformach TV połączonych, takich jak Prime Video, Roku i DirecTV. Wielu jej klientów to małe przedsiębiorstwa. Tradycyjne tworzenie reklamy telewizyjnej wymagało ekipy filmowej i montażowej, przy kosztach zaczynających się od kilku tysięcy dolarów i zazwyczaj sięgających dziesiątek tysięcy dolarów. Trusted TV obniża to do zera. Właściciel małej firmy może stworzyć pełną reklamę ze smartfona w około pięć minut i zobaczyć ją, zanim zapłaci cokolwiek. Na platformie utworzono ponad 10,000 kampanii.

Ian, dyrektor generalny Trusted TV, zobaczył benchmark opóźnień MachGen na Artificial Analysis i nie uwierzył w wyniki. Zarejestrował się, aby przetestować to samodzielnie. Jego pierwsze renderowanie zwróciło się po około 25 sekundach bez utraty jakości, a gdy przeprowadził testy współbieżności, usprawnienia utrzymały się w skali. Przenieśli cały swój przepływ produkcji do MachGen w mniej niż 48 godzin, a MachGen napędza teraz wszystkie ich nowe tworzenie wideo. W najnowszym wdrożeniu jesteśmy bliżej 10 lub 11 sekund dla tego modelu i będziemy go dalej ulepszać.

Efekt produktu polega na tym, że reklamodawcy przestają tworzyć jedną lub dwie ogólne reklamy. Ich użytkownicy rotują dwie lub trzy nowe reklamy tygodniowo, testują kreacje w różnych segmentach odbiorców i iterują zamiast zobowiązywać się. Następnie pojawia się personalizacja na poziomie geograficznym i odbiorców w skali, która wcześniej była zarezerwowana dla firm z budżetami wielomilionowymi dolarami.

Wersja, o której myślę osobiście: dziś otrzymuję reklamę sneakersów nakręconą na ulicy w Manhattan. Mieszkam w Bay Area, więc nic dla mnie nie znaczy. Chciałbym tę samą reklamę z Mission Peak w tle. To nie jest tańsza reklama; to inny rodzaj reklamy i staje się opłacalna dopiero wtedy, gdy generacja jest wystarczająco szybka i tania, aby stworzyć tysiące wariantów.

Dla firm wbudowujących generowanie obrazów lub wideo bezpośrednio w produkty, jak powinny myśleć o ekonomice inferencji? Przy jakiej skali optymalizacja wykorzystania GPU staje się strategicznie ważna, zamiast po prostu płacenia dostawcy API za każde wygenerowanie?

Punkt zwrotny następuje, gdy inferencja zaczyna wpływać na doświadczenie klienta lub marże firmy.

API o ogólnym przeznaczeniu może mieć sens, gdy zespół weryfikuje produkt. Gdy generacja staje się centralna dla tego produktu, zespoły muszą patrzeć poza podaną cenę za wynik. Opóźnienie, współbieżność, jakość, niezawodność i wykorzystanie GPU stają się częścią ekonomiki.

Generacja może wydawać się tania, ale wciąż stwarza problem biznesowy, jeśli użytkownicy muszą czekać kilka minut i porzucają proces. Architektura, która wymaga, aby pojemność GPU rosła w tym samym tempie co zużycie, będzie również wywierać rosnącą presję na marże.

Nie ma jednego progu liczby żądań, ponieważ moc obliczeniowa wymagana dla krótkiego klipu 540p jest bardzo różna od dłuższego wideo 1080p. Optymalizacja staje się strategiczna, gdy rosnące użycie powoduje, że koszty rosną prawie w tym samym tempie, szczytowe zapotrzebowanie tworzy kolejki lub opóźnienie zaczyna ograniczać doświadczenie produktu.

MachGen działa na kilku warstwach, w tym własnych kernelech GPU, buforowaniu, optymalizacji precyzji, planowaniu i równoległości. Ponieważ modele rozwijają się szybko, która warstwa stosu inferencji, według Ciebie, oferuje największą pozostałą szansę na dramatyczne usprawnienia w szybkości i kosztach?

W generacji wideo uwaga stanowi jedną z największych pozostałych szans, ponieważ dominuje budżet obliczeniowy w wielu modelach. Wciąż istnieje duży potencjał do ulepszenia przepisów o niższej precyzji, rzadkiej uwagi oraz kernele uwagi specyficzne dla dyfuzji.

Uwaga to tylko jedna część szansy. Największe ogólne zyski będą wynikały z łączenia usprawnień w całym stosie. Buforowanie jest jednym z przykładów. Techniki buforowania KV stosowane w LLM nie przenoszą się bezpośrednio, ale modele dyfuzyjne zawierają redundancję przestrzenną i czasową, którą można wykorzystać odpowiednim podejściem.

Równoległość stanowi kolejną szansę. Dodanie GPU nie powoduje automatycznie proporcjonalnego przyspieszenia, ponieważ narzut komunikacji może zniwelować korzyść. Opracowujemy dostosowane kernele, które nakładają komunikację na obliczenia niezależne od danych i łączą je w potok z pracą zależną od danych.

Uwaga, buforowanie, kernele, równoległość, pamięć i planowanie wpływają na siebie nawzajem. Optymalizacja tylko jednej warstwy ostatecznie tworzy wąskie gardło gdzie indziej. Największe usprawnienia przyjdą z traktowania stosu jako kompletnego systemu zaprojektowanego pod profil obliczeniowy dyfuzji.

Wraz z nowszymi modelami wideo skracającymi czasy generacji w stronę czasu rzeczywistego, jak blisko jesteśmy naprawdę interaktywnego generatywnego wideo i jakie bariery techniczne wciąż trzeba pokonać, zanim generowanie wideo w czasie rzeczywistym stanie się powszechne?

Już osiągamy prędkości interaktywne w niektórych zastosowaniach. MachGen generuje pięciosekundowe wideo Vidu Q3 Turbo w rozdzielczości 720p w około sześć sekund, a w 540p w niecałe trzy sekundy. To wystarczająco szybkie dla szybkiej iteracji kreatywnej i sprawia, że responsywne awatary oraz interaktywne wideo są w zasięgu ręki.

Przykład tego, co według mnie oznacza interaktywność. Wyobraź sobie, że oglądasz opowieść i widzisz, dokąd zmierza zakończenie, a nie podoba ci się to. Zamiast siedzieć biernie, przekierowujesz ją: dwie postacie powinny dowiedzieć się, co ukrywa trzecia, i skonfrontować się z nią, zamiast pozwolić, by wszystko potoczyło się samo. Treść, którą sterujesz, zamiast treści, którą otrzymujesz. To właśnie szybka, tania generacja umożliwia i zmienia prawie wszystko, co konsumujemy.

Dotarcie do tego zazwyczaj wymaga więcej niż jednego solidnego benchmarku opóźnień. Całe doświadczenie musi pozostawać responsywne przy ruchu produkcyjnym, zachowując jakość wizualną, spójność klatek oraz przewidywalny koszt. Dłuższe filmy, wyższe rozdzielczości i równoczesne żądania zwiększają obciążenie infrastruktury, a system nadal musi przydzielać pojemność, kierować żądania i odzyskiwać po awariach sprzętu, nie dając tego odczuć użytkownikowi.

Pojawi się przypadek po przypadku. Krótkie klipy, awatary, gry i narzędzia kreatywne prawdopodobnie będą pierwsze, ponieważ generowanie mierzone w sekundach jest już dla nich wystarczające. W miarę jak jakość modeli i wydajność inferencji będą się jednocześnie poprawiać, kolejne zastosowania przekroczą ten próg.

W miarę jak agenci AI coraz częściej generują obrazy i wideo autonomicznie, zamiast czekać, aż człowiek naciśnie przycisk, jak to zmienia wymagania infrastrukturalne? Czy obciążenia napędzane przez agentów generują zasadniczo inne wymagania dotyczące opóźnień, współbieżności, kosztów i niezawodności?

Agent przekształca pojedyncze żądanie użytkownika w dziesiątki lub setki zadań generacji. Tworzy kilka opcji, ocenia je, modyfikuje prompt i powtarza proces, bez udziału człowieka pomiędzy krokami.

To sprawia, że opóźnienia, współbieżność, koszty i niezawodność stają się znacznie ważniejsze. Jeśli każda generacja trwa minuty, przepływ pracy agenta jest zbyt wolny, by był użyteczny. Jeśli każdy próbny proces jest kosztowny, autonomiczna iteracja staje się ekonomicznie niepraktyczna. System musi także radzić sobie z wieloma równoczesnymi żądaniami w sposób niezawodny, ponieważ jedna awaria może przerwać cały łańcuch prac.

Tutaj istotne są takie możliwości jak przydzielanie GPU, autoskalowanie i routing, równie ważne jak optymalizacja na poziomie modelu. Zapotrzebowanie agentów jest znacznie bardziej pulsujące niż zapotrzebowanie z kreatywnej aplikacji, w której użytkownik klika przycisk.

Odpowiednią jednostką pracy nie jest już pojedynczy obraz czy wideo. To pełna pętla generowania, oceny i udoskonalania treści. Infrastruktura musi uczynić tę całą pętlę szybką, przystępną cenowo i niezawodną.

Między dostawcami GPU, chmurami inferencyjnymi, twórcami modeli i platformami optymalizacyjnymi panuje intensywna konkurencja. Gdy sam sprzęt staje się szybszy, dlaczego firmy nadal będą potrzebować specjalistycznej warstwy inferencyjnej takiej jak MachGen, zamiast polegać na ulepszeniach od NVIDIA, AMD, dostawców chmur czy samych twórców modeli?

Szybszy sprzęt podnosi pułap. Oprogramowanie decyduje, jak duża część tego pułapu zostanie osiągnięta.

Zaobserwowaliśmy to na przykładzie LLM‑ów. Nowe akceleratory zwiększały surową wydajność w każdej generacji, a ciągłe batchowanie, zarządzanie KV‑cache, spekulacyjne dekodowanie i specjalistyczne kernele wciąż były tym, co doprowadziło branżę do przepustowości i ekonomiki na poziomie produkcyjnym. Żadne z tego nie pochodziło od sprzętu.

Ciągła optymalizacja pełnej ścieżki produkcyjnej generowania obrazów i wideo to inna praca niż to, co robią producenci sprzętu, dostawcy chmur i twórcy modeli, i nie jest kluczowym priorytetem żadnego z nich.

Istnieje kilka podejść do tego zadania. Jednym jest model marketplace, w którym modele są agregowane i kierują żądania. Nie uważamy, że jest to obronne w dłuższej perspektywie, ponieważ nie ma kontroli nad warstwą, w której znajduje się wydajność. Wybraliśmy budowę stosu we własnym zakresie i natywne hostowanie, co jest jedynym sposobem na osiągnięcie obserwowanych przez nas opóźnień i kosztów.

Oznacza to dostrajanie uwagi, buforowanie, jąder, precyzji, pamięci i równoległości dla każdego modelu i każdego akceleratora oraz wsparcie zarządzanych interfejsów API, dedykowanej chmury i wdrożeń samodzielnie hostowanych. W miarę jak rośnie liczba modeli i opcji sprzętowych, rośnie również złożoność. Naszą rolą jest przejęcie tego, aby nasi klienci mogli poświęcić swój czas na to, co wyróżnia ich produkty.

Opisałeś modele świata jako część długoterminowej wizji MachGen, przy czym wiele ich cech obliczeniowych przypomina obciążenia dyfuzyjne. Jak powinna wyglądać infrastruktura dla modeli świata w skali produkcyjnej i jakie zastosowania staną się możliwe, jeśli generowanie i symulowanie środowisk wizualnych ostatecznie stanie się tak tanie i responsywne, jak dzisiaj generowanie tekstu?

Jednym ze sposobów myślenia o naszej platformie jest porównanie jej do ogólnego modelu językowego (LLM). Ten sam model tworzy projekt umowy prawnej i odpowiada na pytanie o restauracje. Dla nas ta sama warstwa obsługuje firmy tworzące awatary wideo, reklamę AI, generowanie opowieści i mikrodram oraz w przyszłości modele świata. Różne branże, jeden zestaw podstawowych problemów wydajnościowych.

Modele świata nie są dziś naszym głównym biznesem, ale są tym, do czego dążymy, i aktywnie nad nimi pracujemy. Modele świata w skali produkcyjnej będą wymagały bardzo wysokiej przepustowości i bardzo niskiej latencji, ponieważ ciągle generują i aktualizują środowisko, a nie produkują jednorazowy wynik. Potrzebują także spójności przestrzennej i czasowej, zdolności reagowania na działania oraz często możliwości symulacji wielu potencjalnych wyników jednocześnie. To generuje trudne problemy z pamięcią, przepływem danych, równoległością i niezawodnością. Model świata sterujący robotem lub grą nie może zajmować minut na wygenerowanie kolejnego stanu. Wydajność decyduje o tym, czy te systemy są w ogóle użyteczne.

Obliczeniowo współczesne modele świata bardzo przypominają modele dyfuzyjne, więc warstwa, którą obecnie budujemy, jest naturalną podstawą. Nie istnieje jeszcze dojrzała warstwa serwowania w skali produkcyjnej dla nich, porównywalna z tym, co istnieje dla LLM‑ów. Zamierzamy ją stworzyć.

Jeśli symulacja stanie się tak responsywna i przystępna cenowo, jak generowanie tekstu dzisiaj, roboty będą mogły przećwiczyć rzadkie sytuacje przed ich napotkaniem, gry będą mogły generować środowiska reagujące na poszczególnych graczy, a projektanci będą mogli przetestować dziesiątki możliwości przed realizacją w świecie rzeczywistym. Dyfuzja to obszar, w którym dziś zarabiamy. Modele świata są naszą gwiazdą północną.

Dziękujemy za wspaniały wywiad, czytelnicy, którzy chcą dowiedzieć się więcej, powinni odwiedzić MachGen AI.

Antoine jest wizjonerskim liderem i współzałożycielem Unite.AI, który jest zmotywowany niezachwianą pasją do kształtowania i promowania przyszłości sztucznej inteligencji i robotyki. Jako serialowy przedsiębiorca, wierzy, że sztuczna inteligencja będzie tak samo przełomowa dla społeczeństwa, jak elektryczność, i często jest złapany na tym, że zachwala potencjał przełomowych technologii i AGI.

Jako futurysta, jest poświęcony badaniu, jak te innowacje ukształtują nasz świat. Ponadto, jest założycielem Securities.io, platformy skupiającej się na inwestowaniu w najnowocześniejsze technologie, które zmieniają przyszłość i przebudowują całe sektory.