Rozhovory

Kismat Singh, spoluzakladatel a generální ředitel MachGen AI – série rozhovorů

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Kismat Singh, spoluzakladatel a generální ředitel MachGen AI, je výkonný ředitel v oblasti AI infrastruktury a inženýrství s více než dvacetiletou zkušeností se stavbou výkonných výpočetních a strojového učení systémů. Před založením MachGen AI působil Singh jako viceprezident inženýrství pro AI frameworky ve společnosti Intel a dříve zastával seniorní inženýrské pozice ve společnostech NVIDIA, AMD, HP a dalších technologických firmách. Jeho práce zahrnovala příspěvky do knihoven a kompilátorů pro hluboké učení, optimalizaci AI frameworků a zlepšení odolnosti tréninku ve velkém měřítku. V Intel byl úzce zapojen do iniciativ společnosti v oblasti PyTorch a veřejně hovořil o tom, jak učinit AI frameworky přístupnějšími napříč různými hardwarovými platformami.

MachGen AI je společnost zabývající se AI infrastrukturou, která se zaměřuje na to, aby generativní modely obrázků a videí byly výrazně rychlejší a ekonomičtější. Společnost založili Kismat Singh a Manoj Krishnan a vyvíjí vysoce výkonný stack pro inference a fine-tuning, který je speciálně navržen pro difuzní modely, místo aby přizpůsoboval infrastrukturu původně vytvořenou pro velké jazykové modely. MachGen optimalizuje oblasti jako výpočet pozornosti, cachování, GPU jádra, správa paměti, paralelizace, plánování a nasazení, aby snížil latenci generování a zároveň zachoval kvalitu modelu. Jeho platforma poskytuje API pro text‑na‑obrázek, obrázek‑na‑obrázek, text‑na‑video, obrázek‑na‑video a reference‑na‑video, přičemž základní technologie je zaměřena na umožnění aplikací s nízkou latencí, jako je interaktivní tvorba obsahu, real‑time avatary, hraní her a personalizovaná reklama.

Pracoval jste více než dvě desetiletí na videu, GPU výpočtech a výkonu AI, včetně TensorRT ve společnosti NVIDIA, AI softwaru v Intelu, optimalizace GPU v AMD a dřívější práce na real‑time video kódování. Co jste během těch let viděl, co vás nakonec přesvědčilo opustit velké technologické společnosti a spoluzakládat MachGen, a proč jste věřil, že inference difúze je infrastrukturní problém, který stojí za založení firmy?

Můj spoluzakladatel Manoj a já jsme hráli badminton ve stejném tělocvičně téměř 10 let. Většinu té doby jsme se snažili najímat toho druhého. Nakonec jsme usoudili, že je snazší spolupracovat než neustále se navzájem najímat.

Důvod, proč jsme si vybrali tento problém, je ten, že jsme oba sledovali, jak se inference stack vyvíjí zevnitř. Pomáhal jsem budovat tým pro inference platformu ve společnosti NVIDIA a poté vedl AI software v Intelu. Manoj postavil infrastrukturu pro trénink velkých modelů za PyTorch v Meta. Viděli jsme, jak roky práce na kešování, dávkování, plánování a jádrech proměňují rané výzkumné systémy LLM na produkční infrastrukturu obsluhující biliony tokenů.

Difúze je zhruba tam, kde byla inference LLM před třemi lety. Modely pro obrázky a videa se rychle vyvíjejí, ale systémy, které je obsluhují, zůstávají pomalé, drahé a obtížně škálovatelné. Většina existující infrastruktury byla navržena pro LLM, přičemž difúze byla přidána později.

Tři faktory, které načasování učinily správným: modely se staly dostatečně dobrými pro tvorbu skutečných produktů, problém vyžadoval přesně dovednosti, které jsme během kariéry rozvíjeli, a dopad je natolik velký, že lze postavit generaci společnosti. Když se video, které dříve trvalo několik minut, dokáže vygenerovat během několika sekund za zlomek nákladů, stává se možnou interaktivní tvorba, personalizovaná reklama, real‑time avatary a zcela nové kreativní produkty.

MachGen tvrdí, že mnoho technik, které transformovaly inference velkých jazykových modelů, se na difúzní modely nepřevádí čistě. Co je zásadně odlišné na obsluze modelů pro obrázky a videa a kde jsou největší úzká místa výkonu, která konvenční AI infrastruktura často přehlíží?

LLM a difúzní modely mají zásadně odlišné výpočetní vzory. LLM jsou autoregresivní, s výpočetně náročným předvyplněním následovaným paměťově omezeným dekódováním token po tokenu. Techniky jako KV kešování a rozdělení předvyplnění/dekódování byly navrženy právě pro tuto strukturu.

Difúzní modely jsou ne‑autoregresivní a zůstávají výpočetně náročné po celou dobu procesu odšumování. Generování videa také zahrnuje velké množství prostorových a časových dat, což vytváří odlišné požadavky na pozornost, paměť, komunikaci a paralelismus.

Výsledkem je, že mnoho optimalizací vyvinutých pro LLM se nepřevádí čistě. Konvenční KV kešování neřeší stejný problém, standardní paralelismus může zavádět značné komunikační zatížení a dostupná open‑source jádra jsou mnohem méně vyspělá. Plánovač, model paměti, strategie kešování, jádra a paralelismus musí být navrženy kolem samotné difúze. Proto jsme postavili MachGen s difúzí jako první třídou občana.

MachGen uvádí přibližně 4–6× nižší latenci u některých modelů pro obrázky a kolem 6× zlepšení u několika modelů pro video při běhu originálních, nedistilovaných modelů. Jaké jsou nejdůležitější technické průlomy stojící za těmito zisky a jak zajišťujete, aby zlepšení výkonu nepřišlo na úkor kvality výstupu?

Zisky pocházejí z několika částí stacku, které spolupracují. Pozornost dominuje výpočetnímu rozpočtu v mnoha video modelech, takže se zaměřujeme na nízkopřesné recepty, řídkou pozornost a související techniky. Také jsme vyvinuli metody cachování, které využívají prostorovou a časovou redundanci, vysoce optimalizované kernely pro difúzní architektury a techniky paralelismu, které snižují komunikační režii.

Díky těmto vylepšením dokáže MachGen dodat HiDream během jedné sekundy oproti šesti sekundám a Flux během 1,5 sekundy oproti 6,2 sekundy. U videa běží Wan 2.2 za 16,5 sekundy oproti 98 sekundám, zatímco LTX 2.3 za 10,7 sekundy oproti 67 sekundám. Náklady na inferenci jsou také 2–4‑krát nižší u modelů pro obrázky a 2–3‑krát nižší u videa.

Tyto výsledky používají originální, nedestilované modely. Zlepšujeme způsob, jakým modely běží, aniž bychom snižovali kvalitu výstupu. Pro nasazení do produkce musí rychlost, náklady i kvalita spolupracovat.

Trusted TV je zajímavý příklad, protože snížení generování z minut na sekundy mění více než jen rozpočet na infrastrukturu. Jakmile se generování videa stane dostatečně rychlé na vytvoření tisíců kampaní a personalizovaných kreativních variant, jaké nové obchodní modely nebo produktové zážitky se stanou možnými, které předtím nebyly realizovatelné?

TrustedTV pomáhá firmám vytvářet televizní reklamy připravené k vysílání pomocí AI a umisťovat je na platformy propojené televize jako Prime Video, Roku a DirecTV. Mnoho jejích zákazníků jsou malé podniky. Vytvoření televizní reklamy tradičním způsobem vyžadovalo filmový a střihový tým, s náklady začínajícími v řádu tisíců a obvykle se vyšplhajícími do desítek tisíc dolarů. Trusted TV to snižuje na nulu. Majitel malé firmy může vytvořit kompletní reklamu ze smartphonu za přibližně pět minut a vidět ji, aniž by něco zaplatil. Na platformě bylo vytvořeno více než 10 000 kampaní.

Ian, CEO společnosti Trusted TV, viděl benchmark latence MachGen na Artificial Analysis a nevěřil tomu. Přihlásil se, aby to otestoval sám. Jeho první render se vrátil za přibližně 25 sekund bez ztráty kvality a když provedl testy souběžnosti, vylepšení se udržela i při velkém měřítku. Přesunuli celý svůj produkční workflow na MachGen během méně než 48 hodin a MachGen nyní pohání veškerou jejich novou tvorbu videí. V posledním nasazení se blížíme k 10 nebo 11 sekundám u tohoto modelu a budeme jej nadále vylepšovat.

Efekt produktu je, že inzerenti přestávají vytvářet jednu nebo dvě obecné reklamy. Jejich uživatelé střídají dva nebo tři nové spoty týdně, testují kreativitu napříč různými segmenty publika a iterují místo závazného nasazení. Dalším krokem je geografická a publika‑úrovňová personalizace v takovém měřítku, které dříve bylo vyhrazeno pro společnosti s rozpočty v řádu několika milionů dolarů.

Verze, o které přemýšlím osobně: Dnes dostanu reklamu na tenisky natočenou na ulici v Manhattanu. Bydlím v Bay Area, takže pro mě nic neznamená. Chci tu samou reklamu s Mission Peak v pozadí. To není levnější reklama; je to jiný typ reklamy a stane se ekonomicky životaschopným jen tehdy, když je generování dostatečně rychlé a levné na vytvoření tisíců variant.

Pro společnosti, které vkládají generování obrázků nebo videí přímo do produktů, jak by měly uvažovat o ekonomice inferencí? V jakém měřítku se optimalizace využití GPU stává strategicky důležitou spíše než pouhé placení poskytovateli API za každé generování?

Zlomový bod nastává, když inferenční proces začíná ovlivňovat buď zákaznickou zkušenost, nebo marže společnosti.

Obecné API může mít smysl, dokud tým ověřuje produkt. Jakmile se generování stane ústředním prvkem tohoto produktu, musí týmy hledat nad rámec uvedené ceny za výstup. Latence, souběžnost, kvalita, spolehlivost a využití GPU se všechny stanou součástí ekonomiky.

Generování se může jevit jako levné, ale stále vytváří obchodní problém, pokud uživatelé musí čekat několik minut a opouštějí pracovní postup. Architektura, která vyžaduje, aby kapacita GPU rostla stejným tempem jako využití, bude také zvyšovat tlak na marže.

Neexistuje jediné prahové množství požadavků, protože výpočetní výkon potřebný pro krátký 540p klip se výrazně liší od delšího 1080p videa. Optimalizace se stává strategickou, když rostoucí využití způsobuje, že náklady stoupají téměř stejným tempem, špičková poptávka vytváří fronty nebo latence začíná omezovat uživatelský zážitek produktu.

MachGen funguje napříč několika vrstvami, včetně vlastních GPU kernelů, cachování, optimalizace přesnosti, plánování a paralelismu. Jak se modely nadále rychle vyvíjejí, kterou vrstvu inference stacku považujete za největší zbývající příležitost pro dramatické zlepšení rychlosti a nákladů?

Pro generování videa představuje pozornost jednu z největších zbývajících příležitostí, protože dominuje výpočetnímu rozpočtu v mnoha modelech. Stále existuje značný prostor pro zlepšení nízkopřesných receptů, řídké pozornosti a specifických attention kernelů pro difúzi.

Pozornost je jen jednou částí příležitosti. Největší celkové zisky přijdou spojením vylepšení napříč stackem. Caching je jeden příklad. Techniky KV cachování používané v LLMs se nepřenášejí přímo, ale difúzní modely obsahují prostorovou a časovou redundanci, kterou lze využít správným přístupem.

Paralelismus představuje další příležitost. Přidání GPU automaticky nevede k úměrnému zrychlení, protože komunikační režie může výhodu vyrovnat. Vyvíjíme přizpůsobená jádra, která překrývají komunikaci s výpočtem nezávislým na datech a řadí ji do pipeline s prací závislou na datech.

Pozornost, kešování, jádra, paralelismus, paměť a plánování se navzájem ovlivňují. Optimalizace pouze jedné vrstvy nakonec vytvoří úzké hrdlo někde jinde. Největší zlepšení přijdou z přístupu, který považuje celý stack za kompletní systém navržený pro výpočetní profil difúze.

S novějšími video modely, které posouvají časy generování blíže k reálnému času, jak blízko jsme k skutečně interaktivnímu generativnímu videu a jaké technické bariéry je ještě třeba překonat, než se generování videa v reálném čase stane běžnou praxí?

Již dosahujeme interaktivních rychlostí pro určité aplikace. MachGen vygeneruje pětisekundové video Vidu Q3 Turbo v rozlišení 720p přibližně za šest sekund a v rozlišení 540p pod tři sekundy. To je dostatečně rychlé pro rychlou kreativní iteraci a přibližuje k dosahu reaktivní avatary a interaktivní video.

Příklad toho, co podle mě interaktivita znamená. Představte si, že sledujete příběh a můžete vidět, kam směřuje závěr, a nelíbí se vám to. Místo pasivního sledování to přesměrujete: ti dva postavy by měly zjistit, co třetí skrývá, a postavit se mu místo toho, aby to jen tak dopadlo. Obsah, který řídíte, místo obsahu, který jen přijímáte. To je to, co umožňuje rychlá a levná generace, a mění téměř vše, co konzumujeme.

Dosažení tohoto cíle obvykle vyžaduje více než jeden silný benchmark latence. Celý zážitek musí zůstat responzivní i při produkčním provozu, přičemž musí zachovat vizuální kvalitu, konzistenci mezi snímky a předvídatelné náklady. Delší videa, vyšší rozlišení a souběžné požadavky zvyšují zátěž infrastruktury a systém stále musí poskytovat kapacitu, směrovat požadavky a zotavovat se z hardwarových selhání, aniž by to uživatele postihlo.

Přijde to postupně, případ po případě. Krátké klipy, avatary, hry a kreativní nástroje pravděpodobně přijdou jako první, protože generace měřená v sekundách už pro ně stačí. Jak se kvalita modelu a výkon inference zlepšují současně, více aplikací překročí tento práh.

Jak AI agenti stále častěji generují obrázky a videa autonomně, místo aby čekali, až člověk stiskne tlačítko, jak se tím mění požadavky na infrastrukturu? Vytvářejí agenti‑řízené pracovní zatížení zcela odlišné požadavky na latenci, souběžnost, náklady a spolehlivost?

Agent převádí jediný uživatelský požadavek na desítky nebo stovky generovacích úloh. Vytváří několik možností, hodnotí je, upravuje prompt a proces opakuje, aniž by mezi kroky zasahoval člověk.

To dělá latenci, souběžnost, náklady a spolehlivost mnohem důležitějšími. Pokud každá generace trvá minuty, je workflow agenta příliš pomalý na to, aby byl užitečný. Pokud je každý pokus drahý, autonomní iterace se stává ekonomicky nepraktickou. Systém také musí spolehlivě zvládat mnoho současných požadavků, protože jedno selhání může přerušit celý řetězec práce.

Zde jsou důležité schopnosti jako provisioning GPU, automatické škálování a směrování, stejně jako optimalizace na úrovni modelu. Požadavek agentů je mnohem výbušnější než požadavek kreativní aplikace, kde člověk jen kliká na tlačítko.

Relevantní jednotkou práce již není jediný obrázek nebo video. Je to celý cyklus generování, hodnocení a vylepšování obsahu. Infrastruktura musí učinit celý tento cyklus rychlým, cenově dostupným a spolehlivým.

Mezi poskytovateli GPU, inference cloudy, vývojáři modelů a optimalizačními platformami panuje intenzivní soutěž. Jak hardware sám rychlejší, proč budou společnosti i nadále potřebovat specializovanou inference vrstvu jako MachGen, místo aby spoléhaly na vylepšení od NVIDIA, AMD, cloudových poskytovatelů nebo samotných vývojářů modelů?

Rychlejší hardware zvyšuje strop. Software určuje, kolik z toho stropu bude dosaženo.

Viděli jsme, jak se to projevilo u LLM. Nové akcelerátory zlepšovaly surový výkon každou generací a kontinuální batchování, správa KV‑cache, spekulativní dekódování a specializovaná jádra stále zůstávaly tím, co přineslo průmyslu produkční úroveň propustnosti a ekonomiky. Nic z toho nepřišlo z hardwaru.

Průběžná optimalizace celé produkční cesty pro generování obrázků a videí je jiná práce než to, co dělají výrobci hardwaru, cloudoví poskytovatelé a vývojáři modelů, a není to pro žádného z nich hlavní priorita.

Existuje několik přístupů k této práci. Jedním je model tržiště, kde jsou modely agregovány a požadavky směrovány. Nemyslíme si, že je to dlouhodobě udržitelné, protože neexistuje kontrola nad vrstvou, kde se výkon skrývá. Rozhodli jsme se stavět stack sami a hostovat nativně, což je jediný způsob, jak dosáhnout latencí a nákladových čísel, které vidíme.

To znamená ladění pozornosti, cachování, jader, přesnosti, paměti a paralelismu pro každý model a každý akcelerátor a podpora spravovaných API, dedikovaného cloudu a samostatného nasazení. Jak se zvyšuje počet modelů a hardwarových možností, roste i složitost. Naše role je to absorbovat, aby naši zákazníci mohli věnovat svůj čas tomu, co jejich produkty odlišuje.

Popisovali jste světové modely jako součást dlouhodobé vize MachGen, přičemž mnoho jejich výpočetních charakteristik připomíná úlohy difúze. Jak by měla vypadat infrastruktura pro světové modely v produkčním měřítku a jaké aplikace se stanou možnými, pokud bude generování a simulace vizuálních prostředí nakonec tak levné a responzivní jako dnes generování textu?

Jedním ze způsobů, jak uvažovat o naší platformě, je přirovnání k obecně zamýšlenému LLM. Ten samý model vytváří právní smlouvu a odpovídá na otázku o restauracích. Pro nás stejný stack slouží společnostem zabývajícím se video avatary, AI reklamě, generování příběhů a mikrodrám a nakonec i světovým modelům. Různé vertikály, jedna sada základních výkonnostních problémů.

Světové modely nejsou dnes naším hlavním podnikáním, ale jsou tím, k čemu směřujeme, a aktivně na nich pracujeme. Světové modely v produkčním měřítku budou vyžadovat velmi vysokou propustnost a velmi nízkou latenci, protože neustále generují a aktualizují prostředí místo toho, aby produkovaly jediný výstup. Také potřebují prostorovou a časovou konzistenci, schopnost reagovat na akce a často i schopnost simultánně simulovat více možných výsledků. To vytváří obtížné problémy v paměti, přenosu dat, paralelismu a spolehlivosti. Světový model řídící robot nebo hru si nemůže dovolit trvat minuty na vytvoření dalšího stavu. Výkon rozhoduje, zda jsou tyto systémy vůbec použitelné.

Z výpočetního hlediska vypadají dnešní světové modely hodně jako difúzní modely, takže stack, který nyní budujeme, je přirozeným základem. Pro ně zatím neexistuje vyspělá produkční vrstva pro nasazení, srovnatelná s tím, co existuje pro LLM. Máme v úmyslu ji vytvořit.

Pokud se simulace stane tak responzivní a cenově dostupná jako dnes generování textu, roboti mohou natrénovat vzácné situace před jejich setkáním, hry mohou generovat prostředí, která reagují na jednotlivé hráče, a designéři mohou otestovat desítky možností před tím, než je realizují ve fyzickém světě. Difúze je oblast, ve které dnes vyděláváme. Světové modely jsou naším severním hvězdou.

Děkujeme za skvělý rozhovor, čtenáři, kteří se chtějí dozvědět více, by měli navštívit MachGen AI.

Antoine je vizionářský líder a spoluzakladatel Unite.AI, který je poháněn neotřesitelnou vášní pro formování a propagaci budoucnosti umělé inteligence a robotiky. Jako sériový podnikatel věří, že umělá inteligence bude mít na společnost stejně disruptivní vliv jako elektřina, a často se chvála na potenciál disruptivních technologií a AGI.