Rozhovory
Kirill Solodskih, spoluzakladatel a CEO TheStage AI – rozhovor

Kirill Solodskih, PhD, je spoluzakladatel a CEO TheStage AI, stejně jako zkušený AI výzkumník a podnikatel s více než desetiletou zkušeností v optimalizaci neuronových sítí pro reálné obchodní aplikace. V roce 2024 spoluzakladatel TheStage AI, který získal 4,5 milionu dolarů na financování plně automatizovaného zrychlení neuronových sítí napříč všemi hardwarovými platformami.
Předtím, jako vedoucí týmu v Huawei, Kirill vedl urychlení aplikací AI pro kamery Qualcomm (QCOM ) NPUs, přispívající k výkonu smartphonů P50 a P60 a získal několik patentů za své inovace. Jeho výzkum byl uveden na předních konferencích, jako je CVPR a ECCV, kde získal ocenění a uznání v oboru. Také hostí podcast o optimalizaci a inferenci AI.
Co vás inspirovalo k založení TheStage AI a jak jste přešli z akademie a výzkumu k optimalizaci inferencí jako zakladatel startupu?
Základy toho, co se nakonec stalo TheStage AI, začaly mým prací v Huawei, kde jsem se hluboce zabýval automatizací nasazení a optimalizací neuronových sítí. Tyto iniciativy se staly základem některých našich průlomových inovací a tam jsem viděl skutečnou výzvu. Školení modelu je jedna věc, ale dostat ho k efektivnímu běhu ve skutečném světě a učinit ho dostupným uživatelům je jiná. Nasazení je úzkým místem, které brání mnoha skvělým nápadům, aby se staly realitou. Proč je to tak důležité, je vidět na příkladu ChatGPT, kde je mnoho technických výzev spojených s jeho nasazením.
Ruční optimalizace inferencí byla dlouho úzkým místem v AI. Můžete vysvětlit, jak TheStage AI automatizuje tento proces a proč je to zásadní změna?
TheStage AI řeší jednu z hlavních úzkých míst v AI: ruční kompresi a urychlení neuronových sítí. Neuronové sítě mají miliardy parametrů a určit, které z nich odstranit pro lepší výkon, je téměř nemožné ručně. ANNA (Automated Neural Networks Analyzer) automatizuje tento proces, určuje, které vrstvy vyloučit z optimalizace, podobně jako když se ZIP komprese poprvé automatizovala.
To mění hru tím, že činí přijetí AI rychlejším a dostupnějším. Místo spoléhání se na nákladné ruční procesy mohou startupy optimalizovat modely automaticky. Technologie poskytuje podnikům jasný přehled o výkonu a nákladech, zajišťuje efektivitu a škálovatelnost bez hádání.
TheStage AI tvrdí, že snižuje náklady na inferenci až o 5x — co dělá vaši optimalizační technologii tak efektivní ve srovnání s tradičními metodami?
TheStage AI snižuje výstupní náklady až o 5x s optimalizačním přístupem, který jde za hranice tradičních metod. Místo aplikace stejného algoritmu na celou neuronovou síť ANNA rozdělí síť na menší vrstvy a rozhodne, který algoritmus aplikovat na každou část, aby dosáhla požadované komprese a maximalizovala kvalitu modelu. Kombinací chytrých matematických heuristik s efektivními aproximacemi je náš přístup vysoce škálovatelný a usnadňuje podnikům všech velikostí přijetí AI. Také integrujeme flexibilní nastavení kompilátoru, aby optimalizovaly sítě pro specifické hardwarové platformy, jako jsou iPhony nebo NVIDIA GPU. To nám dává více kontroly pro jemné ladění výkonu, zvyšující rychlost bez ztráty kvality.
Jak se urychlení inferencí TheStage AI srovnává s nativním kompilátorem PyTorch a jaké výhody nabízí AI vývojářům?
TheStage AI urychluje výstup daleko za hranice nativního kompilátoru PyTorch. PyTorch používá “just-in-time” kompilační metodu, která kompiluje model pokaždé, když běží. To vede k dlouhým časech spuštění, někdy trvajícím minuty nebo dokonce déle. Ve škálovatelných prostředích to může vytvořit neefektivitu, zejména když je třeba přidat nové GPU pro zpracování zvýšeného uživatelského zatížení, což způsobuje zpoždění, které ovlivňuje uživatelský zážitek.
Naopak TheStage AI umožňuje modely předkompilovat, takže jakmile je model připraven, může být nasazen okamžitě. To vede k rychlejším nasazením, zlepšené službě a úspoře nákladů. Vývojáři mohou nasazovat a škálovat AI modely rychleji, bez úzkých míst tradiční kompilace, což z něj činí více efektivní a reaktivní pro případy s vysokou poptávkou.
Můžete sdílet více o toolkitu QLIP TheStage AI a jak vylepšuje výkon modelu, zatímco udržuje kvalitu?
QLIP, toolkit TheStage AI, je Python knihovna, která poskytuje základní sadu primitiv pro rychlé sestavení nových optimalizačních algoritmů přizpůsobených různému hardwaru, jako jsou GPU a NPUs. Toolkit zahrnuje komponenty, jako je kvantizace, prořezávání, specifikace, kompilace a serving, všechny kritické pro vývoj efektivní a škálovatelné AI systémy.
Co odlišuje QLIP je jeho flexibilita. Umožňuje AI inženýrům prototypovat a implementovat nové algoritmy s pouhými několika řádky kódu. Například nedávná konferenční práce o kvantizačních neuronových sítích může být převedena do funkčního algoritmu pomocí primitiv QLIP za několik minut. To usnadňuje vývojářům integrovat nejnovější výzkum do svých modelů bez omezení rigidními rámci.
Na rozdíl od tradičních open-source rámců, které vás omezují na pevnou sadu algoritmů, QLIP umožňuje komukoli přidat nové optimalizační techniky. Tato adaptabilita pomáhá týmům zůstat před rychle se vyvíjejícím AI krajem, zlepšuje výkon, zatímco zajišťuje flexibilitu pro budoucí inovace.
Jste přispěl k AI kvantizačním rámcům používaným v Huawei P50 & P60 kamerech. Jak tato zkušenost ovlivnila váš přístup k optimalizaci AI?
Má zkušenost s prací na AI kvantizačních rámcích pro Huawei P50 a P60 mi dala cenné poznatky o tom, jak optimalizaci lze streamovat a škálovat. Když jsem poprvé začal s PyTorch, práce s kompletním grafem neuronových sítí byla rigidní a kvantizační algoritmy musely být implementovány ručně, vrstva po vrstvě. V Huawei jsem postavil rámec, který automatizoval proces. Stačilo pouze zadat model a automaticky se generoval kód pro kvantizaci, eliminující ruční práci.
To mě vedlo k tomu, abych si uvědomil, že automatizace v AI optimalizaci je o umožnění rychlosti bez obětování kvality. Jeden z algoritmů, který jsem vyvinul a patentoval, se stal nepostradatelným pro Huawei, zejména když museli přejít z procesorů Kirin na Qualcomm kvůli sankcím. Umožnilo týmu rychle přizpůsobit neuronové sítě architektuře Qualcomm bez ztráty výkonu nebo přesnosti.
Automatizací a zjednodušením procesu jsme snížili dobu vývoje z více než roku na pouhé měsíce. To mělo obrovský dopad na produkt, který používají miliony lidí, a formovalo můj přístup k optimalizaci, zaměřený na rychlost, efektivitu a minimální ztrátu kvality. To je přístup, který přináším do ANNY dnes.
Vaše výzkum byl uveden na CVPR a ECCV — co jsou některé z hlavních průlomů v AI efektivitě, kterých jste nejvíce pyšný?
Když se mě zeptáte na mé úspěchy v AI efektivitě, vždy si vzpomenu na naši práci, která byla vybrána pro ústní prezentaci na CVPR 2023. Být vybrán pro ústní prezentaci na takové konferenci je vzácné, protože pouze 12 prací je vybráno. To přidává k faktu, že Generativní AI obvykle dominuje ve světle, a naše práce se zabývala jiným přístupem, zaměřeným na matematickou stránku, konkrétně analýzou a kompresí neuronových sítí.
Vyvinuli jsme metodu, která nám pomohla porozumět, kolik parametrů neuronová síť skutečně potřebuje k efektivnímu provozu. Aplikací technik z funkční analýzy a přechodem z diskrétní na kontinuální formulaci jsme byli schopni dosáhnout dobrých kompresních výsledků, zatímco jsme si uchovávali schopnost integrovat tyto změny zpět do modelu. Práce také představila několik nových algoritmů, které nebyly dříve použity komunitou, a našly další uplatnění.
To byla jedna z mých prvních prací v oblasti AI a důležitým způsobem to byla kolektivní snaha našeho týmu, včetně mých spoluzakladatelů. To byl významný milník pro nás všechny.
Můžete vysvětlit, jak fungují Integrované neuronové sítě (INNs) a proč jsou důležitou inovací v hlubokém učení?
Tradiční neuronové sítě používají pevné matice, podobné tabulkám Excel, kde je velikost a parametry předem stanoveny. INNs však popisují sítě jako kontinuální funkce, nabízející mnohem více flexibility. Představte si to jako deku s kolíčky na různých výškách, a to reprezentuje kontinuální vlnu.
Co dělá INNs vzrušující, je jejich schopnost dynamicky “komprimovat” nebo “rozšířit” se podle dostupných zdrojů, podobně jako když je analogový signál digitalizován do zvuku. Můžete zmenšit síť bez obětování kvality a když je třeba, můžete ji opět rozšiřit bez potřebného přeškolování.
Otestovali jsme to a zatímco tradiční kompresní metody vedou k významné ztrátě kvality, INNs udržují kvalitu blízkou originálu, i při extrémní kompresi. Matematika za tím je více netradiční pro AI komunitu, ale skutečná hodnota spočívá v její schopnosti dodávat solidní, praktické výsledky s minimálními úsilími.
TheStage AI pracoval na kvantových annealovacích algoritmech — jak vidíte kvantové výpočty hrající roli v AI optimalizaci v blízké budoucnosti?
Když se jedná o kvantové výpočty a jejich roli v AI optimalizaci, klíčovým závěrem je, že kvantové systémy nabízejí zcela jiný přístup k řešení problémů, jako je optimalizace. Ačkoli jsme nevyvinuli kvantové annealovací algoritmy od základu, společnosti, jako je D-Wave, poskytují Python knihovny pro sestavení kvantových algoritmů specificky pro diskrétní optimalizační úkoly, které jsou ideální pro kvantové počítače.
Nápad spočívá v tom, že nebudeme přímo načítat neuronovou síť do kvantového počítače. To není možné s aktuální architekturou. Místo toho aproximujeme, jak neuronové sítě se chovají pod různými typy degradace, dělají je vhodné pro systém, který kvantový čip může zpracovat.
V budoucnu by kvantové systémy mohly škálovat a optimalizovat sítě s přesností, kterou klasické systémy těžko zvládnou. Výhoda kvantových systémů spočívá v jejich vestavěném paralelismu, něco, co klasické systémy mohou pouze simulovat pomocí dalších zdrojů. To by mohlo výrazně urychlit optimalizační proces, zejména když se budeme učit, jak efektivně modelovat větší a složitější sítě.
Skutečný potenciál spočívá v použití kvantového výpočtu pro řešení masivních, intrikátních optimalizačních úkolů a rozdělení parametrů na menší, lépe zvladatelné skupiny. S technologiemi, jako je kvantový a optický výpočet, existují obrovské možnosti pro optimalizaci AI, které daleko přesahují to, co klasické výpočty mohou nabídnout.
Jaký je váš dlouhodobý výhled pro TheStage AI? Kam vidíte optimalizaci inferencí směřovat v příštích 5-10 letech?
V dlouhodobém horizontu TheStage AI cílí stát se globálním Modelem Hub, kde kdokoli může snadno získat optimalizovanou neuronovou síť s požadovanými vlastnostmi, ať už pro smartphone nebo jakékoli jiné zařízení. Cílem je nabídnout drag-and-drop zkušenost, kde uživatelé zadají své parametry a systém automaticky vygeneruje síť. Pokud síť ještě neexistuje, bude vytvořena automaticky pomocí ANNY.
Naším cílem je spustit neuronové sítě přímo na zařízeních uživatelů, snížit náklady o 20 až 30krát. V budoucnu by to mohlo téměř eliminovat náklady, protože výpočet by zpracovávalo zařízení uživatele místo spoléhání se na cloud servery. To, v kombinaci s pokroky v modelové kompresi a hardwarovém urychlení, by mohlo učinit nasazení AI výrazně efektivnějším.
Plánujeme také integrovat naše technologie s hardwarovými řešeními, jako jsou senzory, čipy a robotika, pro aplikace v oblastech, jako je autonomní řízení a robotika. Například cílíme na vývoj AI kamer, které mohou fungovat v jakémkoli prostředí, ať už ve vesmíru nebo v extrémních podmínkách, jako je tma nebo prach. To by učinilo AI využitelné v širokém spektru aplikací a umožnilo by nám vytvářet custom řešení pro specifické hardwarové platformy a použití.
Děkuji za skvělý rozhovor, čtenáři, kteří chtějí se dozvědět více, by měli navštívit TheStage AI.












