Rozhovory
Neetu Pathak, spoluzakladatel a CEO Skymel – Interview Series

Neetu Pathak, spoluzakladatel a CEO Skymel, vede společnost při revoluci umělých inferencí s inovativní technologií NeuroSplit ™. Společně s technickým ředitelem Sushantem Tripathy řídí Skymel mise na zlepšení výkonu aplikací umělé inteligence a snížení výpočetních nákladů.
NeuroSplit ™ je adaptivní inferenční technologie, která dynamicky rozděluje zátěž umělé inteligence mezi koncová zařízení a cloudové servery. Tento přístup využívá nečinné výpočetní zdroje na uživatelských zařízeních, snižuje náklady na cloudovou infrastrukturu až o 60 %, urychluje rychlost inferencí, zajišťuje ochranu dat a umožňuje bezproblémové škálování.
Optimalizací lokální výpočetní síly umožňuje NeuroSplit ™ spustit aplikace umělé inteligence efektivně i na starších GPU, což výrazně snižuje náklady a zlepšuje uživatelský zážitek.
Co vás inspirovalo k založení Skymel a jaká byla hlavní výzva v infrastruktuře umělé inteligence, kterou jste chtěli řešit s NeuroSplit?
Inspirace pro Skymel přišla z konvergence našich doplňkových zkušeností. Během svého působení v Google (GOOGL ) můj spoluzakladatel Sushant Tripathy nasazoval modely umělé inteligence založené na řeči na miliardy zařízení Android. Zjistil, že na koncových zařízeních je obrovské množství nečinné výpočetní síly, ale většina společností nemůže efektivně využít tyto zdroje kvůli složitým inženýrským výzvám při přístupu k těmto zdrojům bez ohrožení uživatelského zážitku.
Meanwhile, moje zkušenosti z práce s podniky a startupy v Redis mi daly hluboké znalosti o tom, jak kritická je latence pro podniky. Jakmile se aplikace umělé inteligence staly více rozšířené, bylo jasné, že potřebujeme přesunout zpracování blíže k místu, kde jsou data vytvářena, místo neustálého přenosu dat tam a zpět do datových center.
To bylo okamžik, kdy Sushant a já uvědomili, že budoucnost není o volbě mezi lokálním nebo cloudovým zpracováním – ale o vytvoření inteligentní technologie, která může adaptivně přepínat mezi lokálním, cloudovým nebo hybridním zpracováním na základě každé konkrétní inferenční žádosti. Tato myšlenka nás vedla k založení Skymel a vývoji NeuroSplit, který jde za hranice tradičních omezení infrastruktury, která brzdila inovace umělé inteligence.
Můžete vysvětlit, jak NeuroSplit dynamicky optimalizuje výpočetní zdroje, zatímco zachovává ochranu uživatele a výkon?
Jedním z hlavních problémů lokální inferenční umělé inteligence byla její statická výpočetní náročnost – tradičně vyžadovala spuštění modelu umělé inteligence stejné výpočetní zdroje, bez ohledu na podmínky zařízení nebo chování uživatele. Tento univerzální přístup ignoruje realitu, že zařízení mají různé hardwarové schopnosti, od různých čipů (GPU, NPU, CPU, XPU) až po různé síťové šířky pásma, a uživatelé mají různé chování v oblasti použití aplikací a nabíjení.
NeuroSplit nepřetržitě monitoruje různé telemetrické údaje zařízení – od hardwarových schopností po aktuální využití zdrojů, stav baterie a síťové podmínky. Zároveň zohledňujeme vzorce chování uživatelů, jako je počet spuštěných aplikací a typické vzorce použití zařízení. Tento komplexní monitoring umožňuje NeuroSplit dynamicky určit, kolik inferenční výpočetní zátěže lze bezpečně spustit na koncovém zařízení, zatímco optimalizuje výkonnostní ukazatele pro vývojáře.
Když je ochrana dat zásadní, NeuroSplit zajišťuje, že syrová data nikdy neopouštějí zařízení, zpracovávají citlivé informace lokálně a přitom zachovávají optimální výkon. Naše schopnost inteligentně rozdělit, odstranit nebo odpojit modely umělé inteligence umožňuje nám umístit 50-100 modelů umělé inteligence do paměťového prostoru jediného kvantizovaného modelu na koncovém zařízení. V praktických termínech to znamená, že uživatelé mohou spustit podstatně více aplikací umělé inteligence současně, zpracovávat citlivá data lokálně, ve srovnání s tradičními statickými výpočetními přístupy.
Jaké jsou hlavní výhody adaptivní inferenční technologie NeuroSplit pro společnosti umělé inteligence, zejména ty, které pracují se staršími technologiemi GPU?
NeuroSplit poskytuje tři transformační výhody pro společnosti umělé inteligence. První je dramatické snížení nákladů na infrastrukturu prostřednictvím dvou mechanismů: společnosti mohou efektivně využívat levnější, starší GPU a naše jedinečná schopnost umístit plné i stub modely na cloudové GPU umožňuje podstatně vyšší využití GPU. Například aplikace, která obvykle vyžaduje několik NVIDIA A100 za 2,74 USD za hodinu, může nyní běžet na jediném A100 nebo několika V100 za pouhých 0,83 USD za hodinu.
Druhá výhoda spočívá v podstatném zlepšení výkonu tím, že se zpracovávají počáteční syrová data přímo na uživatelských zařízeních. To znamená, že data, která jsou nakonec přenesena do cloudu, jsou podstatně menší, což snižuje síťovou latenci a zachovává přesnost. Tento hybridní přístup poskytuje společnostem nejlepší z obou světů – rychlost lokálního zpracování s mocí cloudového zpracování.
Třetí výhodou je, že NeuroSplit pomáhá společnostem zachovat silnou ochranu uživatele, aniž by obětovaly výkon. To je stále důležitější, protože předpisy na ochranu soukromí se stávají přísnějšími a uživatelé jsou stále více ochotni chránit svá data.
Jak řeší Skymel náklady na inferenci umělé inteligence bez ohrožení složitosti nebo přesnosti modelu?
NeuroSplit rozděluje jednotlivé modely umělé inteligence a rozděluje výpočetní zátěž mezi uživatelská zařízení a cloud. První část běží na zařízení uživatele, zpracovává 5 % až 100 % celkové výpočetní zátěže v závislosti na dostupných zdrojích zařízení. Zbývající část výpočetní zátěže musí být zpracována v cloudovém GPU.
Toto rozdělení znamená, že cloudová GPU zpracovává sníženou výpočetní zátěž – pokud model původně vyžadoval plné GPU A100, po rozdělení může stejná zátěž vyžadovat pouze 30-40 % kapacity GPU. To umožňuje společnostem používat více nákladově efektivní instance GPU, jako je V100.
Jak se liší hybridní (lokální + cloudová) přístup Skymel od ostatních řešení infrastruktury umělé inteligence na trhu?
Krajina umělé inteligence je na fascinujícím inflexním bodě. Zatímco se dnes zaměřujeme na škálování obecných velkých jazykových modelů v cloudu, budoucí pět let uvidí umělou inteligenci, která se stane hluboce personalizovanou a kontextově vědomou. To není jen o jemném ladění – je to o umělé inteligenci, která se přizpůsobuje konkrétním uživatelům, zařízením a situacím v reálném čase.
Tento posun vytváří dvě hlavní infrastrukturní výzvy. První je, že tradiční přístup běhu všeho v centralizovaných datových centrech se stává neudržitelným jak technicky, tak ekonomicky. Druhá je, že rostoucí složitost aplikací umělé inteligence vyžaduje infrastrukturu, která může dynamicky optimalizovat napříč několika modely, zařízeními a výpočetními lokalitami.
Na Skymel budujeme infrastrukturu, která řeší tyto výzvy. Naše technologie umožňuje umělé inteligenci běhat tam, kde to má nejvíce smysl – ať už na zařízení, kde jsou data generována, v cloudu, kde je k dispozici více výpočetní síly, nebo inteligentně rozdělené mezi oběma. Co je ještě důležitější, tato rozhodnutí se přizpůsobují v reálném čase na základě měnících se podmínek a požadavků.
Jaká je role agenta Orchestrator v doplnění NeuroSplit a jakou roli hraje při transformaci strategií nasazení umělé inteligence?
Agent Orchestrator (OA) a NeuroSplit spolupracují na vytvoření samo-optimalizujícího se systému nasazení umělé inteligence:
1. Vývojáři nastavují hranice:
- Omezení: povolené modely, verze, cloudoví poskytovatelé, zóny, pravidla dodržování předpisů
- Cíle: cílová latence, limity nákladů, požadavky na výkon, potřeby ochrany soukromí
2. OA pracuje v rámci těchto omezení, aby dosáhla cílů:
- Rozhoduje, které modely/API použít pro každou žádost
- Přizpůsobuje strategie nasazení na základě skutečného výkonu
- Dělá kompromisy, aby optimalizoval stanovené cíle
- Může být okamžitě rekonfigurován, pokud se potřeby změní
3. NeuroSplit provádí rozhodnutí OA:
- Používá telemetrická data zařízení v reálném čase k optimalizaci výkonu
- Rozděluje zpracování mezi zařízení a cloud, pokud je to výhodné
- Zajišťuje, aby každá inferenční žádost běžela optimálně s ohledem na aktuální podmínky
Je to jako mít systém umělé inteligence, který se sám optimalizuje v rámci vašich definovaných pravidel a cílů, místo aby vyžadoval manuální optimalizaci pro každou situaci.
Jak podle vás bude agent Orchestrator měnit způsob nasazení umělé inteligence v různých odvětvích?
Řeší tři kritické výzvy, které brzdily přijetí a inovace umělé inteligence.
První je, že umožňuje společnostem držet krok s nejnovějšími pokroky v oblasti umělé inteligence bez námahy. S agentem Orchestrator můžete okamžitě využít nejnovější modely a techniky bez nutnosti rekonstruovat svou infrastrukturu. To je velký konkurenční výhodou ve světě, kde inovace umělé inteligence postupují rychlým tempem.
Druhá je, že umožňuje dynamickou, na žádost optimalizaci výběru modelů umělé inteligence. Agent Orchestrator může inteligentně kombinovat modely z obrovské ekosystémy možností, aby poskytl nejlepší možné výsledky pro každou interakci uživatele. Například umělá inteligence zákaznického servisu by mohla použít specializovaný model pro technické otázky a jiný model pro dotazy související s fakturací, poskytující lepší výsledky pro každý typ interakce.
Třetí je, že maximalizuje výkon, zatímco minimalizuje náklady. Agent automaticky vyvažuje mezi spuštěním umělé inteligence na zařízení uživatele nebo v cloudu na základě toho, co má nejvíce smysl v daném okamžiku. Když je ochrana soukromí důležitá, zpracovává data lokálně. Když je potřeba extra výpočetní síla, využívá cloud. To vše se děje na pozadí, vytváří hladký zážitek pro uživatele a optimalizuje zdroje pro podniky.
Jaké zpětné vazby jste dosud dostali od společností, které se účastní soukromé bety agenta Orchestrator?
Zpětná vazba od našich účastníků soukromé bety byla skvělá! Společnosti jsou nadšeny, že mohou konečně vyjít z infrastrukturního uzamčení, ať už se jedná o proprietární modely nebo hostingové služby. Schopnost budoucnosti libovolného nasazení rozhodnutí eliminuje obávané měsíce rekonstrukce, když se mění přístup.
Naše výsledky výkonu NeuroSplit byly prostě úžasné – nemůžeme se dočkat, až je budeme moci sdílet veřejně. Co je zvláště zajímavé, je to, jak koncept adaptivního nasazení umělé inteligence zachytil představivost. Skutečnost, že umělá inteligence nasazuje sama sebe, zní futuristicky a není něco, co by se očekávalo nyní, takže z technického pokroku lidé dostanou nadšení z možností a nových trhů, které může vytvořit v budoucnu.
S rychlým pokrokem v generativní umělé inteligenci, jaké vidíte jako hlavní překážky pro infrastrukturu umělé inteligence a jak Skymel plánuje řešit je?
Směřujeme se k budoucnosti, kterou většina lidí ještě plně nepochopila: nebude existovat jeden dominantní model umělé inteligence, ale miliardy z nich. I kdybychom vytvořili nejvýkonnější obecný model umělé inteligence, budeme potřebovat personalizované verze pro každého člověka na Zemi, přizpůsobené jedinečným kontextům, preferencím a potřebám. To je nejméně 8 miliard modelů, na základě populace světa.
Toto označuje revoluční posun od dnešního univerzálního přístupu. Budoucnost vyžaduje inteligentní infrastrukturu, která může zvládnout miliardy modelů. Na Skymel budujeme technologickou mapu, která již staví základy pro to, co přijde dále.
Jak si představujete, že se bude infrastruktura umělé inteligence vyvíjet v příštích pěti letech, a jakou roli budete hrát Skymel v této evoluci?
Krajina infrastruktury umělé inteligence se chystá projít zásadním posunem. Zatímco se dnes zaměřujeme na škálování obecných velkých jazykových modelů v cloudu, budoucí pět let uvidí umělou inteligenci, která se stane hluboce personalizovanou a kontextově vědomou. To není jen o jemném ladění – je to o umělé inteligenci, která se přizpůsobuje konkrétním uživatelům, zařízením a situacím v reálném čase.
Tento posun vytváří dvě hlavní infrastrukturní výzvy. První je, že tradiční přístup běhu všeho v centralizovaných datových centrech se stává neudržitelným jak technicky, tak ekonomicky. Druhá je, že rostoucí složitost aplikací umělé inteligence vyžaduje infrastrukturu, která může dynamicky optimalizovat napříč několika modely, zařízeními a výpočetními lokalitami.
Na Skymel budujeme infrastrukturu, která řeší tyto výzvy. Naše technologie umožňuje umělé inteligenci běhat tam, kde to má nejvíce smysl – ať už na zařízení, kde jsou data generována, v cloudu, kde je k dispozici více výpočetní síly, nebo inteligentně rozdělené mezi oběma. Co je ještě důležitější, tato rozhodnutí se přizpůsobují v reálném čase na základě měnících se podmínek a požadavků.
Děkuji za skvělý rozhovor, čtenářům, kteří chtějí se dozvědět více, doporučujeme navštívit Skymel.












