Rozhovory
Yubei Chen, spoluzakladatel Aizip Inc – Interview Series

Yubei Chen je spoluzakladatel Aizip inc., společnosti, která vyvíjí nejmenší a nejefektivnější modely umělé inteligence. Je také asistentem profesora na katedře elektrotechniky a počítačových věd na University of California, Davis. Chenův výzkum se nachází na rozhraní počítačové neurovědy a hlubokého nesupervizovaného (samoučícího se) učení, což zlepšuje naše pochopení výpočetních principů, které řídí nesupervizované učení reprezentací v mozcích a strojích, a mění naše poznatky o statistice přirozených signálů.
Předtím, než se připojil k UC Davis, Chen dokončil postdoktorální studium s prof. Yannem LeCunem na NYU Center for Data Science (CDS) a Meta Fundamental AI Research (FAIR). Doktorát dokončil na Redwood Center for Theoretical Neuroscience a Berkeley AI Research (BAIR), UC Berkeley, pod vedením prof. Bruna Olshausena.
Aizip vyvíjí ultraefektivní řešení umělé inteligence optimalizovaná pro hraniční zařízení, nabízející kompaktní modely pro aplikace vidění, audio, časové řady, jazyka a fúze senzorů. Jejich produkty umožňují úkoly, jako je rozpoznávání obličeje a objektů, rozpoznávání klíčových slov, analýza ECG/EEG a chatboty na zařízení, všechny poháněné TinyML. Prostřednictvím své platformy AI nanofactory, Aizipline, společnost urychluje vývoj modelů pomocí základních a generativních modelů, aby se přiblížila k plné automatizaci návrhu umělé inteligence. Řada malých jazykových modelů Aizip (300M–2B parametrů) podporuje širokou škálu zařízení a přináší inteligentní schopnosti na hraniční zařízení.
Vy jste absolvoval postdoktorální studium s Yannem LeCunem na NYU a Meta FAIR. Jak vám práce s ním a váš výzkum na UC Berkeley ovlivnily váš přístup k budování reálných řešení umělé inteligence?
Na Berkeley, moje práce byla hluboce zakořeněna ve vědeckém zkoumání a matematické přísnosti. Můj doktorský výzkum, který kombinoval elektrotechniku, počítačovou vědu a počítačovou neurovědu, se zaměřil na pochopení systémů umělé inteligence z “bílé skříňky” perspektivy, nebo na vývoj metod, které odhalují základní struktury dat a učících se modelů. Pracoval jsem na budování interpretabilních, vysoce výkonných modelů umělé inteligence a technik vizualizace, které pomáhaly otevřít černé skříňky umělé inteligence.
Na Meta FAIR, se zaměřil na inženýrství systémů umělé inteligence, aby dosáhly špičkového výkonu ve velkém měřítku. S přístupem k světovému počítačovému vybavení, prozkoumal jsem limity samoučícího se učení a přispěl k tomu, co nazýváme “světovými modely” — systémy umělé inteligence, které se učí z dat a představují možné prostředí. Tato dvojí zkušenost — vědecké pochopení na Berkeley a inženýrství orientované na škálování na Meta — mi dala komplexní perspektivu na vývoj umělé inteligence. Ukázala důležitost teoretického pochopení a praktické implementace při vývoji řešení umělé inteligence pro reálné aplikace
Vaše práce kombinovala počítačovou neurovědu s umělou inteligencí. Jaké poznatky z neurovědy ovlivnily váš vývoj modelů umělé inteligence?
V počítačové neurovědě studujeme, jak mozek zpracovává informace měřením jeho reakcí na různé podněty, podobně jako když zkoumáme modely umělé inteligence, abychom pochopili jejich vnitřní mechanismy. Brzy v mé kariéře, vyvinul jsem techniky vizualizace, abych analyzoval word embeddings — rozkládající slova, jako je “jablko”, na jejich složené semantické prvky, jako je “ovoce” a “technologie”. Později, tento přístup se rozšířil na komplexnější modely umělé inteligence, jako jsou transformátory a velké jazykové modely, které pomáhaly odhalit, jak zpracovávají a ukládají znalosti.
Tyto metody jsou vlastně paralelní s technikami v neurovědě, jako je použití elektrod nebo fMRI ke studiu mozkové aktivity. Zkoumání vnitřních reprezentací modelu umělé inteligence umožňuje nám pochopit jeho strategie uvažování a detekovat emergentní vlastnosti, jako je koncept neuronů, které se aktivují pro specifické myšlenky (jako je funkce Golden Gate Bridge, kterou Anthropic nalezl při mapování Claude). Tato linie výzkumu je nyní široce přijata v průmyslu, protože prokázala, že umožňuje jak interpretovatelnost, tak praktické zásahy, odstraňování偏见 z modelů. Takže přístupy inspirované neurovědou vlastně pomáhají nám dělat umělou inteligenci více vysvětlitelnou, důvěryhodnou a efektivní.
Co vás inspirovalo k založení Aizip? Můžete sdílet cestu od konceptu k zahájení společnosti?
Jako fundamentální výzkumník umělé inteligence, většina mé práce byla teoretická, ale chtěl jsem most mezi výzkumem a reálnými aplikacemi. Založil jsem Aizip, abych přinesl inovace umělé inteligence do praktického použití, zejména v prostředích s omezenými zdroji. Místo budování velkých základních modelů, zaměřili jsme se na vývoj nejmenších a nejefektivnějších modelů umělé inteligence, které by byly optimalizovány pro hraniční zařízení.
Cesta vlastně začala s klíčovým pozorováním: zatímco pokroky v oblasti umělé inteligence rychle škálovaly, reálné aplikace často vyžadovaly kompaktní a vysoce efektivní modely. Viděli jsme příležitost, abychom zavedli nový směr, který vyvážil vědeckou přísnost s praktickým nasazením. Díky využití poznatků ze samoučícího se učení a kompaktních architektur modelů, Aizip dokázala dodat řešení umělé inteligence, která fungují efektivně na hraničních zařízeních a otevírají nové možnosti pro umělou inteligenci v vestavěných systémech, IoT a dalších.
Aizip se specializuje na malé modely umělé inteligence pro hraniční zařízení. Jakou mezeru na trhu jste viděli, že vedla k tomuto zaměření?
Průmysl umělé inteligence se většinou zaměřil na škálování modelů, ale reálné aplikace často vyžadují opačný přístup — vysokou efektivitu, nízkou spotřebu energie a minimální latenci. Mnoho modelů umělé inteligence dnes je příliš výpočetně náročných pro nasazení na malá, vestavěná zařízení. Viděli jsme mezeru na trhu pro řešení umělé inteligence, která by mohla dodat silný výkon, zatímco fungovala v extrémních omezeních zdrojů.
Uznali jsme, že není nutné, aby každé řešení umělé inteligence běželo na masivních modelech, a že by to nebylo škálovatelné, aby se spoléhali na modely této velikosti pro vše. Místo toho, zaměřujeme se na optimalizaci algoritmů, aby dosáhli maximální efektivity, zatímco zachovávali přesnost. Navrhováním modelů umělé inteligence pro hraniční aplikace — ať už v chytrých senzorech, nositelných zařízeních nebo průmyslové automatizaci — umožňujeme, aby umělá inteligence běžela na místech, kde by tradiční modely byly nepraktické. Naše přístup dělá umělou inteligenci více přístupnou, škálovatelnou a energeticky efektivní, odemykající nové možnosti pro inovace umělé inteligence za hranicemi cloudu.
Aizip je na předním místě ve vývoji malých jazykových modelů (SLM). Jak vidíte soutěž nebo doplnění větších modelů, jako je GPT-4?
SLM a větší modely, jako je GPT-4, nejsou nutně v přímé soutěži, protože slouží různým potřebám. Larger modely jsou mocné v termínech generalizace a hlubokého uvažování, ale vyžadují podstatné výpočetní zdroje. SLM jsou navrženy pro efektivitu a nasazení na nízkoenergetických hraničních zařízeních. Doplnňují větší modely tím, že umožňují schopnosti umělé inteligence v reálných aplikacích, kde výpočetní zdroje, latence a náklady jsou omezeny — jako je v zařízeních IoT, nositelných zařízeních a průmyslové automatizaci. Jak se přijetí umělé inteligence roste, vidíme, že se vyvíjí hybridní přístup, kde větší, cloudové modely zpracovávají komplexní dotazy, zatímco SLM poskytuje reálnou, lokalizovanou inteligenci na hraničních zařízeních.
Jaké jsou největší technické výzvy při vytváření modelů umělé inteligence dostatečně efektivní pro nízkoenergetická hraniční zařízení?
Jednou z fundamentálních výzev je absence úplného teoretického pochopení, jak modely umělé inteligence fungují. Bez jasných teoretických základů, optimalizační úsilí jsou často empirická, omezující zisky efektivity. Kromě toho, lidské učení probíhá různými způsoby, které současné paradigmy strojového učení plně nezachycují, což činí obtížným navrhnout modely, které napodobují lidskou efektivitu.
Z inženýrského hlediska, tlačení umělé inteligence do extrémních omezení vyžaduje inovativní řešení v kompresi modelů, kvantizaci a návrhu architektury. Další výzvou je vytvářet modely umělé inteligence, které se mohou přizpůsobit různým zařízením a prostředím, zatímco zachovávají robustnost. Jak se umělá inteligence stále více interaguje s fyzickým světem prostřednictvím IoT a senzorů, potřeba přirozených a efektivní rozhraní — jako je hlas, gesta a jiná netradiční vstupní metody — se stává kritickou. Umělá inteligence na hraničních zařízeních je o tom, jak předefinovat, jak uživatelé interagují s digitálním světem bezproblémově.
Můžete sdílet některé podrobnosti o práci Aizip s společnostmi, jako je Softbank?
Nedávno jsme se spojili se SoftBankem na projektu akvakultury, který získal cenu CES Innovation Award — jeden, na který jsme besonders pyšní. Vyvinuli jsme efektivní, hraniční model umělé inteligence pro aplikaci počítání ryb, který lze použít operátory rybích farem. Toto řešení řeší kritickou výzvu v rybářství, která může nakonec vytvořit udržitelnost, odpad potravin a problémy s ziskem. Průmysl byl pomalý v přijetí umělé inteligence jako řešení, kvůli nestabilní energii a připojení na moři, což činí cloudová řešení umělé inteligence nepraktickými.
Abysme to vyřešili, vyvinuli jsme řešení založené na zařízení. Kombinovali jsme simulace počítačové grafiky SoftBanku pro trénovací data s našimi kompaktními modely umělé inteligence a vytvořili vysoce přesný systém, který běží na smartphonech. V podvodních polních testech, dosáhli jsme 95% rozpoznávací sazby, což dramaticky zlepšilo přesnost počítání ryb. To umožnilo farmářům optimalizovat skladovací podmínky, určit, zda by ryby měly být transportovány živé nebo zmražené, a detekovat potenciální nemoci nebo zdravotní problémy u ryb.
Tento průlom zlepšuje efektivitu, snižuje náklady a snižuje závislost na manuální práci. Širší, ukazuje, jak může umělá inteligence mít skutečný dopad na reálné problémy.
Aizip zavedl koncept “AI Nanofactory”. Můžete vysvětlit, co to znamená a jak automatizuje vývoj modelů umělé inteligence?
AI Nanofactory je naše interní pipeline automatizace návrhu umělé inteligence, inspirovaná Electronic Design Automation (EDA) ve výrobě polovodičů. Raný vývoj v jakékoli vznikající technologické oblasti zahrnuje mnoho manuálních úsilí, takže automatizace se stává klíčem k urychlení pokroku a škálování řešení, jak se oblast zrací.
Místo toho, abychom používali umělou inteligenci k urychlení jiných odvětví, zeptali jsme se, zda může umělá inteligence urychlit svůj vlastní vývoj? AI Nanofactory automatizuje každou fázi vývoje modelu umělé inteligence, od zpracování dat po návrh architektury, výběr modelu, trénink, kvantizaci, nasazení a ladění. Díky využití umělé inteligence k optimalizaci sama sebe, jsme schopni snížit dobu vývoje nových modelů v průměru o faktor 10. V některých případech, až o 1 000krát. To znamená, že model, který dříve trval více než rok, může být nyní vytvořen za několik hodin.
Další výhodou je, že tato automatizace také zajišťuje, že řešení umělé inteligence jsou ekonomicky životaschopná pro širokou škálu aplikací, což činí nasazení umělé inteligence v reálném světě více přístupným a škálovatelným.
Jak vidíte roli edge AI vyvíjet se v příštích pěti letech?
Edge AI slibuje transformovat, jak interagujeme s technologií, podobně jako to udělaly smartphony s přístupem k internetu. Většina aplikací umělé inteligence dnes je založena na cloudu, ale toto se začíná měnit, jak se umělá inteligence pohybuje blíže k senzorům a zařízením, která interagují s fyzickým světem. Tento posun zdůrazňuje kritickou potřebu efektivní, reálné zpracování na hraničních zařízeních.
V příštích pěti letech očekáváme, že edge AI umožní více přirozených interakcí mezi lidmi a počítači, jako je rozpoznávání hlasu a gest, a další intuitivní rozhraní, která odstraní závislost na tradičních bariérách, jako jsou klávesnice a dotykové obrazovky. Umělá inteligence se také stane více vestavěnou do každodenních prostředí, jako jsou chytré domy nebo průmyslová automatizace, aby umožnila reálné rozhodování s minimální latencí.
Další klíčový trend bude rostoucí autonomie systémů edge AI. Modely umělé inteligence se stanou více samo-optimalizujícími a adaptivními, díky pokrokům v automatizaci AI Nanofactory, takže sníží potřebu lidského zásahu při nasazení a údržbě. To otevře nové příležitosti v několika odvětvích, jako je zdravotnictví, automobilový průmysl a zemědělství.
Jaké jsou některé nadcházející zařízení s umělou inteligencí od Aizip, na které se těšíte?
Pracujeme na rozšíření použití našich modelů v nových odvětvích a jedním z nich, na které se especialmente těšíme, je agent umělé inteligence pro automobilový průmysl. Existuje rostoucí trend, zejména mezi čínskými automobilkami, na vývoj hlasových asistentů poháněných jazykovými modely, které se cítí jako ChatGPT uvnitř kabiny. Výzvou je, že většina současných asistentů stále závisí na cloudu, zejména pro přirozené a flexibilní dialogy. Pouze základní příkazy a řízení (jako “zapnout klimatizaci” nebo “otevřít kufr”) obvykle běží místně na vozidle, a rigidní povaha těchto příkazů se může stát rozptýlením pro řidiče, pokud je nemají úplně zapamatované.
Vyvinuli jsme řadu ultraefektivních, SLM-poháněných agentů umělé inteligence zvaných Gizmo, které jsou aktuálně používány v několika aplikacích pro různá odvětví, a pracujeme na jejich nasazení jako “spolujezdců” pro vozidla. Gizmo je trénován, aby porozuměl úmyslu více nuancovaným způsobem, a když slouží jako AI Agent vozidla, mohl by vykonat příkazy prostřednictvím konverzačního, volného jazyka. Například, agent by mohl upravit teplotu kabiny, pokud by řidič prostě řekl, “Je mi zima”, nebo by reagoval na výzvu, jako “Jedu do Bostonu zítra, co bych měl nosit?” tím, že zkontroluje počasí a nabídne návrh.
Protože běží místně a nezávisí na cloudu, tito agenti pokračují v fungování v mrtvých zónách nebo oblastech s špatným připojením, jako jsou tunely, hory nebo venkovské oblasti. Také zlepšují bezpečnost, poskytujíce řidičům kompletní hlasové ovládání, aniž by museli odvrátit pozornost od silnice. A na samostatné a lehčí poznámce, chtěl bych také zmínit, že jsme aktuálně ve fázi uvedení modelu umělé inteligence pro karaoke do výroby, který běží místně, podobně jako spolujezdec. Základní, vezme jakékoli vstupní audio a odstraní lidské hlasy z něj, což umožňuje vytvořit karaoke verzi jakéhokoli songu v reálném čase. Kromě toho, že pomáháme zákazníkům lépe a bezpečněji řídit, hledáme také způsoby, jak udělat zkušenost více zábavnou.
Tato řešení, která dělají skutečný rozdíl v každodenním životě lidí, jsou ta, na která jsme nejvíce pyšní.
Aizip vyvíjí ultraefektivní řešení umělé inteligence optimalizovaná pro hraniční zařízení, nabízející kompaktní modely pro aplikace vidění, audio, časové řady, jazyka a fúze senzorů. Jejich produkty umožňují úkoly, jako je rozpoznávání obličeje a objektů, rozpoznávání klíčových slov, analýza ECG/EEG a chatboty na zařízení, všechny poháněné TinyML. Prostřednictvím své platformy AI nanofactory, Aizipline, společnost urychluje vývoj modelů pomocí základních a generativních modelů, aby se přiblížila k plné automatizaci návrhu umělé inteligence. Řada malých jazykových modelů Aizip (300M–2B parametrů) podporuje širokou škálu zařízení a přináší inteligentní schopnosti na hraniční zařízení.
Děkuji za skvělý rozhovor, čtenáři, kteří chtějí se dozvědět více, by měli navštívit Aizip.












