Rozhovory

Avi Baum, CTO ve společnosti Hailo – Interview Series

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Avi Baum, CTO ve společnosti Hailo, vede technologickou vizi a inovace produktů společnosti. Předtím působil jako CTO pro bezdrátové připojení ve společnosti Texas Instruments (TXN ), kde řídil strategie pro připojené MCU v oblastech IoT a IIoT, a zastával seniorní architektonické a vedoucí role v Izraelských obranných silách.

Hailo je izraelská společnost specializující se na AI čipové technologie, která nabízí high-performance, low-power edge AI procesory pro aplikace jako autonomní vozidla, chytré kamery a robotiku, podporované komplexním softwarovým balíčkem a globálním partnerstvím.

Můžete sdílet, co vás původně přitáhlo k oboru edge AI a jak vaše rané inženýrské zkušenosti ovlivnily vaše myšlení o návrhu procesoru?

Má kariérní cesta mě vedla do oblastí vznikajících trhů. Během mého působení ve společnosti TI (Texas Instruments), lídera v oblasti polovodičů s dlouhou historií, jsem měl příležitost vést systémový návrh a architekturu, přičemž jsem vedl oddělení produktového vývoje a později působil jako CTO tohoto oddělení. To mě vedlo k tomu, abych neustále prozkoumával vznikající technologie, které pravděpodobně budou tvarovat blízkou budoucnost.

Když jsme založili Hailo v roce 2017, bylo jasné, že AI, které začalo prosperovat v cloudu, také mělo potenciál stát se umožňující technologií pro edge zařízení. Proto jsme nastavili směr a zahájili tuto cestu.

Jak se rozšiřuje generativní AI na edge, proč je TOPS—tera operací za sekundu—již nedostatečným měřítkem pro hodnocení výkonu procesoru?

TOPS byl po dlouhou dobu hlavním měřítkem pro hodnocení AI hardwaru, ale v éře generativní AI na edge již není dostatečným. Příroda klasických modelů spočívá v překladu velkých množství dat do smysluplných informací, takže množství výpočtů potřebných pro zpracování příchozích dat roste s množstvím dat, která je třeba zpracovat. Modely pro tyto úkoly jsou obvykle menší než množství dat, která zpracovávají, což činí režii šířky pásma spojenou s přístupem k parametrům modelu relativně zanedbatelnou.

Generativní modely jsou však znatelně větší – v oblasti miliard parametrů, a v těchto případech se šířka pásma paměti stává významným faktorem.

Místo toho, aby se zaměřovaly pouze na TOPS, je kritické posoudit, jak dobře procesor vyvažuje výpočet a paměť v reálných podmínkách. Není to o tom, aby se honilo za nejvyšší číslo; je to o tom, aby se architektura nastavila na úkoly, které je třeba zvládnout.

Proč se šířka pásma paměti stává nyní kritičtějším úzkým místem než výpočet v edge AI úkolech, zejména pro LLM a VLM?

Pro edge AI úkoly, zejména ty, které zahrnují LLM nebo VLM, se šířka pásma paměti stává primárním úzkým místem. Tyto modely obvykle sahají od 0,5 do 8 miliard parametrů, překračují kapacitu paměti na čipu a vyžadují přístup k paměti mimo čip, jako je DRAM. To dramaticky zvyšuje požadavek na šířku pásma paměti. Například model s 1 miliardou parametrů může dodat až ~40 tokenů za sekundu za optimálních podmínek s standardním LPDDR4X rozhraním, ale udržení této rychlosti s modelem 4B vyžaduje více než čtyřnásobnou šířku pásma. Bez toho výkon trpí, ne kvůli omezenému výpočtu, ale protože procesor nemůže dodat data dostatečně rychle. Tento nesoulad mezi výpočtem a pamětí je jednou z nejnaléhavějších výzev při nasazování generativní AI na edge. To je dále zesíleno v architekturách, které počítají vrstvu po vrstvě, kde se intermediate výsledky také zvyšují a dále zatěžují šířku pásma.

Jak by měly týmy produktů přehodnotit svou strategii benchmarkingu při navrhování pro reálné edge aplikace?

Týmy produktů by měly opustit závislost na jediném výkonovém metriku, jako je TOPS, a místo toho přijmout benchmarking strategii, která odráží realitu edge nasazení. To začíná tím, že se pochopí konkrétní případ užití, skutečný pracovní zatížení, které procesor musí zvládnout, a identifikuje se “pracovní bod”: průnik výkonu, nákladů a latence. Odtud je důležité vyhodnotit, jak výpočet a paměť interagují za těchto podmínek. Procesor s vysokým TOPS nezajistí, pokud je šířka pásma paměti omezená, a více paměti nepomůže, pokud je kapacita výpočtu nedostatečná.

Týmy by měly posoudit, zda procesor může udržitelně vykonávat úkoly, jako je vnímání, zlepšování a generativní zátěž, každá s velmi odlišnými požadavky. Cílem není optimalizovat pro vrcholné specifikace, ale zajistit vyvážený výkon napříč celou řadou očekávaných případů užití v reálném prostředí.

To je přirozený posun od “sterilních” měřítek k více propracovaným přístupům, které odráží, jak jsou platformy používány a jak jsou hodnoceny – podobně jako to, co se stalo s jinými architekturami, které se staly mainstreamem (například SPEC, Coremark, 3DMark atd.).

Jak ovlivňují omezení výkonu a nákladů architektonická rozhodnutí za Hailo procesory, zejména pro spotřebitelská edge zařízení?

Výkon a náklady jsou dvěma nejdůležitějšími omezeními při navrhování AI procesorů pro edge zařízení, zejména v spotřebitelských produktech. V kompaktních zařízeních, jako jsou IoT senzory nebo chytré domácí asistentky, jsou rozpočty energie úzké, a často není aktivní chlazení, takže energetická efektivita se stává kritickou. Každá další výpočetní nebo paměťová zdroje přidávají spotřebu energie a teplo, což přímo ovlivňuje použitelnost a životnost baterie.

Náklady jsou stejně důležité. Spotřebitelská zařízení musí zůstat v konkurenceschopných cenových bodech, což znamená, že procesor může obsahovat pouze tolik TOPS a paměti, než se stane ekonomicky nevhodným. Tato omezení nutí architektonické kompromisy. Ve společnosti Hailo priorizujeme návrhy, které poskytují správnou rovnováhu mezi výpočtem a pamětí, aby splnily reálné potřeby aplikací v rámci úzkého obalu výkonu a nákladů, zajišťující, že edge AI se stane životaschopným, efektivním a škálovatelným napříč širokou řadou spotřebitelských produktů.

Můžete nás provést, jak definujete “pracovní bod” pro aplikaci a proč je to tak důležité v edge AI nasazení?

Definice “pracovního bodu” je jedním z nejdůležitějších kroků při navrhování systému. Odkazuje se na průnik výkonu, nákladů a latence, které formují, co je realisticky dosažitelné v konkrétním nasazení. Na rozdíl od cloudu, kde můžete vrhnout více výpočtu nebo paměti na problém, edge zařízení operují v rámci pevného obalu. To znamená, že musíte učinit úmyslné kompromisy na základě skutečných požadavků aplikace. Například IoT senzor může priorizovat energetickou efektivitu nad surovým výkonem, zatímco autonomní systém může vyžadovat ultra-nízkou latenci bez ohledu na spotřebu energie. Jakmile je stanoven pracovní bod, můžete vyhodnotit, zda procesor má správnou rovnováhu mezi výpočtem a pamětí, aby splnil tuto potřebu. Není to o maximalizaci specifikací ve všech směrech; je to o zajištění udržitelného, spolehlivého výkonu v reálných podmínkách, se kterými se aplikace setká.

Obecně řečeno, pracovní bod je tam, kde chcete, aby klíčové ukazatele výkonu byly na svém optimu. Selhání při tomto může vést k suboptimálnímu provozu v nejtypičtějších scénářích použití platformy.

Jako jednoduchý příklad můžete vytvořit AI analytický systém, který je extrémně efektivní, když je vstup na velmi vysoké rozlišení, ale pokud je tento nasazen v systémech, které nikdy nedosahují tohoto rozlišení, je tato optimalizace bezvýznamná.

Jak přistupujete k optimalizaci napříč multimodálními modely, kde je video, audio a jazyk často kombinován v moderních zařízeních?

Multimodální modely vyžadují promyšlenou rovnováhu mezi výpočetními a paměťovými zdroji. Každá modalita zatěžuje systém jinak: video je výpočetně náročné kvůli vysokému rozlišení a snímkové frekvenci, zatímco jazyk a audio jsou kompaktnější, ale kladou větší nároky na šířku pásma paměti. V aplikacích, jako je zpracování jazyka a videa, se tento rozpor stává zřejmým (i když to není záruka, ale typický scénář): videozpracování tlačí výpočet, zatímco jazykový model může rychle narazit na paměťové úzké místo.

Přistupujeme k optimalizaci tak, že se díváme, jak tyto zátěže interagují napříč potrubím, a zajišťujeme, aby procesor byl navržen tak, aby je podporoval současně, bez toho, aby jedna modalita kompromitovala výkon druhé.

Jak zvyšující se velikost modelu na edge komplikuje latenci a spotřebu energie, a jakou roli hraje systémová architektura při řešení tohoto?

Jak se velikost modelu zvyšuje na edge, latence a spotřeba energie se stávají obtížněji říditelnými. Větší modely spoléhají více na paměť mimo čip, což zvyšuje jak spotřebu energie, tak zpoždění, zejména když se šířka pásma paměti stává úzkým místem. Například škálování z 1 miliardy na 4 miliardy parametrů by vyžadovalo více než čtyřnásobnou šířku pásma, aby se udržela stejná výkonnost – ale v praxi se výkonnost nezvyšuje lineárně kvůli omezením šířky pásma a systémové architektury.

Není to jen o tom, mít vysoké TOPS nebo velkou paměť; je to o tom, jak tyto komponenty interagují. Vyvážený design zajišťuje, aby výpočet, paměť a šířka pásma pracovaly společně efektivně, aby se zabránilo omezení celého systému.

Jak Hailo navrhuje pro budoucí odolnost – s ohledem na to, jak rychle se vyvíjejí AI modely, zátěže a požadavky na nasazení?

Budoucí odolnost v edge AI znamená navrhnout procesory, které mohou zvládnout širokou škálu vznikajících zátěží. Ve společnosti Hailo se zaměřujeme na vyvážené architektury, které nejsou přizpůsobeny pouze jednomu úkolu, ale mohou podporovat vše od percepčních funkcí, jako je detekce objektů, až po generativní modely, jako jsou VLM. Každý typ zátěže zatěžuje výpočet a paměť jinak, takže navrhujeme pro flexibilitu, aby se zabránilo úzkým místům při přepínání mezi nimi. Také zohledňujeme reálné limity výkonu, nákladů a latence napříč aplikacemi. Prioritizací rozmanitosti zátěží a rovnováhy zdrojů se snažíme podporovat příští generaci edge AI nasazení napříč spotřebitelskými a průmyslovými případy užití.

Jedna velikost však nemůže vyhovovat všem, a naše portfolio cílí na určitou adresovatelnou aplikaci a snaží se vejít do dostupného rozpočtu, například výkonu, formátu a toho, co definuje “pracovní bod”.

Jakou roli hraje vývojářský ekosystém při maximalizaci hodnoty procesoru, a jak zajišťujete, aby týmy mohly plně využít schopností Hailo?

Jako programovatelné zařízení je důležité mít snadno použitelné nástroje pro vývojáře, aby mohli využít potenciál procesoru, zkrátit cestu k nasazení a umožnit nové případy užití. Poskytováním dobře podporovaného prostředí kolem našich procesorů pomáháme týmům přivést AI aplikace k životu napříč širokou škálou případů užití.

Jakou radu byste dali inženýrům nebo CTO, kteří si vybírají svůj první AI akcelerátor pro produkt, který se právě staví?

S vhodnými podmínkami jsem přesvědčen, že existuje velký potenciál inovací, který umožňuje překládat představivost do skutečných produktů. V rychle se měnícím prostředí je výběr akcelerátoru, který umožňuje rychlý koncept-to-deployment cyklus, kritický.

Děkuji za skvělý rozhovor, čtenáři, kteří chtějí se dozvědět více, by měli navštívit Hailo

Antoine je vizionářský líder a spoluzakladatel Unite.AI, který je poháněn neotřesitelnou vášní pro formování a propagaci budoucnosti umělé inteligence a robotiky. Jako sériový podnikatel věří, že umělá inteligence bude mít na společnost stejně disruptivní vliv jako elektřina, a často se chvála na potenciál disruptivních technologií a AGI.