Intervjuer

Avi Baum, CTO i Hailo – Intervju-serie

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Avi Baum, CTO i Hailo, leder selskapets teknologiske visjon og produktinnovasjon. Han har tidligere vært CTO for trådløs tilkobling i Texas Instruments (TXN ), der han drev strategier for tilkoblede mikrokontrollere i IoT- og IIoT-markeder, og har hatt seniorarkitekt- og lederroller i Israels forsvar.

Hailo er et israelsk AI-chipselskap som spesialiserer seg på høy-ytelses-, lav-strøm edge AI-prosessorer for applikasjoner som autonome kjøretøy, smarte kamere og robotikk, støttet av en omfattende programvarepakke og globalt partnerøkosystem.

Kan du dele hva som opprinnelig trakk deg til feltet edge AI og hvordan dine tidlige ingeniørerfaringer formet din tenkning om prosessorutforming?

Min karrierevei tok meg til områder med nye markeder. Under min tid i TI (Texas Instruments), en halvlederleder med langvarig arv, hadde jeg muligheten til å lede systemnivådesign og arkitektur, og ledet avdelingen for produktdefinisjon og senere som CTO for denne avdelingen. Dette ledet meg til å kontinuerlig utforske de nye teknologiene som sannsynligvis vil forme fremtidens ‘ikke-så-fjerne’ fremtid.

Når vi grunnla Hailo i 2017, var det klart at AI, som hadde begynt å blomstre i skyen, også hadde potensialet til å bli en muliggjørende teknologi for edge-enheter. Så, vi satte kurs og begynte denne reisen.

Da generativ AI utvides på kanten, hvorfor er TOPS—tera operasjoner per sekund—ikke lenger et tilstrekkelig mål for å vurdere prosessorprestasjon?

TOPS har lenge vært målet for å vurdere AI-hardware, men i generativ AI-æraen på kanten, er det ikke lenger tilstrekkelig. Naturen til klassiske modeller er å oversette mye data til meningsfulle innsikter, så mengden beregning som trengs for å prosessere innkommende data øker med mengden data som må prosesseres. Modeller for disse oppgavene er vanligvis mindre i størrelse enn mengden data de prosesserer, og gjør overføringshastigheten til å aksessere modellparametere relativt ubetydelig.

Generative modeller, derimot, er merkbart større – i milliarder av parametre, og i disse tilfellene blir minnebandbredde en ikke ubetydelig faktor.

I stedet for å fokusere på TOPS alene, er det kritisk å vurdere hvor godt en prosessor balanserer beregning og minne under virkelige forhold. Det handler ikke om å jage det høyeste tallet; det handler om å justere arkitekturen til arbeidsbelastningene det må håndtere.

Hvorfor blir minnebandbredde nå en mer kritisk flaskehals enn beregning i edge AI-arbeidsbelastninger, særlig for LLM og VLM?

For edge AI-arbeidsbelastninger, spesielt de som involverer LLM eller VLM, blir minnebandbredde raskt den primære flaskehalsen. Disse modellene er vanligvis fra 0,5 til 8 milliarder parametre, og overstiger kapasiteten til på-chip-minne og krever tilgang til off-chip-minne som DRAM. Dette øker dramatisk kravene til minnebandbredde. For eksempel kan en 1 milliards parameters modell levere opp til ~40 token per sekund under optimale forhold med en standard LPDDR4X-grensesnitt, men å opprettholde denne hastigheten med en 4 milliards parameters modell krever over fire ganger så mye bandbredde. Uten det, lider ytelsen, ikke fordi beregningen er begrenset, men fordi prosessoren ikke kan mata inn data raskt nok. Denne ubalansen mellom beregning og minne er en av de mest presserende utfordringene i å deployere generativ AI på kanten. Dette er ytterligere forsterket i arkitekturer som beregner lag for lag, hvor midlertidige resultater også øker minnetrafikk og ytterligere belaster bandbredde.

Hvordan bør produktteamene omdefinere sin benchmark-strategi når de designer for virkelige edge-applikasjoner?

Produktteamene bør gå bort fra å avhengig av en enkelt ytelsesmåling som TOPS og i stedet adoptere en benchmark-strategi som reflekterer realitetene i edge-deployment. Det starter med å forstå den spesifikke brukssaken, den faktiske arbeidsbelastningen prosessoren må håndtere, og identifisere «arbeidspunktet»: skjæringspunktet mellom kraft, kostnad og forsinkelsesbegrensninger. Deretter handler det om å vurdere hvordan beregning og minne samhandler under disse forholdene. En prosessor med høy TOPS vil ikke levere hvis minnebandbredde er begrenset, og mer minne vil ikke hjelpe hvis beregningskapasiteten er utilstrekkelig.

Teamene bør vurdere om prosessoren kan opprettholde ytelse over oppgaver som persepsjon, forbedring og generative arbeidsbelastninger, hver med svært forskjellige krav. Målet er ikke å optimere for toppspecifikasjoner, men å sikre balansert ytelse over hele rekken av forventede brukssaker i virkelige miljøer.

Dette er en naturlig skift fra ‘sterile’ målinger til mer intrikate tilnærminger som reflekterer hvordan plattformene brukes og hvordan de vurderes – lignende hva som skjedde med andre arkitekturer som ble mainstream (f.eks. SPEC, Coremark, 3DMark osv.).

Hvordan påvirker kraft- og kostnadsbegrensninger arkitekturbeslutningene bak Hailo-prosessorer, særlig for forbrukerrettede edge-enheter?

Kraft og kostnad er to av de mest avgjørende begrensningene når man designer AI-prosessorer for edge-enheter, særlig i forbrukerrettede produkter. I kompakte enheter som IoT-sensore eller smarte hjemmeassistenter er kraftbudsjettene stramme, og det er ofte ingen aktiv kjøling, så energieffektivitet blir kritisk. Hver ekstra beregnings- eller minneressurs legger til kraftforbruk og varme, som direkte påvirker brukbarheten og batterilevetiden.

Kostnad er like influerende. Forbrukerprodukter må forbli innen konkurranseprispunkter, noe betyr at prosessoren bare kan inkludere så mye TOPS og minne før det blir økonomisk uholdbart. Disse begrensningene tvinger tøffe arkitekturvalg. I Hailo prioriterer vi design som leverer riktig balanse mellom beregning og minne for å møte virkelige applikasjonsbehov innen en stram envelope av kraft og kostnad, og sikrer at edge AI blir levedyktig, effektiv og skalerbar over en rekke forbrukerprodukter.

Kunne du gå gjennom hvordan du definerer et «arbeidspunkt» for en applikasjon og hvorfor det betyr så mye i edge AI-deployment?

Definere «arbeidspunktet» er ett av de viktigste stegene når man designer et system. Det refererer til skjæringspunktet mellom kraft-, kostnads- og forsinkelsesbegrensninger som former hva som realistisk kan oppnås i en bestemt deployering. I motsetning til i skyen, hvor du kan kaste mer beregning eller minne på et problem, opererer edge-enheter innen en fast envelope. Det betyr at du må gjøre bevisste valg basert på applikasjonens faktiske krav. For eksempel kan en IoT-sensor prioritere energieffektivitet over rå ytelse, mens et autonomt system kan kreve ultralav forsinkelse uavhengig av kraftforbruk. Når arbeidspunktet er etablert, kan du vurdere om prosessoren har riktig balanse mellom beregning og minne for å møte dette behovet. Det handler ikke om å maksimere spesifikasjoner i alle retninger; det handler om å sikre vedvarende, pålitelig ytelse i virkelige forhold applikasjonen vil møte.

Generelt sett er arbeidspunktet der du ønsker at nøkkelindikatorene skal være på sitt optimum. Å ikke gjøre dette kan resultere i en underoptimal drift under de mest typiske bruks scenariene for plattformen.

Som et enkelt eksempel kunne man gjøre et AI-analyse system ekstremt effektivt når inndata er på en svært høy oppløsning, men hvis dette deployeres i systemer som aldri når denne oppløsningen, er denne optimaliseringen meningsløs.

Med video, lyd og språk ofte blandet i moderne enheter, hvordan nærmer du deg optimalisering over multimodale modeller?

Multimodale modeller krever en forsiktig balanse mellom beregnings- og minneressurser. Hver modalitet belaster systemet forskjellig: video er beregningsintensivt på grunn av høy oppløsning og bildehastighet, mens språk og lyd er mer kompakte, men plasserer tungere krav på minnebandbredde. I applikasjoner som visjon-språkbehandling blir denne splitten tydelig (selv om dette ikke er en garanti, men en typisk scenario): video-behandling driver beregning, mens språkmodellen kan raskt nå minnebottlenecks.

Vi nærmer oss optimalisering ved å se på hvordan disse arbeidsbelastningene samhandler over pipeline og sikre at prosessoren er arkitektet for å støtte dem samtidig, uten å la en modalitet kompromittere ytelsen til en annen.

Hvordan komplicerer økende modellstørrelse på kanten latency og kraftforbruk, og hva rolle spiller systemnivåarkitektur i å løse dette?

Når modellstørrelsen øker på kanten, blir latency og kraftforbruk vanskeligere å håndtere. Større modeller avhenger mer av off-chip-minne, som øker både energibruken og forsinkelsen, spesielt når minnebandbredde blir en flaskehals. For eksempel ville å skalerer fra en 1 milliards parameters modell til en 4 milliards parameters modell kreve over fire ganger så mye bandbredde for å opprettholde samme ytelse – men i praksis skalerer ikke ytelsen lineært på grunn av bandbredde- og systemnivåbegrensninger.

Det handler ikke bare om å ha høy TOPS eller stor minne; det handler om hvordan disse komponentene samhandler. En balansert design sikrer at beregning, minne og bandbredde fungerer effektivt sammen, og forhindrer at en ressurs begrenser hele systemet.

Hvordan designer Hailo for fremtidssikring – gitt hvor raskt AI-modeller, arbeidsbelastninger og deployeringskrav utvikler seg?

Fremtidssikring i edge AI betyr å designe prosessorer som kan håndtere en rekke utviklende arbeidsbelastninger. I Hailo fokuserer vi på balanserte arkitekturer som ikke er tilpasset bare en oppgave, men kan støtte alt fra perseptuelle funksjoner som objektdeteksjon til generative modeller som VLM. Hver type arbeidsbelastning belaster beregning og minne forskjellig, så vi designer for fleksibilitet, og unngår flaskehalser når vi bytter mellom dem. Vi tar også hensyn til de virkelige grensene for kraft, kostnad og forsinkelse over applikasjoner. Ved å prioritere arbeidsbelastningsdiversitet og ressursbalanse, sikter vi på å støtte neste generasjon edge AI-deployeringer over forbruker- og industrielle brukssaker.

Likevel kan en størrelse ikke passe alle, og porteføljen måler seg mot bestemte anvendelige applikasjoner og prøver å passe innen det tilgjengelige budsjettet for eksempelvis kraft, formfaktor og det definerer et ‘arbeidspunkt’.

Hva rolle spiller utviklerøkosystemet i å maksimere verdien av en prosessor, og hvordan sikrer dere at teamene kan gjøre fullt bruk av Hailos kapasiteter?

Som en programmerbar enhet er det essensielt å ha enkeltverktøy for utviklere til å utøve prosessorpotensialet, forkorte veien til deployering og muliggjøre nye brukssaker. Ved å tilby en velstøttet miljø rundt våre prosessorer, hjelper vi teamene med å bringe AI-applikasjoner til live over en rekke brukssaker.

Hva råd ville du gi til ingeniører eller CTO-er som velger sin første AI-akselerator for et neste-generasjonsprodukt som bygges i dag?

Med de modne betingelsene, tror jeg det er mye innovasjonspotensiale, som lar oss oversette fantasien til virkelige produkter. I et raskt endrende miljø er det kritisk å velge en akselerator som muliggjør en rask konsept-til-deployeringscyklus.

Takk for det flotte intervjuet, lesere som ønsker å lære mer bør besøke Hailo

Antoine er en visjonær leder og medgrunnlegger av Unite.AI, drevet av en urokkelig lidenskap for å forme og fremme fremtiden for AI og robotikk. En serial entrepreneur, han tror at AI vil være like disruptiv for samfunnet som elektrisitet, og blir ofte fanget i å prise potensialet for disruptive teknologier og AGI.

Som en futurist, er han dedikert til å utforske hvordan disse innovasjonene vil forme vår verden. I tillegg er han grunnlegger av Securities.io, en plattform som fokuserer på å investere i banebrytende teknologier som definerer fremtiden og omformer hele sektorer.