Intervjuer
Avi Baum, CTO på Hailo – Intervju-serie

Avi Baum, CTO på Hailo, leder företagets tekniska vision och produktinnovation. Han har tidigare tjänstgjort som CTO för trådlös anslutning på Texas Instruments (TXN ), där han drev strategier för anslutna MCU:er på IoT- och IIoT-marknader, och haft seniora arkitekt- och ledningsroller inom Israels försvarsmakt.
Hailo är ett israeliskt AI-chipföretag som specialiserar sig på högpresterande, lågeffektskant-AI-processorer för tillämpningar som autonoma fordon, smarta kameror och robotik, som stöds av en omfattande programvarusvit och globalt partnernätverk.
Kan du berätta vad som ursprungligen drog dig till området edge-AI och hur dina tidiga ingenjörsupplevelser formade ditt tänkande kring processordesign?
Min karriärsväg förde mig till områden med nya marknader. Under min tid på TI (Texas Instruments), en halvledarledare med en lång tradition, hade jag möjlighet att leda systemnivådesign och arkitektur, och senare tjänstgjorde som CTO för denna avdelning. Detta ledde mig att kontinuerligt utforska de uppkommande teknologierna som sannolikt kommer att forma den “inte så avlägsna” framtiden.
När vi grundade Hailo 2017 var det tydligt att AI, som hade börjat blomstra i molnet, också hade potentialen att bli en möjliggörande teknik för kantenheter. Så vi satte kursen och påbörjade denna resa.
Medan generativ AI utvecklas på kanten, varför är TOPS – teraoperationer per sekund – inte längre tillräckligt som mått för att utvärdera processorns prestanda?
TOPS har länge varit det vanliga måttet för att utvärdera AI-hårdvara, men i eran av generativ AI på kanten är det inte längre tillräckligt. Naturen hos klassiska modeller är att översätta stora mängder data till meningsfulla insikter, så mängden beräkningar som behövs för att bearbeta inkommande data ökar med mängden data som måste bearbetas. Modeller för dessa uppgifter är vanligtvis mindre i storlek än den mängd data de bearbetar, vilket gör att överföringsbandbredden som tillskrivs åtkomst till modellparametrar är relativt försumbar.
Generativa modeller, å andra sidan, är märkbart större – i miljardersparameterns domän – och i dessa fall blir minnesbandbredden en icke-försumbar faktor.
I stället för att fokusera på TOPS ensamt är det avgörande att bedöma hur väl en processorn balanserar beräkningar och minne under realistiska förhållanden. Det handlar inte om att jaga det högsta numret, utan om att anpassa arkitekturen till de arbetsbelastningar som den måste hantera.
Varför blir minnesbandbredd nu en mer kritisk flaskhals än beräkning i kant-AI-arbetsbelastningar, särskilt för LLM och VLM?
För kant-AI-arbetsbelastningar, särskilt de som involverar LLM eller VLM, blir minnesbandbredd snabbt den primära flaskhalsen. Dessa modeller är vanligtvis i storleksordningen 0,5 till 8 miljarder parametrar, vilket överstiger kapaciteten för minne på chip och kräver åtkomst till minne utanför chip, som DRAM. Detta ökar dramatiskt kraven på minnesbandbredd. Till exempel kan en 1-miljardersparameterversion leverera upp till ~40 token per sekund under optimala förhållanden med en standard-LPDDR4X-gränssnitt, men för att upprätthålla den takten med en 4-miljardersversion krävs över fyra gånger så stor bandbredd. Utan det lider prestandan, inte på grund av begränsad beräkning, utan för att processorn inte kan mata in data tillräckligt snabbt. Denna obalans mellan beräkning och minne är en av de mest pressande utmaningarna i att distribuera generativ AI på kanten. Detta förstärks ytterligare i arkitekturer som beräknar lager för lager, där mellanresultat också ökar minnestrafik och ytterligare belastar bandbredden.
Hur bör produktteam ompröva sin benchmark-strategi när de utformar för verkliga kanttillämpningar?
Produktteam bör gå bort från att förlita sig på en enda prestandamått som TOPS och i stället anta en benchmark-strategi som återspeglar verkligheten i kantdistribution. Det börjar med att förstå det specifika användningsfallet, den faktiska arbetsbelastning som processorn måste hantera, och identifiera “arbetspunkten”: skärningspunkten för effekt-, kostnads- och latensbegränsningar. Därifrån handlar det om att utvärdera hur beräkning och minne samverkar under dessa förhållanden. En processorn med höga TOPS kommer inte att leverera om minnesbandbredden är begränsad, och mer minne kommer inte att hjälpa om beräkningskapaciteten är otillräcklig.
Team bör bedöma om processorn kan upprätthålla prestanda över uppgifter som perception, enhetlig och generativ arbetsbelastning, var och en med mycket olika krav. Målet är inte att optimera för toppspecifikationer, utan att säkerställa balanserad prestanda över hela det förväntade användningsområdet i verkliga miljöer.
Detta är en naturlig övergång från “sterila” mått till mer invecklade tillvägagångssätt som återspeglar hur plattformar används och hur de betygsätts – liknande vad som hände med andra arkitekturer som blev mainstream (t.ex. SPEC, Coremark, 3DMark osv.).
Hur påverkar effekt- och kostnadsbegränsningar arkitekturbesluten bakom Hailo-processorer, särskilt för konsumentinriktade kantenheter?
Effekt och kostnad är två av de mest avgörande begränsningarna när man utformar AI-processorer för kantenheter, särskilt i konsumentinriktade produkter. I kompakta enheter som IoT-sensorer eller smarta hemassistenter är effektbudgetar tajta, och det finns ofta ingen aktiv kylning, så energieleffektivitet blir avgörande. Varje ytterligare beräknings- eller minnesresurs lägger till effekt och värme, vilket direkt påverkar användbarhet och batterilivslängd.
Kostnad är lika inflytelserik. Konsumentenheter måste stanna inom konkurrenskraftiga prispunkter, vilket innebär att processorn bara kan innehålla så mycket TOPS och minne innan det blir ekonomiskt ohållbart. Dessa begränsningar tvingar fram hårda arkitekturval. På Hailo prioriterar vi design som levererar rätt balans mellan beräkning och minne för att möta verkliga tillämpningsbehov inom en tajt omfattning av effekt och kostnad, vilket säkerställer att kant-AI blir livskraftig, effektiv och skalbar över ett brett spektrum av konsumentprodukter.
Kunde du gå igenom hur du definierar en “arbetspunkt” för en tillämpning och varför det är så viktigt i kant-AI-distribution?
Att definiera “arbetspunkten” är ett av de viktigaste stegen när man utformar ett system. Det hänvisar till skärningspunkten för effekt-, kostnads- och latensbegränsningar som formar vad som realistiskt kan uppnås i en specifik distribution. Till skillnad från i molnet, där man kan kasta mer beräkning eller minne på ett problem, opererar kantenheter inom en fast omfattning. Det betyder att man måste göra medvetna val baserat på tillämpningens faktiska krav. Till exempel kan en IoT-sensor prioritera energieleffektivitet över råprestanda, medan ett autonomt system kan kräva ultralåg latens oavsett effekt. När arbetspunkten är etablerad kan man utvärdera om processorn har rätt balans mellan beräkning och minne för att möta det behovet. Det handlar inte om att maximera specifikationer i alla riktningar, utan om att säkerställa hållbar, tillförlitlig prestanda i de verkliga förhållanden som tillämpningen kommer att möta.
Generellt sett är arbetspunkten där man vill att nyckelprestandaindikatorerna ska vara på sin topp. Att misslyckas med detta kan resultera i en underoptimal drift under de vanligaste användningsfallen för plattformen.
Som ett enkelt exempel kan man göra ett AI-analyssystem extremt effektivt när indata är i mycket hög upplösning, men om detta distribueras i system som aldrig når denna upplösning, är denna optimering meningslös.
Med video, ljud och språk ofta blandade i moderna enheter, hur närmar du dig optimering över multimodala modeller?
Multimodala modeller kräver en genomtänkt balans mellan beräknings- och minnesresurser. Varje modalitet belastar systemet på olika sätt: video är beräkningsintensivt på grund av hög upplösning och bildfrekvens, medan språk och ljud är mer kompakta men lägger tunga krav på minnesbandbredd. I tillämpningar som vision-språkbehandling blir denna uppdelning tydlig (även om detta inte är en garanti, utan ett typiskt scenario): video bearbetning trycker beräkning, medan språkmodellen kan snabbt nå minnesbegränsningar.
Vi närmar oss optimering genom att titta på hur dessa arbetsbelastningar interagerar över pipeline och säkerställa att processorn är utformad för att stödja dem samtidigt, utan att låta en modalitet kompromissa med prestandan för en annan.
Hur komplicerar ökande modellstorlek på kanten latens och effekt, och vilken roll spelar systemnivåarkitektur för att lösa det?
När modellstorleken ökar på kanten blir latens och effekt svårare att hantera. Större modeller förlitar sig mer på minne utanför chip, vilket ökar både energiförbrukning och fördröjning, särskilt när minnesbandbredden blir en flaskhals. Till exempel skulle en ökning från en 1-miljardersparameterversion till en 4-miljardersversion kräva över fyra gånger så stor bandbredd för att upprätthålla samma prestanda – men i praktiken skalar prestandan inte linjärt på grund av bandbredds- och systemnivåbegränsningar.
Det handlar inte bara om att ha höga TOPS eller stort minne; det handlar om hur dessa komponenter interagerar. En balanserad design säkerställer att beräkning, minne och bandbredd fungerar effektivt tillsammans, förhindrar att en resurs begränsar hela systemet.
Hur utformar Hailo för framtidsbevisning – med tanke på hur snabbt AI-modeller, arbetsbelastningar och distributionskrav utvecklas?
Framtidsbevisning i kant-AI innebär att utforma processorer som kan hantera ett brett spektrum av utvecklande arbetsbelastningar. På Hailo fokuserar vi på balanserade arkitekturer som inte är anpassade till en enda uppgift, utan kan stödja allt från perceptiva funktioner som objektdetektering till generativa modeller som VLM. Varje typ av arbetsbelastning belastar beräkning och minne på olika sätt, så vi utformar för flexibilitet, undviker flaskhalsar när man växlar mellan dem. Vi tar också hänsyn till de verkliga begränsningarna för effekt, kostnad och latens över tillämpningar. Genom att prioritera arbetsbelastningsdiversitet och resursbalans syftar vi till att stödja nästa generation av kant-AI-distributioner över konsument- och industriella användningsfall.
Men en storlek kan inte passa alla, och portföljen riktar sig till vissa tillgängliga tillämpningar och försöker passa inom den tillgängliga budgeten för t.ex. effekt, formfaktor och det definierar en “arbetspunkt”.
Vilken roll spelar utvecklar-ekosystemet för att maximera värdet av en processorn, och hur säkerställer ni att team kan utnyttja Hailos förmågor fullt ut?
Som en programmerbar enhet är det avgörande att ha lättanvända verktyg för utvecklare att utöva processorns potential, förkorta vägen till distribution och möjliggöra nya användningsfall. Genom att tillhandahålla ett välstödd miljö runt våra processorer hjälper vi team att förverkliga AI-tillämpningar över ett brett spektrum av användningsfall.
Vad råd skulle du ge till ingenjörer eller CTO:er som väljer sin första AI-accelerator för en nästa generationsprodukt som byggs idag?
Med de mogna förhållandena tror jag att det finns en stor innovationspotential, som möjliggör att vi kan översätta fantasin till verkliga produkter. I en snabbt föränderlig miljö är det avgörande att välja en accelerator som möjliggör en snabb koncept-till-distributionscykel.
Tack för det underbara samtalet, läsare som vill lära sig mer bör besöka Hailo.












