Tankeledere
Fremtiden for generativ AI er kanten

Introduksjonen av ChatGPT og generativ AI generelt er et vendepunkt i teknologiens historie og ligner på begynnelsen av internett og smartphone. Generativ AI har vist ubegrensede muligheter i sin evne til å holde intelligente samtaler, bestå eksamen, generere komplekse programmer/kode og skape imponerende bilder og videoer. Mens GPU kjører de fleste Gen AI-modeller i skyen – både for trening og inferens – er dette ikke en langsiktig skalerbar løsning, særlig for inferens, på grunn av faktorer som inkluderer kostnad, kraft, latency, personvern og sikkerhet. Denne artikkelen behandler hver av disse faktorene sammen med motivasjonseksempler for å flytte Gen AI-beregninger til kanten.
De fleste applikasjonene kjører på høytytende prosessorer – enten på enhet (f.eks. smartphones, desktop, bærbare datamaskiner) eller i datacenter. Ettersom andelen av applikasjoner som bruker AI utvides, er disse prosessorene med bare CPUer utilstrekkelige. Videre driver den raske utvidelsen av generative AI-arbeidsbelastninger en eksponentiell etterspørsel etter AI-aktiverede servere med dyre, kraftkrevede GPUer som igjen driver opp infrastrukturkostnadene. Disse AI-aktiverede serverne kan koste opp til 7 ganger prisen av en vanlig server, og GPUer står for 80% av denne økte kostnaden.
I tillegg forbruker en skybasert server 500W til 2000W, mens en AI-aktiveret server forbruker mellom 2000W og 8000W – 4 ganger mer! For å støtte disse serverne, trenger datacenter ekstra kjølemoduler og infrastrukturoppgraderinger – som kan være enda høyere enn investeringen i beregning. Datacenter forbruker allerede 300 TWH per år, nærmere 1% av den totale verdensomspændende kraftforbruk. Hvis trendene for AI-adoptsjon fortsetter, kan så mye som 5% av verdens kraftforbruk bli brukt av datacenter innen 2030. I tillegg er det en utenkelig investering i generativ AI-datacenter. Det estimeres at datacenter vil forbruke opp til 500 milliarder dollar for kapitalutgifter innen 2027, hovedsakelig drevet av AI-infrastrukturbehov.

Forbruket av elektrisitet i datacenter, allerede 300 TwH, vil øke betydelig med adopsjonen av generativ AI.
AI-beregningkostnad samt energiforbruk vil hindre masseadopsjon av generativ AI. Skaleringutfordringer kan overvinnes ved å flytte AI-beregning til kanten og bruke prosesseringsløsninger optimalisert for AI-arbeidsbelastninger. Med denne tilnærmingen oppnår kunden også andre fordeler, inkludert latency, personvern, pålitelighet samt økt evne.
Beregning følger data til kanten
Siden AI oppsto fra den akademiske verden for et tiår siden, har trening og inferens av AI-modeller skjedd i skyen/datacenter. Ettersom mye av dataene genereres og forbrukes på kanten – spesielt video – var det bare logisk å flytte inferensen av dataene til kanten, og dermed forbedre den totale eierkostnaden (TCO) for bedrifter på grunn av reduserte nettverks- og beregningskostnader. Mens AI-inferenskostnadene på skyen er gjentakende, er kostnaden for inferens på kanten en engangskost for hårdware. I virkeligheten reduserer tillegget av et Edge AI-prosessor den totale driftskostnaden. Liksom migreringen av konvensjonelle AI-arbeidsbelastninger til kanten (f.eks. apparat, enhet), vil generative AI-arbeidsbelastninger følge samme mønster. Dette vil bringe betydelige besparelser til bedrifter og forbrukere.
Flyttingen til kanten kombinert med en effektiv AI-akselerator for å utføre inferensfunksjoner leverer også andre fordeler. Fremst blant disse er latency. For eksempel i spillapplikasjoner kan ikke-spillerkarakterer (NPCer) kontrolleres og utvides med generativ AI. Ved å bruke LLM-modeller som kjører på Edge AI-akseleratorer i en spillkonsoll eller PC, kan spillere gi disse karakterene spesifikke mål, så de kan delta meningsfullt i historien. Den lave latencyen fra lokal kantinferens vil tillate NPC-tale og bevegelser å reagere på spillernes kommandoer og handlinger i sanntid. Dette vil levere en svært imersiv spilloplevelse på en kostnadseffektiv og strømeffektiv måte.
I applikasjoner som helse, er personvern og pålitelighet ekstremt viktig (f.eks. pasientevaluering, legemiddel-anbefalinger). Data og de tilhørende Gen AI-modellene må være på stedet for å beskytte pasientdata (personvern), og enhver nettverksfeil som blokkerer tilgang til AI-modeller i skyen kan være katastrofalt. En Edge AI-applikasjon som kjører en Gen AI-modell som er spesialbygget for hver bedriftskunde – i dette tilfelle en helseleverandør – kan løse problemene med personvern og pålitelighet på en måte som også gir lavere latency og kostnad.

Mange Gen AI-modeller som kjører på skyen kan være nær en billion parametre – disse modellene kan effektivt håndtere generelle spørsmål. Men bedriftsspesifikke applikasjoner krever at modellene leverer resultater som er relevante for bruksområdet. Ta eksemplet på en Gen AI-basert assistent bygget for å ta bestillinger på en raskmatrestaurant – for at dette systemet skal ha en sømløs kundeinteraksjon, må den underliggende Gen AI-modellen være trent på restaurantens menyelementer, og også kjenne til allergener og ingredienser. Modellstørrelsen kan optimaliseres ved å bruke en superset Large Language Model (LLM) for å trene en relativt liten, 10-30 milliarder parameter LLM, og deretter bruke ytterligere finjustering med kundespesifikke data. Slike modeller kan levere resultater med økt nøyaktighet og evne. Og gitt modellens mindre størrelse, kan den effektivt deployes på en AI-akselerator på kanten.
Gen AI vil vinne på kanten
Det vil alltid være et behov for Gen AI som kjører i skyen, særlig for generelle formål som ChatGPT og Claude. Men når det kommer til bedriftsspesifikke applikasjoner, som Adobes Photoshop-generative fylling eller Github Copilot, er Generativ AI på kanten ikke bare fremtiden, men også nåtiden. Spesialbygde AI-akseleratorer er nøkkelen til å gjøre dette mulig, særlig for generelle formål som ChatGPT og Claude. Men når det kommer til bedriftsspesifikke applikasjoner, som Adobes Photoshop-generative fylling eller Github Copilot, er Generativ AI på kanten ikke bare fremtiden, men også nåtiden. Spesialbygde AI-akseleratorer er nøkkelen til å gjøre dette mulig.












