Tankeledere

Fremtiden for Generative AI er Edge

mm
Føj Unite.AI til dine foretrukne kilder på Google

Introduktionen af ChatGPT og Generative AI generelt er et vendepunkt i teknologiens historie og ligner begyndelsen på internettet og smartphoneæraen. Generative AI har vist ubegrænsede muligheder i sin evne til at føre intelligente samtaler, bestå eksaminer, generere komplekse programmer/kode og skabe øjenfaldende billeder og video. Mens de fleste Gen AI-modeller køres på GPU’er i skyen – både til træning og inferens – er dette ikke en langsigtsorienteret skalerbar løsning, især til inferens, på grund af faktorer som omkostninger, strøm, latency, privatliv og sikkerhed. Denne artikel behandler hver af disse faktorer sammen med motiverende eksempler til at flytte Gen AI-computebelastninger til edge.

De fleste applikationer køres på højtydende processorer – enten på enheden (f.eks. smartphones, stationære computere, bærbare computere) eller i datacentre. Da andelen af applikationer, der anvender AI, udvides, er disse processorer med kun CPU’er utilstrækkelige. Desuden driver den hurtige udvidelse af Generative AI-arbejdsbelastninger en eksponentiel efterspørgsel efter AI-aktiverede servere med dyre, strømslugende GPU’er, hvilket igen driver op for infrastrukturkostene. Disse AI-aktiverede servere kan koste op til 7 gange prisen for en almindelig server, og GPU’er står for 80% af denne ekstra omkostning.

Dertil forbruger en skybaseret server 500W til 2000W, mens en AI-aktiveret server forbruger mellem 2000W og 8000W – 4 gange mere! For at understøtte disse servere har datacentre brug for ekstra kølemoduler og infrastruktur-opgraderinger – hvilket kan være endnu højere end investeringen i beregning. Datacentre forbruger allerede 300 TWH om året, næsten 1% af den samlede verdensomspændende strømforbrug. Hvis AI-adoptions-tendenserne fortsætter, kan op til 5% af verdensomspændende strømforbrug blive brugt af datacentre omkring 2030. Derudover er der en uden precedent investering i Generative AI-datacentre. Det estimeres, at datacentre vil forbruge op til 500 milliarder dollar for kapitaludgifter i 2027, primært drevet af AI-infrastrukturkrav.

Forbrug af el af datacentre, allerede 300 TwH, vil stige betydeligt med adoptionen af generativ AI.

AI-computekost samt energiforbrug vil hindre massetilslutning af Generative AI. Skaleringudfordringer kan overvindes ved at flytte AI-compute til edge og bruge procesløsninger, der er optimeret til AI-arbejdsbelastninger. Med denne tilgang opnås andre fordele til kunden, herunder latency, privatliv, pålidelighed samt øget kapacitet.

Compute følger data til Edge

Siden AI dukkede op fra den akademiske verden for et årti siden, er træning og inferens af AI-modeller sket i skyen/datacentret. Da meget af data genereres og forbruges på edge – især video – gjorde det kun mening at flytte inferensen af data til edge, hvilket forbedrer den samlede ejeromkostning (TCO) for virksomheder på grund af reducerede netværks- og computekostninger. Mens AI-inferenskostene på skyen er tilbagevendende, er omkostningen ved inferens på edge en engangs, hardware-omkostning. I virkeligheden reducerer tilføjelsen af et Edge AI-processor den samlede driftsomkostning. Ligesom migrationen af konventionelle AI-arbejdsbelastninger til Edge (f.eks. apparat, enhed), vil Generative AI-arbejdsbelastninger følge samme mønster. Dette vil bringe betydelige besparelser til virksomheder og forbrugere.

Flytningen til edge kombineret med en effektiv AI-accelerator til at udføre inferensfunktioner leverer også andre fordele. Frem for alt er det latency. For eksempel i gaming-applikationer kan ikke-spiller-karakterer (NPC’er) styres og forbedres med generativ AI. Ved hjælp af LLM-modeller, der køres på edge-AI-accelleratorer i en gaming-konsol eller pc, kan spillere give disse karakterer bestemte mål, så de kan deltage meningsfuldt i historien. Den lave latency fra lokal edge-inferens vil tillade NPC-tale og bevægelser at reagere på spillernes kommandoer og handlinger i realtid. Dette vil levere en meget immersiv gaming-oplevelse på en kosteffektiv og strømsparende måde.

I applikationer som sundhedspleje er privatliv og pålidelighed ekstremt vigtigt (f.eks. patientevaluering, medicin-anbefalinger). Data og de tilhørende Gen AI-modeller skal være på stedet for at beskytte patientdata (privatliv) og enhver netværksfejl, der blokerer adgang til AI-modeller i skyen, kan være katastrofalt. En Edge AI-applikation, der kører en Gen AI-model, der er specialbygget til hver virksomhedskunde – i dette tilfælde en sundhedsudbyder – kan uden problemer løse problemerne med privatliv og pålidelighed, samtidig med at den leverer lavere latency og omkostninger.

Generative AI på edge-enheder vil sikre lav latency i gaming og bevare patientdata og forbedre pålideligheden for sundhedspleje.

Mange Gen AI-modeller, der køres på skyen, kan være tæt på en billion parametre – disse modeller kan effektivt besvare generelle spørgsmål. Men virksomhedsspecifikke applikationer kræver, at modellerne leverer resultater, der er relevante for brugsfaldet. Tag for eksempel et Gen AI-baseret assistentbygget til at tage ordrer på en fastfood-restaurant – for at dette system kan have en problemfri kundeinteraktion, skal den underliggende Gen AI-model være trænet på restaurantens menuitems, samt kende allergener og ingredienser. Modelstørrelsen kan optimeres ved at bruge en superset Large Language Model (LLM) til at træne en relativt lille, 10-30 milliard parameter LLM og derefter bruge yderligere finjustering med kundespecifik data. En sådan model kan levere resultater med øget nøjagtighed og kapacitet. Og givet modelens mindre størrelse kan den effektivt deployes på en AI-accelerator på Edge.

Gen AI vil vinde på Edge

Der vil altid være et behov for Gen AI, der køres på skyen, især til generelle formål som ChatGPT og Claude. Men når det kommer til virksomhedsspecifikke applikationer, såsom Adobe Photoshops generative fyldning eller Github copilot, er Generative AI på Edge ikke kun fremtiden, men også nutiden. Specialbyggede AI-accelleratorer er nøglen til at gøre dette muligt.

Som Silicon Valley-veteran og CEO af Kinara Inc, bringer Ravi Annavajjhala mere end 20 års erfaring, der spænder over forretningsudvikling, marketing og ingeniørarbejde, hvor han bygger førende teknologiprodukter og bringer dem på markedet. I sin nuværende rolle som administrerende direktør for Deep Vision, fungerer Ravi i bestyrelsen og har samlet 50M $, hvor han har taget selskabets Ara-1 processor fra pre-silicon til fuld skala produktion og til at øge den 2. generations processor, Ara-2, i volumen. Før han tiltrådte Deep Vision, havde Ravi ledende stillinger i Intel og SanDisk, hvor han spillede nøgleroller i at drive indtægtsvækst, udvikle strategiske partnerskaber og udvikle produktveje, der ledte industrien med førende funktioner og muligheder.