Tankeledare

Framtiden för generativ AI är Edge

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Introduktionen av ChatGPT och generativ AI i allmänhet är en vattendelare i teknikhistorien och liknas vid internetets och smarttelefonens födelse. Generativ AI har visat obegränsad potential i sin förmåga att hålla intelligenta samtal, klara prov, generera komplexa program/kod och skapa ögonblicksbildande bilder och video. Medan de flesta Gen AI-modeller körs på molnet – både för utbildning och inferens – är detta inte en långsiktig skalbar lösning, särskilt för inferens, på grund av faktorer som inkluderar kostnad, effekt, latency, sekretess och säkerhet. Denna artikel behandlar var och en av dessa faktorer tillsammans med motiverande exempel för att flytta Gen AI-beräkningsarbetsbelastningar till edge.

De flesta applikationer körs på högpresterande processorer – antingen på enheten (t.ex. smartphones, stationära datorer, bärbara datorer) eller i datacenter. När andelen applikationer som använder AI utökas är dessa processorer med endast CPU:er otillräckliga. Dessutom driver den snabba expansionen av Generative AI-arbetsbelastningar en exponentiell efterfrågan på AI-aktiverade servrar med dyra, energikrävande GPU:er som i sin tur driver upp infrastrukturkostnaderna. Dessa AI-aktiverade servrar kan kosta upp till 7 gånger priset för en vanlig server och GPU:er står för 80 % av denna ökade kostnad.

Dessutom förbrukar en molnbaserad server 500 W till 2000 W, medan en AI-aktiverad server förbrukar mellan 2000 W och 8000 W – 4 gånger mer! För att stödja dessa servrar behöver datacenter ytterligare kylmoduler och infrastrukturuppgraderingar – som kan vara ännu högre än investeringen i beräkningar. Datacenter förbrukar redan 300 TWh per år, nästan 1 % av den totala globala elförbrukningen. Om trenderna för AI-antagande fortsätter, kan så mycket som 5 % av den globala elförbrukningen användas av datacenter till 2030. Dessutom görs en utanförordentlig investering i Generative AI-datacenter. Det beräknas att datacenter kommer att förbruka upp till 500 miljarder dollar för kapitalutgifter till 2027, främst driven av AI-infrastrukturkrav.

Elförbrukningen i datacenter, redan 300 TWh, kommer att öka betydligt med antagandet av generativ AI.

AI-beräkningskostnad samt energiförbrukning kommer att hindra massantagandet av Generative AI. Skalningsutmaningar kan övervinnas genom att flytta AI-beräkningar till edge och använda bearbetningslösningar som är optimerade för AI-arbetsbelastningar. Med denna metod kommer andra fördelar också att tillkomma kunden, inklusive latency, sekretess, tillförlitlighet samt ökad kapacitet.

Beräkning följer data till Edge

Sedan en decennium tillbaka, när AI uppstod från den akademiska världen, har utbildning och inferens av AI-modeller skett i molnet/datacentret. Med tanke på att mycket av datan genereras och konsumeras på edge – särskilt video – var det bara logiskt att flytta inferensen av datan till edge, vilket förbättrar den totala ägandekostnaden (TCO) för företag på grund av minskade nätverks- och beräkningskostnader. Medan AI-inferenskostnaderna i molnet är återkommande, är kostnaden för inferens på edge en engångs, maskinkostnad. I princip sänker tillägg av systemet med en Edge AI-processor de totala driftskostnaderna. Liksom migrationen av konventionella AI-arbetsbelastningar till Edge (t.ex. apparat, enhet), kommer Generative AI-arbetsbelastningar att följa samma mönster. Detta kommer att medföra betydande besparingar för företag och konsumenter.

Flytten till edge i kombination med en effektiv AI-accelerator för att utföra inferensfunktioner levererar andra fördelar också. Främst bland dem är latency. Till exempel i spelapplikationer kan icke-spelarkaraktärer (NPC:er) kontrolleras och förbättras med generativ AI. Med hjälp av LLM-modeller som körs på edge-AI-accelleratorer i en spelkonsol eller PC kan spelare ge dessa karaktärer specifika mål, så att de kan delta meningsfullt i berättelsen. Den låga latensen från lokal edge-inferens kommer att tillåta NPC-tal och rörelser att svara på spelarnas kommandon och åtgärder i realtid. Detta kommer att leverera en mycket immersiv spelupplevelse på ett kostnadseffektivt och energisnålt sätt.

I applikationer som hälsovård, är sekretess och tillförlitlighet extremt viktiga (t.ex. patientutvärdering, läkemedelsrekommendationer). Data och de associerade Gen AI-modellerna måste finnas på plats för att skydda patientdata (sekretess) och eventuella nätverksavbrott som blockerar tillgång till AI-modeller i molnet kan vara katastrofala. En Edge AI-applikation som kör en Gen AI-modell som är specialbyggd för varje företagskund – i detta fall en hälsovårdspersonal – kan smidigt lösa problemen med sekretess och tillförlitlighet samtidigt som den levererar lägre latency och kostnad.

Generativ AI på edge-enheter kommer att säkerställa låg latency i spel och bevara patientdata och förbättra tillförlitligheten för hälsovård.

Många Gen AI-modeller som körs på molnet kan vara nära en biljon parametrar – dessa modeller kan effektivt hantera allmänna ändamålsfrågor. Men företagsspecifika applikationer kräver att modellerna levererar resultat som är relevanta för användningsfallet. Ta exemplet med en Gen AI-baserad assistent som byggts för att ta beställningar på en snabbmatsrestaurang – för att detta system ska ha en smidig kundinteraktion, måste den underliggande Gen AI-modellen vara utbildad på restaurangens menypunkter, samt känna till allergener och ingredienser. Modellens storlek kan optimeras genom att använda en superset Large Language Model (LLM) för att utbilda en relativt liten, 10-30 miljarders parameter LLM och sedan använda ytterligare finjustering med kundspecifik data. En sådan modell kan leverera resultat med ökad noggrannhet och kapacitet. Och med tanke på modellens mindre storlek, kan den effektivt distribueras på en AI-accelerator på edge.

Gen AI kommer att vinna på Edge

Det kommer alltid att finnas ett behov av Gen AI som körs i molnet, särskilt för allmänna ändamålsapplikationer som ChatGPT och Claude. Men när det gäller företagsspecifika applikationer, som Adobes Photoshop generativa fyllning eller Github copilot, är Generative AI på Edge inte bara framtiden, utan också nutiden. Specialbyggda AI-accelleratorer är nyckeln till att göra detta möjligt, särskilt för allmänna ändamålsapplikationer som ChatGPT och Claude. Men när det gäller företagsspecifika applikationer, som Adobes Photoshop generativa fyllning eller Github copilot, är Generative AI på Edge inte bara framtiden, utan också nutiden.

Som en veteran från Silicon Valley och VD för Kinara Inc, bringar Ravi Annavajjhala mer än 20 års erfarenhet som spänner över affärsutveckling, marknadsföring och teknik, bygga ledande tekniska produkter och bringa dem till marknaden. I sin nuvarande roll som VD för Deep Vision, sitter Ravi i dess styrelse och har samlat in 50M dollar för att ta företagets Ara-1 processor från pre-silicon till fullskalig produktion och för att öka den 2:a generationens processor, Ara-2, i volym. Före anslutningen till Deep Vision, hade Ravi ledande befattningar på Intel och SanDisk där han spelade nyckelroller i att driva intäktsökning, utveckla strategiska partnerskap och utveckla produktvägar som ledde branschen med banbrytande funktioner och förmågor.