AI-modeller och plattformar
Upptåget av neuronnätverksprocessorer: Förbättrar on-device generativ AI för hastighet och hållbarhet
Utvecklingen av generativ AI förändrar inte bara vår interaktion och upplevelser med datorer, utan också omdefinierar kärnan i datorkonsten. En av de viktigaste drivkrafterna bakom denna transformation är behovet av att köra generativ AI på enheter med begränsade beräkningsresurser. Den här artikeln diskuterar de utmaningar som detta medför och hur neuronnätverksprocessorer (NPUs) håller på att utvecklas för att lösa dem. Dessutom presenterar artikeln några av de senaste NPU-processorer som leder vägen inom detta område.
Utmaningar med on-device generativ AI-infrastruktur
Generativ AI, som ligger bakom bildsyntes, textgenerering och musikkomposition, kräver betydande beräkningsresurser. Traditionellt har dessa krav tillgodosetts genom att utnyttja de omfattande möjligheterna hos molnplattformar. Medan denna metod är effektiv, medför den också en uppsättning utmaningar för on-device generativ AI, inklusive beroende av konstant internetanslutning och centraliserad infrastruktur. Detta beroende introducerar fördröjning, säkerhetsrisker och ökad energiförbrukning.
Ryggmärgen i molnbaserad AI-infrastruktur bygger i stor utsträckning på centrala processorer (CPUs) och grafikprocessorer (GPUs) för att hantera de beräkningskrav som generativ AI ställer. Dessa processorer möter dock betydande hinder när de tillämpas på on-device generativ AI. CPUs är utformade för allmänna uppgifter och saknar den specialiserade arkitektur som behövs för effektiv och låg effektutförande av generativa AI-arbetsbelastningar. Deras begränsade parallella bearbetningsförmåga resulterar i minskad genomströmning, ökad fördröjning och högre effektbehov, vilket gör dem mindre lämpliga för on-device AI. Å andra sidan kan GPUs utmärka sig i parallell bearbetning, men de är främst utformade för grafikbearbetning. För att effektivt utföra generativa AI-uppgifter kräver GPUs specialiserade integrerade kretsar, som förbrukar hög effekt och genererar betydande värme. Dessutom skapar deras stora fysiska storlek hinder för deras användning i kompakta, on-device-applikationer.
Upptåget av neuronnätverksprocessorer (NPUs)
Som svar på ovanstående utmaningar håller neuronnätverksprocessorer (NPUs) på att utvecklas som en transformerande teknik för implementering av generativ AI på enheter. Arkitekturen för NPUs är i huvudsak inspirerad av hjärnans struktur och funktion, särskilt hur neuroner och synapser samarbetar för att bearbeta information. I NPUs fungerar artificiella neuroner som grundläggande enheter, som speglar biologiska neuroner genom att ta emot indata, bearbeta dem och producera utdata. Dessa neuroner är sammanlänkade genom artificiella synapser, som överför signaler mellan neuroner med varierande styrka som justeras under inlärningsprocessen. Detta efterliknar processen för synaptisk viktändring i hjärnan. NPUs är organiserade i lager; indata-lager som tar emot rådata, dolda lager som utför mellanliggande bearbetning och utdata-lager som genererar resultaten. Denna lagerstruktur återspeglar hjärnans multi-stegs- och parallella informationsbearbetningsförmåga. Eftersom generativ AI också konstrueras med en liknande struktur av artificiella neuronnätverk är NPUs väl lämpade för att hantera generativa AI-arbetsbelastningar. Denna strukturella anpassning minskar behovet av specialiserade integrerade kretsar, vilket leder till mer kompakta, energisnåla, snabba och hållbara lösningar.
Tillgodoseende av diversa beräkningsbehov för generativ AI
Generativ AI omfattar en mängd olika uppgifter, inklusive bildsyntes, textgenerering och musikkomposition, var och en med sina egna unika beräkningskrav. Till exempel är bildsyntes starkt beroende av matrisoperationer, medan textgenerering innefattar sekventiell bearbetning. För att effektivt tillgodose dessa diversa beräkningsbehov integreras neuronnätverksprocessorer (NPUs) ofta i System-on-Chip (SoC)-teknologi tillsammans med CPUs och GPUs.
Var och en av dessa processorer erbjuder distinkta beräkningsstyrkor. CPUs är särskilt lämpade för sekventiell kontroll och omedelbarhet, GPUs utmärker sig i parallell dataström och NPUs är finjusterade för kärn-AI-operationer, som hanterar skalär, vektor och tensor-matematik. Genom att utnyttja en heterogen beräkningsarkitektur kan uppgifter tilldelas processorer baserat på deras styrkor och uppgiftens specifika krav.
NPUs, som är optimerade för AI-arbetsbelastningar, kan effektivt avlasta generativa AI-uppgifter från den primära CPU. Denna avlastning säkerställer inte bara snabba och energisnåla operationer, utan accelererar också AI-inferensuppgifter, vilket gör att generativa AI-modeller kan köras smidigare på enheten. När NPUs hanterar AI-relaterade uppgifter kan CPUs och GPUs allokeras för att utföra andra funktioner, vilket förbättrar den övergripande applikationsprestandan samtidigt som termisk effektivitet upprätthålls.
Verkliga exempel på NPUs
Utvecklingen av NPUs går framåt. Här är några verkliga exempel på NPUs:
- Hexagon NPUs av Qualcomm (QCOM ) är särskilt utformade för att accelerera AI-inferensuppgifter på enheter med låg effekt och begränsade resurser. De är byggda för att hantera generativa AI-uppgifter som textgenerering, bildsyntes och ljudbearbetning. Hexagon NPU är integrerad i Qualcomms Snapdragon-plattformar, vilket möjliggör effektiv körning av neuronnätverksmodeller på enheter med Qualcomms AI-produkter.
- Apples Neural Engine är en nyckelkomponent i A-serien och M-serien chips, som driver olika AI-drivna funktioner som Face ID, Siri och förstärkt verklighet (AR). Neural Engine accelererar uppgifter som ansiktsigenkänning för säker Face ID, naturlig språkbehandling (NLP) för Siri och förbättrad objekttillförlitlighet och scenförståelse för AR-applikationer. Det förbättrar betydligt prestandan för AI-relaterade uppgifter på Apple-enheter, vilket ger en sömlös och effektiv användarupplevelse.
- Samsungs NPU är en specialiserad processor utformad för AI-beräkningar, som kan hantera tusentals beräkningar samtidigt. Integrerad i de senaste Samsung Exynos SoCs, som driver många Samsung-telefoner, möjliggör denna NPU-teknik lågeffekt, höghastighets generativa AI-beräkningar. Samsungs NPU-teknik är också integrerad i flaggskeppstelevisorer, vilket möjliggör AI-driven ljudinnovation och förbättrar användarupplevelsen.
- Huaweis Da Vinci-arkitektur utgör kärnan i deras Ascend AI-processor, som är utformad för att förbättra AI-beräkningskraften. Arkitekturen utnyttjar en högpresterande 3D-kub-beräkningsmotor, vilket gör den kraftfull för AI-arbetsbelastningar.
Slutsatsen
Generativ AI förändrar vår interaktion med enheter och omdefinierar datorkonsten. Utmaningen att köra generativ AI på enheter med begränsade beräkningsresurser är betydande, och traditionella CPUs och GPUs är ofta otillräckliga. Neuronnätverksprocessorer (NPUs) erbjuder ett lovande lösning med sin specialiserade arkitektur, som är utformad för att möta kraven för generativ AI. Genom att integrera NPUs i System-on-Chip (SoC)-teknologi tillsammans med CPUs och GPUs kan vi utnyttja varje processorns styrkor, vilket leder till snabbare, mer effektiva och hållbara AI-prestanda på enheter. När NPUs fortsätter att utvecklas är de på väg att förbättra on-device AI-förmågor, vilket gör applikationer mer responsiva och energisnåla.












