AI-modeller og plattformer
Oppgangen av neurale prosesseringsenheter: Forbedring av på-enhet generativ AI for hastighet og bærekraft
Utviklingen av generativ AI endrer ikke bare vår interaksjon og erfaringer med datamaskiner, men definerer også om kjernecomputingen. En av de viktigste drivkreftene bak denne transformasjonen er behovet for å kjøre generativ AI på enheter med begrensede beregningsressurser. Denne artikkelen diskuterer utfordringene dette presenterer og hvordan neurale prosesseringsenheter (NPUs) oppstår for å løse dem. I tillegg presenterer artikkelen noen av de nyeste NPU-prosessorer som leder vei i dette feltet.
Utfordringer med på-enhet generativ AI-infrastruktur
Generativ AI, som er hjørnestenen bak bilde-syntese, tekst-generering og musikk-komposisjon, krever betydelige beregningsressurser. Vanligvis er disse kravene blitt møtt ved å utnytte de omfattende evnene til sky-plattformer. Mens dette er effektivt, kommer dette tilnærmingen med sine egne utfordringer for på-enhet generativ AI, inkludert avhengighet av konstant internett-tilkobling og sentralisert infrastruktur. Denne avhengigheten introduserer latency, sikkerhets-sårbarheter og økt energiforbruk.
Ryggmargen til sky-basert AI-infrastruktur hviler i stor grad på sentral prosesseringsenheter (CPUs) og grafikk-prosesseringsenheter (GPUs) for å håndtere de beregningsmessige kravene til generativ AI. Imidlertid, når de brukes til på-enhet generativ AI, møter disse prosessorer betydelige hindringer. CPUs er designet for generelle oppgaver og mangler den spesialiserte arkitekturen som er nødvendig for effektiv og lav-kraft-utførelse av generativ AI-arbeidsbelastninger. Deres begrensede parallell-prosesserings-evner resulterer i redusert gjennomstrømming, økt latency og høyere kraft-forbruk, noe som gjør dem mindre ideelle for på-enhet AI. På den andre siden, mens GPUs kan utmerke seg i parallell-prosesserings-oppgaver, er de primært designet for grafikk-prosesserings-oppgaver. For å effektivt utføre generativ AI-oppgaver, krever GPUs spesialiserte integrerte kretser, som forbruker høy kraft og genererer betydelig varme. I tillegg skaper deres store fysiske størrelse hindringer for deres bruk i kompakte, på-enhet-applikasjoner.
Oppgangen av neurale prosesseringsenheter (NPUs)
Som svar på ovennevnte utfordringer, oppstår neurale prosesseringsenheter (NPUs) som en transformasjonsteknologi for implementering av generativ AI på enheter. Arkitekturen til NPUs er primært inspirert av hjernens struktur og funksjon, spesielt hvordan neuroner og synapser samarbeider for å prosessere informasjon. I NPUs fungerer kunstige neuroner som de grunnleggende enhetene, som speiler biologiske neuroner ved å motta inndata, prosessere dem og produsere utdata. Disse neuronene er koblet sammen gjennom kunstige synapser, som overfører signaler mellom neuronene med varierende styrke som justeres under læringen. Dette etterligner prosessen med synaptisk vektendring i hjernen. NPUs er organisert i lag; inndata-lag som mottar rådata, skjulte lag som utfører mellomliggende prosessering, og utdata-lag som genererer resultater. Denne lagdelte strukturen reflekterer hjernens fler-stegs- og parallell informasjons-prosesserings-evne. Ettersom generativ AI også er konstruert ved hjelp av en lignende struktur av kunstige neurale nettverk, er NPUs godt egnet for å håndtere generativ AI-arbeidsbelastninger. Denne strukturelle sammenstillingen reduserer behovet for spesialiserte integrerte kretser, noe som fører til mer kompakte, energi-efektive, raske og bærekraftige løsninger.
Tilpasse seg diverse beregningsmessige behov til generativ AI
Generativ AI omfatter en rekke oppgaver, inkludert bilde-syntese, tekst-generering og musikk-komposisjon, hver med sine egne unike beregningsmessige krav. For eksempel, er bilde-syntese sterkt avhengig av matris-operasjoner, mens tekst-generering involverer sekvensiell prosessering. For å effektivt imøtekomme disse diverse beregningsmessige behovene, er neurale prosesseringsenheter (NPUs) ofte integrert i System-on-Chip (SoC)-teknologi sammen med CPUs og GPUs.
Hver av disse prosessorer tilbyr distinkte beregningsmessige styrker. CPUs er spesielt dyktige i sekvensiell kontroll og umiddelbarhet, GPUs utmerker seg i strømmende parallell data, og NPUs er fint stemt for kjerne-AI-operasjoner, som omhandler skalar, vektor og tensor-matematikk. Ved å utnytte en heterogen beregnings-arkitektur, kan oppgaver tildeles prosessorer basert på deres styrker og kravene til den spesifikke oppgaven.
NPUs, som er optimert for AI-arbeidsbelastninger, kan effektivt avlaste generativ AI-oppgaver fra hoved-CPU. Denne avlastningen sikrer ikke bare raske og energi-efektive operasjoner, men akselererer også AI-inferens-oppgaver, noe som tillater generativ AI-modeller å kjøre mer jevnt på enheten. Med NPUs som håndterer AI-relaterte oppgaver, er CPUs og GPUs frie til å tildele ressurser til andre funksjoner, noe som forbedrer hele applikasjons-ytelsen samtidig som termisk effektivitet opprettholdes.
Reelle eksempler på NPUs
Fremgangen av NPUs er i ferd med å få økt momentum. Her er noen reelle eksempler på NPUs:
- Hexagon NPUs av Qualcomm (QCOM ) er spesifikt designet for å akselerere AI-inferens-oppgaver på lav-kraft- og lav-resurs-enheter. Det er bygget for å håndtere generativ AI-oppgaver som tekst-generering, bilde-syntese og audio-prosessering. Hexagon NPU er integrert i Qualcomms Snapdragon-plattformer, som gir effektiv utførelse av neurale nettverksmodeller på enheter med Qualcomm AI-produkter.
- Apples Neural Engine er en nøkkelkomponent i A-serie og M-serie-chip, som driver ulike AI-drevne funksjoner som Face ID, Siri og augmentert virkelighet (AR). Neural Engine akselererer oppgaver som ansikts-gjenkjenning for sikker Face ID, naturlig språk-prosessering (NLP) for Siri og forbedret objekt-sporing og scene-forståelse for AR-applikasjoner. Det forbedrer betydelig ytelsen av AI-relaterte oppgaver på Apple-enheter, og gir en jevn og effektiv bruker-erfaring.
- Samsungs NPU er en spesialisert prosessor designet for AI-beregning, som kan håndtere tusenvis av beregninger samtidig. Integrert i de nyeste Samsung Exynos SoCs, som driver mange Samsung-telefoner, muliggjør denne NPU-teknologien lav-kraft, høy-hastighet generativ AI-beregninger. Samsungs NPU-teknologi er også integrert i flaggskip-TV-er, som muliggjør AI-drevne lyd-innovasjoner og forbedrer bruker-erfaringer.
- Huaweis Da Vinci-arkitektur fungerer som kjernen i deres Ascend AI-prosessor, designet for å forbedre AI-beregningsevnen. Arkitekturen utnytter en høy-ytelses 3D-kube-beregning-motor, som gjør den kraftig for AI-arbeidsbelastninger.
Slutt-punktet
Generativ AI endrer vår interaksjon med enheter og definerer om kjernecomputingen. Utfordringen med å kjøre generativ AI på enheter med begrensede beregningsressurser er betydelig, og tradisjonelle CPUs og GPUs mangler ofte. Neurale prosesseringsenheter (NPUs) tilbyr et løftende løsning med sin spesialiserte arkitektur designet for å møte kravene til generativ AI. Ved å integrere NPUs i System-on-Chip (SoC)-teknologi sammen med CPUs og GPUs, kan vi utnytte hver prosessors styrker, noe som fører til raskere, mer effektive og bærekraftige AI-ytelse på enheter. Ettersom NPUs fortsetter å utvikle seg, er de i stand til å forbedre på-enhet AI-evnen, og gjøre applikasjoner mer responsiv og energi-efektiv.












