AI-modeller og platforme
Neural Processing Units’ Opkomst: Forbedring af On-Device Generative AI til Hastighed og Bæredygtighed
Evolutionen af generative AI omdefinerer ikke kun vores interaktion og oplevelser med computere, men også selv grundlæggende computering. En af de vigtigste drivkræfter bag denne transformation er behovet for at køre generative AI på enheder med begrænsede beregningsressourcer. Denne artikel diskuterer de udfordringer, dette medfører, og hvordan neural processing units (NPUs) opstår for at løse dem. Derudover introducerer artiklen nogle af de seneste NPU-processorer, der er førende i dette felt.
Udfordringer for On-Device Generative AI-Infrastruktur
Generative AI, der er drivkraften bag billedsynthese, tekstgenerering og musikkomposition, kræver betydelige beregningsressourcer. Traditionelt er disse krav blevet opfyldt ved at udnytte de store muligheder i cloud-platforme. Selvom dette er effektivt, medfører dette tilgang en række udfordringer for on-device generative AI, herunder afhængighed af konstant internetforbindelse og centraliseret infrastruktur. Denne afhængighed introducerer forsinkelse, sikkerhedsrisici og øget energiforbrug.
Bagbenet for cloud-baseret AI-infrastruktur afhænger i høj grad af central processing units (CPUs) og grafikprocessorer (GPUs) til at håndtere de beregningskrav, der stilles til generative AI. Når disse processorer dog anvendes til on-device generative AI, møder de betydelige hindringer. CPUs er designet til generelle opgaver og mangler den specialiserede arkitektur, der er nødvendig for effektiv og lavenergisk udførelse af generative AI-arbejdslaster. Deres begrænsede parallele proceskapsacitet resulterer i reduceret gennemstrømning, øget forsinkelse og højere energiforbrug, hvilket gør dem mindre ideelle til on-device AI. På den anden side kan GPUs udføre parallel proceskapsacitet, men de er primært designet til grafikbehandling. For at udføre generative AI-opgaver effektivt kræver GPUs specialiserede integrerede kredsløb, der forbruger megen energi og genererer betydelig varme. Desuden skaber deres store fysiske størrelse hindringer for deres anvendelse i kompakte, on-device-applikationer.
Opkomsten af Neural Processing Units (NPUs)
Som svar på ovennævnte udfordringer opstår neural processing units (NPUs) som en transformerende teknologi til implementering af generative AI på enheder. NPUs’ arkitektur er primært inspireret af hjernens struktur og funktion, særligt hvordan neuroner og synapser samarbejder om at behandle information. I NPUs fungerer kunstige neuroner som grundlæggende enheder, der spejler biologiske neuroner ved at modtage input, behandle dem og producere output. Disse neuroner er forbundet gennem kunstige synapser, der transmitterer signaler mellem neuroner med varierende styrke, der justeres under læreprocessen. Dette efterligner processen med synaptisk vægtændring i hjernen. NPUs er organiseret i lag; inputlag, der modtager rådata, skjulte lag, der udfører mellemprocesser, og outputlag, der genererer resultaterne. Denne lagdelte struktur afspejler hjernens flertrins- og parallelinformationsbehandlingsevne. Da generative AI også er konstrueret ved hjælp af en lignende struktur af kunstige neurale netværk, er NPUs velegnede til at håndtere generative AI-arbejdslaster. Denne strukturelle tilpasning reducerer behovet for specialiserede integrerede kredsløb, hvilket fører til mere kompakte, energivenlige, hurtige og bæredygtige løsninger.
Tilpasning af Diverse Beregningsbehov for Generative AI
Generative AI omfatter en bred vifte af opgaver, herunder billedsynthese, tekstgenerering og musikkomposition, hver med sine unikke beregningskrav. For eksempel afhænger billedsynthese stærkt af matrixoperationer, mens tekstgenerering involverer sekventiel proceskapsacitet. For at effektivt imødekomme disse diverse beregningsbehov integreres neural processing units (NPUs) ofte i System-on-Chip (SoC)-teknologi sammen med CPUs og GPUs.
Hver af disse processorer tilbyder distinkte beregningsstyrker. CPUs er særligt egnede til sekventiel kontrol og umiddelbarhed, GPUs excellerer i streaming parallelt data, og NPUs er finjusteret til kerne-AI-operationer, der omhandler skalar-, vektor- og tensor-matematik. Ved at udnytte en heterogen beregningsarkitektur kan opgaver tildeles processorer baseret på deres styrker og opgavens specifikke krav.
NPUs, der er optimeret til AI-arbejdslaster, kan effektivt aflaste generative AI-opgaver fra den primære CPU. Denne aflasting sikrer ikke kun hurtige og energivenlige operationer, men accelererer også AI-inferensopgaver, hvilket tillader generative AI-modeller at køre mere jævnt på enheden. Med NPUs, der håndterer AI-relaterede opgaver, kan CPUs og GPUs allokkere ressourcer til andre funktioner, hvilket forbedrer den samlede applikationspræstation, mens termisk effektivitet opretholdes.
Reelle Eksempler på NPUs
Fremgangen i NPUs er i fuld gang. Her er nogle reelle eksempler på NPUs:
- Hexagon NPUs af Qualcomm (QCOM ) er specifikt designet til at accelerere AI-inferensopgaver på lavenergidevices. Den er bygget til at håndtere generative AI-opgaver som tekstgenerering, billedsynthese og lydbehandling. Hexagon NPU er integreret i Qualcomms Snapdragon-platforme, hvilket giver effektiv udførelse af neurale netværksmodeller på enheder med Qualcomm AI-produkter.
- Apples Neural Engine er en nøglekomponent i A-serien og M-serien chips, der driver forskellige AI-drevne funktioner som Face ID, Siri og forstærket virkelighed (AR). Neural Engine accelererer opgaver som ansigtsgenkendelse til sikker Face ID, naturlig sprogbehandling (NLP) til Siri og forbedret objektfølgning og sceneforståelse til AR-applikationer. Den forbedrer betydeligt AI-relaterede opgavers præstation på Apple-enheder, hvilket giver en problemfri og effektiv brugeroplevelse.
- Samsungs NPU er en specialiseret processor designet til AI-beregning, der kan håndtere tusinder af beregninger samtidigt. Integreret i de seneste Samsung Exynos SoCs, der driver mange Samsung-telefoner, muliggør denne NPU-teknologi lavenergisk, højhastigheds generative AI-beregninger. Samsungs NPU-teknologi er også integreret i flagship-TV’er, der muliggør AI-drevet lydinnovation og forbedrer brugeroplevelsen.
- Huaweis Da Vinci-arkitektur fungerer som kernen i deres Ascend AI-processor, designet til at forbedre AI-regnekapaciteten. Arkitekturen udnytter en højpræstations 3D-kubeberegningsemotor, der gør den kraftfuld til AI-arbejdslaster.
Sammenfattende Konklusion
Generative AI transformerer vores interaktion med enheder og omdefinerer computering. Udfordringen ved at køre generative AI på enheder med begrænsede beregningsressourcer er betydelig, og traditionelle CPUs og GPUs falder ofte kort. Neural processing units (NPUs) tilbyder en lovende løsning med deres specialiserede arkitektur, der er designet til at imødekomme kravene til generative AI. Ved at integrere NPUs i System-on-Chip (SoC)-teknologi sammen med CPUs og GPUs kan vi udnytte hver processors styrker, hvilket fører til hurtigere, mere effektive og bæredygtige AI-præstationer på enheder. Da NPUs fortsætter med at udvikle sig, er de sat til at forbedre on-device AI-kapaciteter, hvilket gør applikationer mere responsiv og energivenlig.












