AI-modellen en platforms
De opkomst van neurale verwerkingseenheden: het verbeteren van on-device generatieve AI voor snelheid en duurzaamheid
De evolutie van generatieve AI verandert niet alleen onze interactie en ervaringen met computers, maar redefineert ook de kern van de computertechnologie. Een van de belangrijkste drijvende krachten achter deze transformatie is de noodzaak om generatieve AI te laten draaien op apparaten met beperkte rekenkracht. Dit artikel bespreekt de uitdagingen die dit met zich meebrengt en hoe neurale verwerkingseenheden (NPUs) ontstaan om deze uitdagingen aan te pakken. Bovendien introduceert het artikel enkele van de nieuwste NPU-processoren die de weg banen in dit veld.
Uitdagingen van on-device generatieve AI-infrastructuur
Generatieve AI, de kracht achter beeldsynthese, tekstgeneratie en muzieksynthese, vereist aanzienlijke rekenkracht. Traditioneel zijn deze eisen ingevuld door de uitgebreide mogelijkheden van cloudplatforms te benutten. Hoewel effectief, brengt deze aanpak zijn eigen set uitdagingen met zich mee voor on-device generatieve AI, waaronder afhankelijkheid van constante internetverbinding en centrale infrastructuur. Deze afhankelijkheid introduceert vertraging, beveiligingskwetsbaarheden en verhoogde energieverbruik.
De ruggengraat van cloudgebaseerde AI-infrastructuur steunt grotendeels op centrale verwerkingseenheden (CPUs) en grafische verwerkingseenheden (GPUs) om de rekenkrachteisen van generatieve AI te verwerken. Echter, wanneer toegepast op on-device generatieve AI, ondervinden deze verwerkingseenheden aanzienlijke hindernissen. CPUs zijn ontworpen voor algemene taken en ontbreken de gespecialiseerde architectuur die nodig is voor efficiënte en laagvermogende uitvoering van generatieve AI-werklasten. Hun beperkte parallelle verwerking-capaciteiten resulteren in gereduceerde doorvoer, verhoogde latentie en hoger energieverbruik, waardoor ze minder ideaal zijn voor on-device AI. Aan de andere kant kunnen GPUs uitstekend presteren in parallelle verwerking, maar zijn voornamelijk ontworpen voor grafische verwerkingstaken. Om generatieve AI-taken effectief uit te voeren, hebben GPUs gespecialiseerde geïntegreerde schakelingen nodig, die hoge vermogens verbruiken en aanzienlijke warmte genereren. Bovendien creëert hun grote fysieke omvang obstakels voor hun gebruik in compacte, on-device toepassingen.
De opkomst van neurale verwerkingseenheden (NPUs)
Als reactie op bovenstaande uitdagingen ontstaan neurale verwerkingseenheden (NPUs) als transformatieve technologie voor het implementeren van generatieve AI op apparaten. De architectuur van NPUs is voornamelijk geïnspireerd door de structuur en functie van de menselijke hersenen, met name hoe neuronen en synapsen samenwerken om informatie te verwerken. In NPUs fungeren kunstmatige neuronen als basisunits, die biologische neuronen nabootsen door invoer te ontvangen, te verwerken en uitvoer te produceren. Deze neuronen zijn verbonden door kunstmatige synapsen, die signalen tussen neuronen overdragen met variabele sterktes die zich aanpassen tijdens het leerproces. Dit imiteert het proces van synaptische gewichtsveranderingen in de hersenen. NPUs zijn georganiseerd in lagen; invoerlagen die ruwe gegevens ontvangen, verborgen lagen die tussenliggende verwerking uitvoeren en uitvoerlagen die de resultaten genereren. Deze laagstructuur weerspiegelt de meerstaps- en parallelle informatieverwerking van de hersenen. Aangezien generatieve AI ook is opgebouwd met een soortgelijke structuur van kunstmatige neurale netwerken, zijn NPUs goed geschikt voor het beheren van generatieve AI-werklasten. Deze structurele overeenstemming reduceert de noodzaak voor gespecialiseerde geïntegreerde schakelingen, wat leidt tot compactere, energie-efficiëntere, snellere en duurzamere oplossingen.
Het aanpakken van uiteenlopende rekenkrachteisen van generatieve AI
Generatieve AI omvat een breed scala aan taken, waaronder beeldsynthese, tekstgeneratie en muzieksynthese, elk met hun eigen unieke rekenkrachteisen. Om bijvoorbeeld beeldsynthese uit te voeren, is een zware afhankelijkheid van matrixoperaties nodig, terwijl tekstgeneratie sequentiële verwerking omvat. Om deze uiteenlopende rekenkrachteisen effectief te verwerken, worden neurale verwerkingseenheden (NPUs) vaak geïntegreerd in System-on-Chip (SoC)-technologie naast CPUs en GPUs.
Elk van deze verwerkingseenheden biedt distincte rekenkrachtsterktes. CPUs zijn bijzonder geschikt voor sequentiële controle en onmiddellijkheid, GPUs excelleren in parallelle dataprocessen en NPUs zijn fijn afgestemd op core AI-bewerkingen, die omgaan met scalaire, vector- en tensorwiskunde. Door een heterogene rekenarchitectuur te gebruiken, kunnen taken worden toegewezen aan verwerkingseenheden op basis van hun sterktes en de eisen van de specifieke taak.
NPUs, die geoptimaliseerd zijn voor AI-werklasten, kunnen generatieve AI-taken efficiënt afhandelen van de hoofd-CPU. Deze afhandeling zorgt niet alleen voor snelle en energie-efficiënte bewerkingen, maar versnelt ook AI-inferentietaken, waardoor generatieve AI-modellen soepeler op het apparaat kunnen draaien. Wanneer NPUs de AI-gerelateerde taken afhandelen, kunnen CPUs en GPUs hun middelen toewijzen aan andere functies, waardoor de algehele applicatieprestatie wordt verbeterd terwijl de thermische efficiëntie wordt behouden.
Reële voorbeelden van NPUs
De vooruitgang van NPUs wint aan momentum. Hier zijn enkele reële voorbeelden van NPUs:
- Hexagon NPUs van Qualcomm (QCOM ) zijn specifiek ontworpen voor het versnellen van AI-inferentietaken op apparaten met lage vermogens en beperkte middelen. Het is gebouwd om generatieve AI-taken zoals tekstgeneratie, beeldsynthese en audiobewerking te verwerken. De Hexagon NPU is geïntegreerd in Qualcomm’s Snapdragon-platforms, waardoor efficiënte uitvoering van neurale netwerkmodellen op apparaten met Qualcomm AI-producten mogelijk wordt.
- Apple’s Neural Engine is een sleutelcomponent van de A-series en M-series chips, die verschillende AI-gedreven functies zoals Face ID, Siri en augmented reality (AR) aandrijft. De Neural Engine versnelt taken zoals gezichtsherkenning voor beveiligde Face ID, natuurlijke taalverwerking (NLP) voor Siri en verbeterde objectvolging en scènebegrip voor AR-toepassingen. Het verbetert aanzienlijk de prestaties van AI-gerelateerde taken op Apple-apparaten, waardoor een naadloze en efficiënte gebruikerservaring wordt geboden.
- Samsung’s NPU is een gespecialiseerde verwerkingseenheid ontworpen voor AI-bewerking, die duizenden berekeningen tegelijk kan uitvoeren. Geïntegreerd in de nieuwste Samsung Exynos SoCs, die veel Samsung-telefoons aandrijven, maakt deze NPU-technologie laagvermogende, hoge-snelheidsgeneratieve AI-berekeningen mogelijk. Samsung’s NPU-technologie is ook geïntegreerd in vlaggenschip-tv’s, waardoor AI-gedreven geluidinnovaties en verbeterde gebruikerservaringen mogelijk worden.
- Huawei’s Da Vinci-architectuur vormt de kern van hun Ascend AI-processor, die is ontworpen om de AI-rekenkracht te verbeteren. De architectuur maakt gebruik van een high-performance 3D-cube-computing-engine, waardoor het krachtig is voor AI-werklasten.
De bottom line
Generatieve AI verandert onze interactie met apparaten en redefineert de computertechnologie. De uitdaging van het draaien van generatieve AI op apparaten met beperkte rekenkracht is aanzienlijk, en traditionele CPUs en GPUs voldoen vaak niet aan deze eisen. Neurale verwerkingseenheden (NPUs) bieden een veelbelovende oplossing met hun gespecialiseerde architectuur, die is ontworpen om te voldoen aan de eisen van generatieve AI. Door NPUs te integreren in System-on-Chip (SoC)-technologie naast CPUs en GPUs, kunnen we elke verwerkingseenheid gebruiken waarin ze het sterkst zijn, waardoor snellere, efficiëntere en duurzamere AI-prestaties op apparaten mogelijk worden. Naarmate NPUs verder evolueren, zullen ze on-device AI-mogelijkheden verbeteren, waardoor applicaties responsiever en energie-efficiënter worden.












