Thought leaders
De toekomst van Generatieve AI is de Edge

De komst van ChatGPT en Generatieve AI in het algemeen is een keerpunt in de geschiedenis van de technologie en wordt vergeleken met de dageraad van het internet en de smartphone. Generatieve AI heeft een onbeperkt potentieel getoond in zijn vermogen om intelligente gesprekken te voeren, examens te halen, complexe programma’s/code te genereren en oogstrelende afbeeldingen en video’s te creëren. Terwijl de meeste Gen AI-modellen in de cloud worden uitgevoerd op GPUs, zowel voor training als inferentie, is dit geen lange-termijn-oplossing, vooral voor inferentie, vanwege factoren zoals kosten, energie, latentie, privacy en beveiliging. Dit artikel behandelt elk van deze factoren, samen met motiverende voorbeelden om Gen AI-compute-werklasten naar de edge te verplaatsen.
De meeste toepassingen draaien op hoge-prestatie-processoren – hetzij op apparaten (bijv. smartphones, desktops, laptops) of in datacentra. Naarmate het aandeel toepassingen dat AI gebruikt toeneemt, zijn deze processoren met alleen CPUs onvoldoende. Bovendien drijft de snelle expansie van Generatieve AI-werklasten een exponentiële vraag naar AI-geactiveerde servers met dure, energievretende GPUs, waardoor de infrastructuurkosten toenemen. Deze AI-geactiveerde servers kunnen tot 7 keer duurder zijn dan een reguliere server en GPUs verantwoorden 80% van deze extra kosten.
Bovendien verbruikt een cloud-gebaseerde server 500W tot 2000W, terwijl een AI-geactiveerde server tussen 2000W en 8000W verbruikt – 4 keer meer! Om deze servers te ondersteunen, hebben datacentra extra koelmodules en infrastructuur-upgrades nodig – die zelfs hoger kunnen zijn dan de compute-investering. Datacentra verbruiken al 300 TWH per jaar, bijna 1% van het totale wereldwijde energieverbruik. Als de trends van AI-adoptie voortduren, kan tot 5% van het wereldwijde energieverbruik door datacentra worden verbruikt tegen 2030. Bovendien wordt een ongekende investering gedaan in Generatieve AI-datacentra. Het wordt geschat dat datacentra tot $500 miljard aan kapitaaluitgaven zullen verbruiken tegen 2027, voornamelijk aangedreven door AI-infrastructuurvereisten.

Het energieverbruik van datacentra, al 300 TwH, zal aanzienlijk toenemen met de adoptie van generatieve AI.
AI-compute-kosten evenals energieverbruik zullen de massale adoptie van Generatieve AI belemmeren. Schaalbaarheidsuitdagingen kunnen worden overwonnen door AI-compute naar de edge te verplaatsen en verwerkingsoplossingen te gebruiken die zijn geoptimaliseerd voor AI-werklasten. Met deze benadering komen andere voordelen ook ten goede aan de klant, waaronder latentie, privacy, betrouwbaarheid en een verhoogde capaciteit.
Compute volgt data naar de Edge
Sinds een decennium geleden, toen AI uit de academische wereld kwam, is de training en inferentie van AI-modellen in de cloud/datacenter uitgevoerd. Aangezien veel van de data wordt gegenereerd en verbruikt aan de edge – vooral video – was het alleen maar logisch om de inferentie van de data naar de edge te verplaatsen, waardoor de totale kosten van eigendom (TCO) voor ondernemingen zijn verlaagd vanwege verlaagde netwerk- en compute-kosten. Terwijl de AI-inferentiekosten in de cloud terugkerend zijn, is de kosten van inferentie aan de edge een eenmalige, hardware-uitgave. In wezen verlaagt het toevoegen van een Edge AI-processor aan het systeem de totale operationele kosten. Net zoals de migratie van conventionele AI-werklasten naar de Edge (bijv. apparaat, apparaat), zullen Generatieve AI-werklasten hierop volgen. Dit zal aanzienlijke besparingen opleveren voor ondernemingen en consumenten.
De verplaatsing naar de edge, in combinatie met een efficiënte AI-accelerator om inferentiefuncties uit te voeren, levert andere voordelen op. Allereerst is dit latentie. Bijvoorbeeld, in gaming-toepassingen kunnen niet-spelerspersonages (NPC’s) worden gecontroleerd en verrijkt met generatieve AI. Met behulp van LLM-modellen die draaien op edge AI-accelerators in een gamingconsole of pc, kunnen gamers deze personages specifieke doelen geven, zodat ze zinvol kunnen deelnemen aan het verhaal. De lage latentie van lokale edge-inferentie zal ervoor zorgen dat NPC-spraak en -bewegingen in real-time reageren op de commando’s en acties van de spelers. Dit zal een zeer immersieve gaming-ervaring bieden op een kostenefficiënte en energievriendelijke manier.
In toepassingen zoals gezondheidszorg zijn privacy en betrouwbaarheid uiterst belangrijk (bijv. patiëntbeoordeling, medicijnrecepten). Data en de bijbehorende Gen AI-modellen moeten on-premise zijn om patiëntgegevens (privacy) te beschermen en eventuele netwerkuitval die toegang tot AI-modellen in de cloud blokkeert, kan catastrofaal zijn. Een Edge AI-apparaat dat een Gen AI-model uitvoert dat specifiek is gebouwd voor elke ondernemingsklant – in dit geval een zorgverlener – kan de problemen van privacy en betrouwbaarheid soepel oplossen, terwijl het tegelijkertijd lage latentie en lagere kosten biedt.

Generatieve AI op edge-apparaten zal lage latentie in gaming garanderen en patiëntgegevens beschermen en betrouwbaarheid verbeteren voor gezondheidszorg.
Veel Gen AI-modellen die op de cloud draaien, kunnen tot een triljoen parameters hebben – deze modellen kunnen effectief algemene vragen beantwoorden. Echter, ondernemingsspecifieke toepassingen vereisen dat de modellen resultaten leveren die relevant zijn voor het gebruiksscenario. Neem het voorbeeld van een Gen AI-gebaseerde assistent die is gebouwd om bestellingen te nemen bij een fastfoodrestaurant – voor dit systeem om een naadloze klantinteractie te hebben, moet het onderliggende Gen AI-model zijn getraind op de menu-items van het restaurant, evenals de allergenen en ingrediënten. De modelgrootte kan worden geoptimaliseerd door een superset Large Language Model (LLM) te gebruiken om een relatief klein, 10-30 miljard parameter LLM te trainen en vervolgens extra fine-tuning te gebruiken met klantspecifieke gegevens. Een dergelijk model kan resultaten leveren met verhoogde nauwkeurigheid en capaciteit. En gezien de kleinere modelgrootte, kan het effectief worden geïmplementeerd op een AI-accelerator aan de Edge.
Gen AI zal winnen aan de Edge
Er zal altijd een behoefte zijn aan Gen AI die in de cloud draait, vooral voor algemene toepassingen zoals ChatGPT en Claude. Maar wanneer het gaat om ondernemingsspecifieke toepassingen, zoals Adobe Photoshop’s generatieve vulfunctie of Github Copilot, is Generatieve AI aan de Edge niet alleen de toekomst, maar ook het heden. Purpose-built AI-accelerators zijn de sleutel tot het mogelijk maken hiervan. Especially voor algemene toepassingen zoals ChatGPT en Claude. Maar wanneer het gaat om ondernemingsspecifieke toepassingen, zoals Adobe Photoshop’s generatieve vulfunctie of Github Copilot, is Generatieve AI aan de Edge niet alleen de toekomst, maar ook het heden. Purpose-built AI-accelerators zijn de sleutel tot het mogelijk maken hiervan.












