AI-modellen en platforms
De GPU-muur kraakt: De onzichtbare revolutie in post-Transformer-architecturen

De afgelopen vijf jaar is de kunstmatige intelligentie-industrie effectief synoniem geweest met één woord: Transformer. Sinds de release van het seminale “Attention Is All You Need“-paper in 2017, heeft deze architectuur het veld overgenomen. Van GPT tot Claude, vertrouwt vrijwel elk model dat de headlines haalt op dezelfde onderliggende mechanisme van self-attention. We hebben over het algemeen aangenomen dat de weg naar betere AI simpelweg een kwestie is van schaal. In de praktijk betekent dit het trainen van grotere Transformers met meer data op grotere clusters van GPUs.
Terwijl dit geloof veel doorbraken heeft gedreven, bereikt het nu zijn limieten. We botsen tegen een “GPU-muur”, een barrière die niet alleen bestaat uit brute rekenkracht, maar ook uit geheugencapaciteit en economische duurzaamheid. Terwijl de wereld zich richt op de race naar triljoen-parametermodellen, vindt er een radicale verschuiving plaats in onderzoekscentra. Een nieuwe golf van “post-Transformer-architecturen” ontstaat om de beperkingen van het huidige paradigma te doorbreken. Deze verschuiving belooft AI efficiënter, toegankelijker en in staat te maken om over oneindige contexten te redeneren.
De siliciumplafond: Waarom Transformers tegen een muur botsen
Om te begrijpen waarom we een verschuiving nodig hebben, moeten we eerst de bottleneck van het huidige regime begrijpen. Transformers zijn ongelooflijk krachtig, maar ze zijn ook opvallend inefficiënt op bepaalde manieren. De kern van hun vermogen ligt in de “aandachtmachine”, die het model in staat stelt om naar elk token in een sequentie te kijken en de relatie tot elk ander token te berekenen. Dit is wat hen de mogelijkheid geeft om context opvallend goed te begrijpen.
Er is echter een dodelijke fout in de “kwadratische schaling”. Als je de lengte van het document verdubbelt dat je wilt dat de AI leest, neemt de berekeningsarbeid niet alleen toe, maar verviervoudigt deze. Terwijl we streven naar “oneindige context”-modellen die hele bibliotheken of codebases kunnen lezen, worden de berekeningsvereisten extreem hoog.
Maar het meer onmiddellijke probleem is geheugen, met name de “KV Cache” (Key-Value Cache). Om tekst vloeiend te genereren, moet een Transformer een lopende geschiedenis van alles wat het heeft gezegd in het high-speed-geheugen van de GPU (VRAM) bewaren. Terwijl het gesprek langer wordt, zwelt deze cache op en verbruikt het enorme hoeveelheden geheugen om te onthouden wat er drie alinea’s geleden is gebeurd.
Dit creëert de “GPU-muur”. We hebben niet alleen te weinig chips; we hebben te weinig geheugencapaciteit om ze te voeden. We hebben motoren gebouwd die steeds groter worden, maar ze worden onmogelijk om te laten draaien. Een lange tijd was de oplossing van de industrie simpelweg om meer NVIDIA H100s (NVDA ) te kopen. Maar deze brute kracht bereikt een punt van afnemende rendementen. We hebben geen motor nodig die brandstof verbruikt met een kwadratische factor, maar een nieuwe architectuur.
De onzichtbare revolutie
Terwijl het mainstream-onderzoek zich richt op LLM’s, heeft een groep onderzoekers een oude idee opnieuw bekeken: Recurrent Neural Networks (RNN’s). Voordat Transformers bestonden, waren RNN’s de standaard voor taal. Ze verwerkten tekst sequentieel, woord voor woord, en werkten een verborgen interne “toestand” bij. Ze waren ongelooflijk efficiënt omdat ze niet naar de hele geschiedenis hoefden te kijken; ze droegen alleen de “essentie” ervan in hun geheugen.
RNN’s faalden omdat ze geen lange afhankelijkheden aankonden; ze zouden het begin van een zin “vergeten” tegen de tijd dat ze het einde bereikten. Ze waren ook langzaam om te trainen omdat je ze niet kon paralleliseren. Dit betekent dat je woord A moest verwerken voordat je woord B kon verwerken. Transformers losten dit op door alles tegelijk te verwerken (parallelisatie) en alles in het geheugen te houden (aandacht).
Nu zien we de opkomst van architectuur die het beste van beide werelden combineert. Deze worden breed bekend als State Space Models (SSM’s). Ze bieden de trainsnelheid van Transformers (paralleliseerbaar) maar de inferentie-efficiëntie van RNN’s (lineaire schaling).
Een van de prominente architectuur in deze nieuwe golf is Mamba. Uitgebracht in het najaar van 2023 en verfijnd in 2024, is Mamba een fundamentele verschuiving in hoe modellen informatie verwerken. In tegenstelling tot een Transformer, die een originele kopie van elk woord dat het ooit heeft gezien in zijn geheugenbuffer bewaart, gebruikt Mamba een “selectieve toestandsruimte”.
We kunnen het verschil tussen Transformer en Mamba begrijpen door Transformer te zien als een geleerde die elke boek die hij ooit heeft gelezen op een enorm bureau openhoudt, constant heen en weer scannend om verbindingen te vinden. Mamba is daarentegen een geleerde die het boek eenmaal leest en de belangrijkste inzichten in een zeer efficiënte notitieblok comprimeert. Wanneer Mamba het volgende woord genereert, hoeft het niet terug te kijken naar de ruwe tekst; het kijkt naar zijn gecomprimeerde toestand.
Deze onderscheid verandert de economie van AI-implementatie. Met Mamba en soortgelijke architectuur zoals RWKV (Receptance Weighted Key Value), explodeert de kosten van tekstgeneratie niet als de sequentie langer wordt. Je kunt theoretisch deze modellen een miljoen woorden van context voeden, en de berekeningskosten om het volgende token te genereren blijven hetzelfde als wanneer je het tien woorden had gevoerd.
De terugkeer van recursie
De technische doorbraak achter Mamba is “selectiviteit”. Eerdere pogingen om RNN’s te moderniseren faalden omdat ze te rigide waren. Ze comprimeerden informatie gelijk, ongeacht of het belangrijk was of ruis. Mamba introduceert een mechanisme dat het model in staat stelt om dynamisch te beslissen wat te onthouden en wat te vergeten terwijl het data verwerkt.
Als het model een belangrijk stuk informatie krijgt, zoals een variabeledefinitie in een codeblok, “opent het de poort” en schrijft het sterk in zijn toestand. Als het tegen vullende woorden of irrelevante ruis aanloopt, sluit het de poort, waardoor zijn beperkte geheugencapaciteit behouden blijft voor wat belangrijk is.
Deze selectiviteit lost effectief het “vergeten”-probleem op dat oude RNN’s uitdaagde. In veel tests komen Mamba-gebaseerde modellen overeen met de prestaties van Transformers van dezelfde grootte, maar lopen ze tot vijf keer sneller tijdens inferentie. Nog belangrijker, hun geheugenspoor is veel kleiner. Dit opent de deur voor high-performance LLM’s om te draaien op apparaten die eerder ongeschikt werden geacht om ze te verwerken, zoals laptops, edge-computingnetwerken of zelfs smartphones, zonder uit te besteeden aan de cloud.
We zien ook de opkomst van Hyena, een andere sub-kwadratische architectuur die lange convoluties gebruikt om data te verwerken. Net als Mamba, heeft Hyena als doel de zware “aandachtlagen” van de Transformer te verwijderen en ze te vervangen door wiskundige operaties die veel goedkoper zijn voor de hardware om uit te voeren. Deze modellen hebben nu begonnen om Transformer-incumbenten op grote leaderboards uit te dagen.
De opkomst van de hybriden
De revolutie kan echter niet een complete vervanging van de Transformer zijn, maar eerder een evolutie in hybride vormen. We zien nu al de opkomst van modellen zoals Jamba (van AI21 Labs), die Transformer-lagen combineert met Mamba-lagen.
Deze hybride aanpak biedt een praktische manier om de beperkingen van de Transformer aan te pakken. Transformers blijven uitzonderlijk sterk in bepaalde taken, vooral voor het kopiëren van precieze details uit context. Door Mamba-lagen (die de bulk van de dataprocessing en langetermijngeheugen verwerken) te combineren met een paar Transformer-aandachtlagen (die scherpe, onmiddellijke redenering verwerken), krijgen we een model dat het beste van beide werelden samenbrengt.
Een hybride model creëert een enorm contextvenster dat daadwerkelijk bruikbaar is. Momenteel claimen veel “lange context”-Transformers dat ze 100.000 tokens kunnen verwerken, maar hun prestaties verslechteren snel als de context vol raakt. Dit fenomeen wordt bekend als “verloren in het midden“. Hybride architectuur behoudt hun coherentie veel beter over lange afstanden omdat de SSM-lagen specifiek zijn ontworpen om staat te comprimeren en over tijd te dragen.
Deze ontwikkelingen verschuiven de industriefocus van “Trainingscompute” (hoe groot moet ik mijn cluster bouwen om het model te bouwen?) naar “Inferentie-economie” (hoe goedkoop kan ik dit model serveren aan een miljard gebruikers?). Als een hybride model een gebruiker kan serveren voor 10% van de kosten van een Transformer, verandert het businessplan voor AI-toepassingen over een nacht.
De toekomst van AI-implementatie
De implicaties van deze post-Transformer-revolutie zijn niet beperkt tot het datacenter. De GPU-muur heeft historisch gezien als poortwachter gediend, waardoor alleen de grootste tech-reuzen met miljarden dollars aan hardware state-of-the-art-modellen konden bouwen en draaien. Efficiënte architectuur zoals Mamba en RWKV democratiseert deze macht. Als je een GPT-4-niveau-model op een consumentenkaart kunt draaien omdat je geen terabytes aan VRAM meer nodig hebt voor de Key-Value-cache, begint de centrale controle over AI los te laten. We kunnen een opleving zien van lokale, privé-AI-agents die volledig op je computer draaien, je privé-data verwerken zonder ooit een pakket naar de cloud te sturen.
Bovendien is deze efficiëntie de sleutel tot het ontgrendelen van “Agentic AI“-systemen die uren of dagen in de achtergrond draaien om complexe taken te voltooien. Huidige Transformers zijn te duur en te langzaam om in continue lussen te draaien voor lange perioden. Een efficiënte, lineaire architectuur kan “denken” en lussen verwerken zonder de gebruiker failliet te laten gaan of de hardware te oververhitten.
De bodemlijn
De Transformer heeft AI-koppen gedomineerd, maar achter de schermen is een stille revolutie gaande. De GPU-muur dwingt onderzoekers om opnieuw na te denken over hoe modellen geheugen en berekening verwerken. Post-Transformer-architecturen zoals Mamba en hybride modellen bewijzen dat efficiëntie, niet alleen schaal, de volgende era zal definiëren. Deze innovaties maken enorme contextvensters praktisch, inferentie goedkoper en geavanceerde AI toegankelijk buiten datacenters. De toekomst van AI ligt niet in grotere modellen, maar in slimmere modellen die onthouden, redeneren en efficiënt schalen.












