AI-modellen en platforms
Hoe DeepSeek de kostenbarrière doorbrak met $5,6M
De conventionele AI-wijsheid suggereert dat het bouwen van grote taalmodellen (LLM’s) diepe zakken vereist – meestal miljarden in investeringen. Maar DeepSeek, een Chinese AI-startup, heeft deze paradigma net verbroken met hun laatste prestatie: het ontwikkelen van een wereldklasse AI-model voor slechts $5,6 miljoen.
DeepSeek’s V3-model kan het hoofd bieden aan industrie-reuzen zoals Google’s Gemini en OpenAI’s laatste aanbod, allemaal terwijl het een fractie van de typische rekenbronnen gebruikt. Deze prestatie trok de aandacht van veel industrieleiders, en wat dit bijzonder opmerkelijk maakt, is dat het bedrijf dit bereikte ondanks het feit dat het te maken kreeg met Amerikaanse exportbeperkingen die de toegang tot de nieuwste Nvidia-chips (NVDA ) beperkten.
De economie van efficiënte AI
De cijfers vertellen een overtuigend verhaal over efficiëntie. Terwijl de meeste geavanceerde AI-modellen tussen 16.000 en 100.000 GPU’s voor training vereisen, slaagde DeepSeek erin met slechts 2.048 GPU’s die 57 dagen draaiden. De training van het model verbruikte 2,78 miljoen GPU-uren op Nvidia H800-chips – opmerkelijk bescheiden voor een model met 671 miljard parameters.
Om dit in perspectief te plaatsen, had Meta ongeveer 30,8 miljoen GPU-uren nodig – ongeveer 11 keer meer rekenkracht – om zijn Llama 3-model te trainen, dat eigenlijk minder parameters heeft met 405 miljard. DeepSeek’s aanpak lijkt op een meesterklasse in optimalisatie onder beperkingen. Door te werken met H800-GPU’s – AI-chips ontworpen door Nvidia specifiek voor de Chinese markt met verminderde mogelijkheden – wist het bedrijf potentiële beperkingen om te zetten in innovatie. In plaats van gebruik te maken van standaardoplossingen voor processorcommunicatie, ontwikkelden ze aangepaste oplossingen die de efficiëntie maximaliseerden.
Terwijl concurrenten blijven opereren onder de veronderstelling dat massive investeringen noodzakelijk zijn, toont DeepSeek aan dat vindingrijkheid en efficiënte gebruik van bronnen het speelveld kunnen egaliseren.

Afbeelding: Artificial Analysis
Het ontwerpen van het onmogelijke
DeepSeek’s prestatie ligt in zijn innovatieve technische aanpak, waaruit blijkt dat soms de meest impactvolle doorbraken voortkomen uit het werken binnen beperkingen in plaats van onbeperkte middelen in een probleem te steken.
Het hart van deze innovatie is een strategie genaamd “auxiliary-loss-free load balancing”. Denk hierbij aan het orkestreren van een massaal parallelle verwerkingssysteem waar traditioneel complexe regels en straffen nodig zouden zijn om alles soepel te laten verlopen. DeepSeek zette deze conventionele wijsheid op zijn kop door een systeem te ontwikkelen dat van nature in balans blijft zonder de overhead van traditionele benaderingen.
Het team ontwikkelde ook wat ze “Multi-Token Prediction” (MTP) noemen – een techniek die het model in staat stelt om vooruit te denken door meerdere tokens tegelijk te voorspellen. In de praktijk vertaalt dit zich in een indrukwekkende acceptatiegraad van 85-90% voor deze voorspellingen over verschillende onderwerpen, waardoor een 1,8 keer snellere verwerkingssnelheid wordt bereikt ten opzichte van eerdere benaderingen.
De technische architectuur zelf is een meesterwerk van efficiëntie. DeepSeek’s V3 maakt gebruik van een mixture-of-experts-benadering met in totaal 671 miljard parameters, maar hier zit het slimme: het activeert slechts 37 miljard parameters voor elke token. Deze selectieve activatie betekent dat ze de voordelen van een groot model behouden terwijl ze praktische efficiëntie behouden.
Hun keuze voor een FP8-mixed-precision-trainingframework is een andere sprong voorwaarts. In plaats van de conventionele beperkingen van gereduceerde precisie te accepteren, ontwikkelden ze aangepaste oplossingen die de nauwkeurigheid behouden terwijl ze het geheugen en de berekeningsvereisten aanzienlijk verminderen.
Ripple-effecten in het AI-ecosysteem
De impact van DeepSeek’s prestatie gaat verder dan alleen een succesvol model.
Voor de Europese AI-ontwikkeling is deze doorbraak bijzonder significant. Veel geavanceerde modellen komen niet in de EU terecht omdat bedrijven als Meta en OpenAI deze niet kunnen of willen aanpassen aan de EU AI-wet. DeepSeek’s aanpak toont aan dat het bouwen van state-of-the-art AI niet altijd massive GPU-clusters vereist – het gaat meer over het efficiënt gebruik van beschikbare bronnen.
Deze ontwikkeling toont ook aan hoe exportbeperkingen innovatie kunnen stimuleren. DeepSeek’s beperkte toegang tot high-end-hardware dwong hen om anders te denken, wat resulteerde in software-optimalisaties die mogelijk nooit zouden zijn ontstaan in een omgeving met onbeperkte middelen. Dit principe kan de manier waarop we AI-ontwikkeling wereldwijd benaderen herschikken.
De democratiseringsimplicaties zijn diepgaand. Terwijl industrie-reuzen blijven branden met miljarden, heeft DeepSeek een blauwdruk gemaakt voor efficiënte, kosteneffectieve AI-ontwikkeling. Dit kan deuren openen voor kleinere bedrijven en onderzoeksinstellingen die eerder niet konden concurreren vanwege beperkingen in middelen.
Dit betekent echter niet dat grote rekeninfrastructuur verouderd raakt. De industrie verschuift de focus naar het schalen van inferentietijd – hoe lang een model nodig heeft om antwoorden te genereren. Naarmate deze trend voortduurt, zullen aanzienlijke rekenbronnen nog steeds nodig zijn, waarschijnlijk zelfs meer naarmate de tijd vordert.
Maar DeepSeek heeft fundamenteel het gesprek veranderd. De langetermijnimplicaties zijn duidelijk: we betreden een tijdperk waarin innovatief denken en efficiënt gebruik van bronnen meer kunnen betekenen dan pure rekenkracht. Voor de AI-gemeenschap betekent dit dat we ons niet alleen moeten concentreren op de middelen die we hebben, maar ook op hoe we deze creatief en efficiënt gebruiken.












