Thought leaders

Open modellen worden steeds beter. De economie wordt ingewikkelder.

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

AI-modellen zijn duidelijk beter dan 18 maanden geleden. Maar toen ik dieper ging kijken, klopten de gebruikelijke verklaringen voor die vooruitgang niet.

Ze werden niet alleen beter omdat ze groter werden. “Open source wint” is slechts gedeeltelijk waar. En het advies om naar benchmark-scores te kijken bleek veel minder nuttig dan ik had verwacht. Dat kostte me even tijd om te accepteren.

Dus ik haalde 18 maanden aan gegevens over 46 modellen van acht laboratoria. Ik wilde begrijpen of intelligentie een handelswaar wordt, of open modellen de frontier inhalen, en welke criteria bedrijven moeten hanteren bij het kiezen van de systemen waarop ze hun toepassingen bouwen.

De belangrijkste bevinding was eenvoudig: een benchmarkscore is niet echt een eigenschap van een model. Het weerspiegelt het model, de software en de context eromheen, en hoeveel tijd en rekenkracht het mocht gebruiken. Publiceer je één getal, dan verberg je de andere twee.

De implicaties zijn echter veel breder. Bedrijven vergelijken individuele modellen terwijl ze het volledige systeem dat het werk moet uitvoeren, zouden moeten evalueren.

Benchmarks verbergen het systeem

Toen ik stopte met het bekijken van samengestelde scores en modellen test per test vergeleek, was het verschil tussen toonaangevende open-weight- en propriëtaire modellen niet één getal.

Op SWE-bench Verified, een oudere test die in talloze modelaankondigingen is verschenen, was het verschil 0.2 points. Op SWE-bench Pro, een nieuwere test die is ontworpen rond realistisch, meertalig softwarewerk met een gestandaardiseerde opzet, was het 18.2 points.

De schijnbare modelkloof hangt af van de benchmark

Benchmark Kloof Status
SWE-bench Verified 0.2 pts Verzadigd, besmetting gemarkeerd
GPQA Diamond 2.0 pts Verzadigd, ceiling around 92–95%
Terminal-Bench 2.1 4.9 pts Live, agentic
Humanity’s Last Exam 9.8 pts Live, frontier reasoning
SWE-bench Pro 18.2 pts Live, standardized scaffold

Bron: Jaspreet Singh’s analyse van toonaangevende open‑weight en propriëtaire modellen, juli 2026.

Hetzelfde model kan ook verschillende scores krijgen, afhankelijk van wie de test uitvoert. Kimi K3 scoorde 80.9% op Terminal-Bench 2.1 in een onafhankelijke evaluatie en 88.3% toen de maker het resultaat rapporteerde. Die swing van 7.4 points is groter dan de open-versus-frontier gap op drie van de vijf benchmarks die ik analyseerde.

Een model ontvangt instructies via de omringende software, maakt gebruik van de gegeven context, gebruikt de tools die het kan benaderen, en werkt binnen een redeneerbudget dat door de ontwikkelaar is vastgesteld. Verander je die voorwaarden, dan verandert het resultaat mee.

Openbare benchmarks zijn nuttig om de richting van de vooruitgang te begrijpen. Ze vormen een slechte basis om te bepalen wat binnen je bedrijf zal werken.

Agentische betrouwbaarheid verandert de berekening

Dit wordt belangrijker naarmate AI verschuift van het beantwoorden van vragen naar het uitvoeren van een reeks handelingen.

Neem een workflow met 20 stappen, waarbij de AI elke stap voor 95% van de tijd correct uitvoert. Dat klinkt betrouwbaar. Over de volledige reeks echter slaagt de workflow slechts 36% van de tijd.

Een beter model kan de kansen bij elke stap verbeteren, vooral bij moeilijk agentisch werk. Het is de omringende engineering die bepaalt of één foutieve stap het werk verpest. Het opslaan van voortgang, het verifiëren van output, veilig opnieuw proberen en herstellen van fouten scheiden vaak een overtuigende demonstratie van een betrouwbaar product.

De keuze van model blijft belangrijk. Maar het best‑scorende model levert niet automatisch het meest betrouwbare systeem op.

Kies modellen op basis van het werk

De gegevens ondersteunen een beperktere conclusie dan beide kanten van het open‑versus‑propriëtaire debat gewoonlijk stellen.

Open-weight-modellen zijn concurrerend voor goed gedefinieerd, kortetermijnwerk waarbij het resultaat direct kan worden gemeten. Classificatie, extractie, samenvatting en gestructureerde generatie vallen steeds vaker in deze categorie.

Frontier-modellen behouden nog steeds hun premie bij langere agentische taken, naleving van instructies onder druk, en werk waarbij falen duur is om achteraf te detecteren. Daar laten nieuwere benchmarks een kloof zien die dichter bij 18 points ligt dan bij nul, en waar de veiligheidslaag die een modelleverancier biedt, waarde heeft.

Bedrijven moeten modellen kiezen op basis van taak, maar ze moeten er niet van uitgaan dat overschakelen gratis is. Context, redeneren en promptcaches verplaatsen zich niet soepel tussen aanbieders. Een goedkoper model kan duurder worden als het wisselen van systemen het werk moet herstarten of extra lagen van engineering en governance toevoegt.

Modelkeuze wordt minder permanent. Overschakelen blijft een architecturale beslissing.

Naarmate intelligentie goedkoper wordt, blijft oordeel duur.

Competente algemene capaciteit wordt buitengewoon goedkoop. Aan de bovenkant van de curve echter kost elk extra prestatiepunt meer dan het vorige. De laatste negen capaciteitspunten kosten ongeveer tien keer zoveel als alles eronder.

De meeste bedrijven hebben niet voor elk verzoek het krachtigste model nodig. Wel moeten ze weten welk werk het verdient.

Samenvatten, extraheren, classificeren, opstellen en vertalen bewegen zich richting een utiliteitscapaciteit. Wat schaars blijft, is oordeel: weten welke van de vijf plausibele antwoorden correct is, opmerken dat de vraag fout was, en bepalen wanneer te stoppen en een mens te raadplegen.

Oordeel komt voort uit eigendomscontext, bedrijfsregels, workflows, historische kennis en de engineering die het werk verifieert en fouten beperkt.

Bouw de evaluatie die niemand anders kan uitvoeren

Voor een onderneming is de meest waardevolle benchmark opgebouwd uit haar eigen werk.

Maak een privé-evaluatieset met 50 tot 200 echte taken uit uw bedrijf. Houd het omringende systeem constant, voer de tests herhaaldelijk uit, en beoordeel of de taak correct is voltooid in plaats van hoe gepolijst het antwoord klinkt.

Pas dezelfde discipline toe op kosten. Kosten per token kunnen misleiden wanneer een model langer redeneert, meer retries vereist of meer werk creëert voor een menselijke beoordelaar. Meet in plaats daarvan de kosten per geaccepteerde uitkomst.

Begin met een klein aantal modellen. Routeer werk aan het begin van een taak in plaats van halverwege van provider te wisselen. Tel de beveiligings-, governance- en operationele lasten van elke extra provider mee, naast de geadverteerde prijs.

De markt zal blijven nieuwe benchmarkwinnaars voortbrengen, en bedrijven zullen steeds weer in de verleiding komen hun AI-strategie rond elk van hen opnieuw op te bouwen. Een betere aanpak is modellen te kiezen voor het werk, en vervolgens het volledige systeem te evalueren onder de omstandigheden waarin het moet presteren.

De benchmark die uw architectuur moet sturen, is diegene die alleen uw bedrijf kan uitvoeren.

Oprichter en CEO, Jaspreet Singh, brengt een combinatie van productvisie en ervaring als algemeen manager en heeft Druva geleid tot een van de snelstgroeiende bedrijven in de multi‑miljard dollar data‑beschermings‑ en beheerindustrie. Zijn ondernemingsgeest stelde hem in staat om Druva van de grond af op te bouwen, dat nu gewaardeerd wordt op meer dan $2 billion en wereldwijd wordt vertrouwd door duizenden bedrijven die voorop lopen in het omarmen van het cloud‑tijdperk. Zijn markt‑ en technologie‑inzichten leidden hem tot het creëren van het eerste cloud‑native data‑beschermingsplatform, dat innovatieve technologische oplossingen levert en een onderscheidend consumptiemodel biedt dat een erfenis van verouderde hardware en software verstoort.

Voordat hij Druva oprichtte, bekleedde Jaspreet fundamentele functies bij Veritas en Ensim Corp. Daarnaast heeft hij meerdere patenten en een B.S. in Computerwetenschappen van het Indian Institute of Technology, Guwahati.