Tankeledere

Open-modeller bliver ved med at blive bedre. Økonomien bliver mere kompliceret.

mm
Føj Unite.AI til dine foretrukne kilder på Google

AI-modeller er åbenlyst bedre end de var for 18 måneder siden. Men da jeg begyndte at grave dybere, stemte de sædvanlige forklaringer på den fremgang ikke.

De blev ikke bedre blot fordi de blev større. “Open source vinder” er kun delvist korrekt. Og rådet om at kigge på benchmark‑resultater viste sig at være meget mindre nyttigt, end jeg havde forventet. Det tog mig et stykke tid at acceptere.

Så jeg samlede 18 måneders data fra 46 modeller fra otte laboratorier. Jeg ønskede at forstå, om intelligens bliver en vare, om open-modeller indhenter frontlinjen, og hvad virksomheder bør måle, når de vælger de systemer, de skal bygge på.

Den vigtigste konklusion var enkel: en benchmark‑score er egentlig ikke en egenskab ved en model. Den afspejler modellen, softwaren og konteksten omkring den, samt hvor meget tid og beregningskraft den fik lov til at bruge. Publicér ét tal, og du skjuler de to andre.

Implikationerne er dog langt bredere. Virksomheder sammenligner individuelle modeller, når de i stedet burde evaluere det komplette system, der skal udføre arbejdet.

Benchmarks skjuler systemet

Da jeg holdt op med at se på sammensatte scores og sammenlignede modeller test for test, var forskellen mellem førende open‑weight‑ og proprietære modeller ikke ét tal overhovedet.

På SWE-bench Verified, en ældre test som er blevet nævnt i utallige model‑annonceringer, var forskellen 0,2 point. På SWE-bench Pro, en nyere test designet omkring realistisk, flersproget softwarearbejde med en standardiseret opsætning, var den 18,2 point.

Den tilsyneladende model‑forskel afhænger af benchmarken

Benchmark Forskel Status
SWE-bench Verified 0,2 pt Mættet, forurening markeret
GPQA Diamond 2,0 pt Mættet, loft omkring 92–95 %
Terminal-Bench 2.1 4,9 pt Live, agentisk
Humanity’s Last Exam 9,8 pt Live, frontlinje‑resonering
SWE-bench Pro 18,2 pt Live, standardiseret ramme

Kilde: Jaspreet Singhs analyse af førende open‑weight‑ og proprietære modeller, juli 2026.

Den samme model kan også få forskellige scores afhængigt af, hvem der kører testen. Kimi K3 opnåede 80,9 % på Terminal-Bench 2.1 i en uafhængig evaluering og 88,3 % da dens producent rapporterede resultatet. Denne forskel på 7,4 point er større end forskellen mellem open og frontier på tre af de fem benchmarks, jeg analyserede.

En model modtager instruktioner gennem den omgivende software, trækker på den kontekst, den får, bruger de værktøjer, den kan tilgå, og opererer inden for et resonneringsbudget sat af udvikleren. Ændrer man disse betingelser, ændres resultatet også.

Offentlige benchmarks er nyttige til at forstå retningen af fremskridt. De er et dårligt grundlag for at beslutte, hvad der vil fungere i din virksomhed.

Agentisk pålidelighed ændrer ligningen

Dette bliver vigtigere, efterhånden som AI bevæger sig fra at besvare spørgsmål til at fuldføre en sekvens af handlinger.

Tag et workflow med 20 trin, hvor AI klarer hvert trin korrekt 95 % af tiden. Det lyder pålideligt. Over hele sekvensen lykkes workflowet dog kun 36 % af tiden.

En bedre model kan forbedre oddsene på hvert trin, især på vanskeligt agentisk arbejde. Det er den omgivende ingeniørkunst, der afgør, om et enkelt dårligt trin ødelægger jobbet. At gemme fremskridt, verificere output, prøve igen sikkert og komme sig efter fejl adskiller ofte en overbevisende demonstration fra et pålideligt produkt.

Modelvalget betyder stadig noget. Men den bedst‑scorede model producerer ikke automatisk det mest pålidelige system.

Vælg modeller efter arbejdet

Dataene understøtter en snævrere konklusion end nogen af siderne i debatten om open versus proprietær normalt gør.

Open-weight‑modeller er konkurrencedygtige til veldefineret, kortsigtet arbejde, hvor resultatet kan måles direkte. Klassificering, udtræk, sammenfatning og struktureret generering falder i stigende grad ind under denne kategori.

Frontier‑modeller tjener stadig deres præmie på længere agentiske opgaver, overholdelse af instruktioner under pres, og arbejde hvor fejl er dyre at opdage i eftertid. Det er her, nyere benchmarks viser en forskel på omkring 18 point frem for nul, og hvor sikkerhedslagene fra en model‑leverandør har værdi.

Virksomheder bør vælge modeller efter opgave, men de bør ikke antage, at skift er gratis. Kontext, ræsonnement og prompt‑caches overføres ikke problemfrit mellem leverandører. En billigere model kan blive dyrere, hvis ændring af systemer tvinger arbejdet til at starte forfra eller tilføjer lag af engineering og governance.

Modelvalg bliver mindre permanent. Skift er stadig en arkitektonisk beslutning.

Når intelligens bliver billigere, forbliver dømmekraft dyr

Kompetent generel kapacitet bliver ekstraordinært billig. Øverst i kurven koster hvert ekstra præstationspunkt dog mere end det foregående. De sidste ni points af kapacitet koster cirka ti gange så meget som alt, der ligger under dem.

De fleste virksomheder har ikke brug for den mest kraftfulde model til hver forespørgsel. De skal dog vide, hvilket arbejde der berettiger den.

Opsummering, udtræk, klassificering, udarbejdelse og oversættelse bevæger sig mod en nyttekapacitet. Det, der forbliver knapt, er dømmekraft: at vide, hvilket af fem plausible svar der er korrekt, bemærke at spørgsmålet var forkert, og beslutte hvornår man skal stoppe og bede et menneske om hjælp.

Dømmekraft kommer fra proprietær kontekst, forretningsregler, arbejdsprocesser, historisk viden og den engineering, der verificerer arbejdet og indeholder fejl.

Byg den evaluering, som ingen andre kan køre

For en virksomhed er den mest værdifulde benchmark bygget ud fra eget arbejde.

Opret et privat evalueringssæt med 50 til 200 reelle opgaver fra din virksomhed. Hold det omgivende system uændret, kør testene gentagne gange, og bedøm om opgaven blev udført korrekt frem for hvor poleret svaret lyder.

Anvend samme disciplin på omkostninger. Omkostning pr. token kan være vildledende, når en model resonnerer længere, kræver flere forsøg eller skaber mere arbejde for en menneskelig reviewer. Mål i stedet omkostning pr. accepteret resultat.

Start med et lille antal modeller. Rute arbejdet i begyndelsen af en opgave i stedet for at skifte leverandør midt i den. Medregn sikkerheds-, governance- og driftsbyrden for hver ekstra leverandør sammen med den annoncerede pris.

Markedet vil fortsætte med at producere nye benchmark‑vindere, og virksomheder vil fortsat blive fristet til at genopbygge deres AI‑strategi omkring hver enkelt. En bedre tilgang er at vælge modeller til arbejdet og derefter evaluere hele systemet under de betingelser, hvor det skal præstere.

Den benchmark, der bør drive din arkitektur, er den, som kun din virksomhed kan køre.

Grundlægger og administrerende direktør, Jaspreet Singh, bringer en kombination af produktvision og erfaring som general manager og har ledt Druva til at blive en af de hurtigst voksende virksomheder i den milliard-dollar store data‑beskyttelses‑ og administrationsindustri. Hans entreprenørielle ånd gjorde det muligt for ham at starte Druva fra bunden, som nu er vurderet til over 2 milliarder dollars og er betroet verden over af tusindvis af virksomheder, der er i front med at omfavne cloud‑æraen. Hans marked‑ og teknologiskundskaber førte ham til at skabe den første cloud‑native data‑beskyttelsesplatform, som leverer innovative teknologiløsninger og en særpræget forbrugsmodel, der forstyrrer en arv af aldrende hardware og software.

Før han grundlagde Druva, havde Jaspreet grundlæggende stillinger hos Veritas og Ensim Corp. Derudover har han flere patenter og en bachelor i datalogi fra Indian Institute of Technology, Guwahati.