Tankeledere
Åpne modeller blir stadig bedre. Økonomien blir stadig mer komplisert.

AI-modeller er åpenbart bedre enn de var for 18 måneder siden. Men da jeg begynte å se nærmere, stemte ikke de vanlige forklaringene på denne fremgangen.
De ble ikke bedre bare fordi de ble større. «Åpen kildekode vinner» er bare delvis riktig. Og rådet om å se på benchmark‑resultater viste seg å være mye mindre nyttig enn jeg forventet. Det tok meg en stund å akseptere.
Så hentet jeg 18 måneder med data fra 46 modeller fra åtte laboratorier. Jeg ønsket å forstå om intelligens blir en vare, om åpne modeller innhenter frontlinjen, og hva selskaper bør måle når de velger systemene de skal bygge på.
Den viktigste funn var enkelt: En benchmark‑score er egentlig ikke en egenskap ved en modell. Den reflekterer modellen, programvaren og konteksten rundt den, samt hvor mye tid og datakraft den fikk bruke. Publiser ett tall, så skjuler du de to andre.
Implikasjonene er imidlertid mye bredere. Selskaper sammenligner individuelle modeller når de burde evaluere hele systemet som må utføre arbeidet.
Benchmark‑tester skjuler systemet
Da jeg sluttet å se på sammensatte scorer og sammenlignet modeller test for test, var gapet mellom ledende åpne‑vekt‑modeller og proprietære modeller ikke ett enkelt tall.
På SWE-bench Verified, en eldre test som har dukket opp i utallige modellannonser, var gapet 0,2 poeng. På SWE-bench Pro, en nyere test designet for realistisk, flerspråklig programvarearbeid med en standardisert oppsett, var det 18,2 poeng.
Den tilsynelatende modellgapet avhenger av benchmark‑testen
| Benchmark | Gap | Status |
|---|---|---|
| SWE-bench Verified | 0.2 pts | Mettet, forurensning flagget |
| GPQA Diamond | 2.0 pts | Mettet, tak rundt 92–95 % |
| Terminal-Bench 2.1 | 4.9 pts | Live, agentisk |
| Humanity’s Last Exam | 9.8 pts | Live, frontlinje‑resonnement |
| SWE-bench Pro | 18.2 pts | Live, standardisert rammeverk |
Kilde: Jaspreet Singhs analyse av ledende åpne‑vekt‑ og proprietære modeller, juli 2026.
Den samme modellen kan også få forskjellige scorer avhengig av hvem som kjører testen. Kimi K3 oppnådde 80,9 % på Terminal-Bench 2.1 i en uavhengig evaluering og 88,3 % da produsenten rapporterte resultatet. Denne 7,4‑poengs svingingen er større enn åpne‑versus‑frontlinje‑gapet på tre av de fem benchmark‑testene jeg analyserte.
En modell mottar instruksjoner gjennom omkringliggende programvare, bruker konteksten den får, benytter verktøyene den har tilgang til, og opererer innenfor et resonneringsbudsjett satt av utvikleren. Endrer du disse forholdene, endres også resultatet.
Offentlige benchmark‑tester er nyttige for å forstå retningen på fremgangen. De er et dårlig grunnlag for å avgjøre hva som vil fungere i ditt selskap.
Agentisk pålitelighet endrer regnestykket
Dette blir viktigere etter hvert som AI går fra å svare på spørsmål til å fullføre en sekvens av handlinger.
Ta en arbeidsflyt med 20 trinn, der AI får hvert trinn riktig 95 % av gangene. Det høres pålitelig ut. Over hele sekvensen lykkes imidlertid arbeidsflyten bare 36 % av gangene.
En bedre modell kan forbedre sjansene på hvert trinn, spesielt ved vanskelig agentisk arbeid. Det er den omkringliggende ingeniørkunsten som avgjør om ett dårlig trinn ødelegger jobben. Å lagre fremdrift, verifisere resultater, prøve på nytt på en sikker måte, og komme seg etter feil, skiller ofte en overbevisende demonstrasjon fra et pålitelig produkt.
Modellvalget spiller fortsatt en rolle. Men den best‑scorende modellen gir ikke automatisk det mest pålitelige systemet.
Velg modeller etter arbeidet
Dataene støtter en snevrere konklusjon enn noen av sidene i debatten om åpen versus proprietær vanligvis gjør.
Åpne‑vekt‑modeller er konkurransedyktige for veldefinert, kortsiktig arbeid hvor resultatet kan måles direkte. Klassifisering, uttrekk, oppsummering og strukturert generering faller i økende grad inn i denne kategorien.
Frontlinje‑modeller tjener fortsatt sin premie på lengre agentiske oppgaver, etterlevelse av instruksjoner under press, og arbeid hvor feil er kostbart å oppdage i ettertid. Det er her nyere benchmark‑tester viser et gap nærmere 18 poeng enn null, og hvor sikkerhetslaget som leveres av en modellleverandør har verdi.
Bedrifter bør velge modeller etter oppgave, men de bør ikke anta at bytte er gratis. Kontekst, resonnering og prompt‑hurtiglagre flytter seg ikke sømløst mellom leverandører. En billigere modell kan bli dyrere hvis bytte av systemer tvinger arbeidet til å starte på nytt eller legger til lag av ingeniørarbeid og styring.
Valg av modell blir mindre permanent. Bytte er fortsatt en arkitektonisk beslutning.
Etter hvert som intelligens blir billigere, forblir dømmekraft dyr.
Kyndig generelle kapasiteter blir usedvanlig rimelige. På toppen av kurven koster hvert ekstra ytelsespoeng imidlertid mer enn det forrige. De siste ni poengene av kapasitet koster omtrent ti ganger så mye som alt under dem.
De fleste bedrifter trenger ikke den mest kraftfulle modellen for hver forespørsel. De må imidlertid vite hvilket arbeid som fortjener den.
Oppsummering, uttrekking, klassifisering, utkastskriving og oversetting beveger seg mot nyttekapasitet. Det som fortsatt er knapphet, er dømmekraft: å vite hvilken av fem plausible svar som er korrekt, oppdage at spørsmålet var feil, og bestemme når man skal stoppe og be en menneskelig.
Dømmekraft kommer fra proprietær kontekst, forretningsregler, arbeidsflyter, historisk kunnskap og ingeniørarbeidet som verifiserer arbeidet og begrenser feil.
Bygg evalueringen som ingen andre kan kjøre
For en virksomhet er den mest verdifulle benchmarken bygget på eget arbeid.
Lag et privat evalueringssett med 50 til 200 reelle oppgaver fra din virksomhet. Hold det omkringliggende systemet uendret, kjør testene gjentatte ganger, og vurder om oppgaven ble fullført korrekt i stedet for hvor polert svaret høres ut.
Bruk samme disiplin på kostnad. Kostnad per token kan være misvisende når en modell resonnerer lenger, krever flere forsøk, eller skaper mer arbeid for en menneskelig gjennomgår. Mål kostnad per akseptert resultat i stedet.
Start med et lite antall modeller. Rute arbeidet i begynnelsen av en oppgave i stedet for å bytte leverandør midt i den. Telle sikkerhets-, styrings- og driftsbelastningen for hver ekstra leverandør sammen med den annonserte prisen.
Markedet vil fortsette å produsere nye benchmark‑vinnere, og bedrifter vil fortsatt bli fristet til å bygge om sin AI‑strategi rundt hver enkelt. En bedre tilnærming er å velge modeller for arbeidet, og deretter evaluere hele systemet under de forholdene der det må prestere.
Benchmarken som bør styre arkitekturen din, er den som kun ditt selskap kan kjøre.












