Tankeledare

Öppna modeller blir ständigt bättre. Ekonomin blir allt mer komplicerad.

mm
Lägg till Unite.AI bland dina föredragna källor på Google

AI-modeller är uppenbarligen bättre än de var för 18 månader sedan. Men när jag började gräva djupare stämde inte de vanliga förklaringarna till den utvecklingen.

De förbättrades inte bara för att de blev större. ”Öppen källkod vinner” är bara delvis sant. Och rådet att titta på benchmark‑resultat visade sig vara mycket mindre användbart än jag förväntade mig. Det tog ett tag för mig att acceptera det.

Så jag samlade 18 månader av data från 46 modeller från åtta laboratorier. Jag ville förstå om intelligens blir en vara, om öppna modeller hänger med i frontlinjen, och vad företag bör mäta när de väljer de system de ska bygga på.

Den viktigaste slutsatsen var enkel: ett benchmark‑resultat är egentligen inte en egenskap hos en modell. Det speglar modellen, mjukvaran och kontexten runt den, samt hur mycket tid och beräkningskraft den fick använda. Publicera ett tal, och du döljer de två andra.

Implikationerna är dock mycket bredare. Företag jämför enskilda modeller när de egentligen bör utvärdera hela systemet som ska utföra arbetet.

Benchmark‑resultat döljer systemet

När jag slutade titta på sammansatta poäng och jämförde modeller test för test, var klyftan mellan ledande öppna och proprietära modeller inte ett enda tal.

På SWE-bench Verified, ett äldre test som har dykt upp i otaliga modellannonser, var klyftan 0,2 poäng. På SWE-bench Pro, ett nyare test utformat för realistiskt, flerspråkigt mjukvariarbete med en standardiserad uppsättning, var den 18,2 poäng.

Den upplevda modellklyftan beror på benchmarken

Benchmark Klyfta Status
SWE-bench Verified 0,2 pkt Mätt, kontaminering flaggad
GPQA Diamond 2,0 pkt Mätt, tak runt 92–95 %
Terminal-Bench 2.1 4,9 pkt Live, agentisk
Humanity’s Last Exam 9,8 pkt Live, frontlinjerational
SWE-bench Pro 18,2 pkt Live, standardiserad ram

Källa: Jaspreet Singhs analys av ledande öppna och proprietära modeller, juli 2026.

Samma modell kan också få olika poäng beroende på vem som kör testet. Kimi K3 fick 80,9 % på Terminal-Bench 2.1 i en oberoende utvärdering och 88,3 % när tillverkaren rapporterade resultatet. Den 7,4‑punkts svängningen är större än klyftan mellan öppna och frontlinjemodeller på tre av de fem benchmarkarna jag analyserade.

En modell får instruktioner via omgivande mjukvara, drar nytta av den kontext den får, använder de verktyg den kan nå och opererar inom en resonemangsbudget som utvecklaren satt. Ändras dessa förutsättningar förändras också resultatet.

Offentliga benchmarkar är användbara för att förstå utvecklingsriktningen. De är en dålig grund för att besluta vad som kommer att fungera i ditt företag.

Agentisk tillförlitlighet förändrar matematiken

Detta blir viktigare när AI går från att svara på frågor till att fullfölja en sekvens av handlingar.

Tänk dig ett arbetsflöde med 20 steg, där AI gör varje steg rätt 95 % av gångerna. Det låter pålitligt. Över hela sekvensen lyckas dock arbetsflödet bara 36 % av gångerna.

En bättre modell kan förbättra sannolikheten i varje steg, särskilt vid svår agentisk arbetsuppgift. Det är den omgivande ingenjörskonsten som avgör om ett enda felsteg förstör hela jobbet. Att spara framsteg, verifiera resultat, återförsöka säkert och återhämta sig från fel är ofta det som skiljer en övertygande demonstration från en pålitlig produkt.

Modellvalet spelar fortfarande roll. Men den modell som får högst poäng ger inte automatiskt det mest pålitliga systemet.

Välj modeller efter arbetet

Datan stödjer en snävare slutsats än vad någon av sidorna i debatten om öppet kontra proprietärt vanligtvis påstår.

Öppna modeller är konkurrenskraftiga för väldefinierat, kortsiktigt arbete där resultatet kan mätas direkt. Klassificering, extraktion, sammanfattning och strukturerad generering faller i allt högre grad inom denna kategori.

Frontlinjemodeller behåller fortfarande sitt premium på längre agentiska uppgifter, instruktionstrogen under press och arbete där fel är dyra att upptäcka i efterhand. Det är där nyare benchmarkar visar en klyfta närmare 18 poäng än noll, och där säkerhetslagret som en modellleverantör erbjuder har värde.

Företag bör välja modeller efter uppgift, men de bör inte anta att byte är gratis. Kontext, resonemang och promptcachar flyttar inte smidigt mellan leverantörer. En billigare modell kan bli dyrare om byte av system tvingar arbetet att starta om eller lägger till lager av ingenjörs- och styrningsarbete.

Modellvalet blir mindre permanent. Att byta är fortfarande ett arkitekturbeslut.

När intelligensen blir billigare förblir omdömesförmågan dyr

Kompetent allmännyttig kapacitet blir extraordinärt billig. Längst upp i kurvan kostar dock varje extra poäng i prestanda mer än den föregående. De sista nio poängen i kapacitet kostar ungefär tio gånger så mycket som allt under dem.

De flesta företag behöver inte den mest kraftfulla modellen för varje förfrågan. De måste veta vilket arbete som förtjänar den.

Sammanfattningsvis, extrahering, klassificering, utkastsskrivning och översättning rör sig mot nytta‑kapacitet. Vad som fortfarande är knapp är omdöme: att veta vilket av fem möjliga svar som är korrekt, att märka att frågan var felaktig, och att avgöra när man ska sluta och be en människa.

Omdöme kommer från proprietär kontext, affärsregler, arbetsflöden, historisk kunskap och den ingenjörskonst som verifierar arbete och begränsar fel.

Bygg den utvärdering ingen annan kan köra

För ett företag är det mest värdefulla benchmarket byggt på dess eget arbete.

Skapa ett privat utvärderingsset med 50 till 200 verkliga uppgifter från din verksamhet. Håll det omgivande systemet oförändrat, kör testerna upprepade gånger och bedöm om jobbet slutfördes korrekt snarare än hur polerat svaret låter.

Applicera samma disciplin på kostnad. Kostnad per token kan vilseleda när en modell resonerar längre, kräver fler omförsök eller skapar mer arbete för en mänsklig granskare. Mät kostnad per accepterat resultat istället.

Börja med ett litet antal modeller. Rutta arbete i början av ett jobb snarare än att byta leverantör mitt i det. Räkna med säkerhets-, styrnings- och driftsbördan för varje extra leverantör tillsammans med dess annonserade pris.

Marknaden kommer fortsätta producera nya benchmark‑vinnare, och företag kommer fortsätta frestas att bygga om sin AI‑strategi kring varje ny. Ett bättre tillvägagångssätt är att välja modeller för arbetet, och sedan utvärdera hela systemet under de förhållanden där det måste prestera.

Det benchmark som bör styra din arkitektur är det som bara ditt företag kan köra.

Grundare och VD, Jaspreet Singh, kombinerar produktvision med erfarenhet som general manager och har lett Druva till att bli ett av de snabbast växande företagen i den multimiljard‑dollar stora branschen för dataskydd och -hantering. Hans entreprenörsanda gjorde det möjligt för honom att bootstrappa Druva, som nu är värderat till över $2 miljarder och är betrott världen över av tusentals företag i framkant när det gäller att omfamna molnetiden. Hans marknads‑ och teknikinblickar ledde honom till att skapa den första molnnativa dataskyddsplattformen, som levererar innovativa teknologilösningar och en distinkt konsumtionsmodell som stör ett arv av åldrande hårdvara och mjukvara.

Innan han startade Druva hade Jaspreet grundläggande roller på Veritas och Ensim Corp. Dessutom har han flera patent och en kandidatexamen i datavetenskap från Indian Institute of Technology, Guwahati.