Ajatusjohtajat

Avoimet mallit paranevat jatkuvasti. Talous monimutkaistuu.

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Tekoälymallit ovat selvästi parempia kuin 18 kuukautta sitten. Mutta kun aloin tarkastella asiaa syvemmin, tavanomaiset selitykset tälle edistykselle eivät pitäneet paikkaansa.

Ne eivät parantuneet pelkästään koon kasvun vuoksi. “Avoin lähdekoodi voittaa” on vain osittain totta. Lisäksi neuvonta tarkastella vertailuarvoja osoittautui paljon vähemmän hyödylliseksi kuin odotin. Tämäkin kesti hetken hyväksyä.

Joten keräsin 18 kuukautta dataa 46 mallista kahdeksasta laboratoriosta. Halusin ymmärtää, muuttuuko älykkyys tavaraksi, saavuttavatko avoimet mallit eturannan, ja mitä yritysten tulisi mitata valitessaan järjestelmiä, joihin ne rakentavat.

Keskeinen havainto oli yksinkertainen: vertailuarvo ei ole oikeastaan mallin ominaisuus. Se heijastaa mallia, sitä ympäröivää ohjelmistoa ja kontekstia sekä sitä, kuinka paljon aikaa ja laskentatehoa sille on annettu käyttää. Julkaisemalla yhden luvun, piilotat kaksi muuta.

Seuraukset ovat kuitenkin paljon laajemmat. Yritykset vertailevat yksittäisiä malleja, vaikka niiden tulisi arvioida koko järjestelmä, jonka on suoritettava työ.

Vertailut piilottavat järjestelmän

Kun lopetin koostetuissa pisteissä katsomisen ja vertailin malleja testi kerrallaan, johtavien avoimen painon ja suljettujen mallien välinen ero ei ollut yhtään luku.

SWE-bench Verified -testissä, vanhemmassa testissä, joka on esiintynyt lukuisissa mallijulkaisussa, ero oli 0,2 pistettä. SWE-bench Pro -testissä, uudessa testissä, joka on suunniteltu realistiseen, monikieliseen ohjelmistotyöhön vakiintuneella asetuksella, ero oli 18,2 pistettä.

Ilmeinen malliero riippuu vertailusta

Vertailu Ero Tila
SWE-bench Verified 0.2 pts Kyllästynyt, kontaminaatio merkitty
GPQA Diamond 2.0 pts Kyllästynyt, yläraja noin 92–95 %
Terminal-Bench 2.1 4.9 pts Live, agenttinen
Humanity’s Last Exam 9.8 pts Live, eturannan päättely
SWE-bench Pro 18.2 pts Live, vakiollistettu runko

Lähde: Jaspreet Singhin analyysi johtavista avoimen painon ja suljetuista malleista, heinäkuu 2026.

Sama malli voi myös saada erilaisia pisteitä sen mukaan, kuka testin suorittaa. Kimi K3 sai 80,9 % Terminal-Bench 2.1 -testissä itsenäisessä arvioinnissa ja 88,3 % kun sen valmistaja raportoi tuloksen. Tämä 7,4 pisteen vaihtelu on suurempi kuin avoimen ja eturannan välinen ero kolmessa viidestä tarkastellusta vertailusta.

Malli saa ohjeet ympäröivästä ohjelmistosta, hyödyntää sille annettua kontekstia, käyttää käytettävissä olevia työkaluja ja toimii kehittäjän asettaman päättelybudjetin puitteissa. Muuta näitä ehtoja ja tulos muuttuu niiden mukana.

Julkiset vertailut ovat hyödyllisiä edistymisen suunnan ymmärtämisessä. Ne ovat heikko pohja päätettäessä, mikä toimii yrityksessäsi.

Agenttinen luotettavuus muuttaa laskentaa

Tämä korostuu, kun tekoäly siirtyy vastaamaan kysymyksiin kohti toimien sarjan suorittamista.

Ota esimerkiksi työnkulku, jossa on 20 vaihetta, ja tekoäly tekee jokaisen vaiheen oikein 95 %:ssa tapauksista. Se kuulostaa luotettavalta. Koko sarjan aikana työnkulku onnistuu kuitenkin vain 36 %:ssa tapauksista.

Parempi malli voi parantaa todennäköisyyksiä jokaisessa vaiheessa, erityisesti vaikeassa agenttisessa työssä. Ympäröivä tekniikka määrää, rikkooko yksi huono vaihe koko työn. Edistymisen tallentaminen, tulosten tarkistaminen, turvallinen uudelleenyritys ja epäonnistumisesta toipuminen erottavat usein vakuuttavan demonstraation luotettavasta tuotteesta.

Mallin valinta on yhä merkityksellinen. Mutta paras pistemäärä ei automaattisesti tuota luotettavinta järjestelmää.

Valitse mallit työn mukaan

Aineisto tukee kapeampaa johtopäätöstä kuin avoimen ja suljetun välinen keskustelu yleensä esittää.

Avoimen painon mallit ovat kilpailukykyisiä selkeästi määritellyssä, lyhyen aikavälin työssä, jossa tulos voidaan mitata suoraan. Luokittelu, tiedon poiminta, tiivistäminen ja rakenteellinen generointi kuuluvat yhä enemmän tähän kategoriaan.

Eturannan mallit ansaitsevat edelleen lisähintansa pidemmissä agenttisissa tehtävissä, ohjeiden noudattamisessa paineen alla ja työssä, jossa epäonnistumisen havaitseminen jälkikäteen on kallista. Näissä tilanteissa uudemmat vertailut osoittavat eron, joka on lähellä 18 pistettä eikä nollaa, ja missä mallitoimittajan tarjoama turvakerros on arvokas.

Yritysten tulisi valita mallit tehtävän mukaan, mutta niiden ei pidä olettaa, että vaihtaminen on ilmaista. Konteksti, päättely ja kehotteiden välimuistit eivät siirry sujuvasti eri tarjoajien välillä. Halvempi malli voi tulla kalliimmaksi, jos järjestelmän vaihtaminen pakottaa työn aloittamaan alusta tai lisää insinööri- ja hallintokerroksia.

Mallivalinta on vähemmän pysyvää. Vaihtaminen on edelleen arkkitehtoninen päätös.

Kun älykkyys tulee halvemmaksi, harkinta pysyy kalliina

Kyvykäs yleiskäyttöinen kyvykkyys tulee poikkeuksellisen edulliseksi. Kuitenkin käyrän huipulla jokainen lisäpiste suorituskyvyssä maksaa enemmän kuin edellinen. Viimeiset yhdeksän kyvykkyyspistettä maksavat noin kymmenkertaisesti sen, mitä kaikki alemmat pisteet maksavat.

Useimmat yritykset eivät tarvitse kaikkein voimakkainta mallia jokaisessa pyynnössä. Heidän täytyy kuitenkin tietää, mikä työ ansaitsee sen.

Yhteenveto, tiedon poiminta, luokittelu, luonnostelu ja kääntäminen siirtyvät kohti hyötykyvykkyyttä. Harvinaista on edelleen harkinta: tietää, mikä viidestä mahdollisesta vastauksesta on oikea, huomata, että kysymys oli virheellinen, ja päättää, milloin lopettaa ja pyytää ihmistä.

Harkinta perustuu omistajuuteen olevaan kontekstiin, liiketoimintasääntöihin, työnkulkuihin, historiallisten tietojen tuntemukseen sekä insinööritieteeseen, joka tarkistaa työn ja rajoittaa epäonnistumisia.

Rakenna arviointi, jota kukaan muu ei voi suorittaa

Yritykselle arvokkainta mittaria on se, joka perustuu sen omaan työhön.

Luo yksityinen arviointijoukko, jossa on 50–200 todellista tehtävää liiketoiminnastasi. Pidä ympäröivä järjestelmä samana, suorita testit toistuvasti ja arvioi, onko tehtävä suoritettu oikein sen sijaan, että arvioisit vastauksen kiiltävyyttä.

Sovelletaan samaa kurinalaisuutta kustannuksiin. Token‑kohtainen hinta voi olla harhaanjohtava, kun malli päättää pidempään, vaatii useampia yrityksiä tai luo enemmän työtä ihmistarkistajalle. Mittaa sen sijaan kustannus hyväksyttyä tulosta kohti.

Aloita pienellä määrällä malleja. Ohjaa työ tehtävän alussa sen sijaan, että vaihtaisit tarjoajaa kesken prosessin. Laske jokaisen lisätoimittajan turvallisuus-, hallinto- ja operatiivinen kuormitus sen ilmoitetun hinnan ohella.

Markkinat jatkavat uusien mittarivoittajien tuottamista, ja yritykset houkuttelevat yhä uudelleen rakentamaan AI‑strategiansa jokaisen ympärille. Parempi lähestymistapa on valita mallit työn mukaan ja sitten arvioida koko järjestelmä niissä olosuhteissa, joissa sen on suoritettava.

Arviointimittari, jonka tulisi ohjata arkkitehtuuriasi, on se, jonka vain yrityksesi voi suorittaa.

Perustaja ja toimitusjohtaja Jaspreet Singh tuo mukanaan yhdistelmän tuotevisioita ja yleisjohtajakokemusta, ja hän on johtanut Druvan yhdeksi nopeimmin kasvavista yrityksistä monimiljardisessa datan suojaus‑ ja hallintateollisuudessa. Hänen yrittäjähenkisyytensä mahdollisti Druvan käynnistämisen, ja yritys on nyt yli 2 miljardia dollaria arvostettu ja maailmanlaajuisesti tuhansien edelläkävijäyritysten luottama pilviajan omaksumisessa. Markkina‑ ja teknologiasisältöinen näkemys johti hänet luomaan ensimmäisen pilvipohjaisen datan suojausalustan, joka tarjoaa innovatiivisia teknologiaratkaisuja ja erottuvan kulutusmallin, joka murtaa vanhentuneen laitteiston ja ohjelmiston perinnön.

Ennen Druvan perustamista Jaspreet toimi perustavissa rooleissa Veritasilla ja Ensim Corpissa. Lisäksi hänellä on useita patentteja ja hänellä on kandidaatin tutkinto tietojenkäsittelytieteessä Indian Institute of Technology, Guwahati -laitoksesta.