Lideri de opinie
Modelele deschise continuă să se îmbunătățească. Economia devine tot mai complicată.

Modelele de IA sunt evident mai bune decât erau acum 18 luni. Dar când am început să cercetez mai în profunzime, explicațiile obișnuite pentru acest progres nu se potriveau.
Ele nu s-au îmbunătățit doar pentru că au devenit mai mari. „Open source câștigă” este doar pe jumătate adevărat. Iar sfatul de a privi scorurile benchmark-urilor s-a dovedit mult mai puțin util decât mă așteptam. A durat ceva timp să accept acest lucru.
Așadar am adunat 18 luni de date de la 46 de modele din opt laboratoare. Am vrut să înțeleg dacă inteligența devine o marfă, dacă modelele deschise ajung la frontieră și ce ar trebui să măsoare companiile atunci când aleg sistemele pe care le vor construi.
Descoperirea cheie a fost simplă: un scor de benchmark nu este cu adevărat o proprietate a unui model. El reflectă modelul, software‑ul și contextul înconjurător, precum și timpul și puterea de calcul pe care i‑s‑au permis să le folosească. Publici un singur număr și ascunzi celelalte două.
Implicațiile, totuși, sunt mult mai ample. Companiile compară modele individuale când ar trebui să evalueze sistemul complet care trebuie să efectueze munca.
Benchmark‑urile ascund sistemul
Când am încetat să mă uit la scorurile compuse și am comparat modelele test cu test, diferența dintre modelele open‑weight de top și cele proprietare nu era deloc un singur număr.
Pe SWE-bench Verified, un test mai vechi care a apărut în nenumărate anunțuri de modele, diferența a fost de 0,2 puncte. Pe SWE-bench Pro, un test mai nou conceput în jurul muncii software realiste, multilingve, cu o configurație standardizată, diferența a fost de 18,2 puncte.
Diferența aparentă a modelului depinde de benchmark
| Benchmark | Diferență | Stare |
|---|---|---|
| SWE-bench Verified | 0.2 pts | Saturat, contaminare semnalată |
| GPQA Diamond | 2.0 pts | Saturat, plafon în jur de 92–95% |
| Terminal-Bench 2.1 | 4.9 pts | În timp real, agentic |
| Humanity’s Last Exam | 9.8 pts | În timp real, raționament de frontieră |
| SWE-bench Pro | 18.2 pts | În timp real, schelet standardizat |
Sursă: analiza lui Jaspreet Singh a modelelor open-weight și proprietare de top, iulie 2026.
Același model poate primi, de asemenea, scoruri diferite în funcție de cine rulează testul. Kimi K3 a obținut 80,9% la Terminal-Bench 2.1 într-o evaluare independentă și 88,3% când producătorul său a raportat rezultatul. Această diferență de 7,4 puncte este mai mare decât diferența open‑versus‑frontier la trei dintre cele cinci benchmark‑uri pe care le-am analizat.
Un model primește instrucțiuni prin software‑ul înconjurător, se bazează pe contextul furnizat, utilizează instrumentele la care are acces și funcționează în cadrul unui buget de raționament stabilit de dezvoltator. Modifică acele condiții și rezultatul se modifică în consecință.
Benchmark‑urile publice sunt utile pentru a înțelege direcția progresului. Ele reprezintă o bază slabă pentru a decide ce va funcționa în interiorul companiei tale.
Fiabilitatea agentică schimbă calculele
Acest lucru devine mai important pe măsură ce IA trece de la a răspunde la întrebări la a finaliza o secvență de acțiuni.
Ia în considerare un flux de lucru cu 20 de pași, în care IA execută corect fiecare pas în 95% din cazuri. Sună fiabil. Însă pe întreaga secvență, fluxul de lucru reușește doar în 36% din cazuri.
Un model mai bun poate îmbunătăți șansele la fiecare pas, în special la sarcini agentice dificile. Este ingineria înconjurătoare cea care determină dacă un pas greșit strică întregul job. Salvarea progresului, verificarea rezultatelor, reluarea în siguranță și recuperarea din eșec deseori separă o demonstrație convingătoare de un produs de încredere.
Alegerea modelului contează în continuare. Dar modelul cu cel mai bun scor nu produce automat cel mai fiabil sistem.
Alege modelele în funcție de sarcină
Datele susțin o concluzie mai restrânsă decât cea pe care fiecare parte a dezbaterii open‑versus‑proprietar o susține de obicei.
Modelele open‑weight sunt competitive pentru sarcini bine definite, pe termen scurt, unde rezultatul poate fi măsurat direct. Clasificarea, extragerea, rezumarea și generarea structurată intră tot mai des în această categorie.
Modelele frontier continuă să-și justifice prețul premium pe sarcini agentice mai lungi, respectarea instrucțiunilor sub presiune și munci în care eșecul este scump de detectat ulterior. Aici benchmark‑urile noi arată o diferență apropiată de 18 de puncte, nu zero, și unde stratul de siguranță furnizat de furnizorul modelului are valoare.
Companiile ar trebui să aleagă modelele în funcție de sarcină, dar nu ar trebui să presupună că trecerea la altul este gratuită. Contextul, raționamentul și cache‑urile de prompt nu se transferă curat între furnizori. Un model mai ieftin poate deveni mai costisitor dacă schimbarea sistemelor obligă munca să fie reluată sau adaugă straturi de inginerie și guvernanță.
Alegerea modelului devine din ce în ce mai puțin permanentă. Schimbarea rămâne o decizie arhitecturală.
Pe măsură ce inteligența devine mai ieftină, judecata rămâne scumpă
Capacitatea generală competentă devine extraordinar de ieftină. În vârful curbei, totuși, fiecare punct suplimentar de performanță costă mai mult decât precedentul. Ultimele nouă puncte de capacitate costă aproximativ de zece ori mai mult decât tot ce se află sub ele.
Majoritatea companiilor nu au nevoie de cel mai puternic model pentru fiecare cerere. Au nevoie să știe care lucru merită acel model.
Rezumatul, extragerea, clasificarea, redactarea și traducerea se îndreaptă spre o capacitate de utilitate. Ceea ce rămâne rar este judecata: să știi care dintre cele cinci răspunsuri plauzibile este corect, să observi că întrebarea era greșită și să decizi când să te oprești și să soliciți intervenția unui om.
Judecata provine din contextul proprietar, regulile de afaceri, fluxurile de lucru, cunoștințele istorice și ingineria care verifică munca și conține eșecurile.
Construiți evaluarea pe care nimeni altcineva nu o poate rula
Pentru o întreprindere, cel mai valoros benchmark este construit din munca proprie.
Creați un set de evaluare privat cu 50 până la 200 de sarcini reale din afacerea dumneavoastră. Mențineți sistemul înconjurător fix, rulați testele în mod repetat și evaluați dacă sarcina a fost finalizată corect, nu cât de finisat sună răspunsul.
Aplicați aceeași disciplină costurilor. Costul pe token poate induce în eroare când un model raționează mai mult, necesită mai multe încercări sau generează mai multă muncă pentru un revizor uman. Măsurați costul pe rezultat acceptat în schimb.
Începeți cu un număr mic de modele. Direcționați munca la începutul unei sarcini în loc să schimbați furnizorii pe parcurs. Numărați povara de securitate, guvernanță și operațională a fiecărui furnizor suplimentar alături de prețul său publicitar.
Piața va continua să producă noi câștigători de benchmark, iar companiile vor fi în continuare tentate să-și reconstruiască strategia AI în jurul fiecăruia. O abordare mai bună este să alegeți modelele în funcție de muncă, apoi să evaluați întregul sistem în condițiile în care trebuie să performeze.
Benchmark‑ul care ar trebui să vă ghideze arhitectura este cel pe care doar compania dumneavoastră îl poate rula.












