Myslitelé
Open modely se neustále zlepšují. Ekonomika se stává složitější.

AI modely jsou očividně lepší než před 18 měsíci. Ale když jsem se začal hlouběji zabývat, obvyklá vysvětlení tohoto pokroku nedávala smysl.
Nezlepšily se jen proto, že se zvětšily. „Open source vítězí“ je jen částečně pravda. A rada sledovat skóre benchmarků se ukázala být mnohem méně užitečná, než jsem očekával. Trvalo mi to, než jsem to přijal.
Tak jsem shromáždil 18 měsíců dat napříč 46 modely z osmi laboratoří. Chtěl jsem pochopit, zda se inteligence stává komoditou, zda open modely dohánějí špičku, a co by společnosti měly měřit při výběru systémů, na nichž budou stavět.
Klíčový závěr byl jednoduchý: skóre benchmarku není ve skutečnosti vlastností modelu. Odráží model, software a kontext, který jej obklopuje, a kolik času a výpočetního výkonu mu bylo povoleno použít. Publikujete jedno číslo a skryjete tak další dvě.
Důsledky jsou však mnohem širší. Společnosti porovnávají jednotlivé modely, ačkoliv by měly hodnotit celý systém, který má práci vykonávat.
Benchmarky skrývají systém
Když jsem přestal sledovat souhrnná skóre a porovnával modely test po testu, rozdíl mezi předními open-weight a proprietárními modely nebyl vůbec jedním číslem.
U SWE-bench Verified, staršího testu, který se objevil v nesčetných oznámeních modelů, byl rozdíl 0,2 bodu. U SWE-bench Pro, novějšího testu navrženého pro realistickou, vícejazyčnou softwarovou práci se standardizovaným nastavením, byl rozdíl 18,2 bodu.
Zdánlivý rozdíl modelů závisí na benchmarku
| Benchmark | Rozdíl | Stav |
|---|---|---|
| SWE-bench Verified | 0.2 pts | Nasycený, označený jako kontaminovaný |
| GPQA Diamond | 2.0 pts | Nasycený, strop kolem 92–95 % |
| Terminal-Bench 2.1 | 4.9 pts | Živý, agentický |
| Humanity’s Last Exam | 9.8 pts | Živý, špičkové uvažování |
| SWE-bench Pro | 18.2 pts | Živý, standardizovaný rámec |
Zdroj: analýza Jaspreet Singhova o předních open-weight a proprietárních modelech, červenec 2026.
Stejný model může také získat různá skóre v závislosti na tom, kdo test provádí. Kimi K3 dosáhl 80,9 % na Terminal-Bench 2.1 v nezávislém hodnocení a 88,3 % když to uvedl jeho výrobce. Tento rozdíl o 7,4 bodu je větší než rozdíl mezi open a špičkovými modely u tří z pěti benchmarků, které jsem analyzoval.
Model přijímá instrukce prostřednictvím okolního softwaru, čerpá z poskytnutého kontextu, využívá dostupné nástroje a funguje v rámci rozpočtu rozvažování nastaveného vývojářem. Změníte-li tyto podmínky, výsledek se s nimi změní.
Veřejné benchmarky jsou užitečné pro pochopení směru pokroku. Jsou však špatným základem pro rozhodování, co bude fungovat ve vaší firmě.
Agentní spolehlivost mění matematiku
To se stává důležitějším, jak AI přechází od odpovídání na otázky k provádění sekvence akcí.
Vezměte si pracovní postup se 20 kroky, kde AI každou krok zvládne správně 95 % času. To zní spolehlivě. V celé sekvenci však pracovní postup uspěje jen 36 % času.
Lepší model může zvýšit pravděpodobnost úspěchu v každém kroku, zejména u obtížné agentní práce. Je to okolní inženýrství, které určuje, zda jeden špatný krok práci zničí. Ukládání postupu, ověřování výstupů, bezpečné opakování a zotavení po selhání často oddělují přesvědčivou ukázku od spolehlivého produktu.
Výběr modelu stále záleží. Ale model s nejvyšším skóre automaticky neprodukuje nejspolehlivější systém.
Volte modely podle úkolu
Data podporují užší závěr, než který obvykle prezentuje jakákoliv strana debaty o open versus proprietárních modelech.
Open-weight modely jsou konkurenceschopné pro dobře definovanou, krátkodobou práci, kde lze výsledek přímo změřit. Klasifikace, extrakce, sumarizace a strukturovaná generace do této kategorie stále častěji spadají.
Špičkové modely si stále vydělávají prémii u delších agentních úkolů, dodržování instrukcí pod tlakem a práce, kde je selhání drahé odhalit až po události. Právě zde novější benchmarky ukazují rozdíl blíže k 18 bodům než k nule a kde bezpečnostní vrstva poskytovaná dodavatelem modelu má hodnotu.
Společnosti by měly vybírat modely podle úkolu, ale neměly by předpokládat, že přepínání je zdarma. Kontext, uvažování a cache výzev se mezi poskytovateli nepřesouvají čistě. Levnější model se může stát dražším, pokud změna systémů nutí práci restartovat nebo přidává vrstvy inženýrství a správy.
Volba modelu se stává méně trvalou. Přepínání je stále architektonické rozhodnutí.
Jak se inteligence stává levnější, úsudek zůstává drahý
Kompetentní obecná schopnost se stává mimořádně levnou. Na vrcholu křivky však každý další bod výkonu stojí více než předchozí. Posledních devět bodů schopnosti stojí zhruba desetkrát více než vše, co je pod nimi.
Většina společností nepotřebuje nejvýkonnější model pro každý požadavek. Potřebují však vědět, která práce si ho zaslouží.
Shrnutí, extrakce, klasifikace, tvorba návrhů a překlad směřují k užitkové schopnosti. To, co zůstává vzácné, je úsudek: vědět, která z pěti pravděpodobných odpovědí je správná, zaznamenat, že otázka byla chybná, a rozhodnout, kdy přestat a požádat člověka.
Úsudek vychází z proprietárního kontextu, obchodních pravidel, pracovních postupů, historických znalostí a inženýrství, které ověřuje práci a zachytává selhání.
Vytvořte hodnocení, které nikdo jiný nemůže spustit
Pro podnik je nejcennější benchmark postavený na jeho vlastní práci.
Vytvořte soukromou sadu hodnocení s 50 až 200 reálnými úkoly z vašeho podnikání. Udržujte okolní systém pevný, testy opakovaně spouštějte a hodnotte, zda byl úkol dokončen správně, spíše než jak uhlazená odpověď zní.
Stejný přístup použijte i na náklady. Náklad na token může být zavádějící, když jeden model uvažuje déle, vyžaduje více opakování nebo vytváří více práce pro lidského recenzenta. Měřte místo toho náklad na přijatý výsledek.
Začněte s malým počtem modelů. Směřujte práci na začátku úkolu místo toho, abyste během něj měnili poskytovatele. Započítejte bezpečnostní, správní a provozní zátěž každého dalšího poskytovatele spolu s jeho inzerovanou cenou.
Trh bude i nadále přinášet nové vítěze benchmarků a společnosti budou i nadále lákány přestavovat svou AI strategii kolem každého z nich. Lepší přístup je vybírat modely podle práce a poté hodnotit celý systém za podmínek, ve kterých má fungovat.
Benchmark, který by měl řídit vaši architekturu, je ten, který může spustit jen vaše společnost.












