Liderzy opinii
Otwarte modele wciąż się poprawiają. Ekonomia staje się coraz bardziej skomplikowana.

Modele SI są oczywiście lepsze niż były 18 miesięcy temu. Jednak gdy zacząłem się zagłębiać, typowe wyjaśnienia tego postępu nie miały sensu.
Nie poprawiły się po prostu dlatego, że stały się większe. „Open source wygrywa” jest tylko w połowie prawdziwe. A rada, aby patrzeć na wyniki benchmarków, okazała się znacznie mniej użyteczna, niż się spodziewałem. To przyjęcie zajęło mi trochę czasu.
Więc zebrałem 18 miesięcy danych z 46 modeli z ośmiu laboratoriów. Chciałem zrozumieć, czy inteligencja staje się towarem, czy otwarte modele nadgonią najnowocześniejsze oraz co firmy powinny mierzyć przy wyborze systemów, na których będą budować.
Kluczowy wniosek był prosty: wynik benchmarku nie jest właściwością samego modelu. Odzwierciedla on model, oprogramowanie i otaczający go kontekst oraz ile czasu i mocy obliczeniowej mu przydzielono. Publikując jedną liczbę, ukrywasz dwie pozostałe.
Implikacje są jednak znacznie szersze. Firmy porównują poszczególne modele, podczas gdy powinny oceniać cały system, który ma wykonać pracę.
Benchmarki ukrywają system
Kiedy przestałem patrzeć na łączone wyniki i porównałem modele test po teście, różnica między wiodącymi otwartymi a własnościowymi modelami nie była wcale jedną liczbą.
W teście SWE-bench Verified, starszym teście, który pojawiał się w niezliczonych zapowiedziach modeli, różnica wyniosła 0.2 punktu. W teście SWE-bench Pro, nowszym teście zaprojektowanym wokół realistycznej, wielojęzycznej pracy programistycznej z ustandaryzowanym środowiskiem, różnica wyniosła 18.2 punktu.
Pozorna różnica modeli zależy od benchmarku
| Benchmark | Różnica | Status |
|---|---|---|
| SWE-bench Verified | 0.2 pkt | Nasycony, wykryto zanieczyszczenie |
| GPQA Diamond | 2.0 pkt | Nasycony, limit około 92–95% |
| Terminal-Bench 2.1 | 4.9 pkt | Na żywo, agentowy |
| Humanity’s Last Exam | 9.8 pkt | Na żywo, rozumowanie na granicy |
| SWE-bench Pro | 18.2 pkt | Na żywo, ustandaryzowana struktura |
Źródło: analiza Jaspreeta Singha wiodących otwartych i własnościowych modeli, lipiec 2026.
Ten sam model może także otrzymać różne wyniki w zależności od tego, kto przeprowadza test. Kimi K3 uzyskał 80.9% w Terminal-Bench 2.1 w niezależnej ocenie i 88.3% gdy jego twórca podał wynik. Ta zmiana o 7.4 punktu jest większa niż różnica między otwartymi a najnowocześniejszymi modelami w trzech z pięciu benchmarków, które przeanalizowałem.
Model otrzymuje instrukcje poprzez otaczające oprogramowanie, korzysta z podanego kontekstu, używa dostępnych narzędzi i działa w ramach budżetu rozumowania ustalonego przez dewelopera. Zmiana tych warunków powoduje zmianę wyniku.
Publiczne benchmarki są przydatne do zrozumienia kierunku postępu. Są jednak słabym podstawą do decydowania, co będzie działało w twojej firmie.
Agentowa niezawodność zmienia rachunki
Staje się to ważniejsze, gdy SI przechodzi od odpowiadania na pytania do realizacji sekwencji działań.
Weźmy przepływ pracy z 20 krokami, w którym SI poprawnie wykonuje każdy krok w 95% przypadków. Brzmi to niezawodnie. Jednak w całej sekwencji przepływ kończy się sukcesem jedynie w 36% przypadków.
Lepszy model może zwiększyć szanse na każdym kroku, szczególnie przy trudnej pracy agentowej. To otaczające inżynieria decyduje, czy jeden błąd zepsuje całość. Zapisywanie postępu, weryfikacja wyników, bezpieczne ponawianie oraz odzyskiwanie po awarii często odróżniają przekonującą demonstrację od niezawodnego produktu.
Wybór modelu wciąż ma znaczenie. Jednak model z najlepszym wynikiem nie zapewnia automatycznie najniebardziej niezawodnego systemu.
Wybieraj modele według rodzaju pracy
Dane wspierają węższy wniosek niż ten, który zazwyczaj prezentują obie strony debaty otwarte vs własnościowe.
Modele otwarte są konkurencyjne przy jasno określonych, krótkoterminowych zadaniach, gdzie wynik można zmierzyć bezpośrednio. Klasyfikacja, ekstrakcja, streszczanie i generowanie strukturalne coraz częściej należą do tej kategorii.
Modele na granicy nadal uzasadniają swoją wyższą cenę przy dłuższych zadaniach agentowych, przestrzeganiu instrukcji pod presją oraz pracy, w której wykrycie błędu po fakcie jest kosztowne. To właśnie tam nowsze benchmarki wykazują różnicę bliższą 18 punktom niż zeru, a warstwa bezpieczeństwa zapewniana przez dostawcę modelu ma wartość.
Firmy powinny dobierać modele do zadania, ale nie powinny zakładać, że zmiana jest darmowa. Kontekst, rozumowanie i pamięci podręczne promptów nie przenoszą się płynnie między dostawcami. Tańszy model może stać się droższy, jeśli zmiana systemów zmusza do ponownego rozpoczęcia pracy lub dodaje warstwy inżynierii i zarządzania.
Wybór modelu staje się mniej trwały. Zmiana nadal jest decyzją architektoniczną.
W miarę jak inteligencja staje się tańsza, osąd pozostaje kosztowny
Kompetentna, ogólnego przeznaczenia zdolność staje się niezwykle tania. Na szczycie krzywej jednak każdy dodatkowy punkt wydajności kosztuje więcej niż poprzedni. Ostatnie dziewięć punktów zdolności kosztuje mniej więcej dziesięciokrotnie więcej niż wszystko, co znajduje się poniżej nich.
Większość firm nie potrzebuje najpotężniejszego modelu do każdego zapytania. Muszą jednak wiedzieć, które zadania na to zasługują.
Streszczanie, wyodrębnianie, klasyfikowanie, tworzenie szkiców i tłumaczenie zmierzają w kierunku użytecznej zdolności. To, co pozostaje rzadkie, to osąd: wiedza, która z pięciu prawdopodobnych odpowiedzi jest prawidłowa, zauważenie, że pytanie było błędne, oraz decyzja, kiedy przerwać i poprosić człowieka.
Osąd wynika z własnego kontekstu, reguł biznesowych, przepływów pracy, wiedzy historycznej oraz inżynierii, która weryfikuje pracę i ogranicza awarie.
Stwórz ocenę, której nikt inny nie może przeprowadzić
Dla przedsiębiorstwa najcenniejszy benchmark opiera się na jego własnych zadaniach.
Utwórz prywatny zestaw oceny zawierający od 50 do 200 rzeczywistych zadań z Twojej firmy. Utrzymuj stały otaczający system, powtarzaj testy i oceniaj, czy zadanie zostało wykonane poprawnie, a nie jak dopracowana brzmi odpowiedź.
Zastosuj tę samą dyscyplinę do kosztów. Koszt za token może wprowadzać w błąd, gdy model dłużej rozumuje, wymaga więcej powtórzeń lub generuje dodatkową pracę dla ludzkiego recenzenta. Zamiast tego mierz koszt za zaakceptowany wynik.
Zacznij od niewielkiej liczby modeli. Kieruj pracę na początku zadania, zamiast zmieniać dostawcę w połowie realizacji. Uwzględnij obciążenie bezpieczeństwa, zarządzania i operacyjne każdego dodatkowego dostawcy wraz z jego reklamowaną ceną.
Rynek będzie nadal wytwarzał nowych zwycięzców benchmarków, a firmy będą kusić się do przebudowywania swojej strategii AI wokół każdego z nich. Lepszym podejściem jest dobieranie modeli do konkretnych zadań, a następnie ocenianie całego systemu w warunkach, w których musi działać.
Benchmark, który powinien kształtować Twoją architekturę, to ten, który może przeprowadzić wyłącznie Twoja firma.












