Liderzy opinii

Otwarte modele wciąż się poprawiają. Ekonomia staje się coraz bardziej skomplikowana.

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Modele SI są oczywiście lepsze niż były 18 miesięcy temu. Jednak gdy zacząłem się zagłębiać, typowe wyjaśnienia tego postępu nie miały sensu.

Nie poprawiły się po prostu dlatego, że stały się większe. „Open source wygrywa” jest tylko w połowie prawdziwe. A rada, aby patrzeć na wyniki benchmarków, okazała się znacznie mniej użyteczna, niż się spodziewałem. To przyjęcie zajęło mi trochę czasu.

Więc zebrałem 18 miesięcy danych z 46 modeli z ośmiu laboratoriów. Chciałem zrozumieć, czy inteligencja staje się towarem, czy otwarte modele nadgonią najnowocześniejsze oraz co firmy powinny mierzyć przy wyborze systemów, na których będą budować.

Kluczowy wniosek był prosty: wynik benchmarku nie jest właściwością samego modelu. Odzwierciedla on model, oprogramowanie i otaczający go kontekst oraz ile czasu i mocy obliczeniowej mu przydzielono. Publikując jedną liczbę, ukrywasz dwie pozostałe.

Implikacje są jednak znacznie szersze. Firmy porównują poszczególne modele, podczas gdy powinny oceniać cały system, który ma wykonać pracę.

Benchmarki ukrywają system

Kiedy przestałem patrzeć na łączone wyniki i porównałem modele test po teście, różnica między wiodącymi otwartymi a własnościowymi modelami nie była wcale jedną liczbą.

W teście SWE-bench Verified, starszym teście, który pojawiał się w niezliczonych zapowiedziach modeli, różnica wyniosła 0.2 punktu. W teście SWE-bench Pro, nowszym teście zaprojektowanym wokół realistycznej, wielojęzycznej pracy programistycznej z ustandaryzowanym środowiskiem, różnica wyniosła 18.2 punktu.

Pozorna różnica modeli zależy od benchmarku

Benchmark Różnica Status
SWE-bench Verified 0.2 pkt Nasycony, wykryto zanieczyszczenie
GPQA Diamond 2.0 pkt Nasycony, limit około 92–95%
Terminal-Bench 2.1 4.9 pkt Na żywo, agentowy
Humanity’s Last Exam 9.8 pkt Na żywo, rozumowanie na granicy
SWE-bench Pro 18.2 pkt Na żywo, ustandaryzowana struktura

Źródło: analiza Jaspreeta Singha wiodących otwartych i własnościowych modeli, lipiec 2026.

Ten sam model może także otrzymać różne wyniki w zależności od tego, kto przeprowadza test. Kimi K3 uzyskał 80.9% w Terminal-Bench 2.1 w niezależnej ocenie i 88.3% gdy jego twórca podał wynik. Ta zmiana o 7.4 punktu jest większa niż różnica między otwartymi a najnowocześniejszymi modelami w trzech z pięciu benchmarków, które przeanalizowałem.

Model otrzymuje instrukcje poprzez otaczające oprogramowanie, korzysta z podanego kontekstu, używa dostępnych narzędzi i działa w ramach budżetu rozumowania ustalonego przez dewelopera. Zmiana tych warunków powoduje zmianę wyniku.

Publiczne benchmarki są przydatne do zrozumienia kierunku postępu. Są jednak słabym podstawą do decydowania, co będzie działało w twojej firmie.

Agentowa niezawodność zmienia rachunki

Staje się to ważniejsze, gdy SI przechodzi od odpowiadania na pytania do realizacji sekwencji działań.

Weźmy przepływ pracy z 20 krokami, w którym SI poprawnie wykonuje każdy krok w 95% przypadków. Brzmi to niezawodnie. Jednak w całej sekwencji przepływ kończy się sukcesem jedynie w 36% przypadków.

Lepszy model może zwiększyć szanse na każdym kroku, szczególnie przy trudnej pracy agentowej. To otaczające inżynieria decyduje, czy jeden błąd zepsuje całość. Zapisywanie postępu, weryfikacja wyników, bezpieczne ponawianie oraz odzyskiwanie po awarii często odróżniają przekonującą demonstrację od niezawodnego produktu.

Wybór modelu wciąż ma znaczenie. Jednak model z najlepszym wynikiem nie zapewnia automatycznie najniebardziej niezawodnego systemu.

Wybieraj modele według rodzaju pracy

Dane wspierają węższy wniosek niż ten, który zazwyczaj prezentują obie strony debaty otwarte vs własnościowe.

Modele otwarte są konkurencyjne przy jasno określonych, krótkoterminowych zadaniach, gdzie wynik można zmierzyć bezpośrednio. Klasyfikacja, ekstrakcja, streszczanie i generowanie strukturalne coraz częściej należą do tej kategorii.

Modele na granicy nadal uzasadniają swoją wyższą cenę przy dłuższych zadaniach agentowych, przestrzeganiu instrukcji pod presją oraz pracy, w której wykrycie błędu po fakcie jest kosztowne. To właśnie tam nowsze benchmarki wykazują różnicę bliższą 18 punktom niż zeru, a warstwa bezpieczeństwa zapewniana przez dostawcę modelu ma wartość.

Firmy powinny dobierać modele do zadania, ale nie powinny zakładać, że zmiana jest darmowa. Kontekst, rozumowanie i pamięci podręczne promptów nie przenoszą się płynnie między dostawcami. Tańszy model może stać się droższy, jeśli zmiana systemów zmusza do ponownego rozpoczęcia pracy lub dodaje warstwy inżynierii i zarządzania.

Wybór modelu staje się mniej trwały. Zmiana nadal jest decyzją architektoniczną.

W miarę jak inteligencja staje się tańsza, osąd pozostaje kosztowny

Kompetentna, ogólnego przeznaczenia zdolność staje się niezwykle tania. Na szczycie krzywej jednak każdy dodatkowy punkt wydajności kosztuje więcej niż poprzedni. Ostatnie dziewięć punktów zdolności kosztuje mniej więcej dziesięciokrotnie więcej niż wszystko, co znajduje się poniżej nich.

Większość firm nie potrzebuje najpotężniejszego modelu do każdego zapytania. Muszą jednak wiedzieć, które zadania na to zasługują.

Streszczanie, wyodrębnianie, klasyfikowanie, tworzenie szkiców i tłumaczenie zmierzają w kierunku użytecznej zdolności. To, co pozostaje rzadkie, to osąd: wiedza, która z pięciu prawdopodobnych odpowiedzi jest prawidłowa, zauważenie, że pytanie było błędne, oraz decyzja, kiedy przerwać i poprosić człowieka.

Osąd wynika z własnego kontekstu, reguł biznesowych, przepływów pracy, wiedzy historycznej oraz inżynierii, która weryfikuje pracę i ogranicza awarie.

Stwórz ocenę, której nikt inny nie może przeprowadzić

Dla przedsiębiorstwa najcenniejszy benchmark opiera się na jego własnych zadaniach.

Utwórz prywatny zestaw oceny zawierający od 50 do 200 rzeczywistych zadań z Twojej firmy. Utrzymuj stały otaczający system, powtarzaj testy i oceniaj, czy zadanie zostało wykonane poprawnie, a nie jak dopracowana brzmi odpowiedź.

Zastosuj tę samą dyscyplinę do kosztów. Koszt za token może wprowadzać w błąd, gdy model dłużej rozumuje, wymaga więcej powtórzeń lub generuje dodatkową pracę dla ludzkiego recenzenta. Zamiast tego mierz koszt za zaakceptowany wynik.

Zacznij od niewielkiej liczby modeli. Kieruj pracę na początku zadania, zamiast zmieniać dostawcę w połowie realizacji. Uwzględnij obciążenie bezpieczeństwa, zarządzania i operacyjne każdego dodatkowego dostawcy wraz z jego reklamowaną ceną.

Rynek będzie nadal wytwarzał nowych zwycięzców benchmarków, a firmy będą kusić się do przebudowywania swojej strategii AI wokół każdego z nich. Lepszym podejściem jest dobieranie modeli do konkretnych zadań, a następnie ocenianie całego systemu w warunkach, w których musi działać.

Benchmark, który powinien kształtować Twoją architekturę, to ten, który może przeprowadzić wyłącznie Twoja firma.

Założyciel i dyrektor generalny, Jaspreet Singh, łączy wizję produktu z doświadczeniem menedżera generalnego i doprowadził Druva do tego, by stała się jedną z najszybciej rozwijających się firm w wielomiliardowej branży ochrony i zarządzania danymi. Jego przedsiębiorczy duch pozwolił mu samodzielnie rozwinąć Druva, której obecna wycena przekracza 2 miliardy dolarów i jest zaufana na całym świecie przez tysiące firm będących na czele przyjmowania ery chmury. Jego wgląd w rynek i technologię skłonił go do stworzenia pierwszej natywnej w chmurze platformy ochrony danych, która dostarcza innowacyjne rozwiązania technologiczne oraz charakterystyczny model konsumpcji, zakłócając tradycyjne, przestarzałe rozwiązania sprzętowe i programowe.

Przed założeniem Druva Jaspreet pełnił kluczowe stanowiska w firmach Veritas i Ensim Corp. Dodatkowo posiada liczne patenty oraz tytuł licencjata (B.S.) w dziedzinie informatyki uzyskany na Indian Institute of Technology, Guwahati.