Лідери думок
Відкриті моделі продовжують ставати кращими. Економіка стає складнішою.

Штучні інтелекти явно кращі, ніж 18 місяців тому. Але коли я почав копати глибше, звичні пояснення цього прогресу не виправдовувалися.
Вони не покращились лише тому, що стали більшими. «Відкритий код виграє» — це лише частково вірно. І порада орієнтуватися на бенчмарк-результати виявилася значно менш корисною, ніж я очікував. Це зайняло у мене певний час, щоб прийняти.
Тому я зібрав 18 місяців даних по 46 моделях з восьми лабораторій. Я хотів зрозуміти, чи стає інтелект товаром, чи відкриті моделі наздоганяють передовий рівень, і що компанії мають вимірювати, обираючи системи, на яких вони будуть будувати.
Ключовий висновок був простим: оцінка бенчмарку насправді не є властивістю моделі. Вона відображає модель, програмне забезпечення та контекст навколо неї, а також скільки часу і обчислювальних ресурсів їй дозволено використати. Публікуючи одне число, ви приховуєте інші два.
Однак наслідки значно ширші. Компанії порівнюють окремі моделі, хоча мали б оцінювати всю систему, яка повинна виконувати роботу.
Бенчмарки приховують систему
Коли я перестав дивитися на сукупні бали і порівнював моделі тест за тестом, розрив між провідними відкритими та пропрієтарними моделями виявився не одним числом.
У тесті SWE-bench Verified, старішому тесті, що з’являвся у безлічі анонсів моделей, розрив склав 0,2 пункту. У тесті SWE-bench Pro, новішому тесті, розробленому для реальної багатомовної програмної роботи зі стандартизованою конфігурацією, він становив 18,2 пункту.
Здається, розрив між моделями залежить від бенчмарку
| Бенчмарк | Розрив | Статус |
|---|---|---|
| SWE-bench Verified | 0.2 pts | Насичений, виявлено забруднення |
| GPQA Diamond | 2.0 pts | Насичений, верхня межа близько 92–95% |
| Terminal-Bench 2.1 | 4.9 pts | Живий, агентний |
| Humanity’s Last Exam | 9.8 pts | Живий, передове міркування |
| SWE-bench Pro | 18.2 pts | Живий, стандартизована основа |
Джерело: аналіз Джаспрітом Сінгхом провідних відкритих та пропрієтарних моделей, липень 2026 року.
Той самий модель може отримувати різні оцінки залежно від того, хто проводить тест. Kimi K3 отримав 80,9 % у Terminal-Bench 2.1 в незалежній оцінці та 88,3 % коли її розробник повідомив результат. Це коливання на 7,4 пункту більше, ніж розрив між відкритими та передовими моделями за трьома з п’яти бенчмарків, які я аналізував.
Модель отримує інструкції через навколишнє програмне забезпечення, користується наданим контекстом, використовує доступні інструменти та працює в межах бюджету розумових ресурсів, встановленого розробником. Змінивши ці умови, змінюється і результат.
Публічні бенчмарки корисні для розуміння напрямку прогресу. Однак вони погана основа для вирішення, що буде працювати у вашій компанії.
Агентна надійність змінює розрахунки
Це стає важливішим, коли ШІ переходить від відповіді на питання до виконання послідовності дій.
Уявімо робочий процес з 20 кроками, де ШІ виконує кожен крок правильно у 95 % випадків. Це звучить надійно. Однак усього процесу успішність становить лише 36 %.
Краща модель може підвищити ймовірність успіху на кожному кроці, особливо у складній агентній роботі. Однак саме інженерне оточення визначає, чи один помилковий крок зіпсує всю задачу. Збереження прогресу, перевірка результатів, безпечне повторення спроб і відновлення після помилки часто розрізняють вражаючу демонстрацію та надійний продукт.
Вибір моделі все ще важливий. Але модель з найвищим балом не обов’язково створює найнадійнішу систему.
Обирайте моделі за типом роботи
Дані підтримують більш вузький висновок, ніж зазвичай формулюють обидві сторони дебатів про відкриті проти пропрієтарних моделей.
Моделі з відкритою вагою конкурентоспроможні для чітко визначеної, короткострокової роботи, де результат можна виміряти безпосередньо. Класифікація, екстракція, резюмування та структурована генерація все частіше потрапляють у цю категорію.
Передові моделі все ще виправдовують свою преміальність у довших агентних завданнях, дотриманні інструкцій під тиском та роботі, де виявлення помилок після завершення дорого коштує. Саме тут нові бенчмарки показують розрив близько 18 пунктів, а не нуль, і де безпековий шар, що надає постачальник моделі, має цінність.
Компаніям слід підбирати моделі за завданням, але не варто вважати, що перехід безкоштовний. Контекст, міркування та кеші підказок не переходять плавно між постачальниками. Дешевша модель може стати дорожчою, якщо зміна систем змушує роботу перезапускатися або додає шари інженерії та управління.
Вибір моделі стає менш постійним. Перехід все ще є архітектурним рішенням.
Коли інтелект стає дешевшим, судження залишається дорогим
Компетентна універсальна здатність стає надзвичайно недорогою. Однак на вершині кривої кожна додаткова одиниця продуктивності коштує більше, ніж попередня. Останні дев’ять пунктів здатності коштують приблизно в десять разів більше, ніж усе, що розташовано нижче.
Більшість компаній не потребують найпотужнішої моделі для кожного запиту. Однак їм потрібно знати, яка робота її вимагає.
Підсумовування, витяг, класифікація, складання чернеток та переклад рухаються до утилітарної здатності. Те, що залишається дефіцитним, — це судження: знати, яка з п’яти можливих відповідей правильна, помітити, що питання сформульовано неправильно, і вирішити, коли зупинитися і звернутися до людини.
Судження походить із власного контексту, бізнес-правил, робочих процесів, історичних знань та інженерії, яка перевіряє роботу і запобігає помилкам.
Створіть оцінку, яку ніхто інший не зможе виконати
Для підприємства найцінніший бенчмарк створюється на основі його власної роботи.
Створіть приватний набір оцінки з 50‑200 реальних завдань вашого бізнесу. Залишайте оточуючу систему незмінною, повторно запускайте тести та оцінюйте, чи було завдання виконано правильно, а не наскільки відшліфована відповідь.
Застосуйте ту ж дисципліну до вартості. Вартість за токен може вводити в оману, коли одна модель довше міркує, потребує більше повторних спроб або створює додаткову роботу для людського рецензента. Натомість вимірюйте вартість за прийнятий результат.
Почніть з невеликої кількості моделей. Розподіляйте роботу на початку завдання, а не змінюйте постачальника посеред процесу. Враховуйте навантаження на безпеку, управління та операції кожного додаткового постачальника разом із його рекламованою ціною.
Ринок і надалі буде створювати нових переможців бенчмарків, і компанії будуть спокушені перебудовувати свою стратегію ШІ навколо кожного з них. Кращий підхід — підбирати моделі під конкретну роботу, а потім оцінювати всю систему за умов, у яких вона має працювати.
Бенчмарк, який має визначати вашу архітектуру, — це той, який може виконати лише ваша компанія.












