Лидеры мнений

Открытые модели продолжают улучшаться. Экономика становится всё более запутанной.

mm
Добавьте Unite.AI в избранные источники в Google

ИИ‑модели очевидно стали лучше, чем 18 месяцев назад. Но когда я стал копать глубже, обычные объяснения этого прогресса не выдерживали проверки.

Они не улучшились просто потому, что стали больше. Утверждение «открытый исходный код выигрывает» лишь отчасти верно. И совет ориентироваться на оценки бенчмарков оказался гораздо менее полезным, чем я ожидал. На это потребовалось некоторое время, чтобы принять.

Итак, я собрал данные за 18 месяцев по 46 моделям из восьми лабораторий. Я хотел понять, становится ли интеллект товаром, догоняют ли открытые модели передний край, и что компаниям следует измерять при выборе систем, на которых они будут строить.

Ключевой вывод был прост: оценка бенчмарка не является свойством модели. Она отражает модель, программное обеспечение и контекст вокруг неё, а также количество времени и вычислительных ресурсов, которые ей были предоставлены. Публикуя одну цифру, вы скрываете остальные два.

Однако последствия гораздо шире. Компании сравнивают отдельные модели, хотя им следует оценивать полностью систему, которая будет выполнять работу.

Бенчмарки скрывают систему

Когда я перестал смотреть на совокупные оценки и сравнивал модели тест за тестом, разрыв между ведущими моделями с открытым весом и коммерческими моделями оказался вовсе не одной цифрой.

В тесте SWE-bench Verified, более старом, который упоминался во множестве анонсов моделей, разрыв составил 0.2 пункта. В тесте SWE-bench Pro, более новом, разработанном для реалистичной, многоязычной программной работы со стандартизированной настройкой, он составил 18.2 пункта.

Кажущийся разрыв моделей зависит от бенчмарка

Бенчмарк Разрыв Статус
SWE-bench Verified 0.2 pts Насыщено, обнаружено загрязнение
GPQA Diamond 2.0 pts Насыщено, потолок около 92–95%
Terminal-Bench 2.1 4.9 pts Живой, агентный
Humanity’s Last Exam 9.8 pts Живой, передовое рассуждение
SWE-bench Pro 18.2 pts Живой, стандартизированная структура

Источник: анализ Джасприт Сингха ведущих моделей с открытым весом и коммерческих моделей, июль 2026 г.

Одна и та же модель может получать разные оценки в зависимости от того, кто проводит тест. Kimi K3 набрал 80.9% в Terminal-Bench 2.1 в независимой оценке и 88.3% когда результат был опубликован её разработчиком. Это изменение на 7.4 пункта больше, чем разрыв между открытыми и передовыми моделями по трем из пяти бенчмарков, которые я проанализировал.

Модель получает инструкции через сопутствующее программное обеспечение, использует предоставленный контекст, применяет доступные инструменты и работает в рамках бюджета рассуждений, установленного разработчиком. Измените эти условия — и результат изменится соответственно.

Публичные бенчмарки полезны для понимания направления прогресса. Однако они являются плохой основой для решения, что будет работать в вашей компании.

Агентная надёжность меняет расчёты

Это становится более важным, когда ИИ переходит от ответов на вопросы к выполнению последовательности действий.

Возьмём рабочий процесс из 20 шагов, где ИИ правильно выполняет каждый шаг в 95% случаев. Это звучит надёжно. Однако в полной последовательности процесс завершается успешно лишь в 36% случаев.

Более хорошая модель может повысить вероятность успеха на каждом шаге, особенно при сложной агентной работе. Именно сопутствующая инженерия определяет, разрушит ли один ошибочный шаг весь процесс. Сохранение прогресса, проверка результатов, безопасные повторные попытки и восстановление после сбоя часто отличают убедительную демонстрацию от надёжного продукта.

Выбор модели всё ещё имеет значение. Но модель с лучшей оценкой не гарантирует создание самой надёжной системы.

Выбирайте модели по типу работы

Данные поддерживают более узкий вывод, чем обычно делают обе стороны дебатов об открытых и коммерческих моделях.

Модели с открытым весом конкурентоспособны для чётко определённой, краткосрочной работы, где результат можно измерить напрямую. Классификация, извлечение, суммирование и структурированная генерация всё чаще попадают в эту категорию.

Модели переднего края по‑прежнему оправдывают свою премию в более длительных агентных задачах, при строгом соблюдении инструкций под давлением и в работе, где обнаружить ошибку после её возникновения дорого. Именно здесь новые бенчмарки показывают разрыв около 18 пунктов, а не ноль, и где слой безопасности, предоставляемый поставщиком модели, имеет ценность.

Компаниям следует выбирать модели в зависимости от задачи, но они не должны полагать, что переключение бесплатно. Контекст, рассуждения и кэши запросов не переносятся чисто между поставщиками. Дешевле модель может стать дороже, если смена систем заставит работу начинать заново или добавит уровни инженерии и управления.

Выбор модели становится менее постоянным. Переключение всё ещё остаётся архитектурным решением.

По мере снижения стоимости интеллекта, суждение остаётся дорогим

Компетентные возможности общего назначения становятся чрезвычайно недорогими. Однако в верхней части кривой каждый дополнительный пункт производительности стоит дороже предыдущего. Последние девять пунктов возможностей стоят примерно в десять раз больше, чем всё, что ниже их.

Большинству компаний не нужна самая мощная модель для каждого запроса. Им необходимо знать, какая работа заслуживает её использования.

Сводка, извлечение, классификация, составление черновиков и перевод движутся к утилитарным возможностям. Дефицитным остаётся суждение: знать, какой из пяти правдоподобных ответов верен, замечать, что вопрос сформулирован неверно, и решать, когда остановиться и обратиться к человеку.

Суждение формируется из проприетарного контекста, бизнес‑правил, рабочих процессов, исторических знаний и инженерии, которая проверяет работу и ограничивает сбои.

Создайте оценку, которую никто другой не сможет выполнить

Для предприятия самый ценный бенчмарк формируется на основе его собственной работы.

Создайте закрытый набор оценок из 50–200 реальных задач вашего бизнеса. Оставьте окружающую систему неизменной, многократно запускайте тесты и оценивайте, выполнена ли работа правильно, а не насколько отшлифованным выглядит ответ.

Примените тот же подход к стоимости. Стоимость за токен может вводить в заблуждение, когда одна модель рассуждает дольше, требует больше повторных запросов или создаёт дополнительную работу для человеческого проверяющего. Измеряйте стоимость за принятый результат.

Начните с небольшого количества моделей. Направляйте работу в начале задания, а не меняйте поставщика в середине процесса. Учтите нагрузку по безопасности, управлению и эксплуатации каждого дополнительного поставщика наряду с его рекламируемой ценой.

Рынок будет продолжать выпускать новых победителей бенчмарков, и компании будут искушены перестраивать свою стратегию ИИ вокруг каждого из них. Лучший подход — выбирать модели под конкретную работу, а затем оценивать всю систему в условиях, где она должна работать.

Бенчмарк, который должен определять вашу архитектуру, — это тот, который может выполнить только ваша компания.

Основатель и генеральный директор, Jaspreet Singh, сочетает видение продукта и опыт генерального менеджера и привёл Druva к тому, чтобы стать одной из самых быстрорастущих компаний в многомиллиардной отрасли защиты и управления данными. Его предпринимательский дух позволил ему запустить Druva с нуля, сейчас компания оценивается более чем в $2 billion и пользуется доверием тысяч компаний по всему миру, находящихся в авангарде принятия облачной эпохи. Его инсайты рынка и технологий привели к созданию первой облачно‑нативной платформы защиты данных, которая предлагает инновационные технологические решения и уникальную модель потребления, разрывающую традицию устаревшего аппаратного и программного обеспечения.

Перед тем как основать Druva, Jaspreet занимал ключевые должности в компаниях Veritas и Ensim Corp. Кроме того, он имеет несколько патентов и степень B.S. в области компьютерных наук, полученную в Indian Institute of Technology, Guwahati.