Лидеры мнений
Нет, ИИ не тормозит. Вы смотрите на неправильную доску счета

Руководители начали сомневаться в своих дорожных картах ИИ. После первоначального всплеска генеративных инструментов в 2023 году естественно задуматься, не замедлился ли импульс. Но этот вопрос неправильно интерпретирует доску счета. Прогресс ИИ не остановился. Он сместился.
То, что когда-то казалось экспоненциальным изменением на поверхности, плавной письменностью, отполированными резюме, теперь происходит в более глубоких, значимых областях: рассуждении, коде, оркестровке рабочих процессов и многомодальном понимании. Эти достижения менее яркие, но намного более влиятельные. Если вы все еще измеряете ИИ его способностью написать лучший абзац, вы пропускаете фактическую трансформацию.
Настоящие выигрыши происходят там, где выполняется работа
Прогресс ускоряется там, где он имеет наибольшее значение. На новых, строгих бенчмарках, таких как GPQA, который оценивает рассуждение на уровне магистра наук, производительность модели увеличилась почти на 49% пунктов в год. На MMMU, который тестирует задачи по нескольким доменам и многомодальные задачи, оценки увеличились на 19 пунктов. SWE-bench, бенчмарк, который требует исправления реальных кодовых баз GitHub и прохождения автоматических тестов, увеличился с 4,4% до более 71% за один год.
Это не маргинальные улучшения. Они показывают, что большие языковые модели осваивают задачи, которые требуют точности, рассуждения и интеграции по сложным системам. SWE-bench, в частности, выходит за рамки игрушечных проблем и демонстрирует, могут ли модели участвовать в фактическом разработке программного обеспечения, порог, который когда-то казался годами.
В то же время предприятия эволюционируют свои ожидания. Теперь недостаточно, чтобы модели были “общеинтеллектуальными”, они должны быть конкретно полезными. Сдвиг в сторону адаптированных моделей, систем, связанных с инструментами, и многоагентных рамок отражает растущий спрос на производительность, которая является операционной, аудиторской и интегрированной в реальные рабочие процессы.
Нарратив не соответствует реальности
Итак, почему кажется, что все замедляется? Есть две причины. Во-первых, бенчмарки, которые изначально привлекли внимание, суммирование текста, генерация электронной почты и простые задачи чата, достигли естественных потолков. Как только модель последовательно выполняет задачи с точностью 90%, улучшения кажутся минимальными. Это потолочный эффект, а не плато в прогрессе.
Сегодняшние улучшения включают долгосрочную память, интеграцию инструментов, рассуждение во время вывода и точность, специфичную для домена. Эти возможности не производят вирусные демонстрации, но они значительно улучшают то, что модели могут делать в реальных рабочих процессах. Хотя традиционные языковые бенчмарки достигают потолка, операционные бенчмарки, связанные с реальным рассуждением, использованием инструментов и надежностью предприятия, улучшаются быстрее, чем когда-либо. Этот разрыв объясняет несоответствие: случайные наблюдатели видят застой, потому что поверхность не изменилась, но практики видят трансформацию, происходящую прямо под ней.
От демонстраций к развертыванию
ИИ больше не ограничивается яркими демонстрациями или узкими прототипами. Он переходит в фазу основного развертывания, особенно в корпоративных средах, где надежность, точность и доставка результатов имеют значение. Сдвиг в сторону структурированных, задачно-специфических систем уже начался.
К 2026 году 40% корпоративных приложений будут включать встроенные агенты ИИ, что является огромным скачком с 5% в 2025 году. Эти агенты предназначены не просто для ответа на запросы, а для выполнения задач, оркестровки рабочих процессов и доставки осязаемых результатов в таких областях, как финансы, кибербезопасность и операции с клиентами.
Эта эволюция отражает более глубокий технический сдвиг. Ведущие разработчики ИИ, включая OpenAI, переходят от грубой масштабирования к рассуждению во время вывода, что позволяет моделям мыслить над проблемами, проверять выводы и взаимодействовать с внешними инструментами динамически. То, что когда-то казалось узкой автоматизацией, становится чем-то гораздо более способным: агентами, которые планируют, адаптируются и выполняют надежно. Это не больше ИИ, это умнее ИИ, построенный для реальной работы.
И эта реальная работа измеряется, а не просто представляется. Предприятия переходят от циклов доказательства концепции к готовым к производству развертываниям с четкими KPI и бизнес-целями, связанными с результатами. Эта зрелая фаза больше не о новизне, а о надежности.
Ошибка, которую руководители собираются совершить
Настоящий риск, с которым сталкиваются лидеры предприятий сегодня, заключается не в том, что прогресс ИИ остановился. Это то, что они поверят в это и приостановят инвестиции в тот момент, когда возможности ускоряются под поверхностью.
Организации, которые обгоняют других, не ждут следующего откровения в стиле GPT. Они встраивают сегодняшний ИИ в высокоценные, межфункциональные рабочие процессы и доставляют измеримое бизнес-воздействие. Более двух третей организаций, использующих ИИ, сообщают о значительном снижении затрат или росте доходов,直接 связанных с этими развертываниями. Наиболее успешные адоптеры были теми, кто интегрировал ИИ по нескольким бизнес-функциям и автоматизировал целые цепочки процессов.
Тем не менее, многие команды руководителей все еще застряли в устаревших рамках оценки. Они полагаются на академические бенчмарки, которые больше не отражают сложность реальных задач предприятия. Они оптимизируют под эффективность токенов, одновременно игнорируя операционную ценность точности, восстановления и интеграции.
Это не просто техническая задержка, это стратегическая. Разрыв между компаниями, которые скорректировали свой подход к ИИ, и теми, кто не сделал этого, расширяется. И скоро он не будет измеряться в развернутых моделях, а в доле рынка и времени, необходимом для получения результата.
Как переоценить оценку ИИ
Пора обновить доску счета. Организациям необходимо отслеживать полное выполнение задач, оркестровку инструментов и межмодальные рабочие процессы. Модели должны оцениваться не только на то, “отвечают ли они на вопрос”, но и на то, выполняют ли они многоступенчатую задачу, восстанавливаются ли после сбоя и производят ли вывод, интегрируемый в существующие системы.
Бенчмарки, такие как GPQA, MMMU и SWE-bench, являются началом. Но внутренние бенчмарки, построенные вокруг конкретной области и рабочих процессов предприятия, еще более важны.
Современный ИИ способен доставлять высокоценные результаты, но только если вы тестируете на те результаты, которые имеют значение.
То, что определит следующую волну успеха, не будет моделями с наибольшим количеством параметров, а системами, которые работают надежно в конкретном бизнес-контексте. Точность, аудиторская проверка, поддержка цепочки инструментов и восстановление после ошибки будут иметь больше веса, чем плавность или тон.
Фронтир переместился
ИИ не застойный. Он переходит в слои, где фактически происходит работа, где системы должны рассуждать, проверять и взаимодействовать по нескольким доменам. Он оставляет позади фазу новизны и входит в фазу инфраструктуры.
Компании, которые понимают этот сдвиг, уже строят преимущество. Они не гонятся за следующей вирусной демонстрацией. Они захватывают реальную производительность, улучшают время решения и масштабируют процессы с точностью и скоростью.
Если вы все еще смотрите на старую доску счета, вы пропускаете очки, набранные где-то еще. Следующие лидеры не будут теми, кто ждал фейерверков. Они будут теми, кто увидел через шум и действовал на реальный сигнал.












