Лидеры мнений

Архитектура проверки имеет большее значение, чем модель в корпоративном ИИ

mm
Добавьте Unite.AI в избранные источники в Google

Следующая фаза зрелости ИИ в корпоративной среде зависит меньше от лучших моделей и больше от создания достоверной архитектуры вокруг них.

Каждый разговор об управлении ИИ, который у меня был за последние два года, возвращается к одним и тем же проблемам: показатели галлюцинаций, эталоны точности и тестирование на соответствие. Эти проблемы являются реальными, конечно, но разговор был сосредоточен на неправильном конце проблемы.

Хотя модели значительно улучшились, количество непроверенных выходов ИИ, доходящих до руководителей высшего звена, увеличилось вместе с ними. Этот пробел указывает на проблему архитектуры проверки, и отрасль практически не обсуждает это.

История, ориентированная на модель, опережает реальность

Доминирующая рамка в корпоративном ИИ все еще рассматривает качество модели как основную переменную: если модель достаточно точна, выход достоверен. Эта логика была понятна два года назад, когда ранние модели LLM были более непоследовательными и склонными к галлюцинациям, но ситуация изменилась.

Модели сегодня производят отполированные, хорошо структурированные, богатые цитатами ответы на огромный диапазон задач, отформатированные на языке, готовом для заинтересованных сторон. Организации теперь используют ИИ в объеме, который значительно превышает тот, с которым их процессы проверки были рассчитаны на обработку. Исследования по внедрению корпоративного ИИ задокументировали это несоответствие в разработке программного обеспечения, где разработчики, использующие ИИ, завершают на 21% больше задач, а время проверки запросов на слияние увеличивается на 91%. Производительность увеличивается, поэтому возможность больше не является узким местом. Вместимость проверки является настоящим препятствием.

Что показывают данные в работе с информацией

Отрасль информации является выгодным местом для изучения этой проблемы, поскольку профессионалы исследований являются обученными скептиками. Они знают разницу между корреляцией, причинностью, результатами и выводами. Вопросы качества данных являются частью работы.

Согласно Индексу доверия ИИ Knit, 92% опрошенных профессионалов корпоративных исследований сообщают, что выходы, сгенерированные ИИ, доходят до руководителей высшего звена без всесторонней проверки.
Найденные Индексом доверия моменты давления определяют три основных момента давления:

  • Объем превысил способность верификации. Команды генерируют больше выходов, чем они имеют полосу пропускания, чтобы тщательно проверить их.
  • Уверенность возросла быстрее, чем изменилось поведение верификации. Исследователи чувствуют себя в целом положительно о качестве ИИ, признавая, что их практика проверки не поспевает.
  • Инструменты для проверки работы ИИ отстают от инструментов для его производства. Организации инвестировали значительные средства в возможности генерации и сравнительно мало в инфраструктуру для проверки и отслеживания того, что произвело ИИ.

Отполированные выходы приглашают к меньшей проверке

Более сложный режим отказа не является случаем, когда ИИ производит явно неправильный ответ и кто-то ловит его. Более сложная проблема заключается в предвзятости автоматизации, тенденции уменьшить проверку выходов, которые кажутся авторитетными и хорошо сформированными. Систематический обзор 2025 года, опубликованный в журнале ИИ и Общество, изучил это на основе 35 рецензируемых исследований и обнаружил, что отполированные, высокообоснованные выходы ИИ последовательно уменьшают глубину человеческой проверки — даже среди опытных профессионалов. Когда что-то выглядит правильно, мы выделяем меньше внимания на проверку того, является ли оно таковым.

Этот пробел создает проблему распространения. Выход исследований, который аналитик только слегка проверяет, становится точкой данных в презентации на уровне вице-президента, которая становится основой для обсуждения на уровне совета директоров. К тому времени, когда ошибка проходит так далеко, ее происхождение становится невидимым, а ее исправление становится дорогим. Глобальные бизнес-потери от неточностей, сгенерированных ИИ, превысили 67 миллиардов долларов в 2024 году. Расходы на верификацию на одного сотрудника могут достигать 14 200 долларов в год, только для проверки того, является ли содержание, сгенерированное ИИ, точным. Снова, это не проблемы качества модели; это проблемы архитектуры проверки.

Как выглядят зрелые рабочие процессы ИИ

Организации, которые хорошо управляют этой проблемой, не используют лучшие модели, чем все остальные. Вместо этого они построили более тщательную инфраструктуру проверки вокруг моделей, которые они используют. Четыре принципа определяют их подход:

  1. Открытое происхождение

Каждый выход ИИ несет прозрачную запись о том, откуда взялись его входные данные. Эта запись дает проверяющим ценные сведения о том, что им нужно оценить, чтобы эффективно оценить эти выходы. Вы не можете оценить утверждение, которое не прослеживается.

  1. Уровневая проверка по ставкам

Не все выходы ИИ несут одинаковый риск. Зрелые рабочие процессы применяют интенсивность проверки пропорционально последствиям неправильного понимания. Выходы с высокими ставками получают больше глаз и структурированных шагов верификации. Рутинные выходы движутся быстрее.

  1. Трение в правильных местах

Организации, которые борются больше всего с доверием ИИ, удалили трение равномерно, рассматривая скорость как универсальную цель. Успешные организации были избирательными: сохраняя намеренное трение в точках передачи, где выходы ИИ становятся организационными решениями. Их процессы требуют подписи перед тем, как сгенерированное ИИ обнаружение войдет в презентацию совета директоров, или структурированного шага проверки перед тем, как обнаружения войдут в обсуждения стратегии.

  1. Петли обратной связи к слою модели

Лучшие рабочие процессы рассматривают проверку как процесс, генерирующий данные, а не контрольный пункт. Когда проверяющий отмечает ошибку или переопределяет рекомендацию ИИ, этот сигнал захватывается и подается обратно в то, как ИИ развертывается в будущей работе. Отчет OpenAI о состоянии корпоративного ИИ обнаружил, что организации с наивысшей производительностью отличаются не сложностью своих моделей, а строгостью их процессов развертывания. Организации без этой петли обратной связи начинают с нуля каждый раз.

Следующая фаза будет выиграна на уровне проверки

Настоящее конкурентное преимущество в отрасли информации заключается в том, кто может постоянно доверять тому, что они производят. Это доверие исходит от знания того, откуда произошел выход, кто его проверил и что произошло, когда что-то было неправильным. Недавняя история ответила на вопрос модели; организационная инфраструктура для ответственного развертывания моделей в масштабе является тем, где отрасль все еще находит свою дорогу.

Тот факт, что 92% профессионалов исследований видели непроверенный контент ИИ, доходящий до руководителей высшего звена, не является технологическим провалом. Это провал организационного дизайна, и он возникает в различных отраслях, где скорость была оптимизирована, а проверка была рассмотрена как стоимость. Компания с самой умной моделью не выиграет следующую фазу корпоративного ИИ, но компания с наиболее достоверной архитектурой проверки вокруг нее.

Аниш Дхаван является сооснователем и генеральным директором Knit, агентства по исследованию, основанному на искусственном интеллекте. Он провел последние 5 лет на пересечении корпоративного ИИ и методологии исследований. Knit работает с организациями, включая Google, Amazon, T-Mobile и ESPN, для предоставления готовых к принятию решений выводов на скорости ИИ.