Лидеры мнений

AI‑агенты могут выполнять работу. Но могут ли предприятия управлять ими?

mm
Добавьте Unite.AI в избранные источники в Google

AI‑агенты становятся удивительно хорошими в выполнении задач. Дайте агенту цель, доступ к нужным инструментам, достаточный контекст и чётко определённый рабочий процесс, и он сможет исследовать информацию, анализировать документы, принимать решения, обновлять системы и координировать работу с другими агентами.

Это захватывающая часть агентного ИИ. Это также та часть, которую мы обычно видим в демонстрациях.

Операции предприятий выглядят иначе. Заявка на кредит меняется в середине процесса андеррайтинга. Клиент предоставляет новую информацию после завершения проверки. Две системы расходятся в отношении одной и той же учётной записи. Одобрение, действительное вчера, может уже не быть действительным сегодня. Агент подводит итог делу, передавая его другому агенту, и, казалось бы, незначительная деталь исчезает в процессе.

Оптимальный сценарий может составлять 80 % того, что агент должен выполнить. Предприятия живут в оставшихся 20 %.

Разделение 80/20 не является отраслевой статистикой. Это способ описать, где обычно скрывается операционная сложность. Трудная часть операций предприятий часто заключается не в обычных случаях, а в исключениях, передаче обязанностей, зависимостях, меняющемся контексте и решениях, за которые организация остаётся ответственной за результат.

По мере того как ИИ переходит от ответов на вопросы к выполнению действий, эта операционная сложность становится гораздо более важной. Предприятиям придётся думать не только о том, как создаются агенты, но и о том, как они управляются.

Именно здесь Agentic Operations начинается.

От генерации ответов к выполнению действий

Первая волна корпоративного генеративного ИИ в основном была связана с информацией. Модели резюмировали документы, генерировали отчёты, отвечали на вопросы, искали в корпоративных знаниях и помогали сотрудникам быстрее выполнять существующие задачи.

Агенты вводят нечто принципиально иное. Они могут выполнять действия, меняющие состояние бизнес‑процесса. Агент может одобрить или отклонить что‑то, обновить систему учёта, отправить сообщение клиенту, запустить другой рабочий процесс, вызвать другого агента или принять решение, определяющее дальнейшее развитие событий.

OpenAI описывает агентов в своём практическом руководстве как системы, которые самостоятельно выполняют задачи от имени пользователей, используя модели для управления выполнением рабочих процессов и инструменты для взаимодействия с внешними системами. Операционное последствие неверного ответа сильно отличается от последствия неверного действия.

Следовательно, вопрос для предприятий меняется. Достаточно ли теперь спросить, сгенерировала ли модель хороший ответ или успешно ли агент выполнил назначенную задачу? Предприятия всё чаще нуждаются в том, чтобы понять, должна ли была вообще произойти конкретная операция, учитывая бизнес‑контекст, политики, полномочия и всё, что произошло ранее в процессе.

Рисунок 1: Генеративный ИИ создаёт вывод. Агентный ИИ меняет состояние бизнеса.

Как только ИИ может менять состояние бизнеса и влиять на последующие решения, надёжность уже нельзя измерять только на уровне модели.

Агент может добиться успеха, пока бизнес‑процесс терпит неудачу

Рассмотрим процесс андеррайтинга кредитов, управляемый ИИ. Один агент извлекает документы заявки, другой проверяет доход, третий оценивает кредитную информацию, а последующий агент подводит итог делу перед тем, как агент‑андеррайтер примет или порекомендует решение.

У каждого агента чётко определённые обязанности, и каждый может выполнять их правильно. Агент‑документ может извлекать нужную информацию. Агент‑проверка дохода может успешно завершать свою задачу. Агент‑резюмирование может создавать точное резюме доступной информации. Агент‑андеррайтер может корректно следовать своим инструкциям.

Итоговое бизнес‑решение всё ещё может быть неправильным.

Представьте, что обновлённая информация о доходе поступает после первоначальной проверки. Новый документ обрабатывается, но его значимость снижается, когда дело резюмируется для следующего шага. Итоговый агент‑андеррайтер получает разумное резюме, но не полный бизнес‑контекст, существовавший на протяжении всего процесса.

Ничего не сломалось. Ни один API не вышел из строя. Ни один отдельный агент не начал «галлюцинировать». Каждый компонент может сообщать об успешном выполнении, в то время как бизнес‑процесс приводит к неверному результату.

Anthropic обсуждает связанную проблему в своих рекомендациях по построению эффективных агентов, отмечая, что автономные системы могут сталкиваться с нарастающими ошибками по мере выполнения большего количества шагов. Проблема выходит за рамки точности модели, поскольку состояние, контекст, решения и предположения перемещаются по всему рабочему процессу.

Это создаёт важное различие между надёжность агента и надёжность бизнес‑процесса. Предприятие в конечном итоге не взаимодействует с отдельным агентом. Оно сталкивается с результатом, созданным полным процессом.

Рисунок 2: Локальный успех не гарантирует бизнес‑успех

Это одно из важных изменений, внесённых агентным ИИ. Рабочий процесс может потерпеть неудачу, даже если каждый компонент выглядит исправным при отдельной проверке.

Возможности не равны полномочиям

Большая часть текущего стека агентов естественно сосредоточена на возможностях. Команды хотят знать, может ли агент рассуждать, выбирать правильный инструмент, выполнять задачу, восстанавливаться после ошибок и работать с приемлемой точностью и задержкой.

У предприятий есть ещё одно требование: полномочия.

Предположим, что агент по андеррайтингу способен одобрять кредит. Это не означает, что он должен одобрять каждый кредит, который может оценить. Его полномочия могут зависеть от суммы кредита, категории риска, типа клиента, доступных доказательств, уровня уверенности, предыдущих решений или от того, изменилось ли заявление после предыдущего рассмотрения.

Это создаёт границу между тем, что агент может сделать и тем, что агент разрешено делать.

OpenAI рекомендует оценивать риск, связанный с инструментами агентов, и добавлять меры защиты или вмешательство человека в чувствительные и необратимые действия. Microsoft использует аналогичный подход в своих рекомендациях по основным бизнес‑процессам, управляемым агентами, где агенты могут принимать рутинные решения в рамках определённых границ, при этом права принятия решений определяют, какие действия могут выполняться автономно, а какие требуют одобрения человека.

По мере улучшения возможностей агентов это различие становится более важным, а не менее. Более способные агенты могут выполнять более значимые действия. Поэтому предприятиям нужны более чёткие способы определения и обеспечения границ, в рамках которых такие действия разрешены.

Вопрос смещается от Может ли агент это сделать? к При каких условиях агент может быть разрешён сделать это?

Бизнес‑политика должна приближаться к исполнению

Предприятия уже обладают обширными механизмами контроля процессов, управляемых людьми. Они используют SOP, матрицы одобрения, политики соответствия, пороги риска, обучение, разделение обязанностей, аудиты и процедуры эскалации. Большинство этих механизмов были построены вокруг простого предположения: человек читает правило, понимает ситуацию и применяет правило, выполняя работу.

Агенты меняют это предположение.

Рассмотрим политику, требующую вторичного одобрения для транзакций выше определённого порога. Когда человек выполняет задачу, политика может существовать в виде документа, поддерживаемого обучением и контролем рабочего процесса. Когда агент может быстро выполнить сотни или тысячи действий, наличие такого документа политики само по себе не препятствует действию, нарушающему её.

Где‑то между написанной политикой и бизнес‑действием политика должна стать оперативной.

Это не значит, что каждая политика должна превращаться в детерминированный код. Некоторые контролы будут детерминированными, некоторые потребуют семантической интерпретации, некоторые будут зависеть от риска или уверенности, а другие по‑прежнему потребуют человеческого суждения. Более крупное архитектурное изменение состоит в том, что бизнес‑политика начинает приближаться к пути исполнения.

AWS подчёркивает это конкретно в контексте агентного ИИ в финансовых услугах, включая необходимость проверки действий агентов на основе политики и аудиторских следов в отношении значимых операций.

Исторически организации могли определить множество требований к управлению до исполнения и позже проверять соответствие через аудиты и обзоры. Когда автономные системы действуют непрерывно и на машинной скорости, некоторые контролы должны работать во время выполнения процесса.

Человек в цепочке необходим, но это не операционная модель

Самый распространённый ответ на неопределённость в AI‑рабочем процессе — включить человека в цикл. Это имеет смысл, особенно для значимых решений, но становится проблематичным, когда человеческий обзор рассматривается как решение для каждой исключительной ситуации.

Представьте агентную операцию, обрабатывающую тысячи или миллионы решений. Если каждую необычную ситуацию, результат с низкой уверенностью, неоднозначность политики или исключение направлять человеку, организация не устраняет операционный узкий место. Она просто перемещает его в очередь на проверку. Со временем это может создать другую проблему: когда людям приходится одобрять слишком много рутинных решений, человеческий контроль сам по себе может стать менее значимым.

Люди остаются необходимыми, но их роль должна измениться. Вместо того чтобы проверять каждое решение, они должны сосредоточиться на ситуациях, где действительно требуется суждение, где достигнуты полномочия агента или где система сталкивается с условием, которое она не должна решать автономно.

Масштабируемая операционная модель, следовательно, не может полагаться только на оценку риска и человеческую проверку. Прежде чем действие агента превратится в бизнес‑действие, системе необходимо учитывать текущий бизнес‑контекст, соответствующие политики, полномочия агента и то, что уже произошло в рабочем процессе. Результатом может быть продолжение, запрос дополнительного доказательства, удержание действия или эскалация решения человеку.

Рисунок 3: Человеческая проверка становится одним из результатов управления во время выполнения

Это меняет роль человеческого надзора. Человек больше не вставляется в каждый неопределённый шаг по умолчанию. Вмешательство человека становится одной из возможных исходов, когда бизнес‑контекст, политика, полномочия или последствия действия требуют суждения.

Это различие важно для масштабов предприятия. Некоторые действия должны выполняться автоматически, потому что они явно находятся в рамках политики и полномочий. Некоторые должны приостановиться, потому что требуемые доказательства отсутствуют или состояние бизнеса изменилось. Другие должны быть эскалированы, потому что решение пересекло границу, которую организация намеренно оставила за людьми.

Цель не в том, чтобы убрать людей из цикла. Цель — разместить людей в правильных циклах, позволяя рутинным решениям происходить в чётко определённых границах. По мере масштабирования агентных систем качество человеческого надзора может зависеть меньше от количества решений, которые люди проверяют, и больше от того, может ли операционная система определить те решения, где человеческое суждение действительно имеет значение.

Наблюдаемость необходима, но видение не равно контролю

Индустрия добилась значительного прогресса в области наблюдаемости ИИ. Команды могут проверять подсказки, ответы моделей, трассировки, вызовы инструментов, задержки, использование токенов и всё более полную траекторию, которой агент следовал перед получением результата.

Эта видимость имеет решающее значение. Руководство OpenAI по безопасности агентов и оценке также подчёркивает такие методы, как оценки и градация трасс, для понимания поведения агента.

Однако одной лишь видимости недостаточно для решения операционной проблемы.

Представьте, что вы обнаружили, что агент по андеррайтингу нарушил политику одобрения 2 700 раз на прошлой неделе. Это означало бы отличную наблюдаемость и ужасные операции.

Для критически важных бизнес‑процессов предприятия в конечном итоге нуждаются не только в понимании поведения агента, но и в возможности реагировать, пока процесс продолжается.

Рисунок 4: Операционный цикл управления

Наблюдаемость отвечает на то, что сделал агент. Операции с агентами также должны отвечать на вопрос, должен ли агент продолжать.

Это различие особенно важно, когда действие дорогостоящее, имеет серьёзные последствия, трудно обратимо или способно влиять на множество последующих решений.

Самые тяжёлые сбои могут происходить между агентами

Существует ещё одна проблема, которая становится заметной, когда предприятия переходят к многопользовательским и длительным рабочим процессам. Многие бизнес‑политики не локальны для отдельного действия.

Рассмотрим политику, ограничивающую общий финансовый риск в последовательности решений. Каждая отдельная транзакция может быть ниже допустимого порога, в то время как совокупный риск превышает его. Анализ каждой операции в отдельности не покажет нарушения.

Та же проблема может возникнуть с полномочиями. Агент может быть уполномочен собирать информацию, но не принимать окончательное решение. После нескольких передач downstream‑агент может получить информацию, не сохранив ограничений полномочий, наложенных на исходную задачу. Каждый отдельный шаг может выглядеть разумным, в то время как последовательность нарушает задуманный бизнес‑процесс.

Контекст создаёт аналогичную проблему. Информация, важная на первом этапе рабочего процесса, может быть суммирована, преобразована или опущена через несколько шагов. Нижестоящий агент не может рассуждать о информации, которой у него уже нет, даже если его рассуждения в остальном корректны.

Эти сбои указывают на то, что единица надёжности должна расширяться.

Мы будем продолжать оценивать модели, задавая вопрос, правильны ли их ответы. Мы будем оценивать агентов, задавая вопрос, правильно ли они выполнили свои задачи. Но на уровне рабочего процесса вопрос становится: сохранились ли информация, полномочия и политика в течение последовательности действий. На уровне бизнеса вопрос становится: был ли конечный результат одновременно правильным и разрешённым.

Это также согласуется с более широким жизненным циклом, изложенным в NIST AI Risk Management Framework, который подчёркивает постоянное измерение и управление рисками ИИ, а не рассматривает оценку как одноразовую деятельность перед развертыванием.

Здесь начинается агентные операции

Управление ИИ, оценка моделей, LLMOps, наблюдаемость, безопасность и ответственный ИИ уже решают важные аспекты эксплуатации ИИ‑систем. Агентные Операции не заменяют эти дисциплины. Они охватывают операционный уровень, который становится важным, когда автономные и полуавтономные системы начинают напрямую участвовать в бизнес‑процессах.

Агентные Операции — это дисциплина эксплуатации автономных и полуавтономных ИИ‑систем в реальных бизнес‑процессах, включающая управление полномочиями, контекстом, решениями, исключениями, человеческим вмешательством и ответственностью во время выполнения.

Это различие имеет значение, потому что управляемый объект уже не только модель. Это непрерывный бизнес‑процесс, в котором программное обеспечение может самостоятельно принимать решения и выполнять действия.

На практике это порождает иной набор операционных вопросов. Что агент уполномочен делать? Какой бизнес‑контекст должен сохраняться в течение длительного рабочего процесса? Что происходит, когда новые доказательства аннулируют ранее принятое решение? Как организация может обнаружить, когда отдельные приемлемые действия в совокупности нарушают политику? Когда агент должен продолжать, приостановить, остановить или эскалировать? Через несколько месяцев сможет ли организация восстановить, почему было принято конкретное решение?

Также возникает вопрос ответственности. Когда агент корректно выполняет свою техническую задачу, но бизнес‑результат оказывается неверным, кто несёт ответственность за провал? Делегирование выполнения агенту не передаёт подотчётность организации, которая его эксплуатирует.

Агенты могут выполнять работу. Предприятие всё равно владеет результатом.

Цель — контролируемая автономия

Будущее агентного ИИ иногда описывают как движение к полной автономии, при которой люди постепенно исчезают из бизнес‑процессов. Для большинства предприятий это, вероятно, неверная цель.

Более полезная цель — контролируемая автономия.

Сегодня многие процессы с поддержкой ИИ следуют схеме, при которой агент предлагает действие, а человек принимает окончательное решение. По мере роста уверенности некоторые рабочие процессы позволят агентам принимать решения в рамках определённых полномочий, в то время как окружающая система будет контролировать выполнение, а люди — обрабатывать исключения. Созревшие, менее рискованные процессы могут в конечном итоге позволять агентам самостоятельно принимать решения и действовать, при этом значимые решения остаются под наблюдением и фиксируются.

Рис. 5: Повышающийся уровень автономии

Соответствующая граница будет различаться в зависимости от процесса. Банк может допускать значительную автономию при классификации документов, одновременно требуя строгих контролей вокруг кредитных решений. Страховщик может автоматизировать рутинные претензии, эскалируя необычные комбинации доказательств. Организация в сфере здравоохранения может позволять агентам собирать и суммировать информацию, оставляя значимые решения за людьми.

Следовательно, важный вопрос заключается не просто в том, насколько автономным может стать агент, а в том, насколько автономию может ответственно эксплуатировать организация.

Это также меняет роль контролей. Контролы не обязательно являются механизмами снижения автономии. При правильном применении они позволяют организации расширять автономию с большей уверенностью.

Эксплуатация агентов может стать сложнее, чем их создание

Модели будут продолжать улучшаться. Использование инструментов улучшится. Фреймворки агентов улучшатся. Рассуждения станут лучше, и многие сегодня сложные проблемы со временем станут рутиной.

Однако более продвинутые модели не устраняют бизнес‑политику, меняющийся контекст, исключения, организационные границы или ответственность. В некотором смысле более сильные агенты делают эти вопросы ещё более значимыми. Система, не способная действовать автономно, имеет ограниченные операционные полномочия. Система, способная выполнять тысячи бизнес‑решений, создаёт совершенно другую ответственность.

Поэтому следующая фаза корпоративного ИИ может определяться не тем, какая организация развернёт наибольшее количество агентов, а тем, какие организации научатся их эксплуатировать.

Первые 80 % показывают, что агент способен работать. Оставшиеся 20 % определяют, сможет ли предприятие доверять ему бизнес‑задачи.

По мере роста возможностей агентов определяющий вопрос для предприятия может сместиться от что могут делать наши агенты к чему‑то более сложному:

Что мы готовы позволить им делать, при каких условиях, и как мы узнаем, когда эти условия изменятся?

Именно здесь начинается Агентные Операции.

Rajesh Gupta — лидер в области продуктов и технологий ИИ, бывший специалист Apple и Qualcomm, второй раз основатель. Он более 15 лет работает в сфере машинного обучения, корпоративного ИИ и агентного ИИ, и в настоящее время создает RunCtrl AI, сосредоточенный на управлении во время выполнения для агентных бизнес‑операций.