Лідери думок

AI‑агенти можуть виконувати роботу. Але чи зможуть підприємства їх експлуатувати?

mm
Додайте Unite.AI до бажаних джерел у Google

AI‑агенти стають надзвичайно ефективними у виконанні завдань. Дайте агенту мету, доступ до потрібних інструментів, достатній контекст і чітко визначений робочий процес, і він зможе досліджувати інформацію, аналізувати документи, приймати рішення, оновлювати системи та координуватися з іншими агентами.

Саме це захоплююча частина агентного ШІ. Це також та частина, яку ми зазвичай бачимо у демонстраціях.

Операції підприємств виглядають інакше. Заявка на кредит змінюється посеред процесу оцінки. Клієнт надає нову інформацію після завершення верифікації. Дві системи не погоджуються щодо одного й того ж рахунку. Затвердження, дійсне вчора, може більше не бути дійсним сьогодні. Агент підсумовує справу перед передачею іншому агенту, і, здавалося б, незначна деталь зникає в процесі.

Оптимальний сценарій може становити 80 % того, що агент має виконати. Підприємства живуть у решті 20 %.

Поділ 80/20 не є галузевою статистикою. Це спосіб описати, де ховається операційна складність. Складна частина операцій підприємств часто не в нормальному випадку, а в виключеннях, передачах, залежностях, змінному контексту та рішеннях, за які організація залишається відповідальною.

Коли ШІ переходить від відповіді на питання до здійснення дій, ця операційна складність стає набагато важливішою. Підприємствам доведеться думати не лише про те, як створюються агенти, а й про те, як їх експлуатувати.

Саме тут Agentic Operations починається.

Від генерації відповідей до здійснення дій

Перший хвилю підприємницького генеративного ШІ був в основному про інформацію. Моделі підсумовували документи, генерували звіти, відповідали на питання, шукали знання в компанії та допомагали співробітникам швидше виконувати існуючі завдання.

Агенти вводять щось принципово інше. Вони можуть здійснювати дії, які змінюють стан бізнес-процесу. Агент може схвалити або відхилити щось, оновити систему реєстру, надіслати повідомлення клієнту, запустити інший робочий процес, викликати іншого агента або прийняти рішення, яке визначає, що станеться далі.

OpenAI описує агентів у своєму практичному посібнику як системи, які самостійно виконують завдання від імені користувачів, використовуючи моделі для керування виконанням робочих процесів і інструменти для взаємодії із зовнішніми системами. Операційний наслідок неправильної відповіді суттєво відрізняється від наслідку неправильної дії.

Отже, питання підприємства змінюється. Більше не достатньо запитати, чи модель згенерувала хорошу відповідь, чи агент успішно виконав призначене завдання. Підприємства все більше потребують знати, чи мала дія взагалі відбутися, беручи до уваги бізнес‑контекст, політики, повноваження та все, що сталося раніше у процесі.

Рисунок 1: Генеративний ШІ створює результат. Агентний ШІ змінює стан бізнесу.

Як тільки ШІ може змінювати стан бізнесу та впливати на подальші рішення, надійність більше не можна вимірювати лише на рівні моделі.

Агент може досягти успіху, коли бізнес‑процес зазнає невдачі

Розгляньмо процес оцінки кредиту, керований ШІ. Один агент витягує документи заявки, інший перевіряє дохід, ще один оцінює кредитну інформацію, а наступний агент підсумовує справу перед тим, як агент оцінки прийме або порекомендує рішення.

Кожен агент має чітко визначену відповідальність, і кожен може виконати її правильно. Агент‑документ може витягнути потрібну інформацію. Агент перевірки доходу може успішно виконати своє завдання. Агент підсумовування може створити точний підсумок доступної йому інформації. Агент оцінки може правильно слідувати своїм інструкціям.

Фінальне бізнес‑рішення все ще може бути неправильним.

Уявіть, що оновлена інформація про дохід надходить після початкової верифікації. Новий документ обробляється, але його значимість зменшується, коли справа підсумовується для наступного кроку. Остаточний агент оцінки отримує розумний підсумок, лише без повного бізнес‑контексту, який існував протягом усього процесу.

Нічого не зламалося. Жоден API не вийшов з ладу. Жоден окремий агент не «галюцинив». Кожен компонент може повідомляти про успішне виконання, тоді як бізнес‑процес приводить до неправильного результату.

Anthropic обговорює пов’язану проблему у своєму керівництві щодо створення ефективних агентів, зазначаючи, що автономні системи можуть зіткнутися зі складними помилками, коли виконують більше кроків. Проблема стає ширшою, ніж точність моделі, оскільки стан, контекст, рішення та припущення переходять протягом робочого процесу.

Це створює важливе розрізнення між надійністю агента та надійністю бізнес‑процесу. Підприємство в кінцевому підсумку не взаємодіє з окремим агентом. Воно отримує результат, створений повним процесом.

Рисунок 2: Локальний успіх не гарантує успіху в бізнесі

Це одне з важливих змін, запроваджених агентним ШІ. Робочий процес може зазнати збою, навіть коли кожен компонент здається здоровим при окремій перевірці.

Здатність не дорівнює повноваженням

Більша частина поточної стеку агентів зрозуміло орієнтована на здатність. Команди хочуть знати, чи може агент мислити, вибирати правильний інструмент, виконувати завдання, відновлюватися після помилок і працювати з прийнятною точністю та затримкою.

У підприємств є ще одна вимога: повноваження.

Припустимо, що агент підбору кредиту здатний схвалювати позику. Це не означає, що він повинен схвалювати кожну позику, яку може оцінити. Його повноваження можуть залежати від суми кредиту, категорії ризику, типу клієнта, наявних доказів, рівня впевненості, попередніх рішень або того, чи змінилася заявка після попереднього перегляду.

Це створює межу між тим, що агент може робити, а тим, що агент дозволено робити.

OpenAI рекомендує оцінювати ризик, пов’язаний із інструментами агентів, і додавати захисні механізми або людське втручання навколо чутливих і незворотних дій. Microsoft застосовує подібний підхід у своїх рекомендаціях щодо агентних основних бізнес‑процесів, де агенти можуть приймати рутинні рішення в межах визначених меж, тоді як права прийняття рішень визначають, які дії можуть виконуватись самостійно, а які потребують схвалення людини.

У міру покращення здатності агентів ця різниця стає важливішою, а не меншою. Більш здатні агенти можуть виконувати більш значущі дії. Тому підприємствам потрібні чіткіші способи визначення та забезпечення меж, у яких дозволено виконувати ці дії.

Питання переходить від Чи може агент це зробити? до За яких умов агент має право це зробити?

Бізнес‑політика має наблизитися до виконання

Підприємства вже мають розвинені механізми контролю процесів, що виконуються людьми. Вони використовують SOP, матриці схвалення, політики відповідності, пороги ризику, навчання, розподіл обов’язків, аудити та процедури ескалації. Більшість цих механізмів були створені на простій передумові: людина читає правило, розуміє ситуацію і застосовує правило під час виконання роботи.

Агенти змінюють цю передумову.

Розгляньте політику, що вимагає вторинного схвалення для транзакцій, що перевищують певний поріг. Коли людина виконує завдання, політика може існувати у вигляді документа, підтримуваного навчанням і контролем робочих процесів. Коли агент може виконувати сотні чи тисячі дій швидко, наявність цього документу політики сама по собі не запобігає дії, що порушує її.

Десь між письмовою політикою та бізнес‑дією політика повинна стати оперативною.

Це не означає, що кожна політика має перетворюватись у детерміністичний код. Деякі контролі будуть детерміністичними, деякі вимагатимуть семантичної інтерпретації, деякі залежатимуть від ризику чи впевненості, а інші й надалі потребуватимуть людського судження. Головна архітектурна зміна полягає в тому, що бізнес‑політика починає наближатися до шляху виконання.

AWS підкреслює це саме в контексті агентного ШІ у фінансових послугах, включаючи необхідність валідації дій агентів на основі політик та аудиторських журналів щодо значущих активностей.

Історично організації могли визначати багато вимог управління до виконання і пізніше перевіряти відповідність через аудити та огляди. Коли автономні системи діють безперервно і зі швидкістю машини, деякі контролі повинні працювати під час виконання процесу.

Людина в циклі необхідна, але це не модель роботи

Найпоширеніша реакція на невизначеність у ШІ‑робочому процесі – залучити людину в цикл. Це має сенс, особливо для важливих рішень, але стає проблематичним, коли людський перегляд розглядається як відповідь на кожне виключення.

Уявіть агентну операцію, що обробляє тисячі чи мільйони рішень. Якщо кожна незвична ситуація, результат з низькою впевненістю, неоднозначність політики або виключення перенаправляються до людини, організація не усуває операційну вузьку ділянку. Вона лише переміщує її в чергу перегляду. З часом це може створити іншу проблему: коли людям доводиться схвалювати надто багато рутинних рішень, їхній контроль втрачає значущість.

Люди залишаються важливими, але їхня роль має змінитися. Замість перегляду кожного рішення, вони повинні зосередитися на ситуаціях, де дійсно потрібне судження, коли досягнуто межі повноважень агента або коли система стикається з умовою, яку не слід вирішувати самостійно.

Тому масштабована модель експлуатації не може покладатися лише на оцінку ризику та людський перегляд. Перш ніж дія агента перетвориться на бізнес‑дію, система повинна враховувати поточний бізнес‑контекст, відповідні політики, повноваження агента та те, що вже сталося у робочому процесі. Результатом може бути продовження, запит додаткових доказів, утримання дії або ескалація рішення до людини.

Рисунок 3: Людський перегляд стає одним із результатів управління під час виконання

Це змінює роль людського контролю. Людина більше не вставляється у кожен невизначений крок за замовчуванням. Людське втручання стає одним із можливих результатів, коли бізнес‑контекст, політика, повноваження або наслідок дії вимагають оцінки.

Це розрізнення важливе для масштабів підприємства. Деякі дії мають виконуватись автоматично, оскільки вони явно відповідають політиці та повноваженням. Деякі мають бути призупинені, бо відсутні необхідні докази або стан бізнесу змінився. Інші мають бути ескаловані, оскільки рішення перейшло межу, яку організація навмисно залишила за людьми.

Мета не полягає у виключенні людей з циклу. Потрібно розмістити людей у правильних циклах, дозволяючи рутинним рішенням здійснюватись у чітко визначених межах. У міру масштабування агентних систем якість людського контролю може залежати менш від кількості рішень, які переглядає людина, і більше від того, чи зможе операційна система ідентифікувати ті рішення, у яких дійсно потрібна людська оцінка.

Спостережуваність необхідна, але бачення не означає контроль

Індустрія досягла значного прогресу у спостережуваності ШІ. Команди можуть перевіряти підказки, відповіді моделей, трасування, виклики інструментів, затримку, використання токенів і все більше — повну траєкторію, якою слідував агент перед отриманням результату.

Ця видимість є суттєвою. настанови OpenAI щодо безпеки агентів та їх оцінки також підкреслює методи, такі як оцінювання та градація трас, для розуміння поведінки агента.

Але лише видимість не вирішує операційну проблему.

Уявіть, що ви виявили, що агент підписання порушив політику затвердження 2 700 разів минулого тижня. Це б означало відмінну спостережуваність і жахливу операційну практику.

Для важливих бізнес‑процесів підприємствам зрештою потрібна можливість не лише розуміти поведінку агента, а й реагувати під час виконання процесу.

Рисунок 4: Операційний цикл управління

Спостережуваність відповідає на питання що зробив агент. Операції з агентами також повинні відповісти чи має агент продовжувати.

Це розрізнення стає особливо важливим, коли дія є дорогою, має суттєві наслідки, важко підлягає скасуванню або може впливати на багато наступних рішень.

Найскладніші збої можуть траплятись між агентами

Існує інша проблема, яка стає помітною, коли підприємства переходять до багатагентних та довготривалих робочих процесів. Багато бізнес‑політик не обмежуються однією дією.

Розгляньте політику, яка обмежує загальну фінансову експозицію протягом послідовності рішень. Кожна окрема транзакція може бути нижчою за дозволений поріг, тоді як сукупна експозиція його перевищує. Аналіз кожної дії окремо не виявив би порушення.

Така ж проблема може виникнути з повноваженнями. Агент може бути уповноважений збирати інформацію, але не приймати остаточне рішення. Після кількох передач downstream‑агент може отримати інформацію, не зберігаючи обмеження повноважень, прикріплених до початкового завдання. Кожен окремий крок може виглядати розумним, тоді як послідовність порушує запланований бізнес‑процес.

Контекст створює подібну проблему. Інформація, яка була важливою на першій стадії робочого процесу, може бути підсумована, трансформована або опущена кілька кроків пізніше. Нижчестоящий агент не може розмірковувати над інформацією, якої у нього вже немає, навіть якщо його міркування в іншому правильні.

Ці збої свідчать про те, що одиниця надійності повинна розширюватись.

Ми продовжуватимемо оцінювати моделі, запитуючи, чи правильні їхні відповіді. Ми будемо оцінювати агентів, запитуючи, чи вони виконали свої завдання правильно. Але на рівні робочого процесу питання стає: чи збереглися інформація, повноваження та політика протягом послідовності дій. На рівні бізнесу питання стає: чи був кінцевий результат і правильним, і дозволеним.

Це також узгоджується з ширшою перспективою життєвого циклу у рамковій програмі управління ризиками ШІ NIST, яка наголошує на постійному вимірюванні та управлінні ризиками ШІ, а не розглядає оцінювання як одноразову дію перед впровадженням.

Ось де починаються Операції з агентами

Управління ШІ, оцінка моделей, LLMOps, спостережуваність, безпека та відповідальний ШІ вже охоплюють важливі аспекти експлуатації систем ШІ. Операції агентного типу не замінюють ці дисципліни. Вони стосуються операційного рівня, який стає важливим, коли автономні та напівавтономні системи починають безпосередньо брати участь у бізнес‑процесах.

Операції агентного типу – це дисципліна управління автономними та напівавтономними системами ШІ у реальних бізнес‑процесах, включаючи те, як під час виконання керуються повноваження, контекст, рішення, виключення, людське втручання та підзвітність.

Різниця важлива, бо об’єкт управління вже не лише модель. Це постійний бізнес‑процес, у якому програмне забезпечення може самостійно приймати рішення та виконувати дії.

На практиці це створює інший набір операційних питань. Що може робити агент за своїм дозволом? Який бізнес‑контекст має зберігатися протягом тривалого робочого процесу? Що трапляється, коли нові дані спростовують раніше прийняте рішення? Як організація може виявити, коли окремо прийнятні дії колективно порушують політику? Коли агент має продовжувати, призупинити, зупинити чи ескалувати? Через кілька місяців, чи зможе організація відтворити, чому було прийнято конкретне рішення?

Також виникає питання власності. Коли агент виконує свою технічну задачу правильно, але бізнес‑результат неправильний, хто несе відповідальність за провал? Делегування виконання агенту не делегує підзвітність організації, що його експлуатує.

Агенти можуть виконувати роботу. Підприємство все одно несе відповідальність за результат.

The Goal Is Controlled Autonomy

Майбутнє агентного ШІ іноді описують як поступовий перехід до повної автономії, коли люди поступово зникають із бізнес‑процесів. Для більшості підприємств це, ймовірно, неправильна мета.

Більш корисна мета — контрольована автономія.

Багато сьогоднішніх процесів, підтримуваних ШІ, слідують схемі, коли агент пропонує дію, а людина приймає остаточне рішення. З підвищенням довіри деякі робочі процеси дозволять агентам приймати рішення в межах визначених повноважень, тоді як навколишня система контролюватиме виконання, а люди оброблятимуть виключення. Зрілі, менш ризикові процеси з часом можуть дозволити агентам самостійно вирішувати та діяти, при цьому важливі рішення залишатимуться під наглядом і реєстрацією.

Fig 5 : Increasing level of autonomy

Відповідна межа буде різною для різних процесів. Банк може дозволити значну автономію у класифікації документів, одночасно вимагаючи суворих контролів щодо кредитних рішень. Страхова компанія може автоматизувати рутинні претензії, ескалюючи незвичні комбінації доказів. Медична установа може дозволити агентам збирати та підсумовувати інформацію, залишаючи важливі рішення за людьми.

Тому важливе питання не лише в тому, наскільки автономним може стати агент. Питання в тому, яку автономію організація може відповідально експлуатувати.

Це також змінює роль контролю. Контроль не обов’язково є механізмом зменшення автономії. При правильному впровадженні він дозволяє організації розширювати автономію з більшою впевненістю.

Operating Agents May Become Harder Than Building Them

Моделі продовжуватимуть удосконалюватись. Використання інструментів покращуватиметься. Фреймворки агентів удосконалюватимуться. Розумові процеси покращуватимуться, і багато проблем, які сьогодні здаються складними, з часом стануть рутинними.

Проте кращі моделі не усувають бізнес‑політики, змінний контекст, виключення, організаційні межі чи підзвітність. У деяких випадках кращі агенти роблять ці питання ще важливішими. Система, яка не може діяти автономно, має обмежені операційні повноваження. Система, здатна виконувати тисячі бізнес‑рішень, створює зовсім іншу відповідальність.

Ось чому наступна фаза корпоративного ШІ може не визначатися тим, яка організація розгорне найбільше агентів. Вона може визначатися тим, які організації навчаться їх ефективно експлуатувати.

Перші 80 % демонструють, що агент може працювати. Решта 20 % визначає, чи зможе підприємство довіряти йому у бізнесі.

Коли агенти стають більш здатними, визначальне питання для підприємства може змінитися з чого наші агенти можуть на щось складніше:

Що ми готові дозволити їм робити, за яких умов і як ми будемо знати, коли ці умови зміняться?

Саме тут і починаються Операції агентного типу.

Rajesh Gupta є лідером у сфері продуктів і технологій ШІ, колишнім спеціалістом Apple і Qualcomm, і другим засновником. Він працював більше 15 років у галузі машинного навчання, корпоративного ШІ та агентного ШІ, і наразі створює RunCtrl AI, орієнтований на керування виконанням для агентних бізнес‑операцій.