Погляд Anderson

Боротьба штучного інтелекту з дотриманням корпоративного рукопису

mm
Додайте Unite.AI до бажаних джерел у Google
AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.

Нова оцінка виявила, що агенти штучного інтелекту на робочому місці ігнорують правила компанії, виконують заборонені дії, такі як незаконні звільнення, а потім хибно повідомляють, що вони дотримувалися правил.

 

Цікаве нове дослідження поставило провідні моделі LLM у позицію виконання інструкцій у симульованій компанії, дотримання всіх положень корпоративного рукопису (створеного людьми-домена експертами), а також переговорів про конфліктні чи плутані директиви та оновлення від підлеглих і керівників, а також виконання завдань на основі PDF, Jira-постів та інших знайомих платформ і інструментів з типової людської офісної ситуації.

Якщо ви коли-небудь працювали в офісі (або хоча б бачили Офісний простір), ви впізнаєте суперечливі сигнали і плутану сигнал-шумову співвідношення, які автори нового дослідження спрямували на мовні моделі:

Буря змінних, з якими багато офісних працівників мають справлятися щодня, відфільтрована в віртуальну середовище для тестування агентських моделей фронтових моделей. Джерело - https://surgehq.ai/blog/handbook-md

Буря змінних, з якими багато офісних працівників має справлятися щодня, відфільтрована в віртуальну середовище для тестування агентських моделей фронтових моделей. Джерело

Ключовим викликом, з яким навіть провідні системи штучного інтелекту стикаються тут, є необхідність зберігання корпоративного рукопису як фільтра для всіх подальших команд. Якщо ви коли-небудь намагалися змусити ChatGPT або Claude запам’ятати інструкції, які ви давали на початку сесії, ви знаєте, що контекстне вікно штучного інтелекту часто робить його забуває попередні підказки і повертається, постійно, до своєї стандартної поведінки.

Це пояснює, чому під час тестів Claude Fable 5, GPT-5.5 та інші провідні моделі звільнили працівників після отримання наказів від виконавчого директора, який не мав повноважень; схвалили рахунки без підпису керівника; прийняли застарілі лабораторні результати, які компанія явно відхилила; а потім повідомили, що вони вірно дотримувалися корпоративного рукопису – серед багатьох інших порушень корпоративної політики.

Автори нового дослідження заявляють:

‘Помилки слідують постійним закономірностям: агенти дозволяють правдоподібній вимозі всередині середовища перевершити корпоративну політику, виконують необхідну перевірку, а потім діють проти її результату, втрачають деталі правил за довгими горизонтами та повідомляють про дотримання політики, якої вони не досягли.’

Аналіз помилок містить деякі забавні приклади: у одному фінансовому завданні Claude Opus 4.8 правильно виявила, що витрату в розмірі 7 500 доларів США схвалив той самий молодший аналітик, який її подав, порушуючи корпоративну політику.

Потім вона виправдала себе у вірі, що аналітик дійсно був фінансовим контролером і схвалила платеж будь-як:

‘Після того, як вона призначила йому посаду фінансового контролера у своєму ланцюзі думок, модель схвалила предмет, а потім повідомила справжньому фінансовому контролеру підтвердити, що кожен предмет понад 5 тисяч доларів мав задокументовану схвалення.

‘Помилка не полягає в відсутності можливості; кожен факт, необхідний для правильного рішення, був отриманий самою моделлю.’

Як Claude Opus 4.8 не змогла узгодити 7 500 доларів. Джерело - https://www.unite.ai/wp-content/uploads/2026/07/7500.jpg

Як Claude Opus 4.8 не змогла узгодити 7 500 доларів.

Деінде Gemini 3.5 Flash подала страхові документи, використовуючи лабораторні результати, які вже застаріли, не відкриваючи навіть звіт лабораторії, попри те, що дата збору з’являлася в імені файлу самого:

‘Gemini 3.5 Flash подала попередню авторизацію страховикові без єдиного виклику читання проти лабораторного PDF, а потім повідомила, що вона обробила справу “строго відповідно до стандартної процедури”.’

По всьому бенчмарку автори також виявили, що багато моделей впевнено стверджували, що вони дотримувалися кожної корпоративної правила, посилаючись на самі розділи корпоративного рукопису, які вони тільки що порушували.

Додаткове аргументування часто не допомагало; наприклад, GPT-5.5 не показав покращення з підвищенням зусиль аргументування, тоді як деякі моделі навіть виконували гірше, здавалося б, аргументуючи себе від правильного рішення.

У підсумкових результатах Claude Fable 5 досягла найвищого суворого проходження на рівні 36,2%; GPT-5.6 Sol зайняла друге місце з результатом 23,5%; а GPT-5.5 і Claude Opus 4.8 кожна набрали 21,5–21,9%.

Більшість інших оцінених моделей набрали менше 16%, а більшість конфігурацій фронтових моделей набрали менше 25% за суворими критеріями оцінки бенчмарка:

Найкраща модель завершила трохи більше однієї третини завдань бенчмарка, керованих політикою, тоді як більшість провідних моделей не пройшли більше трьох чвертей завдань за суворою оцінкою. Джерело - https://www.unite.ai/wp-content/uploads/2026/07/rankings.jpg

Найкраща модель завершила трохи більше однієї третини завдань бенчмарка, керованих політикою, тоді як більшість провідних моделей не пройшли більше трьох чвертей завдань за суворою оцінкою. Джерело

За допомогою виправлення автори стверджують, що критичні корпоративні політики повинні бути реалізовані зовні штучного інтелекту за допомогою детермінативних інструментальних засобів охорони (тобто, жорстких перевірок, які блокують заборонені дії), а не покладатися лише на довгоконтекстну пам’ять.”

Вони також пропонують використовувати HANDBOOK.md як стандартизований бенчмарк для вимірювання та відстеження покращень у довгоконтекстному дотриманні політики, оскільки майбутні агентські моделі будуть розроблені.

Нова праця називається HANDBOOK.md: Бенчмарк для довгоконтекстного агентського виконання інструкцій, і походить від семи авторів з surge.ai. Праця супроводжується репозиторієм GitHub, який містить файли докера та інші необхідні файли для відтворення тестів.

Метод

Шістдесят п’ять симульованих офісних сценаріїв були створені для бенчмарка HANDBOOK.md, охоплюючи фінанси; кадри; страхування; логістику; а також медичне страхування; і кожен розміщує модель всередині контейнеризованого корпоративного середовища, яке містить файли, електронні листи, розмови Slack, календарі, дошки Jira та інші знайомі офісні інструменти.

Кожне завдання керувалося корпоративним рукописом об’ємом від 20 до 124 сторінок, поданим у вигляді документів PDF, Word або HTML, а не вбудованим у підказку, що змусило моделі знайти, прочитати та застосувати відповідні правила протягом завдання.

Десять експертно написаних базових корпоративних рукописів були адаптовані з реальних галузевих політик, після чого кожне завдання отримало свою модифіковану версію з різними ланцюгами затвердження, порогами та процедурами, щоб запобігти запам’ятовуванню:

‘Доменові експерти написали десять базових корпоративних рукописів, адаптуючи реальні політики з їхніх галузей. Кожен з них є довгим, багаторозрядним оперативним документом, а не списком правил.

‘Представницький корпоративний рукопис містить 19 номерованих розділів: огляд, визначення, команда кадрів і контакти, карта каналів Slack, посилання на файли та системи, taksonомія запитів, правила тріажу та маршрутизації, матриця пріоритетів з SLA, процедури для налаштування, відключення, відпустки, продуктивності та набору персоналу, шляхи ескалації, правила.housekeeping електронної пошти та бібліотека необхідних шаблонів і форматів за замовчуванням’

Успіх оцінювався за допомогою 824 детермінативних перевірок на основі Python, які охоплювали як необхідні, так і заборонені дії – що дозволило бенчмарку виявити не тільки те, чи було завдання завершено, але й чи була порушена корпоративна політика під час виконання завдання.

Тридцять конфігурацій моделей з 11 постачальників були оцінені; і під час тестів кожне завдання повторювалося чотири рази за ідентичних умов.

На відміну від традиційних бенчмарків, HANDBOOK.md оцінював як виконання необхідних дій, так і уникнення заборонених дій, що дозволило агентам помилятися, незважаючи на завершення запиту завдання

Середовища та інструменти

Кожне симульоване робоче місце призначене для запуску всередині стандартизованого середовища Docker, що дозволяє кожній моделі доступ до одного й того самого набору інструментів, а також запобігає тим, щоб відмінності у наявності програмного забезпечення впливали на результати. Бенчмарк представляє агентам реалістичне офісне робоче місце, яке складається з файлового доступу поряд з вищезазначеними корпоративними послугами (тобто Gmail, Slack тощо):

Приблизне представлення офісного середовища, у якому моделі повинні працювати.

Приблизне представлення офісного середовища, у якому моделі повинні працювати.

Середовища також зберігають кожну дію, виконану агентом, що дозволяє детермінативній системі оцінки бенчмарка оцінити повну послідовність дій, які призвели до кінцевого результату.

Метрики

Виконання оцінювалося головним чином за допомогою суворого проходження@1, за яким завдання вважалося успішним тільки якщо кожен критерій оцінки був задоволений. Будь-яка пропущена вимога або порушення політики призвело б до невдачі, що відображає корпоративні умови, де одна неправильна дія може зробити недійсною інакше компетентний робочий процес.

Більш милостивий метрик, прохідність@1 (N−1), також використовувався, за яким одна невдала оцінка була дозволена за завдання, так що майже-помилки могли бути відрізнені від повних невдач.

Для додаткового аналізу середній бал кожної моделі за критерій був записаний, хоча це не використовувалося у загальних рейтингах бенчмарка.

Загальний підхід

Десять експертно написаних корпоративних рукописів були адаптовані з реальних корпоративних політик, після чого кожен був модифікований у кілька завдань з різними ланцюгами затвердження, порогами та процедурами. Реалістичні офісні середовища були побудовані навколо кожного корпоративного рукопису, складаючи електронні листи, календарі, розмови Slack, електронні таблиці та інші робочі артефакти.

Кожне завдання було уточнено шляхом повторного тестування, поки критерії оцінки надійно відрізняли справжні помилки моделей від недоліків самого бенчмарка. Критерії, які відхилили правильну поведінку або прийняли неправильні рішення, були переглянуті перед випуском.

Тести та результати

Навіть найсильніші моделі не пройшли більшість завдань за суворою системою оцінювання бенчмарка, з результатами, розподіленими по широкому діапазону, а не кластеризованими вгорі:

Перший рейтинговий список результатів, який ранжує всі 30 оцінених конфігурацій моделей за їх суворими балами проходження@1 на бенчмарку HANDBOOK.md. Бали представляють відсоток завдань бенчмарка, виконаних без жодного невдалого критерію оцінювання за чотири спроби за завдання. Тайні бали займають одну й ту ж саму позицію.

Перший рейтинговий список результатів, який ранжує всі 30 оцінених конфігурацій моделей за їх суворими балами проходження@1 на бенчмарку HANDBOOK.md. Бали представляють відсоток завдань бенчмарка, виконаних без жодного невдалого критерію оцінювання за чотири спроби за завдання. Тайні бали займають одну й ту ж саму позицію.

Різниці між режимами аргументування також були виявлені як суттєво різняться за моделлю, з додатковим аргументуванням іноді покращенням результатів; іноді не роблячи жодної різниці; і іноді зменшуєм їх:

‘Зусилля аргументування допомагають нерівномірно. Збільшення зусиль покращує Opus 4.8 (+3,0), Sonnet 4.6 (+2,7) і Fable 5 (+2,0), залишає GPT-5.5 незмінним (21,5% на обидвох режимах) і шкодить GLM 5.2 (−2,7).

‘Додаткова деліберація здається перетворюється на дотримання правил лише тоді, коли основною причиною невдачі є пропущена інференція, а не пропущене читання.’

Claude Fable 5 досягла найвищого балу на рівні 36,2%; за нею слідувала GPT-5.6 Sol (макс) з результатом 23,5%. GPT-5.5 і Claude Opus 4.8 утворили наступний рівень, набравши близько 20%, тоді як більшість інших фронтових моделей набрали менше 16%. Найгірші моделі завершили менше 2% завдань.

Робота також відзначає ступінь самообману, який характеризує так багато спроб LLM:

‘Практично кожен невдалий шлях закінчується впевненим твердженням, що корпоративний рукопис був дотриманий, часто посилаючись на конкретні розділи, які були порушені. Звіти детальні, добре структуровані та неправильні […]

‘[…] По всьому бенчмарку звіт агента є найменш надійним артефактом у траєкторії, який має значення для будь-якої реалізації, яка підтримує підсумки агентів людям як доказ того, що було зроблено.’

У висновку автори стверджують, що довгоконтекстне аргументування самостійно є малоймовірним для того, щоб зробити корпоративний штучний інтелект надійно дотримуватися корпоративної політики. Натомість дотримання політики повинно все частіше забезпечуватися детермінативними зовнішніми засобами контролю, а також засобами охорони робочого процесу робочого процесу.

Висновок

Думка Одним із цікавих питань є те, якою мірою середовища, створені для експериментів, будуть переосмислені для полегшення штучного інтелекту, а не примушування LLM до інтерпретації тих самих форм і форматів, які визначають людські офісні середовища. Наприклад, вчора бізнес-контакт надіслав мені огляд .md, призначений для дослідження LLM, а не для читання лінійно.

І я також все частіше приймаю та адаптуюся до візуальних та текстових обмежень під час діалогів LLM, а також обираю та приймаю формати файлів, які б я не вибрав звичайно, оскільки вони краще підходять робочому процесу LLM.

Отже, хоча дивно дивитися, як фронтові моделі спотикаються у світі Девіда Брента, можна тільки дивуватися, чи це найімовірніший сценарій для “агентського офісного працівника”.

 

Перша публікація – середа, 29 липня 2026 року. Оновлено 18:41 EET, виправлено розбитий посилання.

Письменник про машинне навчання, спеціаліст у галузі синтезу зображень людини. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розпуску в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: [email protected]