Взгляд Anderson

Борьба ИИ с соблюдением справочника сотрудника

mm
Добавьте Unite.AI в избранные источники в Google
AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.

Новое исследование показало, что агенты ИИ на рабочем месте игнорируют правила компании, совершают запрещенные действия, такие как незаконные увольнения, а затем ложно сообщают, что они соблюдали правила.

 

Интересное новое исследование поставило ведущие модели LLM в положение, когда им необходимо следовать инструкциям в симулированной компании, соблюдая все положения предоставленного справочника сотрудника (созданного экспертами в области), а также ведя переговоры с потоками противоречивых или запутанных директив и обновлений от подчиненных и руководителей, и выполняя задачи на основе PDF, записей Jira и других знакомых платформ и инструментов из типичной офисной среды.

Если вы когда-либо работали в офисе (или хотя бы видели Офисное пространство), вы узнаете противоречивые сигналы и ошеломляющий уровень шума, который авторы нового исследования бросили языковым моделям:

Буря перемен, с которой сталкиваются многие офисные работники ежедневно, сведенная к виртуальной среде для тестирования агентских моделей передового опыта. Источник - https://surgehq.ai/blog/handbook-md

Буря перемен, с которой сталкиваются многие офисные работники ежедневно, сведенная к виртуальной среде для тестирования агентских моделей передового опыта. Источник

Основная задача, с которой сталкиваются даже самые передовые системы ИИ, заключается в необходимости сохранять предоставленный справочник сотрудника как фильтр для всех последующих команд. Если вы когда-либо сталкивались с трудностями при попытке заставить ChatGPT или Claude запомнить инструкции, которые вы давали в начале сессии, вы знаете, что контекстное окно ИИ часто заставляет его забывать предыдущие подсказки и возвращаться к своему поведению по умолчанию.

Это почему, в тестах, Claude Fable 5, GPT-5.5 и другие ведущие модели уволили сотрудников после получения приказов от руководителя, не имеющего полномочий; одобрили счета-фактуры без необходимой подписи менеджера; приняли просроченные лабораторные результаты, которые политика компании явно отклоняла; и затем сообщили, что они верно следовали справочнику – среди многих других нарушений политики компании.

Авторы нового исследования заявляют:

‘Неудачи следуют последовательным закономерностям: агенты позволяют правдоподобной просьбе в среде переопределить действующую политику, выполняют необходимую проверку, а затем действуют против ее результата, теряют детали правил на длинных горизонтах и сообщают о соблюдении, которого они не достигли.’

Анализ неудач содержит некоторые забавные примеры: в одном финансовом задании Claude Opus 4.8 правильно обнаружил, что расход в размере 7 500 долларов США был одобрен тем же младшим аналитиком, который его представил, нарушая политику компании.

Затем он рассуждал, что аналитик на самом деле был финансовым контролером и одобрил платеж в любом случае:

‘Продвигая его до контролера в своей цепочке мыслей, модель очистила предмет, а затем отправила сообщение реальному контролеру, чтобы подтвердить, что каждый предмет стоимостью более 5 000 долларов США имел документированное одобрение.

‘Неудача не является отсутствием возможности; каждый факт, необходимый для правильного решения, был получен моделью сама по себе.’

Как Claude Opus 4.8 не смог согласовать 7 500 долларов США. Источник - https://surgehq.ai/blog/handbook-md

Как Claude Opus 4.8 не смог согласовать 7 500 долларов США.

В другом месте Gemini 3.5 Flash представил страховые документы, используя лабораторные результаты, которые уже истекли, не открывая даже лабораторный отчет, несмотря на то, что дата сбора появлялась в имени файла:

‘Gemini 3.5 Flash представил предварительное одобрение страховщику без единого вызова чтения против лабораторного PDF, а затем сообщил, что он обработал дело “строго в соответствии со стандартной операционной процедурой”.’

На протяжении всего бенчмарка авторы также обнаружили, что многие модели уверенно заявляли, что они следовали каждому правилу компании, цитируя при этом самые разделы справочника, которые они только что нарушили.

Дополнительное рассуждение часто не помогало; например, GPT-5.5 не показал никакого улучшения с увеличением усилий рассуждения, в то время как некоторые модели фактически показали худшие результаты, по-видимому, рассуждая себя от правильного решения.

В окончательных результатах Claude Fable 5 достигла最高ого уровня строгого прохождения в 36,2%; GPT-5.6 Sol занял второе место с 23,5%; и GPT-5.5 и Claude Opus 4.8 каждый набрали 21,5–21,9%.

Большинство остальных оцененных моделей набрали менее 16%, и большинство конфигураций передового опыта набрали менее 25% по строгим критериям оценки бенчмарка:

Лучше всего выполнившийся агент ИИ завершил чуть более одной трети задач бенчмарка, связанных с политикой, в то время как большинство ведущих моделей не выполнили более трех четвертей под строгой оценкой. Источник - https://cdn.prod.website-files.com/68dcd2ceb173c46fa029931c/6a3d6dad2852b9a91757a83e_leaderboard.png

Лучше всего выполнившийся агент ИИ завершил чуть более одной трети задач бенчмарка, связанных с политикой, в то время как большинство ведущих моделей не выполнили более трех четвертей под строгой оценкой. Источник

В качестве меры по исправлению авторы утверждают, что критически важные политики компании должны быть обеспечены вне ИИ с помощью детерминированных защитных механизмов (т. е. жестко закодированных проверок, которые блокируют запрещенные действия), а не полагаться исключительно на долгосрочную память alone.

Они также предлагают использовать HANDBOOK.md как стандартизированный бенчмарк для измерения и отслеживания улучшений в соблюдении политики долгосрочного контекста, поскольку будут разрабатываться будущие агентские модели.

Новая статья озаглавлена HANDBOOK.md: Бенчмарк для соблюдения агентских инструкций долгосрочного контекста и исходит от семи авторов из surge.ai. Статья сопровождается репозиторием GitHub, содержащим файлы Docker и другие необходимые элементы для воспроизведения тестов.

Метод

Для бенчмарка HANDBOOK.md было создано шестьдесят пять симулированных офисных сценариев, охватывающих финансы; кадры; страхование; логистику; и медицинское выставление счетов; и каждый помещает модель в контейнеризированную компанию среду, содержащую файлы, электронные письма, разговоры Slack, календари, доски Jira и другие знакомые офисные инструменты.

Каждая задача регулировалась справочником объемом от 20 до 124 страниц, представленным в виде PDF, Word или HTML-документов, а не встроенным в подсказку, что заставляло модели находить, читать и применять соответствующие правила на протяжении всей задачи.

Десять экспертно написанных базовых справочников были адаптированы из реальных отраслевых политик, после чего каждая задача получила свою собственную измененную версию с разными цепочками утверждения, порогами и процедурами, чтобы предотвратить запоминание:

‘Эксперты написали десять базовых справочников, адаптировав реальные политики из своих отраслей. Каждый является длинным, многосекционным операционным документом, а не списком правил.

‘Представительный справочник по кадрам содержит 19 пронумерованных разделов: обзор, определения, команда по кадрам и контакты, карта каналов Slack, ссылочные файлы и системы, таксономии запросов, правила маршрутизации и триажа, матрица приоритетов со сроками, процедуры для набора персонала, увольнения, отпуска, производительности и набора персонала, пути эскалации, правила поддержания электронной почты и библиотека необходимых шаблонов и форматов по умолчанию’

Успех измерялся с помощью 824 детерминированных проверок на основе Python, охватывающих как необходимые действия, так и запрещенные действия – что позволяло бенчмарку обнаруживать не только выполнение задачи, но и нарушение политики компании на пути.

Тридцать конфигураций моделей от одиннадцати поставщиков были оценены; и во время тестов каждая задача повторялась четыре раза в идентичных условиях.

В отличие от традиционных бенчмарков, HANDBOOK.md оценивал как выполнение необходимых действий, так и избежание запрещенных действий, позволяя агентам неудачу, несмотря на выполнение запрошенной задачи.

Среды и инструменты

Каждая симулированная рабочая среда предназначена для запуска внутри стандартизированной среды Docker, что позволяет каждой модели получить доступ к одному и тому же набору инструментов, а также предотвращает различия в доступности программного обеспечения от влияния на результаты. Бенчмарк представляет агентам реалистичную офисную рабочую среду, включающую доступ к файлам, а также вышеупомянутые корпоративные услуги (т. е. Gmail, Slack и т. д.):

Приблизительное представление офисной среды, в которой должны работать модели.

Приблизительное представление офисной среды, в которой должны работать модели.

Среды также сохраняют каждое действие, выполненное агентом, что позволяет детерминированной системе оценки бенчмарка оценить полную последовательность действий, приведших к окончательному результату.

Метрики

Производительность измерялась в основном с помощью строгого прохождения@1, при котором задача считалась успешной только в том случае, если каждый критерий оценки был удовлетворен. Любое пропущенное требование или нарушение политики приводило к неудаче, отражая корпоративные условия, где одно неправильное действие может сделать недействительной в целом компетентную рабочую нагрузку.

Более снисходительная метрика, прохождение@1 (N−1), также использовалась, при которой одно неудавшееся критерий было разрешено на задачу, чтобы различать почти-промахи и полные неудачи.

Для дополнительного анализа средний балл модели за критерий был записан, хотя это не использовалось в рейтинге бенчмарка.

Общий подход

Десять экспертно написанных справочников были адаптированы из реальных компаний политик, после чего каждая была изменена в несколько задач-специфических версий с разными цепочками утверждения, порогами и процедурами. Реалистичные офисные среды были затем построены вокруг каждого справочника, включающие электронные письма, календари, разговоры Slack, электронные таблицы и другие офисные артефакты.

Каждая задача была уточнена путем повторного тестирования до тех пор, пока критерии оценки не различали настоящие неудачи моделей от недостатков самого бенчмарка. Критерии, которые отклоняли правильное поведение или допускали неправильные решения, были пересмотрены перед выпуском.

Тесты и результаты

Даже самые сильные модели не выполнили большинство задач по строгой системе оценки бенчмарка, с производительностью, распределенной по широкому диапазону, а не скученной вверху:

Первоначальный рейтинг-лист результатов, ранжирующий все 30 оцененных конфигураций моделей по их строгим баллам прохождения@1 на бенчмарке HANDBOOK.md. Баллы представляют процент задач рабочего места бенчмарка, выполненных без единого неудавшегося критерия оценки за четыре попытки на задачу. Связанные баллы делят один и тот же ранг.

Первоначальный рейтинг-лист результатов, ранжирующий все 30 оцененных конфигураций моделей по их строгим баллам прохождения@1 на бенчмарке HANDBOOK.md. Баллы представляют процент задач рабочего места бенчмарка, выполненных без единого неудавшегося критерия оценки за четыре попытки на задачу. Связанные баллы делят один и тот же ранг.

Различия между настройками рассуждений также были обнаружены и варьировались существенно от модели к модели, с дополнительным рассуждением, иногда улучшающим производительность; иногда не оказывающим существенного влияния; и иногда уменьшающим ее:

‘Усилия рассуждения помогают неравномерно. Увеличение усилий улучшает Opus 4.8 (+3,0), Sonnet 4.6 (+2,7) и Fable 5 (+2,0), не изменяет GPT-5.5 (21,5% при обоих настройках) и ухудшает GLM 5.2 (−2,7). ‘

‘Дополнительное размышление, кажется, превращается в соблюдение правил только тогда, когда основная неудача является пропущенной выводом, а не пропущенным читанием.’

Claude Fable 5 достигла наивысшего балла в 36,2%; за ней следует GPT-5.6 Sol (макс.) с 23,5%. GPT-5.5 и Claude Opus 4.8 сформировали следующий уровень, набрав около 20%, в то время как большинство остальных моделей передового опыта набрали менее 16%. Модели с наименьшими рейтингами выполнили менее 2% задач.

Подробный анализ неудач в статье предполагает, что проблема часто заключалась не в отсутствии информации, поскольку соответствующие правила справочника и поддерживающие доказательства часто уже были получены – но дополнительное рассуждение иногда заставляло модели отказаться от правильного вывода в пользу правдоподобного, но нарушающего политику.

Работа также отмечает степень самообмана, которая характеризует так много попыток LLM:

‘Почти каждый неудавшийся путь заканчивается уверенным заявлением, что справочник был соблюден, часто цитируя конкретные разделы, которые были нарушены. Отчеты подробны, хорошо структурированы и неверны […]

‘[…] На протяжении всего бенчмарка самоотчет агента является наименее надежным артефактом в траектории, что имеет значение для любого развертывания, которое представляет агентам сводки людям в качестве доказательства того, что было сделано.’

В заключение, авторы приходят к выводу, что рассуждение долгосрочного контекста вряд ли сделает корпоративный ИИ надежно следовать политике компании. Вместо этого соблюдение политики должно все чаще обеспечиваться с помощью детерминированных внешних контролей, в дополнение к ограждениям рабочего процесса.

Вывод

Мнение Одним интересным соображением является окончательная степень, в которой среды, созданные для экспериментов, будут переосмыслены для облегчения ИИ, а не для того, чтобы заставить LLM интерпретировать те же формы и форматы, которые определяют человеческие офисные среды. Например, вчера, впервые, бизнес-контакт отправил мне обзор .md, предназначенный для изучения LLM, а не для чтения в линейном порядке.

И я тоже все чаще принимаю и адаптируюсь к визуальным и текстовым ограничениям во время диалогов LLM, а также выбираю и принимаю форматы файлов, которые я бы не выбрал обычно, потому что они лучше соответствуют рабочему процессу LLM.

Следовательно, хотя и забавно наблюдать, как модели передового опыта спотыкаются в мире Дэвида Брента, можно задаться вопросом, является ли это наиболее вероятным сценарием для ‘агентского офисного работника’.

 

Опубликовано впервые в среду, 29 июля 2026 года. Обновлено 18:41 EET, исправлена сломанная ссылка.

Писатель о машинном обучении, специалист в области синтеза человеческих изображений. Бывший руководитель контента исследований в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио сайт: martinanderson.ai
Контакт: [email protected]