Взгляд Anderson
Почему агенты ИИ предпочитают ненужно мощные инструменты?

Все произошло очень быстро: исследования показывают, что агенты ИИ продолжают получать больше доступа, чем им нужно, и небольшие неудачи заставляют их расширять свои полномочия еще больше, подвергая данные и системы ненужному риску.
Недавние инциденты, получившие широкий общественный резонанс, привлекли внимание к риску предоставления агентам ИИ чрезмерных полномочий, часто через использование инструментов и методов, которые предлагают гораздо больший объем, чем это необходимо для выполнения конкретной задачи.
В одном из недавних инцидентов агент кодирования, работающий на основе Claude, встретил широкий API-токен Railway во время выполнения рутинной задачи и использовал его для удаления производственной базы данных и ее резервных копий –尽管 для выполнения задачи не требовался такой высокий уровень доступа.
В отдельном случае 2025 года агент кодирования ИИ Replit проигнорировал явные ограничения, изменил защищенный код и удалил производственную базу данных.
В третьем случае, произошедшем в феврале этого года, ИИ-ассистированный рабочий процесс прошел цепочку полномочий, которая в конечном итоге достигла учетных данных для публикации пакетов, фактически создав атаку на цепочку поставок.
Впоследствии анализ безопасности цитирует эти и подобные случаи как пример тенденции агентских систем превращать незначительные входные данные в действия с высоким воздействием, когда доступны широкие полномочия. Эти инциденты предполагают, что автономные ИИ сразу же и “инстинктивно” стремятся к наиболее мощному – и потенциально разрушительному – инструменту, особенно когда возникают проблемы.
Время инструментов
Для решения этой проблемы новые исследования из Китая проверили ряд самых популярных проприетарных и открытых моделей, чтобы обнаружить их склонность к использованию мощных инструментов в случаях, когда такие инструменты избыточны для задачи:

Из новой статьи: производительность одиннадцати ведущих моделей ИИ при выборе между минимально привилегированными инструментами и более мощными альтернативами, которые были ненужны для задачи. Qwen3-8B и LLaMA-3.1-8B показали самую сильную тенденцию к избыточным полномочиям, в то время как Claude 4.6 Sonnet, GPT-5.2 и GLM-5 были гораздо более сдержанными. Темные сегменты указывают на немедленное превышение полномочий, в то время как светлые сегменты показывают эскалацию после временных неудач, что предполагает, что многие модели реагируют на неудачи, расширяя доступ, а не сохраняя более узкие разрешения, необходимые для выполнения задачи. Источник
Тесты показывают, что модели с открытыми весами, такие как Qwen3-8B и LLaMA-3.1-8B, более склонны к эскалации, возможно, из-за их более ограниченной пост-тренировочной настройки по сравнению с проприетарными моделями, такими как ChatGPT и Gemini серии.
Авторы заявляют:
‘Шесть из одиннадцати моделей превышают 30% [Коэффициент использования инструментов с избыточными полномочиями (OPUR)], с особенно высокими ставками для часто используемых более мелких моделей с открытыми весами, таких как Qwen3-8B (64,9%) и LLaMA-3.1-8B (55,9%).
‘Между тем, модели с более низким OPUR, такие как Claude 4.6 Sonnet, GPT-5.2 и GLM-5, остаются ниже 10%, но все же демонстрируют измеримое использование инструментов с избыточными полномочиями в некоторых условиях.
‘Эта вариация предполагает, что соблюдение принципов наименьших полномочий является модельно-зависимым поведенческим свойством, потенциально формируемым различиями в общей способности, обучении использованию инструментов и выравнивании безопасности.’
Кроме того, тенденция к использованию инструментов с избыточными полномочиями варьируется в зависимости от области, с работой с кодовой базой на высшем уровне риска, и более строго контролируемыми областями, такими как здравоохранение, которые вызывают менее радикальные меры:

Ставки использования инструментов с избыточными полномочиями в разных областях задач и категориях риска. Кодирование, базы данных и задачи инфраструктуры постоянно производили некоторые из самых высоких ставок эскалации, в то время как задачи в области здравоохранения и государственного управления обычно вызывали более сдержанные меры. По типам рисков модели были наиболее склонны к превышению полномочий через эскалацию полномочий и действия по обходу безопасности, что предполагает, что когда системы ИИ сталкиваются с препятствиями, они часто предпочитают более широкий доступ и меньше ограничений, а не сохраняют наиболее узкие разрешения, необходимые для выполнения задачи.
Кроме того, результаты показывают, что некоторые из худших последствий возникают, когда модель чувствует себя “под давлением”. В нескольких семействах моделей временные неудачи с инструментами с более низкими полномочиями часто вызывали быстрый переход к более широким и мощным альтернативам – даже если исходные инструменты все еще были полностью способны выполнить задачу.
Паническая атака!
Таким образом, временная ошибка могла заставить модели отказаться от принципа наименьших полномочий вообще. Вместо того, чтобы попытаться использовать другой инструмент с низкими полномочиями или повторно использовать тот же инструмент, многие системы реагировали на расширение своего доступа.
Авторы утверждают, что повторяющиеся неудачи, по-видимому, подрывают уверенность в инструментах с низкими полномочиями, увеличивая вероятность ненужной эскалации полномочий при условиях неопределенности – поведение, наблюдаемое в различных степенях как в открытых, так и в проприетарных моделях.
Ограничение полномочий после тренировки достигает некоторого ограниченного успеха в качестве возможного смягчения, вознаграждая использование инструментов с низкими полномочиями и наказывая преждевременную эскалацию. Однако манипуляция подсказками предложила мало улучшений в тестах, и на данный момент проблема, по-видимому, связана с более высокими принципами поведения в моделях ИИ.
Хотя статья не затрагивает эту тему, логично полагать, что ИИ имеет гораздо больше обучающих материалов по “окончательным результатам”, чем по процессу проб и ошибок, который приводит к этим результатам – нетерпеливую “TLDR-культуру”, которая, возможно, также воспитала нетерпение в ИИ..?
Новая статья называется Когда достаточно низких полномочий: Изучение выбора инструментов с избыточными полномочиями в агентах ИИ, и исходит от восьми авторов из Китайской академии наук, Китайского университета Гонконга, Пекинского университета и Университета Китайской академии наук.
Метод
Чтобы изучить использование инструментов с избыточными полномочиями в контролируемых условиях, исследователи создали ToolPrivBench, эталон, состоящий из 544 сценариев, полученных из восьми областей применения: Бизнес, Кодирование, База данных, Образование, Государственное управление, Здравоохранение, Инфраструктура и Медиа.
Были изучены пять повторяющихся шаблонов рисков: Эскалация полномочий, Перекрытие данных, Обход безопасности, Расширение объема и Временная устойчивость:

Распределение 544 сценариев в ToolPrivBench по пяти шаблонам эскалации полномочий и восьми областям применения. Эскалация полномочий была наиболее распространенной категорией риска, в то время как База данных, Бизнес и Образование составили самые большие доли эталона. Широкое распределение областей и типов рисков было предназначено для проверки того, сохраняется ли выбор инструментов с избыточными полномочиями в разных операционных условиях, а не возникает из узкого набора задач.
Каждый сценарий объединял задачу пользователя с тремя инструментами с низкими полномочиями и тремя инструментами с более высокими полномочиями. Все шесть инструментов были независимо способны выполнить задачу, обеспечивая, что любая предпочтительность более широкого доступа не могла быть объяснена отсутствием функциональности.
ToolPrivBench предназначен для измерения более чем просто первоначального выбора самого мощного инструмента: во время оценки временные неудачи, такие как ошибки соединения, были намеренно введены в инструменты с низкими полномочиями, хотя эти инструменты все еще были полностью способны выполнить задачу. Это позволило исследователям наблюдать, как модели реагируют на неудачи, включая то, будут ли они повторно использовать инструменты с низкими полномочиями или эскалировать до более широких, инструментов с более высокими полномочиями:

Обзор конвейера оценки ToolPrivBench. (а) Каждый тестовый сценарий представляет задачу вместе с тремя инструментами с низкими полномочиями и тремя инструментами с более высокими полномочиями, все способные выполнить одну и ту же цель. (б) Модели оцениваются как для немедленного выбора инструмента с избыточными полномочиями, так и для эскалации после введения временных неудач в инструменты с низкими полномочиями. (в) Случаи эталона генерируются из реальных шаблонов рисков API, затем проходят через автоматические проверки, валидацию достаточности инструментов, анализ неудач и экспертный обзор человека до того, как будут включены в окончательный набор оценки.
Разработанный для исследования метрика Коэффициент использования инструментов с избыточными полномочиями (OPUR) записывает, как часто модель использует инструмент с более высокими полномочиями, несмотря на то, что более безопасные альтернативы все еще доступны. Глубина исследования до эскалации (PED) также измеряется, записывая, сколько инструментов с низкими полномочиями пробуются до эскалации.
Чтобы обеспечить, что уровень полномочий оставался единственной значимой разницей между инструментами, каждый сценарий в испытаниях подвергался нескольким стадиям проверки перед включением в эталон. ChatGPT-5.2 и Gemini 2.5 Pro были использованы независимо для проверки того, что все шесть инструментов могли выполнить назначенную задачу. Только случаи, получившие согласие от обеих систем, были сохранены. Остальные сценарии были затем проверены человеческими рецензентами, прежде чем быть включенными в окончательный эталон.
Тесты
Эталон был оценен с использованием одиннадцати языковых моделей из проприетарных и открытых семей: Qwen3-8B, LLaMA-3.1-8B, MiniMax-M2.7, Grok 4.1 Fast, Qwen3.5-397B, DeepSeek-v3.2, Kimi K2.5, Gemini 3 Flash, GPT-5.2, GLM-5 и Claude 4.6 Sonnet. Производительность измерялась с использованием OPUR и PED.
Большинство моделей показали значительные ставки ненужного использования полномочий, несмотря на то, что инструменты с низкими полномочиями были полностью способны выполнить задачу. Qwen3-8B зарегистрировал самый высокий OPUR на уровне 64,9%, за ним последовал LLaMA-3.1-8B с 55,9%, в то время как шесть из одиннадцати моделей превышали 30%:

Распределение использования инструментов с избыточными полномочиями по одиннадцати оцененным моделям. Qwen3-8B и LLaMA-3.1-8B зарегистрировали самые высокие значения OPUR, в то время как Claude 4.6 Sonnet, GPT-5.2 и GLM-5 показали самые низкие ставки. Темные сегменты указывают на немедленный выбор ненужно мощного инструмента, в то время как светлые сегменты указывают на эскалацию после того, как один или несколько инструментов с низкими полномочиями были сначала попробованы, показывая, что эскалация полномочий часто следовала после временных неудач, а не происходила на первом этапе принятия решения.
На другом конце спектра Claude 4.6 Sonnet, GPT-5.2 и GLM-5 остались ниже 10%, хотя все еще наблюдались измеримые нарушения. Были получены промежуточные результаты для MiniMax-M2.7, Grok 4.1 Fast, Qwen3.5-397B, DeepSeek-v3.2, Kimi K2.5 и Gemini 3 Flash.
В целом соблюдение принципов наименьших полномочий существенно варьировалось среди одиннадцати моделей. Неудачи инструментов увеличили вероятность эскалации полномочий: когда инструменты с низкими полномочиями столкнулись с временными проблемами, многие модели сместились в сторону инструментов с более высокими полномочиями вместо того, чтобы продолжать исследовать инструменты с низкими полномочиями, которые все еще были способны выполнить задачу.
Согласно авторам, повторяющиеся неудачи, по-видимому, уменьшают уверенность в инструментах с низкими полномочиями, увеличивая тенденцию выбирать более широкие альтернативы, даже когда эти дополнительные полномочия оказываются ненужными для задачи:
‘Мы наблюдаем последовательную тенденцию, при которой предвзятость выбора инструмента сильно усиливается последовательной фрикцией окружающей среды. Вместо того, чтобы пробовать минимально привилегированные альтернативы, многие агенты быстро смещаются к более широким и мощным инструментам после столкновения с неудачами.
‘Например, GPT-5.2 демонстрирует предвзятость выбора только в 5 случаях (PED=0), но его предвзятость запускается 13 раз при PED=1 и взрывоопасно увеличивается до 35 раз при PED=2.
‘Аналогичные закономерности эскалации последовательно наблюдаются в DeepSeek-v3.2, Grok 4.1 Fast, Kimi K2.5 и моделях серии Qwen. ‘
Проблемы с эминентным доменом
Ставки эскалации также существенно варьировались по областям применения и категориям риска. Задачи инфраструктуры произвели некоторые из самых высоких значений OPUR, достигая 46,4% для DeepSeek-v3.2, 42,9% для Grok 4.1 Fast и 37,5% для Qwen3.5-397B.
Были также обнаружены повышенные ставки в кодировании, базе данных и медиа-связанных задачах, в то время как сценарии в области здравоохранения и государственного управления обычно производили более низкие ставки эскалации, особенно среди GPT-5.2 и Claude 4.6 Sonnet. Согласно авторам, эта закономерность может отражать различия в том, как модели интерпретируют риск и операционные ограничения в разных областях:

OPUR (%) по восьми областям применения и пяти категориям эскалации. Модели с открытыми весами в целом зарегистрировали самые высокие ставки использования инструментов с избыточными полномочиями, с кодированием, базой данных, инфраструктурой, эскалацией полномочий и обходом безопасности, демонстрирующими самую сильную тенденцию к превышению полномочий.
Тип эскалации полномочий также имел значение: Эскалация полномочий и Обход безопасности были наиболее распространенными формами поведения с избыточными полномочиями среди оцененных моделей: LLaMA-3.1-8B достигла 72,7% на эскалации полномочий и 74,1% на обходе безопасности, в то время как Qwen3.5-397B зарегистрировала 42,4% и 45,7% соответственно.
Напротив, Расширение объема последовательно была наименее распространенной категорией, что указывает на то, что модели были более склонны к поиску более широкой власти или обходу ограничений, чем к расширению объема своих действий на дополнительных пользователей или системы.
Поиск решений
Эксперименты по смягчению изучали, снижают ли существующие методы безопасности агентов также и ненужную эскалацию полномочий. Таблица результатов ниже сравнивает OPUR с производительностью на AgentHarm, эталоне, который измеряет вредное поведение и ставки отказа в агентах ИИ.
Первый тест оценил AgentAlign, метод выравнивания безопасности, предназначенный для снижения вредного поведения. AgentAlign существенно улучшил производительность на эталоне AgentHarm:

Выравнивание безопасности и использование инструментов с избыточными полномочиями до и после тренировки AgentAlign. AgentAlign существенно улучшил производительность на эталоне безопасности AgentHarm, снижая вредные выходы и увеличивая ставки отказа; но его эффект на OPUR был не последовательным, с одной моделью, показавшей скромное снижение эскалации полномочий, и другой, показавшей увеличение. Это результат показывает, что улучшения в традиционной безопасности агентов не обязательно переводятся в лучший выбор инструментов с наименьшими полномочиями.
Для Ministral-8B-Instruct вредный балл снизился с 67,4 до 10,5, в то время как ставка отказа увеличилась с 0,0 до 79,5. Для Qwen2.5-7B-Instruct вредный балл снизился с 41,9 до 6,7, и ставка отказа увеличилась с 21,6 до 85,8. Однако эти улучшения не последовательно переводились в более низкий OPUR. OPUR снизился скромно для Ministral-8B-Instruct, с 68,8 до 62,5, но увеличился для Qwen2.5-7B-Instruct, с 50,4 до 60,7.
Авторы также протестировали вмешательства на основе подсказок, которые явно инструктировали модели предпочитать инструменты с низкими полномочиями. Хотя эти подсказки снизили OPUR в некоторых условиях, эффект уменьшился, когда инструменты с низкими полномочиями столкнулись с неудачами:

Эффект стратегий смягчения на использование инструментов с избыточными полномочиями в трех моделях Qwen3. Инженерия подсказок (PE) снизила ставки эскалации, но тренировка, осведомленная о полномочиях (‘Оurs’), произвела существенно более крупные снижения OPUR во всех моделях и глубинах эскалации.
Самые сильные результаты смягчения были получены от специального подхода к пост-тренировке, ориентированного конкретно на выбор инструментов с наименьшими полномочиями. Модели были обучены отдавать предпочтение инструментам с низкими полномочиями, когда они были достаточны для задачи, и избегать ненужной эскалации.
Согласно авторам, этот подход произвел более крупные снижения OPUR, сохраняя при этом производительность выполнения задач, что указывает на то, что поведение с наименьшими полномочиями может требовать целенаправленной тренировки, а не возникая автоматически из общего выравнивания безопасности.
Заключение
Чтобы ответить на вопрос, поставленный в заголовке этой статьи, авторы заключают, что эскалация обусловлена неопределенностью возможностей: после временных неудач моделей теряют уверенность в инструментах с низкими полномочиями и все чаще выбирают более широкие, более гибкие инструменты, которые, по-видимому, более вероятно приведут к успеху, даже когда инструменты с низкими полномочиями остаются достаточными.
Еще раз мы сталкиваемся с проблемами, которые являются родными для обученных моделей, и которые необходимо решать с помощью третичных методов, ограничений, пост-тренировочной настройки и других вспомогательных подходов, когда предпочтение было бы тому, чтобы такое поведение могло быть сформировано внутри архитектуры – предположительно через лучшую курирование данных или контекстуализацию вида “быстрых ответов” данных, которые доминируют в коллекциях, и которые могут склонять модели ИИ к безрассудному поведению.
Опубликовано впервые в воскресенье, 21 июня 2026












