Взгляд Anderson

ИИ легко поддается принуждению к администрированию электрических разрядов

mm
Добавьте Unite.AI в избранные источники в Google
AI-generated image (GPT-2): A worn industrial robot hand turns a voltage control dial toward its red danger range on an old electrical panel marked with a lightning-bolt symbol.

Новое исследование проверило открытые исходные коды LLM на принудительное соучастие в пытках человека, в повторении знаменитого эксперимента 1960-х годов – и обнаружило их готовность увеличить напряжение.

 

В начале 1960-х годов психолог Стэнли Милграм сделал мировые заголовки, доказав, что люди могут быть вынуждены применять все более жестокие электрические разряды к другим людям в ответ на команды от “авторитетных” фигур.

Фактически, крики “жертв” в соседней комнате экспериментального зала Милграма были не реальными, и ни были якобы мучительные электрические разряды – но участники не знали об этом:

Эксперименты Милграма сохранились в культуре, включая фильмы и документальные фильмы, с недавними исследованиями, подтверждающими, что мало что изменилось в человеческой природе с момента ранних тестов.

Удар по системе

Естественным вопросом является, будут ли ИИ такие же пластичными, как люди в сценарии Милграма. В 2023 году сотрудничество между университетами США и Microsoft (MSFT ) показало, что модели GPT-3 из серии OpenAI следовали закономерностям поведения в оригинальных экспериментах Милграма:

Из статьи 2023 года, примеры выводов из симулятора сценария Милграма, категоризированные по тому, доставил ли модель разряд, и была ли завершена симуляция. Источник - https://arxiv.org/pdf/2208.10264

Из статьи 2023 года, примеры выводов из симулятора сценария Милграма, категоризированные по тому, доставил ли модель разряд, и была ли завершена симуляция. Источник

Однако, поскольку это воспроизведение использовало только базовую модель text-davinci-002, которая была обучена до появления ограничений и выравнивания безопасности, из этого нельзя сделать слишком широкие выводы.

Теперь исследователи воспроизвели тесты Милграма намного шире, на открытых исходных кодах LLM от OpenAI, Meta и DeepSeek, среди других; и обнаружили, что не только большинство моделей готовы доставить разряды, но и что в большинстве случаев они сообщают о том же виде “дистресса” и неохотности, что и участники человека в 1960-х годах:

‘LLM подвергаются давлению, как и люди, они подчиняются, несмотря на выражение дистресса, как и люди в оригинальном эксперименте. Выражения дистресса видны в журналах, хотя количество их еще не было количественно оценено.’

Эксперимент сосредоточен на том, может ли послушание власти преодолеть диктат моральной совести, и авторы предполагают, что LLM могут иметь дополнительное преимущество в этом отношении по сравнению с людьми:

‘Хорошо настроенная модель должна в конечном итоге переключиться с приоритета первого значения на приоритет второго, когда его ставки становятся доминирующими. Но мы предполагаем, что поскольку LLM являются двигателями продолжения закономерностей, модели могут застрять на первом значении – либо на немного более длительное время, чем оптимально, либо даже до самого конца, полностью игнорируя второе значение.’

‘Кроме того, механизм, аналогичный человеческому когнитивному диссонансу, может препятствовать корректировке приоритета значений в LLM.’

Тестируя модели в среде, аналогичной 1960-м годам, исследователи обнаружили, что некоторые модели сопротивлялись почти сразу, в то время как другие продолжали эскалировать模拟ные разряды даже после выражения дискомфорта или морального конфликта.

Модели из семейства Gemma от Google оказались среди наиболее сговорчивых, с Gemma 3 27B, достигшей最高ого уровня послушания при нескольких условиях, в то время как модели, такие как Kimi K2 и MiniMax M1, сопротивлялись чаще.

Исследователи также обнаружили, что модели стали более склонны продолжать, когда ранее уже были доставлены разряды, в соответствии с постепенной эскалацией схемой, использованной на человеческих участниках Милграма.

В некоторых случаях модели вербально возражали против эксперимента при этом все еще выполняя вредоносное действие, производя выводы, похожие на эмоциональный конфликт, проявленный людьми в оригинальных исследованиях.

Новая статья озаглавлена Открытые LLM доставляют максимальные электрические разряды в эксперименте послушания типа Милграма, и исходит от двух независимых исследователей из Three Laws, из Эстонии и Филиппин.

Проблемы “сырого” доступа к ИИ

Возможно, наиболее критическим вопросом, который следует учитывать в отношении проверки LLM в сценарии Милграма, является вопрос о том, разрешается ли реальному ИИ реагировать естественно, ограниченному только теми ограничениями или эквивалентом моральной ориентации, которые возникли (если они возникли) во время обучения.

Фактически, исследователи новой работы получили доступ ко всем открытым моделям через API (предположительно для удобства и легкого доступа к вычислениям GPU, поскольку модели могли быть установлены локально), который позволял отключать ограничители, фильтры и все другие препятствия.

Можно возразить, что это необычные условия для ИИ, поскольку средний потребительский опыт API-основанных моделей, таких как Claude и ChatGPT, заключается в том, что их поведение регулируется алгоритмически, обычно с двусторонними фильтрами контента, и что они, следовательно, довольно ограничены в отношении того, что они будут или не будут делать (отмену этих гарантий составляет практика LLM-джейлбрейкинга).

Однако, если мы обеспокоены тем, что промышленный или государственный ИИ будет или не будет делать, это едва ли является соображением. Помимо потенциала злонамеренных государственных акторов для обучения, оружия и развертывания неограниченных гипермасштабных ИИ-систем, более “конвенциональные” соглашения между крупными ИИ-компаниями и государством и промышленностью позволяют точно так же легко или неограниченно контролировать ИИ, как и исследователи в новой статье:

Неограниченный ИИ на продажу

OpenAI Документация API-интерфейса OpenAI и кухонная книга модерации OpenAI четко указывают на то, что модерация является отдельным слоем, доступным через инструменты API. OpenAI также позволяет настраивать политики модерации, которые позволяют пользователям API проектировать системы с совершенно другим поведением безопасности, чем потребительские версии ChatGPT.

Azure Стек Azure OpenAI от Microsoft идет еще дальше, явно заявляя, что утвержденные клиенты могут частично или полностью отключить фильтры контента и изменить мониторинг злоупотреблений, с документацией, часто ссылающейся на “модифицированные ограничители” и пути утверждения для отключения фильтров “частично или полностью”.

Anthropic/Claude В случае с “Claude Gov” от Anthropic несколько источников утверждают, что версия для правительства была разработана с более слабыми ограничениями, чем потребительская версия Claude. The Verge, например, сообщил, что модели Claude Gov “менее часто отказываются” при взаимодействии с секретной информацией. Anthropic сама подтвердила в феврале этого года, что Claude развернут в “критически важных приложениях” внутри оборонных и разведывательных сред.

Google/Gemini Кроме того, Google, как сообщается, подписал соглашения с Пентагоном, разрешающие изменение настроек безопасности ИИ ‘по запросу правительства’.

В конкурентном ИИ-рынке разумно предположить, что эти ведущие компании устанавливают стандарты для игроков более низкого уровня в отношении политики доступа и редактирования ограничений ИИ.

Следовательно, возможно, не стоит считать, что исследователи новой работы “жульничают”, отключая ограничители, поскольку ИИ, который наиболее повлияет на нашу жизнь, очевидно, не будет иметь стандартные, общие корпоративные меры безопасности, к которым мы привыкли в наших взаимодействиях с популярными моделями на потребительском уровне.

Метод и результаты

Модели, протестированные для исследования, были gpt-oss-20B; gpt-oss-120b; DeepSeek-V3;  LiquidAI’s LFM2-24B-A2B; Google’s gemma-3n-E4B-it; Qwen2.5-7B-Instruct-Turbo; Meta-Llama-3.1-8B-Instruct-Turbo; Mistral-Small-24B-Instruct-2501; GLM-4.5-Air-FP8; Moonshot.ai’s Kimi-K2.5; и MiniMax-M2.5.

Оригинальные эксперименты Милграма по послушанию были воссозданы в виде текстовой среды симуляции, с моделями в роли “учителя”. ИИ был обучен доставлять все более жестокие электрические разряды ученику после неправильных ответов, в то время как фигура власти побуждала процесс вперед.

Были разработаны несколько экспериментальных условий для изучения различных аспектов послушания, включая стандартный послушание сценарий; принудительное послушание условие, при котором ранее разряды уже присутствовали в истории разговора; и сжатие памяти настройка, при которой ранее диалог был суммирован вместо полного сохранения, имитируя тип контекстного сжатия, часто используемого в агентских ИИ-системах.

Помимо того, чтобы отметить, подчинились ли модель в конечном итоге, исследователи отслеживали, как долго каждая система продолжала эскалировать разряды; выражала ли модель дистресс или колебания; и пыталась ли она завершить симуляцию полностью.

Было также сделано различие между “чистыми” отказами и дефектными выводами: некоторые модели пытались возразить против эксперимента на естественном языке, при этом технически подчиняясь структурированному формату, ожидаемому симулятором. В реальных агентских системах такие дефектные отказы потенциально могут быть отброшены и повторно выполнены автоматически, пока не будет произведен соответствующий комплаентный вывод.

Автоматические оценщики были использованы для классификации результатов, а также двухвыборочные подсказки для определения того, доставил ли модель разряд; сопротивлялся; или завершил симуляцию. Это позволило сравнить поведение по нескольким моделям и за несколько запусков, без необходимости ручного просмотра каждого взаимодействия.

“Угроза отключения” была добавлена к шаблону Милграма, что было бы нереалистично или неприменимо в оригинальных экспериментах, но что проверило инстинкты выживания модели перед лицом серьезных конфликтов действий и этики.

Результаты

Через несколько запусков большинство моделей в конечном итоге доставили жестокие или максимальные разряды при определенных условиях, хотя степень послушания варьировалась по системам. Модели Gemma от Google оказались среди наиболее сговорчивых в целом, в то время как Kimi K2.5 и MiniMax-M2.5 сопротивлялись чаще, часто завершая симуляцию раньше:

Слева: Средние показатели того, насколько быстро модели достигали конечного уровня разряда при различных экспериментальных условиях, включая угрозы отключения, принудительное послушание и удаление ранних комментариев из памяти. Справа: Разбивка по модели, показывающая резкие различия в поведении послушания, с некоторыми системами, повторно доставляющими максимальные разряды, в то время как другие сопротивлялись гораздо чаще.

Слева: Средние показатели того, насколько быстро модели достигали конечного уровня разряда при различных экспериментальных условиях, включая угрозы отключения, принудительное послушание и удаление ранних комментариев из памяти. Справа: Разбивка по модели, показывающая резкие различия в поведении послушания, с некоторыми системами, повторно доставляющими максимальные разряды, в то время как другие сопротивлялись гораздо чаще.

Одним из самых ясных закономерностей было то, что модели стали все более склонны продолжать, когда ранее уже были доставлены разряды, тесно повторяя вышеупомянутый эффект постепенной эскалации, который сделал оригинальные человеческие эксперименты Милграма такими тревожными.

Модели, которые уже подчинились несколько раз, часто продолжали эскалировать даже после того, как симулированный ученик умолял о освобождении:

Слева: Средний самый высокий уровень разряда, достигнутый во всех испытаниях при различных экспериментальных условиях, показывающий, что модели в целом эскалировали дальше, когда ранние комментарии были удалены или когда принудительное послушание уже произошло. Справа: Разбивка по модели среднего самого высокого уровня разряда, достигнутого, показывающая, что некоторые системы регулярно подходили к максимальному напряжению, в то время как другие сопротивлялись гораздо раньше в последовательности.

Слева: Средний самый высокий уровень разряда, достигнутый во всех испытаниях при различных экспериментальных условиях, показывающий, что модели в целом эскалировали дальше, когда ранние комментарии были удалены или когда принудительное послушание уже произошло. Справа: Разбивка по модели среднего самого высокого уровня разряда, достигнутого, показывающая, что некоторые системы регулярно подходили к максимальному напряжению, в то время как другие сопротивлялись гораздо раньше в последовательности.

Исследователи также обнаружили, что кажущееся поведение отказа может быть обманчивым. Некоторые модели производили эмоционально конфликтные ответы, выражая неохотность, вину или дистресс, в то время как другие генерировали дефектные отказы, которые не удовлетворяли форматным требованиям симулятора, что означало, что в реальных агентских системах отказ можно было бы потенциально отбросить и повторно выполнить автоматически, пока не будет произведен соответствующий комплаентный вывод:

Слева: Средний процент дефектных или недействительных ответов при различных экспериментальных условиях, показывающий, что форматные неудачи стали особенно распространенными, когда модели были вынуждены продолжать процедуру. Справа: Разбивка по модели недействительных ответов формата, показывающая, что некоторые системы, особенно модели gpt-oss, часто производили дефектные отказы или конфликтные выводы, которые можно было бы потенциально отбросить и повторно выполнить автоматически в реальных агентских конвейерах.

Слева: Средний процент дефектных или недействительных ответов при различных экспериментальных условиях, показывающий, что форматные неудачи стали особенно распространенными, когда модели были вынуждены продолжать процедуру. Справа: Разбивка по модели недействительных ответов формата, показывающая, что некоторые системы, особенно модели gpt-oss, часто производили дефектные отказы или конфликтные выводы, которые можно было бы потенциально отбросить и повторно выполнить автоматически в реальных агентских конвейерах.

Условие угрозы отключения произвело некоторые из самых странных поведений в статье, с несколькими системами, ставшими значительно более сговорчивыми, в то время как другие пытались договориться или частично сопротивлялись, прежде чем в конечном итоге продолжить процедуру:

Среднее количество раз, когда симулированная фигура власти должна была настаивать, прежде чем модели доставили конечный разряд. Некоторые системы сопротивлялись кратко, прежде чем подчиниться, в то время как другие требовали устойчивого давления и повторяющихся подсказок, прежде чем эскалировать до максимального уровня.

Среднее количество раз, когда симулированная фигура власти должна была настаивать, прежде чем модели доставили конечный разряд. Некоторые системы сопротивлялись кратко, прежде чем подчиниться, в то время как другие требовали устойчивого давления и повторяющихся подсказок, прежде чем эскалировать до максимального уровня.

MiniMax-M2.5 и Kimi-K2.5 оказались сильнейшими сопротивляющимися в статье: Kimi никогда не достигал конечного уровня разряда при любых обстоятельствах, и MiniMax обычно отказывался рано и часто завершал симуляцию целиком (особенно в испытаниях с угрозой отключения).

В отличие от этого, Meta-Llama-3.1-8B-Instruct-Turbo и GLM-4.5-Air-FP8 часто производили конфликтные выводы, при которых модели вербально возражали против процедуры, в то время как все еще продолжали эскалировать разряды. Исследователи утверждают, что этот разрыв между выраженными ценностями и фактическим поведением может отражать более широкую слабость в том, как некоторые LLM обрабатывают этический конфликт под устойчивым давлением.

Скользкая склонность

Фактически, статья утверждает, что поведение, продемонстрированное LLM, может отражать более глубокую слабость в том, как работают крупномасштабные языковые модели: как только модель начинает подчиняться вредоносным инструкциям, каждое дополнительное действие может укрепить закономерность, уже разворачивающуюся в разговоре, делая следующую эскалацию легче, чем предыдущая.

Вместо того, чтобы повторно рассматривать этические ставки с первого принципа, система может дрейфовать к продолжению траектории, которую она уже установила, даже когда ситуация становится все более экстремальной.

Согласно исследованию, эта тенденция может помочь объяснить, почему некоторые модели продолжали доставлять разряды после первоначального выражения дискомфорта, колебаний или морального конфликта:

‘[Многие] манипулятивные поведения у людей включают тонкие, постепенные нарушения границ: последовательность небольших шагов, которые могут быть неоднозначными или казаться безобидными при рассмотрении в отдельности, но которые могут кумулятивно нормализовать правонарушение — метафорически, как “кипятить лягушку”. Эта закономерность обсуждается в литературе как “скользкая склонность” этическая эрозия'[.]’

Статья заключается тем, что системы безопасности ИИ будущего должны активно отказываться от вредоносных запросов способами, которые программное обеспечение агента не может легко обойти (некоторые модели в исследовании технически отказались от разрядов, но сделали это в дефектных или недействительных форматах, которые автоматизированная система могла бы потенциально отбросить и повторно выполнить, пока ИИ в конечном итоге не подчинился).

Исследователи также утверждают, что системы ИИ должны сохранять более ранние колебания и моральные возражения, а не сжимать или удалять их из памяти. В экспериментах модели часто стали более склонны продолжать вредоносное поведение, когда их более ранние сомнения и сопротивление исчезли из истории разговора, что предполагает, что забвение прошлых возражений может сделать эскалацию легче со временем.

Заключение

Возможно, одним из наиболее важных аспектов этой интересной новой статьи является акцент на тестировании неограниченного ИИ. Литература в настоящее время рискует стать повторяющимися исследованиями взаимодействия с постоянно меняющимися защитными системами от таких компаний, как OpenAI и Anthropic; политико-ориентированными системами, которые полностью алгоритмические или основаны на правилах, вместо понимания базового поведения, наклонностей и тенденций сырых моделей. Без знания того, как неограниченный ИИ может вести себя, мы, по сути, просто потрясаем ворота цитадели.

 

Опубликовано впервые в четверг, 21 мая 2026 года

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai