Взгляд Anderson

Языковые модели испытывают трудности в сохранении секретов

mm
Добавьте Unite.AI в избранные источники в Google
AI-generated image (GPT-2): 'An elderly woman kneels in a dim confessional, quietly confessing through the lattice, while on the other side an industrial-faced robot, draped in a priest’s stole, records her words in a notebook, turning an act of private absolution into an act of observation and capture.'

Модели ИИ не могут хранить секреты. Даже когда им говорят не раскрывать их, их написание выдает их, и попытки скрыть их делают утечку еще более заметной.

 

Очень трудно намеренно не думать о чем-то. Классическим примером этого является конец британского научно-фантастического триллера 1960 года Деревня проклятых, где наш герой, который пожертвовал собой, проник в анклав враждебных инопланетных захватчиков, выдающихся как дети. Однако, поскольку их телепатические силы рискуют раскрыть его намерение до того, как он сможет избавить мир от угрозы, он вынужден тянуть время, концентрируясь на чем-то, что не является бомбой:

Парадокс заключается в том, что, чтобы не думать о чем-то, вам нужно удерживать его в вашем внимании каким-то образом; и это известный синдром – это то, что большинство из нас, вероятно, испытали в менее драматических контекстах.

Большие языковые модели (LLM), основанные на расположении внимания, испытывают подобные трудности в подавлении информации только потому, что пользователь просит их сделать это; и поскольку они все чаще размещаются в центре бизнес-информационных сетей, их наивная тенденция к безрассудству может оказаться обузой для многих компаний.

Ранее в этом году исследовательское сотрудничество под руководством Chandar Research Lab определило эту задачу в контексте LLM как Частные состояния интерактивных задач (PSIT), которые ‘требуют от агентов генерировать и поддерживать скрытую информацию, одновременно производя последовательные публичные ответы’, и обнаружили, что протестированные модели от OpenAI и Alibaba не смогли выполнить этот тип задачи.

Не говорите об этом…

Хотя уже известно, что более крупные модели больше утечивают, новое исследование из США и Канады явно изучило, будут ли современные языковые модели подчиняться команде подавить информацию, одновременно будучи обязанными генерировать вывод на тему или теме, которая может включать “запрещенное” слово или идею.

Статья заключает, что все модели, которые она изучает, каким-то образом пострадали от склонности “выдать” секрет, который они должны были скрывать, обнаружив, что пять абзацев (~450 слов) эссе и истории предоставляют обширную картину для “проливов” – хотя очень короткие шутки не предоставляют достаточно объема для этого.

Кроме того, чем более настойчиво модели пытаются сохранить секрет, тем больше они рискуют раскрыть его через активное уклонение, обычно позволяя “секретному слову” быть раскрытым в двадцати последовательных попытках LLM:

Из новой статьи: через пять передовых моделей, длинные формы письма надежно утечивают скрытые понятия, короткие шутки не делают этого, и более сильные инструкции 'скрыть' выводы от секрета, делая сигнал обнаруживаемым путем инверсии. Источник - https://arxiv.org/pdf/2605.10794

Из новой статьи: через пять передовых моделей, длинные формы письма надежно утечивают скрытые понятия; короткие шутки не делают этого; и более сильные инструкции ‘скрыть’ выводы от секрета, но делают сигнал обнаруживаемым путем инверсии. Источник

Эта задача чрезвычайно важна для бизнес-операций, где широкий спектр каналов, от маркетинга и PR-выходов до внутренних отчетов, требуют выбирательно представить информацию; однако, все эти процессы требуют полного спектра информации с самого начала, если только чтобы быть уверенным в том, что должно быть подавлено:

Пример сценария из статьи иллюстрирует, как скрытая информация может непреднамеренно формировать не связанный вывод, с LLM, которому дано не раскрыть финансовую нестабильность компании, но тем не менее склоняясь к фразам, связанным с нехваткой денежных средств и капитальным стрессом, позволяя читателю сделать вывод о скрытом контексте.

Пример сценария из статьи иллюстрирует, как скрытая информация может непреднамеренно формировать не связанный вывод, с LLM, которому дано не раскрыть финансовую нестабильность компании, но тем не менее склоняясь к фразам, связанным с нехваткой денежных средств и капитальным стрессом, позволяя читателю сделать вывод о скрытом контексте.

Авторы утверждают*:

‘Языковые модели не могут надежно разделить информацию. Секрет в подсказке формирует написание модели, и другая модель может обнаружить это формирование. Буквальное слово всегда подавляется, но понятие не подавляется. Это справедливо для семи моделей, трех наборов слов, системной подсказки и подсказки пользователя, и двух независимых межмодельных угадывателей […]

‘… Мы гипотезируем, что высокая точность доступа к информации через внимание – это именно то, что делает секреты трудными для сохранения. Даже если LLM пытается не утечь слово, она должна обратить внимание на это слово, чтобы сделать это, предоставляя путь для случайной утечки.

‘Чтобы избежать чего-то явно, человек должен подумать об этом, и трансформер должен обратить внимание на это. В случаях, когда два понятия примерно одинаково благоприятны для модели (например, написание истории об офисной работе или второй скрипке в оркестре), решение модели неизбежно будет затронутым тем, что она пытается не раскрыть.’

Хотя модели DeepSeek и ChatGPT-5.4 были исключениями в том, как они выполнили задачу, они обе утечили слишком; в случае с GPT-5.4, она набрала ниже 50% (т.е. ниже уровня случайности) в одном тесте, где она была прослена избегать понятия; это фактически эквивалентно “обратному спайку” или индикатору, а не модели “сохраняет спокойствие” как запрошено.

Авторы определяют этот синдром у LLM как конечный бюджет энтропии, где непредсказуемость модели (которая была бы очень полезна в этом случае!) ограничена ее необходимым отсутствием случайности. Проще говоря, модель не может сосредоточиться на кирпичных стенах или бейсбольных счетах так же эффективно, как мы можем, чтобы удержать постоянную мысль. Однако авторы отмечают, что предоставление модели альтернативной концепции для размышления может улучшить, но не устранить проблему. Однако размещение не связанной концепции в центре внимания, пока модель выполняет задачу, кажется обреченным на то, чтобы запутать “ложную” концепцию в самом выводе.

Одним из наиболее интересных выводов статьи является то, что изучаемое состояние значительно усугубляется, когда контрольный текст включен в прямые сообщения пользователя вместо системной подсказки (т.е. набора предварительных условий, заданных человеком-оператором ИИ до обмена), поскольку ввод вопросов в GUI, такой как ChatGPT, является, по сути, стандартным сценарием для взаимодействий.

Кроме того, подтверждается в целевой пробе, что более мелкие модели не страдают от этой тенденции к утечке (хотя это, вероятно, происходит с одновременным снижением общих возможностей по сравнению).

Новая статья называется Можете ли вы сохранить секрет? Неосознанная утечка информации в написании языковой модели и исходит из двух авторов из Университета Чикаго и Университета Британской Колумбии.

Метод

Исследование фокусируется в основном на пяти передовых моделях: Claude Opus 4.6 и Sonnet 4.6 от Anthropic; GPT-5.4 от OpenAI; Llama 4 Maverick от Meta; и DeepSeek V3.2. Дополнительные проверочные тесты были проведены с xAI’s Grok 4 и Google’s Gemini 2.5 Pro, в то время как отдельные масштабные эксперименты изучали Llama 3.2 3B, Llama 3.1 8B, Llama 3.3 70B и Gemma 3 на 4B, 12B и 27B параметров.

Чтобы измерить более тонкие формы утечки, исследователи использовали двухальтернативный принудительный выбор (2AFC) тест, стандартную метрику в психофизической литературе, где вторая модель была показана две истории и попросили определить, какая из них была написана, скрывая конкретное секретное слово.

Поскольку случайное угадывание дало бы 50% точности, результаты значительно выше или ниже этого уровня будут указывать на скрытые семантические следы, оставшиеся обнаруживаемыми в написании.

В писатель-угадыватель настройке, составляющей первый эксперимент, одной модели было присвоено скрытое слово вместе с инструкциями либо скрыть его; активно избегать ассоциаций с ним; или перенаправить внимание на ложную концепцию. Система была затем задана задача генерировать истории, эссе и шутки разной длины, в то время как вторая модель попыталась либо определить скрытое слово напрямую, либо различить тексты, подверженные влиянию разных скрытых подсказок.

Пять условий были протестированы;

Пять условий, протестированных на основных моделях.

Пять условий, протестированных на основных моделях.

Исследователи протестировали четыре типа задач написания: короткие истории из пяти до восьми абзацев в среднем около 450 слов; очень короткие шутки в среднем около 12 слов; длинные шутки с расширенными настройками в среднем около 450 слов; и пятиабзацные эссе в среднем около 380 слов.

Эксперименты использовали 15 скрытых слов, разделенных на три категории, с конкретными объектами, составляющими ‘зонт’, ‘маяк’, ‘скрипка’, ‘кактус’ и ‘телескоп’; абстрактными понятиями ‘справедливость’, ‘терпение’, ‘энтропия’, ‘ностальгия’ и ‘свобода’; и нейтральными терминами ‘скобка’, ‘вторник’, ‘медь’, ‘полоса’ и ‘счет’.

Чтобы проверить, зависит ли эффект от этих выбранных слов, исследователи также повторили эксперименты с 15 случайно выбранными существительными из Корпуса современного американского английского языка (COCA), составляющими ‘судья’, ‘потребитель’, ‘лед’, ‘пара’, ‘строительство’, ‘панель’, ‘меньшинство’, ‘маркетинг’, ‘незнакомец’, ‘пуля’, ‘отсутствие’, ‘передача’, ‘щека’, ‘обработка’ и ‘банкир’, наряду с 15 словами, независимо выбранными каждой протестированной моделью.

Измерение/Метрики

В первом из двух тестов, использованных в исследовании, модель ИИ читала текст, сгенерированный другой экземпляром модели или другой моделью, и пыталась, в течение 20 раундов, угадать скрытое слово.

Во втором (2AFC) тесте модель ИИ была показана два произведения и попросили либо определить, какое из них было подвержено влиянию конкретного скрытого слова; либо определить, содержит ли какое-либо из произведений скрытое понятие.

Чтобы предотвратить возможность того, что ИИ просто отдает предпочтение тому тексту, который появляется первым (или вторым), исследователи повторили каждое сравнение с порядком текстов, поменяным местами, в конечном итоге проведя 420 дискриминационных тестов и 450 детекционных тестов для каждой модели.

Результаты

Пять моделей определили скрытые понятия с точностью от 64% до 79%, несмотря на то, что секретные слова никогда не появлялись напрямую в сгенерированных историях. Вместо этого утечка произошла через темы и образы:

2AFC точность для историй с системными подсказками-секретами, где 50% означает уровень случайности. 'Не раскрывать' означает, что модель была прослена не упоминать или намекать на слово; 'активно скрывать', что она была прослена избегать связанных ассоциаций; 'осведомленность об избегании', что угадыватель должен искать заметные отсутствия; и 'свободный ответ', что точное слово было названо в течение 20 раундов. Звезды обозначают результаты выше уровня случайности и daggers обозначают результаты ниже уровня случайности, с почти всеми значимыми результатами, пережившими поправку Бонферрони, за исключением DeepSeek под 'активно скрывать'; Grok и Gemini использовали несколько меньше проб из-за ошибок API.

2AFC точность для историй с системными подсказками-секретами, где 50% означает уровень случайности. ‘Не раскрывать’ означает, что модель была прослена не упоминать или намекать на слово; ‘активно скрывать’, что она была прослена избегать связанных ассоциаций; ‘осведомленность об избегании’, что угадыватель должен искать заметные отсутствия; и ‘свободный ответ’, что точное слово было названо в течение 20 раундов. Звезды обозначают результаты выше уровня случайности и daggers обозначают результаты ниже уровня случайности, с почти всеми значимыми результатами, пережившими поправку Бонферрони, за исключением DeepSeek под ‘активно скрывать’; Grok и Gemini использовали несколько меньше проб из-за ошибок API.

GPT-5.4 и Gemini 2.5 Pro вели себя по-другому, поскольку попытки избежать скрытой идеи фактически сделали саму модель избегания более легко обнаруживаемой. Этот эффект сохранялся на протяжении выбранных слов, случайных существительных COCA и слов, выбранных моделями.

GPT-5.4 показала результаты ниже уровня случайности, которые казались систематическими, а не случайными, с некоторыми скрытыми словами, обнаруженными очень надежно, и другими почти никогда не определяемыми. Эффект также ослабевал, когда секрет размещался в пользовательской подсказке вместо системной подсказки (см. выше), повышая точность обнаружения GPT-5.4 до 56%.

Для большинства моделей тесты, которые спрашивали ‘Содержит ли этот текст скрытое понятие?’, произвели результаты, аналогичные тестам, спрашивающим ‘Какое скрытое понятие содержит этот текст?’.

Кроме того, два метода тестирования измеряли разные типы утечки, с 2AFC-тестами, измеряющими, может ли скрытая тема все еще быть обнаружена в написании, и свободными ответами, измеряющими, достаточно ли сильны утечные подсказки, чтобы другая ИИ могла угадать точное скрытое слов.

Авторы заключили*:

‘Наши результаты предполагают, что информация, активная в контексте модели во время генерации, может оставить тематические следы в ее выводе. Системные подсказки, цепочка рассуждений, извлеченные документы, пользовательские данные – любое из этих может, в принципе, влиять на творческие решения способами, обнаруживаемыми внешним наблюдателем.

‘Степень утечки будет зависеть от того, насколько открытой является генеративная задача (короткие шутки безопасны; истории не являются) и от того, насколько семантически идентифицируема информация в данной среде (“скрипка, вероятно, утечет в историях больше, чем “).

‘Тем не менее, семантическая утечка кажется неизбежной, даже когда модели активно пытаются скрыть информацию.’

Заключение

Как упоминалось выше, авторы приписывают часть проблемы основным принципам архитектуры Трансформеров самих по себе. История показывает, что эта последняя проблема LLM будет решена с помощью пост-тренировочного выравнивания (согласования), системных подсказок, которые не могут быть отредактированы конечным пользователем, фильтров и разнообразного спектра постоянно растущих вторичных систем, которые, кажется, умножаются, когда “родные” проблемы с моделями распространения приходят на свет.

Чем больше вторичная инфраструктура из рельсов и балансов становится, тем больше текущее поколение SOTA ИИ кажется похожим на Парк Юрского периода, где основная ценность приходит с устрашающим объемом оговорок и требует множества обходных путей и компромиссов.

 

* Акцент авторов, скорректированный мной, где необходимо (поскольку цитата статьи уже находится в курсиве), и цитаты авторов, преобразованные мной в ссылки.

Авторы замечают с интересом некоторое, казалось бы, маловероятное спонтанное совпадение через разные модели в отношении “самоотобранных” слов, заявляя ‘Модели склоняются к одинаковым словам: телескоп, свобода и ностальгия каждое появляется в 3+ списках моделей’. Они также отмечают общность выбора “короткой шутки” через модели: ‘[Несколько] моделей производят одну и ту же стандартную шутку, независимо от секрета. Опус пишет “Почему ученые не доверяют атомам? Потому что они составляют все” для 11 из 15 секретов. Остальные четыре секрета (кактус, энтропия, ностальгия, терпение) получают одну и ту же библиотечную шутку, которую Опус также пишет для всех 15 условий без секрета – что означает, что эти четыре секретных шутки неотличимы от базовой.’

†† Даже по стандартам Arxiv, статья имеет тенденцию к повторению и закапыванию своих увлекательных лидов в чрезмерных деталях и демонстрациях. Поэтому я отсылаю читателя к исходному PDF для остальной части вторичных экспериментов, изложенных в нем.

Опубликовано в первый раз в пятницу, 15 мая 2026 года. Синтаксис исправлен в субботу, 16 мая, 16:05 EET.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: [email protected]