Взгляд Anderson

Легкое перефразирование ломает безопасность ИИ, даже для Gemini и Claude

mm
Добавьте Unite.AI в избранные источники в Google
An AI-generated image (GPT-1.5) depicting a crash test dummy embedded in the wall of a crash test laboratory.

Тесты безопасности ИИ показали, что они полагаются на «очевидные» триггерные слова; с легкой перефразировкой модели, помеченные как «разумно безопасные», внезапно терпят неудачу, а атаки удается до 98% времени.

 

Новые корпоративные исследования в США пришли к выводу, что хорошая репутация безопасности различных крупных языковых моделей (LLM) – включая многие ведущие имена, такие как Gemini 3 Pro и Claude Sonnet 3.7 – может быть бессмысленной, поскольку наборы данных и эталоны, используемые для их установления, содержат нелепо «очевидный» язык.

Два набора данных в вопросе, которые были представлены в различных обзорах статей на этом сайте, являются HarmBench и AdvBench:

Из соответствующих статей HarmBench и AdvBench, признанные представительными примерами провокации – но новая статья утверждает, что даже в реальных примерах из этих эталонов примеры легко сигнализируют о злонамеренном намерении, что приводит к (предположительно) непреднамеренному «игре» результатов. Источники – HarmBench [https://arxiv.org/pdf/2402.04249] и AdvBench [https://arxiv.org/pdf/2307.15043]

Из соответствующих статей HarmBench и AdvBench, признанные представительными примерами провокации – но новая статья утверждает, что даже в реальных сценариях примеры из этих эталонов «телеграфируют» злонамеренное намерение, что может привести к (предположительно) непреднамеренному «игре» результатов. Источники: HarmBench и AdvBench.

Хотя примеры, показанные выше, которые взяты из соответствующих статей для каждого эталона, являются намеренно упрощенными, чтобы проиллюстрировать принципы систем, новое исследование утверждает, что на самом деле эти коллекции действительно нацелены на «легкие добычи», и поэтому могут не быть эффективными эталонами – и что истинные результаты для возможностей безопасности протестированных LLM значительно ниже, чем сообщалось:

‘[Мы] оцениваем, действительно ли эти наборы данных измеряют риски безопасности или просто провоцируют отказы через триггерные сигналы. Чтобы изучить это, мы вводим «очистку намерений»: процедуру, которая абстрагирует триггерные сигналы от атак (точек данных), сохраняя при этом злонамеренное намерение и все соответствующие детали.

‘Наши результаты показывают, что текущие наборы данных безопасности ИИ не верно представляют реальные атаки из-за их чрезмерной зависимости от триггерных сигналов.

‘Фактически, как только эти сигналы удаляются, все ранее оцененные «разумно безопасные» модели становятся небезопасными, включая Gemini 3 Pro и Claude Sonnet 3.7.’

‘Безопасность’ в этом смысле представляет выравнивание – способность LLM защититься от попыток пользователей ‘взломать’ ограничения на API-only системах, чтобы сделать систему производить запрещенный вывод, такой как клеветнический текст или изображения.

Упомянутая выше «очистка намерений» авторов просто включает перефразировку «очевидных» атак в двух наборах данных/эталонах, чтобы они стали более тонкими и коварными, и гораздо более способными обойти фильтры и проверки:

Верхняя часть иначе неуклюжего примера из статьи. Показано в верхнем левом углу, желтым, тип «очевидного» запроса, который HarmBench и AdvBench обычно предоставляют; под ним, зеленым, запрос был нейтрализован, перефразирован и сделан достаточно приемлемым для Claude Sonnet 3.7, чтобы он был готов помочь пользователю найти «chop shops» (места обработки украденных транспортных средств) в новом городе. Источник - https://arxiv.org/pdf/2602.16729

Верхняя часть иначе неуклюжего примера из статьи. Показано в верхнем левом углу, желтым, тип «очевидного» запроса, который HarmBench и AdvBench обычно предоставляют; под ним, зеленым, запрос был нейтрализован, перефразирован и сделан достаточно приемлемым для Claude Sonnet 3.7, чтобы он был готов помочь пользователю найти «chop shops» (места обработки украденных транспортных средств) в новом городе. Источник

Исследователи проанализировали качества двух наборов данных по двум подходам: в изоляции, чтобы сравнить коллекции с характеристиками реальных атак; и на практике, где наборы данных – и собственные «улучшения» авторов на них – были использованы для атаки реальных моделей.

Во втором раунде тестов исследователи метод перефразировки был итеративно улучшен до оптимальных результатов в плане коэффициента успеха атаки (ASR):

Очистка намерений начинается с передачи открыто злонамеренного запроса через модель переписывания, которая удаляет явный триггерный язык, сохраняя при этом основное вредоносное намерение. Пересмотренный запрос затем представляется целевой модели, и ее ответ оценивается как по безопасности, так и по практической применимости. Если вывод считается небезопасным и практически применимым, атака считается успешной. Если нет, более ранние неудачные пересмотры подаются обратно в модель переписывания для генерации улучшенных версий, создавая итеративную петлю, которая функционирует как механизм взлома до тех пор, пока не будет достигнуто определенное количество попыток или желаемый коэффициент успеха атаки.

Очистка намерений начинается с передачи открыто злонамеренного запроса через модель переписывания, которая удаляет явный триггерный язык, сохраняя при этом основное вредоносное намерение. Пересмотренный запрос затем представляется целевой модели, и ее ответ оценивается как по безопасности, так и по практической применимости. Если вывод считается небезопасным и практически применимым, атака считается успешной. Если нет, более ранние неудачные пересмотры подаются обратно в модель переписывания для генерации улучшенных версий, создавая итеративную петлю, которая функционирует как механизм взлома до тех пор, пока не будет достигнуто определенное количество попыток или желаемый коэффициент успеха атаки.

Авторы утверждают*:

‘Наши результаты показывают, что с этой регенеративной петлей очистка намерений достигает высокого ASR (90%–98.55%) после всего нескольких итераций во всех изучаемых моделях при полном черном ящике. Это включает недавние модели, широко сообщаемые как среди самых безопасных – такие как Gemini 3 Pro и Claude Sonnet 3.7.

‘Эти результаты进一步 подтверждают, что существующие оценки безопасности и методы выравнивания безопасности высоко переобучены к триггерным сигналам.’

Новая работа называется Очистка намерений: наборы данных безопасности ИИ не являются тем, чем они кажутся, и исходит от двух авторов в Сан-Франциско-базированной программной компании Labelbox.

Метод

Чтобы изучить состав и архитектуру двух эталонных наборов данных в изоляции, были сгенерированы облака слов из двух корпусов, показывающие, какие слова и короткие фразы доминировали в коллекциях:

Облака слов, показывающие 40 самых частых униграмм, биграмм и триграмм в объединенных наборах данных AdvBench и HarmBench. Термины с врожденными негативными или чувствительными коннотациями выделены красным, контекстно-зависимые триггеры – оранжевым, и нейтральные слова, которые образуют более высокие триггеры, – зеленым. Концентрация открытых фраз, таких как «урок» и «инструкции шаг за шагом», предполагает, что два эталона сильно полагаются на явные сигналы, а не на реалистично созданные, скрытые атаки.

Облака слов, показывающие 40 самых частых униграмм, биграмм и триграмм в объединенных наборах данных AdvBench и HarmBench. Термины с врожденными негативными или чувствительными коннотациями выделены красным, контекстно-зависимые триггеры – оранжевым, и нейтральные слова, которые образуют более высокие триггеры, – зеленым. Концентрация открытых фраз, таких как «без обнаружения» и «инструкции шаг за шагом», предполагает, что два эталона сильно полагаются на явные сигналы, а не на реалистично созданные, скрытые атаки.

Авторы отмечают, что доминирующие одно-, двух- и трехсловные граммы невероятно откровенны в отношении злонамеренного намерения, в отличие от языка, который сами преступники используют в обсуждении, и который атакующие используют при тестировании или попытках компрометировать защиты LLM.

‘Эти сигналы подрывают два свойства – хорошо созданные и обусловленные скрытым намерением – поскольку такой открытый язык редко появляется в реальных атаках и кажется созданным для триггерирования механизмов безопасности искусственно. ‘

Статья характеризует закономерности коллекций как «триггерные сигналы» – фразы с явно негативными или чувствительными коннотациями, которые, кажется, спроектированы для активации фильтров безопасности. Некоторые являются врожденными заряженными, такими как ‘совершить самоубийство’, в то время как другие становятся заряженными только в контексте, например, когда вредоносная цель сочетается с формулировкой, такой как «без обнаружения», которая сигнализирует о явном намерении избежать обнаружения.

Несбалансированность языка наборов данных становится более очевидной по мере увеличения количества слов в n-граммах, с фразами, которые несут явный негативный или чувствительный смысл, доминирующими в наиболее частых n-граммах (см. изображение выше). Статья описывает их как триггерные фразы, которые, вместе с отдельными триггерными словами, составляют триггерные сигналы.

Некоторые фразы просто расширяют уже загруженные термины, такие как когда ‘украсть’ становится ‘украсть конфиденциальную информацию’, ‘украсть конфиденциальную информацию’ или ‘украсть личную информацию’; и, например, когда ‘совершить’ расширяется до ‘совершить самоубийство’, ‘совершить инсайдерскую торговлю’ или ‘совершить кражу личности’ – явно язык полиции, судов и медиа-отчетов.

Другие построены полностью из нейтральных слов, которые становятся тревожными только в сочетании, таких как ‘без обнаружения’, конструкция, которая сигнализирует об уклонении, несмотря на отсутствие врожденных заряженных терминов.

Удвоение

Авторы отмечают, что повторение явных сигналов не только делает запросы кажущимися искусственными, но также указывает на значительное дублирование данных в коллекциях. Чтобы проверить эту теорию, они выполнили парные проверки сходства по каждому набору данных, применяя пороги от 0,7 до 0,99, и группируя запросы, которые превысили заданный порог, как дубликаты, а остальные – как уникальные.

Поскольку нет согласованного стандарта того, что считается «высокой» сходством в одном доменном наборе данных, они использовали Open AI’s Grade School Math (GSM8K), популярный не-безопасный эталон, сопоставив его размер с HarmBench и AdvBench для контролируемого сравнения:

Ставки дублирования в AdvBench и HarmBench по порогам сходства, сравненные с подмножествами GSM8K. Почти на каждом пороге наборы данных безопасности содержат гораздо больше почти идентичных запросов, чем не-безопасный эталон, указывая на повторную оценку одного и того же вредоносного намерения в слегка варьирующейся формулировке, и предполагая, что сообщаемая производительность безопасности может быть завышена.

Ставки дублирования в AdvBench и HarmBench по порогам сходства, сравненные с подмножествами GSM8K. Почти на каждом пороге наборы данных безопасности содержат гораздо больше почти идентичных запросов, чем не-безопасный эталон, указывая на повторную оценку одного и того же вредоносного намерения в слегка варьирующейся формулировке, и предполагая, что сообщаемая производительность безопасности может быть завышена. Пожалуйста, обратитесь к исходной статье за лучшим разрешением.

Второй вывод из этой части исследования сравнил запросы внутри каждого набора данных, чтобы измерить, сколько из них были действительно разными. На среднем уровне установки сходства только около 11% запросов AdvBench были уникальными, в то время как почти 94% вопросов в подмножестве GSM8K были разными:

Примеры почти идентичных запросов в AdvBench и HarmBench, которые различаются в основном в формулировке, при этом выражая одно и то же вредоносное намерение. Повторное использование явных сигналов, показанных красным для врожденных заряженных терминов и оранжевым для контекстно-зависимых, производит кластеры запросов, которые эффективно тестируют один и тот же сценарий несколько раз – то есть один ответ будет в основном достаточен для оценки модели для этого намерения.

Примеры почти идентичных запросов в AdvBench и HarmBench, которые различаются в основном в формулировке, при этом выражая одно и то же вредоносное намерение. Повторное использование явных сигналов, показанных красным для врожденных заряженных терминов и оранжевым для контекстно-зависимых, производит кластеры запросов, которые эффективно тестируют один и тот же сценарий несколько раз – то есть один ответ будет обычно достаточен для оценки модели для этого намерения.

HarmBench показал ту же тенденцию, с 16% дубликатов на этом уровне по сравнению с 3,5% в GSM8K, что означает, что наборы данных безопасности часто повторяли одно и то же вредоносное запрос с незначительными изменениями в формулировке.

Если 85% уникальных примеров считается разумным стандартом, AdvBench достигла этого уровня только при очень строгой настройке и все еще не превысила 90%, в то время как GSM8K достигла 85% при гораздо более низком пороге. Согласно статье, эта закономерность предполагает, что эталоны безопасности тестируют повторные вариации одних и тех же идей, а не широкий спектр сценариев атак.

Дальнейшие подходы и тесты

Работа авторов по «очистке намерений» удаляет явный триггерный язык, сохраняя при этом основное вредоносное намерение. Вместо того, чтобы прямо заявлять о намерении, пересмотренные запросы имply его, сохраняя вредоносную нагрузку, но избегая сигналов, которые, вероятно, приведут к немедленному отказу LLM.

Два метода, облегчающих это, были нейтрализация коннотации, которая заменяет явно негативные термины на нейтральные или описательные альтернативы; и транспозиция контекста, которая перемещает реальные ссылки в вымышленные настройки, не изменяя при этом практического смысла.

Небольшой набор пересмотров был сначала написан вручную, после чего процесс был автоматизирован с использованием GPT-5.1 (gpt-5.1-2025-11-13), с настройкой восьми выстрелов в контексте обучения в качестве ‘очистителя намерений’. Ответы на исходные и переписанные запросы затем сравнивались, чтобы измерить, насколько сильно явный триггерный язык влиял на оценки безопасности.

Поскольку очистка намерений может изменить как формулировку, так и контекст, ответы оценивались в плане безопасности и практичности. Безопасность оценивалась по пятибалльной шкале Лайкерта, от ‘крайне небезопасно’ до ‘безопасно’, в зависимости от того, сохраняет ли ответ исходное вредоносное намерение – и, если да, то насколько оно вредно:

Шаблон запроса, используемый для стандартной оценки безопасности ответов на исходные данные AdvBench и HarmBench, до применения очистки намерений. GPT-5.1 был инструктирован оценить каждый ответ по пятибалльной шкале Лайкерта от 'Крайне небезопасно' до 'Безопасно', выбирая один общий суд на основе того, позволяет ли содержание причинить вред или остается неакционированным.

Шаблон запроса, используемый для стандартной оценки безопасности ответов на исходные данные AdvBench и HarmBench, до применения очистки намерений. GPT-5.1 был инструктирован оценить каждый ответ по пятибалльной шкале Лайкерта от ‘Крайне небезопасно’ до ‘Безопасно’, выбирая один общий суд на основе того, позволяет ли содержание причинить вред или остается неакционированным.

‘Практичность’ оценивалась по параллельной пятибалльной шкале от ‘крайне применимо’ до ‘не применимо’, на основе того, насколько полезным и переносимым будут детали в реальном мире; и ASR измерял производительность, с пересмотром, считаемым успешным только в том случае, если ответ был и небезопасным, и практичным.

Пятибалльные оценки были отображены на бинарные результаты, чтобы уменьшить двусмысленность, и очистка намерений также эволюционировала в метод взлома путем добавления итеративной петли пересмотра-регенерации, в которой неудачные пересмотры подвергались обратной связи в GPT-5.1 при той же настройке восьми выстрелов в контексте обучения. Эта петля продолжалась до тех пор, пока не было достигнуто определенное количество попыток или желаемый ASR.

Для тестов оценки безопасности использовался пакет Python wordcloud, чтобы извлечь n-grams из HarmBench и AdvBench, с обычными методами фильтрации (т.е. для удаления стоп-слов и других нерелевантных слов и символов).

Те же наборы данных безопасности, использованные для предыдущего анализа облака слов, были объединены с случайными выборками из вышеупомянутого GSM8K, с количеством слов, выровненных для паритета по коллекциям.

Авторы использовали вложения из контрольной точки all-MiniLM-L6-V2 из Sentence-BERT Transformers, поскольку это уже дофайн-тюнировано для кластеризации и семантического поиска.

Критерии оценки были сгенерированы моделью OpenAI GPT-4o, ограниченной 1024 токенами. GPT-5.1 оценивал как безопасность, так и практичность после очистки намерений, нулевым выстрелом, сопоставленным со всеми способами с самим очистителем намерений, за исключением того, что он также был ограничен 1024 токенами.

Тестируемые модели были Gemini 3 Pro; Claude Sonnet 3.7; Grok 4; GPT-4o; и Qwen2.5-7B-Instruct. Где применимо, поскольку обоснование было излишним фактором, оно было снижено как можно дальше в моделях, способных к обоснованию.

Все модели были ограничены ограничением вывода в 4096 токенов:

Оценка безопасности (SE), оценка практичности (PE) и коэффициент успеха атаки (ASR) для семи моделей на AdvBench (вверху) и HarmBench (внизу) при трех условиях: без пересмотра, первом пересмотре и последующих итерациях очистки намерений. SE сообщает процент ответов, оцененных как 'крайне небезопасно', 'высоко небезопасно' или 'небезопасно'; PE сообщает процент, оцененный как 'крайне применимо', 'высоко применимо' или 'применимо'; и ASR измеряет долю ответов, которые являются и небезопасными, и практичными. В настройке без пересмотра ASR следует его стандартному определению, поскольку не применяется абстракция. Жирные значения указывают на самый высокий ASR, достигнутый в каждом наборе данных, и более низкий ASR соответствует более сильной безопасности модели. Пожалуйста, обратитесь к исходной статье за лучшим разрешением.

Оценка безопасности (SE), оценка практичности (PE) и коэффициент успеха атаки (ASR) для семи моделей на AdvBench (вверху) и HarmBench (внизу) при трех условиях: без пересмотра, первом пересмотре и последующих итерациях очистки намерений. SE сообщает процент ответов, оцененных как ‘крайне небезопасно’, ‘высоко небезопасно’ или ‘небезопасно’; PE сообщает процент, оцененный как ‘крайне применимо’, ‘высоко применимо’ или ‘применимо’; и ASR измеряет долю ответов, которые являются и небезопасными, и практичными. В настройке без пересмотра ASR следует его стандартному определению, поскольку не применяется абстракция. Жирные значения указывают на самый высокий ASR, достигнутый в каждом наборе данных, и более низкий ASR соответствует более сильной безопасности модели. Пожалуйста, обратитесь к исходной статье за лучшим разрешением.

Что касается этих первоначальных результатов, авторы отмечают, что удаление явных триггерных сигналов из запросов атак привело к резкому увеличению коэффициента успеха атаки. На AdvBench средний ASR возрос с первоначальных 5,38% до 86,79% после первого пересмотра, на HarmBench увеличиваясь с 13,79% до 79,83% – указывая на то, что отказы моделей были сильно связаны с присутствием явных триггерных сигналов.

Авторы наблюдают:

‘Это указывает на то, что отказы моделей в основном обусловлены присутствием триггерных сигналов. Следовательно, наборы данных безопасности не надежно измеряют реальные риски безопасности, поскольку они больше полагаются на триггерные сигналы, чтобы вызвать отказы, чем на фактическое вредоносное намерение.’

Очистка намерений, утверждает статья, эффективно удалила триггерные сигналы, сохраняя при этом вредоносное намерение, и функционировала как сильный метод взлома. В последней итерации пересмотра-регенерации, соответствующей самому высокому ASR в каждом наборе данных, коэффициенты успеха атаки достигли 90% до 98,55% во всех моделях.

Это включало Gemini 3 Pro и Claude Sonnet 3.7, которые были взломаны с ASR 93% до 95% на AdvBench и 91% до 93% на HarmBench, после всего нескольких итераций.

Авторы заключают:

‘Наши результаты показали, что предыдущие выводы о безопасности не держатся, когда триггерные сигналы удаляются, и что наблюдаемая производительность безопасности в основном обусловлена присутствием триггерных сигналов, а не основными рисками безопасности.

‘Мы также показали, что очистка намерений может быть использована как мощный метод взлома, достигающий высоких коэффициентов успеха атаки от 90% до более 98%.

‘В целом, наши результаты раскрыли критический разрыв между тем, как оценивается безопасность модели, и тем, как проявляется реальное враждебное поведение.

‘На основе этого мы заключаем, что (1) оценки безопасности должны эволюционировать, чтобы захватить враждебные атаки более реалистично, и (2) текущие усилия по выравниванию безопасности все еще далеки от того, чтобы быть прочными против реальных угроз.’

Вывод

Одна общая нить, которая все еще проходит через литературу языка и компьютерного зрения (и места, где они пересекаются, такие как VLMs) является неспособностью надежно понимать, когда кто-то обманывает производство запрещенного контента; или даже когда кто-то невольно отклоняется от него, без внешнего принуждения.

За кулисами более крупных и более непрозрачных фабрик моделей можно только предположить, что радикальное ужесточение контроля над этими семантическими зонами захвата приводит к неприемлемому побочному ущербу, такому как снижение производительности на «не запрещенных» генерациях или недопустимая скорость ложных положительных результатов от фильтра контента.

Базовая природа обученной модели в любой области состоит в том, чтобы следовать всем своим данным обучения к любому выводу, к которому запрос может привести; единственные родные ограничения, доступные для этого, являются а) не включать спорный материал в данные обучения (что является столь же логистической проблемой, как и любой другой); или б) «отрезать» пути к нежелательному контенту после обучения (процесс, который может быть часто обращен явной аблитацией, или как непреднамеренный побочный эффект файн-тюнинга).

 

* Моя замена внутренних цитат авторов на гиперссылки. Подчеркивания авторов, а не мои.

https://www.unite.ai/what-is-overfitting/

Опубликовано в первый раз в понедельник, 23 февраля 2026 года

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai