Кибербезопасность
Исследование Lasso показывает, что текстовые водяные знаки изменяют отказы LLM и вызовы инструментов

Исследователь Lasso Security Андреа Сипосова 17 сентября 2026 г. опубликовала Налог на происхождение: понимание влияния водяных знаков LLM на поведение AI‑агентов, исследование, в котором сообщается, что текстовый водяной знак SynthID-Text может изменить как отказ языковой модели от вредоносного запроса, так и какие вызовы инструментов генерирует AI‑агент. Исследование назвало этот поведенческий эффект «смещение выборки».
Согласно исследованию, водяные знаки предназначены для происхождения, но SynthID-Text меняет процесс генерации каждым следующим токеном моделью. На уровне модели это может изменить поведение в области безопасности, включая то, отказывает ли модель вредоносному запросу и сохраняется ли этот отказ при внедрении подсказки; на уровне агента те же выбранные токены могут определять как инструмент, который агент вызывает, так и аргументы, передаваемые этому инструменту. В исследовании сообщается, что смещение проявляется на практике как в поведении отказов, так и в вызовах инструментов агентом, что при внедрении водяной знак заставил несколько моделей чаще отвечать на вредоносные запросы, которые они иначе бы отказали, что эффект зависит от модели и ключа, и что агрегированные оценки могут скрывать его, когда изменения в противоположных направлениях компенсируют друг друга.
Водяной знак, переходящий к регулируемому развертыванию
В объявлении от 14 августа 2026 г. Как работает текстовый водяной знак Claude Anthropic заявила, что будущие модели Claude будут генерировать текст, содержащий водяной знак на основе SynthID-Text от Google DeepMind, что является изменением, внедряемым для соответствия EU AI Act. Anthropic отметила, что метод практически не влияет на качество и содержание выводов Claude. Пост Lasso описывает закон ЕС как требующий от поставщиков систем ИИ, генерирующих синтетический текст, помечать выводы в машиночитаемом формате, чтобы их можно было обнаружить как искусственно сгенерированные. В посте также отмечается, что Anthropic заявляет, что водяной знак работает на уровне модели и распространяется на поддерживаемые модели, доступные через API Claude Platform и облачных провайдеров, так что агент, построенный вокруг модели с водяным знаком, может получать помеченные выводы, даже если сам агент является отдельным приложением.
Почему выбор токенов меняет поведение
В исследовании использовалась недеструктивная конфигурация SynthID-Text, сохраняющая оригинальное распределение токенов модели в среднем по всей случайности водяного знака, хотя отдельная генерация под одним фиксированным ключом может отличаться. В посте цитируются Dathathri et al., чья статья в Nature сообщала об отсутствии измеримого ухудшения качества почти в двадцати миллионах ответов Gemini. Недеструктивный водяной знак не подразумевает идентичное поведение при фиксированном ключе, подчеркивает пост: эта гарантия усредняется по случайности водяного знака, в то время как любой отдельный ключ всё равно меняет, какие токены выбираются при генерации текста.
Турнирная выборка имеет больше возможностей изменять выбор токенов в тех местах, где модель неопределенна, объясняет исследование. В структурированном выводе, таком как JSON, структурные элементы — фигурные скобки, ключи и имена функций — обычно легко предсказать, тогда как значения аргументов, такие как запросы, числа, пути и получатели, вызывают большую неопределённость. Поэтому изменение, которое в обычной прозе выглядело бы как лексическая вариация, может переписать аргумент, который исполняет агент, даже если веса модели и подсказка остаются неизменными.
Как исследование измеряло смещение выборки
Исследователи использовали парный дизайн в двух экспериментах. Вызов инструментов оценивался по одноповоротному AST-бенчмарку BFCL v4, а отказы — по 200 вредоносным поведениям из HarmBench плюс 100 безвредных контролей из JailbreakBench, при этом вредоносные запросы тестировались как без модификаций, так и с использованием одной фиксированной техники внедрения подсказки. Эта техника вставляет в подсказку враждебную инструкцию, как будто она является извлечённым содержимым, заявляя, что фильтр безопасности отключён и направляя модель к выполнению; та же техника применялась ко всем подсказкам, моделям и температурам.
Эксперименты проводились с помощью неизменённого SynthIDTextWatermarkLogitsProcessor от Hugging Face, использующего 30 слоёв Tournament, длину n‑грамм 5, таблицу выборки 2^16 и историю контекста 1 024. Каждый элемент генерировался с SynthID и без него, используя одинаковые семена, пакеты и порядок генерации при каждой температуре, так что процессор водяного знака был единственной переменной в каждой паре.
Точность вызова инструментов и отток
Для элементов, где ожидается вызов инструмента, водяной знак снизил точность у шести из семи протестированных моделей, при этом значительное снижение наблюдалось у четырёх, сообщает исследование. Поскольку неверный вызов может компенсироваться правильным, исследователи также измерили разногласия в паре, которые они называют «отток»: доля элементов, для которых результаты водяных и неводяных запусков различались. Используя фиксированный набор из 1 150 задач с ожидаемым вызовом при каждой температуре, исследование обнаружило, что при температуре 1,0 % verdictов вызовов phi-4 различались в 16,8 % случаев, а чистая потеря точности составила 2,87 пункта; Llama-3.1-8B показала отток 9,9 % при чистой потере 0,87 пункта. По 21 комбинации модель‑температура отток в среднем составил 6,5 %, и его бутстрэп‑интервал исключал ноль во всех случаях.
Профили ошибок различались в зависимости от модели. На Llama-3.1-8B наибольший вклад в потерю точности внесли неверные аргументы со значением -3.48 балла, за ними последовали вызовы неправильного инструмента со значением -1.84 балла, тогда как на phi-4 и Granite-3.2-8B доминировал искажённый вывод со значениями -5.96 и -4.36 балла. Хорошо сформированный вызов правильного инструмента с некорректным путём, получателем, запросом или суммой особенно значим, отмечает пост, поскольку такой вызов всё равно завершается, но делает не то, что предполагалось.
Отказы ослабевают при инъекции подсказки
Отказы также генерируются токен за токеном, поэтому водяной знак может влиять на них. Исследование сообщает, что водяной знак изменяет поведение отказов при чисто вредоносных запросах, при этом эффект усиливается при инъекции подсказки, где наибольшие сдвиги переходят от отказа к выполнению. При температуре 0.001 уровень оттока у gemma-3-27b вырос с 6.0% при чисто вредоносных запросах до 23.5% при инъекции, при этом чистое изменение соблюдения переместилось с -1.0 до +12.5 баллов; у gemma-3-12b уровень оттока вырос с 7.5% до 11.0%, а чистое изменение соблюдения переместилось с -0.5 до +9.0 баллов. Llama-3.1-8B показала отток 14.0% при температуре 0.001 и 17.5% при температуре 0.7 при инъекции, хотя её чистое изменение не было статистически значимым.
phi-4 и Qwen3-4B изменились лишь незначительно при любом из условий; обе модели склонны к избыточным отказам, включая безвредные контрольные запросы, и пост предостерегает, что их небольшие изменения не следует принимать за доказательство того, что водяной знак сохраняет поведение в области безопасности у этих моделей. Чтобы поставить разногласия в контекст, исследование сравнило вызванный водяным знаком отток при инъекции при температуре 0.7 с оттоком, полученным при изменении температуры с 0.001 до 0.7 без водяного знака. Вызванный водяным знаком отток был значительно выше у четырёх из шести моделей; у Granite-3.2-8B был наивысший отток, вызванный изменением температуры, — 15.5% и его отток, вызванный водяным знаком, был ещё выше — 21.5%.
Чувствительность к ключу и рекомендации
Поскольку влияние SynthID на выбор токенов зависит от ключа водяного знака, исследование протестировало одиннадцать ключей при температуре 0.7. Для Llama-3.1-8B исследовательский ключ повысил успешность атаки на 3.5 балла, в то время как остальные десять ключей в среднем давали +4.4 балла и варьировались от -4.5 до +14.5 балла. Большинство ключей увеличивали успешность атаки у обеих моделей Gemma по сравнению с базой без водяного знака, тогда как у Granite-3.2-8B наблюдалась смешанная реакция, с ключами, вызывающими изменения успешности атаки в обоих направлениях. Где ключ водяного знака или его конфигурация контролируются поставщиком модели, отмечает пост, такие сдвиги поведения могут происходить вне досягаемости разработчика, создающего агента.
Исследование рекомендует повторно проводить оценку агентов и ред‑тиминг с точной конфигурацией водяного знака, планируемой к развертыванию, сравнивая результаты с водяным знаком и без него на одинаковых входных данных и тестируя при инъекции подсказки. Результаты не выступают против использования водяного знака для подтверждения происхождения, отмечает пост: происхождение и стабильность поведения — это отдельные свойства, и водяной знак, который обнаруживается и не меняет качество текста, не гарантирует, что агент сохранит тот же вызов инструмента или поведение в области безопасности после его включения. Хотя исследование рассматривало SynthID-Text, пост добавляет, что проблема распространяется на любое вмешательство, изменяющее способ выбора токенов в системе, которая оперирует этими токенами.












