Взгляд Anderson
Определение кражи моделей ИИ через секретные данные отслеживания

Новый метод может тайно пометить модели, подобные ChatGPT, за считанные секунды, не требуя повторной тренировки, не оставляя никаких следов в общем выводе и выдерживая все возможные попытки удаления.
Нюанс между водяными знаками и “ловушками для копирования” заключается в том, что водяные знаки – будь то явные или скрытые – обычно предназначены для появления на протяжении всего коллекции (например, набора изображений) как повсеместное препятствие для случайного копирования.
Напротив, фиктивная запись – это небольшой сегмент текста, обычно слово или определение, представленное в большой и относительно общей коллекции, предназначенный для доказательства кражи. Идея заключается в том, что когда вся работа копируется незаконно, либо сама по себе, либо как основа для производной работы, присутствие “уникального” и ложного факта, внедренного оригинальными владельцами, легко раскроет акт кражи.
В отношении добавления водяных знаков к большим языковым моделям (LLM) и моделям языка и зрения (VLM), степень, в которой вывод должен содержать эти характерные признаки, часто делится между этими двумя целями: обеспечить, чтобы весь или большинство вывода содержали явный или скрытый водяной знак; или обеспечить, чтобы “секретный токен” можно было извлечь, который доказывает кражу – но который не появляется в регулярном выводе модели.
Вес(а) доказательств
Последний подход рассматривается в интересном новом сотрудничестве между Китаем, Италией и Сингапуром; работа, целью которой является предоставление такого метода раскрытия открытым моделям, чтобы их нельзя было легко коммерциализировать или использовать способами, которые не разрешены исходной лицензией.
Например, исходная лицензия модели может требовать, чтобы любой, кто извлекает прибыль из работы, делал свои собственные изменения или дополнения публично доступными на тех же щедрых условиях лицензии – но компания может пожелать сохранить свои “улучшения” (например, тонко настроенные версии), чтобы сгенерировать рвы, где их на самом деле нет.
Большинство исследований в этой области занимается процедурами обнаружения, связанными с закрытыми моделями, доступными только через API, или моделями, для которых доступны только оптимизированные (квантованные) веса; и которые поэтому более трудны в эффективном редактировании и изменении способом, предложенным в новой работе (поскольку нет прямого доступа к архитектуре модели).
Этот акцент на выпусках FOSS, возможно, не удивителен для китайского исследовательского сектора, поскольку китайский выпуск ИИ за последний год был отмечен щедрыми полными выпусками моделей, которые, по крайней мере, соперничают с более “запертыми” западными эквивалентами.
Новый подход, озаглавленный EditMark, отличается тем, что не требует, чтобы модель была тонко настроена для добавления “зараженных” данных, и не требует, чтобы модель была обучена с самого начала с включенными данными.
Это имеет несколько преимуществ: одно из них заключается в том, что любые “характерные” данные, включенные в набор данных для обучения, как только они будут обнаружены и раскрыты, больше не будут эффективны, поскольку их можно напрямую нацелить на атакующих; но чтобы атаковать EditMark, злоумышленнику нужно будет знать, какой слой модели нацелить, и какой подход использовать. Это маловероятный сценарий.
Во-вторых, подход быстр и дешев, занимая всего несколько секунд (а не дней или даже недель) для применения к обученной модели, исключая серьезные расходы на тонкую настройку (которые увеличиваются линейно с размером модели и данными, которые необходимо применить).
Наконец, подход причиняет значительно меньше повреждений нормальной работе целевой модели, чем тонкая настройка или предыдущие методы редактирования.
В тестах EditMark – который встраивает математические запросы с несколькими возможными ответами в веса модели – достиг коэффициента извлечения 100%.
Авторы заявляют:
‘Комплексные эксперименты демонстрируют исключительную производительность EditMark в водяных знаках LLM. EditMark достигает замечательной эффективности, встраивая 32-битный водяной знак менее чем за 20 секунд с коэффициентом извлечения водяного знака 100%.
‘Заметно, что время встраивания водяного знака составляет менее 1/300 тонкой настройки (в среднем 6 875 секунд), что подчеркивает эффективность EditMark в реализации водяных знаков с высокой емкостью и беспрецедентной скоростью и надежностью.
‘Кроме того, обширные эксперименты подтверждают прочность, скрытность и точность EditMark.’
Новая работа называется EditMark: Водяные знаки больших языковых моделей на основе редактирования модели, и исходит от восьми авторов из Университета науки и технологий Китая, Университета Сиены и CFAR/IHPC/A*STAR в Сингапуре.
Метод
Подход EditMark состоит из четырех компонентов: Генератора, Кодировщика, Редактора и Декодировщика:

Конвейер EditMark встраивает водяной знак, редактируя модель для ответа на специальные математические вопросы, которые кодируют скрытую идентификационную информацию. Источник: https://arxiv.org/pdf/2510.16367
Генератор использует псевдослучайное семя для построения математических вопросов с несколькими ответами; Кодировщик выбирает ответы на основе водяного знака, которые затем встраиваются в модель через специализированный процесс редактирования. Как только отредактированная модель выпускается или используется неправильно, водяной знак можно извлечь, задав те же вопросы и декодируя закономерность ответов.
Затем Редактор изменяет веса модели так, чтобы, когда задают эти сгенерированные вопросы, модель надежно производила целевые ответы, встраивая водяной знак непосредственно в ее поведение. Декодировщик затем восстанавливает водяной знак, подая те же вопросы подозрительной модели и переводя ее ответы обратно в скрытую подпись.
Модель угроз
Модель угроз работы предполагает, что водяные знаки создаются в белом ящике. Хотя это обычно не хороший знак в исследованиях, связанных с безопасностью, здесь это нормально, поскольку метод направлен на защиту владельцев, имеющих полный доступ к своей работе.
Атакующий также предполагается иметь белый ящик после получения модели, что означает, что он может изменить ее (например, обрезав или тонко настроив). Опять же, этот сценарий нормален и ожидаем в случае выпуска FOSS. Однако атакующий не знает процесса извлечения водяного знака или используемой схемы и может найти этот метод только путем вывода и экспериментов (или утечек).
Генератор строит логически и фактически действительные математические вопросы с несколькими правильными ответами, используя GPT-4o для диверсификации шаблонов (как показано ниже), и псевдослучайное семя для обеспечения уникальности каждого вопроса. Это позволяет известному водяному знаку быть встроенным детерминированно через перестановки ответов, минимизируя при этом перекрытие между вопросами, чтобы избежать запутывания редактирования:

Шаблоны вопросов сгенерированы GPT-4o для встраивания водяного знака, каждая структурирована для получения нескольких действительных целочисленных ответов из сгенерированного неравенства.
Кодировщик преобразует каждый двоичный сегмент водяного знака в уникальную перестановку целых чисел, выбранных из набора решений данного математического вопроса. Используя теорию лексикографической перестановки, Кодировщик сопоставляет десятичное значение каждого сегмента водяного знака с конкретной упорядоченной выборкой ответов, обеспечивая, что водяной знак детерминированно встроен в поведение модели.
Что касается Редактора, оригинальный AlphaEdit метод редактирования модели, используемый для водяных знаков, не имеет точности и устойчивости, с измененной моделью, часто не возвращающей требуемые ответы. Любые изменения, которые он делает, легко нарушаются обрезкой или шумом.
Чтобы преодолеть это, авторы разработали стратегию многократного редактирования, которая постепенно регулирует веса модели на одном слое MLP до тех пор, пока ее ответы не будут достаточно согласованы с желаемыми ответами. Чтобы укрепить редактирование против взлома, они также вводят гауссовский шум во время обучения, чтобы имитировать атаки:

Распределение изменений в K1 для Baichuan-7B, Qwen-7B и LLaMA3-8B до и после атак. Верхний ряд показывает эффект случайного шумового внедрения; нижний ряд показывает эффект обрезки модели. Все изменения остаются близкими к нулю, что говорит о том, что атаки не существенно нарушают внутреннее поведение модели.
Система оценки останавливает процесс, как только редактирование достаточно точно, а регуляризация обеспечивает, что обновления остаются стабильными на протяжении нескольких раундов.
Декодировщик задает модели те же специальные вопросы, использованные во время водяных знаков, затем читает ее ответы, чтобы сделать вывод о скрытом идентификаторе. Поскольку закономерность ответов следует секретному правилу, этот идентификатор можно восстановить без необходимости изучать внутреннюю структуру модели.
Данные и тесты
Чтобы проверить EditMark, были оценены пять LLM: GPT2-X; GPT-J-6B; LLaMA-3-8B; Baichuan-7B; и Qwen-7B. Упомянутый выше AlphaEdit был использован для встраивания водяных знаков, в то время как коэффициент извлечения водяного знака (ESR) и время встраивания (ET) были приняты в качестве метрик.
В качестве базовых линий авторы выбрали Model Watermark (бэкдор); KIMark; и BadEdit, каркас, изначально разработанный для внедрения бэкдоров, здесь адаптированный для целей проекта.
Авторы отредактировали 15-й слой LLaMA-3-8; 17-й слой GPT2-XL и GPT-J-6B; и 14-й слой Qwen-7B и Baichuan-7B.
Эксперименты проводились на четырех NVIDIA RTX 4090 GPU (по 24 ГБ VRAM каждая), с водяными знаками длиной 32 бита, 64 бита и 128 бит, встроенными в модель. Шаблоны вопросов, использованные для генерации вопросов с несколькими ответами для водяных знаков, подробно описаны в изображении ниже:

Шаблоны, использованные для генерации вопросов с несколькими ответами для водяных знаков. Каждый вопрос основан на разных типах математических неравенств, с случайными значениями, вставленными для переменных. Модель запрашивается для возврата списка целочисленных решений, с порядком ответов, используемым для кодирования или декодирования битов водяного знака. Четыре шаблона покрывают квадратичные, логарифмические, рациональные и интервальные формы, и все были сгенерированы с помощью GPT-4o.
Чтобы уменьшить эффекты случайности, семена от 1 до 20 были применены во время тестирования, в разных емкостях водяных знаков.
Первоначально исследователи протестировали как ESR, так и время затрат на встраивание водяного знака в диапазоне LLM:

Сравнение EditMark с тремя предыдущими методами водяных знаков на пяти больших языковых моделях. Сообщается коэффициент извлечения водяного знака (ESR) и время встраивания (ET) в секундах. EditMark последовательно достигает коэффициента извлечения 100%, сокращая время встраивания на несколько порядков, превосходя все базовые линии как по точности, так и по эффективности на моделях разного размера и архитектуры.
Из этих результатов авторы заявляют:
‘[EditMark] достигает коэффициента извлечения 100% и требует менее 20 секунд для встраивания 32-битного водяного знака для всех оцененных LLM. В частности, среднее время встраивания для Baichuan-7B и Qwen-7B составляет менее 10 секунд, что демонстрирует высокую эффективность EditMark.’
Для оценки 128-битного водяного знака, самого высокого значения, возможного в такой схеме, EditMark смог сохранить статус “неизгладимости”:

Коэффициенты извлечения водяных знаков и время встраивания для EditMark на длинах водяных знаков 32, 64 и 128 бит на пяти языковых моделях. Идеальные коэффициенты извлечения поддерживаются во всех случаях, в то время как время встраивания увеличивается с размером водяного знака, но остается менее одной минуты, даже при 128 битах.
Далее была протестирована способность системы сохранять целостность водяного знака на нескольких бенчмарках:

Оценка целостности водяного знака на четырех бенчмарках на пяти моделях, сравнивая неизмененные модели с моделями, помеченными водяными знаками емкостью 32 бита и 128 бит. Производительность остается стабильной на всех конфигурациях, с только незначительными колебаниями средних баллов, что указывает на ограниченное влияние вставки водяного знака на точность бенчмарка.
EditMark’s устойчивость была протестирована против шести распространенных стратегий атак. Модели были сначала встроены с 128-битными водяными знаками, используя пять разных семян. Тонкая настройка, как показано на изображении ниже, вызвала только незначительное ухудшение коэффициентов извлечения водяных знаков (ESR) для большинства моделей:

Коэффициент извлечения водяного знака (ESR) помеченных LLM до и после тонкой настройки в течение одного до трех эпох. Хотя большинство моделей сохраняют высокий ESR на протяжении всего, Qwen-7B показывает заметное снижение, что указывает на большую уязвимость к обновлениям параметров.
Даже после нескольких эпох большинство моделей сохранили ESR выше 90%, что указывает на то, что EditMark сопротивляется дрейфу параметров, введенному обучением на основе LoRA.
Атаки квантования уменьшили точность модели, но оставили большинство водяных знаков целыми:

Коэффициент извлечения водяного знака (ESR) помеченных моделей до и после квантования с точностью Int-8 и Int-4. ESR остается неизменным при квантовании Int-8 на всех моделях, в то время как квантование Int-4 вызывает частичное ухудшение, что указывает на то, что более низкая точность может ослабить, но не полностью удалить водяной знак.
Как видно на изображении выше, квантование Int-8 сохранило ESR 100% на всех моделях, в то время как квантование Int-4 оказало умеренное влияние на ESR, но ввело неприемлемые потери производительности.
Как отмечается в работе, этот конкретный сценарий предполагает ограниченный потенциал для атакующего, поскольку это приводит к взломанной, но ухудшенной модели.
Тесты на шум и обрезку оценили четыре бенчмарк-фреймворка: MMLU; BLIMP; TruthfulQA; и GLUE. Эти атаки привели к снижению ESR по мере усиления нарушений:

Эффект шумовых (верхний ряд) и обрезки (нижний ряд) атак на ESR и производительность помеченных моделей. По мере снижения ESR производительность бенчмарка также ухудшается, особенно при более высоких интенсивностях шума и коэффициентах обрезки, подчеркивая (обычную) напряженность между удалением водяного знака и полезностью модели.
Однако это также вызвало резкое снижение производительности задач, с Baichuan-7B, получившим снижение на 27-31% на BLIMP при применении шума или обрезки.
Редактирование модели и адаптивные атаки также были оценены:

Коэффициент извлечения водяного знака помеченных моделей, подвергшихся различным степеням редактирования модели. Даже при применении до 50 редактирований к известным слоям водяного знака ESR остается выше 95% для всех моделей, что указывает на то, что прямые изменения параметров имеют ограниченный эффект на удаление водяного знака.
Здесь EditMark сохранил более 95% ESR, даже когда были нацелены точные слои встраивания водяного знака.
Вывод
Управление цифровыми правами (DRM), секретные водяные знаки и другие подходы к безопасности, которые имели (ограниченный или частичный) успех в до-ИИ эпохе, трудно применить к системам машинного обучения; намеренно редукционистский характер текущего диапазона архитектур хостов в сочетании с отсутствием подходящих инструментов делает любые внедренные водяные знаки довольно хрупкими.
Это впечатляет, что система направлена на распределение моделей FOSS, и что она выдерживает против всех сценариев, кроме самых маловероятных, в плане предварительных знаний атакующего. Тем не менее, небольшое снижение производительности, которое приходит с пост-редактированием, хотя и небольшое в этих экспериментах, может дать потенциальным пользователям повод задуматься; не в последнюю очередь потому, что отступление к модели контроля, основанной на API, обескураживает такие атаки почти полностью.
* Этот сайт утверждал, что ‘открытые веса’ выпуски из Китая не обязательно квалифицируются как полностью FOSS, поскольку данные часто удерживаются, что предотвращает точную рекреацию конвейера обучения. Справедливо, что эта тема приглашает более глубокий взгляд на политику выпусков моделей ИИ, сравниваемую между западом и востоком, что выходит за рамки этой статьи.
Опубликовано в понедельник, 27 октября 2025 года












