Модели и платформы ИИ
MARKLLM: Открытый инструментарий для водяного знака LLM
Водяной знак LLM, который интегрирует неощутимые, но обнаруживаемые сигналы в выходных данных модели для идентификации текста, сгенерированного LLM, имеет важное значение для предотвращения злоупотребления крупными языковыми моделями. Эти методы водяного знака в основном делятся на две категории: семейство KGW и семейство Christ. Семейство KGW изменяет логиты, вырабатываемые LLM, для создания выходных данных с водяным знаком, категоризируя словарь на зеленый список и красный список на основе предыдущего токена. Смещение вводится в логиты токенов зеленого списка во время генерации текста, отдавая предпочтение этим токенам в сгенерированном тексте. Затем рассчитывается статистический показатель из пропорции зеленых слов, и устанавливается порог для различия между текстом с водяным знаком и без него. Улучшения метода KGW включают улучшенное разделение списка, лучшее манипулирование логитами, увеличение емкости информации водяного знака, устойчивость к атакам на удаление водяного знака и возможность публичного обнаружения водяного знака.
Напротив, семейство Christ изменяет процесс выборки во время генерации текста LLM, внедряя водяной знак путем изменения того, как выбираются токены. Оба семейства водяных знаков направлены на баланс между обнаруживаемостью водяного знака и качеством текста, решая проблемы, такие как устойчивость в условиях переменной энтропии, увеличение емкости информации водяного знака и защита от попыток удаления. Недавние исследования были сосредоточены на усовершенствовании разделения списка и манипулирования логитами, повышении емкости информации водяного знака, разработке методов для сопротивления удалению водяного знака и обеспечении публичного обнаружения. В конечном итоге, водяной знак LLM имеет решающее значение для этичного и ответственного использования крупных языковых моделей, предоставляя метод для отслеживания и проверки текста, сгенерированного LLM. Семейства KGW и Christ предлагают два различных подхода, каждый со своими уникальными сильными сторонами и применениями, постоянно эволюционирующими благодаря продолжающимся исследованиям и инновациям.
Благодаря способности каркаса водяного знака LLM внедрять алгоритмически обнаруживаемые сигналы в выходные данные модели для идентификации текста, сгенерированного каркасом LLM, играет решающую роль в смягчении рисков, связанных с злоупотреблением крупными языковыми моделями. Однако существует множество каркасов водяного знака LLM на рынке в настоящее время, каждый со своими перспективами и процедурами оценки, что затрудняет исследователям экспериментировать с этими каркасами легко. Чтобы противостоять этой проблеме, MarkLLM, открытый инструментарий для водяного знака, предлагает расширяемый и унифицированный каркас для реализации алгоритмов водяного знака LLM, обеспечивая пользовательские интерфейсы для обеспечения легкости использования и доступа. Кроме того, каркас MarkLLM поддерживает автоматическую визуализацию механизмов этих каркасов, тем самым повышая понимание этих моделей. Каркас MarkLLM предлагает комплексный набор из 12 инструментов, охватывающих три перспективы, а также два автоматизированных трубопровода оценки для оценки его производительности. Эта статья направлена на то, чтобы покрыть каркас MarkLLM в глубину, и мы исследуем механизм, методологию, архитектуру каркаса, а также его сравнение с каркасом государственного искусства. Итак, давайте начнем.
MarkLLM: Инструментарий для водяного знака LLM
Появление крупных языковых моделей, таких как LLaMA, GPT-4, ChatGPT и другие, существенно продвинуло способность моделей ИИ выполнять конкретные задачи, включая творческое написание, понимание контента, формирование извлечения и многое другое. Однако вместе с замечательными преимуществами, связанными с исключительной производительностью текущих крупных языковых моделей, возникли определенные риски, включая написание академических работ, генерацию фейковых новостей и изображений LLM, и индивидуальную имитацию, чтобы назвать несколько. Учитывая риски, связанные с этими проблемами, важно разработать надежные методы, способные различать текст, сгенерированный LLM, и контент, созданный человеком, что является основным требованием для обеспечения подлинности цифровой коммуникации и предотвращения распространения дезинформации. В течение последних нескольких лет водяной знак LLM был рекомендован как один из перспективных решений для различения контента, сгенерированного LLM, и контента, созданного человеком, и, включая различные функции во время процесса генерации текста, выходные данные LLM могут быть уникально идентифицированы с помощью специально разработанных детекторов.
Чтобы мостить существующий разрыв, каркас MarkLLM пытается сделать следующие вклады. Каркас MarkLLM предлагает последовательные и пользовательские интерфейсы для загрузки алгоритмов, генерации текста с водяным знаком, проведения процессов обнаружения и сбора данных для визуализации. Он обеспечивает настраиваемые решения для визуализации для обоих основных семей алгоритмов водяного знака, позволяя пользователям видеть, как работают различные алгоритмы в разных конфигурациях с реальными примерами. Инструментарий включает комплексный модуль оценки с 12 инструментами, решающими обнаруживаемость, устойчивость и влияние на качество текста. Кроме того, он включает два типа автоматизированных трубопроводов оценки, поддерживающих настраиваемость наборов данных, моделей, метрик оценки и атак, облегчающих гибкие и тщательные оценки. Разработанный с модульной, слабо связанной архитектурой, MarkLLM повышает масштабируемость и гибкость. Этот выбор дизайна поддерживает интеграцию новых алгоритмов, инновационных методов визуализации и расширение инструментария оценки будущими разработчиками.
Было предложено множество алгоритмов водяного знака, но их уникальные подходы к реализации часто отдают предпочтение конкретным требованиям над стандартизацией, что приводит к нескольким проблемам
- Отсутствие стандартизации в дизайне класса: Это требует значительных усилий для оптимизации или расширения существующих методов из-за недостаточно стандартизированных дизайнов классов.
- Отсутствие унификации в интерфейсах верхнего уровня: Несовместимые интерфейсы делают пакетную обработку и повторение различных алгоритмов громоздкими и трудоемкими.
- Проблемы с кодом: Проблемы включают необходимость изменения настроек в нескольких сегментах кода и несоответствующую документацию, что затрудняет настройку и эффективное использование. Жестко закодированные значения и несоответствующая обработка ошибок еще больше препятствуют адаптивности и усилиям по отладке.
Чтобы решить эти проблемы, наш инструментарий предлагает унифицированный каркас реализации, который позволяет удобно вызывать различные алгоритмы государственного искусства в гибких конфигурациях. Кроме того, наш тщательно разработанный классовый каркас открывает путь для будущих расширений. Следующая фигура демонстрирует дизайн этого унифицированного каркаса реализации.
Благодаря распределенному дизайну каркаса, разработчикам легко добавлять дополнительные интерфейсы верхнего уровня к любому конкретному классу алгоритма водяного знака без беспокойства о влиянии на другие алгоритмы.
MarkLLM: Архитектура и методология
Техники водяного знака LLM в основном делятся на две категории: семейство KGW и семейство Christ. Семейство KGW изменяет логиты, вырабатываемые LLM, для создания выходных данных с водяным знаком, категоризируя словарь на зеленый список и красный список на основе предыдущего токена. Смещение вводится в логиты токенов зеленого списка во время генерации текста, отдавая предпочтение этим токенам в сгенерированном тексте. Затем рассчитывается статистический показатель из пропорции зеленых слов, и устанавливается порог для различия между текстом с водяным знаком и без него. Улучшения метода KGW включают улучшенное разделение списка, лучшее манипулирование логитами, увеличение емкости информации водяного знака, устойчивость к атакам на удаление водяного знака и возможность публичного обнаружения водяного знака.
Напротив, семейство Christ изменяет процесс выборки во время генерации текста LLM, внедряя водяной знак путем изменения того, как выбираются токены. Оба семейства водяных знаков направлены на баланс между обнаруживаемостью водяного знака и качеством текста, решая проблемы, такие как устойчивость в условиях переменной энтропии, увеличение емкости информации водяного знака и защита от попыток удаления. Недавние исследования были сосредоточены на усовершенствовании разделения списка и манипулирования логитами, повышении емкости информации водяного знака, разработке методов для сопротивления удалению водяного знака и обеспечении публичного обнаружения. В конечном итоге, водяной знак LLM имеет решающее значение для этичного и ответственного использования крупных языковых моделей, предоставляя метод для отслеживания и проверки текста, сгенерированного LLM. Семейства KGW и Christ предлагают два различных подхода, каждый со своими уникальными сильными сторонами и применениями, постоянно эволюционирующими благодаря продолжающимся исследованиям и инновациям.
Автоматическая комплексная оценка
Оценка алгоритма водяного знака LLM – это сложная задача. Во-первых, она требует учета различных аспектов, включая обнаруживаемость водяного знака, устойчивость против подделки и влияние на качество текста. Во-вторых, оценки с каждой перспективы могут требовать разных метрик, сценариев атак и задач. Кроме того, проведение оценки обычно включает несколько шагов, таких как выбор модели и набора данных, генерация текста с водяным знаком, постобработка, обнаружение водяного знака, подделка текста и расчет метрик. Чтобы облегчить удобную и тщательную оценку алгоритмов водяного знака LLM, MarkLLM предлагает двенадцать пользовательских инструментов, включая различные калькуляторы метрик и атаков, которые охватывают три вышеупомянутых перспективы оценки. Кроме того, MarkLLM обеспечивает два типа автоматизированных демонстрационных трубопроводов, чьи модули могут быть настроены и собраны гибко, позволяя легко настроить и использовать.
Для аспекта обнаруживаемости большинство алгоритмов водяного знака в конечном итоге требуют указания порога для различия между текстом с водяным знаком и без него. Мы обеспечиваем базовый калькулятор скорости успеха, используя фиксированный порог. Кроме того, чтобы минимизировать влияние выбора порога на обнаруживаемость, мы также предлагаем калькулятор, который поддерживает динамический выбор порога. Этот инструмент может определить порог, который дает лучший показатель F1 или выбрать порог на основе заданного целевого показателя ложных положительных результатов (FPR).
Для аспекта устойчивости MarkLLM предлагает три атаки на уровне слов на текст: случайное удаление слова в указанном соотношении, случайная замена синонимом с использованием WordNet в качестве набора синонимов и контекстно-зависимая замена синонимом с использованием BERT в качестве модели вложения. Кроме того, две атаки на уровне документа на текст предоставляются: парафразирование контекста через API OpenAI или модель Dipper. Для аспекта качества текста MarkLLM предлагает два прямых инструмента анализа: калькулятор perplexity для оценки плавности и калькулятор разнообразия для оценки изменчивости текста. Чтобы проанализировать влияние водяного знака на полезность текста в конкретных задачах, мы обеспечиваем калькулятор BLEU для задач машинного перевода и судью “проходит/не проходит” для задач генерации кода. Кроме того, учитывая текущие методы сравнения качества текста с водяным знаком и без него, которые включают использование более сильной модели LLM для суждения, MarkLLM также предлагает дискриминатор GPT, использующий GPT-4 для сравнения качества текста.
Трубопроводы оценки
Чтобы облегчить автоматизированную оценку алгоритмов водяного знака LLM, MarkLLM обеспечивает два трубопровода оценки: один для оценки обнаруживаемости водяного знака с и без атак, и другой для анализа влияния этих алгоритмов на качество текста. Следуя этому процессу, мы реализовали два трубопровода: WMDetect3 и UWMDetect4. Основное различие между ними заключается в фазе генерации текста. Первый требует использования метода generate_watermarked_text из алгоритма водяного знака, в то время как второй зависит от параметра text_source для определения того, следует ли直接 извлекать естественный текст из набора данных или вызывать метод generate_unwatermarked_text.
Чтобы оценить влияние водяного знака на качество текста, генерируются пары текста с водяным знаком и без него. Тексты, вместе с другими необходимыми входными данными, затем обрабатываются и подают в назначенный анализатор качества текста для производства подробного анализа и сравнительных результатов. Следуя этому процессу, мы реализовали три трубопровода для разных сценариев оценки:
- DirectQual.5: Этот трубопровод специально разработан для анализа качества текста, сравнивая характеристики текста с водяным знаком с характеристиками текста без водяного знака. Он оценивает метрики, такие как perplexity (PPL) и логарифмическое разнообразие, без необходимости внешних текстов-референтов.
- RefQual.6: Этот трубопровод оценивает качество текста, сравнивая текст с водяным знаком и без него с общим текстом-референтом. Он измеряет степень сходства или отклонения от текста-референта, что делает его идеальным для сценариев, которые требуют конкретных задач для оценки качества текста, таких как машинный перевод и генерация кода.
- ExDisQual.7: Этот трубопровод использует внешний судью, такой как GPT-4 (OpenAI, 2023), для оценки качества текста с водяным знаком и без него. Дискриминатор оценивает тексты на основе заданных пользователем описаний задач, выявляя любое потенциальное ухудшение или сохранение качества из-за водяного знака. Этот метод особенно ценен, когда требуется продвинутый, основанный на ИИ анализ тонких эффектов водяного знака.
MarkLLM: Эксперименты и результаты
Чтобы оценить его производительность, каркас MarkLLM проводит оценки девяти различных алгоритмов и оценивает их влияние, устойчивость и обнаруживаемость на качестве текста.

Таблица выше содержит результаты оценки обнаруживаемости девяти алгоритмов, поддерживаемых в MarkLLM. Динамический выбор порога используется для оценки обнаруживаемости водяного знака, с тремя настройками: при целевом показателе ложных положительных результатов (FPR) 10%, при FPR 1% и при условиях для оптимального показателя F1. Генерируются 200 текстов с водяным знаком, в то время как 200 текстов без водяного знака служат отрицательными примерами. Мы предоставляем показатели истинных положительных результатов (TPR) и F1-оценку при динамическом выборе порога для 10% и 1% FPR, а также TPR, TNR, FPR, FNR, P, R, F1, ACC при оптимальной производительности. Следующая таблица содержит результаты оценки устойчивости девяти алгоритмов, поддерживаемых в MarkLLM. Для каждой атаки генерируются 200 текстов с водяным знаком, которые затем подвергаются атаке, с дополнительными 200 текстами без водяного знака, служащими отрицательными примерами. Мы сообщаем TPR и F1-оценку при оптимальной производительности при каждом обстоятельстве.

Окончательные мысли
В этой статье мы говорили о MarkLLM, открытом инструментарии для водяного знака, который предлагает расширяемый и унифицированный каркас для реализации алгоритмов водяного знака LLM, обеспечивая пользовательские интерфейсы для обеспечения легкости использования и доступа. Кроме того, каркас MarkLLM поддерживает автоматическую визуализацию механизмов этих каркасов, тем самым повышая понимание этих моделей. Каркас MarkLLM предлагает комплексный набор из 12 инструментов, охватывающих три перспективы, а также два автоматизированных трубопровода оценки для оценки его производительности.












