Моделі та платформи ШІ
MARKLLM: Відкритий інструментарій для водяних знаків LLM
Водяні знаки LLM, які інтегрують непомітні, але виявні сигнали у вивід моделі для ідентифікації тексту, згенерованого LLM, є важливими для запобігання неправильному використанню великих мовних моделей. Ці техніки водяних знаків переважно діляться на дві категорії: сімейство KGW і сімейство Christ. Сімейство KGW змінює логіти, згенеровані LLM, для створення водяного знаку, категоризуючи словниковий запас на зелений список і червоний список на основі попереднього токену. Зміна відбувається до логітів токенів зеленого списку під час генерації тексту, надаючи перевагу цим токенам у згенерованому тексті. Потім обчислюється статистичний показник з пропорції зелених слів, і встановлюється поріг для розрізнення між водяним знаком і не водяним знаком. Покращення методу KGW включають покращення розбиття списку, кращу маніпуляцію логітами, збільшену місткість інформації водяного знаку, стійкість до атак на видалення водяного знаку та можливість публічного виявлення водяного знаку.
Натомість сімейство Christ змінює процес вибірки під час генерації тексту LLM, впроваджуючи водяний знак шляхом зміни вибору токенів. Обидва сімейства водяних знаків спрямовані на балансування виявності водяного знаку з якістю тексту, адресуючи такі проблеми, як стійкість у різних умовах ентропії, збільшення місткості інформації водяного знаку та захист від спроб видалення. Останні дослідження зосередилися на вдосконаленні розбиття списку та маніпуляції логітами, підвищенні місткості інформації водяного знаку, розробці методів захисту від видалення водяного знаку та забезпечення публічного виявлення. В кінцевому підсумку, водяні знаки LLM є важливими для етичного та відповідального використання великих мовних моделей, забезпечуючи метод для відстеження та верифікації тексту, згенерованого LLM. Сімейства KGW і Christ пропонують два різні підходи, кожен з яких має свої унікальні сильні сторони та застосування, які постійно еволюціонують завдяки тривалим дослідженням та інноваціям.
Через можливість інструментарію водяних знаків LLM для впровадження алгоритмічно виявних сигналів у вивід моделі для ідентифікації тексту, згенерованого LLM, відіграє важливу роль у пом’якшенні ризиків, пов’язаних з неправильним використанням великих мовних моделей. Однак на ринку зараз існує велика кількість інструментаріїв водяних знаків LLM, кожен з яких має свій власний погляд і процедури оцінки, що робить складним для дослідників легко експериментувати з цими інструментаріями. Для вирішення цієї проблеми MarkLLM, відкритий інструментарій для водяних знаків, пропонує розширений і уніфікований інструментарій для впровадження алгоритмів водяних знаків LLM, забезпечуючи користувальницькі інтерфейси для забезпечення легкості використання та доступу. Крім того, інструментарій MarkLLM підтримує автоматичну візуалізацію механізмів цих інструментаріїв, підвищуючи зрозумілість цих моделей. Інструментарій MarkLLM пропонує комплексний набір із 12 інструментів, що охоплюють три погляди, а також два автоматизовані потоки оцінки для оцінки його продуктивності.
MarkLLM: Інструментарій водяних знаків LLM
Поява великих мовних моделей, таких як LLaMA, GPT-4, ChatGPT тощо, суттєво просунула можливість моделей AI виконувати конкретні завдання, включаючи творче письмо, розуміння змісту, формування інформації та багато іншого. Однак разом з видатними перевагами великих мовних моделей виникли певні ризики, включаючи академічне паперове привидіння, фальшиві новини та зображення, згенеровані LLM, та індивідуальну імперсонацію, щоб назвати кілька. Ураховуючи ризики, пов’язані з цими питаннями, важливо розробити надійні методи, здатні розрізняти текст, згенерований LLM, і людський контент, що є основним вимогами для забезпечення автентичності цифрового спілкування та запобігання поширення дезінформації. За останні кілька років водяні знаки LLM були рекомендовані як одна з перспективних рішень для розрізнення тексту, згенерованого LLM, і людського контенту, і шляхом впровадження особливих ознак під час процесу генерації тексту вивід LLM можна унікально ідентифікувати за допомогою спеціально розроблених детекторів.
Для подолання поточної прогалини інструментарій MarkLLM намагається зробити наступні внески. MarkLLM пропонує послідовні та користувальницькі інтерфейси для завантаження алгоритмів, генерації водяного знаку тексту, проведення процесів виявлення та збору даних для візуалізації. Він забезпечує спеціальні рішення для візуалізації для обох основних сімейств алгоритмів водяних знаків, дозволяючи користувачам бачити, як різні алгоритми працюють під різними конфігураціями з реальними прикладами. Інструментарій включає комплексний модуль оцінки з 12 інструментами, що охоплюють виявність, стійкість та вплив на якість тексту. Крім того, він пропонує два типи автоматизованих потоків оцінки, що підтримують користувальницьке налаштування наборів даних, моделей, метрик оцінки та атак, забезпечуючи гнучкі та всебічні оцінки.
Було запропоновано багато алгоритмів водяних знаків, але їх унікальні підходи до реалізації часто віддають перевагу конкретним вимогам над уніфікацією, що призводить до кількох проблем
- Відсутність уніфікації у проектуванні класів: Це вимагає значних зусиль для оптимізації або розширення існуючих методів через недостатньо уніфіковані проекти класів.
- Відсутність уніфікації у верхніх інтерфейсах виклику: Несумісні інтерфейси роблять пакетну обробку та реплікацію різних алгоритмів незручними та трудомісткими.
- Проблеми зі стандартами коду: Виклики включають необхідність зміни налаштувань у декількох сегментах коду та несумісної документації, що ускладнює налаштування та ефективне використання. Жорсткі значення та несумісне оброблення помилок ще більше ускладнюють адаптацію та зусилля з відладкою.
Для вирішення цих проблем наш інструментарій пропонує уніфікований інструментарій реалізації, який дозволяє зручно викликати різні алгоритми сучасного рівня під гнучкими конфігураціями. Крім того, наш ретельно спроектований класовий механізм відкриває шлях для майбутніх розширень.
Через розподільний дизайн інструментарію для розробників легко додати додаткові верхні інтерфейси до будь-якого конкретного класу алгоритму водяного знаку без турботи про вплив на інші алгоритми.
MarkLLM: Архітектура та методологія
Техніки водяних знаків LLM переважно діляться на дві категорії: сімейство KGW і сімейство Christ. Сімейство KGW змінює логіти, згенеровані LLM, для створення водяного знаку, категоризуючи словниковий запас на зелений список і червоний список на основі попереднього токену. Зміна відбувається до логітів токенів зеленого списку під час генерації тексту, надаючи перевагу цим токенам у згенерованому тексті. Потім обчислюється статистичний показник з пропорції зелених слів, і встановлюється поріг для розрізнення між водяним знаком і не водяним знаком. Покращення методу KGW включають покращення розбиття списку, кращу маніпуляцію логітами, збільшену місткість інформації водяного знаку, стійкість до атак на видалення водяного знаку та можливість публічного виявлення водяного знаку.
Натомість сімейство Christ змінює процес вибірки під час генерації тексту LLM, впроваджуючи водяний знак шляхом зміни вибору токенів. Обидва сімейства водяних знаків спрямовані на балансування виявності водяного знаку з якістю тексту, адресуючи такі проблеми, як стійкість у різних умовах ентропії, збільшення місткості інформації водяного знаку та захист від спроб видалення. Останні дослідження зосередилися на вдосконаленні розбиття списку та маніпуляції логітами, підвищенні місткості інформації водяного знаку, розробці методів захисту від видалення водяного знаку та забезпечення публічного виявлення. В кінцевому підсумку, водяні знаки LLM є важливими для етичного та відповідального використання великих мовних моделей, забезпечуючи метод для відстеження та верифікації тексту, згенерованого LLM. Сімейства KGW і Christ пропонують два різні підходи, кожен з яких має свої унікальні сильні сторони та застосування, які постійно еволюціонують завдяки тривалим дослідженням та інноваціям.
Автоматична комплексна оцінка
Оцінка алгоритму водяного знаку LLM – це складне завдання. По-перше, це вимагає розгляду різних аспектів, включаючи виявність водяного знаку, стійкість проти підробок та вплив на якість тексту. По-друге, оцінки з кожної перспективи можуть вимагати різних метрик, сценаріїв атак та завдань. Крім того, проведення оцінки зазвичай включає кілька кроків, таких як вибір моделі та набору даних, генерація тексту з водяним знаком, постобробка, виявлення водяного знаку, підробка тексту та обчислення метрик. Для забезпечення зручної та всебічної оцінки алгоритмів водяних знаків LLM інструментарій MarkLLM пропонує дванадцять користувальницьких інструментів, включаючи різні калькулятори метрик та атакувальників, які охоплюють три зазначені перспективи оцінки. Крім того, MarkLLM пропонує два типи автоматизованих демонстраційних потоків, чий модуль можна налаштувати та зібрати гнучко, дозволяючи легко конфігурувати та використовувати.
Для аспекту виявності більшість алгоритмів водяних знаків в кінцевому підсумку вимагають вказівки порогу для розрізнення між текстом з водяним знаком і без нього. Ми пропонуємо базовий калькулятор успішності за допомогою фіксованого порогу. Крім того, для мінімізації впливу вибору порогу на виявність пропонуємо калькулятор, який підтримує динамічний вибір порогу. Цей інструмент може визначити поріг, який забезпечує найкращий показник F1 або вибрати поріг на основі зазначеної користувачем цілової швидкості помилкової позитивності (FPR).
Для аспекту стійкості MarkLLM пропонує три атаки на рівні слів: випадкове видалення слів у зазначеному співвідношенні, випадкова заміна синонімами за допомогою WordNet як набору синонімів та контекстно-залежна заміна синонімами з використанням BERT як моделі вкладення. Крім того, пропонуються дві атаки на рівні документів: парафразування контексту через OpenAI API або модель Dipper. Для аспекту якості тексту MarkLLM пропонує два прямі інструменти аналізу: калькулятор перплексії для оцінки плавності та калькулятор різноманітності для оцінки змінності текстів. Для аналізу впливу водяного знаку на корисність тексту в конкретних завданнях нижнього рівня пропонується калькулятор BLEU для завдань машинного перекладу та суддя про проходження/не-проходження для завдань генерації коду. Крім того, враховуючи поточні методи порівняння якості тексту з водяним знаком та без нього, які включають використання сильнішої LLM для судження, MarkLLM також пропонує дискримінатор GPT, який використовує GPT-4 для порівняння якості тексту.
Потоки оцінки
Для забезпечення автоматизованої оцінки алгоритмів водяних знаків LLM інструментарій MarkLLM пропонує два потоки оцінки: один для оцінки виявності водяного знаку з атаками та без них, і інший для аналізу впливу цих алгоритмів на якість тексту. Слідуючи цьому процесу, ми реалізували два потоки: WMDetect3 та UWMDetect4. Основна відмінність між ними полягає в фазі генерації тексту. Перший вимагає використання методу generate_watermarked_text з алгоритму водяного знаку, тоді як другий залежить від параметра text_source для визначення того, чи потрібно безпосередньо отримувати природній текст з набору даних чи викликати метод generate_unwatermarked_text.
Для оцінки впливу водяного знаку на якість тексту генеруються пари текстів з водяним знаком та без нього. Тексти, разом з іншими необхідними вхідними даними, потім обробляються та подаються до призначеного аналізатора якості тексту для отримання детального аналізу та порівняльних результатів. Слідуючи цьому процесу, ми реалізували три потоки для різних сценаріїв оцінки:
- DirectQual.5: Цей потік спеціально розроблений для аналізу якості тексту шляхом прямого порівняння характеристик текстів з водяним знаком та без нього. Він оцінює метрики, такі як перплексія (PPL) та логарифмічна різноманітність, без потреби у зовнішніх текстах- посиланнях.
- RefQual.6: Цей потік оцінює якість тексту шляхом порівняння текстів з водяним знаком та без нього з спільним текстом-посиланням. Він вимірює ступінь схожості або відхилення від тексту-посилання, що робить його ідеальним для сценаріїв, які вимагають конкретних завдань нижнього рівня для оцінки якості тексту, таких як машинний переклад та генерація коду.
- ExDisQual.7: Цей потік використовує зовнішній суддя, такий як GPT-4 (OpenAI, 2023), для оцінки якості текстів з водяним знаком та без нього. Дискримінатор оцінює тексти на основі зазначених користувачем описів завдань, визначаючи будь-яке потенційне погіршення або збереження якості через водяний знак. Цей метод особливо цінний, коли потрібен просунутий, AI-оснований аналіз тонких ефектів водяного знаку.
MarkLLM: Експерименти та результати
Для оцінки своєї продуктивності інструментарій MarkLLM проводить оцінки дев’яти різних алгоритмів та оцінює їх вплив, стійкість та виявність на якість тексту.

Вищезазначена таблиця містить результати оцінки виявності дев’яти алгоритмів, підтримуваних у MarkLLM. Динамічний вибір порогу використовується для оцінки виявності водяного знаку, з трьома налаштуваннями: під ціловою швидкістю помилкової позитивності (FPR) 10%, під ціловою швидкістю помилкової позитивності (FPR) 1% та під умовами для оптимальної продуктивності F1. Генеруються 200 текстів з водяним знаком, тоді як 200 текстів без водяного знаку служать негативними прикладами. Ми забезпечуємо показники TPR та F1-score під динамічним вибором порогу для 10% та 1% FPR, поряд з TPR, TNR, FPR, FNR, P, R, F1, ACC при оптимальній продуктивності. Наступна таблиця містить результати оцінки стійкості дев’яти алгоритмів, підтримуваних у MarkLLM. Для кожної атаки генеруються 200 текстів з водяним знаком, які потім піддаються підробці, разом з додатковими 200 текстами без водяного знаку, які служать негативними прикладами. Ми повідомляємо показники TPR та F1-score при оптимальній продуктивності під кожної умови.

Фінальні думки
У цій статті ми говорили про MarkLLM, відкритий інструментарій для водяних знаків, який пропонує розширений та уніфікований інструментарій для впровадження алгоритмів водяних знаків LLM, забезпечуючи користувальницькі інтерфейси для забезпечення легкості використання та доступу. Крім того, інструментарій MarkLLM підтримує автоматичну візуалізацію механізмів цих інструментаріїв, підвищуючи зрозумілість цих моделей. Інструментарій MarkLLM пропонує комплексний набір із 12 інструментів, що охоплюють три погляди, а також два автоматизовані потоки оцінки для оцінки його продуктивності.












