Погляд Anderson

Персоналізовані мовні моделі легко створити – і важче виявити

mm
Додайте Unite.AI до бажаних джерел у Google
A robot hand at large in an exam room - Flux, Krita (AI GENERATED).

Відкриті клони ChatGPT можна налаштувати масштабно та з обмеженою або відсутньою експертизою, що полегшує створення “приватних” мовних моделей, які уникають виявлення. Більшість інструментів не можуть відстежувати, звідки походять ці моделі чи для чого їх тренували, що дозволяє студентам та іншим користувачам генерувати текст за допомогою штучного інтелекту без викриття; проте новий метод стверджує, що може ідентифікувати ці приховані варіанти, виявляючи спільні “родинні ознаки” у виводах моделей.

 

За даними нового дослідження з Канади, користувацькі налаштовані моделі штучного інтелекту, подібні до ChatGPT, здатні створювати контент у соціальних мережах, який дуже схожий на людську писемну мову, і може обманути алгоритми виявлення та людей.

У статті зазначається:

‘Реально мотивований нападник, ймовірно, налаштує модель для свого конкретного стилю та використання, оскільки це дешево та легко зробити. З мінімальними зусиллями, часом та грошима ми створили налаштовані генератори, які здатні створювати більш реалістичні твіти у соціальних мережах, як за лінгвістичними ознаками, так і за точністю виявлення, і підтвердили це за допомогою анотацій людей.’

Автори підкреслюють, що налаштовані моделі цього типу не обмежуються коротким контентом у соціальних мережах:

‘Хоча мотивовані поширенням контенту штучного інтелекту у соціальних мережах та пов’язаними з цим ризиками астротурфінгу та кампаній впливу, ми підкреслюємо, що основні результати поширюються на всі тексти доменів.

‘Дійсно, налаштування моделей для генерації контенту у конкретному стилі є загально застосовним методом, і він, ймовірно, вже використовується багатьма користувачами генеративного штучного інтелекту – що викликає питання про ефективність існуючих методів виявлення генерації штучного інтелекту у реальному світі, а не у дослідницькій лабораторії.’

Як зазначається у статті, метод створення цих індивідуалізованих мовних моделей полягає у налаштуванні, коли користувачі створюють обмежену кількість自己的 цільових даних та вводять їх у все більш доступні та дешеві онлайн-інструменти навчання.

Наприклад, популярний репозиторій Hugging Face пропонує налаштування великих мовних моделей (LLM) через спрощений інтерфейс, використовуючи систему AutoTrain Advanced, яку можна запустити за кілька доларів через онлайн-GPU або безкоштовно, якщо у користувача є достатнє апаратне забезпечення:

Різні цінові структури для діапазону GPU, доступних для системи Hugging Face AutoTrain. Джерело: https://huggingface.co/spaces/autotrain-projects/autotrain-advanced?duplicate=true

Різні цінові структури для діапазону GPU, доступних для системи Hugging Face AutoTrain. Джерело: https://huggingface.co/spaces/autotrain-projects/autotrain-advanced?duplicate=true

Інші спрощені методи та платформи включають Axolotl, Unsloth та більш потужну, але вимогливу TorchTune.

Приклад використання буде студентом, який втомився писати свої власні есе, але боїться бути викритим онлайн-інструментами виявлення штучного інтелекту, який може використовувати свої власні реальні історичні есе як тренувальні дані для налаштування ефективної відкритої моделі, наприклад, серії Mistral.

Хоча налаштування моделі зазвичай викривляє її продуктивність у бік додаткових тренувальних даних та погіршує загальну продуктивність, “персоналізовані” моделі можна використовувати для “де-АІ” все більш характерного виводу систем, таких як ChatGPT, щоб зробити його схожим на власний стиль користувача (і, для підвищення автентичності, його недоліків).

Однак можна використати виключно налаштовану модель, спеціально треновану для вузької задачі або діапазону задач, наприклад, LLM, налаштовану на курсові роботи конкретного університету. Модель такого типу матиме вузький, але глибокий погляд на цю область, ніж універсальна LLM, подібна до ChatGPT, і, ймовірно, коштуватиме менше 10-20 доларів для тренування.

Айсберг LLM

Важко сказати, якою є масштаб цього явища. Анекдотично, на різних соціальних платформах я останнім часом зустрічав багато прикладів бізнес-орієнтованого налаштування LLM – значно більше, ніж рік тому; у одному випадку компанія налаштувала мовну модель на свої власні публічні матеріали, які потім могли перетворити грубу розмову з новим клієнтом у відполірований бізнес-пост майже за один крок, на вимогу.

Модель такого типу потребує спарених даних (приклади до та після, у масштабі), тоді як створення персоналізованого “поліску” характеристик конкретного письменника – це простіша задача, подібна до переносу стилю.

Хоча це приховане заняття (навіть попри численні заголовки та академічні дослідження на цю тему), де немає цифр, той самий здоровий глузд, який привів до прийняття закону TAKE IT DOWN цього року, застосовується тут: цільова діяльність є можливою та доступною, і існує сильне розуміння, що потенційні користувачі мають високу мотивацію.

Є достатньо тертя у найспрощеніших онлайн-системах налаштування, щоб зайняття нечесним тренуванням та використанням налаштованих моделей залишалося відносно нішевим випадком – хоча, безумовно, не поза традиційною винахідливістю студентів.

PhantomHunter

Це приводить нас до основної статті, яка цікавить нас – нового підходу з Китаю, який об’єднує широкий спектр технік у єдину структуру – звану PhantomHunter – яка стверджує, що може ідентифікувати вивід налаштованих мовних моделей, який інакше пройде за оригінальну людську роботу.

Система призначена для функціонування навіть у випадку, коли конкретна налаштована модель ніколи не зустрічалася раніше, спираючись замість цього на залишкові сліди, які залишаються від оригінальної базової моделі – які автори характеризують як “родинні ознаки”, які виживають після процесу налаштування.

У тестах стаття – озаглавлена PhantomHunter: Виявлення приватно-налаштованих LLM-генерованих текстів за допомогою сімейно-обізнаного навчання – повідомляє про сильну точність виявлення, причому система перевершує оцінку GPT-4-mini з нульовим зразком у відстежуванні зразка тексту до сім’ї моделей.

Це свідчить про те, що чим більше модель налаштовується, тим більше вона розкриває про своє походження, спростовуючи припущення, що приватне налаштування завжди маскує походження моделі; натомість процес налаштування може залишити виявлений слід, який, якщо його правильно прочитати, видає гру.

У статті зазначається*:

‘Виявлення згенерованого тексту штучним інтелекту загалом відрізняє згенерований текст LLM та людський текст за допомогою двійкової класифікації. Існуючі методи або вивчають спільні тексти ознаки, спільні для LLM, за допомогою навчання представлень, або проектують розрізнювальні метрики між людським та LLM-текстами на основі внутрішніх сигналів LLM (наприклад, ймовірності токенів).

‘Для обох категорій їхні тести проводилися в основному на даних з публічно доступних LLM, припускаючи, що користувачі генерують текст, використовуючи публічні, готові сервіси.

Ми стверджуємо, що ця ситуація змінюється через недавній розвиток відкритої спільноти LLM. За допомогою платформ, таких як HuggingFace, та ефективних технік тренування LLM, таких як низькорангове адаптування (LoRA), створення налаштованих LLM з приватними наборами даних стало значно легшим, ніж раніше.

‘Наприклад, на HuggingFace існує понад 60 тисяч похідних моделей Llama. Після приватного налаштування на невідомому корпусі вивчені характеристики базових моделей можуть змінитися, а детектори генерації тексту штучним інтелекту можуть, створюючи новий ризик, коли зловмисні користувачі можуть генерувати шкідливі тексти приватно, не будучи виявленими детекторами генерації тексту штучним інтелекту.

‘Появляється новий виклик: Як виявити тексти, згенеровані приватно-налаштованими відкритими LLM?

Метод і тренування

Система PhantomHunter використовує сімейно-обізнану стратегію навчання, об’єднуючи три компоненти: екстрактор ознак, який захоплює ймовірності виводу з відомих базових моделей; контрастний енкодер, тренований для розрізнення між сім’ями; і (як описано нижче) класифікатор суміші експертів, який призначає сімейні мітки новим зразкам тексту:

Схема системи. PhantomHunter обробляє зразок тексту, спочатку витягуючи ознаки ймовірності з кількох базових моделей, які потім кодуються за допомогою CNN та трансформерних шарів. Він оцінює сім'ю моделі для обчислення ваг гейтингу, які керують модулем суміші експертів при передбаченні, чи є текст згенерованим LLM. Контрастна втрата застосовується під час тренування для уточнення розрізнення між сім'ями моделей. Джерело: https://arxiv.org/pdf/2506.15683

Схема системи. PhantomHunter обробляє зразок тексту, спочатку витягуючи ознаки ймовірності з кількох базових моделей, які потім кодуються за допомогою CNN та трансформерних шарів. Він оцінює сім’ю моделі для обчислення ваг гейтингу, які керують модулем суміші експертів при передбаченні, чи є текст згенерованим LLM. Контрастна втрата застосовується під час тренування для уточнення розрізнення між сім’ями моделей. Джерело: https://arxiv.org/pdf/2506.15683

PhantomHunter працює, пропускаючи текст через кілька відомих базових моделей та реєструючи, наскільки ймовірно, що кожна з них вважає наступне слово, на кожному кроці. Ці закономірності потім подаються у нейронну мережу, яка вивчає розрізнювальні характеристики кожної сім’ї моделей.

Під час тренування система порівнює тексти з однієї сім’ї та вчиться групувати їх разом, тоді як розрізняє ті, що походять з різних сімей, допомагаючи ідентифікувати приховані зв’язки між налаштованими моделями та їхніми базовими моделями.

MOE

Для визначення того, чи написаний текст людиною чи штучним інтелекту, PhantomHunter використовує суміш експертів, у якій кожен “експерт” налаштовується для виявлення тексту з конкретної сім’ї моделей.

Як тільки система вгадує, з якої сім’ї текст, ймовірно, походять, вона використовує цю гіпотезу для визначення того, яку вагу надати кожному експертному висновку. Ці зважені висновки потім об’єднуються для прийняття остаточного рішення: штучний інтелект чи людина.

Тренування системи включає кілька цілей: навчання для розпізнавання сімей моделей; навчання для розрізнення тексту штучного інтелекту та людського тексту; і навчання для розрізнення різних сімей за допомогою контрастного навчання – цілі, які балансуються під час тренування за допомогою настраїваних параметрів.

Фокусуючись на закономірностях, спільних для кожної сім’ї, а не на особливостях окремих моделей, PhantomHunter, як вважається, повинен бути здатний виявити навіть налаштовані моделі, яких він ніколи не бачив раніше.

Дані та тести

Для розробки даних для тестів автори сконцентрувалися на двох найпоширеніших академічних сценаріях: написанні та відповідях на питання. Для написання вони зібрали 69 297 резюме з академічного архіву Arxiv, розділених за основними доменами. Для питань та відповідей було зібрано 2 062 пари з набору даних HC3 за трьома предметами: ELI5; фінанси; і медицина:

Перелік джерел даних та їх кількості, зібраних для дослідження.

Перелік джерел даних та їх кількості, зібраних для дослідження.

Всього було треновано дванадцять моделей для тесту. Три базові моделі були LLaMA-2 7B-Chat; Mistral 7B-Instruct-v0.1; і Gemma 7B-it), з яких було створено дев’ять налаштованих варіантів, кожен з яких був адаптований для імітації різних доменів або стилів авторів, за допомогою домен-специфічних даних:

Статистика набору даних для оцінки, де 'FT Домен' позначає домен, використаний під час налаштування, а 'базовий' вказує на відсутність налаштування.

Статистика набору даних для оцінки, де ‘FT Домен’ позначає домен, використаний під час налаштування, а ‘базовий’ вказує на відсутність налаштування.

Всього, отже, три базові моделі були налаштовані за допомогою як повного, так і LoRA технік налаштування через три різні домени в кожному з двох сценаріїв використання: академічне написання резюме та відповіді на питання. Для реальних завдань виявлення моделі, налаштовані на дані з комп’ютерних наук, були вилучені з тестів написання, тоді як моделі, налаштовані на дані з фінансів, були вилучені з оцінювань питань-відповідей.

Рівні.frameworks, вибрані для порівняння, були RoBERTa; T5-Sentinel; SeqXGPT; DNA-GPT; DetectGPT; Fast-DetectGPT; і DeTeCtive.

PhantomHunter був тренований за допомогою двох типів нейронних мережевих шарів: трьох конвольційних шарів з макс-пулінгом для захоплення місцевих текстових закономірностей, і двох трансформерних шарів з чотирма головками уваги кожна для моделювання довгострокових відносин.

Для контрастного навчання, яке спонукає систему розрізняти різні сім’ї моделей, параметр температури був встановлений на 0,07.

Тренувальна мета поєднувала три термини втрат: L1 (для класифікації сімей) і L2 (для двійкової детекції), кожен зі вагою 1,0, і L3 (для контрастного навчання), зі вагою 0,5.

Модель була оптимізована за допомогою Adam з швидкістю навчання 2e-5 та розміром 배чи 32. Тренування відбувалося протягом десяти повних епох, а найкращу контрольну точку вибрали за допомогою валідаційного набору. Всі експерименти проводилися на сервері з чотирма GPU NVIDIA A100.

Використані метрики включали F1-оцінку для кожного піднабору тестів, разом з справжнім позитивним рейтингом для порівняння з комерційними детекторами.

F1-оцінки для виявлення тексту з невидимих налаштованих мовних моделей. Дві найкращі результати в кожній категорії виділені та підкреслені. 'BFE' позначає витяг ознак ймовірності базової моделі, 'CL' – контрастне навчання, а 'MoE' – модуль суміші експертів.

F1-оцінки для виявлення тексту з невидимих налаштованих мовних моделей. Дві найкращі результати в кожній категорії виділені та підкреслені. ‘BFE’ позначає витяг ознак ймовірності базової моделі, ‘CL’ – контрастне навчання, а ‘MoE’ – модуль суміші експертів.

Результати початкового тесту, візуалізовані у таблиці вище, показують, що PhantomHunter перевершив усі базові системи, зберігаючи F1-оцінки вище 90% для як людського, так і згенерованого машинами тексту, навіть при оцінці виводу з налаштованих моделей, виключених з тренування.

Автори коментують:

‘З повним налаштуванням PhantomHunter покращує MacF1-оцінку над найкращим базовим результатом на 3,65% та 2,96% на обох наборах даних відповідно; і з налаштуванням LoRA покращення складають 2,01% та 6,09% відповідно.

‘Результат демонструє потужну детектуючу здатність PhantomHunter для текстів, згенерованих невидимими налаштованими LLM.’

Вивчалися абляційні дослідження для оцінки ролі кожного основного компонента в PhantomHunter. Коли окремі елементи були видалені, такі як екстрактор ознак, контрастний енкодер або класифікатор суміші експертів, спостерігався постійний спад точності, вказуючи на те, що архітектура залежить від координації всіх частин.

Автори також вивчили, чи може PhantomHunter узагальнювати за межами своєї тренувальної розподіленої системи, і визначили, що навіть при застосуванні до виводу з базових моделей, яких не було під час тренування, він продовжував перевершувати суперницькі методи – вказуючи на те, що сімейні підписи залишаються виявними через налаштовані варіанти.

Висновок

Один із аргументів на користь користувацьких тренованих генеративних мовних моделей полягає в тому, що ці налаштування зберігають індивідуальний колорит і особливості автора в умовах, коли генеричні, SEO-орієнтовані вислови чат-ботів штучного інтелекту загрожують зробити будь-яку мову, де штучний інтелект стає значним або домінуючим внеском, генеричною.

З девальвацією коледжського есе та студентами, які зараз скрінкастують величезні сесії написання, щоб довести, що вони не використовували штучний інтелект у своїх роботах, більше викладачів поза Європою (де усні іспити нормалізовані) розглядають фейс-ту-фейс іспити як альтернативу наданим текстам. Нещодавно було запропоновано повернення до рукописних робіт.

Аргументується, що обидва ці рішення є кращими, ніж те, що загрожує стати LLM-основною повторенням гонки глибоких фейків; хоча вони відбуваються за рахунок людських зусиль та уваги, яких зараз технологічна культура намагається автоматизувати.

 

Будь ласка, перегляньте розділ після основних результатів у джерельній статті для подробиць щодо цього.

* Моя конвертація внутрішніх посилань авторів у гіперпосилання. Акцентування тексту авторів, а не моє.

Перше опубліковане четвер, 19 червня 2025

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai