Взгляд Anderson
Персонализированные языковые модели легко создать – и труднее обнаружить

Открытые клонированные версии ChatGPT можно донастроить в крупном масштабе и с ограниченной или отсутствующей экспертизой, что облегчает создание “частных” языковых моделей, которые избегают обнаружения. Большинство инструментов не могут отслеживать, откуда эти модели берутся или для чего они были обучены, что позволяет студентам и другим пользователям генерировать текст с помощью ИИ, не будучи обнаруженными; но новый метод утверждает, что он может выявить эти скрытые варианты, обнаруживая общие “семейные черты” в выходных данных моделей.
Согласно новому исследованию из Канады, пользовательские модели чата ИИ, аналогичные ChatGPT, способны производить контент в социальных сетях, который очень похож на человеческое письмо и может обмануть алгоритмы обнаружения и людей.
В статье говорится:
‘Реалистично мотивированный атакующий, скорее всего, донастроит модель для своего конкретного стиля и случая использования, поскольку это дешево и легко сделать. С минимальными усилиями, временем и деньгами мы создали донастроенные генераторы, которые способны производить гораздо более реалистичные твиты в социальных сетях, основанные на лингвистических особенностях и точности обнаружения, и подтвержденные аннотациями человека.’
Авторы подчеркивают, что такие пользовательские модели не ограничиваются контентом коротких сообщений в социальных сетях:
‘Хотя мы были мотивированы распространением контента ИИ в социальных сетях и связанными с этим рисками астротурфинга и кампаний влияния, мы подчеркиваем, что основные выводы распространяются на все области текста.
‘Действительно, донастройка моделей для генерации контента в определенном стиле является общим методом, который, вероятно, уже используется многими пользователями генеративных моделей ИИ – что вызывает вопросы о том, насколько эффективны существующие методы обнаружения ИИ в реальном мире, а не в исследовательской лаборатории.’
Как отмечает статья, метод, используемый для создания этих индивидуальных языковых моделей, заключается в донастройке, когда пользователи курируют ограниченное количество своих собственных целевых данных и вводят их в все более простые и дешевые онлайн-инструменты обучения.
Например, популярный репозиторий Hugging Face предлагает донастройку крупномасштабных языковых моделей через упрощенный интерфейс, используя свою систему AutoTrain Advanced, которую можно запустить за несколько долларов через онлайн-GPU или бесплатно, если у пользователя есть подходящее оборудование:

Различные структуры ценообразования для диапазона доступных GPU для системы Hugging Face AutoTrain. Источник: https://huggingface.co/spaces/autotrain-projects/autotrain-advanced?duplicate=true
Другие упрощенные методы и платформы включают Axolotl, Unsloth и более мощную, но требовательную TorchTune.
Примером использования может быть студент, который устал писать свои собственные эссе, но боится быть пойманным онлайн-инструментами обнаружения ИИ, который может использовать свои собственные реальные исторические эссе в качестве обучающих данных для донастройки очень эффективной открытой модели, такой как Mistral серии.
Хотя донастройка модели склонна смещать ее производительность в сторону дополнительных обучающих данных и ухудшать общую производительность, “персонализированные” модели можно использовать для “де-ИИ” все более характерного выхода систем, таких как ChatGPT, так, чтобы он отражал собственный исторический стиль пользователя (и, для повышения аутентичности, его недостатки).
Однако можно использовать исключительно донастроенную модель, специально обученную для узкого задания или диапазона заданий, такого как крупномасштабная языковая модель, донастроенная на курсовой работе конкретного университетского модуля. Модель такого рода имела бы узкий, но гораздо более глубокий взгляд на эту область, чем универсальная крупномасштабная языковая модель, такая как ChatGPT, и, вероятно, стоила бы менее 10-20 долларов для обучения.
Айсберг крупномасштабных языковых моделей
Трудно сказать, какой масштаб этой практики. Анекдотически, на различных социальных платформах я в последнее время встречал много бизнес-ориентированных примеров донастройки крупномасштабных языковых моделей – определенно больше, чем год назад; в одном случае компания донастроила языковую модель на своих собственных опубликованных материалах, которые затем смогли преобразовать неуклюжий звонок с новым клиентом в отполированный бизнес-пост几乎 за один проход, по требованию.
Модель такого рода требует парных данных (примеры до и после, в крупном масштабе), тогда как создание персонализированного “глосса” характеристик конкретного автора – это более простая задача, более похожая на перенос стиля.
Хотя это секретное занятие (несмотря на многочисленные заголовков и академических исследований на эту тему), где цифры недоступны, тот же здравый смысл, который привел к принятию закона TAKE IT DOWN в этом году, применим и здесь: целевая деятельность возможна и доступна, и существует сильное понимание, что потенциальные пользователи очень мотивированы.
Есть достаточно трения в самых “упрощенных” онлайн-системах донастройки, чтобы практика несовестного обучения и использования донастроенных моделей оставалась относительно нишевой на данный момент – хотя определенно не за пределами традиционной изобретательности студентов.
PhantomHunter
Это приводит нас к основной статье, представляющей новый подход из Китая, который объединяет широкий спектр методов в единую структуру – называемую PhantomHunter – которая утверждает, что может выявить выход донастроенных языковых моделей, который в противном случае будет принят за оригинальную человеческую работу.
Система предназначена для работы даже тогда, когда конкретная донастроенная модель никогда не встречалась раньше, полагаясь вместо этого на остаточные следы, оставленные исходной базовой моделью – которые авторы характеризуют как “семейные черты”, которые выживают в процессе донастройки.
В испытаниях статья – озаглавленная PhantomHunter: Обнаружение незримо настроенных LLM-генерируемого текста через обучение, осведомленное о семье – сообщает о сильной точности обнаружения, причем система превосходит оценку GPT-4-mini с нулевым выстрелом† при отслеживании образца текста до его модели семьи.
Это предполагает, что чем больше модель донастраивается, тем больше она раскрывает о своем происхождении, противореча предположению, что частная донастройка всегда маскирует происхождение модели; вместо этого процесс донастройки может оставить обнаруживаемый след, который, если его правильно прочитать, выдает игру – по крайней мере, пока не появятся дальнейшие достижения, которые, кажется, появляются каждую неделю.
Статья гласит*:
‘Обнаружение сгенерированного текста ИИ обычно различает LLM-генерируемый и написанный человеком текст через бинарную классификацию. Существующие методы либо выучивают общие текстовые особенности, общие для LLM, с помощью обучения представлений, либо проектируют различимые метрики между текстом человека и LLM на основе внутренних сигналов LLM (например, вероятности токенов).
‘Для обеих категорий их испытания были в основном проведены на данных из публично доступных LLM, предполагая, что пользователи генерируют текст, используя публичные, готовые сервисы.
‘Мы утверждаем, что эта ситуация меняется из-за недавнего развития сообщества открытых LLM. С помощью платформ, таких как HuggingFace, и эффективных методов обучения LLM, таких как низкоранговая адаптация (LoRA), построение донастроенных LLM с настраиваемыми частными наборами данных стало намного проще, чем раньше.
‘Например, на HuggingFace было более 60 000 производных моделей Llama. После частной донастройки на неизвестном корпусе изученные характеристики базовых моделей могли измениться, и детекторы LLMGT не смогли бы [обнаружить], формируя новый риск, что злонамеренные пользователи могут генерировать вредоносные тексты частным образом, не будучи обнаруженными детекторами LLMGT.
‘Возникает новая задача: Как обнаружить текст, сгенерированный частным настроенным открытым LLM?‘
Метод и обучение
Система PhantomHunter использует семейно-осведомленную стратегию обучения, объединяющую три компонента: экстрактор особенностей, захватывающий выходные вероятности из известных базовых моделей; контрастный энкодер, обученный для различения между семьями; и (как подробно описано ниже) классификатор смеси экспертов, который присваивает метки семьи новым образцам текста:

Схема системы. PhantomHunter обрабатывает образец текста, извлекая сначала вероятностные особенности из нескольких базовых моделей, которые затем кодируются с помощью слоев CNN и трансформера. Источник: https://arxiv.org/pdf/2506.15683
PhantomHunter работает, пропуская кусок текста через несколько известных базовых моделей и записывая, насколько вероятно, что каждая из них думает, что следующее слово будет на каждом шаге. Эти закономерности затем вводятся в нейронную сеть, которая учится различать характеристики каждой модели семьи.
Во время обучения система сравнивает тексты из одной семьи и учится группировать их вместе, различая их от тех, которые из разных семей, что помогает выявить скрытые связи между донастроенными моделями и их базовыми моделями.
MOE
Чтобы решить, написан ли кусок текста человеком или ИИ, PhantomHunter использует систему смеси экспертов, где каждый “эксперт” настроен на обнаружение текста из конкретной семьи моделей.
Как только система угадывает, из какой семьи текст, скорее всего, произошел, она использует это предположение, чтобы решить, сколько веса придать каждому мнению эксперта. Эти взвешенные мнения затем объединяются для принятия окончательного решения: ИИ или человек.
Обучение системы включает несколько целей: обучение распознаванию семьи моделей; обучение различению текста ИИ и текста человека; и обучение разделению разных семей с помощью контрастного обучения – цели, которые балансируются во время обучения через настраиваемые параметры.
Сосредоточившись на закономерностях, общих для каждой семьи, а не на особенностях отдельных моделей, PhantomHunter, по теории, должен быть в состоянии обнаружить даже донастроенные модели, которые он никогда не видел раньше.
Данные и испытания
Чтобы разработать данные для испытаний, авторы сосредоточились на двух наиболее распространенных академических сценариях: написании и ответах на вопросы. Для написания они собрали 69 297 резюме из архива Arxiv, разделенных на основные области. Для вопросов и ответов было собрано 2 062 пары из набора данных HC3 по трем предметам: ELI5; финансы; и медицина:

Список источников данных и их количества, собранных для исследования.
Всего было обучено двенадцать моделей для испытаний. Три базовые модели были LLaMA-2 7B-Chat; Mistral 7B-Instruct-v0.1; и Gemma 7B-it), из которых были получены девять донастроенных вариантов, каждый из которых был адаптирован для имитации разных областей или стилей авторов, используя данные, специфичные для области:

Статистика набора данных оценки, где ‘FT Domain’ относится к области, использованной во время донастройки, и ‘base’ указывает на отсутствие донастройки.
Всего, таким образом, три базовые модели были донастроены с помощью как полных параметров, так и методов LoRA в трех различных областях в каждом из двух сценариев использования: академическое написание резюме и ответы на вопросы. Чтобы отразить реальные проблемы обнаружения, модели, донастроенные на данных компьютерных наук, были исключены из испытаний написания, а модели, донастроенные на данных финансов, были исключены из оценок вопросов и ответов.
Выбранные соперничающие системы были RoBERTa; T5-Sentinel; SeqXGPT; DNA-GPT; DetectGPT; Fast-DetectGPT; и DeTeCtive.
PhantomHunter был обучен с помощью двух типов слоев нейронной сети: трех свёрточных слоев с макс-пулингом для захвата местных закономерностей текста и двух трансформерных слоев с четырьмя головами внимания каждая для моделирования более длинных отношений.
Для контрастного обучения, которое побуждает систему различать разные семьи моделей, параметр температуры был установлен на 0,07.
Цель обучения объединила три термина потерь: L1 (для классификации семьи) и L2 (для бинарного обнаружения), каждый взвешенный на 1,0, и L3 (для контрастного обучения), взвешенный на 0,5.
Модель была оптимизирована с помощью Adam с скоростью обучения 2e-5 и размером партии 32. Обучение проводилось в течение десяти полных эпох, с лучшей контрольной точкой, выбранной с помощью набора валидации. Все эксперименты проводились на сервере с четырьмя GPU NVIDIA A100.
Использованные метрики были балансированным счетом F1 для каждого подмножества испытаний, вместе с истинной положительной скоростью для сравнения с коммерческими детекторами.

Балансированные счета F1 для обнаружения текста из незримо настроенных языковых моделей. Два лучших результата в каждой категории выделены жирным шрифтом и подчеркнуты.
Результаты начального испытания, визуализированные в таблице выше, показывают, что PhantomHunter превосходит все базовые системы, сохраняя балансированные счета F1 выше девяноста процентов как для человеческого, так и для машинного текста, даже когда оценивается на выходах из донастроенных моделей, исключенных из обучения.
Авторы комментируют:
‘С полной донастройкой PhantomHunter улучшает балансированный счет F1 над лучшим базовым результатом на 3,65% и 2,96% в обоих наборах данных, соответственно; и с донастройкой LoRA улучшения составляют 2,01% и 6,09% соответственно.
‘Результат демонстрирует мощную способность обнаружения PhantomHunter для текста, сгенерированного незримо настроенными LLM.’
Исследования удаления были проведены для оценки роли каждого основного компонента в PhantomHunter. Когда были удалены отдельные элементы, такие как экстрактор особенностей, контрастный энкодер или классификатор смеси экспертов, наблюдался последовательный спад точности, указывающий на то, что архитектура зависит от координации всех частей.
Авторы также изучили, может ли PhantomHunter обобщаться за пределами своей обучающей распределения, и установили, что даже когда он применялся к выходам из базовых моделей, полностью отсутствующих во время обучения, он продолжал превосходить соперничающие методы – что предполагает, что семейственные сигнатуры остаются обнаруживаемыми через донастроенные варианты.
Вывод
Одним из аргументов в пользу пользовательских обученных генеративных языковых моделей является то, что хотя бы эти крошечные донастройки и LoRA сохраняют индивидуальный вкус и причуды автора в климате, где генерический, вдохновленный SEO стиль чат-ботов ИИ угрожает генерализировать любой язык, где ИИ становится значительным или доминирующим вкладом.
С девальвацией колледжского эссе и с тем, что студенты теперь сcreencasting огромные сессии написания, чтобы доказать, что они не использовали ИИ в своих работах, больше учителей вне Европы (где устные экзамены нормализированы) рассматривают личные экзамены в качестве альтернативы представленным текстам. Более недавно, возвращение к рукописным работам было предложено.
Возможно, оба этих решения лучше, чем то, что грозит стать повторением гонки вооружений глубоких фейков на основе ИИ; хотя они происходят за счет человеческих усилий и внимания, которые культура технологий в настоящее время стремится автоматизировать.
† Пожалуйста, посмотрите раздел в конце основного результата, в исходной статье, для подробностей об этом.
* Мое преобразование внутренних цитат авторов в гиперссылки. Подчеркивания текста авторов, а не мои.
Опубликовано впервые в четверг, 19 июня 2025 года












