Взгляд Anderson
AI-генерируемое письмо никогда не “устает” и, таким образом, обнаруживает себя

Стиль чат-ботов AI, подобных ChatGPT, выдает себя увеличением последовательности, в то время как человеческое письмо остается непредсказуемым на протяжении всего текста.
Ограниченное окно контекста большинства потребительских моделей Large Language Models (LLM) является одним из факторов, которые могут заставить их забыть или неправильно вспомнить ранние части разговоров пользователей – ошибки воспоминания, которые могут постепенно превратить вывод в полный бред – или, что хуже, обманчиво связный текст, содержащий тонкие ошибки.
Поскольку эти обстоятельства приводят к галлюцинациям, и поскольку галлюцинации все еще являются главным препятствием для полного продвижения AI на рынок, значительные исследовательские усилия были направлены на создание генеративных систем AI, которые могут создавать более длинные, но более последовательные отрывки текста.
Фактически, прогресс идет так быстро, что распознавание контента, сгенерированного AI (т. е. контента, сгенерированного исключительно AI, с минимальным или нулевым человеческим послеобслуживанием), считается растущей проблемой.
Раскрытие филибастера AI
Тем не менее, недавние эмпирические исследования утверждают, что чем больше вывода производят генераторы текста AI в одном проходе, тем легче определить, написан ли этот текст человеком или нет; но общепринятое мнение в отношении этого якоря обнаружения предполагает, что AI можно различить, потому что что бы это ни было, что делает AI по-другому, чем люди, оно получает шанс сделать более часто в более длинных отрывках.
Не делается никаких предположений о распределении этих “откровений” в тексте самом по себе.
Чтобы бросить вызов этому и расширить проблему, интересное недавнее исследовательское исследование из Китая предлагает новый метод различения нового поколения генераторов контента, сгенерированного AI, от реальных человеческих авторов. Исследователи, стоящие за этой работой, утверждают, что токен-за-токеном характер, которым генерируется текст AI, означает, что он становится более последовательным с увеличением длины, тогда как собственные причуды людей не уменьшаются с длиной.
Таким образом, авторы предлагают, что их прозрение предлагает потенциальную новую метрику для систем обнаружения текста AI*:
‘Токены, сгенерированные AI, в последней части текста демонстрируют меньшие и более стабильные колебания вероятности, поскольку прогнозы модели становятся все более последовательными по мере накопления контекста.
‘Мы называем этот шаблон Снижение волатильности на поздней стадии. Этот феномен отражает присущее поведение автoreгрессивной генерации: по мере накопления контекста распределение прогнозов модели сужается, что приводит к уменьшению изменчивости в статистике токенов.
‘Написание человека, с другой стороны, продолжает вводить неожиданные лексические выборы и поддерживает более высокую волатильность на протяжении всего текста.’
Чтобы уловить эту странную “гладкость”, которая накапливается в тексте AI к концу, исследователи определяют два простых признака: первый измеряет, насколько статистическое поведение письма “прыгает” между токенами; второй проверяет, насколько стабильно все остается в коротких отрывках текста.
Оба вычисляются только из второй половины вывода, где AI становится заметно более регулярным, а человеческое письмо не становится.
Авторы отмечают, что хотя эти сигналы работают хорошо самостоятельно, они еще более эффективны, когда объединены с старыми методами обнаружения, которые сканируют более широкие закономерности.
Новая работа предлагает методологию для тестирования “AI-образности” через анализ временных признаков второй половины, не требующий дополнительной тренировки или настройки, или привилегированного доступа к модели.
Новая работа озаглавлена Когда AI успокаивается: Поздняя стабильность как сигнатура обнаружения текста, сгенерированного AI и исходит от четырех авторов Университета Уэстлейка в Ханчжоу.
Метод
Чтобы уловить растущую гладкость в тексте, сгенерированном AI, исследователи разработали два измерения, которые фокусируются только на второй половине отрывка.
Они полагаются на баллы лог-пробабельности от стандартной языковой модели и не требуют настройки, повторной тренировки или дополнительных образцов:
Первый показатель, называемый Дисперсия производной (DD), отслеживает, насколько резко меняется уверенность модели от одного слова к другому.
Второй показатель, Местная волатильность (LV), анализирует, насколько “прыгает” уверенность модели в небольшом окне текста.
Оба показателя вычисляются только из второй половины текста, где AI становится более регулярным, а человеческое письмо не становится.
Как только снова, оба показателя затем объединяются в единую величину, называемую Временной показатель обнаружения стабильности (TSD) – который склонен увеличиваться, поскольку письмо становится “гладким” (и, следовательно, более вероятно сгенерированным AI).
Простой порог затем используется для определения того, вероятно ли, что данный отрывок написан машиной.
Данные и тесты
Авторы провели тесты на двух связанных наборах данных: EvoBench содержит 32 000 пар текста человека и AI, сгенерированных в семи семействах моделей, включая GPT-4;
Другой каркас был MAGE, который предлагает 30 000 тестовых пар в восьми семействах моделей, включая (но не ограничиваясь) серию GPT от OpenAI и семейства LLaMA, OPT и FLAN-T5.
Претенденты
Новый метод был протестирован против ряда детекторов с нулевым выстрелом, использующих ту же заместительную модель.
Вероятность, Энтропия, Ранг и Лог-ранг (DetectGPT) измеряли статистику токенов на протяжении всего отрывка;
Реализация и результаты
Все методы обнаружения были запущены с использованием Llama-3-8B-Instruct в качестве общей заместительной модели, с ограниченными последовательностями входных данных до 512 токенов.
Временные признаки были извлечены только из второй половины каждого отрывка, используя скользящее окно из 20 токенов для измерения волатильности.
Площадь под кривой ROC (AUROC) была основной метрикой оценки†:
Из этих первоначальных результатов авторы заявляют:
‘Наш простой временной показатель достигает лучшей производительности среди отдельных методов, с TSD, достигающим 83,36% на EvoBench и 71,56% на MAGE, превосходя все базовые показатели, включая Fast-DetectGPT.
Вывод
Одним из аспектов, на который не было обращено прямого внимания в новой работе, является тенденция человеческих писателей проходить свою работу через черновики и различные слои надзора – иногда включая внешний надзор, такой как вклад редакторов и корректоров, а также возможные предложенные изменения со стороны юридических отделов, в зависимости от контекста.
Множество заинтересованных сторон, участвующих в документах, таких как хорошо спрятанная газетная статья, могут практически уничтожить причуды, на которые нацелен новый предложенный метод, и по сути представляют собой своего рода “аналоговую версию” процесса черновика, с помощью AI.
Кроме того, системы, изучаемые в работе, сами тренировались на таких работах, и – поскольку данные для тренировки все чаще ранжируются по авторитету во время тренировки – наиболее “взвешенные” или уважаемые источники могут быть наименее “естественными”; по крайней мере, по сравнению с кем-то, быстро составляющим неформальное письмо коллеге, а не собирающим годовой отчет для годового собрания акционеров.
Дополнительным и противоположным соображением является то, что текстовый контент, к которому внесли свой вклад несколько человек, также может быть среди наиболее фрагментированных, ошибочных и повторяющихся произведений, чтобы войти в набор данных, поскольку они часто не будут иметь пользу от единого унифицирующего голоса, оставляя кусочную природу их разработки очевидной в прозе.
* Оригинальный стиль текста авторов, воспроизведенный из работы; не мои акценты.
† Авторы заявляют ‘первичный’, не перечисляя никаких других метрик оценки.
Опубликовано в понедельник, 26 января 2026 года












