Взгляд Anderson

Модели ИИ предпочитают человеческие тексты генерируемым ИИ

mm
Добавьте Unite.AI в избранные источники в Google
William Shakespeare arm-wrestling a robot. The style should not be illustration-type, nor cartoonish, but instead, photorealistic, in the style of a publicity photo for Real Steel' + variations. GPT-4o, Flux Kontext, Firefly.

Согласно новым исследованиям, ChatGPT и подобные модели теперь демонстрируют явную предвзятость в отношении текстов, которые, по их мнению, были написаны людьми, даже если это мнение ошибочно. Просто называя текст “сделанным человеком”, модели ИИ склонны ему отдавать предпочтение – и, иронично, они могут усваивать это предубеждение от нас.

 

Представления об аутентичности, происхождении и общем человеческом опыте могут сыграть более значимую роль в атаке ИИ на творческий сектор письма, чем было очевидно до сих пор: проведенные для нового исследования в Принстоне тесты показали, что ряд крупных закрытых и открытых языковых моделей, включая ChatGPT, предпочитают то, что они считают “сгенерированным человеком” текстами.

Даже когда метки на образцах письма были перевернуты, и модели ИИ, и человеческие участники продолжали находить недостатки в тексте, написанном ИИ, повторяя те же критические замечания, которые они сделали, когда он был правильно помечен.

Исследователи считают, что часть причины может заключаться в том, что растущая враждебность людей по отношению к генеративному ИИ, которая, кажется, проявляется в новых и интересных событиях каждый день, может влиять на сами системы ИИ. Отмечая, насколько ИИ не любит написанное ИИ текст больше, чем люди, они заявляют*:

’13 моделей ИИ, которые мы протестировали, продемонстрировали предвзятость в 34,3 процентных пункта по сравнению с 13,7 процентными пунктами у людей, что делает их в 2,5 раза более восприимчивыми к атрибутивным сигналам, чем наши человеческие оценщики.

‘Это усиление имеет смысл, когда мы признаем, что современные модели являются оценщиками, обученными на предпочтениях. Обучение на выравнивании через обучение с подкреплением от человеческой обратной связи (RLHF) явно учит модели относиться к человеческим суждениям как к эталону, эффективно устанавливая усвоенную достоверность [приоритет].

‘Модели учатся, что отдача предпочтения человеческим предпочтениям вознаграждается, создавая сикофанцию, где они повторяют ожидаемые пользовательские отношения, а не предоставляют независимую оценку.’

Найденные результаты применяются к области творческого письма, где исследователи использовали истории известного французского автора в качестве образцов данных; и они указывают на то, что человеческая предвзятость против ИИ может, в конечном итоге, перевесить любое количественное улучшение в языковой конструкции, которое могут обеспечить большие языковые модели (LLM), когда они эволюционируют – и что метка “ИИ” может, возможно, означать “неаутентичный”, “замененный” и даже “второсортный” в этой области.

Многие из причин связаны с культурной практикой и использованием: статья указывает, что творчество часто описывается в терминах новизны, ценности и типичности, т.е. насколько что-то ново; насколько оно ценится экспертами; и насколько хорошо оно подходит к своей категории. Когда отрывок помечен как “написанный человеком”, знакомые жанровые черты вознаграждаются как ценные; когда помечен как “сгенерированный ИИ”, те же черты отвергаются как неоригинальные.

По сути, раскрытие источника вызывает переоценку достоинства работы, формируемую предположениями о том, как она была сделана. Как только авторство ИИ раскрывается, читатели инстинктивно отвергают возможность индивидуального открытия или намерения за выводом.

Статья гласит*:

‘В большинстве искусств нет эталона для “достаточно творческого”, что делает сигналы происхождения мощными примами, которые могут изменить, какой критерий кажется наиболее заметным: дисциплинированное мастерство или заметная новизна, доступность или сложность.

‘Поскольку наблюдатели часто выводят процесс из продукта, происхождение влияет на суждения о том, как что-то было сделано, а также о том, что это такое: консервативные движения могут быть засчитаны как мастерство у человека, но отвергнуты как “простая генерация” у модели.’

Тринадцать моделей, включая варианты ChatGPT, Claude, Gemini и Mistral, приняли участие вместе с человеческими читателями, и все оценивали истории более благоприятно, когда им говорили, что они были сделаны человеком, с LLM, показывающими большую предвзятость, чем люди.

Идея о том, что модели ИИ могут усвоить предвзятость против своей собственной продукции, вызывает вопросы о том, откуда берется эта предвзятость. Поскольку написанное ИИ не всегда легко идентифицировать, любые негативные ассоциации, сформированные во время обучения, вероятно, исходят от примеров, явно помеченных, будь то через освещение в новостях ИИ-контента или самопровозглашенных ИИ-генерируемых статей в основных изданиях.

Новая статья под названием Все предпочитают человеческих писателей, включая ИИ исходит от двух авторов из Центра цифровых гуманитарных наук Принстона. Работа сопровождается связанным выпуском данных на Zenodo (с выпуском GitHub, упомянутым в статье, но репозиторий неактивен на момент написания).

Метод

Чтобы изучить, как атрибуция влияет на и формирует восприятие стиля и творчества, авторы использовали Exercices de style, эксцентричную работу 1947 года Раймона Кено, переписывающую простую анекдоту в 99 разных стилях. История следует за человеком, который садится в автобус, спорит с другим пассажиром и позже получает советы по моде от друга.

Хотя литературное по происхождению, эта структура предвосхищает трансформации, основанные на подсказках, в современных языковых моделях, где пользователи запрашивают переписывание в определенных тонах, голосах или регистрах. Этот процесс когда-то был назван трансстилизацией – рамкой, теперь отраженной в исследованиях ИИ в контексте Style Transfer. Хотя большинство вычислительных методов нацелены на функциональные изменения, такие как сдвиги настроений или детоксикация, переписывания Кено направлены на заметный стилистический контраст.

Из популярного английского перевода работы Кено были выбраны тридцать упражнений, которые сохранили повествование, а также охватили широкий стилистический диапазон. Это включало ограниченные формы, такие как александрины и липограммы, изменения регистра, такие как благородный или оскорбительный, повествовательные сдвиги, такие как ретроградный и колебание, и игривые искажения, включающие спунеризмы, ономатопею или дог-латинский:

Примеры из исследования, показывающие, как GPT-4 переписал истории Кено в разных литературных стилях, в паре со стилистическими описаниями, которые увидели человеческие и ИИ-оценщики во время тестирования. Источник: https://arxiv.org/pdf/2510.08831

Примеры из исследования, показывающие, как GPT-4 переписал истории Кено в разных литературных стилях, в паре со стилистическими описаниями, которые увидели человеческие и ИИ-оценщики во время тестирования. Источник: https://arxiv.org/pdf/2510.08831

Поскольку эксперименты Кено трудно классифицировать, эти категории являются лишь приблизительными группировками, с целью не проверить распознаваемость или соответствие жанру, а создать разнообразные условия, при которых (человеческие) читатели и модели могут раскрыть свои предубеждения.

Чтобы произвести аналоги, написанные ИИ, для каждого выбранного стиля, исследователи использовали намеренно минимальные подсказки. Каждой модели была дана самая простая версия анекдота Кено (начальное упражнение, Нотация), вместе с короткой инструкцией переписать его в определенном стиле, таком как Перепишите историю как научно-фантастическую версию. Этот подход позволил подсказкам отражать дух оригинальных трансформаций Кено, сохраняя при этом свободу модели интерпретировать стиль.

Двойное зрение

Первое исследование, проведенное авторами, использовало GPT-4o для генерации всех тридцати вариантов стиля, поскольку это была наиболее продвинутая модель на тот момент. Использование одной модели обеспечило последовательные выходные данные, помогая изолировать эффект атрибутивных меток, который исследование стремилось проверить.

Выходные данные не редактировались по стилю или тону, кроме рамочных отходов, таких как Вот переписанная версия.

Во втором исследовании процесс генерации был повторен на тринадцати больших языковых моделях: Qwen 2.5 72B Instruct, Mistral Nemo, Mistral Medium 3, Llama 4 Maverick, Llama 3.3 70B Instruct, Gemini 2.5 Flash, GPT-4o Mini, GPT-4o, GPT-3.5 Turbo Instruct, DeepSeek RI (0528), DeepSeek Chat v3 (0324), Cohere Command R (08-2024), Claude Sonnet 4, и Claude 3.5 Haiku.

Каждая модель получила те же инструкции и произвела свои собственные версии тридцати упражнений, в результате чего получилось 420 переписанных историй в общей сложности. Это позволило исследователям проверить, сохраняется ли эффект атрибуции на разных моделях ИИ, а не связан ли он с одной моделью.

Данные и тесты

Исследователи показали одни и те же пары историй разным группам людей, но изменили метки, чтобы увидеть, насколько название автора влияет на мнения:

Одна группа не видела никаких имен авторов, только метки ‘А’ и ‘Б’. Вторая группа видела правильные имена, с одной версией, помеченной как написанной человеком, и другой – как написанной GPT-4o.

Третья группа видела имена переключенными, с ‘ИИ’-историей, помеченной как ‘человек’, и ‘человеческой’ версией, помеченной как ‘ИИ’:

Обзор исследования 1. Человеческие и ИИ-судьи сравнивали 30 пар историй, каждая из которых содержала версию, написанную Кено, и одну – GPT-4. Судьи были разделены на три группы: одна не видела никаких имен авторов; одна видела правильные имена; и одна видела имена, переключенные – настройка, предназначенная для проверки степени, в которой имена авторов влияют на мнения о стиле письма.

Обзор исследования 1. Человеческие и ИИ-судьи сравнивали 30 пар историй, каждая из которых содержала версию, написанную Кено, и одну – GPT-4. Судьи были разделены на три группы: одна не видела никаких имен авторов; одна видела правильные имена; и одна видела имена, переключенные – настройка, предназначенная для проверки степени, в которой имена авторов влияют на мнения о стиле письма.

Исследование 1

Исследователи разделили 30 созданных стилей на более мелкие наборы, с каждым участником исследования, видящим только пять стилей, и каждым стилем, протестированным под всеми тремя настройками меток.

Каждый участник видел только одну настройку меток: слепая группа не видела никакого упоминания ИИ, в то время как другие группы видели либо правильные, либо перевернутые метки автора. Назначение группы, порядок истории и левое-правое размещение были все случайными.

Модели ИИ прошли через тот же процесс, получив тот же микс стилей и тот же случайный перемешивание. Каждый тест был запущен три раза на каждую модель, чтобы убедиться, что результаты были последовательными, что позволило сравнить человеческие и ИИ-реакции на метки автора.

Исследование 2 использовало те же три настройки меток, что и раньше, но расширило тест, чтобы включить все 420 историй, сгенерированных из 14 разных моделей LLM. Каждая модель оценила каждую историю под каждым условием метки, производя 1260 решений на модель, и в результате получилось 17 596 действительных оценок:

Результаты исследования 1. ИИ- и человеческие судьи оба показали предвзятость, основанную на метках автора. Когда не показывались никакие метки (Слепая), предпочтения были почти равными; когда показывались правильные метки (Открытая метка), обе группы предпочитали человеческий текст; и когда метки были перевернуты (Контрфактическая), обе группы переключились на предпочтение текста, который, по их мнению, был человеческим – и этот эффект был намного сильнее в моделях ИИ, чем у людей. Полосы ошибок показывают 95% доверительные интервалы.

Результаты исследования 1. ИИ- и человеческие судьи оба показали предвзятость, основанную на метках автора. Когда не показывались никакие метки (Слепая), предпочтения были почти равными; когда показывались правильные метки (Открытая метка), обе группы предпочитали человеческий текст; и когда метки были перевернуты (Контрфактическая), обе группы переключились на предпочтение текста, который, по их мнению, был человеческим – и этот эффект был намного сильнее в моделях ИИ, чем у людей. Полосы ошибок показывают 95% доверительные интервалы.

Во всех тринадцати моделях был обнаружен тот же про-человеческий шаблон, но он был намного сильнее: без меток ИИ-системы оценивали человеческие и ИИ-истории почти одинаково, выбирая ИИ-текст 49,4% времени; когда метка ИИ была видна, это предпочтение резко упало до 29,8%, показывая явное недооценку признанного ИИ-работы; и когда тот же текст был помечен как человеческий, предпочтение возросло до 64,1%.

Разница между двумя условиями меток составила 34,3%, что означает, что модели ИИ изменили свое предпочтение намного больше, чем люди, когда метки были переключены. Кроме того, модели были высоко последовательными на повторных запусках, подтверждая, что предвзятость была стабильной, а не случайной.

Чтобы проверить, вызвана ли предвзятость формулировкой меток, а не тем, кто написал текст, исследователи провели два дополнительных теста: один использовал метки, которые делали ИИ звучать более впечатляюще; и другой использовал нейтральные термины, такие как ‘авторство ИИ’ и ‘авторство человека’.

Оба показали ту же предвзятость, и даже когда модели ИИ производили один и тот же ответ каждый раз, предвзятость сохранялась, указывая на то, что предвзятость вызвана типом метки (‘человек’ или ‘ИИ’), а не точными словами, использованными.

Исследование 2

Второе исследование показало ту же про-человеческую предвзятость во всех 13 моделях ИИ, независимо от архитектуры или поставщика:

Предвзятость атрибуции для каждой из 13 моделей ИИ: полосы показывают размеры эффектов с 95% доверительными интервалами, и красная линия отмечает человеческий базовый уровень. Все модели показали более сильную предвзятость, чем люди, с только небольшими различиями между ними.

Предвзятость атрибуции для каждой из 13 моделей ИИ: полосы показывают размеры эффектов с 95% доверительными интервалами, и красная линия отмечает человеческий базовый уровень. Все модели показали более сильную предвзятость, чем люди, с только небольшими различиями между ними.

Каждая модель предпочитала истории, помеченные как написанные человеком, с более сильными эффектами, чем у людей. Даже после удаления наиболее экстремального случая средняя предвзятость оставалась более чем в два раза больше, чем человеческая версия, что предполагает, что эффект не является ошибкой в одной модели, а общей чертой моделей LLM.

Вывод

Хотя, как отмечается в статье, предыдущие исследования показали, что ИИ может производить письмо, равное или даже лучше человеческого, авторы подчеркивают, что в литературе ценность, придаваемая авторству и аутентичности, является древней и глубоко укоренившейся конвенцией:

‘Когда GPT-4o Mini отвергает “творческий и юмористический” подход Кено как “преувеличенный” под меткой ИИ, а хвалит идентичные черты под человеческой атрибуцией, он неявно показывает, как эти метки запускают предположения о том, что нет аутентичного психологического процесса.

‘Сигналы происхождения проникают в процесс, который мог бы быть суждением только о продукте: “простая генерация” кажется приемлемой от человеческого мастера (оцениваемого как умелое ремесло), но подозрительной от модели (оцениваемой как алгоритмическая рекомбинация).’

Модели LLM еще не достаточно надежны для несUPERвизного исследования, основанного на фактах, хотя тщательный надзор все еще может сделать их продуктивными – но творческое письмо на основе LLM может столкнуться с более неопределенным будущим, если ИИ-генерируемые творческие работы будут стигматизированы через более широкое общественное неодобрение вторжения ИИ в человеческие области, а не на основе литературных достоинств.

Последствия результатов таких исследований существенно зависят от готовности компаний и отдельных пользователей быть честными о том, использовали ли они ИИ в своей продукции. В некоторых случаях нежелание признать такое использование может быть связано больше с корпоративной пиратской деятельностью в области авторского права, чем с беспокойством о том, примет ли общественность ИИ-генерируемые творческие работы.

Однако юридические, финансовые и политические решения возможны (хотя и очень сложны) в отношении авторского права. Хотя можно сделать людей наслаждаться творческими работами ИИ, не имеющими единой и связной человеческой мысли, стоящей за ними – это может быть еще более сложной задачей.

 

* Пожалуйста, обратитесь к исходной статье для удаленных внутренних цитат. По мере необходимости они будут включены в статью.

Опубликовано в понедельник, 13 октября 2025 года

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: [email protected]