Взгляд Anderson

Искусственный интеллект может помочь выявить «розовую слизь» в новостях

mm
Добавьте Unite.AI в избранные источники в Google
AI-generated illustration featuring two 'perfect' and typical US-style newsreaders in a news anchor room – an older male and younger blonde female both Caucasian, with robots and technicians in the background. Z-Image, Firefly 3, et al.

Агендированные фабрики мнений, предназначенные больше для влияния на общественное мнение, чем для служения обществу, могут быть труднее обнаружить, если искусственный интеллект используется для того, чтобы они звучали более оригинально и рационально. Итак, началась гонка за то, чтобы опережать в игре «обнаружения розовой слизи».

 

Дефинансирование традиционных местных средств массовой информации за последние двадцать лет, как из-за эволюции медиа-трендов, так и из-за политики правительства США, оставило пустоту в региональной журналистике, которую с удовольствием заняли партийные организации, использующие искусственный интеллект для продвижения своих целей.

Чтобы понять термин «партийный» (учитывая, что ни одна новостная организация не лишена политических тенденций), мы говорим о нефтяных компаниях, которые управляют региональными новостными сайтами издалека, без каких-либо реальных местных ресурсов, но с целью защиты репутации компании; политически мотивированных новостных сайтов без какого-либо источника дохода, готовящихся к выборам; и целых сетей про-республиканских новостных сайтов, которые появляются ниоткуда, близко к дате голосования.

В 2024 году было подсчитано, что новости, созданные с помощью искусственного интеллекта, наконец-то превысили количество подлинных новостных источников; в то время австралийское исследование показало, что 41% потребителей предпочитают источники «розовой слизи» над «настоящими» источниками.

Этот вид скрытой предвыборной агитации, можно утверждать, эволюционировал от простого «тёмного искусства» до экзистенциальной угрозы для демократии (в отношении политически мотивированных изданий) и для общественного доверия к разумным стандартам справедливости в освещении.

Следовательно, методы различения характерной продукции издателей и вещателей «розовой слизи» от более традиционных средств массовой информации будут очень полезны, по крайней мере, для понимания того, кто такие игроки и движущие силы в текущем информационном климате.

Как это стоит, штампы и шаблоны реальных новостных организаций очень легко имитировать, и искусственный интеллект делает масштабное издание текущей и доступной реальностью, используя многие из тех же трюков, которые принимаются бюджетными «старыми» издателями и вещателями.

Сигнал и шум

Новое исследование из США решает эту проблему, изучая растущее использование больших языковых моделей для того, чтобы сделать сайты «розовой слизи» менее генеричными и легко обнаруживаемыми, и создавая обучающую основу, предназначенную для того, чтобы идти в ногу с эволюционирующими изменениями в выходных данных «розовой слизи» (PS).

Название Раскрытие журналистики «розовой слизи»: лингвистические сигнатуры и прочная детекция против угроз, сгенерированных БLM, новая работа исходит от пяти исследователей из Университета Техаса.

Новая работа исследует, как массово производимые местные новостные статьи PS отличаются от легитимной журналистики, фокусируясь на их зависимости от коротких, повторяющихся структур и шаблонов с минимальными вариациями; и авторы отмечают, что статьи PS склонны повторять идентичные шаблоны, предназначенные для манипулирования общественным мнением, с обращением к эмоциям в верхней части контента:

Из новой статьи - несколько источников публикуют почти идентичные статьи с измененными только местными деталями, раскрывая стратегию копирования и вставки для массового производства контента, имитирующего легитимную местную журналистику. Источник - https://arxiv.org/pdf/2512.05331

Из новой статьи – несколько источников публикуют почти идентичные статьи с измененными только местными деталями, раскрывая стратегию копирования и вставки для массового производства контента, имитирующего легитимную местную журналистику. Источник

Традиционные модели обнаружения, обученные на этих чертах, хорошо работают против такого контента, но терпят неудачу, когда статьи переписываются с помощью чат-ботов искусственного интеллекта, чтобы они казались более естественными или изысканными.

Тесты авторов показывают, что даже незначительные стилистические изменения, введенные большими языковыми моделями, могут снизить точность обнаружения до 40%. Чтобы смягчить это, они предлагают постоянную обучающую основу, которая инкрементально переобучает модели обнаружения на как исходных, так и переписанных с помощью ИИ статьях, чтобы адаптироваться к меняющимся лингвистическим закономерностям.

Метод

Для установления данных для проекта авторы использовали набор данных «Розовой слизи», в котором представлены 7,9 миллиона статей, охватывающих 1093 источника за 2021-2023 годы, из которых они получили 9472 статьи «розовой слизи» после фильтрации. Они также использовали набор данных LIAR, который содержит аннотированные фейковые новости, а также NELA-GT-2021, который содержит только статьи из США*.

Для подготовки своих обучающих и тестовых наборов авторы сначала использовали алгоритм t-SNE, чтобы уменьшить вложения статей до двух измерений. Затем они применили алгоритм кластеризации DBSCAN, чтобы выделить кластеры подобных статей «розовой слизи».

Каждый кластер рассматривался как группа связанных историй, многие из которых все еще следовали одному и тому же шаблону, несмотря на сознательную попытку решить проблему дубликатов.

Чтобы предотвратить появление подобных статей в обучающих и тестовых наборах, целые кластеры были случайным образом выбраны, 80% использовались для обучения и 20% для тестирования. Поскольку легитимные новостные статьи не образовывали четкие кластеры, был применен случайный раздел.

Этот процесс был повторен три раза, чтобы обеспечить последовательность и уменьшить предвзятость выборки.

Характеристики «Розовой слизи»

Комментируя характерные черты PS по сравнению с обычными новостями, исследователи утверждают, что статьи PS-стиля значительно короче и проще, чем легитимная журналистика, в среднем содержа меньше девяти предложений на статью.

Более высокий процент простых предложений и более сильная зависимость от прилагательных являются дальнейшими характеристиками «розовой слизи», согласно статье, и указывают на склонность к повторяющемуся, эмоционально заряженному языку.

Лексическое богатство было измерено с помощью RTTR, и оказалось значительно ниже в статьях PS, которые также демонстрировали намного меньше уникальных именных фраз.

Эти закономерности указывают на ограниченный словарный запас и формулу стиля, в отличие от легитимной местной журналистики, которая характеризуется сложными закономерностями частей речи, построенными вокруг вспомогательных глаголов, местоимений и союзов. Вместо этого фейковые статьи отдают предпочтение базовым структурам глагол-существительное, с частым использованием пунктуационных триграмм, что указывает на менее формальный, более фрагментированный стиль письма.

Тесты

Для изучения связей между различными типами новостных статей, основанных на лингвистических и структурных особенностях, были сгенерированы вложения с помощью модели stella_en_400M_v5 и уменьшены с помощью PCA и t-SNE для визуализации.

Когда они были спроецированы на две размерности, фейковые местные новостные статьи образовывали небольшие, плотные кластеры, каждая из которых соответствовала узко фокусированным темам, таким как статистика преступности, обновления акций или благотворительные пожертвования:

Кластерные закономерности из проекции t-SNE показывают, что статьи «розовой слизи» образуют плотные, повторяющиеся группы, в то время как легитимные новости демонстрируют более широкие, разнообразные распределения, выровненные с разнообразием тем и стиля.

Кластерные закономерности из проекции t-SNE показывают, что статьи «розовой слизи» образуют плотные, повторяющиеся группы, в то время как легитимные новости демонстрируют более широкие, разнообразные распределения, выровненные с разнообразием тем и стиля.

Как мы видим, в некоторой степени, в вышеуказанной визуализации, эта закономерность предполагает жесткую, шаблонную структуру, с минимальными вариациями между статьями.

Интересно, что статьи, помеченные как «фейковые новости», отклонялись от фейковых местных материалов, показывая распределение, более соответствующее настоящим новостям, что указывает на то, что массово производимые фейковые местные материалы могут не быть просто менее правдивыми, но также механически различными по форме и составу.

Напротив, «легитимные» местные новости образуют меньше и более широко расположенных кластеров, что соответствует более разнообразному языку и предмету, в то время как национальные новостные статьи демонстрируют еще большую дисперсию, отражающую более широкий тематический диапазон и более свободную стилистическую последовательность.

Сравнения особенностей между легитимными местными новостями и контентом «розовой слизи», указывающие на то, что статьи PS короче, используют более простые структуры предложений, содержат больше прилагательных, демонстрируют более низкое лексическое богатство, отдают предпочтение базовым структурам частей речи и содержат меньше уникальных именных фраз.

Сравнения особенностей между легитимными местными новостями и контентом «розовой слизи», указывающие на то, что статьи PS короче, используют более простые структуры предложений, содержат больше прилагательных, демонстрируют более низкое лексическое богатство, отдают предпочтение базовым структурам частей речи и содержат меньше уникальных именных фраз.

Обнаружение

Исследователи оценили два основных подхода к обнаружению контента «розовой слизи»: классификацию, основанную на手crafted лингвистических особенностях; и трансформер-основанное тонкое настрой.

Для подхода с помощью классификации были подчеркнуты структурные, а не семантические характеристики, используя счет предложений; лексическое богатство; синтаксическую глубину; вероятности совместного появления частей речи; вероятности совместного появления тегов зависимостей; читаемость; и счет частей речи.

Три модели были протестированы на этом наборе особенностей: XGBoost; Random Forest; и Support Vector Machine (SVM) – с Random Forest, показавшим немного более сильные результаты в целом.

И XGBoost, и Random Forest присвоили высокое прогностическое значение особенностям, таким как счет предложений и количество уникальных именных фраз. Читаемость и лексическое богатство также сильно повлияли на классификацию, хотя модели оценивали их по-разному, с XGBoost, отдающим предпочтение Flesch и RTTR, в то время как Random Forest склонялся к CTTR:

<img class=" wp-image-227112" src="https://www.unite.ai/wp-content/uploads/2025/12/figure-4-1.jpg" alt="Оценки важности особенностей на основе SHAP (SHapley Additive exPlanations) подчеркивают, как каждая входная особенность влияет на выход модели в разных образцах. В данном случае оценки SHAP показывают, что и XGBoost, и Random Forest в основном полагались на счет предложений и уникальные именные фразы, чтобы различать «розовую слизь» и настоящие новости, в то время как присваивали разный вес мерам лексического богатства и читаемости.” width=”955″ height=”286″ /> Оценки важности особенностей на основе SHAP (SHapley Additive exPlanations) подчеркивают, как каждая входная особенность влияет на выход модели в разных образцах. В данном случае оценки SHAP показывают, что и XGBoost, и Random Forest в основном полагались на счет предложений и уникальные именные фразы, чтобы различать «розовую слизь» и настоящие новости, в то время как присваивали разный вес мерам лексического богатства и читаемости.

Как мы видим в предыдущих сравнениях особенностей (выше), статьи «розовой слизи» отдают предпочтение сенсационности над деталями, с более низким лексическим богатством и с меньшим количеством различных именных фраз – подкрепляя вывод о том, что этот тип контента высоко шаблонен и повторяен.

Закономерности триграмм частей речи подтверждают, что легитимная местная журналистика склонна использовать более сложные структуры, включающие вспомогательные глаголы, местоимения и союзы, в то время как «розовая слизь» отдает предпочтение фрагментированной или минимальной синтаксисе. Эти закономерности предполагают надежную основу для различения синтетического местного контента от настоящей журналистики.

Второй раунд тестирования включал тонкую настройку трансформер-моделей на полный текст статей, чтобы захватить как семантический контент, так и синтаксическую структуру.

BERT, XLNet и Flan-T5 были протестированы, с BERT, достигшим最高 F1-оценки на уровне 89,31% – хотя в статье отмечается, что различия в производительности не были статистически значимыми. В отличие от классификаторов с handcrafted особенностями, эти модели обновляют все веса во время обучения, что позволяет им учиться представлениям, специфичным для задачи, напрямую из данных.

Дополнительный метод, основанный на вложениях, использовал полносвязанный классификатор, который показал лучшие результаты, чем модели с handcrafted особенностями, но не достиг уровня точности тонкой настройки.

Эти подходы выигрывают от более широкого лингвистического контекста – что полезно, учитывая, что статьи «розовой слизи» часто перерабатывают контент между источниками. Handcrafted особенности, с другой стороны, полагаются только на поверхностную синтаксис, что ограничивает их способность обобщаться между источниками.

Усиление «Розовой слизи» с помощью БLM

Чтобы протестировать, можно ли сделать статьи «розовой слизи» более трудными для обнаружения, исследователи переписали их с помощью больших языковых моделей. Промпты были разработаны для улучшения стиля письма, расширения контента, уменьшения чрезмерного использования прилагательных, обеспечения нейтрального тона, использования более разнообразного словаря и увеличения количества уникальных именных фраз, с целью скрыть поверхностные черты, на которые полагаются большинство систем обнаружения.

Тестируемые модели были Gemma‑2B; Mistral‑7B; Llama‑1B; Llama‑3B; Llama‑8B; Qwen‑7B; GPT‑4o mini; и Claude‑3.5‑Haiku.

Производительность обнаружения (F1) классификатора BERT, настроенного на полный текст, когда статьи «розовой слизи» переписываются с помощью разных БLM. Более низкие оценки указывают на более успешное сокрытие.

Производительность обнаружения (F1) классификатора BERT, настроенного на полный текст, когда статьи «розовой слизи» переписываются с помощью разных БLM. Более низкие оценки указывают на более успешное сокрытие.

Из этих результатов авторы комментируют:

‘[Среди] открытых моделей Qwen оказалась наиболее эффективной в уклонении от обнаружения: когда протестирована на предварительно настроенном классификаторе BERT (базовая F1-оценка: 89%), она привела к снижению производительности обнаружения на 28,34%.

‘Закрытые модели оказались значительно более мощными, с обоими GPT-4o-mini и Claude-3.5-Haiku, снижающими F1-оценку в среднем на 40%, подчеркивая вызов, представленный высококачественным сокрытием, сгенерированным БLM.’

Эти результаты, по мнению авторов, показывают, насколько легко БLM могут замаскировать контент «розовой слизи», делая его намного более трудным для текущих инструментов обнаружения**.

Заключение

Мнение Эта линия исследований содержит некоторые интересные дилеммы, не в последнюю очередь то, что так много людей (согласно хотя бы одному опросу, упомянутому ранее) поддерживают контент «розовой слизи», зная, что это такое, что это вызывает вопросы о контексте, в котором используется этот термин. Это похоже на то, что люди знают, что «Сойлент Грин – это люди», но они пожимают плечами и продолжают есть; или так может показаться, с либеральной точки зрения.

Эта публичная безразличность к алгоритмическим новостям может эволюционировать и даже откатиться назад – но на данный момент она, кажется, углубляется.

Еще одна вещь, которая меня поразила, читая статью, была то, как простой стиль и редукционизм выходных данных «розовой слизи» были рассмотрены как недостаток с возможным технологическим решением, когда минимализм, эмоционализм и ограниченный словарный запас, по сути, являются намеренными.

Если различные группы интересов за «розовой слизью» хотят расширить свое влияние на более интеллектуальную или либеральную аудиторию (хотя это, возможно, не будет их сильной стороной), кажется более вероятным, что они установят лагерь ближе к своей целевой аудитории, а не изменят стиль языка и тон, который уже достигает своих целей на существующих платформах.

 

* Из-за некоторых неудачных форматирований в статье, дополнительный источник местных новостей не имеет ясной атрибуции. Пожалуйста, обратитесь к исходной статье и угадайте, какая из ссылок «Horne» применима.

** Здесь мы направляем читателя к исходной статье для получения подробностей о вторичных, дополнительных экспериментах, которые завершают раздел результатов новой статьи.

Опубликовано впервые в пятницу, 12 декабря 2025 года

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai