Взгляд Anderson
Определение спонсируемого контента на новостных сайтах с помощью машинного обучения

Исследователи из Нидерландов разработали новый метод машинного обучения, способный различать спонсируемый или оплаченный контент на новостных платформах, с точностью более 90%, в ответ на растущий интерес рекламодателей к форматам “родной” рекламы, которые трудно отличить от “настоящей” журналистской продукции.
Новая статья, озаглавленная Различение коммерческого и редакционного контента в новостях, поступила от исследователей из Лейденского университета.

Коммерческие (красные) и редакционные (синие) субграфы, возникающие из анализа данных. Источник: https://arxiv.org/pdf/2111.03916.pdf
Авторы отмечают, что хотя более серьезные издания, которые могут диктовать условия рекламодателям, будут делать разумные усилия, чтобы различать “партнерский контент” и общий поток новостей и анализа, стандарты медленно, но неуклонно меняются в сторону увеличения интеграции между редакционными и коммерческими командами на платформе, что они считают тревожной и негативной тенденцией.
‘Способность маскировать контент, добровольно или недобровольно, и вероятность того, что рекламные статьи не будут распознаны как таковые, даже если они правильно помечены, значительна. Маркетологи называют это “родной” рекламой по какой-то причине.’

Некоторые текущие примеры родной рекламы, называемой “партнерским контентом”, “бренд-контентом” и многими другими названиями, предназначенными для тонкого стирания различия между родной и коммерчески размещенной рекламой на журналистских платформах.
Работа была проведена в рамках более широкого исследования сетевой новостной культуры в ACED Reverb Channel, базирующемся в Амстердаме, который концентрируется на данных, управляемых анализом эволюционирующих журналистских тенденций.
Сбор данных
Чтобы разработать источник данных для проекта, авторы использовали 1,000 статей и 1,000 рекламных статей из четырех голландских новостных изданий и классифицировали их на основе их текстовых особенностей. Поскольку набор данных был относительно скромным по размеру, авторы избегали крупномасштабных подходов, таких как BERT, и вместо этого оценивали эффективность более классических рамок машинного обучения, включая Support Vector Machine (SVM), LinearSVC, Decision Tree, Random Forest, K-Nearest Neighbor (K-NN), Stochastic Gradient Descent (SGD) и Naïve Bayes.
Корпус Reverb Channel смог предоставить 1,000 необходимых “прямых” статей, но авторы должны были собрать рекламные статьи напрямую с четырех голландских веб-сайтов. Полученные данные доступны в ограниченной форме (из-за проблем с авторскими правами) на GitHub, вместе с некоторым из Python-кода, использованного для получения и оценки данных.
Четыре изучаемых издания были политически консервативным Nu.nl, более прогрессивным Telegraaf, NRC и деловым журналом De Ondernemer. Каждое издание было одинаково представлено в данных.
Было необходимо определить и исключить потенциальные “утечки” в лексиконе, сформированном исследованием – слова, которые могут появляться в обоих типах контента с небольшим различием между их частотой и использованием, чтобы установить четкие закономерности для действительно родного и спонсируемого контента.
Результаты
По всем методам, протестированным для определения, лучшие результаты были получены SVM, linearSVC, Random Forest и SGD. Поэтому исследователи продолжили использовать SVM в дальнейшем анализе.

Лучший подход к модели для извлечения классификации по корпусу превысил 90% точности, хотя исследователи отмечают, что получение четкой классификации становится более трудным при работе с ориентированными на B2B публикациями, где лексическое совпадение между воспринимаемым “настоящим” и “спонсируемым” контентом чрезмерно – возможно, потому что стиль делового языка уже более субъективен, чем общий поток отчетов и аналитических конвенций, и может более легко скрывать программу.

t-Distributed Stochastic Neighbor Embedding (t-SNE) plots for separation of real and sponsored content across the four publications.
Является ли спонсируемый контент “фейковыми новостями”?
Исследование авторов предполагает, что их проект является новым в области анализа новостного контента. Рамки, способные определять спонсируемый контент, могут проложить путь к разработке годовой мониторинга баланса между объективной журналистикой и растущей долей “родной рекламы”, которая находится в几乎 том же контексте в большинстве изданий, используя те же визуальные подсказки (CSS-стили и другие форматирования) как общий контент.
В某ком смысле, частое отсутствие очевидного контекста для спонсируемого контента возникает как подполе изучения “фейковых новостей”. Хотя большинство издателей признают необходимость разделения “церкви и государства” и обязательство предоставлять читателям четкие разделения между оплаченным и органически сгенерированным контентом, реалии постпечатной журналистской сцены и увеличение зависимости от рекламодателей превратили демонтаж спонсируемых индикаторов в тонкое искусство в UI-психологии. Иногда вознаграждение за запуск спонсируемого контента достаточно заманчиво, чтобы рискнуть крупным оптическим катастрофой.
В 2015 году социальная медиа- и конкурентная платформа Quintly предложила метод определения спонсируемого контента, заявив о точности 96%. В следующем году исследование из Университета Джорджии утверждало, что то, как издатели обращаются с объявлением спонсируемого контента, может быть ‘сговорчивым с обманом’.
В 2017 году MediaShift, организация, изучающая пересечение между медиа и технологиями, обратила внимание на растущую степень, в которой The New York Times монетизирует свои операции через свою бренд-студию, T Brand Studio, заявив о снижении уровня прозрачности вокруг спонсируемого контента, с тактично намеренным результатом, что читатели не могут легко определить, является ли контент органически сгенерированным.
В 2020 году другая исследовательская инициатива из Нидерландов разработала классификаторы машинного обучения для автоматического определения российских государственных новостей, появляющихся в сербских новостных платформах. Кроме того, было оценено в 2019 году, что “медиа-контент решения” Forbes составляют 40% его общего дохода через BrandVoice, контент-студию, запущенную издателем в 2010 году.












