Anderson 视角
使用机器学习识别新闻网站中的赞助内容

来自荷兰的研究人员开发了一种新的机器学习方法,可以区分新闻平台中的赞助或付费内容,准确率超过90%,以应对广告商对“本地广告”格式的日益增长的兴趣,这种格式很难与“真正”的新闻输出区分开来。
新论文《区分商业和编辑内容在新闻中》来自莱顿大学的研究人员。

商业(红色)和编辑(蓝色)子图从数据分析中出现。 来源:https://arxiv.org/pdf/2111.03916.pdf
作者观察到,虽然更严肃的出版物可以更容易地为广告商设定条件,并会合理地努力区分“合作内容”和一般新闻和分析,但标准正在缓慢但不可逆转地转变为出版物的编辑和商业团队之间的集成度增加,他们认为这是一个令人担忧和负面的趋势。
‘内容的伪装能力,无论是故意还是无意的,及其被识别为广告的可能性,即使正确标记,也是显著的。营销人员称之为本地广告,有其原因。’

一些当前的本地广告例子,分别称为“合作内容”、“品牌内容”和其他名称,旨在微妙地模糊新闻平台中本地和商业内容之间的区别。
该工作是作为对网络新闻文化的更广泛调查的一部分在阿姆斯特丹的ACED Reverb Channel进行的,该调查重点关注数据驱动的新闻趋势分析。
获取数据
为了开发项目的源数据,作者使用了四家荷兰新闻机构的1000篇文章和1000篇广告,并根据其文本特征对其进行分类。由于数据集相对较小,作者避免使用大规模方法,如BERT,而是评估了更经典的机器学习框架的有效性,包括支持向量机(SVM)、LinearSVC、决策树、随机森林、K-最近邻(K-NN)、随机梯度下降(SGD)和朴素贝叶斯。
Reverb Channel语料库能够提供1000篇必要的“直接”文章,但作者不得不直接从四家荷兰网站上爬取广告。获得的数据以有限形式(由于版权问题)在GitHub上提供,连同一些用于获取和评估数据的Python代码。
研究的四家出版物是保守的Nu.nl、进步的Telegraaf、NRC和商业期刊De Ondernemer。每家出版物在数据中都有同等的代表性。
为了建立明确的本地和赞助内容模式,需要确定和排除研究中形成的词汇中的潜在“泄漏”——可能在两种内容中以类似的频率和用法出现的词语。
结果
在测试的识别方法中,SVM、LinearSVC、随机森林和SGD获得了最佳结果。因此,研究人员继续使用SVM进行进一步分析。

最佳模型方法在整个语料库中超过90%的准确率,尽管研究人员指出,当处理面向B2B的出版物时,获得明确分类变得更加困难,因为“真正的”和“赞助的”内容之间的词汇重叠过多——可能是因为商业语言的本地风格已经比一般的报道和分析惯例更主观,可以更容易地隐藏议程。

四家出版物中真实和赞助内容的t-SNE图。
赞助内容是“假新闻”吗?
作者的研究表明,他们的项目在新闻内容分析领域是新颖的。能够识别赞助内容的框架可以为开发年度监测奠定基础,以平衡客观新闻和日益增长的“本地广告”之间的关系,这种广告在大多数出版物中使用相同的视觉提示(CSS样式表和其他格式)。
在某种意义上,赞助内容缺乏明显的上下文正在成为“假新闻”研究的一个子领域。虽然大多数出版商认识到区分“教堂和国家”的必要性,并为读者提供明确的付费和自动生成内容之间的区别,但后印刷新闻场景的现实和对广告商的依赖程度已经将赞助指标的淡化变成了UI心理学的一种微妙艺术。有时,运行赞助内容的回报足以冒险引发一个重大视觉灾难。
2015年,社交媒体和竞争对手基准平台Quintly提供了一种基于AI的检测方法,用于确定Facebook上的一篇帖子是否是赞助的,声称准确率为96%。第二年,来自佐治亚大学的一项研究认为,出版商处理赞助内容声明的方式可能是“与欺骗相容”的。
2017年,研究媒体和技术交叉点的组织MediaShift观察到《纽约时报》通过其品牌内容工作室T Brand Studio将业务货币化的程度越来越大,声称赞助内容的透明度越来越低,读者无法轻易区分内容是否自动生成。
2020年,荷兰的另一项研究开发了机器学习分类器,以自动识别在塞尔维亚新闻平台上出现的俄罗斯国家资助的新闻。另外,据估计,2019年Forbes的“媒体内容解决方案”通过2010年由出版商推出的内容工作室BrandVoice占其总收入的40%。进一步来说,荷兰开发了机器学习分类器,以自动识别俄罗斯国家资助的新闻出现在塞尔维亚新闻平台上。另外,据2019年估计,Forbes的“媒体内容解决方案”通过2010年由出版商推出的内容工作室BrandVoice占其总收入的40%。












