Anderson 视角
麻省理工学院:使用机器学习在主要新闻媒体中衡量媒体偏见

麻省理工学院的一项研究使用机器学习技术来识别大约100家最大的和最有影响力的新闻媒体中的偏见性措辞,包括83家最有影响力的印刷新闻出版物。这是一项研究成果,展示了自动化系统的发展方向,这些系统可以潜在地自动分类出版物的政治性质,并为读者提供对媒体在他们关心的主题上的道德立场的更深入的见解。
该研究的重点是媒体如何使用特定的措辞来处理某些话题,例如 无证移民 | 非法移民,胎儿 | 未出生的婴儿,示威者 | 无政府主义者。
该项目使用自然语言处理(NLP)技术来提取和分类这种“带电”语言(假设看似更“中立”的术语也代表一种政治立场),并将其映射到一个广泛的图谱中,揭示了超过300万篇文章中左翼和右翼偏见的分布情况,结果是一个可导航的 偏见地图。
该研究由麻省理工学院物理系的萨曼莎·达洛佐和马克斯·特格马克进行,观察到最近围绕“事实核查”的一些倡议可以被视为 不真诚,并服务于特定利益的目的。该项目旨在提供一种更数据驱动的方法来研究偏见和“影响”语言在所谓中立新闻背景下的使用。

研究中得出的左到右的短语谱系。 来源:https://arxiv.org/pdf/2109.00024.pdf
NLP处理
该研究的源数据来自开放源码 Newspaper3K数据库,包括100个媒体新闻来源的3,078,624篇文章,包括83家报纸。报纸的选择基于其影响力,而在线媒体来源还包括军事新闻分析网站 Defense One 和 Science 的文章。

研究中使用的来源。
研究报告指出,下载的文本经过“最小”的预处理。直接引语被删除,因为研究关注的是记者选择的语言(尽管引语选择本身就是一个 有趣的研究领域)。
英国拼写被改为美国拼写,以标准化数据库,所有标点符号被删除,所有序数以外的数字也被删除。初始句子大写被转换为小写,但保留其他大写字母。
首先,找出了最常见的100,000个短语,并对其进行了排名、清除和合并,形成了一个短语列表。所有可识别的冗余语言(如“分享此文章”和“文章转载”)也被删除。标准化了基本相同的短语的变体(如“大科技”和“Big Tech”,“网络安全”和“cyber security”)。
‘Nutpicking’
最初的测试是关于“黑人的生命很重要”这个话题,能够辨别出短语偏见和同义词在数据中的分布。
当我们沿着媒体的政治立场移动时,“抗议者”会从“无政府主义者”转变为“暴徒”,研究报告指出,NLP提取和分析的立场受到“挑剔”的影响——媒体会引用一个被不同政治派别视为有效的短语,并依赖其读者将其视为负面。研究引用“解散警察”作为一个例子。
这种短语是“双值”的,而某些其他短语具有普遍的负面含义(如“杀婴”),在各种媒体中始终被视为负面。
研究还揭示了类似的映射,用于“热点”话题,如堕胎、科技审查、美国移民和枪支管制。
爱好马
有一些媒体的政治倾向不能预测性地分裂,例如军事开支的话题。研究发现,“左倾”的CNN最终与右倾的国家评论和福克斯新闻站在同一立场上。
一般来说,政治立场可以通过其他短语来确定,例如更喜欢“军事工业复合体”而不是更右倾的“国防工业”。结果显示,前者被批评性媒体如 Canary 和 美国保守派 使用,而后者更常被福克斯和CNN使用。
研究建立了其他从批判性到支持性语言的进展,包括从“枪杀”到更被动的“杀害”;从“囚犯罪犯”到“被监禁的人”;从“石油生产者”到“大石油”。

具有建制偏见的同义词,从上到下。
研究承认,媒体可能会“摆脱”其基本政治立场,或者出于其他动机。例如,英国著名的右翼出版物 观察家 经常和突出地刊登左翼观点,这可能是出于公正报道的愿望,或者是为了激发其核心读者的流量生成评论风暴——这是一个难以解释的现象,也不是机器学习系统可以轻易解决的问题。
这些特定的“爱好马”和媒体使用“刺耳”观点的模糊性,会使研究最终提供的左-right映射有些混乱,尽管它提供了一个关于政治归属的广泛指示。

保留的意义
尽管该研究于2021年8月底发表,但它并没有获得太多关注。部分原因可能是批判性研究不太可能被主流媒体热情地接受;但也可能是由于作者不愿意产生明确的图表来展示有影响力和权威的媒体在各个问题上的立场,以及他们的偏见程度。
同样,研究发布的数据显示了事件的频率,但似乎被匿名化,使得难以对媒体偏见有一个清晰的认识。没有某种方式来运用这个项目,只能依靠研究中呈现的选定例子。
后续研究可能会考虑不仅仅是话题的措辞,还有话题是否被报道,因为 沉默也具有政治性,并且往往反映出不仅仅是预算限制或其他实际因素的影响。
尽管如此,麻省理工学院的研究似乎是迄今为止最大的同类研究,可能会为未来分类系统和其他技术(如浏览器插件)提供框架,这些技术可能会提醒读者他们正在阅读的媒体的政治色彩。
泡沫、偏见和反弹
此外,需要考虑的是,这样的系统是否会加剧算法推荐系统中最具争议的方面之一——即读者可能永远不会看到相反或具有挑战性的观点,这可能会进一步巩固他们对核心问题的立场。
是否认为这样的 内容泡沫 是一个“安全环境”、对智力成长的障碍,还是对部分宣传的保护,这是一个价值判断——一个从机器学习系统的机械和统计角度难以解决的哲学问题。
此外,正如麻省理工学院的研究所努力的那样,让数据定义结果,短语的政治价值的分类也不可避免地是一种价值判断,这种判断很难抵抗语言的能力,即 重新编码 有毒或有争议的内容为新短语,这些短语不在手册、论坛规则或训练数据库中。
如果这种编码被嵌入到流行的在线系统中,似乎很可能会发展成人工智能识别偏见和出版商表达其立场的语言演化之间的一场冷战,这种语言旨在超越机器学习对语义的理解。
2021年9月14日 – 1:41 GMT+2 – 将“100家报纸”改为“100家新闻媒体”













