Anderson 视角
基于人工智能的偏见检查工具包,适用于新闻文章,现已在Python中提供

加拿大、印度、中国和澳大利亚的研究人员合作开发了一个免费的Python包,可以有效地识别和替换新闻稿中的“不公平语言”。
该系统被称为Dbias,它利用各种机器学习技术和数据库开发了一个三阶段的循环工作流程,可以精炼有偏见的文本,直到返回一个无偏见或至少更中立的版本。
该系统代表了一个可重用的、自成体系的管道,可以通过Pip从Hugging Face安装,并作为一个补充阶段、插件或附加组件集成到现有的项目中。
四月份,谷歌文档中实施了类似的功能,受到批评,主要是因为其缺乏可编辑性。相比之下,Dbias可以更有选择性地在任何用户希望的新闻语料库上进行训练,并保留开发定制公平指南的能力。
关键的区别在于,Dbias管道旨在自动将“加载语言”(为事实通信添加批判层的词语)转换为中立或平凡的语言,而不是让用户接受持续的教育。基本上,用户将定义道德过滤器并相应地训练该系统;在谷歌文档的方法中,该系统正在——可以说——训练用户,以一种单方面的方式。

Dbias工作流的概念架构。
根据研究人员的说法,Dbias是第一个真正可配置的偏见检测包,与迄今为止在自然语言处理(NLP)这一子领域中特征的现成组装项目不同。
新论文的标题为确保新闻文章公平性的方法,来自多伦多大学、多伦多大都会大学、班加罗尔环境资源管理公司、中国深蓝科学院和悉尼大学的贡献者。
方法
Dbias的第一个模块是偏见检测,它利用DistilBERT包——谷歌的机器学习模型BERT的高度优化版本。对于这个项目,DistilBERT在媒体偏见注释(MBIC)数据集上进行了微调。

MBIC由来自各种媒体来源的新闻文章组成,包括Huffington Post、USA Today和MSNBC。研究人员使用了该数据集的扩展版本。
虽然原始数据是由众包工人注释的(这种方法在2021年底受到批评),但论文的研究人员能够在数据集中识别出额外的未标记的偏见实例,并手动追加了这些实例。识别出的偏见实例与种族、教育、民族、语言、宗教和性别有关。
下一个模块是偏见识别,它使用命名实体识别(NER)来识别输入文本中的有偏见的词语。论文指出:
‘例如,新闻“不要相信关于龙卷风和气候变化的伪科学宣传”被前面的偏见检测模块分类为有偏见,而偏见识别模块可以识别“伪科学宣传”这个词为有偏见的词。’
NER并不是专门为这个任务设计的,但它已经被使用过,尤其是用于2021年达勒姆大学的一个项目。
在这个阶段,研究人员使用了RoBERTa,结合SpaCy English Transformer NER管道。

下一个阶段是偏见掩蔽,它涉及对识别出的偏见词语进行多重掩蔽,这个过程在多个识别出的偏见词语的情况下是顺序进行的。

Dbias的第三个阶段中,加载语言被替换为务实语言。注意“嘴巴”和“使用”等同于相同的动作,尽管前者被认为是轻蔑的。
如有必要,该阶段的反馈将被发送回管道的开始,以便进一步评估,直到生成一定数量的适当的替代短语或词语。这个阶段使用了掩蔽语言建模(MLM),按照Facebook Research领导的2021年合作的方式进行。
通常,MLM任务会随机掩蔽15%的词语,但Dbias工作流程会将识别出的有偏见的词语作为输入。
该架构是在Google Colab Pro上实现和训练的,使用NVIDIA P100,具有24GB的VRAM,批量大小为16,仅使用两个标签(有偏见和无偏见)。
测试
研究人员将Dbias与五种可比拟的方法进行了比较:LG-TFIDF,使用逻辑回归和TfidfVectorizer的TFIDF词嵌入;LG-ELMO;MLP-ELMO(一个包含ELMO嵌入的前馈人工神经网络);BERT;和RoBERTa。
用于测试的指标包括准确率(ACC)、精度(PREC)、召回率(Rec)和F1评分。由于研究人员不知道任何可以在单个管道中完成所有三个任务的现有系统,因此,对于竞争框架进行了特殊处理,只评估Dbias的主要任务——偏见检测和识别。

Dbias试验结果。
Dbias在所有竞争框架中都取得了更好的结果,包括那些具有更重的处理负载的框架。
论文指出:
‘结果还表明,深度神经嵌入通常可以在偏见分类任务中超越传统的嵌入方法(例如TFIDF)。这是因为ELMO(深度神经网络嵌入)与LG结合使用时比TFIDF向量化更好的性能所证明的。’
‘这可能是因为深度神经嵌入可以更好地在不同上下文中捕捉文本中的单词的上下文。深度神经嵌入和深度神经方法(MLP、BERT、RoBERTa)也比传统的机器学习方法(LG)表现更好。’
研究人员还指出,基于Transformer的方法在偏见检测中优于其他方法。
另外,测试还包括Dbias与各种SpaCy Core Web版本(包括core-sm(小)、core-md(中)和core-lg(大))的比较。Dbias也在这些试验中领先。

研究人员得出结论,偏见识别任务通常在更大、更昂贵的模型中表现更好,可能是由于参数和数据点的增加。他们还指出,该领域未来的工作的有效性将取决于更大的努力来注释高质量的数据集。
森林和树木
希望这种细致的偏见识别项目最终能够被纳入能够采取更广阔视野的偏见探测框架中,并考虑到选择报道任何特定故事本身就是一个偏见的行为,这可能是由不仅仅是报告的浏览统计数据驱动的。
最初发表于2022年7月14日。













