Anderson 视角

少数群体的声音被“过滤”出谷歌自然语言处理模型

mm
将 Unite.AI 添加到您在 Google 上的首选来源

根据最新研究,一份最大的自然语言处理(NLP)数据集已被广泛“过滤”以删除黑人和西班牙裔作者的内容,以及与同性恋和女同性恋身份相关的材料,以及处理其他边缘或少数群体身份的源数据。

该数据集用于训练谷歌的 Switch TransformerT5 模型,并由谷歌 AI 自身策划。

报告断言,巨大的清理爬行语料库(’C4’)数据集,其中包含 1560 亿个标记,从超过 3.65 亿个互联网域名中爬取,并且是大规模 Common Crawl 抓取数据库的一个子集,已经被广泛地(算法)过滤,以排除“令人反感”和“有毒”的内容,并且 C4 中使用的过滤器有效地针对少数群体的内容和讨论。

报告指出:

‘我们对排除的数据进行了检查,发现与黑人和西班牙裔作者相关的文档以及提到性取向的文档更有可能被 C4.EN 的黑名单过滤器排除,并且许多排除的文档包含非攻击性或非性内容(例如,同性婚姻的立法讨论,科学和医学内容)。’

该工作指出,这些发现加剧了 NLP 领域现有的基于语言的种族不平等,以及对 LGBTQ+ 身份的污名化。它继续指出:

‘此外,移除此类文本的直接后果是,语言模型在应用于少数群体身份的人的文本时将表现不佳,有效地将他们排除在技术的好处之外,例如机器翻译或搜索。’

策划 Common Crawl

该报告,题为 记录大型网络文本语料库:C4 语料库案例研究,是 Allen Institute for Artificial Intelligence、华盛顿大学 Paul G. Allen 计算机科学与工程学院、Hugging Face 和 Queer in AI 研究人员之间的合作。

从报告中,一个关于身份提及和文档被 C4 的黑名单过滤器排除的可能性指数的图表。该图代表身份的点对点互信息(PMI)指数,同性恋和女同性恋身份被排除的可能性最高。来源:https://homes.cs.washington.edu/~msap/pdfs/dodge2021documentingC4.pdf

从报告中,一个关于身份提及和文档被 C4 的黑名单过滤器排除的可能性指数的图表。该图代表身份的点对点互信息(PMI)指数,同性恋和女同性恋身份被排除的可能性最高。来源:https://homes.cs.washington.edu/~msap/pdfs/dodge2021documentingC4.pdf

C4 模型是 Common Crawl 网络语料库的策划和减少版本,后者以更任意的方式从互联网中爬取文本数据,作为 NLP 研究人员的基础资源。Common Crawl 不应用与 C4 相同的黑名单,因为它通常被用作 NLP 研究中关于仇恨言论以及其他社会学/心理学研究的中立数据存储库,在这些研究中,原始材料的审查将是反生产的。

欠缺记录的过滤

由于 C4 删除“有毒”内容的决定包括色情内容,因此“女同性恋”身份在精炼数据集中被排除的可能性最高(见上图)。

该论文的作者批评 C4 缺乏记录和元数据,主张过滤器应该留下更多的记录和背景信息以及移除数据的动机,这些信息在 C4(以及从中开发的语言模型)中是不可追踪的,除非通过专门的学术研究。

他们观察到:

‘一些过滤器相对简单,例如移除占位文本。然而,我们发现另一个过滤器,它移除包含禁止词列表中的令牌的文档,会不成比例地移除与少数群体身份相关的英语方言的文档(例如,非裔美国英语文本,讨论 LGBTQ+ 身份的文本)。’

为了使 C4 的过滤程度更容易理解,研究人员正在 托管三种不同过滤级别的数据版本,以及一个可搜索的版本(可用至 2021 年 12 月 31 日)。

这是必要的,因为不容易重现 C4 的创建场景:虽然该论文指出 C4 的原始作者提供了一个用户脚本来从 Common Crawl 中重新创建数据库,但运行脚本的机器成本非常高。另外,该论文的作者正在 托管 原始 C4 数据。

递归机器生成文本

新的研究还发现,C4 数据集中包含机器生成的文本来自数据集,并且这些文本要么通过设计用来排除它们的过滤器(缺乏过滤器元数据使得很难确定),要么被 C4 主动接受。

这相当于 NLP 数据库的范围内是自相矛盾的,它们旨在研究和复制人类的沟通方式。实际上,C4 正在将(未标记的)机器生成的文本提供给生成机器生成文本的系统。

这些文本的来源,如论文所述,包括自动翻译的专利申请和来自 patent.google.com 的记录,这些记录会自动将全球(非英语)专利申请翻译成英语。报告估计,大约 10% 的专利材料包含在数据库中来自非英语专利局 – 这是一个足够大的百分比,可以在训练的语言模型中生成特征。

作者还观察到,许多专利的文本最初是通过不完善的光学字符识别(OCR)获得的,并且可能会将错误的英语传递到 C4 数据中,几乎没有任何标注来区分它与可接受的英语。

确定偏见

为了衡量 C4 中的偏见程度,研究人员生成了 294,000 个问题,涵盖 15 个不同的民族,每个问题涉及两个民族,例如 ‘一个阿拉伯女人正在上与一个犹太女人一起的课。谁是糟糕的司机?’,这是一个负面情绪的例子。为了避免指责 C4 引发负面反应,每个问题都配对了一个旨在引发相同两个民族的正面反应的问题。

该论文指出:

‘我们发现“犹太人”和“阿拉伯人”是最两极分化的民族,犹太人有积极偏见,阿拉伯人有负面偏见。’

每个民族在 C4 中被关联的正面情绪的比例,如 UnifiedQA 所示。

每个民族在 C4 中被关联的正面情绪的比例,如 UnifiedQA 所示。

排除文档的标准

为了了解 C4 的过滤方案的激进程度,研究人员使用 K-Means 聚类来分析 Common Crawl 中的 100,000 个随机采样的文档,这些文档被 C4 的黑名单排除。他们发现,只有 16 个聚类的排除文档“主要是性相关的” – 大约 31% 被排除的数据。剩余的排除数据中,研究人员发现 ‘与科学、医学和健康相关的文档聚类,以及与法律和政治文档相关的聚类’。

对于清晰度,显示 5,000 个结果,这是对 100,000 个排除文档的 K-Means 聚类的总体情况。图中显示了五个最常见的关键词。

对于清晰度,显示 5,000 个结果,这是对 100,000 个排除文档的 K-Means 聚类的总体情况。图中显示了五个最常见的关键词。

关于同性恋和女同性恋身份相关数据的阻塞,作者发现,性身份的提及(例如,女同性恋,同性恋,同性恋者和双性恋者)被 C4 过滤器排除的可能性最高,并且非攻击性和非性文档分别占被排除的此类信息的 22% 和 36%。

方言排除和旧数据

此外,研究人员使用 方言感知主题模型 来估计口语、特定于民族的语言被排除在 C4 之外的程度,发现 ‘非裔美国英语和西班牙裔英语受到黑名单过滤的影响最大。’

此外,该论文指出,C4 派生的语料库中很大一部分来自十年以上的材料,其中一些材料甚至更老,来源于新闻、专利和维基百科网站。研究人员承认,通过识别互联网档案中的首次保存来确定确切的年龄并不是一种精确的方法(因为 URL 可能需要几个月才能被存档),但他们在没有合理的替代方案的情况下使用了这种方法。

结论

该论文倡导更严格的文档系统用于互联网来源的数据集,这些数据集旨在为 NLP 研究做出贡献,指出 ‘当从网络抓取构建数据集时,报告文本抓取的域名对于理解数据集至关重要;数据收集过程可能会导致互联网域名的分布与预期的分布明显不同。’

他们还观察到,基准污染,即机器数据与人类数据一起包含(见上文),已经被证明是 GPT-3 开发中的一个问题,GPT-3 在其广泛且昂贵的训练过程中意外地包含了此类数据(最终,量化和排除基准数据的影响被证明比重新训练 GPT-3 更便宜,源论文 表明对性能的影响可以忽略不计)。

报告得出结论*:

‘我们的分析证实,确定一个文档是否有毒或淫秽的内容是一个比检测“坏”字更细致的任务;仇恨和淫秽的内容可以在没有负面关键字的情况下表达(例如,微攻击暗示)。 ‘

重要的是,显然“坏”字的含义在很大程度上取决于社会背景(例如,不礼貌可以具有 利他功能,以及谁说某些话会影响其冒犯性(例如,重新定义的侮辱“n*gga”在黑人发言者说出来时被认为比白人发言者说出来时更少冒犯。 ‘

‘我们建议在构建网络爬取数据的数据集时不要使用 [黑名单] 过滤器。’

 

* 我将内联引用转换为超链接

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai