AI 模型与平台
Appen Limited 推出多样化数据训练集用于 NLP
Appen Limited,一家为大规模构建 AI 系统的公司提供高质量训练数据的领先供应商,推出了新的多样化训练数据集,用于自然语言处理(NLP)项目。这些数据集将使最终用户能够在语言、方言、族语、口音、种族或性别方面获得相同的体验。
根据 2020 年 3 月 PNAS 发布的一份报告,流行的自动语音识别(ASR)系统,尤其是那些用于虚拟助手、字幕和无手计算的系统,往往在性能方面存在种族差异。这种情况在很大程度上是由于这些系统基于有偏见或不完整的数据,这就是为什么开发多样化的训练集如此重要的原因。
通过这次发布,Appen 旨在减少性能差异,创造一个更加包容的语音识别技术环境。同样的挑战也存在于语言解释和 NLP 系统中。
马克·布赖恩(Mark Brayan)是 Appen 的首席执行官。
“训练数据的质量和多样性直接影响 AI 模型的性能和偏见,”布赖恩说。“作为数据合作伙伴,我们可以为许多用例提供完整的训练数据,以确保 AI 模型适用于所有人。我们必须吸引一群多样化的个人来产生、标记和验证数据,以确保正在训练的模型不仅是公平的,也是负责任的。”
Appen 语言项目
Appen 通过其各种项目和合作伙伴关系,包括以下内容,试图创建一个多样化的 AI 环境:
- 与无边界翻译组织(TWB)的合作伙伴关系:Appen 与 TWB、亚马逊、卡内基梅隆大学、Facebook (META ) 、谷歌、约翰霍普金斯大学、微软和 Translated 合作。该合作伙伴关系已加入COVID-19 语言翻译计划(TICO-19),该计划旨在通过支持多种语言的语言技术开发,扩大对 COVID-19 信息的访问。这些语言包括刚果斯瓦希里语、提格雷尼亚语和尼日利亚富拉尼语等发展中国家语言。
- 加拿大法语翻译项目:Appen 在与本土语言顾问协调后,帮助微软在微软翻译器中添加了“加拿大法语”作为语言选项。
- 因纽特语翻译项目:Appen 与努勒维特政府合作,促使微软将因纽特语添加到微软翻译器中。因纽特语是加拿大北极地区的原住民语言。
- 非裔美国人白话英语(AAVE)现成数据集:通过与 AAVE 说话者合作并收集关于各种主题的对话数据,Appen 尝试创建代表 AAVE 的新训练数据集。
朱迪斯·毕晓普博士是 Appen 的人工智能专家高级总监。
“有偏见的 AI 数据会导致项目无法实现预期的商业结果,并对其预期受益者造成伤害,”毕晓普博士说。“AI 项目的规模和复杂性使得大多数公司无法在没有与 AI 数据专家的合作伙伴关系的情况下获得无偏见的高质量数据。Appen 致力于开发最多样化和最专业的数据注释员队伍,为构建公平和负责任的 AI 项目提供了一个明显不同的资源。”
Appen 得到了来自 170 多个国家的训练数据注释员的支持,其语言代表包括 235 种独特的语言和 395 种方言。它还提供现成数据集(OTS),使企业能够更快地为其 AI 项目获取高质量的训练数据。












