AI 模型与平台

Appen Limited 推出多样化数据训练集用于 NLP

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Appen Limited,一家为大规模构建 AI 系统的公司提供高质量训练数据的领先供应商,推出了新的多样化训练数据集,用于自然语言处理(NLP)项目。这些数据集将使最终用户能够在语言、方言、族语、口音、种族或性别方面获得相同的体验。

根据 2020 年 3 月 PNAS 发布的一份报告,流行的自动语音识别(ASR)系统,尤其是那些用于虚拟助手、字幕和无手计算的系统,往往在性能方面存在种族差异。这种情况在很大程度上是由于这些系统基于有偏见或不完整的数据,这就是为什么开发多样化的训练集如此重要的原因。

通过这次发布,Appen 旨在减少性能差异,创造一个更加包容的语音识别技术环境。同样的挑战也存在于语言解释和 NLP 系统中。

马克·布赖恩(Mark Brayan)是 Appen 的首席执行官。

“训练数据的质量和多样性直接影响 AI 模型的性能和偏见,”布赖恩说。“作为数据合作伙伴,我们可以为许多用例提供完整的训练数据,以确保 AI 模型适用于所有人。我们必须吸引一群多样化的个人来产生、标记和验证数据,以确保正在训练的模型不仅是公平的,也是负责任的。”

Appen 语言项目

Appen 通过其各种项目和合作伙伴关系,包括以下内容,试图创建一个多样化的 AI 环境:

  • 与无边界翻译组织(TWB)的合作伙伴关系:Appen 与 TWB、亚马逊、卡内基梅隆大学、Facebook (META ) 、谷歌、约翰霍普金斯大学、微软和 Translated 合作。该合作伙伴关系已加入COVID-19 语言翻译计划(TICO-19),该计划旨在通过支持多种语言的语言技术开发,扩大对 COVID-19 信息的访问。这些语言包括刚果斯瓦希里语、提格雷尼亚语和尼日利亚富拉尼语等发展中国家语言。
  • 加拿大法语翻译项目Appen 在与本土语言顾问协调后,帮助微软在微软翻译器中添加了“加拿大法语”作为语言选项。
  • 因纽特语翻译项目Appen 与努勒维特政府合作,促使微软将因纽特语添加到微软翻译器中。因纽特语是加拿大北极地区的原住民语言。
  • 非裔美国人白话英语(AAVE)现成数据集:通过与 AAVE 说话者合作并收集关于各种主题的对话数据,Appen 尝试创建代表 AAVE 的新训练数据集。

朱迪斯·毕晓普博士是 Appen 的人工智能专家高级总监。

“有偏见的 AI 数据会导致项目无法实现预期的商业结果,并对其预期受益者造成伤害,”毕晓普博士说。“AI 项目的规模和复杂性使得大多数公司无法在没有与 AI 数据专家的合作伙伴关系的情况下获得无偏见的高质量数据。Appen 致力于开发最多样化和最专业的数据注释员队伍,为构建公平和负责任的 AI 项目提供了一个明显不同的资源。”

Appen 得到了来自 170 多个国家的训练数据注释员的支持,其语言代表包括 235 种独特的语言和 395 种方言。它还提供现成数据集(OTS),使企业能够更快地为其 AI 项目获取高质量的训练数据。

Alex McFarland 是一名人工智能记者和作家,探索最新的人工智能发展。他曾与世界各地的众多人工智能初创公司和出版物合作。