访谈

艾普恩(Appen)高级AI专家高级总监朱迪斯·毕晓普博士 – 采访系列

mm
将 Unite.AI 添加到您在 Google 上的首选来源

朱迪斯·毕晓普博士是艾普恩(Appen)公司APAC/US地区的高级AI专家高级总监。她领导并发展了一支顶尖的语言学家、计算语言学家和人类交流专家团队,致力于提供高质量和速度的AI训练数据。

是什么最初吸引你学习语言学?

我第一次听说语言学是在高中时的一位英语老师那里。我是那些同时对外语、人文和数学、科学科目都感兴趣的孩子之一。语言学是研究语言如何工作的科学,所以它让我把这些兴趣结合起来。就像很多人一样,一旦我了解了它,我就完全被吸引住了。有什么比我们如何向对方传达思想和情感更令人着迷呢?语言学探索了语言结构,尽管声音和书写系统有所不同,但在表面下往往是相似的,因为所有这些都是人类共同存在的产物。

您能否分享您如何开始从事AI工作的故事?

我从2004年开始在艾普恩(Appen)工作,支持语言技术产品和服务的开发。随着时间的推移,AI已经成为一个全面的框架、使命和愿景,用于模拟和扩展人类的沟通、推理和感知能力。2019年,我的团队将自己重新命名为AI专家,认识到我们的语言学和语言知识对于AI企业至关重要。我们的注释数据为AI产品和服务的成功提供了必要的支持。

您已经从事AI工作超过16年了,您见过的最大的变化是什么?

主要的转变是从核心技术开发转向了对用例和应用的关注。我的大部分职业生涯中,语言基于AI的重点是开发和完善一套模拟人类语音感知和产生的核心模型,例如语音识别、语音合成和自然语言处理。数据集通常遵循常见的标签和数据采样标准和惯例,例如由Speecon联盟(Speech-Driven Interfaces for Consumer Devices)开发的标准。这些标准使核心技术开发人员能够在常见的数据结构上benchmark他们的性能,并支持AI的快速发展。

然而,近年来AI用例的普遍扩展带来了对更专门的数据类型的认识,这些数据类型需要对核心、通用AI模型进行进一步的调整。此外,这些模型必须在所有人类输入的多样性中进行训练或更新,包括所有方言、口音、民族、性别和其他人类差异的维度。

您能否讨论无偏见数据在机器学习中的重要性?

机器学习模型,无论是监督学习、无监督学习还是强化学习模型,都会反映出训练数据中的偏见。Alyssa Simpson Rochwerger和Wilson Pang在他们最近的书《Real World AI》中提供了几个很好的例子。如果某个人群的训练数据不足,AI模型对于该人群的准确性就会降低。

在另一个常见的情况下,人群的代表性可能足够,但如果训练数据包含反映实际但不理想的世界条件的数据点之间的关联(例如女性的全职就业率较低,或者非裔美国人的监禁率较高),则由此产生的AI应用程序可能会强化和延续这些条件。

语言中的关联可以在依赖统计关系的NLP应用程序中产生偏见,例如词嵌入。如果“她”和“护士”在训练数据中比“他们”或“他”和“护士”更频繁地关联,则生成的应用程序将使用“她”作为单数代词来指代护士。为了解决这个问题,研究人员最近开发了一种中性词嵌入算法的变体,称为GN-GloVe。

在敏感应用中,这些偏见问题可能会对用户产生毁灭性的影响,并可能消除商业投资。好消息是,除了开发新的、更透明和包容的数据集外,越来越多的数据科学应用程序正在被开发,以检查现有的训练数据集和AI应用程序中偏见的存在。

艾普恩(Appen)最近推出了新的多样化训练数据集,用于自然语言处理(NLP)计划。您能否分享一些有关这些数据集如何使最终用户能够获得相同的体验,无论其语言、方言、族群方言、口音、种族或性别如何?

出于上述原因,需要数据集来纠正现有的AI生产系统中的偏见,以及用于训练未来的系统的更包容的数据集。您提到的艾普恩数据集将支持纠正与族群和相关族群方言(例如非裔美国人方言英语)相关的偏见。它们将为AI语言模型提供补充训练数据,以提高这些人群在AI语言模型中的代表性。

族群正在成为AI数据中的一个关键人口维度,需要显式标注。语言学家将与特定族群相关的语言变体称为“族群方言”。AI数据提供商如艾普恩现在认识到,除非关键的多样化和少数群体在AI训练数据集中被明确代表,否则我们无法确保生成的系统对这些群体的性能相同。

相同的性能意味着系统以相同的准确性识别用户的词语和意图(它们的含义或要执行的操作),并且在某些情况下,情感;并且它以满足用户需求的方式做出响应,并且不会对特定用户群体产生更负面的影响,无论是实际的还是心理上的。

除了AI之外,您还是一位诗人,拥有多首获奖诗歌。您如何看待未来AI展现出这种创造力,包括写诗?

这是一个很有趣的问题。诗歌和其他形式的人类创造力都依赖于我们的全部人类资源,包括记忆、感知、感觉和情感,以及语言和图像的结构和细微差别,来产生与当代问题产生共鸣的见解。艾米丽·迪金森写道:“如果我读一本书,它让我全身发冷,没有火可以温暖我,我知道那是诗。如果我感觉到我的头顶被掀开,我知道那是诗。”必须有感知、感觉或情感的认可,但也必须有真正的惊讶。

高级AI模型,如GPT-3,统计了不同体裁中单词共同出现的可能性,包括诗歌。这意味着它们可以生成我们认为是“诗意”的语言,例如使用高级词汇、韵律和意外或超现实的单词组合。但是,这些生成语言模型缺乏产生一件能阐明人类存在意义的艺术作品所需的大部分资源。

我认为AI在创造性背景下的潜力令人信服的是,它能够产生完全新的见解——这些见解与任何单个人类思维(即使是最博学或最有经验的思维)都不同。只要AI能够持续访问感知和感知数据进行分析,就会有广阔的创造性探索领域等待我们。AI的分析能力可能会为人类探索带来新的肥沃土壤。

您已经拥有了非常出色的职业生涯,在您看来,什么阻碍了更多女性加入STEM领域,特别是AI领域?

缺乏榜样可以是一个强大的因素(也是一个恶性循环)。在文化、社会和实际上,打破女性和其他多样性性别人群尚未拥有深厚基础的领域是一个真正的挑战。我的领导经验一次又一次地表明,具有多样化经验和观点的团队可以是多么有韧性、创造力和成功。领导者需要在招聘中大胆,并勇敢地面对多样化视角带来的挑战,知道这种勇气也与财务和企业成功密切相关。

您是否还有其他想分享的关于艾普恩或AI的一般信息?

像艾普恩这样的数据提供商有着强大的潜力,通过提供包容性的训练数据来影响AI的结果,从而使其变得更好。

然而,要实现包容性AI的目标,需要每个人都参与。数据买家也必须认识到他们的责任,明确要求并支付能够确保他们的系统在现实世界中为所有用户提供最佳性能的包容性数据。并且,必须让那些为AI开发提供数据的多样化社区能够信任他们的数据将被如何使用。建立这种信任需要所有处理敏感数据的人都具有强大的透明度和道德实践。

感谢这次精彩的采访,我很高兴能够更多地了解您对AI和语言学的看法。希望了解更多的读者可以访问艾普恩(Appen)网站。

安托万是一位具有远见的领导者和Unite.AI的联合创始人,他对塑造和推广人工智能和机器人技术的未来充满热情。作为一位连续创业者,他相信人工智能将对社会产生电力的影响一样的颠覆性影响,并经常对颠覆性技术和通用人工智能的潜力大加赞扬。

作为一位未来学家Securities.io的创始人,这是一个专注于投资尖端技术的平台,这些技术正在重新定义未来并重塑整个行业。