AI 模型与平台
安娜斯塔西娅·卢基娜,ETS高级研究科学家(NLP/语音)- 采访系列

安娜斯塔西娅·卢基娜是教育测试服务机构(ETS)的研究科学家,她在那里从事语音自动评分的工作。
她的研究兴趣涵盖了广泛的主题。她曾经从事过现代希腊方言、语音节奏和自动语调分析等方面的工作。
她的当前工作重点是将语音技术和机器学习的工具和方法与语音感知/产生研究的见解相结合,构建自动评分模型,以评估非母语语音。
您显然对语言有着浓厚的兴趣,什么让您对语言产生了这种热情?
我在俄罗斯圣彼得堡长大,小时候我对英语产生了兴趣:有些词汇有规律,可以将俄语单词“转换”成英语单词。然后我会遇到一些词汇,我的“模式”失效了,我会尝试找到更好的、更普遍的规律。当然,那时我还不知道语言类型学或同源词和借词的区别,但这激发了我的好奇心和学习更多语言的愿望。这种识别语言模式和测试数据的热情正是我从事语音学、机器学习和当前工作的动力。
在您从事自然语言处理(NLP)工作之前,您曾经是英语-俄语和现代希腊语-俄语的翻译。您认为您的翻译工作是否给您带来了对NLP中一些细微差别和问题的额外见解?
我的主要身份一直是研究人员。的确,我最初的学术生涯是作为现代希腊语的学者,或者更具体地说,是现代希腊语音韵学的研究者。我的博士论文探讨了现代希腊语的几个方言之间的音韵差异,以及这些差异如何与该地区的历史联系起来。我认为,这些差异可能是由于该地区语言接触的结果。虽然我不再从事现代希腊语的研究,但语言接触的变化仍然是我工作的核心:现在,我关注的是个体学习新语言时发生的变化,以及如何利用技术来实现这一点以达到最高效率。
英语中有很多口音,您如何设计一个NLP系统来理解所有这些不同的方言?这只是将更多的大数据从每种口音中输入到深度学习算法中吗?
过去,人们曾经使用过多种方法来解决这个问题。除了建立一个大型模型来涵盖所有口音外,您还可以先识别口音,然后使用自定义模型,或者尝试多个模型并选择最有效的模型。最终,要实现良好的性能,需要具有代表性的训练和评估数据,以涵盖系统可能遇到的多种口音。
在ETS,我们进行全面评估,以确保我们的自动系统产生的评分反映了我们要衡量的实际技能的差异,并且不会受到学习者的人口统计特征(如性别、种族或国籍)的影响。
儿童和/或语言学习者经常难以达到完美的发音。您如何解决发音问题?
没有所谓的“完美发音”:我们的说话方式与我们的身份密切相关,作为开发人员和研究人员,我们的目标是确保我们的系统对所有用户都是公平的。
语言学习者和儿童都对语音系统提出特定的挑战。例如,儿童的声音不仅具有不同的音质,而且儿童的说话方式也与成人不同,儿童之间也存在很大的差异。因此,开发儿童的自动语音识别系统通常是一个单独的任务,需要大量的儿童语音数据。
类似地,尽管来自同一背景的语言学习者之间存在许多相似之处,但学习者在使用音韵、语法和词汇模式方面可能存在很大的差异,使得语音识别成为一个特别具有挑战性的任务。当我们为英语语言能力评估建造系统时,我们使用来自不同语言水平和母语背景的语言学习者的数据。
2018年1月,您发表了题为“使用示例响应进行训练和评估自动语音评分系统”的论文。该论文中的一些主要突破和基本概念是什么?
在这篇论文中,我们研究了训练和测试数据的质量如何影响自动评分系统的性能。
自动评分系统,如许多其他自动系统一样,是在人类标记的数据上训练的。在这种情况下,这些是人类评分者分配的评分。人类评分者并不总是对评分达成一致。有几种策略被用于评估,以确保最终报告给测试者的评分在人类评分者之间的差异很小。然而,由于自动评分引擎通常使用响应级评分进行训练,因此,由于各种原因造成的人类评分的不一致可能会对系统产生负面影响。
我们能够获得大量具有不同人类评分者一致性水平的数据,并比较了在不同条件下系统的性能。我们发现,即使在训练数据中使用完美的数据,也不会比使用噪声标签的数据训练的系统表现得更好。当训练集很小时,完美标签只会带来优势。另一方面,人类标签的质量对系统评估产生了巨大的影响:如果您在干净的标签上进行评估,您的性能估计可能会高出30%。
主要结论是,如果您有大量数据和资源来清理您的金标准标签,那么清理评估集的标签可能比清理训练集的标签更明智。并且这一发现不仅适用于自动评分,还适用于其他许多领域。
您能否描述一下您在ETS的工作?
我从事语音评分引擎系统的开发,该系统处理教育环境中的口语。其中一个系统是SpeechRater,它使用先进的语音识别和分析技术来评估和提供英语语言口语能力的详细反馈。SpeechRater是一个非常成熟的应用程序,已经存在超过10年了。我为不同的应用程序构建评分模型,并与ETS的其他同事合作,以确保我们的评分对于所有测试者都是可靠、公平和有效的。我们还与ETS的其他团队合作,持续监测系统的性能。
除了维护和改进我们的运营系统外,我们还开发新的系统。其中一个我非常兴奋的项目是RelayReader:一个旨在帮助发展阅读者获得流利度和信心的应用程序。当使用RelayReader阅读时,用户会轮流聆听和朗读一本书。然后,他们的朗读会被发送到我们的服务器以提供反馈。从语音处理的角度来看,该应用程序的主要挑战是如何衡量学习并提供可行且可靠的反馈,而不会干扰读者对书籍的参与度。
您在ETS工作的最喜欢的部分是什么?
最初吸引我加入ETS的是它是一家非营利组织,致力于提高全球教育质量。虽然研究可能会带来产品,但我欣赏有机会从事一些基础性质的项目,这些项目将有助于未来的产品开发。我也珍视ETS对数据隐私和公平性的严肃态度,我们的所有系统在投入运营之前都会经过严格的评估。
但真正使ETS成为一个伟大工作场所的是它的人。我们拥有来自不同背景的科学家、工程师和开发人员的惊人社区,这使得合作非常有趣。
您是否认为AI会通过图灵测试?
自20世纪50年代以来,图灵测试的解释已经有很多种。可能存在一个共识,即图灵测试在哲学意义上尚未被通过:没有一个AI系统像人类一样思考。然而,这已经成为一个非常小众的话题。大多数人不构建系统来通过图灵测试:我们希望它们实现特定的目标。
对于某些任务,例如语音识别或自然语言理解,人类的性能可能被认为是金标准。然而,也有许多任务,我们希望自动系统做得比人类更好,或者自动系统和人类专家需要共同努力以达到最佳结果。例如,在教育环境中,我们不希望AI系统取代老师:我们希望它帮助老师,无论是识别学生学习轨迹中的模式、帮助评分还是找到最佳的教学材料。
您是否还有其他想分享的关于ETS或NLP的内容?
许多人只知道ETS的评估和自动评分系统。但我们做的远不止这些。我们拥有从语音生物识别到语音对话应用等多种能力,并且我们正在不断寻找将技术融入学习的新方法。现在,许多学生正在家中学习,我们已经向公众开放了一些我们的研究能力。
感谢这次采访,并感谢您对NLP和语音识别的最新进展提供的见解。任何希望了解更多信息的人都可以访问教育测试服务机构的网站。












