AI 模型与平台

新的 AI 模型支持更广泛的人类语言

mm
将 Unite.AI 添加到您在 Google 上的首选来源

滑铁卢大学的研究人员开发了一个 AI 模型,使计算机能够处理更广泛的人类语言。这是在该领域的一个重要步骤,因为许多语言经常在编程过程中被忽略。非洲语言通常不会被计算机科学家关注,这导致了非洲大陆自然语言处理(NLP)能力的限制。

该语言模型由滑铁卢大学 David R. Cheriton 计算机科学学院的一组研究人员开发。

研究 在 2021 年经验性自然语言处理会议的多语言表示学习工作坊上进行了介绍。

该模型在帮助计算机分析非洲语言的文本方面发挥着关键作用,并被称为 AfriBERTa。它使用深度学习技术实现了对低资源语言的令人印象深刻的结果。

支持 11 种非洲语言

AfriBERTa 目前支持 11 种非洲语言,包括阿姆哈拉语、豪萨语和斯瓦希里语,总共有 4 亿多人使用。该模型展示了与现有最佳模型相当的输出质量,并且仅从 1GB 的文本中学习。其他类似模型通常需要数千倍的数据。

Kelechi Ogueji 是滑铁卢大学计算机科学专业的硕士生。

“预训练语言模型已经改变了计算机处理和分析文本数据的方式,包括机器翻译和问答等任务,” Ogueji 说。“不幸的是,非洲语言在研究社区中得到了很少的关注。”

“一个挑战是神经网络在构建时需要大量的文本和计算资源。与英语不同,英语有大量的可用文本,世界上大约 7,000 种语言中的大多数都可以被认为是低资源语言,因为没有足够的数据来满足数据饥渴的神经网络。”

预训练技术

大多数这些模型依赖于预训练技术,该技术涉及研究人员向模型展示带有隐藏或掩盖的某些单词的文本。然后,模型必须猜测隐藏的单词,并重复此过程数十亿次。它最终学习了单词之间的统计关联,这类似于人类的语言知识。

Jimmy Lin 是计算机科学 Cheriton 主席,也是 Ogueji 的导师。

“能够预训练模型,使其在某些下游任务中具有相同的准确性,但使用的数据量要小得多,这有很多优势,” Lin 说。“需要的数据量较少意味着计算量较小,碳排放量也较低。较小的数据集也使数据整理更加实用,这是减少模型中偏差的一种方法。”

“这项工作为将自然语言处理能力带给非洲大陆 13 亿多人迈出了一个小但重要的步骤。”

该研究还涉及 Yuxin Zhu,他最近在大学完成了计算机科学的本科学位。

Alex McFarland 是一名人工智能记者和作家,探索最新的人工智能发展。他曾与世界各地的众多人工智能初创公司和出版物合作。