AI 模型与平台
新的 AI 模型支持更广泛的人类语言
滑铁卢大学的研究人员开发了一个 AI 模型,使计算机能够处理更广泛的人类语言。这是在该领域的一个重要步骤,因为许多语言经常在编程过程中被忽略。非洲语言通常不会被计算机科学家关注,这导致了非洲大陆自然语言处理(NLP)能力的限制。
该语言模型由滑铁卢大学 David R. Cheriton 计算机科学学院的一组研究人员开发。
该 研究 在 2021 年经验性自然语言处理会议的多语言表示学习工作坊上进行了介绍。
该模型在帮助计算机分析非洲语言的文本方面发挥着关键作用,并被称为 AfriBERTa。它使用深度学习技术实现了对低资源语言的令人印象深刻的结果。
支持 11 种非洲语言
AfriBERTa 目前支持 11 种非洲语言,包括阿姆哈拉语、豪萨语和斯瓦希里语,总共有 4 亿多人使用。该模型展示了与现有最佳模型相当的输出质量,并且仅从 1GB 的文本中学习。其他类似模型通常需要数千倍的数据。
Kelechi Ogueji 是滑铁卢大学计算机科学专业的硕士生。
“预训练语言模型已经改变了计算机处理和分析文本数据的方式,包括机器翻译和问答等任务,” Ogueji 说。“不幸的是,非洲语言在研究社区中得到了很少的关注。”
“一个挑战是神经网络在构建时需要大量的文本和计算资源。与英语不同,英语有大量的可用文本,世界上大约 7,000 种语言中的大多数都可以被认为是低资源语言,因为没有足够的数据来满足数据饥渴的神经网络。”
预训练技术
大多数这些模型依赖于预训练技术,该技术涉及研究人员向模型展示带有隐藏或掩盖的某些单词的文本。然后,模型必须猜测隐藏的单词,并重复此过程数十亿次。它最终学习了单词之间的统计关联,这类似于人类的语言知识。
Jimmy Lin 是计算机科学 Cheriton 主席,也是 Ogueji 的导师。
“能够预训练模型,使其在某些下游任务中具有相同的准确性,但使用的数据量要小得多,这有很多优势,” Lin 说。“需要的数据量较少意味着计算量较小,碳排放量也较低。较小的数据集也使数据整理更加实用,这是减少模型中偏差的一种方法。”
“这项工作为将自然语言处理能力带给非洲大陆 13 亿多人迈出了一个小但重要的步骤。”
该研究还涉及 Yuxin Zhu,他最近在大学完成了计算机科学的本科学位。












