AI 模型与平台

Facebook 开发了可以直接翻译 100 种不同语言的机器翻译模型

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Facebook最近开发了一个新的机器翻译模型,可以在100种语言中任意翻译文本。虽然其他机器翻译系统存在,但大多数其他AI翻译系统首先将文本翻译成英语,然后再将其转换为其他语言。 据Engadget报道,Facebook的AI翻译器不需要使用英语作为中间语言,据报道其准确率约为90%。

Facebook的AI模型训练数据由大约7.5亿对句子组成,分布在100种不同的语言中。这些数据是使用一系列网页爬虫从网上收集的,并使用名为FastText的语言模型来识别收集的数据中的语言。收集数据后,使用LASER 2.0工具来提取不同句子样本的含义,并根据其含义将不同语言中的句子匹配在一起。 LASER 2.0由Facebook开发,采用无监督学习算法来创建嵌入。句子嵌入包含有关不同句子之间关系的信息,例如使用频率和句子之间的接近程度。 LASER 2.0可以创建具有高度相似含义的句子对。

训练数据不仅仅是基于句子含义配对的。语言本身也被分组在一起。目标是设计一个不需要使用英语作为两种语言之间的中间语言的系统,Facebook的Angela Fan领导了该项目,并指出世界各地有许多地区说着两种非英语语言。 Facebook工程师通过关注经常相互翻译的语言配对来进行训练。根据文化、语言相似性和地理位置等变量,创建了14个不同的语言组。例如,研究人员创建的一个语言组包含印度最常见的语言,包括乌尔都语、泰米尔语、印地语和孟加拉语。这样,常见的语言配对将获得高质量的翻译。

语言组专注的训练方法得到了有趣的结果。发现所得到的翻译模型对于某些语言配对具有比现有模型更高的准确率。例如,当翻译英语和白俄罗斯语时,AI可以应用它在翻译俄语时学到的某些模式,因为白俄罗斯语与俄语有语言相似性。同样,西班牙语和葡萄牙语之间的翻译工作得到了改进,因为西班牙语是第二种最广泛使用的语言,并且有大量的训练数据用于此任务。

大约有60种语言翻译系统尚未涵盖,模型在没有大量训练数据的语言上的准确率需要在投入使用之前得到改进。东南亚和非洲的许多语言缺乏训练可靠模型所需的数据量。研究团队需要找到一种方法来弥补这一缺乏的数据。研究团队还需要确定如何控制模型可能学到的任何种族主义、性别歧视或其他不雅的模式。虽然研究团队使用了一个亵渎过滤器,但该过滤器主要用于英语数据。

机器翻译系统尚未在Facebook的社交媒体平台上使用。当前模型仅用于研究目的。然而,Facebook正在准备设计类似的模型,并让它们处理该网站每天收到的约200亿个翻译请求。

博客作者和程序员,专攻 Machine Learning Deep Learning 领域。Daniel 希望帮助他人利用 AI 的力量为社会做好事。