Anderson 视角
德国自动翻译模型的高碳足迹

新的研究表明,机器学习翻译模型产生的碳足迹指出,德语可能是训练最耗碳的流行语言,尽管原因尚不完全清楚。新的报告旨在开辟更多的研究途径,以探索更节能的AI训练方法,在人们越来越意识到机器学习系统消耗电力的情况下。
预印本论文题为《抑制您的碳排放:机器翻译中的碳排放基准》,来自印度Manipal理工学院的研究人员。
作者测试了各种可能的跨语言翻译模型的训练时间,并计算了碳排放值,发现“显著的差异” zwischen 三个最耗碳的语言对和三个最节能的模型。

平均10个epoch的训练期间释放的碳排放量。左侧使用ConvSeq,右侧使用Transformers。 来源:https://arxiv.org/pdf/2109.12584.pdf
该论文发现,训练最“环保”的语言对是英语>法语、法语>英语和德语>英语,而德语出现在所有最高耗能对中:法语>德语、英语>德语和德语>法语。
复利
研究结果表明,词汇多样性“与达到适当性能水平的训练时间成正比”,并指出德语在三个测试语言中具有最高的词汇多样性评分,如其类型-令牌比率(TTR)所估计的——基于文本长度的词汇大小的衡量标准。
在翻译模型中处理德语的增加的需求并没有在用于实验的源数据中体现出来。事实上,源数据中生成的德语令牌(299445)少于英语(320108),远少于法语(335917)。

从自然语言处理(NLP)角度来看,挑战是将复合德语单词分解为组成单词。NLP系统通常必须在没有预先分割的周围语法或上下文线索的情况下为德语执行此操作,而这些线索可以在英语等TTR评分较低的语言中找到。这个过程称为复合拆分或去复合。
德语有一些世界上最长的单个单词,尽管在2013年,它失去了对其65个字符的前记录保持者的官方认可,这足以要求在本文中占用一行:
Rindfleischetikettierungsueberwachungsaufgabenuebertragungsgesetz
这个词指的是一个委托牛肉标签监控的法律,但由于欧洲法规的变化而失去了存在意义,承认其他流行的长单词,如“多瑙河蒸汽船公司船长的遗孀”(49个字符):
Donaudampfschifffahrtsgesellschaftskapitaenswitwe
一般来说,德语的句法结构需要偏离支撑许多西方语言的NLP实践中的词序假设,流行的(柏林基于的)spaCY NLP框架采用了自己的本地语言模型。

英语和德语短语中的投影映射,展示了德语中词汇元素之间的复杂相互关系。 来源:https://explosion.ai/blog/german-model
数据和测试
对于源数据,研究人员使用了Multi30k数据集,包含30,000个样本,涵盖法语、德语和英语。
研究人员使用的第一个模型是Facebook AI 2017年的卷积序列到序列(ConvSeq),它是一个包含卷积层但没有循环单元的神经网络,而是使用滤器从文本中提取特征。这使得所有操作都可以在计算上高效的并行方式下执行。
研究人员使用的第二种方法是Google 2017年的有影响力的Transformers架构。Transformers使用线性层、注意力机制和归一化例程。虽然原始发布的模型已受到批评,因碳效率低下,但随后的改进存在争议。
实验在Google Colab上进行,均匀地在Tesla K80 GPU上进行。使用BLEU(双语评估)评分指标和CodeCarbon机器学习排放计算器比较语言。数据在10个epoch上训练。
发现
研究人员发现,德语相关语言对的训练时间延长是导致碳消耗增加的原因。虽然其他一些语言对,例如英语>法语和法语>英语,具有更高的碳消耗,但它们训练得更快,解决得更容易,这些消耗的突然增加被研究人员描述为“相对于包含德语的语言对的消耗来说相对较不重要”。

按编码器/解码器碳排放分析语言对。
研究人员得出结论:
‘我们的研究结果清楚地表明,一些语言对比其他语言对训练更耗碳,这种趋势在不同的架构中都存在。’
他们继续说:
‘然而,仍然存在一些未解答的问题,例如为什么训练某种语言对的模型比训练其他语言对的模型更耗碳,以及是否有一些架构更适合这些耗碳的语言对,为什么会这样,如果真是这样的话。’
该论文强调,训练模型的碳消耗差异的原因尚不完全清楚。他们预计将在非拉丁语系语言中发展这一研究方向。
格林尼治标准时间下午1:20 – 更正文本错误。












