Anderson 视角
苹果公司解决性别化语言翻译的方法

苹果公司刚刚与南加州大学合作发表了一篇论文,探讨了iOS18操作系统中用于提供用户更多性别选择的机器学习方法。

在iOS18中,用户可以在原生翻译应用中选择替代性别建议来翻译单词。来源:https://support.apple.com/guide/iphone/translate-text-voice-and-conversations-iphd74cb450f/ios
虽然这项工作涉及当前关于性别定义的辩论,但它关注的是一个更老的问题:84种已知语言中,有229种语言使用基于性别的性别系统。

红点表示使用基于性别的性别系统的语言。来源:https://wals.info/feature/31A#map
令人惊讶的是,英语属于基于性别的类别,因为它分配了阳性或阴性单数代词。
相比之下,所有罗曼语族语言(包括超过5亿西班牙语使用者)和其他语言,如俄语,需要性别协议,这迫使翻译系统处理语言中的性别分配。
新论文通过观察所有可能的西班牙语翻译来说明这一点,例如句子《秘书对老板很生气》。

从新论文中,一个例子是句子’The secretary was angry with the boss’从英语翻译成西班牙语的潜在性别分配。来源:https://arxiv.org/pdf/2407.20438
天真地翻译远远不够,尤其是对于可能在开始时建立性别并且之后不再提及性别的长文本。然而,翻译必须记住整个文本中分配的性别。
这对基于令牌的方法来说可能是一个挑战,这些方法以离散的块处理翻译,并且可能会在整个内容期间丢失分配的性别上下文。
更糟糕的是,提供替代翻译来纠正偏见性别分配的系统不能随意地做到这一点,例如,只是替换性别名词,而必须确保语言的所有其他部分都同意改变的性别名词。
在苹果/南加州大学论文中的这个例子中,我们看到虽然《秘书》被分配了男性性别,但单数过去时《was》仍然是女性(《estaba》)。

蛮力性别替换可能会忽略必要的性别协议。在这个例子中,单词’enojada’应该是’enojado’,以符合阳性’El secretario’。
性别问题
在新论文中,苹果和南加州大学的研究人员提出了一个半监督方法来将性别模糊实体转换为实体级别的替代方案。
该系统,用于告知苹果翻译应用在iOS18中的翻译,通过使用大型语言模型和微调预训练的开源机器翻译模型来构建语言模式。
从这些系统中获得的翻译结果然后被训练到一个包含性别结构的体系中,这些结构是包含不同性别化名词的短语组,代表相同的实体。
论文指出:
‘训练数据中的性别偏见会渗透到自然语言处理系统中,导致这些偏见的传播和放大。这些偏见往往也是错误的根源。 ‘
‘机器翻译系统可能会将“医生”翻译成西班牙语的“médico”(阳性)而不是“médica”(阴性),假设输入的是“The doctor asked the nurse to help her in the procedure”。 ‘
‘为了避免错误的性别分配,机器翻译系统需要通过上下文消除性别歧义。当不能通过上下文确定正确的性别时,提供覆盖所有有效性别选择的多个翻译替代方案是一个合理的方法。 ‘
研究人员开发的方法有效地将翻译从单个令牌转换为用户控制的数组。
虽然这篇论文没有提到,但这为用户选择反馈到模型的后续迭代打开了可能性,或者在提供翻译服务的类似门户中。
该模型在GATE和MT-GenEval测试集上进行了评估。GATE包含最多有3个性别模糊实体的源句子,而MT-GenEval包含无法推断性别的材料,这有助于理解何时不应向用户提供替代性别选项。
在两种情况下,测试集都需要重新注释以符合项目的目标。
为了训练系统,研究人员依赖于一种新型的自动数据增强算法,与传统的基于规则的方法不同,他们微调了一个预训练的BERT语言模型在G-Tag数据集上。
为苹果公司策划的数据集包括Europarl、WikiTitles和WikiMatrix。语料库被分成G-Tag(包含12,000个句子),其中包括带有性别模糊注释的句子,以及G-Trans(包含50,000个句子),其中包含性别模糊实体和性别对齐。
作者声称:
‘据我们所知,这是第一个包含性别模糊性以及它们对翻译中性别化形式的影响的大规模语料库。 ‘
数据集和项目的多样化数据已在GitHub上公开。数据集包含五种语言对,英语与俄语、德语、法语、葡萄牙语和西班牙语相对比。
研究人员利用2019年的一种先前方法来赋予模型输出性别对齐的能力,使用交叉熵损失和额外的对齐损失进行训练。
再次审视
对于检测到的模糊性别实体,苹果和南加州大学探索了两种方法:微调预训练的语言模型和使用大型语言模型。
关于第一种方法,论文指出:
‘我们在G-Trans数据集的二元文本上微调了预训练的MT模型M。二元文本的源句子包含带有<M>/<F>标签的模糊实体,目标翻译具有正确的性别变格,考虑到性别标签。 ‘

从G-Trans数据集中提取二元文本的模式图示。
在上面的图像中,我们看到下中间列中的微调文本和右列中的期望输出,带有上面的基本原理图示。
对于这种方法,作者使用了来自2020年早期工作的格子重评分方法,并使用了约束性束搜索作为过滤器,以确保只处理目标域(性别)。
对于大型语言模型方法,作者设计了一种使用大型语言模型作为编辑的策略,通过重写提供的翻译来提供性别分配。

大型语言模型使用上下文示例提示来分配性别。
将两种方法的结果连接起来后,模型随后被微调以将源令牌分类为对齐或不对齐。

连接两种方法结果的模式图示。
数据和测试
用于该项目的模糊实体检测器是通过微调Facebook AI的xlm-roberta-large模型来开发的,使用了变换器,并使用了G-Tag数据集中的所有五种语言对。
在第一种方法中,M2M 1.2B模型是在Fairseq上训练的,联合使用了G-Trans数据集中的二元文本,并提供了来自Wiktionary的性别变格。
对于大型语言模型方法,作者使用了GPT-3.5-turbo,并使用xlm-roberta-large来对齐性别结构,使用G-Trans中的性别对齐。
用于评估替代方案、结构(带有精度和召回率)和对齐准确性的指标。
虽然前两个是自解释的,但对齐准确性衡量输出性别结构符合已知正确源标识的百分比,并使用δ-BLEU方法,按照MT-GenEval的方法论进行。
以下是数据增强管道的结果:

数据增强测试的结果。向上箭头表示“更高更好”,向下箭头表示“更低更好”。
作者评论道:
‘M2M和GPT在大多数情况下表现相似,除了英语-俄语,其中GPT实现了更低的替代召回率(58.7比89.3)。在英语-德语和英语-葡萄牙语上,GPT生成的性别结构质量更好,而在英语-西班牙语和英语-俄语上,M2M的质量更好,如结构指标所示。 ‘
‘注意,我们没有G-Trans数据用于英语-意大利语,因此M2M模型和英语-意大利语上的对齐准确率仅仅是M2M和XLM模型的零样本泛化。 ‘
研究人员还将数据增强系统的性能与GATE的句子级性别重写器进行了比较,使用GATE自己的指标。

苹果/南加州大学的数据增强管道与GATE的句子级方法进行比较。
论文指出:
‘我们看到在回忆率方面有显著的改进,代价是精度略微下降(除了英语-意大利语)。我们的系统能够在所有3种语言对上超越GATE的F.5指标。 ‘
最后,作者训练了多个“香草”多语言模型到“香草二元文本”中。贡献数据集包括WikiMatrix、WikiTitles、Multi-UN、NewsCommentary和Tilde。
两个额外的香草模型被训练,一个包含带有<gender>前缀标签的G-Trans数据集,作为监督基准;另一个包含性别结构和对齐(在较小的本地模型中,因为使用GPT的API服务对于此目的来说非常昂贵)。
模型被测试在2022年的FloRes数据集上。

末端香草机器翻译模型的测试(P = 精度,R = 召回率)。
论文总结了这些结果:
‘香草模型无法生成替代方案,并且表现出强烈的偏见,倾向于生成阳性形式(δ-BLEU范围从5.3到12.5)。 ‘
‘这种偏见通过监督基准大大减少。训练在增强数据上的模型进一步减少了偏见,并在替代指标、对齐准确率和δ-BLEU方面获得了最佳性能。 ‘
‘这表明了数据增强管道的有效性。增强的数据还使我们能够训练一个具有竞争力的系统,用于英语-意大利语,该语言缺乏监督数据。 ‘
作者得出结论,指出该模型的成功必须放在更广泛的自然语言处理背景下,即性别分配的理性化;他们指出,这仍然是一个开放的问题。
尽管研究人员认为所获得的结果并没有完全实现生成实体级别性别中立翻译和/或消除性别歧义的目标,但他们相信这项工作对于未来对机器翻译中最具挑战性的领域之一的探索是一个有力的工具。
* 我将作者的内联引用转换为超链接
首次发布于2024年10月8日星期二












