AIモデルとプラットフォーム

アップルの性別を扱う言語翻訳への対策

mm
Unite.AI を Google の優先ソースに追加
A photo of the Rosetta Stone, with a woman out of focus in the background, looking at the stone. Source: https://smarthistory.org/the-rosetta-stone/

アップルは、USCとの共同研究で、iOS18オペレーティングシステムのユーザーが翻訳時に性別を選択できるようにするためのマシンラーニング方法を探求した論文を発表しました。

(AAPL )
iOS18では、ネイティブのTranslateアプリで翻訳語の代替の性別を選択できます。ソース:https://support.apple.com/guide/iphone/translate-text-voice-and-conversations-iphd74cb450f/ios

iOS18では、ネイティブのTranslateアプリで翻訳語の代替の性別を選択できます。ソース:https://support.apple.com/guide/iphone/translate-text-voice-and-conversations-iphd74cb450f/ios

この研究では、現在進行中の性別の定義に関するトピック的な議論に触れていますが、84の言語が性別を基盤とした性別システムを使用しているという事実に焦点を当てています。

赤い点は性別を基盤とした性別システムを使用する言語を示しています。ソース:https://wals.info/feature/31A#map

赤い点は性別を基盤とした性別システムを使用する言語を示しています。ソース:https://wals.info/feature/31A#map

驚くことに、英語は性別を基盤としたカテゴリに分類されます。なぜなら、英語は単数の代名詞に男性または女性の性別を割り当てるからです。

対照的に、すべてのロマンス言語(スペイン語を含む約5億人の話者を含む)と、ロシア語を含む他の多くの言語は、性別の一致を必要とするため、翻訳システムは言語における性別の割り当てに対処する必要があります。

新しい論文では、スペイン語の「The secretary was angry with the boss」の翻訳例を示しています。

新しい論文からの例:英語からスペイン語への翻訳における潜在的な性別の割り当て。ソース:https://arxiv.org/pdf/2407.20438

新しい論文からの例:英語からスペイン語への翻訳における潜在的な性別の割り当て。ソース:https://arxiv.org/pdf/2407.20438

単純な翻訳は、長いテキストでは不十分です。なぜなら、テキストの開始時に性別が設定され、以降に性別が再び言及されない場合があるからです。しかし、翻訳者は、参加者の性別をテキスト全体で維持する必要があります。

これは、トークンに基づくアプローチにとって課題となる可能性があります。トークンに基づくアプローチでは、翻訳を離散的なチャンクで処理し、コンテンツの期間中に性別のコンテキストを失うリスクがあります。

さらに、偏った性別の割り当てに対する代替翻訳を提供するシステムは、単に性別の名詞を置き換えるだけでは不十分です。システムは、他の言語の部分が変更された性別の名詞と一致するようにする必要があります。

アップル/USCの論文からの例では、秘書に男性の性別が割り当てられているにもかかわらず、単数の過去の動詞「was」は女性の形(estaba)で残っています。

ブルートフォースの性別の置き換えは、必要な性別の一致を怠る可能性があります。この例では、単語「enojada」は「enojado」に変更されるべきです。

ブルートフォースの性別の置き換えは、必要な性別の一致を怠る可能性があります。この例では、単語「enojada」は「enojado」に変更されるべきです。

性別の問題

アップルとUSCの研究者は、性別の代替を生成するための半教師ありアプローチを提案しています。

このシステムは、iOS18のアップル翻訳アプリの翻訳に使用され、言語モデルの構築に大規模な言語モデル(LLM)と事前トレーニングされたオープンソースの機械翻訳モデルを使用しています。

結果は、性別構造を含むアーキテクチャにトレーニングされました。性別構造とは、同じエンティティを表すさまざまな性別を持つ名詞のグループです。

論文では、次のことが述べられています。

‘トレーニングデータに含まれる性別の偏りは、自然言語処理(NLP)システムに影響を及ぼし、偏りの拡散と増幅につながる可能性があります。これらの偏りは、エラーの根本的な原因となることもあります。 ‘

‘機械翻訳(MT)システムは、たとえば、英語の「doctor」をスペイン語の「médico」(男性形)ではなく「médica」(女性形)に翻訳する可能性があります。入力は「The doctor asked the nurse to help her in the procedure」です。 ‘

‘誤った性別の割り当てを避けるために、MTシステムはコンテキストを通じて性別を明確にする必要があります。コンテキストで正しい性別を決定できない場合、すべての有効な性別選択肢をカバーする複数の翻訳の代替案を提供することが妥当なアプローチです。 ‘

アップルとUSCが開発したモデルは、GATEとMT-GenEvalテストセットで評価されました。

テストセットには、最大3つの性別の曖昧なエンティティを含むソース文が含まれています。

モデルは、M2M 1.2BモデルとGPT-3.5-turboを使用してトレーニングされました。

結果は、次のとおりです。

データ増強パイプラインの結果。上向きの矢印は「高いほどよい」、下向きの矢印は「低いほどよい」を示します。

データ増強パイプラインの結果。上向きの矢印は「高いほどよい」、下向きの矢印は「低いほどよい」を示します。

二度見

アップルとUSCは、性別の曖昧なエンティティが検出された場合に、2つのアプローチを探求しました。事前トレーニングされた言語モデルのファインチューニングと、LLMの使用です。

最初のアプローチでは、論文では次のことが述べられています。

‘私たちは、G-Transデータセットから抽出されたビテキストで事前トレーニングされたMTモデルMをファインチューニングしました。ソース文には、 / タグで男性または女性としてマークされた曖昧なエンティティが含まれています。ターゲット翻訳には、性別タグに基づいて正しい性別の曲げが含まれています。 ‘

G-Transデータセットからビテキストを抽出するためのスキーマのイラスト。

G-Transデータセットからビテキストを抽出するためのスキーマのイラスト。

画像では、下の中央列にファインチューニングされたテキストが表示され、右列に望ましい出力が表示されています。

このアプローチでは、以前の研究からラティス再評価法を使用しました。

LLMアプローチでは、LLMを編集者として使用し、提供された翻訳を書き直して性別の割り当てを提供する戦略を策定しました。

LLMは、性別を割り当てるためにコンテキスト内で例示されています。

LLMは、性別を割り当てるためにコンテキスト内で例示されています。

データとテスト

このプロジェクトでは、Facebook AIのxlm-roberta-largeモデルを使用して、性別の曖昧なエンティティを検出するための検出器を開発しました。

この検出器は、G-Tagデータセットを使用してファインチューニングされました。

モデルは、M2M 1.2BモデルとGPT-3.5-turboを使用してトレーニングされました。

結果は、次のとおりです。

データ増強パイプラインの結果。上向きの矢印は「高いほどよい」、下向きの矢印は「低いほどよい」を示します。

データ増強パイプラインの結果。上向きの矢印は「高いほどよい」、下向きの矢印は「低いほどよい」を示します。

ここで、著者は次のように述べています。

‘M2MとGPTは、ほとんどの場合、同等の性能を示しています。ただし、英語-ロシア語の場合、GPTは代替のリコールが大幅に低下しています(58.7対89.3)。生成された性別構造の品質は、英語-ドイツ語と英語-ポルトガル語の場合、GPTが優れていますが、英語-スペイン語と英語-ロシア語の場合、M2Mが優れています。 ‘

著者はまた、データ増強システムの性能を、M2Mを使用してGATEの文レベルの性別書き換えシステムと比較しました。

アップル/USCのデータ増強パイプラインをGATEの文レベルの方法と比較した結果。

アップル/USCのデータ増強パイプラインをGATEの文レベルの方法と比較した結果。

ここで、論文では次のことが述べられています。

‘私たちは、リコールのコストで相対的に小さな精度の低下(英語-イタリア語を除く)で、GATEを上回る改善を見ました。私たちのシステムは、すべての言語ペアでGATEの提案されたF.5メトリックを上回りました。 ‘

最後に、著者は、vanillaの多言語モデルをさまざまなデータセットでトレーニングしました。

結果は、次のとおりです。

エンドツーエンドのバニラ機械翻訳モデルをテストしました(P = 精度、R = リコール)。

エンドツーエンドのバニラ機械翻訳モデルをテストしました(P = 精度、R = リコール)。

論文では、次のことが述べられています。

‘バニラモデルは代替案を生成できません。男性の形式を生成するための強い偏り(δ-BLEUは5.3から12.5ポイント)を示しています。 ‘

‘この偏りは、監督学習ベースラインによって大幅に軽減されます。増強データでトレーニングされたモデルは、さらに偏りを軽減し、代替メトリック、構造の一致、δ-BLEUで最高の性能を達成します。 ‘

‘これは、データ増強パイプラインの有効性を示しています。増強データを使用すると、英語-イタリア語のための競合システムをトレーニングできますが、監督データはありません。 ‘

著者は、モデルの成功は、NLPの性別の割り当ての合理化におけるより広い文脈で考慮する必要があると述べています。また、性別の割り当ての問題はまだ解決されていないことを指摘しています。

研究者は、得られた結果が性別の中立的な翻訳の生成と性別の曖昧さの解消の目標を完全に達成していないと考えていますが、この研究は機械翻訳の最も課題的な分野の1つへの将来の探究のための強力なツールであると考えています。

著者は、さらに研究が必要であると述べています。

この研究は、性別の曖昧なエンティティを検出するための新しいアプローチを提案しています。

このアプローチは、性別の代替を生成するための半教師ありアプローチを使用しています。

結果は、提案されたアプローチの有効性を示しています。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai