ソートリーダー

Transformerの影響:機械翻訳は完全に解決されたのか?

mm
Unite.AI を Google の優先ソースに追加

Googleは最近、Google Translateに110の新しい言語を追加したと発表しました。これは、2022年に開始された1000言語イニシアチブの一環です。2022年には、24の言語を追加しました。最新の110の言語を追加すると、243の言語になります。この急速な拡張は、Zero-Shot Machine Translation技術によって可能になりました。この技術では、機械学習モデルは、事前に例を学習することなく、別の言語に翻訳することを学習します。しかし、将来的には、この進歩が機械翻訳の課題を完全に解決することができるかどうかを見ていきます。一方で、現在は、この技術がどのように機能するかを探ってみましょう。

以前はどうだったのか?

統計機械翻訳(SMT)

これは、Google Translateが最初に使用した方法でした。統計モデルに頼っています。大量の並列コーパス、つまり整列された文の翻訳のコレクションを分析して、最も可能性の高い翻訳を決定します。まず、システムはテキストを英語に翻訳し、中間ステップとして英語をターゲット言語に変換し、国連と欧州議会の議事録からの大量のデータセットと交差参照する必要がありました。これは、静的な言語フレームワークに頼る必要のない、従来のアプローチとは異なります。統計アプローチにより、静的な言語フレームワークに頼ることなく、データから学習し、適応することができました。
しかし、このアプローチにもいくつかの欠点があります。Google Translateは、最初にフレーズベースの翻訳を使用していました。システムは文をフレーズに分割し、個別に翻訳していました。これは、単語ごとの翻訳よりも改善されましたが、まだ制限がありました。例えば、不自然なフレーズやコンテキストエラーが発生することがありました。また、SMTは並列コーパスに大きく依存しており、比較的まれな言語の翻訳は困難でした。

ニューラル機械翻訳(NMT)

2016年、Googleはニューラル機械翻訳に切り替えました。深層学習モデルを使用して、文全体を一度に翻訳し、より流暢で正確な翻訳を提供します。NMTは、コンピュータ内に高度な多言語アシスタントを持っているようなものです。シーケンスツーシーケンス(seq2seq)アーキテクチャを使用して、NMTは一つの言語の文を処理してその意味を理解し、次に別の言語の対応する文を生成します。この方法では、統計機械翻訳とは異なり、並列コーパスを分析して最も可能性の高い翻訳を決定するのではなく、巨大なデータセットを使用して学習します。SMTとは異なり、NMTはフレーズベースの翻訳に頼るのではなく、シーケンス全体を処理する能力により、言語のニュアンスをより効果的に捉えることができます。したがって、さまざまな言語ペアの翻訳品質が向上し、人間の翻訳者と比較して流暢性と正確性が高いレベルに達しました。
実際、伝統的なNMTモデルは、シーケンスデータを処理するために設計されたRecurrent Neural Networks(RNNs)をコアアーキテクチャとして使用していました。RNNsは、隠れた状態を維持することで、各入力(単語またはトークン)が処理されるにつれて進化するため、時間依存の依存関係を学習することができます。しかし、RNNsは計算コストが高く、効果的に並列化することが困難でした。

Transformerの導入

2017年、Google Researchは「Attention is All You Need」という論文を発表し、Transformerを導入しました。これは、RNNsからニューラルネットワークアーキテクチャへの重要な転換点でした。

Transformerは、自己注意メカニズムのみに頼っています。これにより、ニューラル機械翻訳モデルは入力シーケンスの最も重要な部分に選択的に焦点を当てることができます。RNNsとは異なり、Transformerは、シーケンス内の各トークンを同時に計算し、他のトークンとの関係を理解することができます。これにより、Transformerは、再帰的な接続や畳み込みフィルタに頼ることなく、短距離と長距離の依存関係を効果的に捉えることができます。

したがって、再帰を排除することで、Transformerはいくつかの重要な利点を提供します:

  • 並列化:注意メカニズムは、シーケンスの異なるセグメントを並列に計算することができます。これにより、GPUなどのモダンなハードウェアでトレーニングを高速化することができます。
  • トレーニング効率:Transformerは、伝統的なRNNベースまたはCNNベースのモデルと比較して、トレーニング時間を大幅に短縮することができます。これにより、機械翻訳などのタスクで優れたパフォーマンスを実現することができます。

Zero-Shot Machine TranslationとPaLM 2

2022年、Googleは、Zero-Shot Machine Translationを使用して24の新しい言語をサポートすることを発表しました。これは、機械翻訳技術における重要な里程碑でした。また、世界で最も話されている1000の言語をサポートすることを目的とした1000 Languages Initiativeを発表しました。現在、110の言語を追加しました。Zero-Shot Machine Translationは、ソース言語とターゲット言語の間の並列データがなくても翻訳を可能にします。これにより、各言語ペアのためのトレーニングデータを作成する必要性がなくなりました。

この進歩は、Transformerのアーキテクチャと自己注意メカニズムによって可能になりました。Transformerモデルの言語間の関係を学習する能力と、複数の言語を同時に処理するスケーラビリティにより、より効率的で効果的な多言語翻訳システムの開発が可能になりました。しかし、Zero-Shotモデルは、並列データでトレーニングされたモデルと比較して、一般的に品質が低いです。

その後、Googleは、2023年にPaLM 2を導入しました。これにより、2024年に110の新しい言語をリリースすることが可能になりました。PaLM 2は、AwadhiやMarwadi(ヒンディー語に関連)やSeychelloisやMauritian Creole(フランス語クレオール)などの近縁言語の学習能力を大幅に強化しました。PaLM 2の改善点、例えば、計算最適化、データセットの強化、設計の洗練により、言語の学習がより効率的になり、Googleの言語サポートの拡大と多様な言語のニュアンスのサポートが可能になりました。

Transformerで機械翻訳の課題は完全に解決されたのか?

私たちが話している進化は、GoogleがSMTを採用してから18年、Zero-Shot Machine Translationを使用して110の言語を追加するまでの大きな飛躍です。これは、並列コーパスの収集という、歴史的に非常に手間のかかるタスクの必要性を減らす可能性があります。しかし、機械翻訳が完全に解決されたと主張することは、技術的な観点と倫理的な観点から見て、早計です。

現在のモデルは、まだコンテキストと一貫性に苦労しており、微妙な間違いを犯すことがあります。これらの問題は、論理的な流れとニュアンスの理解が必要な、より長く複雑な文で顕現します。また、文化的なニュアンスや慣用句が失われることが多く、翻訳が文法的に正しいものの、意図した意味や音が自然でないものになります。

事前トレーニングのデータ:PaLM 2や同様のモデルは、多言語テキストコーパスで事前トレーニングされており、その前身のPaLMを上回っています。この強化により、PaLM 2は多言語タスクで優れたパフォーマンスを発揮することができ、翻訳品質の向上のための従来のデータセットの重要性を強調しています。

ドメイン固有または希少言語:法務、医療、技術などの専門分野では、並列コーパスはモデルが特定の用語や言語のニュアンスに遭遇することを保証します。高度なモデルは、ドメイン固有の用語や言語のトレンドに苦労することがあり、Zero-Shot Machine Translationの課題となります。また、低リソース言語は、正確なモデルをトレーニングするために必要なデータが不足しているため、まだ不完全に翻訳されています。

ベンチマーク:並列コーパスは、特に並列コーパスデータが不足している言語の翻訳モデルのパフォーマンスを評価およびベンチマークするために不可欠です。BLEU、BLERT、METEORなどの自動メトリックは、文法以外のニュアンスを評価することに限界があります。しかし、人間の評価者は偏見によって妨げられることがあり、各言語ペアの微妙なエラーを捉えるために必要な完全な二言語話者評価者を見つけることは困難です。

リソースの集中度:LLMのトレーニングと展開のリソース集約的な性質は、特定のアプリケーションや組織のアクセシビリティを制限する障壁のままです。

文化の保存:倫理的な側面は深刻です。Googleの研究科学者であるIsaac Caswellは、Zero-Shot Machine Translationについて次のように述べています。「これを、多言語を知っているポリグロットと考えることができます。しかし、翻訳されていない1000以上の言語のテキストも見ることができます。ポリグロットが新しい言語の小説を読み始めたと想像してください。一般的な言語知識に基づいて、その言語の意味を推測し始めることができます。」しかし、並列コーパスを持たない少数言語への長期的な影響を考慮することが重要です。言語自体から離れて言語への依存が移行すると、文化の保存に影響を及ぼす可能性があります。

イリーナ・バルスカヤ博士は、10年以上の経験を持つ優秀なデータサイエンティストで、製品分析と最新技術の分析を担当しています。彼女は、サウジアラビア初の完全に機能するローカライズされたAIベースの音声アシスタントであるヤスミナの作成と分析を主導し、現代標準アラビア語とサウジアラビア方言の複雑なデータローカライズとラベル付けを担当しました。現在、イリーナはヤンデックスの品質分析を担当し、AI技術の進歩を推進しています。