AIモデルとプラットフォーム

多言語LLMの現状:英語を超えて

mm
Unite.AI を Google の優先ソースに追加

マイクロソフトの研究によると、世界の言語の約88%、12億人によって話されている言語は、Large Language Models (LLMs) にアクセスできません。これは、ほとんどのLLMが英語中心であり、英語のデータで構築されており、英語話者向けに設計されているためです。この英語の優位性はLLMの開発にもあり、デジタル言語のギャップを生み出し、多くの人をLLMの利点から除外する可能性があります。LLMのこの問題を解決するために、異なる言語でトレーニングできるLLMと、異なる言語でタスクを実行できるLLMが必要です。多言語LLMが登場しました!

多言語LLMとは何か?

多言語LLMは、複数の言語を理解し、テキストを生成できます。異なる言語のデータセットでトレーニングされており、ユーザーのプロンプトに応じて複数の言語でタスクを実行できます。

多言語LLMの応用は巨大であり、文学を地元の方言に翻訳すること、リアルタイムの多言語コミュニケーション、多言語コンテンツの作成などが含まれます。これらは、誰でも簡単に情報にアクセスし、話し合うことができるようにします。

また、多言語LLMは、文化的なニュアンスやコンテキストの欠如、トレーニングデータの制限、翻訳中に知識が失われる可能性などの課題に対処します。

多言語LLMはどのように機能するか?

多言語LLMを構築するには、さまざまな言語のテキストのバランスの取れたコーパスを慎重に準備し、トレーニングのための適切なアーキテクチャとテクニックを選択する必要があります。Transformerモデルは、多言語学習に適しています。

多言語LLMの構築手順

出典:著者による画像

1つのテクニックは、エンベディングを共有することです。これにより、LLMは各言語の単語の意味を学習し、異なる言語をよりよく理解できます。

この知識により、LLMは、言語の翻訳、スタイルの書き込みなど、さまざまな言語タスクに適応できます。別のテクニックは、クロスリンガル転移学習です。ここでは、モデルは多言語データの大きなコーパスで事前にトレーニングされ、特定のタスクで微調整されます。

この2段階のプロセスにより、モデルは多言語言語理解の強固な基礎を持ち、さまざまなダウンストリームアプリケーションに適応できます。

多言語LLMの例

多言語LLMの比較チャート

出典:Ruder.io

いくつかの注目すべき多言語LLMの例があります。各々が特定の言語的ニーズと文化的背景に応じて設計されています。いくつかを紹介します:

1. BLOOM

BLOOMは、多様な言語とアクセシビリティを優先するオープンアクセスの多言語LLMです。176億のパラメータを持ち、46の自然言語と13のプログラミング言語を処理できます。これは、最大で最も多様なLLMの1つです。

BLOOMのオープンソース性により、研究者、開発者、言語コミュニティがその機能を活用し、改善に貢献できます。

2. YAYI 2

YAYI 2は、主にアジアの言語を対象としたオープンソースLLMです。アジア地域の複雑さと文化的ニュアンスを考慮して、16以上のアジア言語からなる多言語コーパスで事前にトレーニングされています。

これにより、モデルはアジアの言語と文化の特定の要件を満たす結果を生成します。

3. PolyLM

PolyLMは、低資源言語の課題に対処するために適応機能を提供するオープンソースの「ポリグロット」LLMです。約640億トークンのデータセットでトレーニングされており、1.7Bと13Bの2つのモデルサイズで利用できます。PolyLMは16以上の言語をサポートします。

これにより、高資源言語でトレーニングされたモデルを低資源言語で微調整できます。这种柔軟性により、LLMはさまざまな言語状況とタスクでより有用になります。

4. XGLM

XGLMは、75億のパラメータを備え、20以上の言語の多様なセットでトレーニングされた多言語LLMです。ファミリーの一員として、大規模な多言語LLMの1つです。テキストとコードの大量のデータセットでトレーニングされています。

XGLMは、多くの言語を網羅し、言語的多様性に焦点を当てています。多言語LLMの構築の可能性を示しています。

5. mT5

mT5(大量に多言語テキストからテキストへの転送トランスフォーマー)は、Google (GOOGL ) AIによって開発されました。コモンクロールデータセットでトレーニングされたmT5は、スペイン語や中国語などの広く話されている言語から、バスク語やケチュア語などの低資源言語まで、101の言語を処理できます。

また、翻訳、要約、質問回答などの多言語タスクでも優れています。

普遍的なLLMは可能か?

言語に中立的なLLM、つまり特定の言語に偏見なく言語を理解し生成できるLLMの概念は、魅力的です。

まだ完全な普遍的なLLMの開発は遠い話ですが、現在の多言語LLMはすでに大きな成功を収めています。完全に開発されれば、代表されていない言語や多様なコミュニティのニーズに応えることができます。

例えば、研究によると、多くの多言語LLMは、タスク固有のトレーニングデータなしで、資源豊富な言語から資源不足な言語へのゼロショットクロスリンガルトランスファーを促進できます。

また、YAYIやBLOOMのようなモデルは、特定の言語やコミュニティに焦点を当て、進歩と包括性を促進する可能性を示しています。

普遍的なLLMまたは現在の多言語LLMを構築するには、個人や組織が次のことを行う必要があります:

  • コミュニティの関与と言語データセットのキュレーションのために、ネイティブスピーカーをクラウドソーシングします。
  • 多言語研究と開発へのコミュニティの取り組みや資金提供を支援します。

多言語LLMの課題

多言語LLMの概念は大きな期待を抱かせますが、まだいくつかの課題があります:

1. データ量

多言語モデルは、単言語モデルよりも多くの言語のトークンを表現するために、より大きな語彙が必要です。しかし、多くの言語には大規模なデータセットが不足しています。これにより、モデルを効果的にトレーニングすることが難しくなります。

2. データ品質の懸念

多言語LLMの出力の正確性と文化的適切性を確保することは、重大な懸念事項です。モデルは、偏見や不正確性を避けるために、言語的および文化的ニュアンスに注意深くトレーニングおよび微調整する必要があります。

3. リソースの制限

多言語モデルをトレーニングおよび実行するには、NVIDIA A100 GPUなどの強力なコンピューティングリソースが必要です。高コストは、特に低資源言語や限られた計算インフラストラクチャへのアクセスを備えたコミュニティにとって、重大な課題となります。

4. モデルアーキテクチャ

さまざまな言語構造や複雑さに対応するために、モデルアーキテクチャを適応させることは、継続的な課題です。モデルは、単語の順序、形態論的変化、書記システムの違いを処理しながら、高いパフォーマンスと効率性を維持する必要があります。

5. 評価の複雑さ

英語以外のベンチマークを超えて多言語LLMのパフォーマンスを評価することは、文化的ニュアンス、言語的特異性、ドメイン固有の要件を考慮するために、重要です。

多言語LLMは、言語の壁を打ち破り、低資源言語をエンパワーメントし、多様なコミュニティ間の効果的なコミュニケーションを促進する可能性があります。

AIとMLの最新ニュースや分析を逃すな – unite.aiを今日訪問してください。

Haziqaは、AIおよびSaaS企業向けの技術コンテンツの作成における豊富な経験を持つデータサイエンティストです。