AIモデルとプラットフォーム

フェイスブックが100種類の言語を直接翻訳できるマシン翻訳モデルを開発

mm
Unite.AI を Google の優先ソースに追加

フェイスブックは最近、新しいマシン翻訳モデルを開発しました。このモデルは、100種類の言語のペア間でテキストを翻訳できます。ほとんどの他のマシン翻訳システムは、テキストを英語に翻訳してから目的の言語に翻訳します。しかし、Engadgetの報告によると、フェイスブックのAI翻訳システムは英語を中間言語として使用せず、約90%の精度で翻訳できます。

フェイスブックのAIモデル用のトレーニングデータは、約75億ペアの文が含まれており、100種類の言語に分散しています。このデータは、ウェブクローラーを使用してウェブから収集され、収集されたデータ内の言語はFastTextという言語モデルを使用して識別されました。データが収集された後、LASER 2.0というツールを使用して、さまざまな文の意味を抽出して、意味に基づいて文をペアにしました。LASER 2.0はフェイスブックによって開発され、教師なし学習アルゴリズムを使用して埋め込みを作成します。文の埋め込みには、頻度や文の近さなどの特徴に基づいて、文間の関係に関する情報が含まれています。LASER 2.0は、非常に似た意味を持つ文のペアを作成できます。

トレーニングデータは、文の意味に基づいてペアにされただけではありません。言語自体もグループ化されました。目標は、英語を使用せずに2つの言語間で翻訳できるシステムを設計することでした。フェイスブックのアンジェラ・ファン氏は、このプロジェクトを率いており、世界の多くの地域では英語以外の2つの言語を話すことが多いと指摘しています。フェイスブックのエンジニアは、言語をペアに合わせてトレーニングを行いました。14つの言語グループが、文化、言語の類似性、地理などの変数に基づいて作成されました。たとえば、研究者が作成した言語グループの1つには、インドで最も一般的な言語であるウルドゥー語、タミル語、ヒンディー語、ベンガル語が含まれていました。これは、一般的にペアにされる言語が高品質の翻訳を受けられるようにするためでした。

言語グループに焦点を当てたトレーニング方法は、興味深い結果をもたらしました。結果として得られた翻訳モデルは、特定の言語ペア間で既存のモデルよりも高い精度を達成しました。たとえば、英語とベラルーシ語を翻訳する場合、AIはロシア語を翻訳するときに学習したパターンを適用できました。ベラルーシ語はロシア語と言語的に類似しているからです。同様に、スペイン語とポルトガル語の翻訳も改善されました。スペイン語は2番目に広く話されている言語であり、トレーニングデータの量も多かったからです。

翻訳システムではまだ約60種類の言語がカバーされていません。また、トレーニングデータが不足している言語の精度を向上させる必要があります。東南アジアやアフリカの多くの言語では、信頼性の高いモデルをトレーニングするために必要なデータの量が不足しています。研究チームは、このデータ不足を補う方法を見つける必要があります。研究チームはまた、モデルが学習した可能性のある人種差別的、性差別的、またはその他の不適切なパターンを制御する方法を見つける必要があります。研究チームは、英語データでは主に機能するプロファニティフィルターを使用しています。

マシン翻訳システムはまだフェイスブックのソーシャルメディアプラットフォームでは使用されていません。現在のモデルは研究目的のみです。しかし、フェイスブックは同様のモデルを設計して、サイトが受け取る約200億の翻訳リクエストを処理する準備をしています。

ブログ作家およびプログラマーで、 Machine Learning Deep Learning のトピックを専門としています。Danielは、AIの力を社会のために利用する手助けを他者に与えることを希望しています。