AIモデルとプラットフォーム
新しいAIモデルはより多くの人間の言語を処理できる
ウォータールー大学の研究者は、コンピューターがより多くの人間の言語を処理できるAIモデルを開発しました。これは、多くの言語がプログラミングプロセスで見落とされることが多い分野において重要な進歩です。アフリカの言語は、コンピューター科学者によって注目されていないことが多く、アフリカ大陸での自然言語処理(NLP)能力が制限されている原因となっています。
新しい言語モデルは、ウォータールー大学のデビッド・R・チェリトン・コンピューター・サイエンス・スクールの研究者チームによって開発されました。
この研究は、2021年のエンパイリカル・メソッド・イン・ナチュラル・ランゲージ・プロセッシング・カンファレンスでのマルチリンガル・レプレゼンテーション・ラーニング・ワークショップで発表されました。
モデルは、コンピューターがアフリカの言語のテキストを分析するのに役立つ重要な役割を果たしており、AfriBERTaと呼ばれています。深層学習技術を使用して、低リソース言語に対して印象的な結果を達成しています。
11のアフリカ言語をサポート
AfriBERTaは、現在、11のアフリカ言語、包括してアムハラ語、ハウサ語、スワヒリ語をサポートしており、これらの言語は合計4億人以上の人々によって話されています。モデルは、最も優れた既存のモデルと比較して、出力の品質を実証しています。また、1ギガバイトのテキストから学習するだけで、他の類似のモデルは何千倍も多くのデータを必要とします。
ケレチ・オグエジは、ウォータールー大学のコンピューター・サイエンスの修士課程の学生です。
「事前トレーニング済みの言語モデルは、機械翻訳から質問回答まで、コンピューターがテキストデータを処理して分析する方法を変えました」とオグエジは述べました。「しかし、アフリカの言語は、研究コミュニティからあまり注目されていません。」
「問題の1つは、ニューラル・ネットワークがテキストとコンピューターに非常に依存していることです。英語には大量のテキストが利用可能ですが、世界で話されている7,000以上の言語のほとんどは、ニューラル・ネットワークを餌とするデータが不足している低リソース言語です。」
事前トレーニング技術
これらのモデルは、事前トレーニング技術に依存しており、研究者はモデルにテキストを提示し、一部の単語を隠したりマスクしたりします。モデルは、隠された単語を推測する必要があり、これを何十億回も繰り返します。最終的に、単語間の統計的関連性を学習し、これは人間の言語知識に似ています。
ジミー・リンは、チェリトン・コンピューター・サイエンスの議長であり、オグエジの指導教員です。
「特定のダウンストリーム・タスクに対して、同じくらい正確なモデルを事前トレーニングすることができ、しかし、はるかに少ない量のデータを使用することができることは、多くの利点があります」とリンは述べました。「モデルをトレーニングするために必要なデータが少ないということは、必要な計算が少なくなることを意味し、結果として、巨大なデータセンターの運用に関連する二酸化炭素排出量が低くなります。小さなデータセットは、データのキュレーションをより実用的であり、これはモデル内の偏見を減らすための1つのアプローチです。」
「この研究は、アフリカ大陸の13億人以上の人々に自然言語処理能力をもたらすための小さな nhưng重要なステップです。」
この研究には、最近ウォータールー大学でコンピューター・サイエンスの学士号を取得したユーシン・ズーも参加していました。












