ソートリーダー
生成可能なAIは、絶滅危惧言語の死刑宣告ではない
ユネスコによると、2100年までに半分の言語が絶滅する可能性がある。多くの人々は、生成可能なAIがこのプロセスに貢献していると言っている。
言語の多様性の低下は、AIやインターネットの登場以前から始まっていた。ただし、AIは、先住民言語や資源の少ない言語の衰退を加速する可能性がある。
世界の7,000以上の言語のほとんどには、AIモデルをトレーニングするための十分なリソースがない。また、多くの言語には文字が存在しない。このため、主要言語がAIトレーニングデータの多くを占め、多くの言語はAI革命の恩恵を受けることができず、完全に消滅する可能性がある。
その理由は、利用可能なAIトレーニングデータのほとんどが英語であるためである。英語は大規模言語モデル(LLM)の主な推進力であり、一般的な言語を話す人々はAIテクノロジーにおいて代表されていない。
以下の世界経済フォーラムの統計を考慮してください:
- インターネット上のウェブサイトの3分の2は英語である。
- GenAIが学習するデータの多くはウェブから収集される。
- 世界人口の20%未満が英語を話す。
AIが私たちの日常生活に浸透するにつれて、私たちはすべて言語の公平性について考えるべきである。AIには、スケールで問題を解決するという前例のない潜在性があり、その約束は英語圏に限定されるべきではない。AIは、豊かな発展途上国の人々の生活を改善する便利さやツールを作成している。
資源の少ない言語を話す人々は、テクノロジーにおいて代表されていないことに慣れている。ウェブサイトが自分の言語で利用できない、Siriが自分の方言を認識できないなどである。資源の少ない言語で利用可能なテキストは、質が悪く、範囲が狭い。
社会は、資源の少ない言語がAIの計算から除外されないようにどうすればよいのか。言語がAIの約束の障壁にならないようにどうすればよいのか。
言語の包括性を向上させるために、主要テクノロジー企業は、巨大な多言語言語モデル(MLM)をトレーニングする取り組みをしている。Microsoft (MSFT ) Translateは、「すべての言語、どこでも」をサポートすることを約束している。Metaも、「言語を残さない」という約束をしている。これらは称賛に値するが、現実的か。
世界のすべての言語を扱う1つのモデルを作ることは、特権階級に有利である。データ量が多い主要言語を扱うと、トレーニングはより困難で時間がかかり、費用もかかる。低資源言語や非ラテン文字の言語を扱うと、AIモデルのトレーニングはより困難で時間がかかり、費用もかかる。低資源言語への間接税と考えることができる。
音声テクノロジーの進歩
AIモデルは主にテキストでトレーニングされるため、テキストコンテンツが豊富な言語に有利である。言語の多様性をサポートするには、テキストに依存しないシステムが必要である。人間の交流はかつてすべて音声ベースであり、多くの文化は依然として口頭コミュニケーションに重点を置いている。グローバルなオーディエンスに適応するには、AI業界はテキストデータから音声データへの移行が必要である。
音声テクノロジーの研究は大きな進歩を遂げているが、依然としてテキストベースのテクノロジーに比べると遅れをとっている。音声処理の研究は進んでいるが、直接の音声対音声テクノロジーはまだ未成熟である。現実は、業界は慎重に動き、テクノロジーが一定のレベルに達するまで進まない。
TransPerfectの新しくリリースされたGlobalLink Live解釈プラットフォームは、より成熟した音声テクノロジー、自動音声認識(ASR)とテキスト音声(TTS)を使用している。直接の音声対音声システムはまだ十分に成熟していないためである。ただし、研究チームは、完全な音声対音声パイプラインが本格的に利用可能になることを準備している。
音声対音声翻訳モデルは、口頭言語の保存に大きな約束をもたらす。2022年、Metaは、約4600万人の中国系の人々によって話される主に口頭言語であるホッキエン語のための最初のAI駆動型音声対音声翻訳システムを発表した。これは、MetaのUniversal Speech Translatorプロジェクトの一部であり、多くの言語間のリアルタイム音声対音声翻訳を可能にする新しいAIモデルを開発している。Metaは、ホッキエン語翻訳モデル、評価データセット、研究論文をオープンソース化したため、他者がその仕事を再現し、構築できる。
少ないリソースで学習
特定の言語に関するリソースが不足しているという事実は、その言語の死刑宣告ではない。ここで多言語モデルが有利であるのは、言語間で学習できることである。すべての言語にはパターンがある。言語間の知識転送により、トレーニングデータの必要性が減る。
90言語を学習するモデルがあると仮定し、インヌ語(北米先住民言語のグループ)を追加したい。知識転送により、インヌ語のデータが必要になる。少ないリソースで学習する方法を見つけています。エンジンの微調整に必要なデータ量は低い。
私は、より包括的なAIの未来に希望を持っています。言語の大量絶滅を見ると思っていないし、AIが英語圏の独占であるとも思っていない。すでに、言語の公平性に関する認識が高まっている。より多様なデータ収集から、言語固有のモデルを構築するまで、進展を遂げている。
フォン語は、ベニンとその周辺のアフリカ諸国で約400万人が話す言語である。最近、人気のAIモデルはフォン語を架空の言語として記述していた。コンピューターサイエンティストのボナヴェンチャー・ドスーは、母親がフォン語を話す。ドスーはフランス語を話し、フォン語の翻訳プログラムがなかったため、母親と会話することができなかった。今日、ドスーは苦労して作ったフォン語とフランス語の翻訳機で母親と会話できる。今日、フォン語のウィキペディアも存在する。
言語を保存するためにテクノロジーを利用しようという取り組みの中で、トルコのアーティストであるレフィク・アナドルは、先住民向けのオープンソースAIツールの作成を開始した。世界経済サミットで、アナドルは「地球上で、人間全体を知らないAIを作成することができるのか」と問うた。
私たちはできないし、しない。












