AIモデルとプラットフォーム

Appen Limited、多様なデータトレーニングセットをNLPのためにリリース

mm
Unite.AI を Google の優先ソースに追加

Appen Limitedは、高品質のトレーニングデータを提供する企業であり、AIシステムを大規模に構築しようとする企業向けに新しい多様なトレーニングデータセットをNLPイニシアチブのためにリリースしました。これらのデータセットにより、エンドユーザーは言語のバリエーション、方言、エスノレクト、発音、アクセント、人種、または性別に関係なく、同じエクスペリエンスを受けることができます。

2020年3月のPNASの報告によると、自動音声認識(ASR)システム、特に仮想アシスタント、字幕、ハンズフリー・コンピューティングに使用されるものは、人種的なパフォーマンスの差異を示すことがよくあります。これは、システムが偏ったまたは不完全なデータに基づいていることが多いためです。つまり、多様なトレーニングセットを開発することが非常に重要です。

Appenは、この新しいリリースにより、パフォーマンスの差異を減らし、音声認識技術のためのより包括的な環境を作り出すことを目指しています。言語解釈とNLPシステムにも同様の課題があります。

マーク・ブライアンはAppenのCEOです。

「トレーニングデータの品質と多様性は、AIモデルのパフォーマンスと偏りを直接影響します」とブライアンは述べました。「データパートナーとして、私たちは多くのユースケースのための完全なトレーニングデータを提供することができ、AIモデルのパフォーマンスが誰に対しても機能することを保証することができます。データの生成、ラベル付け、検証のために、多様な個人のグループを関与させることが非常に重要です。そうすることで、モデルのトレーニングが公平で、責任を持って構築されることを保証することができます。」

Appen Language Projects

Appenは、さまざまなプロジェクトとパートナーシップを通じて、多様なAI環境を作り出そうとしています。以下はその例です:

  • Translators without Borders(TWB)パートナーシップ:Appenは、TWB、Amazon (AMZN ) 、カーネギーメロン大学、Facebook (META ) 、Google (GOOGL ) 、ジョンズ・ホプキンス大学、Microsoft (MSFT ) 、Translatedとパートナーシップを結んでいます。このパートナーシップは、Translation Initiative for COVID-19(TICO-19)に参加し、COVID-19に関する情報へのアクセスを拡大するために、複数の言語での言語技術の開発を支援しました。これには、コンゴ・スワヒリ語、ティグリニャ語、ナイジェリア・フルフルデ語などの開発途上国での言語も含まれます。
  • カナダ・フランス語翻訳プロジェクト:Appenは、カナダ・フランス語の言語コンサルタントと協力して、Microsoft Translatorに「カナダ・フランス語」を言語オプションとして追加しました。
  • イヌクティトゥット翻訳プロジェクト:Appenは、ヌナブト政府と協力して、Microsoft Translatorにイヌクティトゥットを追加することにしました。イヌクティトゥットはカナダ北極圏で話される先住民の言語です。
  • アフリカ・アメリカ・ヴァーナキュラー・イングリッシュ(AAVE)オフ・ザ・シェルフ・データセット:Appenは、AAVEの話者と協力して、さまざまなトピックについての会話を収集し、OTSデータセットを作成しています。これにより、AAVEを表現する新しいトレーニングデータセットを作成することを目指しています。

ジュディス・ビショップ博士はAppenのAIスペシャリストのシニア・ディレクターです。

「偏ったAIデータは、予想されるビジネス結果を達成できず、予想されるメリットを受けるはずの個人に損害を与えるプロジェクトにつながる可能性があります」とビショップ博士は述べました。「AIプロジェクトの規模と複雑さは、ほとんどの企業が、偏りのない高品質のデータを取得するために、AIデータの専門家とパートナーシップを結ぶ必要があります。Appenは、最も多様で専門的なデータアノテーターのクラウドを開発することに尽力しており、これは業界にとって明確に差別化されたリソースを提供しています。公平で、責任を持って構築されたAIプロジェクトを構築するために、多様な個人のグループを関与させることが重要です。」

Appenは、170以上の国からトレーニングデータのアノテーターを支援しています。言語の表現には、235のユニークな言語と395の方言が含まれます。また、オフ・ザ・シェルフ(OTS)データセットも提供しており、企業がAIプロジェクトのための高品質のトレーニングデータをより迅速に取得できるようになります。

Alex McFarlandは、人工知能の最新の開発を探求するAIジャーナリスト兼ライターです。彼は、世界中の数多くのAIスタートアップや出版物と共同しています。