Andersonの視点

AIの将来を決定する「見えない」労働者たち

mm
Unite.AI を Google の優先ソースに追加

Google Researchが主導する2つの新しい報告書は、機械学習システムの基礎となるデータを作成するために、安価で権限のないグローバルなギグワーカーに頼る現在の傾向は、AIに重大な影響を及ぼす可能性があることを示唆している。

研究結果の中で、Googleの研究は、クラウドワーカーの偏見がAIシステムに組み込まれる可能性があること、クラウドワークプラットフォームでの不公平な労働慣行が回答の質を低下させる可能性があること、そしてクラウドワーカー間の意見の相違を解決するための「コンセンサス」システムが、最も適切な回答を却下する可能性があることを示唆している。

悪いニュースは、これらの問題に対する解決策はほとんどが高価で時間がかかる、またはその両方であるということである。

不安全性、ランダムな拒否、憎悪

最初の研究は、Googleの5人の研究者によって行われ、《Whose Ground Truth? Accounting for Individual and Collective Identities Underlying Dataset Annotation》と題されている。2番目の研究は、ニューヨークのシラキュース大学の2人の研究者によって行われ、《The Origin and Value of Disagreement Among Data Labelers: A Case Study of Individual Differences in Hate Speech Annotation》と題されている。

Googleの研究は、クラウドワーカーが実験的なタスクに回答する際に、さまざまな制約の下で作業していることが多いことを示唆している。たとえば、Amazon Mechanical Turkの現在のポリシーでは、依頼者(タスクを出す人)は、説明責任なしにアノテーターの作業を拒否できる。

‘クラウドワーカーの大多数(94%)は、拒否された作業または未払いの作業を持っている。ただし、依頼者は、受け取ったデータに対する全権を保持し、Roberts(2016)は、このシステムを「賃金盗用を可能にする」ものと説明している。 ‘

‘さらに、作業の拒否と賃金の未払いは痛みを伴う。拒否は、不明確な指示と有意義なフィードバックチャンネルの欠如によって引き起こされることが多い。多くのクラウドワーカーは、劣悪なコミュニケーションが自分の作業に悪影響を与えることを報告している。’

研究者は、クラウドワークプラットフォームがワーカーをどのように扱うかを考慮することを提案している。また、アメリカ合衆国では、クラウドワーカーは「独立契約者」とみなされ、最低賃金法の対象外となっていることも指摘している。

コンテキストは重要

研究はまた、アノテーションタスクのために、背景を考慮せずにアドホックなグローバル労働力を使用することを批判している。

予算が許す場合は、AMTや同様のクラウドワークプラットフォームを使用する研究者は、同じタスクを4人のアノテーターに与え、結果について「多数決」で決定することが多い。

研究は、コンテキストの経験が特に軽視されていることを示唆している。たとえば、セクシズムに関する質問が、18〜57歳の男性3人と29歳の女性1人にランダムに配布された場合、男性の判断が勝つが、研究者がアノテーターの資格を考慮する場合には、異なる結果になる可能性がある。

同様に、シカゴのギャング行為に関する質問が、36歳のアメリカの女性、42歳のシカゴ在住の男性、バンガロールとデンマークからのアノテーター2人に配布された場合、問題に最も影響を受ける可能性のある人物(シカゴの男性)は、標準的なアウトソーシング構成では、結果に1/4のシェアしか持たない。

研究者は次のように述べている:

‘クラウドソーシングの回答における「一つの真実」の概念は、神話である。アノテーターの間の意見の相違は、有価値な信号を提供することができる。さらに、多くのクラウドソーシングアノテータープールは、社会人口統計的に偏っているため、データセットに表現される人口と、クラウドワークの課題に直面する人口には、影響がある。 ‘

‘アノテーターの人口統計的偏りを考慮することは、データセットを文脈化し、責任あるダウンストリーム使用を保証するために重要である。簡単に言えば、アノテーターの社会文化的背景を認識し、考慮することは、データの品質と社会的影響の両方の観点から価値がある。’

ホットトピックには「中立」の意見は存在しない

4人のアノテーターの意見が、人口統計学的またはその他の尺度で偏っていない場合でも、Googleの研究は、研究者がアノテーターの生活経験や哲学的立場を考慮していないことを示唆している:

‘一部のタスクは、正解のある客観的な質問を提起する(画像に人間の顔が含まれているか?)が、多くの場合、データセットは、普遍的に正しい答えのない、比較的主観的なタスクに対する判断を収集することを目的としている(このテキストは攻撃的か?)。アノテーターの主観的な判断に頼るかどうかを意図的に考えることが重要である。 ‘

シラキュース大学の研究は、ヘイトスピーチのラベル付けの問題に特に関連するものとして、次の点を指摘している:

‘社会現実の複雑さを考慮すると、人の毒性に対する認識は大きく異なる。彼らの毒性コンテンツのラベルは、彼らの認識に基づいている。 ‘

ヘイトスピーチの次元的なラベル付けに、個性と年齢が「重大な影響」を与えることを発見したシラキュース大学の研究者は、次のように結論付けている:

‘これらの発見は、ヘイトスピーチに対するラベルの一貫性を、異なる背景や個性を持つラベラー間で達成することは、決して完全には成功しない可能性があることを示唆している。 ‘

裁判官も偏見を持っているかもしれない

この主観性は、シラキュース大学の研究によれば、上方に繰り返される可能性がある。コンセンサス投票の「勝者」を決定する手動介入(または自動化ポリシー)は、人間によって決定されるため、同じく主観的な判断となる。
フォーラムモデレーションに似たこのプロセスについて、研究者は次のように述べている:

‘コミュニティのモデレーターは、投稿やユーザーの運命を決定することができる。投稿を公開または非公開にする、ユーザーを称賛または恥ずかしいと思う、またはユーザーを禁止することができる。モデレーターの決定は、コミュニティメンバーとオーディエンスに配信されるコンテンツと、コミュニティの議論の体験に影響を与える。 ‘

‘モデレーターがコミュニティメンバーと人口統計的に同質であると仮定すると、コンテンツを評価するために使用する精神的スキーマは、他のコミュニティメンバーのそれと一致する可能性がある。 ‘

これは、シラキュース大学の研究者がヘイトスピーチのアノテーションの将来についてあまりにも悲観的な結論に達した理由を示唆している。政策やクラウドワークの意見の相違に対する判断は、どこにも明文化されていない「受け入れ可能な」原則に従ってランダムに適用される可能性がある。
クラウドワーカーは、価値判断を提供するタスクに携わっているため、偏っていなくてはならない。クラウドワーク結果の意見の相違について判断を下す人々も、政策を設定する際に価値判断を下している。
ヘイトスピーチ検出フレームワークには数百の政策があるかもしれないが、各政策が最高裁判所まで遡及しない限り、「権威ある」コンセンサスはどこから来るのか。
Googleの研究者は、《アノテーターの間の意見の相違は、タスクについての貴重なニュアンスを埋め込む可能性がある》と示唆している。研究は、データセット内のメタデータを使用して、意見の相違を文脈化することを提案している。
しかし、コンテキスト固有のデータ層が、標準テストの要求に適合したり、定性的結果を支持したりする方法は、現実的ではないシナリオでは、同じ研究グループを続けて使用すること以外には、見つけるのが難しい。

アノテータープールのキュレーション

すべての仮定は、コンセンサス投票につながる複数のアノテーションを含む研究プロジェクトに予算が存在することを前提としている。多くの場合、研究者は、地理的位置、性別、またはその他の文化的要因などの特性を指定することで、アウトソーシングされたアノテーションプールをより安価に「キュレーション」しようとする。

Googleの研究は、これらの課題に対処するための前進道路は、アノテーターとの通信フレームワークを確立することであると示唆している。たとえば、Uberアプリがドライバーと乗客の間で提供する最小限の通信と同様である。

アノテーターの慎重な考慮は、当然、クラウドワークアウトソーシングのハイパースケール化の障害となる。結果として、理由のある結果を持つデータセットが制限され、量が少なくなるか、またはアノテーターの評価が急いで行われ、情報が不足している。

アノテーターが正直であると仮定して。

アウトソーシングされたデータセットラベリングにおける「人を喜ばせる人」

賃金が低い、アサインメントを争う競争が激しい、キャリアの見通しが少ないクラウドワーカーは、正しい答えを素早く提供し、次のミニタスクに進む動機がある。
もし「正しい答え」が「猫/猫なし」以外のものであれば、シラキュース大学の研究は、ワーカーは、質問の内容とコンテキストに基づいて「受け入れられる」答えを推測しようとするだろうと示唆している:

‘代替的な概念化の普及と、単純なアノテーション方法の広範な使用は、オンラインヘイトスピーチに関する研究の進歩を妨げている。たとえば、Rossらは、発見した。ツイッターのヘイトスピーチの定義をアノテーターに提示すると、アノテーターは自分自身の意見を部分的に定義に合わせるようになった。結果として、アノテーションの間の信頼性は非常に低かった。 ‘

 

* 研究のインライン引用をハイパーリンクに変換したもの。

2021年12月13日発行 – 2021年12月18日更新:タグ追加

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai