Andersonの視点
アマゾンメカニカルタークの欠点は自然言語生成システムを脅かす可能性がある

マサチューセッツ大学アマースト校の新しい研究は、英語教師とアマゾンメカニカルタークのクラウドソーシングワーカーを比較して、自然言語生成(NLG)システムの出力を評価し、AMTワーカーがタスクを「操作」していることや、評価タスクの基準が緩いことが、この分野の開発を妨げている可能性があることを結論付けた。
この報告は、オープンエンドのNLG評価タスクを安価にアウトソーシングすることは、劣った結果やアルゴリズムにつながる可能性があることを示唆している。
研究者は、AMTを使用したオープンエンドテキスト生成に関する45件の論文をまとめ、ほとんどの論文がAMTの使用について重要な詳細を報告していないことを発見した。これにより、論文の結果を再現することが困難になった。
スウェットショップ労働
この報告は、AMTのスウェットショップ的な性質と、AMTを信頼性の高い研究資源として使用している(おそらく予算の制約がある)学術プロジェクトを批判している。著者は次のように述べている:
‘AMTは便利で安価な解決策ですが、ワーカー間のバリアンスが大きく、キャリブレーションが不十分で、認知的に要求の高いタスクが多いことから、研究者は誤った科学的結論を導き出す可能性がある(例えば、人間が書いたテキストはGPT-2のテキストよりも「悪い」という結論)。’
報告書は、ワーカーではなく、システムを批判している。研究者は次のように述べている:
‘クラウドワーカーは頻繁に労働に対して低賃金で雇用されており、これは研究の質と、クラウドワーカーが十分な生活を送る能力を両方に悪影響を及ぼしている。’
論文「The Perils of Using Mechanical Turk to Evaluate Open-Ended Text Generation」(メカニカルタークを使用してオープンエンドテキスト生成を評価する危険性)では、オープンエンドのNLGコンテンツを評価するために、言語教師や言語学者などの「専門家評価者」を使用する必要があると結論付けている。
テストタスク
研究者は、AMTのパフォーマンスを、時間の制約が少ない専門家の読者と比較して、200個のテキスト(人間が書いたテキストと人工的に生成されたテキストの両方)を評価するように、ランダムに選択された「ターカー」に依頼した。各タスクには、4つの評価基準が含まれていた:文法(「物語のテキストは文法的に正しいか?」)、一貫性(「物語のテキストはどの程度一貫性があるか?」)、好み(「物語のテキストはどの程度楽しめるか?」)、関連性(「物語のテキストはどの程度関連性があるか?」)。
テキストの生成
研究者は、NLG材料をテストするために、Facebook AI Researchの2018年の「Hierarchical Neural Story Generation」データセットを使用した。このデータセットには、303,358個の英語の物語が含まれており、Redditの「r/WritingPrompts」サブレディットのユーザーによって書かれたものである。200個のプロンプトをランダムに選択し、Hugging-Face Transformersライブラリを使用して、GPT-2モデルでテキストを生成した。
結果と結論
この研究は、多くの点で重要な結論に達している。
短時間
この論文では、AMTの公式の平均タスク時間は360秒であるが、実際の作業時間は22秒、中央値は13秒であると述べている。英語教師が同じタスクを実行するのにかかる時間は、最も速い教師でも4倍以上かかった。

研究の2日目:個々のワーカー(オレンジ)が、より高く報酬の支払われる教師やアップワークのフリーランスと比較して、各タスクに費やす時間が著しく短かった。出典:https://arxiv.org/pdf/2109.06835.pdf
AMTでは、ワーカーが同時に複数のタスクを受け付けることができるため、「ビッグヒッター」が現れ、多くのタスクを完了することで収入を増やしている。研究者は、ワーカーがタスクを完了する時間を測定するために、各タスクの開始と終了時間を比較した。
手引を必要とする
研究結果は、AMTワーカーが人間が書いたテキストと機械が生成したテキストを区別できないことを示唆している。ただし、両方のテキストを同時に提示された場合、区別できる。
低品質の人工テキストの受け入れ
AMTワーカーは、低品質の人工テキストを人間が書いた高品質のテキストと同等に評価した。一方、英語教師は、品質の違いを容易に区別できた。
準備時間なし、ゼロの文脈
このタスクのための適切な心構えを持つことは容易ではなく、英語教師は20のタスクを完了することで、評価環境に慣れる必要があった。一方、AMTワーカーは、通常、タスクを開始する前に、適切な準備時間を与えられない。
システムの操作
報告書は、AMTワーカーがタスクを同時に受け付けて、ブラウザのタブを切り替えてタスクを完了することで、タスクの時間を水増ししていることを示唆している。
出身国は重要
AMTのデフォルト設定では、ワーカーを出身国でフィルタリングしない。報告書は、以前の研究で、AMTワーカーがVPNを使用して地理的制限を回避し、非ネイティブスピーカーがネイティブスピーカーとして働いていることを示唆している。
研究者は、評価テストをAMTで実行し、ワーカーを非英語圏の国に限定した結果、英語圏のワーカーよりも低い評価を与えることが分かった。
報告書は次のように結論付けている:
‘専門家評価者である言語教師や言語学者を使用することができるときは、常に使用するべきである。彼らはすでに書かれたテキストを評価するために訓練されており、費用もそれほど高くない。’
2021年9月16日発行 – 2021年12月18日更新:タグを追加












