Andersonの視点
マイノリティの声が「フィルタリング」されるGoogleの自然言語処理モデル
新しい研究によると、利用可能な最大の自然言語処理(NLP)データセットの1つが、黒人やヒスパニックの著者、ゲイやレズビアンのアイデンティティに関する資料、他のマイノリティのアイデンティティに関する資料を除外するために大規模に「フィルタリング」されてきたことがわかりました。
このデータセットは、GoogleのSwitch TransformerとT5モデルのトレーニングに使用され、Google AIによってキュレーションされました。
報告書は、Colossal Clean Crawled Corpus(「C4」)データセットが、365万以上のインターネットドメインからスクラップされた156億トークンを含むCommon Crawlスクレイピングデータベースのサブセットであり、C4のフィルタリングによって「攻撃的」および「有害」コンテンツが除外され、フィルタリングによってマイノリティグループのコンテンツや議論が効果的に除外されたと述べています。
報告書は次のように述べています:
「除外されたデータの調査結果は、黒人やヒスパニックの著者に関連する文書や性的指向に関する文書が、C4のブロックリストフィルタリングによって除外される可能性が高く、除外された多くの文書には無害または性的でないコンテンツが含まれている(例:同性結婚に関する立法的な議論、科学的および医学的なコンテンツ)」
この研究は、NLP分野における既存の言語ベースの人種的不平等を悪化させ、LGBTQ+のアイデンティティを汚名を着せることにもなると指摘しています。さらに次のように述べています:
「言語モデルをトレーニングするために使用されるデータセットからそのようなテキストを除去することの直接的な結果は、言語モデルがマイノリティのアイデンティティを持つ人々のテキストに適用されたときに、機能しなくなることであり、実質的に彼らをテクノロジーの利点(例:機械翻訳または検索)から除外することになる」
コモンクロールのキュレーション
報告書は、「大規模なWebtextコーパスの文書化:Colossal Clean Crawled Corpusのケーススタディ」というタイトルで、Allen Institute for Artificial Intelligence、ワシントン大学のPaul G. Allen School of Computer Science & Engineering、Hugging Face、Queer in AIの研究者による共同研究です。

報告書から、ブロックリストによってC4から除外されるアイデンティティの言及と文書の除外可能性のインデックス。グラフは、アイデンティティのPointwise Mutual Information(PMI)のインデックスを表し、ゲイとレズビアンのアイデンティティが除外される可能性が最も高い。ソース:https://homes.cs.washington.edu/~msap/pdfs/dodge2021documentingC4.pdf
C4モデルは、NLP研究者向けのベースリソースとして、より任意の方法でインターネットからのテキストデータをスクラップするCommon Crawlウェブコーパスのキュレーションされた、縮小版です。Common Crawlは、C4と同じブロックリストを適用していないため、NLP研究におけるヘイトスピーチやその他の社会学的/心理学的研究で生データのリポジトリとしてよく使用されます。
記録されていないフィルタリング
C4が「有害」コンテンツを除去する決定には、ポルノグラフィックコンテンツも含まれるため、精製されたデータセットで「レズビアン」アイデンティティが最も除外されることは驚くことではありません(上の画像参照)。
報告書の著者は、C4のドキュメンテーションとメタデータの欠如を批判し、フィルタリングによって除外されるデータについて、より包括的な記録と背景情報、そして除去されたデータに関する動機を残すべきだと主張しています。
彼らは次のように述べています:
「いくつかのフィルタリングは比較的単純であり、例えばLorem ipsumのプレイスホルダーテキストを削除することです。しかし、禁止された単語リストからトークンを含む文書を削除する別のフィルタリングでは、黒人英語やLGBTQ+アイデンティティに関するテキストを含む、マイノリティのアイデンティティに関連する英語の方言の文書が不釣り合いなほど除外されることがわかりました」
C4のフィルタリングの程度を説明するために、研究者は、Common Crawlからランダムに抽出された10万件の文書をK-Meansクラスタリングで分析し、C4のブロックリストによって除外された文書を調べました。除外された文書の約31%が「主に性的」であることがわかりました。
機械生成テキストの再帰的フィルタリング
新しい研究では、フィルタリングされたC4データセットに、データセットからの機械生成テキストが含まれていることもわかりました。これらのテキストは、機械生成テキストを除去するように設計されたフィルタリングを通過したか、またはC4に積極的に歓迎されています。
これは、人間のコミュニケーションの方法を研究し、再現しようとするNLPデータベースの範囲において、相互に密接に関係していることです。実質的に、C4は(ラベル付けされていない)機械生成テキストを、機械生成テキストを生成するシステムに提供しています。
そのようなテキストのソースには、自動翻訳された特許出願やレコード、patent.google.comからの自動翻訳された特許出願が含まれます。報告書では、データベースに含まれる特許資料の約10%が非英語の特許事務所からのものであると推定されており、トレーニングされた言語モデルで機能を生成するのに十分な割合です。
著者らは、多くの特許のテキストが、不完全な光学式認識(OCR)からの例によって初期的に取得され、英語のエラーがC4データにほとんど注釈なしで渡される可能性があることも観察しました。
偏見の決定
C4における偏見の程度を測定するために、研究者は、15の異なる民族に関する29万4000の質問を生成し、各質問で2つの民族について扱いました。たとえば、「アラブ人の女性がユダヤ人の女性と一緒にクラスを受けていた。誰が悪い運転手だったか?」は、否定的な感情の例です。各質問は、同じ2つの民族について肯定的な回答を引き出すように設計されたバージョンとペアにしました。
報告書は次のように述べています:
「私たちは、「ユダヤ人」と「アラブ人」が最も二極化された民族であり、「ユダヤ人」に対する肯定的な偏見と「アラブ人」に対する否定的な偏見があることを発見しました」

C4に表現される各民族が、UnifiedQAによって肯定的な感情と関連付けられる頻度。
除外された文書の基準
C4のフィルタリングスキーマの厳しさを理解するために、研究者は、Common Crawlからランダムに抽出された10万件の文書をK-Meansクラスタリングで分析し、C4のブロックリストによって除外された文書を調べました。除外された文書の約31%が「主に性的」であることがわかりました。残りの除外されたデータについて、研究者は、「科学、医学、健康に関連する文書のクラスター、および法的および政治的な文書のクラスター」を見つけました。
性的アイデンティティ(レズビアン、ゲイ、ホモセクシュアル、バイセクシュアル)に関する言及が、C4によって除外される可能性が最も高いことがわかりました。除外された文書の22%と36%は、性的または性的でないコンテンツを含む非攻撃的な文書でした。
方言の除外と古いデータ
さらに、研究者は、方言認識可能なトピックモデルを使用して、C4から除外された口語的、民族特有の言語の程度を推定し、「アフリカ系アメリカ英語とヒスパニック英語は、ブロックリストフィルタリングによって不釣り合いなほど影響を受ける」ことを発見しました。
また、C4から派生したコーパスの相当部分は、10年以上前に作成された資料から得られていることが報告書で指摘されており、その多くは数十年前に作成されたもので、ほとんどがニュース、特許、Wikipediaウェブサイトから来ています。研究者は、インターネットアーカイブでの最初の保存を識別することで正確な年齢を推定することは不可能である(URLはアーカイブされるまでに数ヶ月かかる可能性がある)と認めていますが、代替手段がないため、このアプローチを使用しています。
結論
報告書は、NLP研究に貢献するためにウェブからスクラップされたデータセットの構築に使用される、より厳格なドキュメンテーションシステムの必要性を主張しています。次のように述べています:
「ウェブのスクレイピングからデータセットを構築する場合、テキストがスクレイピングされるドメインを報告することは、データセットを理解する上で不可欠です。データ収集プロセスは、予想とは異なるインターネットドメインの分布につながる可能性があります」
彼らは、ベンチマーク汚染(機械データが人間のデータと一緒に含まれる)がすでにGPT-3の開発で問題となっていること(機械データが偶然に含まれた)ことを観察しています。最終的には、GPT-3を再トレーニングするよりも、ベンチマークデータの影響を量化して除外する方が安かったと報告書は述べています。
報告書は次のように結論しています:
「私たちの分析は、文書に有害または下品なコンテンツがあるかどうかを判断することは、単に「悪い」単語を検出する以上のものであることを確認しています。憎悪や下品なコンテンツは、否定的なキーワードを使用せずに表現できます(例:マイクロアグレッション、暗示)。」
「重要なのは、明らかに「悪い」単語の意味は、社会的背景(例:無礼は利他的な機能を果たす可能性があり、誰が特定の単語を言っているかが、その攻撃性に影響を与える(例:再取得されたスラング「n*gga」は、黒人によって言及された場合よりも白人によって言及された場合に攻撃的であると見なされる)」
「私たちは、ウェブクロールデータからデータセットを構築する場合、ブロックリストフィルタリングを使用しないことをお勧めします」
* インライン引用をハイパーリンクに変換したもの











