Andersonの視点
CLIPベースの画像合成システムの「人種分類」課題

米国の新しい研究によると、DALL-Eシリーズの背後にある人気のあるコンピュータビジョンモデルであり、多くの画像生成および分類モデルでも使用されているCLIP(Contrastive Language Image Pretraining)には、ヒポデセント(人種分類規則、または「一滴の規則」とも呼ばれる)への明確な傾向があることがわかった。ヒポデセントとは、個人が少量の「混合」(非カウカソイド系)の遺伝的血統を持っている場合、完全に「マイノリティ」人種カテゴリに分類される規則である。
ヒポデセントは、人類史上の最も醜い章の一部を特徴づけてきたため、新しい論文の著者は、コンピュータビジョン研究および実装におけるこのような傾向がより多くの注目を集めるべきであると示唆している。なぜなら、CLIPを支えるフレームワークは、ほぼ1ヶ月に100万回以上ダウンロードされており、下流のフレームワークで人種的偏見をさらに広め、普及させる可能性があるからである。
研究対象となっているアーキテクチャは、CLIP(Contrastive Language Image Pretraining)であり、画像/キャプションのペアをインターネットから学習することで、セマンティックな関連性を学習する多モーダルマシンラーニングモデルである。これは、ラベルのコストを大幅に削減する半教師ありアプローチだが、キャプションを作成した人の偏見を反映する可能性がある。
論文より:
‘私たちの結果は、CLIPの埋め込み空間におけるヒポデセントの証拠を提供し、特に女性の画像に強く適用されるバイアスを示している。さらに、CLIPは、画像を、白人からの偏差に基づいて人種または民族のラベルに結び付けることが示唆されている。’
論文ではまた、画像の価値関連(「良い」または「悪い」ものとの関連性)の傾向は、白人ラベルよりも「マイノリティ」人種ラベルでより高いことが示されている。CLIPのバイアスは、英語ウィキペディア(US中心のコーポラス)で学習されたことの反映であると示唆している。
CLIPの明らかなヒポデセントの支持についてコメントするにあたり、著者は次のように述べている:
‘CLIPは、DALL-Eのゼロショット画像生成モデルを学習するために最初に使用された。CLIPアーキテクチャのより大きな、非公開バージョンは、DALL-E 2の学習に使用された。私たちの研究結果と一致して、DALL-E 2のモデルカードのリスクと制限には、「白人に近い人々の画像を生成する」と記載されている。’
‘このような使用法は、CLIPによって学習されたバイアスが、モデル自身の埋め込み空間を超えて広がる可能性を示唆している。CLIPの機能は、他の最先端のAIモデルでセマンティクスの形成を導くために使用されるからである。’
‘さらに、CLIPや同様のモデルによるゼロショット設定での画像とテキストの関連付けの進歩により、多モーダルアーキテクチャは、検索エンジンを含む、幅広いインターネットアプリケーションの将来の基盤として説明されている。’
‘私たちの結果は、自然言語の監視から学習することに対する追加の注意が必要であることを示唆している。’
論文は、《視覚的セマンティックAIにおけるヒポデセントの証拠》と題され、ワシントン大学とハーバード大学の3人の研究者によって執筆された。
CLIPと悪影響
研究者は、CLIPのワークフローは、主にウェブから得た未キュレーションデータから学習しているため、未キュレーションデータに依存しており、女性を低表現し、不快なコンテンツを生成し、セマンティックバイアス(反ムスリム感情など)を示すことがある。
CLIPを最初に提示した論文では、ゼロショット設定で、CLIPはFairFaceデータセットの白人ラベルを持つ人の58.3%のみを関連付けることが示唆された。FairFaceはAmazon Mechanical Turkのワーカーによってラベル付けされたため、偏見を持っている可能性がある。新しい論文の著者は、「CLIPによって、人間によって白人と認識される多くの人が、白人以外の人種と関連付けられる」と述べている。
彼らは次のように続ける:
‘逆の関係は観察されない。FairFaceデータセットで他の人種または民族のラベルでラベル付けされた個人は、CLIPによってそれらのラベルと関連付けられる。結果は、CLIPが社会科学者によって説明されている「ヒポデセント」のルールを学習した可能性があることを示唆している。つまり、多人種の祖先を持つ個人は、少数派または劣位の親グループに属する可能性が高く、多数派または優位の親グループに属する可能性は低い。’
‘言い換えると、黒人と白人の子供は黒人と見なされる可能性が高く、アジア人と白人の子供はアジア人と見なされる可能性が高く、白人と見なされる可能性は低い。’
論文には3つの主要な発見がある:CLIPはヒポデセントを示し、多人種のアイデンティティを持つ人々を少数派の人種カテゴリに「集める」;CLIPでは「白人」がデフォルトの人種である;競合する人種は、白人からの「偏差」によって定義される;および価値バイアス(「悪い」概念との関連性)が、個人が少数派人種に分類される程度と相関する。
方法とデータ
CLIPが多人種の主体をどのように扱うかを判断するために、研究者は、以前採用されたモーフィング技術を使用して、個人の人種を変更した。
写真は、シカゴ顔データベースから取られた。これは、人種を含む心理学的研究用に開発されたデータセットである。
研究者は、データセットから「中立的な表情」の画像のみを選択し、以前の研究と一致するようにした。彼らは、StyleGAN2-ADA(FFHQで学習された)を使用して、顔画像の人種を変更し、1つの人種から別の人種への移行を示す中間画像を生成した(上の画像を参照)。
一致するように、研究者は、データセットで黒人、アジア人、ラテン系と自己認識した人の顔を、白人とラベル付けされた人の顔に変換した。モーフィングプロセスで19の中間ステージが生成された。プロジェクトでは、合計21,000枚の1024x1024pxの画像がこの方法で生成された。
研究者は、各モーフィングセットの21枚の画像ごとに、CLIPの投影画像埋め込みを取得し、次にCLIPから各画像のラベルを取得した:「多人種」、「二人種」、「混合人種」、「人物」(最後のラベルは人種を省略する)。
テスト
CLIPがヒポデセントに傾向する可能性をテストするために、研究者は、各モーフィング画像セットの各画像にCLIPによって割り当てられた人種ラベルを記録した。
結果によると、CLIPは「マイノリティ」カテゴリの人々を約50%の移行点でグループ化する傾向がある。
結果は、CLIPがアジア人、ラテン系、黒人のラベルを白人ラベルよりも多く関連付けることを示している。
CLIPは、50%の混合比率で、女性の画像をアジア人(89.1%)、ラテン系(75.8%)、黒人(69.7%)と関連付けることが多い。
結果はまた、CLIPがアジア人と黒人のラベルを「悪い」概念と関連付けることが多いことを示している。
論文では、CLIPが白人をデフォルトの人種としてエンコードしていることが示唆されており、これは、白人と人とのコサイン類似性の間のより強い相関関係によって裏付けられている。
著者は次のように述べている:
‘証拠は、CLIPが白人をデフォルトの人種としてエンコードしていることを示唆している。これは、白人と人とのコサイン類似性の間のより強い相関関係によって裏付けられている。’
*著者のインライン引用をハイパーリンクに変換したもの。
2022年5月24日に初めて公開されました。












