Andersonの視点

画像検索結果のジェンダーと人種を機械学習で変更する

mm
Unite.AI を Google の優先ソースに追加

UCサンディエゴとAdobe (ADBE ) Researchの共同研究により、従来のWASP中心の職業における画像検索結果のジェンダーと人種の多様性の欠如に対する革新的な解決策が提案された。Generative Adversarial Networks(GAN)を使用して、偏った職業の画像を生成し、主体のジェンダーと/or人種を変更するというものである。

この例は、新しい論文から採用されたもので、研究者は望ましい写真の特性を入力し、それが典型的な画像資料コーパスに表現されていないか、または不適切な表現(例:性的化された表現)で表現されている場合に使用する。

この例は、新しい論文から採用されたもので、研究者は望ましい写真の特性を入力し、それが典型的な画像資料コーパスに表現されていないか、または不適切な表現(例:性的化された表現)で表現されている場合に使用する。 出典

新しい論文「画像検索の多様性の生成と制御」では、著者は、再ランキングによって、偏った画像/特徴クラスのバランスを修正することが限界があることを示唆しており、合成データを使用して人種とジェンダーの多様性を増やすことがこの課題に対する解決策となる可能性があることを示唆している。

‘ユートピア的な世界を追求するには、コンテンツの利用者に、どのような職業でも多様な人種とジェンダーの特性を表現する機会を提供する必要がある。特定の職業、人種、ジェンダーの組み合わせに対する既存のコンテンツの選択肢が限られていることは、コンテンツ提供者にとって課題である。現在の研究は、主に検索の偏りに対する再ランキングアルゴリズムに焦点を当てている。

‘しかし、これらの方法では新しいコンテンツを作成したり、写真における保護された属性の全体的な分布を変更したりすることはできない。这些問題を解決するために、私たちは、不均衡なデータセットからの複数の属性に基づいて高忠実度の画像生成を条件付ける新しいタスクを提案する。 ‘

この目的のために、著者は、StyleGan2をベースとしたGANベースの画像合成システムのさまざまなアーキテクチャを実験した。

論文の補足資料から、'大工'と'機械操作者'の例で、偏った職業の画像表現を'均等化'する2つの例。

論文の補足資料から、’大工’と’機械操作者’の例で、偏った職業の画像表現を’均等化’する2つの例。 出典

不十分または不適切に表現されたもの

研究者は、Google画像検索での「配管工」の検索結果*を実世界の課題として捉え、画像検索結果は若い白人男性によって支配されていることを観察している。

論文から、Google画像検索での'配管工'の検索結果(2021年1月)。

論文から、Google画像検索での’配管工’の検索結果(2021年1月)。

著者は、同様の偏りの兆候が、’事務員’、’清掃員’、’機械操作者’などの職業にも見られ、年齢、ジェンダー、人種に対する偏りも存在することを指摘している。

‘社会的な偏りにより、一部の人種とジェンダーの組み合わせには画像が少ないか、まったくない場合がある。例えば、’黒人女性機械操作者’または’アジア人男性事務員’を検索した場合、Google画像検索では関連画像が見つからなかった。 ‘

‘さらに、特定のジェンダーと人種の組み合わせでは、個人が不適切に表現されることがある。’アジア人女性大工’または’黒人女性警備員’の検索クエリでは、このような挙動が観察された。 ‘

論文は、2014年の別の学術的な共同研究を引用し、96の職業のトップ400の画像検索結果を収集し、女性が結果の37%を占め、反ステレオタイプの画像が22%であったことを発見した。2019年のイェール大学の研究では、5年間でこれらの割合がそれぞれ45%と30%に増加したことが示された。

さらに、2014年の研究では、特定の職業の画像検索結果における個人の性的化を「セクシーな大工問題」として分類し、職業認識の結果を歪める可能性があることを示唆した。

全体像

著者にとっての主な課題は、1024×1024解像度の出力が可能なGANベースの画像合成システムを生成することだった。現在のGANとエンコーダ/デコーダベースの画像合成システムの状態では、512×512は贅沢なものであり、さらに高解像度を達成することは時間と処理リソースのコストがかかり、生成された画像の真実性にリスクをもたらす可能性がある。

しかし、著者は、低解像度では画像検索で注目されることはないと述べ、さまざまなGANフレームワークを実験し、高解像度の画像を出力できるものを探した。

StyleGan2を採用することに決定した後、生成された出力のサブ特性(人種、職業、ジェンダーなど)に対するより大きな制御が必要であることが明らかになった。したがって、著者は生成プロセスを強化するためにマルチクラス条件付けを使用した。

指定画像ジェネレーターのアーキテクチャ。著者は、これがStyleGAN2に特有のものではなく、さまざまなジェネレーターフレームワークに適用可能であると述べている。

指定画像ジェネレーターのアーキテクチャ。著者は、これがStyleGAN2に特有のものではなく、さまざまなジェネレーターフレームワークに適用可能であると述べている。

人種、ジェンダー、職業を制御するために、アーキテクチャはこれらの連結特性の1ショットエンコードをyベクトルに注入する。次に、フィードフォワードネットワークを使用してこれらの特性を埋め込み、生成時には無視されないようにする。

著者は、StyleGan2をこのように操作することには限界があることを観察し、結果をより微妙に変更しようとする試みは、画像の品質が低下し、モード崩壊を引き起こす可能性があることを示した。

これらの対策は、しかし、アーキテクチャ内の暗黙の偏り問題を解決しない。研究者は、データセットから表現されていないエンティティをオーバーサンプリングする必要があったが、オーバーフィットをリスクにさらすことはできなかった。オーバーフィットは、生成された画像ストリームの柔軟性に影響を及ぼすからである。

したがって、著者は、StyleGAN2-ADAを採用し、Adaptive Discriminator Augmentation(ADA)を使用して、ディスクリミネータがオーバーフィットしないようにした。

データ生成と評価

このプロジェクトの目的は、新しい合成データを生成することであるため、研究者は2014年のプロジェクトの方法論を採用し、人種とジェンダーの偏りが高い職業を選択した。選択された職業は、’経営管理者’、’事務員’、’看護師’、’農家’、’軍人’、’警備員’、’トラック運転手’、’清掃員’、’大工’、’配管工’、’機械操作者’、’技術サポート担当者’、’ソフトウェアエンジニア’、’作家’であった。

著者は、これらの職業を選択したのは、画像検索結果における偏りの程度に基づいてのみではなく、多くの場合、職業に固有の視覚的な要素(制服、特定の機器または環境の存在など)が含まれているためである。

データセットは、Adobe Stockライブラリから10,000枚の画像で構成され、職業の分類を試みた場合、95%以上のスコアを獲得した。

多くの画像はターゲットタスクに役立たなかった(例:人を含んでいない)ため、手動でのフィルタリングが必要だった。次に、ResNet32ベースの分類器を使用し、FairFaceで事前学習し、ジェンダーについては95.7%、人種については81.5%の平均精度で画像をラベル付けした。したがって、研究者は、性別:男性、女性、人種:白人、黒人、アジア人、その他の人種などの属性の画像ラベルを取得した。

TensorFlowを使用して、StyleGAN2とStyleGAN2-ADAをコアネットワークとしてモデルを構築し、NVIDIAのFlickr-Faces-HQ Dataset(FFHQ)データセットで事前学習したStyleGAN2の事前学習済み重みを使用し、34,000枚の職業特有の画像で構成される別のデータセットUncurated Stock-Occupation HQ(U-SOHQ)を追加した。

Amazon Mechanical Turkによる人間の評価のサンプルHIT。

Amazon Mechanical Turkによる人間の評価のサンプルHIT。

4つのアーキテクチャ構成で画像を生成し、最終的にUniform+が、自動評価(FID)とAmazon Mechanical Turkワーカーによる後の評価で最高のスコアを獲得した。分類精度と組み合わせて、著者はAttribute Matching Scoreという独自のメトリックを使用した。

人間の評価による、さまざまな方法で生成された画像。Uniform+方法が最も説得力があり、新しいデータセットの基礎となった。

人間の評価による、さまざまな方法で生成された画像。Uniform+方法が最も説得力があり、新しいデータセットの基礎となった。


機械学習のライターで、人間画像合成の専門家です。Metaphysic.ai の研究コンテンツ部門の元責任者で、DNEG の Brahma.ai に統合されるまで勤務していました。
ウェブサイト: martinanderson.ai
連絡先: martin@martinanderson.ai