Andersonの視点

生きている美しさの予測:ライブストリーミングのための顔の魅力予測

mm
Unite.AI を Google の優先ソースに追加
Image by ChatGPT, with superimposed image from the paper https://arxiv.org/pdf/2501.02509

現在までに、顔の魅力予測(FAP)は、主に心理学の研究、美容と化粧品業界、美容外科の分野で研究されてきた分野です。これは、美しさの基準が国によって異なるため、グローバルな基準を設定することが難しい分野です。

これは、単一のAIベースのデータセットを使用することが難しいことを意味します。なぜなら、すべての文化から顔と評価をサンプリングすることで得られる平均値は、より人口の多い国々がより多くのトラクションを得るため、偏っているからです。あるいは、どの文化にも適用できないからです(複数の人種と評価の平均値は、実際の人種に相当しないからです)。

代わりに、国や文化ごとに特化したデータを処理するための概念的な方法論とワークフローを開発することが課題です。

FAPの使用例は、美容と心理学の研究ではかなり限られているため、ほとんどの現在までにキュレーションされたデータセットには、限られたデータしか含まれておらず、またはまったく公開されていません。

オンラインの魅力予測ツールは、主に西洋向けに設計されているため、FAPの最新の状態を表していないかもしれません。現在、東アジア(主に中国)の研究がFAPを支配しているようです。また、東アジアのデータセットもあります。

2020年の論文「Asian Female Facial Beauty Prediction Using Deep Neural Networks via Transfer Learning and Multi-Channel Feature Fusion」からのデータセットの例。

2020年の論文「Asian Female Facial Beauty Prediction Using Deep Neural Networks via Transfer Learning and Multi-Channel Feature Fusion」からのデータセットの例。 ソース:https://www.semanticscholar.org/paper/Asian-Female-Facial-Beauty-Prediction-Using-Deep-Zhai-Huang/59776a6fb0642de5338a3dd9bac112194906bf30

美しさの評価のための商業的な用途には、オンラインデートアプリや、実在のアバター画像を「美しく」するための生成AIシステムがあります(これらのアプリケーションでは、美しさの標準が必要です)。

顔の描画

魅力的な個人たちは、広告や影響力のある分野でまだ価値のある資産です。これらの分野での金銭的インセンティブは、FAPデータセットやフレームワークの最先端を進めるための明確な機会です。

例えば、実際のデータでトレーニングされたAIモデルは、広告の影響力の高いイベントや個人の潜在能力を評価してランク付けすることができます。この機能は、ライブビデオストリーミングのコンテキストで特に重要です。ここでは、現在、フォロワー数やいいね数が、個人の魅力の指標として機能しています。

これは表面的な指標ですが、声、プレゼンテーション、視点も聴衆を集める上で重要な役割を果たします。したがって、FAPデータセットのキュレーションには、人間の監視と、顔の魅力と「見せかけの」魅力を区別する能力が必要です(これがないと、Alex Jonesのようなインフルエンサーが、顔の美しさを推定するために設計されたコレクションの平均FAP曲線に影響を与えることになります)。

LiveBeauty

FAPデータセットの不足を解消するために、中国の研究者は、100,000枚の顔画像と200,000人の人間の注釈を含む、最初の大規模なFAPデータセットを提供しています。

新しいLiveBeautyデータセットのサンプル。

新しいLiveBeautyデータセットのサンプル。 ソース:https://arxiv.org/pdf/2501.02509

このデータセットは、LiveBeautyと呼ばれ、2024年3月に(指定されていない)ライブストリーミングプラットフォームからキャプチャされた10,000人の異なるアイデンティティを特集しています。

著者はまた、FPEMという新しい多モーダルFAP方法を提示しています。FPEMは、ホリスティックな顔の事前知識と多モーダルな美的意味特徴を、Personalized Attractiveness Prior Module(PAPM)、Multi-modal Attractiveness Encoder Module(MAEM)、Cross-Modal Fusion Module(CMFM)を介して統合します。

方法とデータ

研究者は、ライブストリーミングプラットフォームから10時間の放送から最初の3時間ごとに1枚の画像を収集しました。ページビューが最も多い放送が選択されました。

収集されたデータは、複数の前処理ステージを経ました。最初のステージは、顔領域のサイズの測定で、2018年のCPUベースのFaceBoxes検出モデルを使用して、顔の特徴の周りにバウンディングボックスを生成します。パイプラインでは、バウンディングボックスの短辺が90ピクセルを超えることを保証し、小さなまたは不明瞭な顔領域を避けます。

2番目のステップは、ぼけ検出で、顔領域にLaplacian演算子の分散を使用して適用されます。顔の作物の高さ(Y)チャンネルでこの分散は10を超える必要があり、ぼけた画像をフィルタリングするのに役立ちます。

3番目のステップは、顔のポーズ推定で、2021年の3DDFA-V2ポーズ推定モデルを使用します。

3DDFA-V2推定モデルの例。

3DDFA-V2推定モデルの例。 ソース:https://arxiv.org/pdf/2009.09960

ここでは、ワークフローでは、切り取られた顔のピッチ角度が20度を超えないこと、およびヨー角度が15度を超えないことを保証します。極端なポーズの顔は除外されます。

4番目のステップは、顔の比例評価で、3DDFA-V2モデルのセグメンテーション能力を使用して、切り取られた顔領域の比例が画像の60%を超えることを保証します。画像全体で顔が小さい画像は除外されます。

最後のステップは、重複文字の削除で、(帰属なし)の最先端の顔認識モデルを使用して、同じアイデンティティが10時間のビデオの3枚の画像のいずれかに複数回出現する場合に使用されます。

人間の評価と注釈

20人の注釈者が募集され、6人の男性と14人の女性で、使用されたライブプラットフォームの人口統計を反映しています。顔は、iPhone 14 Pro Maxの6.7インチの画面に表示され、ラボラトリーの条件が一貫して維持されました。

評価は、200回のセッションに分割され、各セッションでは50枚の画像が使用されました。被験者は、1から5のスコアでサンプルの顔の魅力を評価するよう求められ、各セッションの間には5分間の休憩が設けられ、すべての被験者がすべてのセッションに参加しました。

したがって、10,000枚の画像全体が、20人の人間の被験者によって評価され、200,000の注釈が得られました。

分析と前処理

最初に、被験者ごとのポストスクリーニングが、外れ値の比率とSpearmanの順位相関係数(SROCC)を使用して実行されました。SROCCが0.75未満、または外れ値の比率が2%を超える被験者は、信頼できないと判断され、除外されました。最終的に、20人の被験者が得られました。

次に、各顔画像に対する平均意見スコア(MOS)が、有効な被験者によって得られたスコアを平均することで計算されました。MOSは、各画像の魅力のグラウンドトゥルースラベルとして機能し、スコアは、各有効な被験者からのすべての個々のスコアを平均することによって計算されます。

最後に、すべてのサンプルのMOS分布、および女性と男性のサンプルのMOS分布の分析は、ガウシアンモデルに似た形状を示したことがわかりました。これは、実際の顔の魅力分布と一致しています。

LiveBeautyのMOS分布の例。

LiveBeautyのMOS分布の例。

ほとんどの個人には、平均的な顔の魅力があり、非常に低いまたは非常に高い魅力を持つ個人は少数です。

さらに、歪度と尖度の値の分析は、分布が薄い尾と平均スコアの周りに集中していることを示し、高魅力は、収集されたライブストリーミングビデオの女性サンプルの中でより一般的であることを示しています。

アーキテクチャ

FPEMとLiveBeautyのハイブリッド融合フェーズの2段階のトレーニング戦略が使用され、4つのモジュールにわたって分割されました。Personalized Attractiveness Prior Module(PAPM)、Multi-modal Attractiveness Encoder Module(MAEM)、Cross-Modal Fusion Module(CMFM)、およびDecision Fusion Module(DFM)です。

LiveBeautyのトレーニングパイプラインの概念スキーマ。

LiveBeautyのトレーニングパイプラインの概念スキーマ。

PAPMモジュールは、画像を入力として受け取り、Swin Transformerを使用してマルチスケールの視覚特徴を抽出します。また、事前トレーニングされたFaceNetモデルを使用して、顔認識特徴を抽出します。これらの特徴は、クロスアテンションブロックを使用して組み合わせられ、パーソナライズされた「魅力」の特徴を作成します。

MAEMは、画像と魅力のテキスト記述を使用して、CLIPを使用して、多モーダルな美的意味特徴を抽出します。

テンプレート化されたテキスト記述は、「{a}魅力のある人の写真」{a}悪い貧しい公平良い、または完全になる可能性があります)の形式です。プロセスは、テキストと視覚の埋め込み間のコサイン類似度を推定して、魅力レベルの確率に到達します。

ハイブリッド融合フェーズでは、CMFMは、PAPMによって生成されたパーソナライズされた魅力特徴を使用して、テキスト埋め込みを改良し、パーソナライズされたテキスト埋め込みを生成します。次に、類似性回帰戦略を使用して予測を行います。

最後に、DFMは、PAPM、MAEM、CMFMからの個々の予測を組み合わせて、単一の最終的な魅力スコアを生成します。頑健なコンセンサスを達成することを目標とします。

損失関数

損失メトリックの場合、PAPMは、L1損失を使用してトレーニングされます。これは、予測された魅力スコアと実際の(グラウンドトゥルース)魅力スコアの絶対差の尺度です。

MAEMモジュールは、スコアリング損失(LS)とマージされたランキング損失(LR)を組み合わせた、より複雑な損失関数を使用します。ランキング損失(LR)には、忠実度損失(LR1)と2方向ランキング損失(LR2)が含まれます。

LR1は、画像ペアの相対的な魅力を比較し、LR2は、魅力レベルの予測確率分布が単一のピークを持ち、両方向に減少することを保証します。この組み合わせアプローチは、スコアリングとランキングの両方を最適化することを目的とします。

CMFMとDFMは、単純なL1損失を使用してトレーニングされます。

テスト

テストでは、研究者はLiveBeautyを9つの前のアプローチと比較しました。

テストの結果は、LiveBeautyが他のアプローチを上回っていることを示しています。

倫理的配慮

魅力の研究は、偏った視点を永続させる可能性があるため、潜在的に分裂する追求です。

魅力のシステムは、人間の注釈やオンライン環境での注目パターンの分析から生じる偏った視点を永続させる可能性があるため、内在的に偏った視点を永続させる可能性があります。

これらの判断は、人間の注釈によって行われることが多く、文化や人種のセクションのいずれかで、ドメインの一般化に効果的に貢献しない可能性があります。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai