Andersonの視点

AIの美の追求

mm
Unite.AI を Google の優先ソースに追加
AI-generated image featuring a woman whose face is being analyzed by a Terminator-style HUD. GPT-1.5.

新しいAI駆動の美評価システムは、顔の魅力を評価することができ、従来のディープラーニングモデルよりも高速にトレーニングすることができ、自動化された美のスコアリングを実現する可能性が高い。

 

顔の美しさ予測(Facial Beauty Prediction, FBP)は、大きなビジネスであり、研究文献の中でも強い分野である。AIと機械学習の実践における偏りの対策という観点からは、ほとんどの原則に反するものであり、アルゴリズミックな女性の認識における客体化と還元主義を支持するものであるにもかかわらず、化粧品、美容手術、ライブストリーミング、ファッションなどの女性向けの多くの多億ドル規模の業界に注目されている。

女性を1〜5の評価で評価した、Asian Female Facial Beauty Prediction Using Deep Neural Networks via Transfer Learning and Multi-Channel Feature Fusionという研究の画像。

女性を1〜5の評価で評価した、Asian Female Facial Beauty Prediction Using Deep Neural Networks via Transfer Learning and Multi-Channel Feature Fusionという研究の画像。 ソース

これらの明らかな女性向けのビジネス分野のほかにも、広告やエンターテインメント、出版などの業界にも、美しさを理解することが大きな利益がある。文化ごとに美しさの認識が異なるため、グローバルに適用できるデータセットを取得することはできず、新しい研究は、地域的なものに留まるか、文化的なデータの多様なスワスに対して適用できる「高レベル」の方法に集中する必要がある。

地理的な場所だけではなく、美しさに焦点を当てたデータセットは、性別や用途によっても制限を受けることがあり、他のドメインでの使用を制限する可能性がある。

例えば、2025年に私はライブストリーミングでの魅力予測のための100,000を超えるアイデンティティを持つデータセットの開発について報告したが、このデータセットは他のプロジェクトへの適用に大きな努力が必要である可能性がある。

顔の表現

上記のリンクや画像から明らかなように、アジアの研究機関は、西洋の研究機関とは異なる文化的な制約を受けていることが多い。西洋の研究機関は、上記の研究のように、5人の西洋女性を1〜5の評価で評価する科学的なイラストを公開することは難しいだろう。

アジアで開発されたこのようなシステムは、西洋の利益が利用または適応できるように、公開されたものとして機能することができる。顔の「評価」のタスクは、批判を受けない場所に移管されることになる。

適者生存

TikTok、Instagram、YouTubeなどの巨大なウェブデータセットは、美しさの評価に適したものであるように思われるかもしれない。フォロワー、いいね、トラフィックを魅力に結び付けることは、社会メディアにおける一般的かつ妥当な関連付けであるからである(ただし、一部の例外はある)。

また、ImageNetやLAIONなどの既存のコレクションは、俳優やモデルが「トップ」に立っているものであり、通常、魅力的な個人を特集している(ただし、多くの場合、同じ人物のデータポイントが多すぎる)ため、より広い文化的メカニズムが美しさの代理として機能することができる。

しかし、これは美しさの評価が時間の経過とともに変化することを考慮していない(地理的な場所によっても異なる)。したがって、高レベルでデータに依存しないシステムが必要であり、個別のコレクションやキュレーションは、変化する評価を反映できない。

混合肌

最新の学術的研究は、中国から登場し、転移学習Broad Learning System(BLS)を組み合わせて、精度と計算コストのトレードオフに取り組んでいる。

従来のニューラルネットワークは、重いトレーニングで強い結果を達成する傾向があるが、BLSなどの軽量システムは迅速にトレーニングすることができるが、細かい詳細を捉えるのに苦労する。新しい研究は、事前トレーニングされた視覚モデルを使用して顔の特徴を抽出し、それをBLSに渡してスコアリングを行うことで、特徴を再学習する必要性を回避し、トレーニングを効率的に行うことができる。

LSAFBDデータセットのサンプル画像。女性の顔が1〜5の美しさスコアでグループ化されている。

LSAFBDデータセットのサンプル画像。女性の顔が1〜5の美しさスコアでグループ化されている。 ソース

最初のバリアント(E-BLS)は、事前トレーニングされた視覚モデルから抽出された特徴を直接軽量システムに渡すものである。2番目のバリアント(ER-BLS)は、特徴を標準化して精製するための簡単な中間ステップを追加するものである。これにより、特徴の整合性が向上し、プロセスが遅くなることはない。

テストでは、著者らは、新しい論文で紹介されているE-BLSとER-BLSの2つのバリアントを使用した。E-BLSは、事前トレーニングされた視覚モデルから抽出された特徴を直接BLSに渡す。ER-BLSは、特徴を標準化して精製するための簡単な中間ステップを追加する。

方法

上記のBroad Learning Systemは、ディープニューラルネットワークの軽量代替であり、複数の層を積み重ねるのではなく、幅広いシンプルな接続を使用して学習する。これにより、モデルは迅速にトレーニングすることができるが、通常、より細かい視覚的な詳細を欠如する。

最初のバリアント(E-BLS)は、EfficientNetベースの転移学習とBLSを組み合わせて、顔の特徴を抽出し、BLSに渡してスコアリングを行う。これにより、フルなディープニューラルネットワークをトレーニングする必要性を回避することができる。

E-BLSモデルのアーキテクチャ。事前トレーニングされたEfficientNet特徴抽出器を使用して、顔の画像を特徴マップに変換し、BLSに渡してスコアリングを行う。

E-BLSモデルのアーキテクチャ。事前トレーニングされたEfficientNet特徴抽出器を使用して、顔の画像を特徴マップに変換し、BLSに渡してスコアリングを行う。

EfficientNetは、ImageNet-1kで事前トレーニングされており、大部分が変更されていない。各入力画像を、構造化された方法で顔の特徴を記述するコンパクトな特徴値のセットに変換する。BLSは、これらの特徴値を使用して、スコアリングを行う。

2番目のバリアント(ER-BLS)は、E-BLSに基づいて、特徴を標準化して精製するための簡単な中間ステップを追加する。特徴を標準化して精製することで、特徴の整合性が向上し、プロセスが遅くなることはない。

データとテスト

著者らは、SCUT-FBP5500データセットを使用して、提案したアプローチをテストした。SCUT-FBP5500データセットは、南中国大学の顔の美しさ予測コレクションであり、5,500枚の正面の顔の画像(350x350px)で構成されており、人種、性別、年齢の多様性がある。

各画像は、60人のボランティアによって、1〜5の評価で評価された。評価は、非常に魅力的でない(1)から非常に魅力的(5)までの範囲で行われた。

別のデータベースとして、Large-Scale Asian Female Beauty Dataset(LSAFBD)コレクションが使用された。LSAFBDコレクションは、著者らによってキュレーションされたデータセットであり、80,000枚の未ラベル画像(144x144px)で構成されており、ポーズや背景のバリエーションがある。

各データセットは、8:20の比率でトレーニングとテストのセグメントに分割され、クロスバリデーションが使用されて、実行間の結果を安定させた。BLSコンポーネントは、特徴ウィンドウの数、ウィンドウごとのノードの数、および強化ノードの数で構成され、Hyperoptが使用されて、有効な組み合わせを検索した。

ベースラインとして、標準的なBLSモデルが同等の設定でトレーニングされた。その後、ResNet50Inception-V3DenseNet121InceptionResNetV2EfficientNetB7MobileNetV2NASNetXceptionなどの転移学習モデルが導入された。すべてのモデルは、ImageNet-1kの重みで初期化され、最終層がアンフリーズされた状態でトレーニングされた。

トレーニングでは、0.001の学習率(進歩が停滞したときに減少)と、16のバッチサイズが使用され、50のエポックでトレーニングされた。さらに、正則化ReLUが適用された。

パフォーマンスは、精度とピアソンの相関係数で評価され、トレーニング時間も考慮された。結果は5回の実行で平均化された。

著者らは、トレーニングの設定を、Intel-i7 3.6 GHz CPUと64GB RAMを搭載したデスクトップコンピューターであると報告した。

SCUT-FBP5500でのパフォーマンス比較。E-BLSとER-BLSは、ResNet50、EfficientNetB7、Inception-V3、XceptionなどのディープCNNモデルと競合する精度を達成しながら、トレーニング時間を大幅に削減する。

SCUT-FBP5500でのパフォーマンス比較。E-BLSとER-BLSは、ResNet50、EfficientNetB7、Inception-V3、XceptionなどのディープCNNモデルと競合する精度を達成しながら、トレーニング時間を大幅に削減する。

結果は、E-BLSが精度を65.85%から73.13%に向上させ、ER-BLSが74.69%の精度を達成し、すべての比較モデルを上回った。トレーニング時間は、ディープCNNモデルと比較して大幅に短縮された。

LSAFBDでのテスト結果は、E-BLSが精度を向上させ、ER-BLSが最高の精度を達成したことを示した。

LSAFBDでのパフォーマンス。ER-BLSとE-BLSは、すべてのベースラインモデルと転移学習モデルを上回る精度を達成しながら、トレーニング時間を大幅に削減する。

LSAFBDでのパフォーマンス。ER-BLSとE-BLSは、すべてのベースラインモデルと転移学習モデルを上回る精度を達成しながら、トレーニング時間を大幅に削減する。

結論

この研究は、コンピュータビジョンの分野で、美しさの評価という驚くほど堅牢な目標に取り組んでおり、人間の経験や主観的な解釈に深く関わるものである。また、美しさのトレンドに左右されない、真正に堅牢なパイプラインを提供するスキーマが必要である。

この研究は、古典的なCNNモデルや低レベルのトレーニング機器を使用しているため、ある意味では「往年の」研究である。しかし、美しさの評価という目標は、人間の経験や主観的な解釈に深く関わるものであり、美しさのトレンドに左右されない、真正に堅牢なパイプラインを提供するスキーマが必要である。

 

2026年3月19日初版

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai