Andersonの視点
メイクを取り除くAIツールが未成年者による年齢確認の回避を防ぐ

顔のメイクの外観は、主に女性である未成年者が、デーティングアプリやECサイトなどのプラットフォームでセルフィーによる年齢確認を回避することを可能にします。新しいAIツールは、この抜け穴に対処し、メイクを消去しながらアイデンティティを保持するための差別モデルを使用し、未成年者が自動化システムを欺くことをより困難にします。
セルフィーベースの年齢確認サービスを使用することは、一般的な世界的な動きのため、増加しています。たとえば、イギリスのオンラインセーフティー法が現在義務付けている新しい施行規制では、年齢確認は、サービスの種類を使用して実行できます。使用する方法の1つは、視覚的な年齢確認で、AIがユーザーの年齢を視覚的に予測します(通常はライブモバイルカメラの映像から)。この種のアプローチを使用するサービスには、Ondato、TrustStamp、およびYotiがあります。
しかし、年齢推定は必ずしも完璧ではなく、大人の権利を得ようとする思春期の伝統的な決意により、若者はさまざまな方法で、禁止されている年齢層のグループに入るためにデーティングサイト、フォーラム、その他の環境に入る方法を開発してきました。
このような方法の1つは、主に女性によって使用されるもので、顔のメイクを使用することです。これは、自動化された年齢推定システムを欺くことが知られている戦術です。これらのシステムは、一般的に、若い人の年齢を過大評価し、高齢者の年齢を過小評価します。
女性だけではない
メイクを「女性向け」と見なすことに対する抗議が出る前に、私たちが注目するべきは、誰でもがメイクを施しているということです。つまり、性別の非常に信頼できない指標です。

米国研究者は、ジェンダー交換メイクがジェンダー検証システムを欺いたことを発見しました。ソース:https://cse.msu.edu/~rossarun/pubs/ChenCosmeticsGenderAge_VISAPP2014.pdf[/em>
2024年には、18〜24歳の米国男性消費者の72%がメイクを日常のルーティーンに組み込んでいることが推定されています。ただし、ほとんどの男性は、健康な皮膚の外観を強調するために化粧品を使用しているのであって、女性の視覚的な美しさと関連付けられるような、派手なマスカラやリップスティックの組み合わせを楽しんでいるのではありません。
したがって、私たちが研究する材料は、新しい研究で探索されている最も一般的なシナリオに従って、メイクを使用して自動化された視覚的な年齢確認システムを回避しようとしている女性の未成年者に焦点を当てる必要があります。
AIによる効果的なメイク除去
上記の研究は、新しい論文 DiffClean:正確な年齢推定のための拡散ベースのメイク除去 としてニューヨーク大学の3人の貢献者から来ています。
このプロジェクトの目的は、画像(または潜在的にビデオ画像)からメイクの外観を除去するAI駆動型方法を達成することです。メイクを施した人の真の年齢をよりよく理解することです。

新しい論文からのメイク除去の例。ソース:https://arxiv.org/pdf/2507.13292[/em>
このようなシステムを開発する上での課題の1つは、メイクを施した未成年者の画像を収集またはキュレーションすることの潜在的な敏感性です。結局、研究者はEleGANtというサードパーティの生成的敵対的ネットワークベースのシステムを使用して、画像に合成メイクスタイルを施しました。これは非常に効果的でした。

清華大学の2022年のEleGANtシステムは、生成的敵対的ネットワーク(GAN)を使用して、ソース写真に本物のメイクを重ねます。ソース:https://arxiv.org/pdf/2207.09840[/em>
この方法で得られた合成データと、さまざまなプロジェクトとデータセットの助けを借りて、著者は、メイクを施したときに年齢推定で最先端の方法を超えることができました。
論文には次のように記載されています。
‘DiffCleanは、テキストガイドの拡散モデルを使用してメイクの痕跡を消去し、メイク攻撃に対して防御します。[それ]は、デジタルにシミュレートされた画像と実際のメイク画像の両方で、年齢推定(18歳未満と18歳以上の正確性が4.8%向上)と顔認証(TMRが8.9%向上、FMR=0.01%)を競合他社の基準よりも改善します。’
それでは、彼らがこのタスクに取り組む方法を見てみましょう。
方法
未成年者のメイクを施した実際の画像を取得するのを避けるために、著者はUTKFaceデータセットから画像を使用し、EleGANtでこれらの画像に合成メイクを施しました。訓練のために、元の画像とメイクを施した画像のペアを作成しました。

UTKFaceデータセットの例。ソース:https://susanqq.github.io/UTKFace/[/em>
DiffCleanは、この変換を逆転させるように訓練されました。年齢推定アルゴリズムは、特に若い年齢層で最も多く間違えるため、研究者は対象年齢(10〜19歳)にファインチューンされたプロキシ年齢分類器を開発する必要がありました。そのためには、SSRNetアーキテクチャを使用しました。これはUTKFaceで訓練され、重み付きL1損失でファインチューンされました。
2021年のOpenAIの拡散モデルの簡略化バージョンが、変換のバックボーンを提供しました。著者は、コアアーキテクチャを保持しましたが、さまざまな解像度で追加のアテンションヘッド、より深い層、BigGANスタイルのブロックを追加して、アップサンプリングとダウンサンプリングの段階を改善しました。
方向制御は、CLIPプロンプトを使用して導入されました。具体的には、メイクのある顔とメイクのない顔で、モデルはメイクを除去することなく、目的のセマンティック方向に移動することを学習しました。顔の詳細、年齢のヒント、アイデンティティを損なうことなく、メイクを除去することができます。

EleGANtを使用して合成メイクを適用したもの。各トリプレットは、元のUTKFace画像(左)、参照メイクスタイル(中央)、スタイル転送後の結果(右)を示しています。コンピュータビジョンの文献では、このようなメイク転送は一般的であり、Adobe Photoshopのニューラルフィルタでも、参照画像からのメイクをターゲット画像に転送する機能があります。[/em>
4つの重要な損失関数が、アイデンティティや年齢のヒントを損なうことなくメイク除去を導きました。上記で述べたCLIPベースの損失に加えて、アイデンティティは、ArcFaceの損失の重み付きペアを使用して保存されました。InsightFaceライブラリからの損失は、生成された顔と元のクリーン画像および「メイクを施した」バージョンの両方の間の類似性を測定し、メイクを施した前と後のサブジェクトの視覚的な一貫性を確保しました。
3つ目は、学習された感覚相似性メトリック(LPIPS)で、L1距離を使用してピクセルレベルの現実感を強制し、メイクを除去した後の元の画像の全体的な見た目を保持しました。
最後に、年齢は、UTKFaceデータセットで訓練されたSSRNetをファインチューンして監督しました。モデルは、10〜29歳の年齢範囲でのエラーに対する罰則をより重くしたスムーズ化されたL1損失を使用しました。モデルの一種は、この損失をCLIPベースの年齢プロンプトに置き換え、モデルが特定の年齢の外観に一致するように促しました。
推論時の年齢推定には、2023年のMiVOLOフレームワークを使用しました。
データとテスト
UTKFaceのSSRNetファインチューンでは、15,364枚の画像のトレーニングセットと、6,701枚の画像のテストセットを使用しました。元の20,000枚の画像は、70歳を超える人を除外し、70:30の比率で分割されました。
2023年のDiffAMプロジェクトで確立された方法に従って、訓練は2段階で行われました。最初のセッションでは、BeautyGANのMTデータセットから300枚の実際のメイク画像(訓練と検証の200/100の分割)を使用しました。
モデルは、EleGANtを使用して合成メイクを適用した300枚の追加のUTKFace画像でさらに改良されました。これにより、5つのBeautyGANの参照スタイルをまたいだ600枚の画像の最終的な訓練セットが作成されました。メイク除去には、多くのメイクスタイルを1つのクリーンな顔にマッピングすることが含まれるため、訓練は、すべての可能な化粧バリエーションをカバーするのではなく、広範な汎化に焦点を当てました。
パフォーマンスは、合成画像と実世界の画像の両方で評価されました。合成テストでは、9つの年齢グループ(70歳未満)に均等にサンプリングされた2,556枚のFlickr-Faces-HQ(FFHQ)データセットの画像を使用しました。これらの画像はEleGANtで修正されました。
汎化は、3,000枚のBeautyFace画像と、355枚のLADN画像を使用して評価されました。これらの画像には、真正なメイクが含まれています。

BeautyFaceデータセットの例。影響を受ける顔の表面のさまざまな領域を定義するセマンティックセグメンテーションを示しています。ソース:https://li-chongyi.github.io/BeautyREC_files/[/em>
メトリックと実装
メトリックとして、著者は、実際の年齢(実際の年齢)と予測年齢の間の平均絶対誤差(MAE)を使用しました。ここで、低い結果はより好ましいです。年齢グループの正確性を評価するために、年齢グループの正確性を使用しました。ここで、低い結果はより好ましいです。未成年/成人の正確性を評価するために、未成年/成人の正確性を使用しました。ここで、高い結果はより好ましいです。
さらに、アイデンティティ検証メトリックとして、受信者操作特性(ROC)値を報告しました。
SSRNetは、64×64pxの画像でバッチサイズ50、バッチサイズ50でアダムオプティマイザ、重み減算1e−4、コサインアニーリングスケジューラ、および200エポックで学習率1e−3、早期終了でファインチューンされました。
一方、DiffCleanモジュールは、256×256pxの入力画像を受け取り、5エポックでアダム、4e−3の粗い学習率でファインチューンされました。サンプリングには、40のDDIM逆転ステップと、6のDDIM前方ステップが使用されました。すべてのトレーニングは、単一のNVIDIA A100 GPU(40GBまたは80GBのVRAMでしたが、どちらかは指定されていません)で実行されました。
テストされたライバルシステムは、CLIP2Protectと、先ほど述べたDiffAMでした。著者は、CLIP2Protectで高い成功率が達成されたと指摘されている「マット」メイクスタイルを使用しました。
DiffAMを基準として再現するために、BeautyGANの事前トレーニング済みモデルをMTデータセットでファインチューンしました。敵対的メイク転送の場合、DiffAMのチェックポイントを使用し、ターゲットモデル、参照画像、アイデンティティの既定のパラメータを使用しました。

MiVOLOを使用した年齢推定タスクでのDiffCleanと基準のパフォーマンス。報告されるメトリックは、未成年/成人の分類精度、年齢グループの精度、平均絶対誤差(MAE)です。CLIP年齢損失を使用するDiffCleanが、すべてのメトリックで最高の結果を達成します。[/em>
これらの結果について、著者は次のように述べています。
‘私たちの方法であるDiffCleanは、CLIP2ProtectとDiffAMの両方を上回り、メイクによって混乱させられた年齢のヒントを回復することに成功し、MAE(5.71)を低減し、全体的な年齢グループの予測精度(37%)を向上させました。 ‘
‘私たちの目的は未成年グループに焦点を当てていたので、結果は未成年対成人年齢分類の88.6%の優れた結果を示しています。’

基準と提案された方法からのメイク除去結果。左端の列はソース画像を示し、次の列はCLIP2ProtectとDiffAMからの出力を示しています。3列目は、SSRNetとCLIPベースの年齢損失を使用するDiffCleanからの結果を示しています。著者は、DiffCleanがメイクをより効果的に除去し、CLIP2Protectの特徴の歪みやDiffAMの残留化粧を回避することを主張しています。[/em>
著者はさらに次のように述べています。
メイクは、年齢の認識に一様な影響を与えず、年齢の認識を高めたり、低下させたり、または変化させない可能性があります。したがって、DiffCleanは、年齢の認識を「一律に低下させる」ことはせず、メイクを除去することで元の年齢のヒントを回復しようとします。

CelebA-HQとCACDデータセットからのメイク除去の例。各列は、メイクを除去する前(左)と後のペアの画像を示しています。最初の列では、予測年齢がメイクを除去した後に低下します。2列目では、予測年齢は同じままです。3列目では、予測年齢が上昇します。[/em>
DiffCleanが新しいデータでどのように機能するかをテストするために、それをBeautyFaceとLADNデータセットで実行しました。これらのデータセットには、ペアになっている画像がない真正なメイクが含まれています。メイクを除去する前と後の年齢予測を比較して、DiffCleanがメイクによって導入された歪みをどれだけ減らすかを評価しました。

LADN(左のペア)とBeautyFace(右のペア)データセットからの実世界の画像からのメイク除去の結果。DiffCleanは、メイクを除去することで予測年齢を低下させ、年齢のギャップを狭めます。白い数字は、処理の前後に推定年齢を示しています。[/em>
結果は、DiffCleanが一貫して年齢と実際の年齢のギャップを狭めることを示しています。両方のデータセットで、過大評価と過小評価のエラーを平均約3年低減しました。これは、システムが現実世界の化粧スタイルにうまく汎化できることを示しています。
結論
パフォーマティブな化粧メイクが、対立的な方法で使用されることは興味深く、ある意味では不可避です。女の子は男の子よりも一貫して早く成熟するため、未成年と成人の女性のステータスの境界を特定するタスクは、研究シーンがこれまでに設定した最も野心的かもしれないものです。
しかし、時間とデータが最終的に、視覚的な年齢確認システムにアンカーとなる一貫した年齢関連の兆候を決定するかもしれません。
* この主題は感情的な言葉を呼び起こすため、「女の子」という言葉は排除的(そして「女性と女の子」という現在受け入れられている用語は、この場合は正確な説明ではありません)であるため、私は「女性」という言葉を最善の妥協点として使用しましたが、すべての人口統計的ニュアンスを捉えているわけではありません。すみません。
† この記事では、「パフォーマティブ」という用語を、メイクが見えるように意図されていることを示すために使用します。マスカラ、アイライナー、ブラー、ファンデーションなどのメイクは、コンシールクリームやその他の「隠れ」の化粧品とは対照的に、認識されるように意図されています。
初版:2025年7月18日












