Andersonの視点

合成データセットからリアルな身元が回復可能

mm
Unite.AI を Google の優先ソースに追加
Sample comparison images from the paper 'Unveiling Synthetic Faces: How Synthetic Datasets Can Expose Real Identities', including original images (top), and inferred images (bottom).

2022年は、ジェネレーティブAIの破壊的な潜在力が広く一般の注目を集めた瞬間だったが、2024年は、企業がその力を活用しようと躍起になる中で、ジェネレーティブAIの根底にあるデータの法的問題が表面化してきた。

アメリカのフェアユースの原則や、ジェネレーティブAIを研究する学術・商業分野が長年享受してきた暗黙の学術免許は、盗作の証拠が表面化するにつれて、ますます維持できなくなった。結果として、アメリカは現在、AI生成コンテンツの著作権登録を認めていない

これらの問題はまだ解決されていないし、すぐに解決される見込みもない。2023年、ジェネレーティブAIの出力の法的地位に関するメディアや一般の懸念が高まったため、米国著作権局はジェネレーティブAIのこの側面に関する数年間の調査を開始し、2024年7月に最初の報告書(デジタルレプリカに関するもの)を公開した。

一方、企業は、将来にわたって明確な法律や定義が確立されるときに、法的影響を受ける可能性がある高価なモデルを活用できない可能性があるという懸念に直面している。

高価な短期的な解決策は、企業が利用権を持つデータでジェネレーティブモデルをトレーニングすることである。アドビのテキストからイメージ(そして現在はテキストからビデオ)へのFireflyアーキテクチャは、2014年にアドビがFotoliaのストックイメージデータセットを購入したことによって主に動かされており、著作権が切れたパブリックドメインデータによって補完されている。同時に、GettyやShutterstockのような在来のストック写真サプライヤーは、ジェネレーティブAIの新たな価値に目をつけ、ライセンス契約を増やし、または独自のIP対応GenAIシステムを開発している。

合成ソリューション

AIモデルの潜在的な空間から著作権付きデータを除去することは問題があり、企業が機械学習を使用した消費者向けおよびビジネス向けソリューションを開発する際に、この分野でのミスは非常に高額になる可能性がある。

代替的手段として、コンピュータビジョンシステム(および大規模言語モデル)では、合成データを使用することができる。これは、ターゲットドメイン(例:顔、猫、教会、またはより一般化されたデータセット)を表すランダムに生成された例で構成されるデータセットである。

thispersondoesnotexist.comのようなサイトは、ジェネレーティブアドバーシャルネットワーク(GAN)を介して、現実の写真と見分けがつかない「非実在」の人の写真を合成できるというアイデアを以前から普及させていた。

したがって、顔認識システムまたは生成システムをこれらの抽象的で非実在の例でトレーニングすると、AIモデルで写真レベルの生産性を得ることができると考えられるが、データが法的に使用可能かどうかは考慮する必要はない。

バランスアクト

問題は、合成データを生成するシステム自体が実データでトレーニングされていることである。合成データに実データが混入すると、制限付きまたは未認可の資料が金銭的利益のために利用された証拠となる可能性がある。

これを避けるには、モデルは真正に一般化されている必要がある。一般化とは、トレーニングデータをそのまま複製することなく、高レベルの概念(例:「顔」「男」、または「女」)を理解するトレーニングされたAIモデルの能力を測る指標である。

不幸にも、トレーニングされたシステムが詳細な詳細を生成または認識することは、データセットを大量にトレーニングしない限り困難である。これにより、システムは暗記のリスクにさらされる。暗記とは、トレーニングデータの実例をある程度再現する傾向である。

これは、学習率を緩和した設定で、またはコア概念がまだ柔軟で特定のデータポイント(例:特定の人の画像の場合、顔のデータセット)に結びついていない段階でトレーニングを終了することで軽減できる。しかし、これらの解決策は、システムが基礎から始めて詳細に至るまでトレーニングされなかったため、より細かい詳細を持たないモデルにつながる可能性がある。

したがって、科学文献では、通常、非常に高い学習率と包括的なトレーニングスケジュールが適用される。研究者は、一般的な適用可能性と詳細性のバランスを取ることを目指すが、わずかに「暗記された」システムは、初期テストでは一般化されたものとして自己表現することがある。

顔の暴露

スイスの新しい論文は、理論上は完全にランダムであるはずの生成された画像から、元の実画像が回復できることを示した最初のものである。

結果は、著者によると、合成ジェネレータが実際に多くのトレーニングデータポイントを暗記していることを示唆しており、合成データに頼ることでAI製作者を法的影響から守るシステムは、この点で非常に信頼できない可能性がある。

研究者は、6つの最新の合成データセットを広範に研究し、すべてのケースで、元の(潜在的に著作権で保護されたまたは保護された)データを回復できることを実証した。彼らは次のように述べている。

「私たちの実験は、最新の合成顔認識データセットには、ジェネレータモデルのトレーニングデータセットに含まれるサンプルと非常に近いサンプルが含まれていることを示しています。場合によっては、合成サンプルには元の画像に小さな変更が加えられていることがありますが、生成されたサンプルには、異なるポーズ、照明条件など、変化が含まれていることもありますが、アイデンティティは保存されています。」

「これは、ジェネレータモデルがトレーニングデータからアイデンティティ関連の情報を学習し、記憶していることを示唆しており、同様のアイデンティティを生成する可能性がある。顔認識やバイオメトリクスなどのプライバシー感受性の高いタスクで合成データを使用することに関する深刻な懸念を引き起こします。」

論文は、《合成顔の暴露:合成データセットがリアルなアイデンティティを暴露する方法》と題され、Idiap Research Institute at Martigny、École Polytechnique Fédérale de Lausanne(EPFL)、およびUniversité de Lausanne(UNIL)在籍の2人の研究者によって発表された。

方法、データ、結果

研究における暗記された顔は、メンバーシップ推論攻撃によって明らかになった。概念は複雑に聞こえるが、実際はかなり自明である。メンバーシップ推論とは、この場合は、システムに質問を投げかけて、探しているデータまたはそれに似たデータを明らかにするプロセスを指す。

研究者は、既知の実データセット源を持つ6つの合成データセットを研究した。実データセットと合成データセットの両方に画像の大量のボリュームがあるため、これは実質的に針の山の中で針を探すようなものである。

したがって、著者は、ResNet100バックボーンを備えたオフザシェルフの顔認識モデルを使用し、AdaFaceロス関数(WebFace12Mデータセット上で)でトレーニングされた。

使用された6つの合成データセットは、DCFace(潜在拡散モデル)、IDiff-Face(一様 – FFHQに基づく拡散モデル)、IDiff-Face(二段階 – 異なるサンプリング方法を使用するバリアント)、GANDiffFace(生成対抗ネットワークと拡散モデルに基づくもので、StyleGAN3を使用して初期アイデンティティを生成し、DreamBoothを使用してバリエーション豊かな例を生成する)、IDNet(StyleGAN-ADAに基づくGAN法)、およびSFace(アイデンティティ保護フレームワーク)であった。

GANDiffFaceはGANと拡散法の両方を使用するため、StyleGANのトレーニングデータセット(このネットワークが提供する「実顔」起源に最も近いもの)と比較された。

CGIではなくAI方法を使用する合成データセットは除外され、結果の評価では子供や顔以外の画像(これらは顔データセットで頻繁に発生する)に対する一致は無視された。

コサイン類似度は、すべての取得されたペアに対して計算され、ヒストグラムに結合され、以下に示す。

類似度の数は、グラフ上のスパイクで表される。論文には、6つのデータセットからのサンプル比較と、元の(実)データセットの推定画像も含まれている。

論文には以下のように記載されている。

「生成された合成データセットには、ジェネレータモデルのトレーニングセットからの非常に似た画像が含まれており、アイデンティティの生成に関する懸念を引き起こします。」

著者は、スケールアップの必要性、視覚的な比較の必要性、自動顔認識のみでは十分ではないことなど、研究の影響と今後の道筋について言及している。

「合成データセットを生成する主な動機は、顔認識などのプライバシー感受性の高いタスクで大規模なWebクロール顔データセットを使用する際のプライバシーに関する懸念に対処することである。」

「したがって、トレーニングデータの機密情報(実画像のアイデンティティなど)の漏洩は、合成データセットの使用に関する深刻な懸念を引き起こす。顔認識のための責任ある合成データセットの生成に向けた研究の道筋を示す。」

著者は、この研究のコードをプロジェクトページで公開することを約束しているが、現在のリポジトリリンクはない。

結論

最近、メディアは、AIモデルをAI生成データでトレーニングすることで得られる減少するリターンに焦点を当てている。

しかし、スイスの新しい研究は、ジェネレーティブAIを活用して利益を上げたいと考えている企業にとって、もっとも重要な懸念事項である可能性がある。つまり、合成データセットを設計してこの問題に対処しようとしている場合でも、IP保護されたデータパターンまたは未認可のデータが残っている可能性があるということである。これを「顔洗浄」と呼ぶことができるかもしれない。

アドビがユーザーがアップロードしたAI生成画像をAdobe Stockに許可したことは、実際にはこのデータの法的「純度」を損なっている。ブルームバーグは、2024年4月に、アドビのAIファイアフライが、ライバルからのAI生成画像をトレーニングに使用していたと主張した。

このモデルは論文では特定されていない。

初版は2024年11月6日に公開された。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai