Andersonの視点

GANジェネレーターのソースデータの再同定

mm
Unite.AI を Google の優先ソースに追加

フランスの新しい研究では、GANによって生成されたデータ(例:GANによって生成された「存在しない人々」の顔)に寄与したソースIDを「再同定」する手法が提案されています。たとえば、This Person Does Not Existなどの顔生成プロジェクトで使用されているGAN生成の「存在しない人々」の顔などです。

この手法は、論文で説明されており、This Person (Probably) Exists. Identity Membership Attacks Against GAN Generated Facesと題されています。この手法では、トレーニングアーキテクチャやモデルデータへのアクセスは必要なく、GANを使用して匿名化された個人情報(PII)や生成された合成データを保護するために使用されるさまざまなアプリケーションに適用できます。

研究者は、Identity Membership Attackと呼ばれる手法を開発しました。これは、特定のIDが頻繁に寄与データセットに現れる可能性を評価するものです。つまり、特定の特徴(例:元の画像のピクセルグループ)に焦点を当てるのではなく、単一のIDが頻繁に現れる可能性を評価します。

Source: https://arxiv.org/pdf/2107.06018.pdf

Source: https://arxiv.org/pdf/2107.06018.pdf

上の画像は、研究で使用されたものです。各行は、StyleGANによって生成されたGAN生成画像から始まります。左側の画像ブロックは40,000枚の画像データベースから生成され、中央のブロックは80,000枚、右側のブロックは46,000枚の画像データベースから生成されています。すべての画像はVGG2Face2データセットから来ています。

一部のサンプルは一時的な類似性を持ちますが、他のサンプルはトレーニングデータと強く相関しています。研究者は、顔識別ネットワークを使用してこれらの顔を成功的に識別しました。

表面的な価値以上のもの

このような再同定アプローチには、多くの研究分野にわたる複数の意味があります。ノルマンディーのカーン大学に所属する研究者は、自分の手法が顔セットや顔生成GANフレームワークに限定されていないことを強調しています。医療画像データセットやバイオメトリクスデータなど、画像合成フレームワークの他の可能な攻撃面にも同等に適用可能であると述べています。

「このような攻撃が成功した場合、GANを機密情報と共に安全に交換する上で重大な障害となるだろう。例えば、絵画やその他の芸術作品の場合、非公開のジェネレーターを配布することは、明らかな著作権問題のため、却下されるだろう。さらに重要なのは、バイオメトリクス会社Aが、顧客のIDを公開するジェネレーターを公開した場合、別の会社Bは、自分の顧客の中に会社Aの顧客がいるかどうかを検出できる可能性がある。同様の状況は、医療データの場合、GANを公開することで患者の個人情報を漏らす可能性があるため、深刻な問題となる。」

不正にWebスクレイピングされた、またはプライベートデータの再同定

この論文では、このトピックに軽く触れていますが、GAN生成の顔(および他のアーキテクチャ)から元のソースデータを識別する能力は、著名な意味を持ちます。特に、著作権保護の実装については、次の5〜10年間にわたって重要な影響を与える可能性があります。

現在、多くの国では、機械学習経済の開発段階で後れを取らないために、パブリックに公開されているWebデータのスクレイピングに対して、自由主義的なアプローチを採用しています。ただし、この分野が商業化し、統合されるにつれ、歴史的に機械学習アルゴリズムの開発に寄与したデータセットに使用された画像について、著作権請求を行う「データトロール」の新しい世代が現れる可能性があります。

開発されたアルゴリズムは時間の経過とともに成熟し、より貴重になるため、許可なく使用された画像は、提案された方法で推測できる場合、潜在的な法的責任となります。SCO Vs IBM(長期にわたるテクノロジー訴訟で、現在もLinuxオペレーティングシステムに脅威を与え続けています)と同様のスケールでです。

多様性対頻度のメキシコスタンドオフの搾取

フランスの研究者が使用した主な手法は、元のデータセット内の画像の頻度を再同定の鍵として使用します。特定のIDがデータセット内で頻繁に現れるほど、その元のIDを識別する可能性は高くなります。攻撃の結果を、パブリックまたはプライベートに利用可能なデータセットと関連付けることでです。

研究者は、この問題は、ソースデータセットに多様性を含めることで軽減できることを指摘しています。さらに、オーバーフィッティングが発生しないように、データセットを長時間トレーニングしないことも重要です。ただし、この問題は、モデルの抽象化を高次元空間で達成する必要があるため、より多くのリソースとデータが必要になります。

このような一般化を達成することは、高価で時間がかかります。潜在的な空間(機械学習モデルの分析部分)には、より多くのリソースが必要になります。データセットには、より多くのキュレーションが必要になります。データ量が大量になるため、バッチサイズとレートスケジューリングは、トレーニングの速度や経済性ではなく、品質と高い一般化度を優先して最適化する必要があります。これにより、開発コストが高くなり、開発時間が長くなります。

さらに、オーバーフィットした生成アルゴリズムは、ソースデータから完全に抽象化されていない場合でも、非常にリアルな合成データを生成できます。特に、GAN生成の顔、地図、バイオメディカル画像などの出力データの場合です。これは、現在の「ワイルドウエスト」な機械学習分野で、より小さなイニシアチブが、より少ないリソースでFAANGのリードを挑戦しようとしている場合、または買収のために注目を集めようとしている場合に、魅力的なショートカットとなる可能性があります。

論文では、ソースデータポイント(例:顔)の多様性は、単独でこれらの方法による再同定を防ぐのに十分ではないことも観察しています。トレーニングの早期停止により、ソースIDが不十分に抽象化される可能性があるためです。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai