Andersonの視点
ディープフェイク検出の新たな地平:潜在的拡散モデルとGAN

意見
最近、2017年後半からほぼ独占的にオートエンコーダー 기반のフレームワークに取り組んでいたディープフェイク検出研究コミュニティは、停滞したアーキテクチャではなく、オートエンコーダーに代わるものとして、潜在的拡散モデルやDALL-E 2、Stable Diffusionなどの研究に注目し始めている。また、Generative Adversarial Networks (GANs)の出力も検討対象になっている。例えば、6月には、UC BerkeleyがDALL-E 2の出力を検出するシステムの研究結果を発表した。
このような関心の高まりの背景には、2022年の潜在的拡散モデルの能力と入手性の急速な進化がある。春には、DALL-E 2がクローズドソースで限定的なアクセスでリリースされた。夏の終わりには、Stable Diffusionがオープンソースで公開された。
GANも以前から研究されていたが、動画ベースの再現ではあまり活用されていなかった。動画ベースの再現では、FaceSwapやDeepFaceLabなどのオートエンコーダーベースのパッケージが一般的だったからである。
動く映像
どちらの場合も、動画合成の次の開発スプリントの可能性が、研究コミュニティを刺激しているように見える。10月の始まりには、ビデオ合成の長年の課題に対する突然の解決策が続出した。Facebookがテキストからビデオへのプラットフォームのサンプルをリリースした後、Google Researchは高解像度の映像を出力可能なImagen-to-Video T2Vアーキテクチャを発表した。
また、stability.aiはStable Diffusionにビデオ機能を追加することを約束しており、Runwayも同様の約束をしているが、同じシステムを指しているかは不明である。StabilityのCEOであるEmad Mostaqueは、Discordメッセージで、オーディオ、ビデオ、3Dを約束している。
さらに、新しいオーディオ生成フレームワークが発表され、本物のようなキャラクターモーションを生成できる拡散モデルも登場した。静的なフレームワークであるGANやディフューザーが、外部のアニメーションフレームワークの補助として使われるようになるという考えが、実現可能なものとなってきている。
簡単に言えば、オートエンコーダーベースのビデオディープフェイクは、顔の中心部分のみを置き換えることができ、来年までに、潜在的拡散ベースのディープフェイク可能な技術によって、写真レベルの全身やシーンの偽造が可能になる可能性がある。
そのため、反ディープフェイク研究コミュニティは、画像合成を真剣に考えるようになり、単にフェイクのLinkedInプロフィール写真を生成する以外の用途にも使えることを認識し始めている。
ブレードランナー
潜在的拡散モデルとGANベースのディープフェイク検出を扱う最新の2つの論文は、DE-FAKE:テキストから画像の拡散モデルによって生成された偽の画像の検出と帰属と、BLADERUNNER:合成(AI生成)StyleGANフェイスのための迅速な対策である。後者は、MITのリンカーン研究所のAdam Dorian Wongによって書かれた。
新しい方法を説明する前に、後者の論文は、GANによって生成された画像かどうかを判断するための以前のアプローチを検討する時間を取る。
‘Brady Bunch’方法は、GANフェイクコンテンツを、特定のパーツが占める固定位置に基づいて識別する。ただし、この方法は、1970年代にテレビを見ていた人や、1990年代の映画を観た人にとっては、無意味な参照となる可能性がある。
別の有用な既知の指標は、StyleGANの頻繁な多面体の描画の欠如である。また、アクセサリの調整が不得手であることも指摘される。
第三の方法は、写真オーバーレイで、私たちの8月の記事に例が見られる。
提案されたアーキテクチャは、ブレードランナーと呼ばれ、ヴォイト・カンプフテストに由来する。パイプラインは2つの段階からなる。最初の段階は、PapersPleaseアナライザーで、thispersondoesnotexist.comなどのウェブサイトからスクレイピングされたデータを評価することができる。
第二の段階は、AmongUs検出器で、写真の眼の配置を検索する。AmongUsは、標準の68ランドマーク検出器によって動作する。
ブレードランナーは、リソースが不足している会社や組織が、自社で解決策を開発するためのリソースが不足している場合に、プラグアンドプレイの解決策として意図されている。また、より恒久的な対策を講じるための「時間稼ぎ」の措置である。
実際、セキュリティ分野は非常に変動しやすく、急速に成長しているため、自社で解決策を開発するためのリソースが不足している会社が、信頼できる解決策に頼ることができるのは、ほとんどない。
ブレードランナーは、オープンソースとしてGitHubに公開されている。より機能豊富なプロプライエタリバージョンもあり、複数の写真を処理できるが、オープンソースのリポジトリでは、1回の操作につき1枚の写真しか処理できない。著者は、GitHubバージョンを同じレベルにアップグレードすることを計画している。また、StyleGANは既知の弱点を超越する可能性があるため、ソフトウェアも発展する必要があると認識している。
DE-FAKE
DE-FAKEアーキテクチャは、テキストから画像の拡散モデルによって生成された画像の「汎用検出」を実現することを目的としている。また、どの潜在的拡散モデルが画像を生成したかを判断する方法も提供する。
現在、このタスクは比較的容易である。なぜなら、人気のある潜在的拡散モデルはすべて、特徴的な特徴を持っているからである。また、多くの共通の弱点も共有している。例えば、画像の先頭を切り取る傾向がある。これは、任意の方法でWebからスクレイピングされた画像を、大規模なデータセットに取り込むためである。
DE-FAKEは、アルゴリズムに依存しないことを目的としており、オートエンコーダーベースの反ディープフェイク研究者が長年目指してきた目標である。現在、潜在的拡散システムに関しては、比較的容易に実現可能である。
アーキテクチャは、OpenAIのCLIPマルチモーダルライブラリを使用して、生成された画像から埋め込みを抽出し、観察されたパターンとクラスに基づいて分類器をトレーニングする。
画像の生成プロセスに関する情報がPNGチャンクに保持されていない「ブラックボックス」シナリオでは、SalesforceのBLIPフレームワークを使用して、画像を生成した際のセマンティック構造を「盲目的に」ポーリングする。
研究者は、Stable Diffusion、潜在的拡散、GLIDE、DALL-E 2を使用して、MSCOCOとFlickr30kを利用したトレーニングとテストのデータセットを生成した。
通常、研究結果を詳細に検討するが、DE-FAKEの結果は、将来のベンチマークとして、または同様のプロジェクトのための基準として、より役立つ可能性がある。なぜなら、競合するシステムは、ほぼ3年前に画像合成シーンがまだ幼かったときに開発されたものであるからである。
チームの結果は、2つの理由で圧倒的に陽性である。まず、比較するための以前の研究がほとんどない。次に、潜在的拡散画像合成分野は指数関数的に発展しているが、現在のシステムの出力は、構造的な欠陥や特徴によって、事実上「水印」が付けられている。
Stable Diffusionの場合、1.5チェックポイント(4GBトレーニングモデル)のリリースによって、パフォーマンスの向上が期待できる。Stabilityはすでに、V2とV3の明確なロードマップを示している。過去3ヶ月間の注目すべき出来事により、OpenAIや他の競合他社のイメージ合成分野における企業の停滞は、ほぼ確実に消滅したと考えられる。したがって、クローズドソースのイメージ合成分野でも、同様のペースの進歩が期待される。
最初に公開された:2022年10月14日。












