Andersonの視点
ディープフェイク・合成アーキテクチャに対して敵対的な画像のエンコード

ディープフェイク研究分野で最もよく知られている研究分野は、ディープフェイク、合成、またはその他の改ざんされた画像やビデオ内の顔の特徴を認識するシステムの開発です。
これらのアプローチでは、深度検出、ビデオの規則性の破壊、モニターの照明の変化(潜在的なディープフェイクのライブビデオコール)、生体特徴、顔の外側領域、さらには人間の潜在意識システムの隠れた力など、さまざまな戦略が使用されています。
これらの方法、そして同様の方法は、すべて、ディープフェイクや画像合成システムがすでにウェブからスクラップされた数千、または数十万の画像でトレーニングされているという点で共通しています。オートエンコーダーシステムは、これらの画像から重要な特徴を容易に抽出し、ビデオ映像や合成画像に偽のアイデンティティを正確に押し付けるモデルを作成できます。さらに、リアルタイムでです。
簡単に言えば、これらのシステムが活性化するまでに、馬はすでに逃げてしまっています。
ディープフェイク/合成アーキテクチャに対して敵対的な画像
ディープフェイクや画像合成の脅威に対するより予防的なアプローチとして、ディープフェイクや画像合成システムに対して不親切な画像を作成する可能性を探る、研究分野が存在します。通常、これらの画像は、ほとんど、またはまったく、認識できない方法で行われます。
例として、FakeTaggerという2021年の提案があります。これは、画像にメッセージをエンコードし、一般化のプロセスに抵抗し、画像がウェブからスクラップされてGAN(Generative Adversarial Network)にトレーニングされた後でも回復できるようにします。

FakeTaggerは、GANのトレーニングプロセスで一般化されることができない情報を画像にエンコードし、特定の画像がシステムの生成能力に貢献したかどうかを判断できるようにします。ソース:https://arxiv.org/pdf/2009.09869.pdf
ICCV 2021では、別の国際的な取り組みが、生成モデル用の人工指紋を導入しました(下の画像を参照)。これにより、StyleGAN2などの画像合成GANの出力から回復可能な「指紋」が生成されます。
この概念の他のバリエーションには、2018年のIBMのプロジェクトや、同年、日本のデジタルウォーターマーキングスキームがあります。
さらに革新的なのは、2021年の取り組みで、南京航空航天大学の研究者が、画像を暗号化することで、画像が認可されたシステムでのみ効果的にトレーニングされ、汎用的な画像合成トレーニングパイプラインで使用された場合は大幅に失敗するようにしました。
これらの方法はすべて、ステガノグラフィーのカテゴリに分類されます。しかし、すべての場合、画像内のユニークな識別情報は、オートエンコーダーやGANアーキテクチャがそれを「ノイズ」や不要なデータとして却下するのではなく、他の顔の特徴とともにエンコードされる必要があります。
同時に、プロセスは画像を歪曲させたり、視覚的に影響を与えたりしてはなりません。そうでなければ、カジュアルなビューアーは画像に欠陥があるか、低品質であると認識することになります。
TAFIM
現在、ミュンヘン工科大学とソニー・ヨーロッパRDCシュトゥットガルトからの新しいドイツの研究が、ディープフェイクモデルまたはStyleGANタイプのフレームワークが処理された画像でトレーニングされた場合、使用できない青または白の出力が生成される画像エンコード技術を提案しています。

TAFIMの低レベル画像の変動は、さまざまな顔の歪み/置換を対処し、モデルが歪んだ出力を生成するように強制し、DeepFaceLiveのリアルタイムディープフェイクストリーミングなどのリアルタイムシナリオでも適用可能であると報告されています。ソース:https://arxiv.org/pdf/2112.09151.pdf
論文「TAFIM:顔の操作に対する標的となる攻撃」では、ニューラルネットワークを使用して画像にほとんど認識できない変動をエンコードします。画像がトレーニングされ、合成アーキテクチャに一般化された後、入力されたアイデンティティに対して、スタイルミックスや顔スワップで使用された場合、モデルは変色した出力を生成します。
ウェブの再エンコード..?
しかし、この場合、私たちは最新の概念の詳細なアーキテクチャを調査するのではなく、このアイデアの実用性を考慮することに関心があります。特に、Stable Diffusionなどの画像合成フレームワークのパブリックにスクラップされた画像の使用に関する議論が高まっていることを考えると、下流の法的影響についても考慮する必要があります。
前述のようなエンコードベースのアプローチは、標準のウェブベースの処理ライブラリ(ImageMagickなど)に新しい圧縮ルーチンを導入することを伴うため、かなりのコストがかかります。これらのライブラリは、多くのソーシャルメディアのアップロードインターフェイスを含む、多くのアップロードプロセスを駆動し、オリジナルのユーザー画像を最適化されたバージョンに変換します。
これにより、主要な質問が生じます。そうしたスキームは、「先行して」実装されるでしょうか。あるいは、歴史的なメディア(数十年間「汚染されていない」状態で利用可能であった)に対するより広範な、後方互換性のある展開が意図されているのでしょうか。
Netflixなどのプラットフォームは、新しいコーデックでバックカタログを再エンコードすることに抵抗しません。ユーザーまたはプロバイダーに利益をもたらす可能性のある、より効率的なコーデック、またはその他の利点を提供するコーデックです。同様に、YouTubeが歴史的なコンテンツをH.264コーデックに変換したことは(明らかにApple TVに合わせるため)、論理的に見て、膨大な作業ではあるものの、却って困難ではなかったようです。
皮肉にも、ウェブ上のメディアコンテンツの大部分が、トレーニングに抵抗する形式で再エンコードされても、影響力のあるコンピュータビジョンデータセットの限定されたカデレは、影響を受けないまま残ります。しかし、上流のデータを使用するシステムは、ウォーターマーク付きコンテンツがアーキテクチャの変換プロセスを妨害するため、出力の品質が低下し始めるでしょう。
政治的対立
政治的観点から、AIの開発で後れを取らないという政府の決意と、オープンに利用可能なオーディオ、ビデオ、画像コンテンツをディープフェイクや画像合成システムの豊富なリソースとして使用することについての公衆の懸念に対する譲歩との間には、明らかな緊張関係があります。
公式には、西側諸国は、コンピュータビジョン研究分野がオープンに利用可能なメディアを使用することを許可する傾向があります。なぜなら、アジアのより独裁的な国々は、自身の開発ワークフローを自身の研究の利益のために形作るためのより大きな自由度を持っているからです。これは、中国がAIの世界的リーダーになることを示唆する要因の1つです。
2022年4月、米国控訴裁判所は、研究目的のためのパブリックに面向するウェブデータは公平であると確認しました。ただし、LinkedInは、ユーザープロファイルをそのようなプロセスから保護したいと主張しています。
したがって、AI耐性のある画像がシステム全体の標準にならない場合、主要なトレーニングデータの供給源は、独自の出力が潜在的なディープフェイクシステムで使用不能になるように、画像にそのようなシステムを実装することができます。
会社固有の展開における基本的な要素は、画像が本質的にトレーニングに抵抗していることです。ブロックチェーンベースの出典技術や、コンテンツの真正性イニシアチブなどの動きは、画像が改ざんされたか、または「スタイルGAN化」されたかを証明することよりも、画像がディープフェイクシステムのトレーニングに使用されたかどうかを防止することに重点を置いています。
カジュアルインスペクション
ブロックチェーン方法を使用して、画像の真正な出典と外観を認証する提案がなされたものの、これ自体は画像のトレーニングを防止したり、トレーニングデータセットに画像が含まれていることをシステムの出力から証明したりする方法を提供しません。
ウォーターマーキングアプローチを使用して画像をトレーニングから除外する場合、画像の真正なソースが公開されていることを確認することに頼るべきではありません。Stable Diffusionの作成に自由に使用された彼らの作品についてアーティストの怒りの叫びに応えて、haveibeentrained.comというウェブサイトでは、ユーザーが画像をアップロードして、Stable Diffusionを動かすLAION5Bデータセットに含まれている可能性を確認できます。
ほとんどの従来のディープフェイクデータセットは、インターネットから抽出されたビデオや画像から、非公開のデータベースにカジュアルに抽出されています。ここで、唯一の潜在的なウォーターマークは、ニューラル耐性のあるウォーターマークのみです。
さらに、Stable Diffusionのユーザーは、ファインチューニング(公式モデルチェックポイントのトレーニングの続行)またはテキストインバージョン(特定の要素または人物の追加)を介してコンテンツを追加しています。LAIONの数十億の画像の検索では、これらは表示されません。
ソースでのウォーターマークの埋め込み
ソース画像にウォーターマークを埋め込むことのさらなる応用例は、商用カメラの生の出力、ビデオ、または画像に、隠された情報を含めることです。1990年代後半の特許出願で提案されたように、ディスクリットコサイン変換を使用して、ビデオや静止画像にステガノグラフィック「サブ画像」を埋め込むことができます。

1990年代後半の特許出願で、Lennaは、必要に応じて回復できるオカルトウォーターマークを埋め込まれています。ソース:https://www.freepatentsonline.com/6983057.pdf
より単純なアプローチは、デバイスレベルで画像に明らかに表示されるウォーターマークを配置することですが、これはほとんどのユーザーにとって魅力に欠け、またアーティストやプロのメディア実践者にとっては冗長です。彼らはソースデータを保護し、必要に応じてブランドや禁止を追加できます(特にストック画像会社の場合)。
少なくとも1台のカメラは、オプションのロゴベースのウォーターマーク配置をサポートしており、派生AIモデルでの未承認使用を信号することができますが、AIを介したロゴの除去はかなり容易になり、カジュアルに商業化さえもされています。
2022年9月25日初出。














