Andersonの視点

GOTCHA–ディープフェイクのためのCAPTCHAシステム

mm
Unite.AI を Google の優先ソースに追加

ニューヨーク大学からの新しい研究は、ディープフェイクの認証を確実に行うために、深い学習を必要とする「酔いテスト」のようなものを受ける必要があるかもしれないことを示唆している。例えば、仕事関連のビデオ会議や、詐欺師がディープフェイクストリーミングソフトウェアを使用して攻撃する可能性のある他の機密性の高いシナリオである。

GOTCHAで適用されるビデオ会議シナリオのアクティブおよびパッシブな課題のいくつか。ユーザーは課題に従ってパスする必要があり、参加者に影響を与えない追加の「パッシブ」方法(潜在的なディープフェイクシステムをオーバーロードするなど)が使用される。ソース:http://export.arxiv.org/pdf/2210.06186

GOTCHAで適用されるビデオ会議シナリオのアクティブおよびパッシブな課題のいくつか。ユーザーは課題に従ってパスする必要があり、参加者に影響を与えない追加の「パッシブ」方法(潜在的なディープフェイクシステムをオーバーロードするなど)が使用される。ソース:http://export.arxiv.org/pdf/2210.06186

提案されたシステムは、GOTCHAと呼ばれ、過去10〜15年間にウェブブラウジングの障害となりつつあるCAPTCHAシステムに敬意を表している。CAPTCHAシステムでは、自動化されたシステムが、動物の識別や歪んだテキストの解読などの、機械が苦手なタスクをユーザーに実行させる(そして、皮肉にも、これらの課題は、ユーザーを無料の AMTスタイルのアウトソーシングアノテーターに変えることが多い)。

本質的に、GOTCHAは、2022年8月にベン・グリオン大学から発表されたDF-Captchaというペーパーを拡張している。このペーパーは、最初に、コールの相手側の人物が、自分自身の認証を証明するために、視覚的に意味のあるいくつかの課題を実行することを提案した。

ベン・グリオン大学の2022年8月のペーパーは、ユーザーに、顔を覆ったり、皮膚を圧迫したりするなどの対話型テストを実行することを最初に提案した。これらのタスクは、訓練されたディープフェイクシステムが予測または 写真的に処理することができない。ソース:https://arxiv.org/pdf/2208.08524.pdf

ベン・グリオン大学の2022年8月のペーパーは、ユーザーに、顔を覆ったり、皮膚を圧迫したりするなどの対話型テストを実行することを最初に提案した。これらのタスクは、訓練されたディープフェイクシステムが予測または 写真的に処理することができない。ソース:https://arxiv.org/pdf/2208.08524.pdf

特に、GOTCHAは、提案されたテストの「カスケード」に「パッシブ」な方法を追加している。これには、ユーザーの顔を覆う非現実的な要素の自動的超重ねや、ソースシステムを介してフレームの「オーバーロード」が含まれる。ただし、ユーザーのローカルシステムへのアクセスを許可する特別な許可なしで、ユーザーに応答するタスクのみを評価することができる。これは、SkypeやZoomなどの人気のあるシステム、またはディープフェイクの除去に特化した専用のプロプライエタリソフトウェアへのローカルモジュールまたはアドオンとして実装される可能性がある。

ペーパーからのGOTCHAシステムとコーラーとのやり取りのイラスト。点線は決定フローを示す。

ペーパーからのGOTCHAシステムとコーラーとのやり取りのイラスト。点線は決定フローを示す。

研究者は、GOTCHAに参加する47名の参加者から2.5百万フレーム以上のビデオを含む新しいデータセットでシステムを検証した。参加者はそれぞれGOTCHAの13の課題に参加した。研究者は、偽のユーザーに対して、ディープフェイクコンテンツの品質が「一貫して測定可能」に低下することを主張している。ローカルシステムをストレスを与えるまで、人間の目に見えるアーティファクトが明らかになる。

新しいペーパーは、GOTCHA:リアルタイムディープフェイク検出のためのチャレンジレスポンスシステムと題されており、システムの名前は本文では大文字だが、出版物のタイトルでは小文字である。

課題の範囲

ベン・グリオン大学のペーパーのほとんどに従って、ユーザーが直面する課題は、いくつかのタイプのタスクに分けられる。

オクルージョン」の場合、ユーザーは、手や他の物体で顔を覆う、または、ディープフェイクモデルに訓練されていないような角度で顔を提示することが求められる(通常、訓練データが不足しているため)。

ユーザーが自分で実行できるアクションに加えて、GOTCHAは、ローカルに訓練されたディープフェイクモデルが期待する顔ストリームを「汚染」するために、ランダムな顔の切り出し、ステッカー、拡張現実フィルタを重ねることができる。ただし、これはユーザーにとっては「パッシブ」なプロセスであるが、ソフトウェアにとっては介入的なものであり、エンドコレントのストリームに直接介入する必要がある。

次に、ユーザーは、訓練データセットに欠けている、または低表現の顔の表情を提示することが求められる。これにより、ディープフェイクの出力の品質が低下する(上記の最初のイラストの2列目にある画像「b」)。

このテストのシリーズの一環として、ユーザーは、ローカルのライブディープフェイクシステムが十分な範囲の音素やその他の種類の口データを訓練していないため、テキストを読んだり会話をしたりすることが求められる。

最後に(そして、これはエンドコレントの演技力を挑戦することになる)、このカテゴリでは、ユーザーは「マイクロエクスプレッション」と呼ばれるものを実行することが求められる。これは、0.5〜4.0秒間続く、感情を明らかにする短い無意識的な顔の表情である。ペーパーでは「これは通常、0.5〜4.0秒間続き、偽装することが難しい」と述べられている。

ペーパーでは、マイクロエクスプレッションを抽出する方法について説明されていないが、論理的に考えると、ユーザーに適切な感情を生み出すために、テストの一環としてショッキングなコンテンツを提示すること以外に方法はないと思われる。

顔の歪み、照明、予期せぬ来訪者

さらに、8月のペーパーの提案に従って、新しい研究では、エンドユーザーに、ディープフェイクシステムが処理できないような、顔の歪みや操作、髪や顔とのやり取りなどの動作を実行することを求める。

笑顔だが、ローカルのディープフェイクシステムではうまく翻訳されない「うつの顔」

笑顔だが、ローカルのディープフェイクシステムではうまく翻訳されない「うつの顔」

さらに、ユーザーが配置されている照明条件を変更することが課題となる。ディープフェイクモデルの訓練が、標準的なビデオ会議の照明状況や、コールが行われている照明条件に最適化されている可能性があるためである。

したがって、ユーザーは、携帯電話のトーチを顔に当てる、または他の方法で照明を変更することが求められる(そして、これは、ディープフェイクビデオ会議の検出に関する別のペーパーの中央提案でもある)。

ディープフェイクシステムは、予期せぬ照明や、予想外の複数の人物がストリームに含まれていることによって挑戦される。

ディープフェイクシステムは、予期せぬ照明や、予想外の複数の人物がストリームに含まれていることによって挑戦される。

ローカルユーザーストリーム(ディープフェイクの中間者が存在する可能性がある)に介入する能力がある場合、予想外のパターンを追加することで、ディープフェイクアルゴリズムのシミュレーションを維持する能力を損なうことができる。

さらに、対応者に追加の人物がいることを要求することは非現実的であるが、システムは追加の顔(上記の右端の画像)を挿入し、ローカルのディープフェイクシステムが注意を切り替えたり、すべての顔のディープフェイクを試みたりするミスを犯すかどうかを確認することができる(オートエンコーダディープフェイクシステムには、1人の個人に焦点を当て続けることができる「アイデンティティ認識」機能がない)。

ステガノグラフィーとオーバーロード

GOTCHAは、4月に初めて提案されたアプローチを含み、ユーザーのローカルビデオストリームにメッセージを暗号化するためにステガノグラフィーを使用する。ディープフェイクルーチンはこのメッセージを完全に破壊し、認証に失敗する。

カリフォルニア大学サンディエゴ校とサンディエゴ州立大学の2022年4月のペーパーより、ユーザーのビデオストリームにステガノグラフィックシグナルを送信して、シグナルがローカルループをそのまま通過するかどうかで、真正性を判断する方法。ソース:https://arxiv.org/pdf/2204.01960.pdf

カリフォルニア大学サンディエゴ校とサンディエゴ州立大学の2022年4月のペーパーより、ユーザーのビデオストリームにステガノグラフィックシグナルを送信して、シグナルがローカルループをそのまま通過するかどうかで、真正性を判断する方法。ソース:https://arxiv.org/pdf/2204.01960.pdf

さらに、GOTCHAは、ローカルシステム(アクセスと許可が与えられた場合)を、ストリームの複製と、ローカルのディープフェイクシステムに「過剰」なデータを提示することで、オーバーロードすることができる。これは、ローカルのディープフェイクシステムのレプリケーションに失敗を引き起こすことを目的としている。

システムには、スマートフォンベースのコレスポンデントの場合、電話を逆さに持つという課題も含まれており、これによりローカルのディープフェイクシステムが歪むことになる。

これらの種類のことは、ユーザーがストリームへのローカルアクセスを強制的に許可する、説得力のあるユースケースがある場合にのみ機能する。ただし、対話型テスト(例:顔に指を押し当てる)とは異なり、単純なユーザービデオのパッシブ評価では実装できない。

実用性

ペーパーは、これらの種類のテストがエンドユーザーを苛立たせる可能性、またはユーザーに不便を与える可能性について触れている。例えば、テストに必要な物体(サングラスなど)を用意する必要があるかもしれない。

また、有力なコレスポンデントがテストルーチンに従うのが難しい可能性についても言及している。CEOとのビデオ会議の場合、著者は次のように述べている。

「ユーザビリティがここで重要になる可能性がある。非公式またはフリーバルな課題(顔の歪みや表情など)は適切ではない可能性がある。外部の物理的な物体を使用する課題は望ましくない。ここでのコンテキストは適切に変更され、GOTCHAはその課題のセットを適応させる。」

データとテスト

GOTCHAは、4つのローカルのライブディープフェイクシステムに対してテストされた。これらには、DeepFaceLab(「DFL」、ただし、DeepFaceLiveは、2021年8月以降、DeepFaceLabの「ライブ」実装であり、潜在的な詐欺師にとって最もらしい初期リソースのようですが、ペーパーでは言及されていない)という、非常に人気のあるオートエンコーダディープフェイク作成ツールの2つのバリエーションが含まれる。

システムは、47人のユーザーがGOTCHAの13の課題に参加し、各ユーザーが約5〜6分間の1080pビデオを60fpsで出力する、2.5百万フレーム以上のビデオクリップを含む新しいデータセットで検証された。著者は、このデータを最終的に公開する予定であると述べている。

異常検出は、人間の観察者またはアルゴリズムによって実行できる。後者の場合、システムは、FaceForensicsデータセットの600の顔で訓練された。回帰損失関数は、強力な学習された感覚画像パッチ類似性(LPIPS)であり、分類器の訓練には二項交差エントロピーが使用された。検出器の重みを視覚化するために、EigenCamが使用された。

GOTCHAのテストの主な結果。

GOTCHAのテストの主な結果。

研究者は、4つのシステムすべてに対するテストの完全なカスケードに対して、最も低い数と重大性の異常(ディープフェイクシステムの存在を明らかにするアーティファクト)が、高度に訓練されたDFLディストリビューションによって得られたと発見した。訓練が不十分なバージョンは、複雑な唇の動き(フレームのほとんどを占めないが、人間の注意を高く受ける)を再現することに特に苦労した。FSGANは2つのDFLバージョンの間の中間の地平を占め、LIAはタスクに完全に不適切であり、研究者は、LIAは現場での展開に失敗するだろうと考えている。まず、唇の動き(これはフレームのほとんどを占めないが、人間の注意を高く受ける)を占める、

 

2022年10月17日に初めて公開。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai