Andersonの視点
ディープフェイク動画通話の検出 – モニター照明を利用した新しいアプローチ

アメリカ国家安全保障局(NSA)とカリフォルニア大学バークレー校の研究者による新しい共同研究では、モニターの照明の影響を観察することで、ライブ動画コンテキストでのディープフェイクコンテンツを検出するための新しい方法を提案しています。

Popular DeepFaceLive user Druuzil Tech & Games tries out his own Christian Bale DeepFaceLab model in a live session with his followers, while lighting sources change. Source: https://www.youtube.com/watch?v=XPQLDnogLKA
このシステムは、ユーザーの画面にグラフィック要素を配置し、典型的なディープフェイクシステムが反応できるよりも速く色を変化させます。たとえば、リアルタイムディープフェイクストリーミング実装であるDeepFaceLive(上の画像参照)のように、ライブカラートランスファーを維持し、環境光を考慮する機能を持っていてもです。
モニターに表示されるグラフィック要素は、ウェブカメラの自動ホワイトバランスやその他の照明補償システムを活性化しないように設計された、狭い範囲の色の変化を循環させます。

From the paper, an illustration of change in lighting conditions from the monitor in front of a user, which effectively operates as a diffuse ‘area light’. Source: https://farid.berkeley.edu/downloads/publications/cvpr22a.pdf
このアプローチの理論は、ライブディープフェイクシステムがグラフィック要素の色の変化に反応することができないため、特定の色域でディープフェイク効果の「遅れ」が生じ、存在を明らかにするというものです。
モニターからの反射光を正確に測定するには、システムは一般的な環境光の影響を考慮し、差し引く必要があります。そうすることで、システムは、活性化照明の色とユーザーの顔の色の測定における短所を区別できます。これは、1〜4フレームの時間差を表します。

By limiting the hue variations in the on-screen ‘detector’ graphic, and ensuring that the user’s webcam is not prompted to auto-adjust its capture settings by excessive changes in levels of monitor illumination, the researchers have been able to discern a tell-tale lag in the deepfake system’s adjustment to the lighting changes.
論文では、次のように結論付けられています。
‘ライブビデオコールに対する我々の信頼は、ビデオ(およびオーディオ)コールの認証技術の重要性を高めるでしょう。’
この研究は、リアルタイムディープフェイクビデオの検出によるアクティブ照明というタイトルで、アメリカ国防総省の応用研究数学者であるCandice R. Gerstnerと、バークレーのHany Farid教授によって行われました。
信頼の侵食
ディープフェイク対策研究は、一般的なディープフェイク検出(事前録音されたビデオやポルノグラフィーを対象)から、ライブディープフェイク検出(ビデオ会議でのディープフェイクの使用)へと、過去6ヶ月で大幅にシフトしました。これは、FBIの警告や、リモートワークへのディープフェイク技術の使用の増加を受けています。
ビデオコールがディープフェイクではない場合でも、AI駆動のビデオインパーソネーターが増えるにつれて、パラノイアが生じています。
論文では、次のように述べられています。
‘リアルタイムディープフェイクの作成は、ライブビデオまたは電話会議の一般的な信頼感と、会議中にディープフェイクを検出する困難性により、独自の脅威をもたらします。’
研究コミュニティは、ディープフェイクコンテンツの検出に簡単に代替できない確実な兆候を見つけることを目標にしています。メディアはこれを、セキュリティ研究者とディープフェイク開発者の間の技術的な戦争として表現していますが、初期アプローチの否定(目つぶり分析、頭部ポーズの区別、行動分析)は、ディープフェイク開発者がよりリアルなディープフェイクを作成しようとしているため、発生しました。
ライブディープフェイクビデオの照明
ライブディープフェイクビデオの検出には、ビデオ会議でよく見られる悪いビデオ接続を考慮する必要があります。ディープフェイク層が介在していなくても、ビデオコンテンツはNASA式の遅延、レンダリングアーティファクト、オーディオとビデオのその他の種類の劣化の影響を受ける可能性があります。これらは、ライブディープフェイクアーキテクチャの粗い辺を隠すのに役立ちます。
このシステムは、オーディオディープフェイクにも対応しています。
著者らは、2020年のテンプル大学フィラデルフィア校の研究に基づいています。

From the 2020 paper, we can observe the change in ‘in-filled’ facial illumination as the content of the user’s screen changes. Source: https://cis.temple.edu/~jiewu/research/publications/Publication_files/FakeFace__ICDCS_2020.pdf
新しい研究の違いは、ウェブカメラが照明の変化に反応する方法を考慮に入れることです。著者らは、次のように述べています。
‘すべての近代的なウェブカメラは自動露出を実行するため、先行研究で使用された高強度のアクティブ照明は、カメラの自動露出をトリガーする可能性があり、記録された顔の外観を混乱させることになります。したがって、等明度の色の変化を使用しています。’
‘これによりカメラの自動露出を回避できますが、カメラのホワイトバランスをトリガーする可能性があり、記録された顔の外観を再び混乱させることになります。したがって、実験的に決定したホワイトバランスをトリガーしない色域で操作しています。’
この取り組みでは、著者らは、LiveScreenなどの類似の先行研究も考慮しました。これは、エンドユーザーのモニターに目立たない照明パターンを強制し、ディープフェイクコンテンツを明らかにすることを目指しています。
そのシステムは94.8%の精度率を達成しましたが、研究者らは、照明パターンの微妙さにより、明るい環境ではこのような秘密のアプローチを実装することが難しいと結論付けています。代わりに、自分たちのシステムまたは同様のシステムを、一般の人や人気のあるビデオ会議ソフトウェアにデフォルトで組み込むことができると提案しています。
‘提案した介入は、呼び出し参加者が画面を共有してテンポラルに変化するパターンを表示することで実現できます。理想的には、ビデオ会議クライアントに直接統合することができます。’
テスト
著者らは、Dlibドライブのディープフェイク検出器を使用して、合成および実世界の被験者をテストしました。合成シナリオでは、スイス連邦工科大学ローザンヌ校から、Mitsubaという名前の、フォワードおよび逆レンダラーを使用しました。

Samples from the simulated environment tests, featuring varying skin tone, light source size, ambient light intensity, and proximity to camera.
描かれたシーンには、90°の視野角を持つ仮想カメラからのパラメトリックCGIヘッドが含まれています。ヘッドは、ランバート反射を特徴とし、中性の肌色を持ち、仮想カメラの前方2フィートに配置されています。
フレームワークをさまざまな可能な皮膚トーンや設定でテストするために、研究者らは、さまざまな側面を順番に変更する一連のテストを実行しました。変更された側面には、皮膚トーン、近接度、照明光のサイズが含まれました。
著者らは、次のように述べています。
‘シミュレーションでは、さまざまな仮定を満たした場合、提案したテクニックは、幅広い画像構成に対して非常に堅牢です。’
実世界のシナリオでは、研究者らは、さまざまな環境で、さまざまな肌色を持つ15人のボランティアを使用しました。各ボランティアは、30Hzのディスプレイリフレッシュレートがウェブカメラと同期されている条件で、制限された色の変化を2サイクル繰り返しました。結果は、合成テストと比較して広く互換性がありましたが、照明値が大きいほど相関が著しく増加しました。
将来の方向性
システムは、一般的な顔の覆い隠し(たとえば、前髪、眼鏡、またはひげ)を考慮していません。しかし、研究者らは、これらのマスクは、ラベル付けとその後のセマンティックセグメンテーションを通じて、後続のシステムに追加できることを示しています。これらのシステムは、ターゲットサブジェクトの認識された皮膚領域からの値のみを受け取るようにトレーニングできます。
著者らは、同様のパラダイムが、ディープフェイクのオーディオコールを検出するために使用できる可能性があることにも触れています。必要な音は、人間の正常な聴覚範囲外の周波数で再生できます。
おそらく最も興味深いのは、研究者らが、評価領域を顔の外側に拡大することで、ディープフェイク検出の可能性を大幅に改善できる可能性があることを示唆していることです。
‘より洗練された3Dの照明推定は、より豊かな外観モデルを提供する可能性が高く、偽造者にとって回避するのがより困難になります。私たちは顔にのみ焦点を当てましたが、コンピュータディスプレイも首、上半身、周囲の背景を照らします。これらからも同様の測定が可能です。 ‘
‘これらの追加の測定により、偽造者は顔だけでなく、全体の3Dシーンを考慮する必要があります。’
* 著者らのインライン引用をハイパーリンクに変換しました。
初版は2022年7月6日に公開されました。
lay also illuminates the neck, upper body, and surrounding background, from which similar measurements could be made. ‘These additional measurements would force the forger to consider the entire 3-D scene, not just the face.’ * My conversion of the authors’ inline citations to hyperlinks. First published 6th 2022年7月.












