Andersonの視点

ビデオ会議のディープフェイクをスマートフォンの「バイブレーション」機能で検出

mm
Unite.AI を Google の優先ソースに追加
An AI-generated illustration: 'a gorgeous panoramic picture of a man sitting in an office, looking into his smartphone, which he is holding; the man is wearing a Guy Fawkes mask; photorealistic, UHQ' - ChatGPT 3, Tuesday, 2024年9月24日 13:27:31

シンガポールからの新しい研究では、スマートフォンのビデオ会議ツールの相手側が、DeepFaceLiveなどの方法を使用して他人を偽装しているかどうかを検出するための新しい方法が提案されています。

この新しいアプローチは、SFakeと呼ばれ、ほとんどのシステムが使用する受動的な方法を放棄し、代わりにユーザーの電話を振動させる(スマートフォンに共通の振動メカニズムを使用)ように設計されています。また、ユーザーの顔を微妙にぼかします。

ライブディープフェイクシステムは、モーションブルーやその他の効果を再現できる可能性がありますが、SFakeが使用するこのタイプの予期せぬぼかを対応することはできません。したがって、ディープフェイク会議コールの存在を明らかにするために、ぼかされていない顔の部分を出力し続けます。

DeepFaceLiveは、カメラの振動によって引き起こされるぼかをシミュレートするのに十分な速さで対応できません。ソース:https://arxiv.org/pdf/2409.10889v1

DeepFaceLiveは、カメラの振動によって引き起こされるぼかをシミュレートするのに十分な速さで対応できません。ソース:https://arxiv.org/pdf/2409.10889v1

研究者が作成した独自のデータセット(アクティブなカメラシェイクを含むデータセットがないため)を使用したテスト結果は、SFakeが競合するビデオベースのディープフェイク検出方法を上回ったことを示しています。さらに、自然な手の動きが発生する状況(例:ビデオ会議の相手側がカメラを手で持っている場合)でも、SFakeは高い精度を維持しました。

ビデオベースのディープフェイク検出の必要性の増加

最近、ビデオベースのディープフェイク検出に関する研究が増えています。数年間にわたる音声ベースのディープフェイク事件の後、今年、財務担当者がディープフェイクビデオ会議コールで2500万ドルを詐取される事件が発生しました。

このようなシステムは、高度なハードウェアアクセスを必要としますが、多くのスマートフォンユーザーはすでに、顔認証サービスが顔の特徴を記録することを求めていることに慣れています(実際、リンクトインの検証プロセスの一部です)。

したがって、ビデオ会議システムでこのような方法が使用される可能性は高くなります。なぜなら、このタイプの犯罪が続いて発生しているからです。

ほとんどのディープフェイク検出ソリューションは、静的なシナリオを想定しています。つまり、通信者が固定されたウェブカメラを使用し、動きや環境の変化がないと想定しています。スマートフォン会議では、このような「固定」状況はありません。

代わりに、SFakeは、スマートフォンを使用したビデオ会議における多数の視覚的な変数を補償するために、複数の検出方法を使用します。また、スマートフォンに標準で搭載されている振動機構を使用して、ディープフェイク問題に対処する最初の研究プロジェクトであると考えられます。

この論文は、Shaking the Fake:Active Probesを介したリアルタイムでのディープフェイクビデオの検出と題されており、シンガポールの南洋理工大学の2人の研究者によって執筆されています。

方法

SFakeは、クラウドベースのサービスとして設計されており、ローカルアプリがリモートAPIサービスにデータを送信し、結果を受け取ります。

ただし、SFakeのサイズはわずか450MBで、最適化された方法論により、ネットワーク接続が画像の圧縮を引き起こし、診断プロセスに影響を与える可能性がある場合でも、デバイス自体でディープフェイク検出を完全に処理できます。

このように「ローカルで実行」することで、システムはユーザーのカメラフィードに直接アクセスでき、ビデオ会議でよく見られるコーデックの干渉を受けることがありません。

平均分析時間は、ユーザーが静止したまま4秒間のビデオサンプルを必要とします。その間に、SFakeはDeepFaceLiveなどのシステムが対応できないランダムな間隔で「プローブ」を送信してカメラの振動を引き起こします。

(攻撃者がトレーニングデータセットにぼかされたコンテンツを含めていない場合、ぼかを生成できるモデルを作成することは不可能であることに注意してください。また、DeepFaceLiveは、カーソルを含まないデータセットでトレーニングされたモデルにこの機能を追加することはできません)

システムは、顔の特定の領域を潜在的なディープフェイクコンテンツとして選択し、目と眉毛(これらの領域の瞬きやその他の顔の動きはぼか検出の範囲外であり、理想的な指標ではないため)を除きます。

SFakeの概念スキーマ

SFakeの概念スキーマ

上記の概念スキーマからわかるように、適切で予測不可能な振動パターンを選択し、最適な焦点距離を決定し、Dlibコンポーネントを介した顔認識(標準の68の顔のランドマークを推定)を実行した後、SFakeは入力された顔からグラデーションを導出し、選択された領域に集中します。

分散シーケンスは、研究中の短いクリップの各フレームを順番に分析することによって取得され、平均または「理想的な」シーケンスが到達した後、残りは無視されます。

これにより、トレーニング済みデータベースに基づいてディープフェイクコンテンツの確率を量化できる機能が抽出されます(後述)。

システムは、1920×1080ピクセルの画像解像度と、レンズに2倍のズーム要件を必要とします。論文では、Microsoft Teams、Skype、Zoom、Tencent Meetingでこれらの解像度(およびそれ以上)がサポートされていることが注目されています。

ほとんどのスマートフォンには、前面と背面のカメラがあり、通常、2つのカメラのうち1つだけがSFakeの要件を満たすズーム機能を備えています。したがって、アプリは、どちらのカメラを使用するかを選択する必要があります。

ここでの目的は、システムが分析するビデオストリームにユーザーの顔を正しい比率で取得することです。論文では、女性がモバイルデバイスを使用する平均距離は34.7cm、男性は38.2cm(Journal of Optometryに報告されている)であると観察しています。SFakeはこれらの距離で非常に効果的に機能します。

安定性は、ハンドヘルドビデオの問題であり、カメラの振動によって発生するぼかはSFakeの機能を妨げる障害です。研究者は、中央のランドマークの中心点を計算し、それを「アンカー」として使用することで、最も成功した方法でこれを補償しました。アルゴリズム的な安定化技術です。この方法により、92%の精度が得られました。

データとテスト

適切なデータセットがないため、研究者は独自のデータセットを作成しました。

「8つの異なるスマートフォンのブランドを使用して、さまざまな性別や年齢の15人の参加者を記録して、独自のデータセットを作成しました。スマートフォンを参加者の20cm離れたところに置き、2倍のズームで参加者の顔に焦点を当てて、さまざまなパターンでスマートフォンを振動させました。」

「前面カメラのズーム機能がない電話の場合、代わりに背面カメラを使用しました。20秒間の長いビデオを150本記録しました。デフォルトでは、検出期間が4秒間続くと想定しています。1本の長いビデオから、ランダムに開始時間を選択して、4秒間の10個のクリップをトリミングしました。したがって、合計1500個のリアルクリップ、各4秒間のクリップが得られました。」

DeepFaceLiveは、現在最も広く使用されているオープンソースのライブディープフェイクシステムであるため、この研究の中心的な対象となりました。研究者は、ディープフェイク検出の基本モデルをトレーニングするために、4つの他の方法を含めました:HififaceFS-GANV2RemakerAI;およびMobileFaceSwap。後者は、ターゲット環境を考慮すると特に適切な選択です。

1500個のフェイクビデオがトレーニングに使用されました。また、同数のリアルで変更されていないビデオも使用されました。

SFakeは、SBIFaceAFCnnDetectLRNetDefakeHopバリアント;および無料のオンラインディープフェイク検出サービスDeepawareなどの複数のクラスифァイアに対してテストされました。各ディープフェイク方法の場合、1500個のフェイクビデオと1500個のリアルビデオがトレーニングされました。

ベーステストクラスファイアは、ニューラルネットワークで、ReLUアクティベーション関数を使用しました。1000個のリアルビデオと1000個のフェイクビデオ(DeepFaceLiveの例のみ)がランダムに選択されました。

受信者操作特性曲線の下の面積(AUC/AUROC)と精度(ACC)が使用されたメトリックです。

トレーニングと推論の両方に、NVIDIA RTX 3060が使用され、テストはUbuntuで実行されました。テストビデオは、Xiaomi Redmi 10x、Xiaomi Redmi K50、OPPO Find x6、Huawei Nova9、Xiaomi 14 Ultra、Honor 20、Google Pixel 6a、Huawei P60で記録されました。

既存の検出方法と一致するように、テストはPyTorchで実装されました。主なテスト結果は以下の表に示されています。

SFakeに対する競合方法の結果

SFakeに対する競合方法の結果

ここで、著者は次のように述べています。

「すべてのケースで、SFakeの検出精度は95%を超えました。5つのディープフェイクアルゴリズムのうち、Hififaceを除いて、SFakeは他のディープフェイクアルゴリズムに対して他の6つの検出方法よりも優れています。DeepFaceLiveで生成されたフェイク画像でトレーニングされたクラスファイアの場合、SFakeは98.8%の最高精度率を達成しました。」

「RemakerAIによって生成されたフェイク顔に対して、他の検出方法は貧弱に実行されます。インターネットからビデオをダウンロードするときの自動圧縮による画像の詳細の損失が原因であると推測していますが、これはSFakeの検出精度に影響しません。RemakerAIに対する検出では、96.8%の精度を達成します。」

著者はさらに、SFakeが2倍のズームが適用されたキャプチャレンズのシナリオで最もパフォーマンスの高いシステムであると述べています。これは、動きを強調し、非常に課題的なシナリオです。さらに、SFakeは2.5と3の倍数のズームでそれぞれ84%と83%の認識精度を達成しました。

結論

ライブディープフェイクシステムの弱点を利用するプロジェクトは、ディープフェイク検出が周波数分析(ディープフェイクの進歩に対して免疫ではない)を中心としたアプローチで占められている今年の新鮮な提案です。

2022年末、別のシステムはモニタの明るさの変化を検出のヒントとして使用しました。また、同年、私自身の実証により、DeepFaceLiveが90度の横向きのプロファイルビューを処理できないことが明らかになりました。

DeepFaceLiveは、ビデオ会議詐欺に関して犯罪的関心の対象となるため、このようなプロジェクトの適切な対象です。

しかし、最近、VFXコミュニティで非常に人気があるLivePortraitシステムが、DeepFaceLiveよりもプロファイルビューをはるかにうまく処理するといういくつかの経験的証拠を見たことがあります。この研究に含めることができたら面白かったでしょう。

2024年9月24日火曜日初版

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai