Andersonの視点

ディープフェイクは多くの主要な顔の「生存性」APIを効果的に欺くことができる

mm
Unite.AI を Google の優先ソースに追加
From DeepFace Live - Arnold Schwarzenegger 224 3.03M Iterations | RTX A6000 - https://www.youtube.com/watch?v=9tr35y-yQRY

米国と中国の共同研究は、世界で最大の顔認証システムのいくつかに対するディープフェイクの脆弱性を調査し、ほとんどのシステムが発展途上のディープフェイク攻撃に対して脆弱であることがわかった。

研究では、カスタムフレームワークを使用して、Facial Liveness Verification(FLV)システムに対するディープフェイクベースの侵入攻撃を実施した。FLVシステムは、主要ベンダーから提供され、航空会社や保険会社などの下流クライアントにサービスとして販売されている。

論文から、主要プロバイダーでのFacial Liveness Verification(FLV)APIの機能の概要。ソース:https://arxiv.org/pdf/2202.10673.pdf

論文から、主要プロバイダーでのFacial Liveness Verification(FLV)APIの機能の概要。ソース:https://arxiv.org/pdf/2202.10673.pdf

Facial Livenessは、敵対的画像攻撃、仮面や事前録音されたビデオの使用、ソーンベースの顔認証システムの突破など、さまざまな技術に対する耐性を向上させることを目的としている。

研究では、ディープフェイク検出モジュールがこれらのシステムに少数しか導入されていないことがわかり、多くのシステムが古いディープフェイク技術に対してしか構成されていないことがわかった。

著者は次のように述べている:

‘さまざまなディープフェイク方法は、さまざまなベンダー間で変化する…ターゲットFLVベンダーの技術的な詳細にアクセスできないため、ベンダーが展開する防御対策の違いによるものと推測する.’

そして続けて:

‘ほとんどのFLV APIは、ディープフェイク検出を使用していない。防御を実装している場合でも、その有効性は懸念される(例:高品質の合成ビデオを検出できるが、低品質のビデオを検出できない)。’

研究者は、この点について「真実性」は相対的なものであると指摘している:

‘人間には非現実的な合成ビデオでも、現在のディープフェイク検出メカニズムを簡単に回避できる.’

上:著者たちの実験で認証に成功したサンプルのディープフェイク画像。下:より現実的なフェイク画像が認証に失敗した例。

上:著者たちの実験で認証に成功したサンプルのディープフェイク画像。下:より現実的なフェイク画像が認証に失敗した例。

別の発見として、現在の汎用的な顔認証システムは、白人男性に対して偏っていることがわかった。したがって、女性や非白人アイデンティティは、ディープフェイクベースの技術を使用して認証システムを突破することが容易になり、顧客のセキュリティ上のリスクが高まることになる。

レポートでは、白人男性のアイデンティティが最も厳格に評価されていることがわかった。上の表では、女性や非白人アイデンティティがシステムを突破することが容易であることが示されている。

レポートでは、白人男性のアイデンティティが最も厳格に評価されていることがわかった。上の表では、女性や非白人アイデンティティがシステムを突破することが容易であることが示されている。

論文では、「Facial Liveness Verification(FLV)には偏りがあるため、特定のグループの人々に重大なセキュリティ上のリスクをもたらす可能性がある」と述べられている。

著者は、中国政府、中国の大手航空会社、中国最大の生命保険会社の1つ、そして世界最大のユニコーン投資グループの1つであるR360に対して、倫理的な顔認証攻撃を実施し、これらの組織のダウンストリームAPIの使用を成功裏に突破したことを報告している。

中国の航空会社の場合、認証を突破するために、ユーザーは「頭を振る」という動作を実行する必要があったが、これは研究者が開発したフレームワークによって容易に回避された。

航空会社の評価では、ユーザーの頭の動きを評価していたが、ディープフェイクコンテンツはテストに合格した。

航空会社の評価では、ユーザーの頭の動きを評価していたが、ディープフェイクコンテンツはテストに合格した。

論文では、FLVの現在の状態を改善するための提案がなされている。これには、シングルイメージ認証(「Image-based FLV」)の放棄、ディープフェイク検出システムの更新、声認証の同期化、ユーザーが特定の動作を実行する必要性の導入などが含まれる。

論文「Seeing is Living? Rethinking the Security of Facial Liveness Verification in the Deepfake Era」は、ペンシルベニア州立大学、浙江大学、山東大学の共同研究によるものである。

コアターゲット

研究者は、6つの代表的なFacial Liveness Verification(FLV)ベンダーを対象としている。これらのベンダーは、研究において暗号名で表記されている。

ベンダーは次のように表記されている: ‘BD’‘TC’ は、顔関連APIコール数が最も多いコンソーシアムサプライヤーであり、中国のAIクラウドサービス市場で最大のシェアを占める; ‘HW’ は、中国のパブリッククラウド市場で最大のベンダーの1つ; ‘CW’ は、コンピュータビジョンで最も急成長しているベンダーであり、市場のリーダーになろうとしている; ‘ST’ は、コンピュータビジョンの最大のベンダーの1つ; ‘iFT’ は、中国最大のAIソフトウェアベンダーの1つである。

データとアーキテクチャ

このプロジェクトを支えるデータには、中国のイニシアチブ「CelebA-Spoof」から625,537枚の画像と、ミシガン州立大学の2019年の「SiW-M」データセットからのライブビデオが含まれる。

すべての実験は、2.40GHz Intel Xeon E5-2640 v4 CPUを搭載したサーバーで実施され、256 GBのRAMと4TBのHDD、4つのNVIDIA 1080Ti GPU(合計44GBのVRAM)を使用した。

6つのフレームワーク

論文の著者が開発したフレームワークは、LiveBugger と呼ばれ、FLVシステムの4つの主な防御に対して6つの最新のディープフェイクフレームワークを使用している。

LiveBuggerには、さまざまなディープフェイクアプローチが含まれており、FLVシステムの4つの主な攻撃ベクトルに焦点を当てている。

LiveBuggerには、さまざまなディープフェイクアプローチが含まれており、FLVシステムの4つの主な攻撃ベクトルに焦点を当てている。

使用された6つのディープフェイクフレームワークは次のとおりである:オックスフォード大学の2018年の「X2Face」;米国学術コラボレーションの「ICface」;2019年のイスラエルプロジェクト「FSGAN」の2つのバリエーション;2020年の初めのイタリアの「First Order Method Model(FOMM)」;北京大学のマイクロソフトリサーチコラボレーションの「FaceShifter」(ただし、FaceShifterはオープンソースではないため、著者は公開されたアーキテクチャの詳細に基づいてそれを再構築する必要があった)。

これらのフレームワークでは、事前にレンダリングされたビデオを使用して、APIの認証要件を事前に評価した後、ユーザーが特定の動作を実行するように促すことが含まれる。また、ディープフェイクの「人形劇」も使用され、個人の生の動きをディープフェイクストリームに変換し、カメラストリームに挿入する。

これの例としては、DeepFaceLiveがあり、先月、人気のあるDeepFaceLabの補足プログラムとして、リアルタイムのディープフェイクストリーミングを可能にするためにデビューしたが、著者の研究には含まれていない。

4つのベクトルへの攻撃

FLVシステム内の4つの攻撃ベクトルは次のとおりである: 画像ベースのFLV、ユーザーが単一の写真を認証トークンとして提供する; サイレンスベースのFLV、ユーザーがビデオクリップをアップロードする必要がある; アクションベースのFLV、ユーザーがプラットフォームが指示する動作を実行する必要がある; 声ベースのFLV、ユーザーの音声パターンをシステムのデータベースエントリと比較する。

システムの最初の課題は、APIがどの程度要求を公開するかを決定することである。これは、LiveBuggerのインテリジェンスエンジンによって処理され、APIのドキュメントやその他のソースから情報を収集する。

APIの公開された要件が欠けている場合(さまざまな理由で)、インテリジェンスエンジンは、APIコールの結果に基づいて暗黙の情報を収集するプローブを含む。これは、開発者のために公式のオフライン「テスト」APIと、テストに自分のアカウントを提供したボランティアによって実現された。

インテリジェンスエンジンは、APIが特定のアプローチを使用しているかどうかを探す。検出の連続性や、ビデオのフレームが時間的に連続しているかどうかをチェックする機能がこれに含まれる。必要性を確立するために、乱れたビデオフレームを送信し、認証の失敗に寄与するかどうかを観察する。

モジュールは、リップ言語検出も探索する。ここで、APIは、ビデオの音声がユーザーのリップの動きと同期されているかどうかをチェックする(これはほとんどの場合、実現されていない)。

結果

著者は、評価された6つのAPIのすべてが、実験の時点で連続性検出を使用していないことを発見した。これにより、LiveBuggerのディープフェイクエンジンは、提供された素材に基づいて合成オーディオとディープフェイクビデオを簡単に組み合わせることができた。

ただし、一部のダウンストリームアプリケーション(APIフレームワークの顧客)は、プロセスに連続性検出を追加していたため、回避するために事前に録音されたビデオを使用する必要があった。

さらに、APIベンダーのうちわずか数社のみがリップ言語検出を使用しており、ほとんどの場合、ビデオとオーディオは個別の量として分析され、リップの動きと提供されたオーディオを一致させる機能はなかった。

LiveBuggerのさまざまなディープフェイク技術に対するFLV APIの結果。高い数字は、ディープフェイク技術を使用して認証を突破することに成功したことを示す。

LiveBuggerのさまざまなディープフェイク技術に対するFLV APIの結果。高い数字は、ディープフェイク技術を使用して認証を突破することに成功したことを示す。

結論

論文の結果とFLV APIの将来に関する示唆は複雑であり、著者はこれらをFLV開発者が脆弱性を理解するのに役立つ「脆弱性のアーキテクチャ」にまとめている。

ディープフェイク攻撃に対する顔認証ルーチンの既存のおよび潜在的な脆弱性に関する論文の推奨事項のネットワーク。

ディープフェイク攻撃に対する顔認証ルーチンの既存のおよび潜在的な脆弱性に関する論文の推奨事項のネットワーク。

推奨事項では、次のように述べられている:

‘FLVのセキュリティリスクは、多くの実際のアプリケーションで広く存在し、したがって数百万人のエンドユーザーのセキュリティを脅かしている。’

著者はまた、行動ベースのFLVの使用は「限定的」であり、ユーザーが実行する必要があるアクションの数を増やすと、「セキュリティ上の利点は得られない」と述べている。

さらに、著者は、声認証と顔認証(ビデオ)を組み合わせることは、APIプロバイダーがリップの動きとオーディオを同期することを要求しない限り、無駄な防御策であると指摘している。

この論文は、FBIがビジネスに対するディープフェイク詐欺の危険性について警告したこと、そしてディープフェイク技術が外国からの影響作戦で使用される可能性についての警告から約1年後に発表された。また、ディープフェイク技術が新しい犯罪の波をもたらす可能性についての一般的な懸念もある。

これはまだディープフェイクが認証攻撃の表面として使用される初期段階である。2020年には、ディープフェイクオーディオ技術を使用して、UAEの銀行から3500万ドルが詐取され、2019年には、イギリスの幹部が243,000ドルを詐取された。

 

2022年2月23日初出。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai