Andersonの視点
AI動画の進歩の一年でディープフェイク検出精度が49%低下

私は興味深く、新しいウクライナ主導の論文が、古い世代のディープフェイク動画検出器が、オープンソースやAlibabaのWan 2.2やHunyuan VideoといったローカルAIインストール、あるいはGrok ImagineやKlingのようなAPI専用のクローズドソースモデルなど、最新の最先端genAI動画に対して非常に性能が低いことを示している。
クリックして再生 (AUDIO CONTENT)。 DF26データセットの「Direct to camera casual」カテゴリからの3つの例。 ソース
2024年に、別の論文ですでに人間のAI動画検出能力はそれほど偶然以上ではない、57%であることが示されていた。新しい研究(タイトルはDF26:もう偽と本物を区別できない)が追加したのは、最新のgenAI動画に直面した際、自动ディープフェイク検出器の有効性が劇的に低下したという実証的証拠で、94%から48%に落ちたことである。

本研究のために生成された新しいデータセットから、画像から動画への生成およびテキストから動画への生成動画(以下)の例を、左側の実動画と比較したものです。コーパスは「説得力があり」かつ信頼できる頭部と肩の構図に焦点を当てており、現在最も懸念されるgenAI領域の一つです。 ソース
本研究で実施されたテストにおける最も急激な低下は49%の減少を示す。以前のベンチマークは2025年のものであり、新しい研究は最新の2026年世代の動画モデルの範囲をテストしているため、この数値はAI動画検出有効性の約1年にわたる劣化を示している。

検出器がテストされたビデオを生成するために使用されたモデルの詳細。
この検出器回避出力を生成するために使用されたクローズドソースの商用モデルは、Grok 1.0、Kling 3.0、Veo 3.1、およびWan 2.6である。これらについてはテキストから動画への例のみが生成された。画像から動画への生成(I2V)を試みると、しばしば「ディープフェイク生成」に関するフィルタが作動するか、プラットフォームの利用規約に違反する可能性があるためである。
私の目を見て
これらのトリガーは、おそらく研究者が動画ベースの説得の中で最も潜在的に強力かつ、議論の余地はあるが陰険な形態、すなわち『頭部と肩部』や『トーキングヘッド』動画の多様なバリエーションに焦点を当てたために発生した。被写体がカメラに向かって話す様子は、YouTubeやTikTokのインフルエンサー動画、あるいはニュース報道シナリオ(衛星接続のインタビュー対象者など)で見られる。
著者らは、これらのシナリオがディープフェイク活動の主要な標的であると主張している。なぜなら、これらは『インフルエンサー』やその他さまざまな『情報』コンテキストを表し、事前の信頼関係が前提とされるため、その関係が濫用される可能性が大きいからである(自然に、これは少なくともディープフェイクビデオ通話にも同様に当てはまるが、研究者はこれについては扱っていない)。
オートエンコーダーディープフェイク時代の絶頂期から、実在するリチャード・ニクソンの映像を操作し、1969年のアポロ9号宇宙飛行士の死亡発表をシミュレートできた――実際には起こらなかった出来事だが、実世界の脚本がディープフェイクされた音声と口の動きに適用されたのである。
このインフルエンサーシナリオに焦点を当てることに加えて、新しいベンチマークとそれに作成された動画は、従来のディープフェイク検出戦略とは対照的に、動画の全フレームを評価することに集中している。
これらの古い戦略は、顔や表情操作、あるいは実動画内での顔(できれば全頭)置換を行っていた――これは実際、拡散ベースのモデルが過去18〜24か月で十分に効果的になり、これらに取って代わるまで唯一合理的なアプローチであった。
顔を背ける
それはもはや行われていない。古いオートエンコーダー方式は2017年後期のディープフェイクの初期に遡り、この手法は、顔の外側輪郭内の領域だけを置換するもので、2022年までに完全に使い尽くされた。

ディープフェイク活動の主要な領域(2017‑2023)—しかし新世代のgenAI動画プラットフォームでは、注目を集中させるような境界は存在しない。ソース
それでも、科学研究分野は長期的な定数を好む――目標が固定され、進化し続ける様々なアプローチを何年・何十年にもわたって試すことができる――ため、‘内部顔置換/修正’に基づくディープフェイク検出手法は文献や商用検出サービスにおいて、対象技術の有効性をはるかに超えて存続してきた。
新しい研究でテストされた3つのクローズドソースモデルに加えて、非常に有能な消費者向けオープンソースモデルも3つ試験された:Wan 2.2 A14B、HunyuanVideo 1.5、そしてLTX 2.3で、最近目覚ましい評価を受けているFOSS genAIコミュニティで話題となっている。LTXシリーズは音声生成も可能である:
クリックして再生:r/stablediffusion の LTX シリーズに関する実験で、コミュニティは FOSS モデルのみを扱っている。 ソース
データ設計
著者らは新しいデータセット DF26 を、未見素材の評価用の‘ホールドアウト’セットとして意図している。このコレクションは、直接カメラに向かうカジュアルなスピーチ、公式声明、スタジオインタビューという3つのパブリックスピーキングシナリオにわたる 2,691 本の動画で構成される。
すべての AI 生成動画は、OpenVid、TalkingCelebs、MAVOS-DDから精選された 271 本の実世界クリップを基に作成された。

OpenVid コレクションからのサンプルで、DF26 コレクションの AI 生成動画の根本素材として 271 本の実世界動画が取得された。その他 2 つのデータセットも DF26 の非偽装部分に貢献している。 ソース
この 271 本の実動画を用いて、フレームから対応するシーンプロンプトを抽出し、必要に応じて最初のフレーム自体も入力として、7 つの動画生成モデルに供給し、合計 2,420 本の合成クリップを生成した。
著者らは、テキストオーバーレイ(話者名のアナウンス等)を含む実世界フレームが生成ワークフローに入らないようにした。これらはショートカットや前提を助長する可能性があるためである。候補クリップはGemini 2.5によって評価された。
さらに、複数の顔が映るセグメントは除外し、‘単一スピーカー’設定を徹底した。
クリックして再生 [NO SOUND]. 本論文に付随するデータセットから、最新かつ最も有能な 7 つの生成モデル(オープン・クローズド両方)による最先端動画生成例を示す。データセットに使用されたモデルは音声生成も可能である(本記事前半の例参照)。 ソース
研究者らは、幅広いクローズド・オープンソースモデルを提供し、さまざまなゲートキーピングとガードレールを備えた人気商用 Higgsfield AI プラットフォームを使用した。
内部研究クラスターのベース GPU として NVIDIA H200(VRAM 141GB)を使用し、コレクション用の 1,626 本の動画生成に約 440 GPU 時間を要した。
出力にテキストが見えないようにするだけでなく、AI ウォーターマーキングの描写を隠すか回避することも必要だった。これも評価者や評価システムへの‘ショートカット’となり得るからである。
テスト
最終テストラウンドで使用された主要指標は受信者操作特性曲線下面積(AUC / AUROC)で、補助指標として等誤差率(EER)が用いられた。
フレームベースの検出器(静止フレームを個別に評価)は各動画から均等に間隔を空けた 32 枚のフレームでテストされ、スコアは平均化されて単一の結果となった。時間的検出器(連続フレーム情報を利用できる)は動画全体を解析した。
時間的検出器 DFD-FCG と PwTF-DVD の結果は以下に示す。また、ForAda、Effort、FSFM、GenD-CLIP と GenD-DINO、DFD-HR の結果も併せて示す。すべては古典的な FaceForensics++ データセットで学習された。

CelebDF++ と DF26 におけるディープフェイク検出器の比較テスト結果。すべての検出器は FaceForensics++ で学習され、AUROC が高く、EER が低いほど性能が優れることを示す。
著者らは、ほとんどの検出器が Celeb-DF++(CDFv3)では良好に機能するが、より挑戦的な新しい DF26 コレクションでは急激に性能が低下することを指摘している。
‘[Multiple] 最先端検出器は CelebDF++ [16](CDFv3)ベンチマークで高い性能を示し、時間的手法は AUROC が 94.3 と 92.3 に達した。
‘しかし、DF26では性能が大幅に低下し、AUROCはそれぞれ48.2と61.6になる。
‘ほとんどの手法は大幅に劣化し、ほぼ偶然レベルにとどまる;最高AUROC 69.7はGenD-PEが達成した。
‘これはDF26が最先端検出器にとってより挑戦的なベンチマークであることを示している。’
画像から動画への変換は、テキストから動画への変換よりも検出が難しいことが判明し、人物でも自動検出器でも、PwTF-DVDがI2V素材で最良の性能を示し、GenD-PEがT2Vでリードした。
性能は偽動画を生成したジェネレーターによって劇的に変化し、検出器が合成動画の一般的な署名ではなく、ジェネレーター固有の痕跡を学習していることが示唆される。例えば、PwTF-DVDはWan 2.2のテキストから動画出力で92.9のAUROCを達成したが、HunyuanVideo 1.5ではほぼ偶然レベルに低下した――両者は同じ現代世代の風景に属しているが。

商用およびオープンソースの動画ジェネレーターに対する検出器の性能。列間の大きなばらつきは、検出信頼性が動画を生成したモデルに強く依存することを示し、GenD-PEが全体で最も高い平均AUROCを達成している。
以下では、GenD-PEを新しいDF26素材で再訓練することで、訓練時に見たことのないジェネレーターからの動画検出能力が大幅に向上したことが示されている。

未見の動画ジェネレーターに対するGenD-PEの再訓練結果。新しいDF26素材での訓練は、元のFaceForensics++訓練と比較してクロスジェネレーター性能を一般的に向上させた。
HunyuanVideo 1.5での訓練により、Grok Imagine 1.0、Veo 3.1、Wan 2.6でのAUROCが少なくとも93.1に上昇し、FaceForensics++などの古いデータセットだけで訓練された検出器は現在の生成動画に対して適合性が低いという論文の主張を裏付けている。
予想通り、2つの時間的検出器は商用モデルのクリップよりもオープンソース動画でずっと容易に検出できた。DFD-FCGはオープンソース素材で57.4のAUROCだったが、クローズドソース動画では34.5に低下;PwTF-DVDは70.5から48.3へ低下した。

ジェネレーターの出所と発話シナリオ別に2つの時間的検出器を比較した結果。両者ともクローズドソース動画で大幅に性能が低下し、シーンタイプ間の差は小さかった。
しかし、論文は商用モデルが単に検出しにくいと断言してはいない。モデルファミリー、ポストプロセッシング、視覚品質の違いも要因となり得る。
シーンの種類ははるかに影響が少なかった:DFD-FCGはカメラに直接向けたクリップ、公式声明、スタジオインタビューすべてで偶然レベルに近く、PwTF-DVDは公式声明で最良の性能を示した。論文によれば、ジェネレーター自体が提示スタイルよりも重要なようだ。
人間のスタディも実施され、DF26で人々が自動検出器と同様に苦戦するかを調べた。232回のラベリングセッションで、参加者はDF26、CelebDF++、DeepSpeak v2 の短いクリップを本物か偽物か判断し、各クラスの例数は事前に告知されなかった。

DF26、CelebDF++、DeepSpeak v2 における人間の正解率。参加者は3つのデータセットすべてで実動画を同程度の割合で識別したが、偽のDF26動画の正解率は偶然レベルに近づいた。
実動画のパフォーマンスは3つのデータセットすべてで類似しており、DF26が76.0%、CelebDF++が75.5%、DeepSpeak v2が72.8%だった。差は偽動画で現れ、DF26では正解率が52.6%に低下し、他の2つの古いデータセットではそれぞれ74.5%と69.8%だった。
したがって、論文によれば、参加者はDF26に一般的に混乱はしなかったものの、その合成動画が偽であるという具体的な可視的証拠を見つけるのに苦労した。
結論
過去2年間でディープフェイクの頻度が報告された16倍の増加にもかかわらず、悪意あるディープフェイクの実態は私たちの日常経験にはほとんど現れず、対象となる場合を除いてはほとんど目にしない。
性的ディープフェイクの被害者の場合、これは全く理解できることです――しかし、ディープフェイクが現在 詐欺犯罪への影響が増大している ため、より多くの資料が一般に共有されれば、我々の文脈をオートエンコーダー・ディープフェイクの「黄金時代」から、拡散ベースのディープフェイクというはるかに鋭く欺瞞的な時代へと更新できるでしょう。
もちろん、新しい研究のモデルからの出力や他のモデルに関するほとんどの資料は、ソーシャルメディアプラットフォーム上で十分な文脈なしに浮上します。そのプラットフォームの管理者は AI と実物を区別できないか、あるいは 単に気にしない 可能性があります。
我々が疑う可能性のある動画に適用できるもう一つの指標は 妥当な信頼性 ですが、この能力は個人差が大きく信頼できません。したがって、技術の影響とそのますます高まる能力に慣れ親しむ過渡期には、単に 判断を保留する 必要があるかもしれません。
2026年9月14日(月)に最初に公開












