Andersonの視点
動画会議のぼやけた映像をリアルタイムで修正するためのCPUのみを使用した新しい方法

新しい方法は、ユーザーの顔のAIモデルを数秒で作成し、リアルタイムでぼやけた動画会議を修正することができます。高性能ハードウェアやクラウド処理は不要で、基本的なラップトップCPUで動作します。
低品質の動画チャット画像に影響を受けるのは、リソースが乏しい国でのユーザーですが、頻繁に「先進国」の問題でもあります。たとえば、チャット参加者が過負荷のWi-Fiホットスポットを使用している場合、または参加者の家庭で他のプロセスまたは人が利用可能な帯域幅を独占している場合、またはその人が接続性の悪い国を訪れている場合などです。
この問題は一般的であるため、研究文献では一定の注意が払われており、デブロッキング、ノイズ除去、スーパーリゾリューション、他の方法を通じて解決策が提案されています。2022年のVQFRシステムは、低品質の画像特徴を学習したコードブックからの高品質の表現に置き換えることで、劣化した顔画像を復元します。2021年のGFP-GANは、生成された顔の先入観を利用して低品質の画像を改善します。さらに、RTFVE:リアルタイム顔映像強化は、高品質の参照画像を使用して顔の復元を実行します。
必要に応じて再生してください。2025年のRTFVE顔強化プロジェクトから、GPUアクセラレーションを使用した顔の改善。 ソース
リソースが乏しいユーザーの観点から見ると、これらの解決策の多くは実行可能ではありません。なぜなら、GPUがユーザーのセットアップにないからです。ただし、コンピュータビジョンタスクをCPUで実行することは通常、オフラインプロセスです。つまり、CPUが処理を完了するまで待たなければなりません。
これは、リソースが乏しい動画チャットシナリオでは受け入れられません。なぜなら、リソースが乏しい動画チャットは、リソースを多く消費するものであり、同時にリソースが乏しいものだからです。本当の意味で民主的な顔の改善システムは、少なくとも24fpsのフレームレートで、合理的な解像度でCPUで実行できる必要があります。これは、大きな要求です。
対処
この厳しいシナリオに対処するために、アメリカから新しい研究成果が発表されました。この成果は、著者によると、ユーザーの顔のスパースフレームから100秒以内にモデルをトレーニングでき、最終的なモデルはビデオ会議アプリケーションであるZoomなどの公式APIレイヤーを介して、ユーザーと会議の間に中間層として実行できます。
必要に応じて再生してください。FSFVEプロジェクトページからの、ウェブカムシナリオの顔の改善のサンプル、3.5MBのモデルを2分以内にトレーニングします。ソース
論文では、次のように述べられています。
‘FSFVEモデルは、ビデオ会議の直前または開始時にトレーニングできます。高品質の画像が5〜30枚必要です。ビデオ会議の直前または開始時に、ユーザーの高品質ビデオを数秒間取得できます。たとえば、3秒間で72フレーム(24fps)を取得できます。’
‘この高品質ビデオを低品質ビデオに再エンコードし、低品質フレームと高品質フレームでモデルをトレーニングできます。’
新しいシステムの特徴の1つは、モデルをトレーニングするための処理の柔軟性です。ユーザーがCPUの処理能力を提供できない場合、モデルをトレーニングするための処理を相手にオフロードできます。代わりに、モデルをトレーニングするための処理をサーバーにシステム的にオフロードできます。著者は、次のように述べています。
‘サーバーは、送信と受信デバイスがトレーニングに十分な速度ではない場合(またはそうでない場合でも、タスクから解放するために)使用できます。’
‘どちらの場合でも、モデルのサイズは比較的小さく(約3.5MB)、高品質のフレームも少ないため、トレーニングが完了すると、典型的なラップトップCPUでリアルタイムに実行できます。’
テストでは、FSFVEは、基準となる圧縮ビデオ、CPU最適化されたResNet、RTFVE(唯一のリアルタイムCPU顔強化システム)と比較して、モデルのトレーニングに基づいて一貫して優れており、リアルタイムでCPUで実行されていました。
新しい論文は、FSFVE:少数の圧縮顔映像強化というタイトルで、デモとGitHubリポジトリが付属しています。
方法
FSFVEは、オープンソースのFaceForensics++データセットでトレーニングされました。これは、363本の1080pビデオで構成されており、俳優が話しているシーンです。著者は、壁に向かって話すカテゴリを抽出し、通常のビデオ会議に最も近いスタイルであると判断しました。
必要に応じて再生してください。FaceForensics++データセットの例。 ソース
このサブセットは、972フレームずつの27本のビデオで構成されており、主に前面のビューですが、必要に応じて側面のビューも含まれています。
ビデオ会議の接続問題をシミュレートするために、著者は、H264とH265ビデオコーデックを使用してデータセットを圧縮しました。圧縮レベルは、CRFの範囲で36、40、44に設定されました(0はロスレスで、51は非常にブロッキーです)。
各フレームは、BlazeFace顔検出を使用して、顔の周りの256×256の領域に切り出し、顔のキー点を使用して、目と口の位置を合わせて、アフィン変換(回転、拡大、移動)を適用して、目が水平で、全フレームで同じ位置になるようにしました。
これは、Face Recognitionライブラリを使用して実行されました。
Face Recognition Pythonライブラリを使用した画像からの顔の線条の抽出例。 ソース
モデルは、単一のビデオ会議からの少数のフレームから学習するように設計されているため、トレーニングフレームは可能な限り多くの顔の変化を捉える必要があります。したがって、k-meansクラスタリングを使用しました。
各切り出しと整列されたフレームは、先ほど述べたRTFVE顔エンコーダーを通過して、数値表現を生成し、k-meansクラスタリングによって、類似のフレームが30のクラスタにグループ化されました。このクラスタリングプロセスは5回繰り返され、最良のグループ化を得るために、各クラスタの中心に最も近いフレームが選択されました。このプロセスにより、各ビデオに30の画像が生成されました。
トレーニングとテスト
モデルは、エポックが100回でトレーニングされました。これは、関与する画像の数が非常に少ないことを考えると、比較的低い数です。ただし、著者は、過剰適合モデルは、このシナリオでは実際に望ましいものであると述べています。過剰適合モデルは、すべての可能性を捉えることができないかもしれませんが(たとえば、一般的な顔の表情、姿勢、または顔の特徴の隠蔽)、一般化の適度な柔軟性とトレーニングの速度が優先されます。
トレーニングのために、RAdamオプティマイザが、学習率10-4で使用されました。
初期テストでは、システムは、元の圧縮ビデオ、リアルタイムCPU推論用に構成された軽量ResNet、および先ほど述べたRTFVE(唯一のリアルタイムCPU顔強化システム)と比較されました。
公平な比較を確保するために、RTFVEは、推論中に高品質の参照画像に依存しないように変更され、RTFVE-0というバリアントが生成されました。ResNetとRTFVE-0モデルは、L1損失関数を使用してトレーニングされました。公平な比較を確保するために、すべてのモデルは同じRAdamオプティマイザとトレーニング設定を使用しました。各ビデオごとに、30フレームから個別のインスタンス固有のモデルがトレーニングされました。
トレーニングを高速化するために、最も視覚的に重要な画像の詳細に重点を置くカスタム周波数ドメインの焦点損失が導入されました。これにより、画像の品質に最も影響を与える低周波DCT成分(周波数値への変換後の画像情報)に重みが付けられました。
重みは、JPEGルミナンス量子化行列から導出され、モデルがトレーニング中に最も視覚的に重要な画像構造を優先するようにしました。
定量的テスト
テストでは、技術的再構成精度(歪み)と視覚的品質の両方が測定されました。歪みは、ピーク信号対雑音比(PSNR)と構造類似性指数(SSIM)で測定され、視覚的品質は、学習された視覚的画像パッチ類似度(LPIPS)で測定されました。
H.264とH.265のビデオの3つの圧縮レベルで、FSFVE、元の圧縮ビデオ、CPU最適化されたResNet、変更されたRTFVE-0のパフォーマンス。PSNRとSSIMが高いほど、再構成の品質が高いことを示し、LPIPSが低いほど、視覚的な品質が高いことを示します。
FSFVEは、すべての圧縮レベルで、元の圧縮ビデオと競合するCPUベースの強化モデルを一貫して上回りました。
H.264ビデオでは、CRF値が36、40、44のとき、PSNRはそれぞれ1.11dB、1.37dB、1.51dB向上しました。SSIMとLPIPSのスコアも、2つの高い圧縮設定で改善されました(視覚的な品質が向上したことを示しています)。
同様の改善はH.265でも記録され、主なビデオコーデックの両方でアプローチが有効であることを示しています。以下に示すように、改善は圧縮が増加するにつれてより顕著になり、低帯域幅条件で最も効果的であることを示しています。
ビットレートが増加するにつれて、元のH.264ビデオと強化された出力のPSNR。低ビットレートでのギャップの拡大は、FSFVEが最も厳しい圧縮、帯域幅制限条件で最大の品質向上を実現することを示しています。
CPU最適化されたResNetとRTFVE-0は、圧縮基準に対してわずかな改善しか示しませんでしたが、FSFVEは1.1dB以上の改善を示し、約100万パラメータしか含まないにもかかわらず、30.24fpsのリアルタイムパフォーマンスを維持しました。
以下に示すように、トレーニングフレームの数が増えるにつれて、パフォーマンスは着実に改善しました。5つのトレーニング画像だけで、FSFVEは圧縮基準に対してPSNRを0.75dB以上改善しました。10のトレーニングフレームは、1dB以上の改善に十分でした。これは、アプローチが非常に限られたトレーニングデータで効果的であることを示しています。
CRF 44のH.264ビデオフレームのトレーニングセットサイズの影響。5つのトレーニング画像だけで、圧縮基準に対して品質が向上しました。
定性的テスト
以下の結果は、定性的テストの段階で、CRF 44のH.264ビデオフレームと対応するFSFVE出力を示しています。
CRF 44のH.264ビデオフレームと対応するFSFVE出力の比較。強化された結果は、圧縮アーティファクトを削減し、顔の構造を復元し、より滑らかで自然な肌を生成し、被写体のアイデンティティと表情を保存します。より良い例については、ソースPDFと元のビデオを参照してください。
著者は、圧縮画像には目、鼻、口の周りの顕著なアーティファクト、皮膚の不自然なテクスチャ、顔の特徴の歪みがあると主張していますが、強化された結果はこれらの欠陥を大幅に軽減します。
‘最初の例では、目が不明瞭で、アイメイクの色が目と混ざっています。唇には明らかなアリエーションがあります。眉毛の定義が欠けていて、肌が歪んでいます。2番目の例では、肌は非常にテクスチャー化されており、ノイズのアーティファクトがあります。’
‘口の下にはブロッキングアーティファクトがあり、顎の形を変えます。また、垂直線もあります。’
‘私たちのモデルは、これらのアーティファクトを修正し、視覚的に魅力的な出力を生成し、失われた細かい詳細を一部復元します。’
‘重要なことに、強化された出力は、ビデオのアイデンティティに忠実です。’
結論
業界と学術界が、低信号のビデオチャットデータの品質を向上させるための継続的な努力が、最終的にビデオチャットのディープフェイク映像を検出するための努力と衝突することは避けられないようです。
新しい論文では、FSFVEのような中間システムは、公式のAPIを介してビデオチャットストリームに適用できるため、ディープフェイク対策としての非処理コンテンツが利用可能になる可能性があると述べています。
* 新しい論文では、’DeepFakeDetector’データセットと呼ばれていますが、著者が参照するFaceForensics++論文内ではこの名前で知られていないようです。
2026年7月14日初版












