Andersonの視点
ビデオでの顔の変形にマシンラーニングを適用する

中国とイギリスの研究者間の共同研究により、ビデオでの顔の変形の新しい手法が開発されました。この技術により、顔の構造の幅や狭さをリアルに変形させることができ、制限やアーティファクトが少なく、高い一貫性を実現しています。

YouTubeのビデオから使用された画像をもとに、女優ジェニファー・ローレンスがよりスリムな容貌で登場します(右)。記事の最後に埋め込まれたビデオを参照してください。 Source: https://www.youtube.com/watch?v=tA2BxvrKvjE
このような変形は、通常、詳細なモーションキャプチャ、リギング、テクスチャリング手順を必要とする従来のCGI手法でしか実現できません。
代わりに、この技術では、ニューラルパイプラインにパラメトリック3D顔情報を統合し、機械学習ワークフローとして使用します。

従来のパラメトリック顔は、AIではなくCGIを使用する変換プロセスのガイドラインとして使用されることが増えています。 Source: https://arxiv.org/pdf/2205.02538.pdf
著者は次のように述べています:
‘私たちの目標は、自然な顔の変形に基づいて、高品質のポートレートビデオを生成することです。これは、美容のための顔の生成や視覚効果のための顔の誇張などのアプリケーションに使用できます。’
2Dの顔の歪みや変形は、Photoshopの登場以来、消費者に利用可能でしたが(これにより、奇妙でしばしば受け入れられないサブカルチャーが生まれました)、ビデオではCGIを使用せずにこれを実現することは難しいです。

マーク・ザッカーバーグの顔の寸法を拡大・縮小する中国・英国共同の新しい技術。
現在、コンピュータビジョンの分野では、ボディのリシェイピングが大きな関心事です。特に、ファッションECでの潜在的な応用がありますが、誰かを背の高い人や骨の細い人に見せることは、現在の大きな課題です。
同様に、ビデオの頭の形を一貫性とリアル性を持って変化させることは、以前から研究されてきましたが、以前の実装ではアーティファクトやその他の制限がありました。新しいシステムは、静的な画像からビデオへの出力を拡張しています。
新しいシステムは、AMD Ryzen 9 3950Xプロセッサと32GBのメモリを搭載したデスクトップPCでトレーニングされ、OpenCVの光流アルゴリズムを使用してモーションマップを作成し、StructureFlowフレームワークでスムーズ化しています。さらに、Facial Alignment Network(FAN)コンポーネントを使用してランドマークを推定し、Ceres Solverを使用して最適化の課題を解決しています。

新しいシステムでの顔の広がりの極端な例。
論文は、Parametric Reshaping of Portraits in Videosというタイトルで、浙江大学の3人とバース大学の1人の研究者によって執筆されています。
顔について
新しいシステムでは、ビデオは画像シーケンスに抽出され、各顔の剛体ポーズが最初に推定されます。次に、代表的なフレーム数が共同で推定され、画像の全シーケンス(つまりビデオのフレーム)に沿った一貫したアイデンティティパラメータを構築します。

顔の歪みアーキテクチャのフロー。
次に、表情が評価され、リニア回帰によって実装される変形パラメータが得られます。次に、独自の符号付き距離関数(SDF)アプローチによって、顔の線条の密な2Dマッピングが、変形前と変形後に構築されます。
最後に、出力ビデオに対してコンテンツ認識型の歪み最適化が実行されます。
パラメトリック顔
このプロセスでは、3Dモーファブル顔モデル(3DMM)を使用します。これは、ニューラルやGANベースの顔合成システムの補助として人気があり、ディープフェイク検出システムにも適用可能です。

3Dモーファブル顔モデル(3DMM)の例。上左:ランドマークの適用。上右:3Dメッシュの頂点。下左:ランドマークのフィッティング。下中央:テクスチャのアイソマップ。下右:フィッティングと形状。 Source: http://www.ee.surrey.ac.uk/CVSSP/Publications/papers/Huber-VISAPP-2016.pdf
このワークフローでは、被写体が顔をそむけたときのような遮蔽のケースを考慮する必要があります。これはディープフェイクソフトウェアの大きな課題です。FANのランドマークはこれらのケースを考慮する能力が低く、顔がそむけられると品質が低下します。
新しいシステムは、3D顔(3DMM)と2D顔(FANランドマークで定義)との境界を一致させることができるコンテアエネルギーを定義することで、この落とし穴を避けることができます。
最適化
このシステムの有用な展開例としては、ビデオチャットフィルタでのリアルタイム変形があります。現在のフレームワークではこれを実現できません。必要な計算リソースは、たとえば「ライブ」変形を実現する上で大きな課題となります。
論文によると、24fpsのビデオを対象とし、パイプライン内のフレームごとの操作は、各秒の映像に対して16.344秒の待ち時間を表します。さらに、アイデンティティ推定と3D顔変形にはそれぞれ321msと160msの初期ヒットがあります。
したがって、待ち時間を短縮するために最適化は重要です。すべてのフレームに対するジョイント最適化はプロセスに大きなオーバーヘッドを加えるため、初期最適化(最初のフレームからの一貫したアイデンティティを前提とする)は異常を引き起こす可能性があるため、著者らは実用的な間隔でサンプリングされたフレームのサブセットの係数を計算するためのスパーススキーマを採用しています。
このサブセットのフレームに対してジョイント最適化を実行し、よりスリムなプロセスを実現します。
顔の歪み
このプロジェクトで使用される歪み技術は、著者らの2020年の研究Deep Shapely Portraits(DSP)の改良版です。

ACMマルチメディアへの2020年の提出物、Deep Shapely Portraits。ZJU-Tencent Game and Intelligent Graphics Innovation Technology Joint Labの研究者が主導しています。 Source: http://www.cad.zju.edu.cn/home/jin/mm2020/demo.mp4
著者らは次のように述べています:‘私たちは、この方法を1つのモノラル画像の変形から画像シーケンスの変形に拡張しました。’
テスト
論文では、比較可能な以前の研究がなかったため、新しい方法と静的なDSP出力のフレームを比較しました。

新しいシステムを静的なDeep Shapely Portraits画像と比較するテスト。
著者らは、DSP法では、スパースマッピングの使用によりアーティファクトが生じることを指摘しています。一方、新しいフレームワークでは密なマッピングによりこの問題を解決しています。さらに、DSPによって生成されたビデオは、スムーズ性と視覚的一貫性が欠けていることを論文は主張しています。
著者らは次のように述べています:
‘結果は、私たちのアプローチがロバストに整合性のある変形ポートレートビデオを生成できることを示しています。一方、画像ベースの方法は目立つフリッカリングアーティファクトにつながりやすい。’
さらに多くの例を参照するには、以下のビデオをご覧ください:
2022年5月9日に初めて公開され、EET午後6時に修正され、SDFの「フィールド」を「関数」に置き換えました。












