Andersonの視点
ディープフェイクは現在、感情の繊細さを伝えることができない

昨日の『スター・ウォーズ』スピンオフ『ボバ・フェットの書』の第6話のデビューは、ファンの意見を二分したようです。一般的な承認を受けているものの、ソーシャルネットワークでは、 Industrial Light and Magic がアマチュアのディープフェイク実践者である Shamook を雇用したことにより、若いマーク・ハミルの再現が大幅に改善されたというのが一般的な認識です。さらに、キャラクターのレンダリングはディープフェイク技術と CGI の組み合わせであると考えられています。
しかし、これについては現在まだ限定的な確認しかできていません。Shamook は ILM の契約による NDA が発生して以来、ほとんど発言していません。にもかかわらず、この作品は 2020 年の CGI に比べて大幅な改善であり、ディープフェイクモデルから派生した「輝き」のような特徴を示し、現在のディープフェイクの最良の視覚的な標準と一致しています。
別のファンの意見は、新しい「若いルーク」の試みには、前のものとは異なる一連の欠点があるというものです。たとえば、新しいスカイウォーカー再現を特徴付ける、長いシーケンスにおける表現の欠如と、ディープフェイクよりも CGI に典型的な、繊細で適切な感情の欠如は、最も物語的なものです。The Verge は、『ボバ・フェット』のシミュレーションを「マーク・ハミルの凍った 1983 年の顔の、不気味で空虚な表情」と表現しています。
いずれにせよ、ILM 再現の背後にある技術に関係なく、ディープフェイク変換には、感情の繊細さという基本的な問題があります。これは、アーキテクチャの変更やソーストレーニング材料の改善によって解決するのが難しい問題です。通常、ディープフェイカーがターゲットビデオを選択する際に慎重な選択を行うことで回避されます。
顔の整列の限界
ディープフェイクのオープンソースリポジトリとして最も一般的に使用されているのは、DeepFaceLab (DFL) と FaceSwap です。これらは両方とも、匿名の 2017 年のソースコードから派生しており、DFL は VFX 業界で大きなリードを持っていますが、限られた機関を持っています。
これらのパッケージは、最初に、ソースマテリアル(ビデオのフレームや静止画像)から顔を識別し、顔のランドマークを抽出するように設計されています。

Facial Alignment Network (FAN) が公式リポジトリで動作しています。 ソース: https://github.com/1adrianb/face-alignment
DFL と FaceSwap は両方とも、Facial Alignment Network (FAN) ライブラリを使用します。FAN は、抽出された顔の 2D と 3D ランドマークを作成できます。3D ランドマークは、顔の認識された向きを、極端なプロファイルや比較的急な角度まで、広範囲にわたって考慮することができます。
しかし、これらはピクセルを誘導して評価するための非常に基本的なガイドラインであることは明らかです。

FaceSwap フォーラムからの、顔の線条のランドマークの粗い指標。 ソース: https://forum.faceswap.dev/viewtopic.php?f=25&t=27
基本的な顔の線条については、目が開いたり閉じたりすることができるし、顎も基本的な構成(笑顔、しかめっ面など)をとることができます。顔は、カメラの視点から約 200 度まで、任意の方向に回転することができます。
しかし、それ以降、これらはピクセルの挙動を境界内で制御するための粗いフェンスであり、ディープフェイクプロセス全体で唯一の真正な数学的および正確な顔のガイドラインを表します。トレーニングプロセス自体は、境界内または境界近くにピクセルが配置されている方法を比較するだけです。

DeepFaceLab でのトレーニング。 ソース: https://medium.com/geekculture/realistic-deepfakes-with-deepfacelab-530e90bd29f2
顔のサブパーツのトポロジー(頬の凹凸、老化の詳細、たんこぶなど)については、ソースとターゲットのアイデンティティの間でこれらの「繊細な」サブ特徴を一致させることはできないため、試みることさえできないのです。
限られたデータでやりくりする
2 つのアイデンティティの間でディープフェイクのトレーニングのために一致したデータを取得することは、簡単ではありません。必要な一致を得るために、よりまれな角度を必要とする場合、アイデンティティ A と B の両方で同じ表情を特徴付ける同じ(まれな)角度の一致が実際に存在するかどうかについて妥協する必要があります。

近いですが、完全に一致していません。
上の例では、2 つのアイデンティティは性格においてかなり似ており、これはデータセットが完全に一致することの近いものです。
明らかな違いがあります。角度とレンズは完全に一致せず、照明も一致しません。主題 A は目を完全に閉じていませんが、主題 B は閉じています。画像の品質と圧縮は主題 A で悪く、主題 B は何らか幸せそうに見えます。
しかし、我々にはこれしかないので、トレーニングするしかありません。
この A><B 一致には多くの珍しい要素があるため、このペアに似たペアはセットにほとんどないと確信できます。したがって、トレーニングは、この一致を アンダーフィット または オーバーフィット することになります。
アンダーフィット: この一致が真の少数派(つまり、親データセットがかなり大きく、こうした特徴を持つ写真をほとんど含んでいない)である場合、他の「人気のある」(つまり、簡単/中立的な)ペアリングよりもトレーニング時間が少なくなるでしょう。したがって、この角度/表情は、トレーニング済みモデルでよく表現されません。
オーバーフィット: このようなまれな A><B 一致のデータが乏しい場合、ディープフェイカーは、このペアをデータセットに複数回複製することがあります。そうすることで、モデルでこの特徴が表現される可能性が高くなります。ただし、オーバーフィットにつながり、モデルで作成されたディープフェイク動画は、2 つの写真間の不一致(たとえば、目を閉じる程度の差)を繰り返し表現する可能性があります。
上の画像では、Vladimir Putin が DeepFaceLab で Kevin Spacey に置き換えられ、トレーニングが比較的進んでいます (160,000 回のイテレーション です)。

ソース: https://i.imgur.com/OdXHLhU.jpg
あるオンラインの感情認識プログラムは、テストスワップでの表情の不一致についてどう考えているのでしょうか。
この特定のプログラムによると、Spacey は、結果として得られる Putin ディープフェイクよりも 怒り、嫌悪、軽蔑 が少ないと分析されています。
不均衡な表情は、ディープフェイクアプリケーションが表情や感情を認識したり一致させたりする能力がないことの結果です。ただし、生のピクセルからピクセルへのマッピングとしては、たとえそれが暗黙的であっても、ディープフェイク FOSS ソフトウェアではこれが提供されるだけです。
私たちにとっては、差は大きいです。私たちは、社会的統合、交際、脅威評価フレームワークとしての基本的な生存テクニックとして、幼少期から表情を読むことを学び、成長してからもこれらのスキルに依存しています。ディープフェイク技術は、最終的にはこれを考慮する必要があります。
逆らう
ディープフェイク革命は、「クラシック」の映画スターを現代の映画やテレビに挿入するという約束をもたらしましたが、AI は時間を遡って、映画の古典作品をより互換性のある解像度と品質で撮影することはできません。これは、このユースケースに不可欠です。
仮に『ボバ・フェット』のハミル再現が、トレーニング済みディープフェイクモデルによって行われたと仮定すると (これが正しいかどうかは重要ではありません)、モデル用のデータセットは、ショーのタイムラインに近い時期のハミルの映像 (『ジェダイの復讐』の制作期間、1981-83 年) を活用する必要があります。
映画は Eastman Color Negative 250T 5293/7293 ストック で撮影されました。これは、当時としては中から細かいグレインのエミュルションでしたが、1980 年代末までにすでに明らかにクリアさ、色域、忠実度で上回られていました。このストックはその時代のものであり、ジェダイ の壮大なスケールにもかかわらず、主演俳優にはほとんどクローズアップがありませんでした。グレインの問題は、フレームの一部しか占めていない顔の場合、さらに重要になります。

『ジェダイの復讐』(1983) のハミルの一連のシーン。
さらに、ハミルを特集した VFX が豊富な映像は、フィルムグレインを増加させるオプティカルプリンターを通過しました。ただし、ルーカスフィルムアーカイブへのアクセス – これはマスターネガティブの良い管理と、未使用の生映像の数時間を提供することができます – はこの問題を解決することができます。
時折、俳優の出演作品の範囲をカバーすることで、ディープフェイクのデータセットを増やし、多様化させることができます。ハミルの場合、ディープフェイカーは、1977 年の自動車事故による彼の外見の変化と、すぐに『ジェダイ』の後に声優としての第二のキャリアを始めたことによって、ソースマテリアルが比較的少ないという点で困難に直面しています。
感情の限られた範囲?
ディープフェイクされた俳優がシーンを食い荒らす必要がある場合、ソース映像には、顔の表情の非常に広い範囲が必要です。利用可能な唯一の時代適切な映像には、必ずしもそのような表情が含まれているとは限りません。
たとえば、ジェダイの復讐 の物語のアークが到来したとき、ハミルのキャラクターは基本的に感情を制御していたため、これはオリジナルのフランチャイズ神話の中央で絶対必要な発展でした。したがって、ジェダイ のデータからハミルのディープフェイクモデルを作成した場合、その時点での役割のために彼が要求されたより限られた感情の範囲と、比較的まれな顔の構成で作業することになります。
『ジェダイの復讐』には、スカイウォーカーがストレスを受けているシーンがあり、より広い表情の範囲を提供する可能性があるかもしれませんが、顔の素材はこれらのシーンでも一時的であり、通常、アクションシーンで見られるモーションブラーと高速編集の影響を受けています。したがって、データはかなり不均衡です。
一般化:感情の統合
『ボバ・フェット』のスカイウォーカー再現が実際にディープフェイクである場合、ある方面からの批判を受けた、表現の範囲の欠如は、限られたソースマテリアルに完全に起因するものではありません。ディープフェイクのエンコーダー・デコーダーのトレーニングプロセスは、数千の画像から中心的な特徴を抽出する 一般化 モデルを探しています。少なくとも、データセットに欠けている角度を 試みる ことができます。
これがなければ、ディープフェイクアーキテクチャは、フレームごとにベースモーフをコピーして貼り付けただけで、時間的適応やコンテキストを考慮しません。
しかし、柔軟性の痛ましい代償は、表情の忠実度がプロセスの犠牲となる可能性が高いことです。表現される 「繊細な」 表情は、正しいものではないかもしれません。私たちは皆、100 人のオーケストラのように顔を演奏し、それを実行するために十分に装備されています。一方、ディープフェイクソフトウェアは、少なくとも弦楽セクションが欠けていると主張できます。
表情の影響の不均衡
顔の動きとそれが私たちに与える影響は、すべての顔に対して均一な言語ではありません。ロジャー・ムーアの顔にある、上げた眉が無邪気に見えるかもしれませんが、セス・ローガンの顔ではそうは見えません。マリリン・モンローが持つ誘惑的な魅力は、ディープフェイクによって、最もデータが利用可能な役割が「怒り」または「不満」である人物(たとえば、7 シーズンの『パークス・アンド・レクリエーション』のオードリー・プラザのキャラクター)にディープフェイクされた場合、より否定的な感情に翻訳される可能性があります。
したがって、A/B の顔セット間のピクセルごとの等価性は、この点では役に立たないでしょう。ただし、現在のディープフェイク FOSS ソフトウェアでは、これが提供されるだけです。
何が必要なのでしょうか。表情や感情を認識し、抽象的な概念である 怒り、誘惑、退屈、疲れ などを体現し、各顔のアイデンティティセットでこれらの感情と関連する表情を分類する能力を持つディープフェイクフレームワークが必要です。ただし、口や瞼の配置を検査または複製するのではなく、それらを検査または複製するのではなく。
最初に公開:2022 年 2 月 3 日。7:47pm EET に更新。名前の属性が間違っていました。













