Andersonの視点

生成的なビデオシステムが完全な映画を作成できない理由

mm
Unite.AI を Google の優先ソースに追加
'a gorgeous illustration of a robot operating a professional movie camera' - ChatGPT Plus, Sept 2024

生成的なAIビデオの出現と進歩により、多くの観客が、機械学習が映画業界の死をもたらすと予測している。代わりに、単一のクリエイターが、ローカルまたはクラウドベースのGPUシステムで、ハリウッドスタイルのブロックバスター映画を作成できるようになるだろう。

これは可能か?それとも、多くの人が信じているように、間もなく実現する可能性があるのか?

個人が、現在知られている形式で、一貫したキャラクター、物語の連続性、完全な写実性を持つ映画を作成できる可能性はある。もしかしたら、それは避けられないことかもしれない。

しかし、潜在的な問題は、生成的なビデオシステムが、現在の技術の限界により、完全な映画を作成できないということである。

これは、現在利用可能なすべてのテキストからビデオ(T2)および画像からビデオ(I2V)システム、包括してMinimax、Kling、Sora、Imagen、Luma、Amazon Video Generator、Runway ML、Kaiber(および、Adobe Fireflyの予定されているビデオ機能を含む)に当てはまる。

ここでは、個人が作成した、真の『オートール』フルレングスジェンAI作品、 一貫したキャラクター、撮影、視覚効果を含む、現在のハリウッドの技術水準と同等のものについて考えてみよう。

1:正確なフォローショットを取得できない

物語の不一致は、これらの障害の中で最も大きいものである。事実は、現在利用可能なビデオ生成システムは、真正に正確な「フォローショット」を生成できない。

これは、生成システムの核となるデノイジング拡散モデルが、ランダムなノイズに依存しており、この基本原理は、同じコンテンツを2回解釈することに適していない(例えば、異なる角度から、または前のショットを開発して、前のショットと一貫性を維持するフォローショットに)。

テキストプロンプトが使用される場合、単独またはアップロードされた「シード」画像(マルチモーダル入力)とともに、プロンプトから得られるトークンは、トレーニングされたモデルの潜在的な空間から、意味的に適切なコンテンツを生成する。

しかし、さらに、「ランダムなノイズ」の要因によって妨げられ、同じことを2回行うことはできない。

これは、ビデオ内の人物のアイデンティティが変化し、オブジェクトや環境が初期ショットと一致しないことを意味する。

これは、非凡な視覚効果やハリウッドレベルの出力を持つウイルスクリップが、単一ショットまたはシステムの機能を紹介する「ショーケースモンタージュ」であることが多い理由である。

Marco van Hylckama Vliegによる生成的なAIモンタージュの抜粋 – ソース:https://www.linkedin.com/posts/marcovhv_thanks-to-generative-ai-we-are-all-filmmakers-activity-7240024800906076160-nEXZ/

これらのコレクションにある《アドホック》ビデオ生成(商業システムの場合、不誠実である可能性がある)は、基礎となるシステムが連続した物語を生成できることを示唆している。

ここでの類推は、映画の予告編であり、映画から1〜2分の映像のみを紹介するが、観客に全映画が存在することを信じさせるものである。

現在、物語の連続性を提供する唯一のシステムは、静止画像を生成するものである。これには、NVIDIAのConsiStoryや、TheaterGen、DreamStory、StoryDiffusionなどの科学文献のプロジェクトが含まれる。

最近のモデルからの「静的な」物語の連続性の2つの例:ソース:https://research.nvidia.com/labs/par/consistory/およびhttps://arxiv.org/pdf/2405.01434

最近のモデルからの「静的な」物語の連続性の2つの例:ソース:https://research.nvidia.com/labs/par/consistory/およびhttps://arxiv.org/pdf/2405.01434

理論的には、より優れたバージョンのこのようなシステム(上記のどれも真正に一貫性があるわけではない)を使用して、画像からビデオのショットのシリーズを作成し、それらをシーケンスに結合することができる。

しかし、現在の技術の状態では、このアプローチでは妥当なフォローショットを生成できない。また、既に《オートール》の夢から離れて、複雑さの層を追加した。

さらに、特定のキャラクター、物体、環境に特化したLow Rank Adaptation(LoRA)モデルを使用して、ショット間の一貫性を維持することができる。

しかし、キャラクターが新しいコスチュームを着たい場合、通常、キャラクターをその服装で表現するために、まったく新しいLoRAをトレーニングする必要がある(サブコンセプトとして「赤いドレス」などの個々のLoRAをトレーニングすることは可能だが、常に簡単に機能するわけではない)。

これは、複雑さを追加することになる。映画のオープニングシーンでは、人物がベッドから出て、ドレスを着て、伸び、ベッドルームの窓を見て、歯を磨くために浴室に行く。そうしたシーンは、従来の映画制作手法で朝の1時間で撮影できるが、現在の生成的なAIの技術では、数週間の作業、複数のトレーニング済みLoRA(または他の付随システム)、および多大な量のポストプロダクションが必要となる。

代わりに、ビデオからビデオを使用することができる。例えば、Runwayは、このようなシステムを提供している。

CGI(左)からBlender、Mathieu VisnjevecによるRunwayビデオからビデオの実験 – ソース:https://www.linkedin.com/feed/update/urn:li:activity:7240525965309726721/

ここには2つの問題がある。まず、既にコアフッテージを作成しているので、すでに映画を作成していることになる。さらに、CGIモデル(上のクリップのように)を使用してビデオから画像への変換を行うと、ショット間の一貫性が保証されない。

これは、ビデオ拡散モデルが「大きな絵」を見ることができない。代わりに、前のフレームに基づいて新しいフレームを作成し、いくつかの ケースでは、近い将来のフレームを考慮するが、将来10手先や過去10手を考えることはできない。

2番目に、拡散モデルは、複数のLoRAを含めても、ショット間の一貫した外観を維持するのに苦労する。これは、最初に説明した理由によるものである。

2:ショットを簡単に編集できない

古典的なCGI方法で、キャラクターが通りを歩くシーンを表現し、ショットの何らかの側面を変更したい場合は、モデルを調整して再レンダリングすることができる。

実写の場合、シーンをリセットして、適切な変更を加えて再度撮影することができる。

しかし、生成されたAIビデオショットが好きだが、1つの側面を変更したい場合は、過去30〜40年間に開発された痛みを伴うポストプロダクション方法でしか実現できない。

拡散モデルがどのように機能するかというと、テキストプロンプトの1つの側面を変更するだけで、生成された出力の複数の側面が変更されるため、プロンプトの「たたき上げゲーム」になる。

3:物理学の法則に頼ることができない

従来のCGI方法では、流体力学、ガス運動、逆運動学(人間の動きの正確なモデリング)、布の動き、爆発、さまざまな現実世界の現象をシミュレートするための、さまざまなアルゴリズムベースの物理ベースのモデルが提供される。

しかし、拡散ベースの方法は、短い記憶と、トレーニングデータセットに含まれるアクションの例(モーション先行)が限られているため、これらの現象をシミュレートするのに苦労する。

OpenAIのSora生成システムの古いバージョンのランディングページでは、会社は、Soraにはこの点で制限があることを認めた(ただし、テキストは以前に削除された)。

‘[Sora]は、複雑なシーンの物理をシミュレートするのに苦労し、特定の原因と結果のインスタンス(例えば、キャラクターがクッキーを齧った後にクッキーにマークが付いていない)を理解できない。

‘モデルは、プロンプトに含まれる空間の詳細を混同し、時間の経過とともに発展する特定のイベント(特定のカメラの軌道など)の正確な説明に苦労する。 ‘

さまざまなAPIベースの生成ビデオシステムの実用的な使用では、物理を正確に表現する際の同様の制限が明らかになる。ただし、爆発などの特定の物理現象は、トレーニングデータセットに優先的に含まれているため、よりよく表現される。

モーション先行埋め込みは、生成モデルにトレーニングされたものや、ソースビデオからフィードされたものがあり、複雑で繰り返されないダンスシーケンス(例えば、複雑な衣装を着た人物)の場合、完了するまでに時間がかかる。ただし、拡散モデルの近視的な注意のウィンドウにより、コンテンツ(顔ID、衣装の詳細など)が変化する可能性がある。

ただし、LoRAはこれをある程度緩和することができる。

ポストプロダクションで修正する

純粋な「単一ユーザー」AIビデオ生成には、急速な動きを表現する際の難しさや、出力ビデオの時間的一貫性を取得する一般的でより深刻な問題などの他の限界がある。

さらに、生成的なビデオでは、特定の顔のパフォーマンスを作成することはほぼ運頼みであり、会話のための唇の同期も同様である。

これらの場合、LivePortraitやAnimateDiffなどの付随システムの使用がVFXコミュニティで非常に人気がある。これにより、少なくとも広い顔の表情や会話の同期を既存の生成出力に転送することができる。

LivePortraitを使用して、ターゲットビデオに表情を転送する例。ビデオはGenerative Z TunisiaGenerativeから。より高品質のフルバージョンは、https://www.linkedin.com/posts/genz-tunisia_digitalcreation-liveportrait-aianimation-activity-7240776811737972736-uxiB/?で利用可能

さらに、Stable Diffusion GUIのComfyUIやプロフェッショナルなコンポジットおよび操作アプリケーションのNukeなどのツールを組み込む複雑なソリューションは、AI VFXプラクティショナーが顔の表情や性格をより大きな制御下に置くことを可能にする。

VFXプロフェッショナルであるFrancisco Contrerasは、ComfyUIでの顔のアニメーションプロセスを「拷問」と表現しているが、唇のフォネームや頭部の表現などの顔の特徴を押し付けるプロセスを開発している。

Stable Diffusion、Nukeを使用したComfyUIワークフローにより、VFXプロフェッショナルであるFrancisco Contrerasが顔の特徴を制御することができた。フルビデオは、https://www.linkedin.com/feed/update/urn:li:activity:7243056650012495872/で利用可能

結論

これらは、単一のユーザーが、現実的な会話、唇の同期、パフォーマンス、環境、連続性を持つ、妥当で写実的なブロックバスター映画スタイルのフルレングス映画を生成するという前景にとって、希望を与えない。

さらに、ここで説明した障害、特に拡散ベースの生成ビデオモデルに関しては、すぐに解決できるものではなく、基本的にアーキテクチャに内在する制限である。

AI合成研究、科学研究全般において、時折、輝かしいアイデアが現れ、多大な可能性をもたらすが、さらに研究が進むと、その根本的な限界が明らかになる。

生成/合成の分野では、これはすでに、生成的な敵対的ネットワーク(GAN)やニューラル放射場(NeRF)で発生しており、どちらも、商業システムへの実用化が非常に難しいことが明らかになった。現在、これらのテクノロジーは、代替アーキテクチャの付随コンポーネントとして最も頻繁に現れる。

映画スタジオは、正当にライセンスされた映画カタログでトレーニングすることで、VFXアーティストやストーリーボードアーティストを排除できるのではないかと希望しているかもしれないが、AIは現在、実際には仕事を増やしている。

拡散ベースのビデオシステムが、真正に物語的一貫性と写実性を持つ映画生成器に変換できるか、または全体が別の錬金術的追求であるかが、次の12か月で明らかになるだろう。

新しいアプローチが必要なのか、または1990年代初頭に開発され、最近画像合成の分野で注目されたGaussian Splatting(GSplat)が、拡散ベースのビデオ生成の代替手段を表すのかはわからない。

GSplatが注目されるまでに34年かかったため、NeRFやGAN、潜在的な拡散モデルなど、古い候補者がまだその日を待っている可能性もある。

* KaiberのAIストーリーボード機能は、このような機能を提供するが、私が見た結果は、商業品質ではない

Martin Andersonは、metaphysic.aiの元科学研究コンテンツ責任者です。
2024年9月23日初版

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:[email protected]