Andersonの視点

コンセプト・エンタングルメントが意味すること:あなたのやり方でAIビデオを作ることはできない

mm
Unite.AI を Google の優先ソースに追加
AI-generated image (GPT-1.5) depicting a man trying to fit disparate Legos together.

AIビデオツールは完全な制御を約束していますが、隠れた「コンセプト・エンタングルメント」はアイデンティティ、表情、行動をまとめて結び付け、ユーザーはハックやテンプレート・トリックに頼らざるを得ない状況に追い込まれ、GenAIの魔法の神話が破壊されることになります。

 

意見 私がこのテーマについて最後に深く扱ったのは5年前でしたが、訓練されたAIシステムにおける「コンセプト・エンタングルメント」の問題は、より広い範囲のユーザーに広がりましたが、その本質についてはあまり理解されていません。

当時、オートエンコーダーのディープフェイク・システム(すでに廃止されたDeepFaceLabや、よりポルノに依存しないFaceSwapなど)が、比較的フォトリアルな人のディープフェイクを作成するための唯一の手段でした。これらのシステムは、アイデンティティについての情報をAIモデルに提供するために、広範な顔のトレーニング・データセットに依存していました。

これらのデータセットは、A)人が静的な状態(典型的な参照埋め込み)でどう見えるか、B)顔が反映できるさまざまな状況(眠りから笑い恐怖退屈シニカル悲しみなど)についての情報を提供することを目的としていました。

アイデンティティは単独で現れるのではなく、顔の表情とともに現れる。また、特定の感情は特定の角度からしか顔のデータが利用できない場合があり、角度と感情が関連付けられることになります。

アイデンティティは単独で現れるのではなく、顔の表情とともに現れる。また、特定の感情は特定の角度からしか顔のデータが利用できない場合があり、角度と感情が関連付けられることになります。

問題は、典型的なアイデンティティは中立的な状態で撮影された顔の画像から推測される必要があり、データセットのほとんどが中立的な状態で撮影された顔の画像ではなく、赤カーペットのパパラッチの写真で構成されているため、分布が「笑顔のデフォルト」に偏ることになりました。

言い換えると、オートエンコーダー・システムは、通常の顔の表情で歪んだ数千の画像から「中立的な」アイデンティティ・コンセプトを抽出する必要がありました。

前向きに

拡散ベースのアプローチが2022年からGen AI画像(そして後にビデオ)シーンを支配し始めると、生成システムは限られた顔のデータを与えられたときに正確な顔の表情を外挿する能力が大幅に向上しました。

現在の最先端技術では、課題である横顔の作成もほぼ克服されています。一方、表情データはアイデンティティから効果的に切り離されています。オートエンコーダー駆動のDeepFaceLiveストリーミング・システムによって先駆されたライブ・ディープフェイク・パペティングは、オフラインでの拡散アプリケーションが多数あり、リアルタイムの演技は将来の開発の可能性があります。

再生するにはクリックしてください。 FlashPortraitプロジェクトから、ソースビデオを介してアバターを駆動するさまざまな例。ここでは、どちらの「リアルな」ドメインがどちらに位置するかは重要ではありません。 ソース 

しかし、GenAIのキャンバスが広がり、出力がより洗練されると、エンタングルメントの問題は単に他の多くの領域に広がっただけで、現在はかなり古いトリックで「修正」されています。如果あなたがそのトリックを知らないなら、あなたはAIビデオや画像がどれほど速く進化し、古い問題を克服しているかについてより楽観的な見方を持っているかもしれません。

おしゃべりな猫

2017年の古いオートエンコーダー・システムでアイデンティティと感情を区別するのが難しかった理由が明らかです。それは、A)ある種類のデータが多すぎる、またはB)モデル・アーキテクチャがこれらの特性を区別するタスクに適していない、または両方だったからです。ユーザーがデータセットのバランスを保つために特別な注意を払わない限り、モデルはこれらの特性を「まとめて」結び付ける傾向がありました。

過去数年間で、オープンソースおよびプロプライエタリのビデオ・モデルで同様の問題が発生していますが、ハルシネーション検閲の欠如、およびその他のトピックに関する批判の波に埋もれています。

たとえば、Wan2.+システムでは、多くのユーザーが生成されたキャラクターが絶え間なく話し続けることや、カメラを見つめることを止めるのが非常に難しいと感じています。

後者の問題(カメラを見つめる、または第四の壁を破る)は、画像のみの拡散システムで既に発生していたもので、LAIONなどのWebスクレイピング・データセットに「カメラを見つめる」写真が豊富にあるためです。

「おしゃべりな」キャラクターの問題は、ユーチューブの「インフルエンサー」ビデオの豊富さから生じています。これらは自然に、カメラの前で話す数千時間の映像を提供し、カーセットに整理され、研究者がウェブ・スクレイピングを学術的な文脈で「洗浄」することができます。

ただし、元のまたは後のキュレーターが、インフルエンサー・ビデオの数を制限し、他のタイプの映像とバランスを保つようにしない限り、ビデオ・モデルに重大な偏りが生じ、プロンプトベースの解決策やサードパーティのシステムが必要になります。

Wanの「おしゃべりな」問題に直面したRedditユーザーu/Several-Estimate-681は、ワークアラウンドを思いつきました。これは、Infinite Talk V2Vシステムの設定を利用します。このフレームワークは、インフルエンサー風の饒舌さを奨励するように設計されていますが、レンダリングされたキャラクターを沈黙させることができます。

再生するにはクリックしてください。 ただし 聞いてみて – ワン2.+でキャラクターの注意を引くためのワークアラウンド。 ソース 

明らかに、このようなショートカットは、低レベルのアーキテクチャ的な解決策を表すものではなく、基礎モデルの作者によって真の解決策が見つかり、実装されるまで、エンタングルメントの「むち打ち」ゲームは、次のバージョンのリリース時に「ゼロ」にリセットされる可能性があります。

安価で脆い

拡散アーキテクチャ自体に、これらの問題が避けられないということはありません。実際、もし何らかの方法で、ハイパースケール・データセットに効果的なキュレーション、トリアージ、ハイ・クオリティのキャプション付けと注釈を適用することができれば、これらの問題のほとんどは消滅するでしょう。

しかし、そのようなレベルの詳細さは、ロジスティクス、範囲、必要なリソース、そして長期的な努力の点でマンハッタン・プロジェクトに匹敵するでしょう。在り得ないほど新しいアーキテクチャ、またはアーキテクチャの新しいバージョンがそのような努力の全容を覆い隠す可能性がある現在の気候では、そのようなコミットメントをする意志はありません。

したがって、使用可能なモデルを取得することと一致する限り、最も安価なアプローチが優先されます。そうした「けちけちした」アプローチの1つは、データ増強です。これは、不適切に、または不適切なデータセットのビデオクリップに適用されると、面白い結果になることがあります。

データ増強は、ソースビデオの方向を逆にすることが多いため、AIモデルは「不可能な」動きを学習することがあります。 ソース

しかし、総合的には、岩が丘を上ることや、人々が「インフルエンサー・モード」をオンにしてキャラクターを崩壊させることは、不思議な結果とアキレス腱と見なされ、Generativeシステムはこれらの欠陥や弱点にもかかわらず、印象的な結果を生み出し、十分に感銘的な見出しの文章を生み出すことができます。

定型文の解決策

現在、数百のGenerativeビデオ・ドメインがあり、そのほとんどが、GenAIに対する新しい法律やバックラッシュを破りながら、法律の執行、ブロックリスト、またはプラットフォームからの排除によってこれらの商業サービスが削除されるまで、繁栄しています。

このような性質のより大きな、よりよく知られたサイト、たとえばKlingやGrokは、最終的にはある種の自主規制に従うか、批判に応じてユーザーが利用できるコンテンツの種類を変更します。

しかし、これらの大手サイトの後ろには、常に新しい、そして往々にして極端なコンテンツの需要に応える、数百のフライ・バイ・ナイト・オペレーションがあります。

このような低コストの提供は、基礎モデルのトレーニングから始めることの非常に高いコストと労力を除外します。さらに、ファインチューニングは、基礎モデルのトレーニングよりもはるかに安価ですが、多くの場合、これも除外されます。

したがって、これらのサイトは「テンプレート」を提供します。これは、実践では、基礎モデルの間に配置されるカスタム・トレーニング済みのLoRAsとまったく同じように動作します。LoRAsは、AIの趣味家によって、アイデンティティ、スタイル、オブジェクト、そして(ビデオのLoRAsの場合)動きやアクションを、専用のLoRAアクセサリにトレーニングするために、すでに4年以上使用されています。

LoRAがユーザーと基礎モデルの間に配置されると、結果はLoRAがトレーニングされたものに特有のものになり、基礎モデルの全体的なパフォーマンスはLoRAの重み付けの影響によって損なわれ、LoRAは自身の主題を非常にうまく再現しますが、どのようなリクエストに対してもそれを再現します(フライ・バイ・ナイトのGenAIビデオ・サイトがこのレベルの制御を許可する場合ですが、許可しません。ただし、アクションテンプレートを提供し、入力テキスト/画像/ビデオを最も成功したテンプレートの適用につながる方法で解釈します)。

明らかに、研究文献には類似の例があります。ここでは、EffectMakerプロジェクトが、ユーザーが提供した画像に特定のアクションを適用する原理を示しています。

再生するにはクリックしてください。 EffectMakerでは、カスタム入力にファインチューンされた特定のエフェクトを適用できます。 ソース 

これらの高度にキュレーションされた状況でも、ユーザーは、良い結果を得るために、トークンを消費する試みを何度も行う必要があると主張し、提供者がけちで、不正行為をしているのではないかと推測するかもしれませんが、むしろ、DiT GenAIフレームワークの固有の「当てずっぽう」性質のせいである可能性があります。

より広い公衆は、GenAIの能力について、代表的なものではない、選別された例からその印象を得ています。ユーザーがテンプレート(LoRAを提供するAIウェブサイト)に6回挑戦し、最も良い結果を公開して賞賛する場合、基礎モデルのクエリだけでそのような結果が得られるという印象を与え、生成基礎モデルの実際よりもはるかに解離されていると考えさせます。

結論

文学では、2020年頃に初めて深刻に浮かび上がったエンタングルメントの問題が、マックス・プランク/Googleの共同研究 教師なし学習による解離表現の厳粛な検討とその評価で検討されています。

さらに、Disentanglement via ContrastDisCo)の後継者が時折登場し、エンタングルメントの問題に対する認識は、GenAIができないことについての一般の認識をはるかに上回っています。

2024年の中国の研究によると、エンタングルメントを解決する必要はなく、エンタングルメントによって引き起こされる問題を解決することができるかもしれません。歴史的に見ると、これは真実です。コンピュータビジョンの多くの難解な問題は、解決されるのではなく、新しい技術とアプローチによって克服されてきたからです。

新しい、離散的な対抗馬が現れるまで、GenAIの欠点や限界に対する暫定的な解決策や絆創膏を適用し続け、基礎モデルの柔軟性や延展性の一般の過大評価に耐える必要があるようです。

 

2026年3月23日(月曜日)に初めて公開されました

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai