Andersonの視点

ハニーユンビデオディープフェイクの台頭

mm
Unite.AI を Google の優先ソースに追加
An Arnie Hunyuan Video LoRA demonstrated by Bob Doyle, on ComfyUI, on YouTube (https://www.youtube.com/watch?v=1D7B9g9rY68) – and, inset right, grabs from various sample videos for the same LoRA at Civit.ai

ここで議論されている一部の資料の性質により、この記事には通常よりも参考リンクや図が少なくなります。

現在、AI合成コミュニティで注目すべきことが起こっていますが、その重要性はしばらくしてから明らかになるかもしれません。愛好家たちは、ビデオベースのLoRAsを使用して、テンセントの最近リリースされたオープンソースHunyuan Videoフレームワークで、人のような似た人を再現するための生成AIビデオモデルをトレーニングしています。

クリックして再生ハニーユンベースのLoRAカスタマイズの多様な結果は、Civitコミュニティで無料で入手できます。低ランク適応モデル(LoRAs)をトレーニングすることで、AIビデオ生成に2年間悩まされてきた一時的な安定性の問題が大幅に軽減されます。 ソース:civit.ai

上記のビデオでは、女優のナタリー・ポートマン、クリスティナ・ヘンドリックス、スカーレット・ジョハンソン、そしてテックリーダーのイーロン・マスクの姿が、ハニーユン生成ビデオシステム用の比較的小さな追加ファイルにトレーニングされています。このシステムは、コンテンツフィルタ(NSFWフィルタなど)なしでユーザーのコンピューターにインストールできます。

上記のクリスティナ・ヘンドリックスのLoRAを作成した人は、マッドメンテレビ番組からわずか16枚の画像でモデルを開発したと述べています(これは307MBのダウンロードです)。RedditとDiscordのStable Diffusionコミュニティからの複数の投稿は、LoRAsのようなものは、ほとんどの場合、多くのトレーニングデータやトレーニング時間を必要としないことを確認しています。

クリックして再生アーノルド・シュワルツェネッガーがハニーユンビデオLoRAで実現しました。このLoRAはCivitコミュニティで無料で入手できます。さらにアーノルドの例については、こちらのAI愛好家ボブ・ドイルのページを参照してください。

ハニーユンLoRAsは、静止画像またはビデオのいずれかでトレーニングできますが、ビデオでトレーニングするには、より多くのハードウェアリソースとトレーニング時間が必要です。

ハニーユンビデオモデルには130億のパラメータがあり、ソラの120億のパラメータを上回り、2024年夏にオープンソースでリリースされた、より能力の低いHunyuan-DiTモデルを大幅に上回ります。後者は15億のパラメータしかありません。

2.5年前と同様に、Stable DiffusionとLoRAStable Diffusion 1.5の「ネイティブ」有名人の例を参照してください)では、基本モデルには、LoRAsを介して得られる忠実度よりも、有名人の個性についての理解が大幅に限定されていました。

実質的に、カスタマイズされた、個性に焦点を当てたLoRAは、基本的なハニーユンモデルの重要な合成能力に「無料で乗車」できます。2017年当時のオートエンコーダーによるディープフェイクや、LivePortraitなどのシステムを使用して静止画像に動きを追加することよりも、はるかに効果的な人間の合成を提供します。

ここで示されているすべてのLoRAsは、Civitコミュニティから無料でダウンロードできます。一方、古いカスタム「静止画像」LoRAsは、より豊富に存在し、将来のハニーユンビデオの「画像からビデオ」機能(現在はリリース待ち)のための「シード」画像を作成する可能性もあります(現在は回避策が可能です)。

クリックして再生上部は、静的なFlux LoRAのサンプルです。下部は、ミュージシャンのテイラー・スウィフトを特集したハニーユンビデオLoRAの例です。これらのLoRAsは、Civitコミュニティで無料で入手できます。

Civitウェブサイトでは、現在「ハニーユン」という検索結果が128件あります。これらのほとんどは、ある程度のNSFWモデルです。22件は有名人を描いています。18件はハードコアポルノの生成を促進するように設計されています。7件のみが男性を描いています(女性を描いたものは7件以外です)。

新しい点は何ですか?

「ディープフェイク」という用語の進化的な性質と、一般的な理解が限られていること、また、現在のAI人間ビデオ合成フレームワークの重大な制限により、ハニーユンLoRAの重要性は、生成AIシーンを随時フォローする人にとっては、簡単に理解できないかもしれません。ハニーユンLoRAsと以前のアプローチとの主な違いをいくつか見てみましょう。

1: 制限のないローカルインストール

ハニーユンビデオの最も重要な側面は、ローカルにダウンロードでき、非常に強力で無修正のAIビデオ生成システムを、一般ユーザーとVFXコミュニティ(地理的な地域で許可される場合)の手に置くことです。

これが起こったのは、Stable Diffusionモデルが2022年の夏にオープンソースでリリースされたときでした。当時、OpenAIのDALL-E2は一般の想像力を捉えていましたが、DALLE-2は有料サービスで、制限がありました(それも時間の経過とともに増えていきました)。

Stable Diffusionが利用可能になると、Low-Rank Adaptationによって、誰でものアイデンティティの画像を生成できるようになり、Stable DiffusionはDALLE-2の人気を上回りました。後者は、最初からより優れたシステムでしたが、その検閲ルーチンは多くのユーザーによって厳格と見なされ、カスタマイズは不可能でした。

おそらく、同じシナリオが、Soraとハニーユンの間(または、より正確に言えば、Soraグレードのプロプライエタリ生成ビデオシステムと、オープンソースのライバル、そしてハニーユンが最初のものですが、おそらく最後のものではありません)で発生しています。ここでは、Fluxが最終的にStable Diffusionに大きな地歩を獲得することになるかもしれません。

ハニーユンLoRA出力を生成したいが、十分な機器が不足しているユーザーは、トレーニングのGPU側面をオンラインコンピューティングサービスにオフロードできます。KaiberやKlingなどのプラットフォームでAIビデオを生成するのとは異なり、ローカルワークフローをサポートするためにオンラインGPUをレンタルする場合、セマンティックまたは画像ベースのフィルタリング(検閲)は含まれません。

2: ホストビデオや多大な労力の必要なし

ディープフェイクが2017年の終わりに登場したとき、匿名で投稿されたコードは、DeepFaceLabFaceSwap(およびDeepFaceLiveのリアルタイムディープフェイクシステム)などのメインストリームフォークに進化しました。

この方法では、各アイデンティティをスワップするために、数千枚の顔画像を慎重にキュレーションする必要がありました。トレーニング時間は、利用可能なハードウェアに応じて2〜14日間変動しましたが、長期的には、十分な能力を持つシステムをもストレスさせました。

モデルが最終的に準備できたら、既存のビデオにのみ顔を重ねることができ、通常、実際の(ターゲット)アイデンティティが、重ねられたアイデンティティに近い外見でなければなりませんでした。

最近、ROOP、LivePortrait、または同様のフレームワークは、労力が大幅に少なく、かつ優れた結果をもたらす機能を提供しましたが、正確なフルボディディープフェイクや、顔以外の要素を生成する能力はありませんでした。

Bob DoyleのYouTubeコンテンツストリームからのROOP UnleashedとLivePortrait(左下のインセット)の例。ソース:https://www.youtube.com/watch?v=i39xeYPBAAMとhttps://www.youtube.com/watch?v=QGatEItg2Ns

Bob DoyleのYouTubeコンテンツストリームからのROOP UnleashedとLivePortrait(左下のインセット)の例。ソース:https://www.youtube.com/watch?v=i39xeYPBAAMとhttps://www.youtube.com/watch?v=QGatEItg2Ns

一方、ハニーユンLoRAs(およびそれに続く同様のシステム)は、全体の世界、フルボディシミュレーションを含むアイデンティティの無制限の創造を可能にします。

3: 時間的一貫性の改善

時間的一貫性は、拡散ビデオのために数年間、聖杯でした。LoRAと適切なプロンプトを使用することで、ハニーユンビデオ生成は、一定のアイデンティティ参照を遵守することができます。理論的には(これは初期段階です)、特定の衣装を着用した特定のアイデンティティの複数のLoRAsをトレーニングできます。

その場合、衣装も、ビデオ生成中に「突然変異」する可能性は低くなります(生成システムは、前のフレームの限定されたウィンドウに基づいて次のフレームを生成するためです)。

(または、画像ベースのLoRAシステムと同様に、単一のビデオ生成に複数のLoRAs、たとえばアイデンティティ + 衣装LoRAsを適用することができます)

4: 人間実験へのアクセス

先日、私は指摘したように、FAANGレベルの生成AIセクターは、現在、プロジェクトの人間合成能力に関する潜在的な批判に非常に警戒的であるようです。したがって、実際の人々は、メジャーな発表やリリースのプロジェクトページにほとんど登場しません。代わりに、関連する広報資料は、合成結果に「かわいい」または「非脅迫的」と見なされる主題を示すことが増えています。

ハニーユンLoRAsの登場により、初めてコミュニティは、非常に優れた(マイナーアプリケーションではなく)システムで、LDMベースの人間ビデオ合成の境界を押し広げ、多くの人にとって最も関心のある主題、つまり人々を、完全に探索する機会が得られます。

影響

Civitコミュニティで「ハニーユン」を検索すると、主に有名人LoRAsと「ハードコア」LoRAsが表示されるため、ハニーユンLoRAsの重要な影響は、有名人や無名の人々を含む、実在の人のAIポルノグラフィックビデオ(またはその他の誹謗中傷的な)を作成することです。

コンプライアンスのため、ハニーユンLoRAsを作成し、さまざまなDiscordサーバーで実験する愛好家たちは、実在の人の例を投稿することを禁止しています。しかし、画像ベースのディープフェイクはすでに武器化されています。現実的なビデオを追加すると、7年間再現されてきたメディアでの懸念が最終的に正当化される可能性があり、新しい規制につながる可能性があります。

原動力

いつものように、ポルノ技術の原動力です。私たちのそのような使用に対する意見に関係なく、この強力な原動力は、最終的に主流の採用に利益をもたらす、最先端の進歩を促進します。

この場合、価格は通常よりも高くなる可能性があります。なぜなら、ハイパーリアリスティックビデオ作成のオープンソース化には、犯罪、政治、倫理的な悪用に対する明らかな影響があるからです。

あるRedditグループ(ここでは名前は言及しません)は、NSFWビデオコンテンツのAI生成に専念しており、ハニーユンベースのビデオポルノ生成のためのComfyUIワークフローを改良するためのオープンなDiscordサーバーがあります。ユーザーは毎日、NSFWクリップを投稿しています。多くのクリップは「過激」または、少なくともフォーラムのルールで言及されている制限を超えています。

このコミュニティはまた、ポルノグラフィックビデオをダウンロードして処理するためのツールを特集する、充実したGitHubリポジトリを維持しています。これらのツールは、新しいモデルのトレーニングデータを提供するために使用できます。

最も人気のあるLoRAトレーナーのKohya-ssは、現在、ハニーユンLoRAトレーニングをサポートしています。無制限の生成ビデオトレーニングへの障壁は毎日低下しています。ハニーユントレーニングとビデオ生成のためのハードウェア要件も低下しています。

ハニーユンLoRAsの重要な側面は、標準的な基本モデルは、NSFW出力を特にトレーニングしたものではなく、したがって、NSFWコンテンツを生成するときには、パフォーマンスが低いか、または学習した概念や関連付けを、パフォーマンスや説得力のある方法で「解離」できない可能性があります。

NSFWファウンドेशनモデルとLoRAsを微調整することで、トレーニングされたアイデンティティを専用の「ポルノ」ビデオドメインに投影することが可能になります。実際には、これは、過去2.5年間に静止画像で既に起こったことのビデオ版です(たとえば、有名人のAIヌード画像がEbayで販売され始めました)。

VFX

ハニーユンビデオLoRAsが提供する時間的一貫性の巨大な増加は、オープンソースソフトウェアに大きく依存するAIビジュアルエフェクト業界にとって明らかな利点です。

ハニーユンビデオLoRAアプローチは、完全なフレームと環境を生成しますが、VFX会社は、得られることができる時間的一貫性の高い人間の顔を分離することを開始し、実世界のソース映像に顔を重ねたり統合したりするために使用しています。

愛好家コミュニティと同様に、VFX会社は、ハニーユンビデオの画像からビデオおよびビデオからビデオの機能がリリースされるのを待たなければなりません。そうしないと、フレームワークとその潜在的なインハウスフォークの外部能力を探るための間を利用して、改良する必要があります。

ハニーユンビデオのライセンス条項は、実際の個人の描写が許可されている限り、技術的に許可していますが、EU、英国、韓国での使用を禁止しています。「ベガスルール」の原則では、これは必ずしもハニーユンビデオがこれらの地域で使用されないことを意味しない可能性があります。ただし、外部データ監査によって、生成AIに関する成長する規制を強制する可能性があり、違法使用はリスクを伴う可能性があります。

ライセンス条項のもう1つの潜在的に曖昧な領域は次のとおりです。

「テンセントハニーユン版のリリース日時点で、ライセンサーが提供する製品またはサービスの月間アクティブユーザー数が、前月の月間アクティブユーザー数が100万を超える場合、テンセントにライセンスを申請する必要があります。テンセントは独自の判断でこれを付与することができます。また、テンセントがこれを明示的に付与しない限り、この契約に基づく権利の行使は認められません。」

この条項は、ハニーユンビデオを「中間者」する可能性のある多くの企業を対象としています。これらの企業は、テクノロジーに不慣れなユーザーの大きな集団にサービスを提供することになります。テンセントは、あるしきい値を超えた場合、行動に参加する必要があります。

この広い表現が、間接的な使用(たとえば、人気の映画やテレビ番組でハニーユンを使用したビジュアルエフェクトの出力を提供すること)をカバーする可能性もあるかどうかは、明確化が必要かもしれません。

結論

ディープフェイクビデオは長い間存在していますが、ハニーユンビデオLoRAがアイデンティティ合成とディープフェイクへのアプローチとしての重要性を過小評価し、現在の努力がハニーユンビデオの完全に制御可能な人間ビデオ合成の潜在能力のわずかな一部を表すだけであると考え、Civitコミュニティや関連するDiscordサーバー、サブレッドで発生している開発を、単なる小さな進歩と見なすことは容易です。

しかし、もっと可能性のあるのは、現在の努力が、画像からビデオコンポーネントがリリースされると、さらに細かいレベルの生成能力が利用可能になるハニーユンビデオの潜在能力の小さな部分を表すだけであるということです。

Stability.aiが2022年にStable Diffusionをリリースしたとき、多くの観察者は、会社が当時那样優れた生成システムをなぜ無料で提供したのかを理解できませんでした。ハニーユンビデオの場合、利益動機はライセンスに直接組み込まれています(ただし、テンセントが会社が利益分配スキームをトリガーするかどうかを判断するのが難しい可能性があります)。

どちらにしても、結果は2022年のときと同じです。ハニーユンビデオのリリースの周囲には、すぐに、そして強い熱意を持って、専用の開発コミュニティが形成されています。次の12ヶ月間に、これらの努力が辿る道のいくつかは、新しい見出しのタイトルをもたらす可能性があります。

 

* 公開時点で136まで

2025年1月7日初版

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai