Andersonの視点
カスタム画像を使用したHunyuanCustomの深層学習ベースのビデオ生成

この記事では、Hunyuan Videoの新しいバージョンであるHunyuanCustomについて紹介します。HunyuanCustomは、単一の画像からカスタムビデオを生成することができます。
プロジェクトページには、多数のサンプルビデオが掲載されていますが、ビデオの解像度や長さの問題により、標準のビデオプレイヤーでは再生できない場合があります。
テンセントは、Hunyuan Videoの新しいバージョンであるHunyuanCustomをリリースしています。この新しいバージョンは、単一の画像からカスタムビデオを生成することができます。
クリックして再生します。 プロンプト: ‘男性が音楽を聴きながらスナイルヌードルを調理しています’. この新しい方法は、Klingを含む既存の方法と比較されています。
上のビデオの左端の列には、HunyuanCustomに提供された単一のソース画像が表示され、次の列には、新しいシステムのプロンプトの解釈が表示されます。残りの列には、さまざまなプロプライエタリおよびFOSSシステムからの結果が表示されます: Kling; Vidu; Pika; Hailuo; および Wan ベースの SkyReels-A2。
以下のビデオでは、このリリースに重要な3つのシナリオのレンダリングが表示されます: 人物 + オブジェクト; 単一キャラクターエミュレーション; および バーチャルトライオン (人物 + 衣服):
クリックして再生します. Hunyuan Videoのサポートサイトからのマテリアルを編集した3つの例です。
これらの例から、いくつかの点がわかります。主に、システムが単一のソース画像に依存しているという点です。
最初のクリップでは、男性は基本的にカメラの前を向いています。彼は頭を下に傾け、横に20〜25度ほど回転しますが、より大きい傾斜角度では、システムは彼の横顔がどうなっているかを推測する必要があります。これは、単一の正面画像から正確に推測することは難しい、または不可能です。
2番目の例では、少女が笑顔でビデオに描かれていることがわかります。再び、単一の画像から、HunyuanCustomは彼女の「休む顔」がどうなっているかについて、かなり情報のない推測を行う必要があります。また、彼女の顔は、前の例(「男性がポテトチップスを食べている」)よりもカメラの前を向いた状態から20度以上外れません。
最後の例では、ソースマテリアル(女性と彼女が着ている服)が完全な画像ではないため、レンダリングはシナリオを切り取ってフィットさせています。これは、データの問題に対するかなり良い解決策です!
ポイントは、システムが複数の画像(例: 人物 + ポテトチップス、または 人物 + 衣服)を扱うことができるが、単一のキャラクターの複数の角度や異なるビューを扱うことはできないということです。したがって、システムは、HunyuanVideoの周りに形成されたLoRAモデルの拡大するエコシステムを置き換えるのに苦労するかもしれません。LoRAモデルのトレーニングデータセット(通常20〜60画像)に表現された任意の角度や顔の表情で、一貫したキャラクターを生成するのに役立ちます。
サウンドとビジョン
HunyuanCustomは、LatentSyncシステムを使用して、オーディオとテキストの入力に合わせたリップの動きを取得します。
オーディオを含む。クリックして再生します。 HunyuanCustomの補足サイトからのオーディオの例です。
既存のビデオの編集
新しいシステムは、ビデオからビデオ(V2V、またはVid2Vid)編集のための非常に印象的な結果を提供します。ここでは、既存の(実際の)ビデオのセグメントがマスクされ、単一の参照画像で指定されたサブジェクトに置き換えられます。
クリックして再生します ただし、ターゲット化されたオブジェクトの周囲も、HunyuanCustomのVid2Vidパスの際に変更されます。
標準的なVid2Vidシナリオと同様に、全体のビデオは、ターゲット化された領域で最も変更されるものの、プロセスによってある程度変更されます。アドビのFireflyは、ガーベージマットアプローチを使用してこれを行います。ガーベージマットアプローチでは、ビデオのほとんどのコンテンツが元のビデオと同じままになります。
しかし、大多数の代替例は、これらの統合をより良く行っています。以下のコンパイルされた例を見てみましょう:
クリックして再生します HunyuanCustomのVid2Vidを使用したコンテンツの挿入の例です。
新しいスタート
このイニシアチブは、Hunyuan Videoプロジェクトの開発であり、別の開発ストリームへのハードピボットではありません。プロジェクトの強化は、離散的なアーキテクチャの挿入として導入されており、モデルがフレーム間でアイデンティティの完全性を維持するために、サブジェクト固有の ファインチューニングに依存しないように設計されています。
明確にするために、HunyuanCustomはスクラッチからトレーニングされたものではなく、2024年12月のHunyuanVideoファウンデーションモデルのファインチューニングです。
LoRAを開発した人は、HunyuanVideo LoRAがこの新しいエディションでまだ機能するか、またはカスタマイズ機能をさらに強化したい場合は、LoRAの車輪を再び作成する必要があるかどうか疑問に思うかもしれません。
一般的に、ハイパースケールモデルの大幅なファインチューニングは、LoRAが以前のモデルで適切に機能しない、または全く機能しないように、モデルウェイトを変更します。
しかし、時には、ファインチューニングの普及がその起源に挑戦することがあります。ファインチューニングが有効なフォークとなり、独自のエコシステムとフォロワーを持ち、Pony DiffusionがStable Diffusion XL(SDXL)のチューニングであることを示すことができます。Ponyには、CivitAIドメインに592,000以上のダウンロードがあり、Pony(ではなくSDXL)をベースモデルとして使用したLoRAの幅広い範囲があり、推論時にPonyを必要とします。
リリース
プロジェクトページには、新しい論文へのリンクが含まれています。この論文は、HunyuanCustom: カスタマイズされたビデオ生成のためのマルチモーダル駆動アーキテクチャと題されています。GitHubサイトへのリンクもあり、コードと必要なウェイトが含まれています。
プロジェクトのHugging Faceの存在は、現在404です。しかし、APIベースのバージョンはあり、WeChatのスキャンコードを提供することで、システムをデモすることができます。
私は、HunyuanCustomのようなプロジェクトの幅広いプロジェクトの使用を見たことがありません。多くのライセンスは、フルリリースを義務付けるでしょう。
GitHubページには2つのモデルが発表されています。720px1280pxバージョンは8GBのGPUピークメモリを必要とし、512px896pxバージョンは60GBのGPUピークメモリを必要とします。
リポジトリには、720px1280px129fの最小GPUメモリ要件は24GBですが、非常に遅いと記載されています。80GBのメモリを持つGPUを使用することをお勧めします。システムは現在、Linuxのみでテストされています。
以前のHunyuan Videoモデルは、公式リリース以来、24GB未満のVRAMで実行できるサイズに量子化されています。新しいモデルも、コミュニティによってより消費者に優しい形式に適応される可能性が高いです。また、Windowsシステムでもすぐに適応されるでしょう。
ペーパーを読む
HunyuanCustomのデータパイプラインは、GDPRフレームワークに準拠しており、合成およびオープンソースのビデオデータセットを組み込んでいます。

HunyuanCustomデータ構築パイプラインの多様なパッケージの概要。
初期フィルタリングは、PySceneDetectで開始され、ビデオを単一のショットクリップに分割します。次に、TextBPN-Plus-Plusを使用して、テキスト、字幕、ウォーターマーク、またはロゴが過剰なビデオを除去します。
解像度と長さの不一致に対処するために、クリップは5秒の長さに標準化され、512または720ピクセルにリサイズされます。美的フィルタリングは、Koala-36Mを使用して行われ、カスタムデータセットに0.06のカスタムしきい値が適用されます。
サブジェクト抽出プロセスには、Qwen7B大規模言語モデル(LLM)、YOLO11Xオブジェクト認識フレームワーク、および人気のあるInsightFaceアーキテクチャが含まれ、人間のアイデンティティを識別および検証するために使用されます。
非人間のサブジェクトの場合、QwenVLおよびGrounded SAM 2を使用して、関連するバウンディングボックスを抽出し、サイズが小さすぎる場合は破棄します。

Hunyuan Controlプロジェクトで使用されるGrounded SAM 2のセマンティックセグメンテーションの例。
マルチサブジェクト抽出には、Florence2をバウンディングボックス注釈に、Grounded SAM 2をセグメンテーションに使用し、クラスタリングとトレーニングフレームの時間セグメンテーションに続きます。
処理されたクリップは、Hunyuanチームによって開発された独自の構造化ラベリングシステムを使用して、注釈付きでさらに強化され、レイヤードメタデータ(説明、カメラモーションキューコンテキストを含む)が付与されます。
マスク増幅戦略、バウンディングボックスへの変換を含む、はオーバーフィッティングを減らし、モデルがさまざまなオブジェクトの形状に適応できるように、トレーニング中に適用されました。
オーディオデータは、先述のLatentSyncを使用して同期され、同期スコアが最小しきい値以下の場合、クリップは破棄されました。
ブラインドイメージ品質評価フレームワーク HyperIQA は、40未満のスコアを持つビデオを除外するために使用されました。有効なオーディオトラックは、Whisperで処理されて、ダウンストリームタスクの特徴が抽出されました。
著者は、注釈段階でLLaVA言語アシスタンモデルを組み込み、画像キャプションを生成し、視覚的なコンテンツとテキストプロンプトを整列させることを強調しています。LLaVAは、モダリティ間の整合性のあるトレーニングシグナルを構築する上で重要な役割を果たします。

HunyuanCustomフレームワークは、テキスト、画像、オーディオ、ビデオ入力に基づいてアイデンティティ一貫性のあるビデオ生成をサポートします。
LLaVAのビジョン言語の整列機能を利用することで、パイプラインは視覚的な要素とそのテキスト記述の間のさらにセマンティックな整列性を獲得します。
カスタムビデオ
画像とプロンプトに基づいてビデオを生成するために、LLaVAを中心とした2つのモジュールが作成され、HunyuanVideoの入力構造が画像とテキストを受け付けるように適応されました。
これには、プロンプトを画像を直接埋め込んだり、短いアイデンティティ記述でタグ付けしたりする方法でフォーマットすることが含まれます。画像埋め込みがプロンプトコンテンツを圧倒しないように、セパレータトークンが使用されました。
LLaVAの視覚エンコーダーは、画像とテキストの特徴を整列する際に、特に単一の参照画像を一般的なセマンティック埋め込みに変換するときに、微細な空間の詳細を圧縮または破棄する傾向があります。したがって、アイデンティティ強化モジュールが組み込まれています。ほとんどのビデオ潜在的拡散モデルのように、LoRAなしでアイデンティティを維持することは難しいです。5秒間のクリップでも、モジュールのパフォーマンスはコミュニティテストで重要となる可能性があります。
参照画像は、元のHunyuanVideoモデルからの因果的3D-VAEを使用してリサイズおよびエンコードされ、その潜在的要素が、時間軸に沿ってビデオ潜在的要素に挿入され、画像が直接出力に再生されるのを防ぐために、空間オフセットが適用されます。
モデルは、Flow Matchingを使用してトレーニングされ、ノイズサンプルはlogit-normal分布から抽出されました。ネットワークは、これらのノイズ潜在的要素から正しいビデオを回復するようにトレーニングされました。LLaVAとビデオジェネレーターは、画像とプロンプトが出力によりスムーズに導かれ、サブジェクトアイデンティティが一貫性を保つように、同時にファインチューンされました。
マルチサブジェクトプロンプトの場合、各画像テキストペアは個別に埋め込まれ、異なる時間位置が割り当てられ、アイデンティティを区別し、複数の対象を含むシーンの生成をサポートしました。
サウンドとビジョン
HunyuanCustomは、ユーザー入力オーディオとテキストプロンプトの両方を使用して、オーディオ/スピーチ生成を条件付けます。
これをサポートするために、アイデンティティ分離オーディオネットモジュールは、リファレンス画像とプロンプトから埋め込まれたアイデンティティシグナルを破壊せずに、オーディオ特徴を導入します。これらの特徴は、圧縮されたビデオタイムラインに整列され、フレームレベルのセグメントに分割され、各フレームを分離してアイデンティティの一貫性を維持する空間的クロスアテンションメカニズムを使用して注入されます。
2番目の時間注入モジュールは、オーディオ特徴を特定の潜在的シーケンスの領域にマッピングし、マルチレイヤーパーセプトロン(MLP)を使用してそれらをトークンごとのモーションオフセットに変換することで、タイミングとモーションに対するより繊細な制御を提供します。これにより、ジェスチャーと顔の動きが、話された入力のリズムと強調に合わせてより正確に動作します。
HunyuanCustomは、既存のビデオ内のサブジェクトを直接編集することを可能にし、ビデオを完全に再構築する必要なく、シーン内のサブジェクトまたはオブジェクトを置き換えたり挿入したりできます。これにより、外観または動きをターゲットに変更するタスクに役立ちます。
クリックして再生します 補足サイトからのさらに1つの例です。
既存のビデオのサブジェクトを置き換えるには、最近の方法(現在人気のVACEなど)とは異なり、リファレンスビデオを事前にトレーニングされた因果的3D-VAEを使用して圧縮し、生成パイプラインの内部ビデオ潜在的要素と整列させ、2つを追加することを好みます。これにより、プロセスは比較的軽量になり、外部ビデオコンテンツが出力を導くことができます。
小さなニューラルネットワークは、クリーン入力ビデオと生成に使用されるノイズ潜在的要素の間の整列を処理します。システムは、2つのセットの特徴を圧縮する前に結合することと、フレームごとに特徴を追加することの2つの方法をテストし、後者が機能し、品質の低下を回避しながら計算負荷を変更せずに機能することがわかりました。
データとテスト
テストでは、以下のメトリックが使用されました: ArcFaceのアイデンティティの一貫性モジュール、サブジェクトの類似性、Dino 2を使用してYOLO11xセグメントを送信することによるものです。さらに、CLIP-Bを使用して、テキストと生成されたビデオの類似性を測定し、CLIP-Bを使用して、各フレームとその隣接フレームおよび最初のフレームとの類似性を計算し、時間的一貫性を評価しました。最後に、VBenchによって定義されたダイナミック度を評価しました。
ベースラインのクローズドソースコンペティターは、Hailuo、Vidu 2.0、Kling(1.6)、Pikaでした。コンペティングFOSSフレームワークは、VACEとSkyReels-A2でした。

HunyuanCustomと主要なビデオカスタマイズ方法のパフォーマンス評価の比較。最適な結果と亜最適な結果は、それぞれ太字と下線で示されています。
これらの結果について、著者は次のように述べています:
‘私たちのHunyuanCustomは、アイデンティティの一貫性とサブジェクトの一貫性で最高の結果を達成しています。また、プロンプトの従順性と時間的一貫性においても、比較可能な結果を達成しています。[Hailuo]は、アイデンティティの一貫性のみでテキストの指示に従うことができるため、アイデンティティの一貫性が最も高いですが、非人間のサブジェクトの一貫性を犠牲にしています(DINO-Simが最も低い)。動的度合いでは、[Vidu]と[VACE]のパフォーマンスが悪く、これはモデルのサイズが小さすぎるためである可能性があります。’
プロジェクトサイトは比較ビデオで溢れていますが、比較のためにビデオのレイアウトがあまりにも美的であるため、HunyuanCustomの機能を他の対象と比較することは難しいです。しかし、ビデオシンセシスの分野で、常にトップまたはリーダーボードの近くにある商用ビデオ拡散APIであるKlingに対してテストを行う勇気を持つプロジェクトはほとんどありません。テンセントは、このインキュメントに対してかなり印象的な進歩を遂げているようです。
* 問題は、一部のビデオが幅が広く、短く、解像度が高いため、VLCまたはWindows Media Playerなどの標準ビデオプレイヤーで再生できないため、黒い画面が表示されることです。
2025年5月8日初版












