Andersonの視点
ゼロショットカスタマイズのためのジェネレーティブAIの闘い

あなたが人気のある画像またはビデオ生成ツールに自分を配置したい場合ですが、基礎モデルがあなたを認識するには十分な有名人でない場合は、自分自身の写真のコレクションを使用して低ランク適応(LoRA)モデルをトレーニングする必要があります。作成後、このパーソナライズされたLoRAモデルは、将来の出力にあなたのアイデンティティを含めることができます。
これは、画像とビデオの合成研究分野では一般的にカスタマイズと呼ばれています。これは、2022年の夏にStable Diffusionが登場してから数ヶ月後に初めて登場し、Google ResearchのDreamBoothプロジェクトは、高いギガバイトのカスタマイズモデルを提供しました。これは、閉じたソースのスキーマでしたが、すぐにコミュニティにリリースされました。
LoRAモデルはすぐに続き、トレーニングが容易でファイルサイズが軽量で、質の低下なしに、Stable Diffusionとその後継モデル、Fluxなどの後のモデル、そしてHunyuan VideoやWan 2.1などの新しいジェネレーティブビデオモデルなどのカスタマイズシーンを支配しました。
繰り返し
問題は、私たちが以前にも指摘したように、新しいモデルが登場するたびに、新しいLoRAの世代をトレーニングする必要があります。これは、カスタムモデルをトレーニングしたLoRA製作者にとって大きな障害となります。モデルアップデートや人気の新しいモデルが登場すると、LoRA製作者は再び最初から始める必要があります。
したがって、ゼロショットカスタマイズアプローチが最近の文献で強い潮流となっています。このシナリオでは、データセットをキュレーションしてサブモデルをトレーニングするのではなく、生成に注入するサブジェクトの写真を1つまたは複数提供し、システムはこれらの入力ソースを混合出力に解釈します。
以下に、PuLIDシステムを使用した顔交換以外に、スタイル転送にもID値を組み込むことができることを示しています:

PuLIDシステムを使用した顔ID転送の例。 Source: https://github.com/ToTheBeginning/PuLID?tab=readme-ov-file
LoRAをジェネリックアダプターに置き換えることは素晴らしいアイデアですが、挑戦的でもあります。LoRAトレーニングプロセスで得られる詳細な注意とカバレッジを、ワンショットのIP-Adapterスタイルのモデルで模倣することは非常に難しいです。
HyperLoRA
この点を考慮して、ByteDanceから提案されたシステムは、実際のLoRAコードをオンザフライで生成します。これは、現在、ゼロショットソリューションの中でユニークです。

入力画像が左側にあり、右側には入力画像に基づいて生成された出力の柔軟な範囲があり、実質的にアンソニー・ホプキンスとアン・ハサウェイのディープフェイクを生成しています。 Source: https://arxiv.org/pdf/2503.16944
論文では次のように述べられています:
‘アダプターベースの手法であるIP-Adapterは、基礎モデルのパラメーターを凍結し、プラグインアーキテクチャを使用してゼロショット推論を可能にしますが、自然さと本物さが欠けていることがあり、ポートレート合成タスクでは無視できない問題です。 ‘
‘私たちは、HyperLoRAと呼ばれるパラメーターエフィシェントな適応生成方法を提案します。これは、適応プラグインネットワークを使用してLoRA重みを生成し、LoRAの優れたパフォーマンスとアダプタースキームのゼロショット能力を統合します。 ‘
‘私たちの慎重に設計されたネットワーク構造とトレーニング戦略を通じて、ハイパフォトリアリズム、忠実度、編集可能性を持つゼロショットパーソナライズドポートレート生成(単一および複数画像入力の両方をサポート)を実現します。 ‘
最も役立つのは、トレーニング済みのシステムが既存のControlNetと共に使用できることです。生成の特異性が高くなります。

HyperLoRAを使用したControlNet生成の例。
新しいシステムがいつの日かエンドユーザーに公開されるかどうかについて、ByteDanceは、以前にも強力なLatentSyncリップシンクフレームワークやInfiniteYouフレームワークを公開しているので、合理的な記録があります。
しかし、論文には公開する意図がないことが示されており、再現するために必要なトレーニングリソースは極めて高額であるため、DreamBoothと同様にエンスージアストコミュニティによって再現することは困難です。
新しい論文は、HyperLoRA: パラメーターエフィシェントな適応生成によるポートレート合成と題されており、ByteDanceとByteDanceのインテリジェントクリエーション部門の7人の研究者から来ています。
方法
新しい方法は、Stable Diffusionの潜在的拡散モデル(LDM)であるSDXLを基礎モデルとして使用します。原則は、一般に拡散モデルに適用可能のようですが、トレーニングの要求は、特にジェネレーティブビデオモデルに適用することが困難になる可能性があります。
HyperLoRAのトレーニングプロセスは、3つのステージに分かれています。各ステージは、学習された重みに特定の情報を分離して保存するように設計されています。目標は、アイデンティティに関連する機能が、服や背景などの無関係な要素によって汚染されないようにすることです。同時に、収束が速く安定するようにすることです。

HyperLoRAの概念スキーマ。モデルは、アイデンティティ機能のためのHyper ID-LoRAと、背景と衣類のためのHyper Base-LoRAに分割されます。この分離により、機能の漏れが減ります。トレーニング中、SDXLベースとエンコーダーは凍結され、HyperLoRAモジュールのみが更新されます。推論時には、ID-LoRAのみが必要です。
最初のステージは、Base-LoRAを学習することに重点を置いています。これは、アイデンティティに無関係な詳細を捉えるものです。
この分離を強制するために、研究者はトレーニング画像の顔部分を意図的にぼかしました。モデルは、背景、照明、ポーズなどのものに焦点を当てることができますが、アイデンティティには焦点を当てることができません。この「ウォームアップ」ステージは、アイデンティティ固有の学習が始まる前に、低レベルの邪魔を除去するフィルタとして機能します。
2番目のステージでは、ID-LoRAが導入されます。ここでは、2つの並列パスを使用して顔のアイデンティティをエンコードします。1つは、構造的な機能に対するCLIPビジョントランスフォーマー(CLIP ViT)であり、もう1つは、より抽象的なアイデンティティ表現に対するInsightFace AntelopeV2エンコーダーです。
移行アプローチ
CLIP機能はモデルが迅速に収束するのに役立ちますが、過剰適合のリスクがあります。一方、Antelope埋め込みはより安定していますが、トレーニングに時間がかかります。したがって、システムはCLIPに重点を置いて開始し、次にAntelopeを段階的に導入して不安定性を避けます。
最終ステージでは、CLIPガイド付きの注意層は完全に凍結されます。AntelopeV2リンクの注意モジュールのみがトレーニングを続行し、モデルはアイデンティティの保存を損なうことなく、既に学習したコンポーネントの忠実度と一般性を改善することができます。
この段階的な構造は、本質的に解離を試みるものです。アイデンティティと非アイデンティティ機能は最初に分離され、次に独立して改良されます。これは、通常のパーソナライゼーションの失敗モード、つまりアイデンティティドリフト、編集可能性の低さ、および付随的な機能への過剰適合に対する方法的な対応です。
重み付け
CLIP ViTとAntelopeV2が、与えられたポートレートから構造的な機能とアイデンティティ固有の機能の両方を抽出した後、取得された機能は、係数のコンパクトなセットにマッピングするトランスフォーマーベースのモジュールであるパーシーバー再サンプラー(IP-Adapterプロジェクトから派生)を介してパスされます。
2つの別々のリサンプラーが使用されます。1つは、背景や非アイデンティティ要素をエンコードするBase-LoRAの重みを生成するために使用され、もう1つは、顔のアイデンティティに焦点を当てたID-LoRAの重みを生成するために使用されます。

HyperLoRAネットワークのスキーマ。
出力係数は、学習されたLoRA基底行列との線形結合によって、基礎モデルを直接変更することなく、完全なLoRA重みを生成します。
このアプローチにより、システムは、画像エンコーダーと軽量な投影のみを使用して、完全にオンザフライでパーソナライズされた重みを生成できます。
データとテスト
HyperLoRAをトレーニングするために、研究者は、LAION-2Bデータセットの4,400万枚の顔画像のサブセットを使用しました。
InsightFaceを使用して、非ポートレートの顔や複数の画像をフィルタリングしました。画像は、BLIP-2キャプションシステムで注釈付けされました。
データ増強については、画像は顔の周りにランダムにトリミングされましたが、常に顔の領域に焦点を当てました。
LoRAランクは、トレーニングセットアップで利用可能なメモリに適応する必要がありました。したがって、ID-LoRAのLoRAランクは8に設定され、Base-LoRAのランクは4に設定され、8ステップの勾配蓄積を使用して、実際よりも大きなバッチサイズをシミュレートしました。
研究者は、Base-LoRA、ID-LoRA(CLIP)、ID-LoRA(アイデンティティ埋め込み)モジュールをそれぞれ20K、15K、55Kイテレーションでトレーニングしました。ID-LoRAトレーニング中、条件付けシナリオを0.9、0.05、0.05の確率でサンプリングしました。
システムはPyTorchとDiffusersを使用して実装され、トレーニングプロセス全体は約10日間で16のNVIDIA A100 GPUで実行されました。
ComfyUIテスト
著者は、ComfyUIシンセシスプラットフォームでHyperLoRAを3つのライバル方法と比較するためのワークフローを構築しました。比較対象は、InstantID、IP-Adapter-FaceID-Portraitフレームワーク(IP-Adapterの形式)、および先ほど述べたPuLIDです。すべてのフレームワークで一貫したシード、プロンプト、サンプリング方法を使用しました。
著者は、アダプターベースの方法(LoRAベースの方法ではなく)は、一般的に低いクラスフリーガイダンス(CFG)スケールが必要であることを指摘しています。
したがって、比較の公平性を保つために、研究者は、すべてのテストで、LEOSAMのHello WorldというオープンソースのSDXLファインチューンチェックポイントバリアントを使用しました。定量的テストのために、Unsplash-50画像データセットを使用しました。
メトリック
忠実度のベンチマークとして、著者は、CLIP画像埋め込み(CLIP-I)と、CurricularFaceを介して抽出されたアイデンティティ埋め込み(ID Sim)間のコサイン距離を測定しました。
各方法は、テストセット内の各アイデンティティについて、4つの高解像度のヘッドショットを生成し、結果を平均化しました。
編集可能性は、アイデンティティモジュールの有無によるCLIP-Iスコアの違いを比較することによって評価され、さらに、10のプロンプトバリエーション(ヘアスタイル、アクセサリー、衣類、背景をカバー)に対するCLIP画像テキストの整合性(CLIP-T)を測定しました。
著者は、Arc2Face基礎モデルを比較に含めました。これは、固定のキャプションとトリミングされた顔の領域でトレーニングされました。
HyperLoRAの場合、2つのバリアントがテストされました。1つはID-LoRAモジュールのみを使用し、もう1つはID-LoRAとBase-LoRAの両方を使用し、後者は0.4の重みで使用されました。Base-LoRAは忠実度を向上させましたが、編集可能性をわずかに制限しました。

初期の定量的比較の結果。
定量的テストについて、著者は次のように述べています:
‘Base-LoRAは忠実度を向上させますが、編集可能性を制限します。私たちの設計では、画像機能を別々のLoRAに分離していますが、相互に漏れが出るのを完全に避けることは難しいです。したがって、Base-LoRAの重みを調整して、さまざまなアプリケーションシナリオに適応させることができます。 ‘
‘私たちのHyperLoRA(フルとID)は、顔の忠実度で最高と2番目の成績を収めました。InstantIDは顔IDの類似性では優れていますが、顔の忠実度は低いです。 ‘
‘両方のメトリックを一緒に考慮する必要があります。顔IDの類似性はより抽象的ですが、顔の忠実度はより詳細なものを反映しています。 ‘
定性的テストでは、基本的な提案のトレードオフが表面化します。以下に、プロンプト「白いシャツ」と「狼の耳」が使用された例を示します。

定性的比較。上から下まで、使用されたプロンプトは「白いシャツ」と「狼の耳」です(詳細は論文を参照)。
ここで、著者は次のように述べています:
IP-AdapterとInstantIDによって生成されたポートレートの肌には、明らかにAI生成されたテクスチャがあり、過剰な彩度があり、写実性から遠いです。
‘これは、アダプターベースの方法の一般的な欠点です。PuLIDはこの問題を軽減することで、IP-AdapterとInstantIDを上回りますが、ぼけや詳細の欠如に苦労しています。 ‘
‘一方、LoRAは基礎モデルの重みを直接変更するのではなく、外部の注意モジュールを導入するのではなく、通常、高度な詳細と写実性を持つ画像を生成します。 ‘
著者は、HyperLoRAが基礎モデルの重みを直接変更することで、従来のLoRAベースの方法の非線形能力を保持し、微妙な詳細の捉え方を向上できる可能性があると主張しています。
定性的比較では、論文は、HyperLoRAのレイアウトがより一貫性があり、プロンプトに沿ったものであり、PuLIDによって生成されたものと似ているが、InstantIDやIP-Adapterよりもはるかに優れていると主張しています。

HyperLoRAを使用したControlNet生成のさらなる例。
結論
過去18ヶ月で、さまざまなワンショットカスタマイズシステムが現れ、絶望的な雰囲気を醸し出しています。ほとんどの提供は、現状を大幅に改善していません。トレーニング要件や推論要件が極めて高いため、実用的には大きな課題があります。
HyperLoRAのトレーニングレジームも他の最近のエントリーよりも大きなトレーニング要件を必要としますが、少なくとも、ボックスから出てくるだけで、アドホックカスタマイズを処理できるモデルが得られます。
論文の補足資料から、HyperLoRAの推論速度はIP-Adapterよりも優れていますが、他の2つの方法よりも遅いことがわかります。ただし、これらの数字は、NVIDIA V100 GPUに基づいています。これは、一般的な消費者向けハードウェアではありません(ただし、新しいNVIDIA GPUはV100の最大32GBのVRAMに匹敵または上回ることができます)。

競合する方法の推論速度(ミリ秒単位)。
ゼロショットカスタマイズは、実用的観点から未解決の問題のままです。HyperLoRAの重要なハードウェア要件は、真の長期的な単一の基礎モデルを生成する能力と相反しています。
* 使用されたモデルに応じて、640GBまたは1280GBのVRAMを表します(指定されていません)
2025年3月24日初版









![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-400x240.jpg)
![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-80x80.jpg)

