Andersonの視点

モデルバージョンアップグレードに対応できるLoRAsの向上

mm
Unite.AI を Google の優先ソースに追加
ChatGPT-4o: variation on ‘a 1792x1024 feature article reportage image of a skip full of discarded metal figurines, featuring realistic men and women of all ages and all types’

私が最近、Hunyuan Video LoRAsの成長について取り上げたところ、Civitコミュニティでは関連するLoRAsの数が185%増加しました。

Hunyuan Video LoRAを作成する簡単な方法がないにもかかわらず、CivitのセレブやテーマのLoRAsカタログは毎日成長しています。 Source: https://civitai.com/

Hunyuan Video LoRAを作成する簡単な方法がないにもかかわらず、CivitのセレブやテーマのLoRAsカタログは毎日成長しています。 Source: https://civitai.com/

これらの「アドオンパーソナリティ」をHunyuan Video(HV)に生成しようとしている同じコミュニティは、Hunyuan Videoの画像からビデオ(I2V)機能のリリースを待ち望んでいます。

オープンソースの人間画像合成に関しては、これは大きなことです。Hunyuan LoRAsの成長と組み合わせると、ユーザーが写真をビデオに変換できるようになりますが、ビデオの開発により個人のアイデンティティが劣化しないようにします。これは、現在、Kling、Kaiber、RunwayMLを含むすべての最先端の画像からビデオの生成器で発生します。

クリックして再生。 RunwayMLの最先端のGen 3 Turboモデルからの画像からビデオの生成。ただし、他の同様のモデルと同様に、カメラから離れたときに一貫したアイデンティティを維持できません。. Source: https://app.runwayml.com/

特定のパーソナリティのカスタムLoRAを開発することで、HVのI2Vワークフローで、実際の写真を開始点として使用できます。これは、モデル内の潜在的な空間にランダムな数字を送信し、結果として得られるセマンティックシナリオに頼るよりも、はるかに優れた「種」です。次に、LoRAまたは複数のLoRAを使用して、アイデンティティ、ヘアスタイル、服装、その他の重要な側面の整合性を維持できます。

これらの組み合わせの利用可能性は、Stable Diffusionの立ち上げ以来、生成可能なAIで最も重要な変化の一つを表す可能性があります。オープンソース愛好家に強力な生成能力が与えられますが、現在の人気のあるgen vidシステムのコンテンツセンサーによる規制(または「門番」)はありません。

現在、Hunyuan画像からビデオは、Hunyuan Video GitHubリポジトリの未チェックの「やること」リストにあります。ホビーコミュニティは、Hunyuan開発者からのDiscordのコメントを報告しており、画像からビデオの機能のリリースは、モデルが「あまりに検閲されていない」ため、Q1の後半に延期されたと述べています。

Hunyuan Videoの公式機能リリースチェックリスト。 Source: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan

Hunyuan Videoの公式機能リリースチェックリスト。 Source: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan

正確かどうかはわかりませんが、リポジトリの開発者は、Hunyuanのチェックリストの残りの部分を大幅に提供しています。したがって、Hunyuan I2Vは最終的に到着することになります。検閲された、検閲されていない、あるいは「アンロック可能」な形式で到着するかもしれません。

しかし、上記のリストでは、I2Vリリースは別のモデルであることがわかります。これは、現在Civitや他の場所にあるHV LoRAsのほとんどがそれと機能する可能性は低いことを意味します。

このシナリオでは、LoRAトレーニングフレームワークのMusubi TunerやOneTrainerは、Hunyuanの新しいモデルをサポートするために、リセットされるか、またはセットバックされる可能性があります。間もなく、最も技術的なYouTube AIの専門家の1、2人が、Patreonで解決策を要求するでしょう。

アップグレードの疲労

LoRAやファインチューニングの愛好家は、ほとんど誰よりもアップグレードの疲労を経験します。なぜなら、生成可能なAIの急速な変化のペースは、Stability.ai、Tencent、Black Forest Labsなどのモデルファウンドリーが、最大の頻度でより大きな、そして時にはより優れたモデルを生成するよう促しているからです。

これらの新しいモデルは、少なくとも異なるバイアスと重みを持つことになります。より一般的には、異なるスケールと/またはアーキテクチャを持つことになります。これは、ファインチューニングコミュニティが、新しいバージョンのために、厳しいトレーニングプロセスを繰り返す必要があることを意味します。

この理由により、CivitにはさまざまなStable Diffusion LoRAバージョンタイプがあります:

Civit.aiの検索フィルターオプションで視覚化されたアップグレードトレイル

Civit.aiの検索フィルターオプションで視覚化されたアップグレードトレイル

これらのLoRAモデルは、互換性がないため、多くの場合、古いモデルに依存する人気の大きなスケールのマージとファインチューンがあります。したがって、コミュニティの多くの部分は、「レガシーバージョン」に留まる傾向があります。同様に、Windows XPのサポートが終了した後も、顧客のロイヤルティが続いたのと同様に。

変化への適応

Qualcomm AI Researchからの新しい論文は、既存のLoRAsを新しくリリースされたモデルバージョンに「アップグレード」できる方法を開発したと主張しています。

モデルバージョン間のLoRAsの変換例。 Source: https://arxiv.org/pdf/2501.16559

モデルバージョン間のLoRAsの変換例。 Source: https://arxiv.org/pdf/2501.16559

これは、新しいアプローチであるLoRA-Xが、すべての同じタイプのモデル(例:テキストから画像モデル、または大規模言語モデル(LLM))間で自由に変換できることを意味するわけではありません。ただし、作者は、Stable Diffusion v1.5からSDXLへのLoRAの効果的な変換、およびTinyLlama 3TモデルからTinyLlama 2.5TへのLoRAの変換を実証しています。

LoRA-Xは、ソースモデルの部分空間内でアダプターを保存することで、異なるベースモデル間でLoRAパラメータを転送します。ただし、モデルバージョン間で十分に似ている部分のみで実行されます。

左側に、LoRA-Xソースモデルがアダプターをファインチューンする方法のスキーマがあります。これは、ターゲットモデルに合わせて調整されます。右側に、SD Eff-v1.0とSSD-1Bのターゲットモデルが、SD-v1.5とSDXLから転送されたアダプターを使用して生成された画像があります。

左側に、LoRA-Xソースモデルがアダプターをファインチューンする方法のスキーマがあります。これは、ターゲットモデルに合わせて調整されます。右側に、SD Eff-v1.0とSSD-1Bのターゲットモデルが、SD-v1.5とSDXLから転送されたアダプターを使用して生成された画像があります。

これは、再トレーニングが望ましくない、または不可能なシナリオでは実用的解決策を提供します。ただし、この方法は、特にLoRA-Xが依存する部分空間の類似性に制限されます。

この制限により、LoRA-Xは、モデルアーキテクチャが近いモデルにのみ適用できます。作者は、Open Reviewのレビューフォーラムで、LoRA-Xが容易に異なるアーキテクチャ間で転送できないことを認めています。

その他のPEFTアプローチ

LoRAsをモデルバージョン間でより移植可能にする可能性は、研究の小さなながら興味深い分野です。LoRA-Xがこの追求に貢献する主な点は、トレーニングが不要であるという主張にあります。これは、厳密には真実ではありません。ただし、LoRA-Xは、すべての以前の方法の中で最もトレーニングが少ないです。

LoRA-Xは、パラメータ効率的なファインチューニング(PEFT)方法の別のエントリです。これは、大規模事前トレーニングモデルを特定のタスクに適応させる挑戦に対処することを目的としています。この概念アプローチは、パフォーマンスを維持しながら、最小限のパラメータを変更することを目的としています。

注目すべきものは次のとおりです:

X-Adapter

X-Adapterフレームワークは、ある程度の再トレーニングを伴って、ファインチューンされたアダプターをモデル間で転送します。システムは、ベース拡散モデル(例:Stable Diffusion v1.5)から、プラグイン(ControlNetやLoRAなど)を、SDXLなどのアップグレードされた拡散モデルと直接使用できるようにします。実質的に、プラグインの「ユニバーサルアップグレーダー」として機能します。

システムは、ベースモデルのコピーを凍結させて、プラグインコネクターを保存する追加ネットワークをトレーニングすることで、これを実現します:

X-Adapterのスキーマ。 Source: https://arxiv.org/pdf/2312.02238

X-Adapterのスキーマ。 Source: https://arxiv.org/pdf/2312.02238

X-Adapterは、当初、SD1.5からSDXLへのアダプター転送のために開発およびテストされました。LoRA-Xは、より広範な変換を提供します。

DoRA(Weight-Decomposed Low-Rank Adaptation)

DoRAは、LoRAを上回るファインチューニング方法で、重み分解戦略を使用して、より完全なファインチューニングに近づきます。

DORAは、アダプターを凍結された環境でコピーするのではなく、重みの基本的なパラメータ(大きさや方向など)を変更します。 Source: https://arxiv.org/pdf/2402.09353

DORAは、アダプターを凍結された環境でコピーするのではなく、重みの基本的なパラメータ(大きさや方向など)を変更します。 Source: https://arxiv.org/pdf/2402.09353

DoRAは、ファインチューニングプロセス自体を改善することに焦点を当てており、モデル内の重みを大きさと方向に分解します(上の画像参照)。一方、LoRA-Xは、既存のファインチューンされたパラメータを異なるベースモデル間で転送することに焦点を当てています。

ただし、LoRA-Xアプローチは、DORAで開発された投影テクニックを採用しており、テストでは、DINOスコアが向上したと主張しています。

FouRA(Fourier Low Rank Adaptation)

2024年6月に公開されたFouRA方法は、Qualcomm AI Researchから来ており、テストプロンプトやテーマの一部をLoRA-Xと共有しています。

LoRAからの「Blue Fire」と「Origami」スタイルアダプターを使用して、Realistic Vision 3.0モデルをLoRAとFouRAでトレーニングした、4つのシードのLoRAの分布崩壊の例。 LoRA画像は分布崩壊と多様性の低下を示していますが、FouRAはより多様な出力を生成します。 Source: https://arxiv.org/pdf/2406.08798

LoRAからの「Blue Fire」と「Origami」スタイルアダプターを使用して、Realistic Vision 3.0モデルをLoRAとFouRAでトレーニングした、4つのシードのLoRAの分布崩壊の例。 LoRA画像は分布崩壊と多様性の低下を示していますが、FouRAはより多様な出力を生成します。 Source: https://arxiv.org/pdf/2406.08798

FouRAは、フーリエ変換アプローチを使用して、生成された画像の多様性と品質を向上させることに焦点を当てています。

ここでも、LoRA-Xは、FouRAのフーリアベースアプローチよりも優れた結果を達成しました。

両方のフレームワークはPEFTカテゴリに属していますが、異なるユースケースとアプローチを持っています。この場合、FouRAは、新しい論文の著者が関与するテストラウンドのライバルが限られているため、「数字を補う」ことになります。

SVDiff

SVDiffも、LoRA-Xとは異なる目標を持っていますが、新しい論文で強く利用されています。SVDiffは、拡散モデルのファインチューニングの効率を向上させることを目的としています。モデル内の重み行列内の値を直接変更しますが、特異ベクトルは変更しません。SVDiffは、トランク化SVDを使用し、最も大きな値のみを変更して、モデルの重みを調整します。

このアプローチでは、Cut-Mix-Unmixというデータ増強テクニックを使用します:

SVDiffにおけるマルチサブジェクト生成。 Source: https://arxiv.org/pdf/2303.11305

SVDiffにおけるマルチサブジェクト生成。 Source: https://arxiv.org/pdf/2303.11305

Cut-Mix-Unmixは、モデルの異なるサブジェクトを認識して保存するように、画像の異なるサブジェクトを1つの画像に結合することで、モデルの学習を支援するように設計されています。次に、モデルは、画像内の個々の要素を明示的に説明するプロンプトでトレーニングされます。これにより、モデルの概念を混在させるのではなく、個別の概念を認識して保存することができます。

トレーニング中、追加の正則化項は、サブジェクト間の干渉を防ぐのに役立ちます。著者の理論は、これにより、マルチサブジェクト生成が改善され、各要素が視覚的に異なるままになることを主張しています。

SVDiffは、LoRA-Xのテストラウンドから除外されていますが、コンパクトなパラメータ空間を作成することを目的としています。一方、LoRA-Xは、元のモデルの部分空間内で動作することで、異なるベースモデル間でLoRAパラメータを転送することに焦点を当てています。

結論

ここで説明した方法は、PEFTの唯一の存在ではありません。他の方法として、QLoRAとQA-LoRAPrefix TuningPrompt-Tuning、およびアダプターチューニングがあります。

「アップグレード可能なLoRA」は、ある種の錬金術的な追求であるかもしれません。確かに、LoRAモデラーが最新の最も優れた重みのリリースのために古いデータセットを再度使用する必要があることを防ぐものは、地平線上にはありません。もし、モデルバージョン間のアーキテクチャの変更やパラメータの膨張に耐えられる重みの修正のためのプロトタイプ標準があるとしたら、それはまだ文献に現れていません。したがって、それは引き続き、モデルごとにデータから抽出される必要があります。

 

2025年1月30日初めて公開

機械学習のライターであり、ヒューマンイメージ合成のドメインスペシャリスト。Metaphysic.aiでの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合に伴い退任。
ポートフォリオサイト:martinanderson.ai
コンタクト:[email protected]