Andersonův úhel
Směřování k LoRAs, které mohou přežít upgrade modelu

Od mé nedávné zprávy o růstu hobbyistů Hunyuan Video LoRAs (malých, trénovaných souborů, které mohou vkládat vlastní osobnosti do multi-miliardových parametrů text-to-video a image-to-video základních modelů), počet souvisejících LoRAs dostupných v komunitě Civit vzrostl o 185%.

Přes fakt, že neexistuje žádný zvlášť snadný nebo nízkonákladový způsob, jak vytvořit Hunyuan Video LoRA, katalog celebrit a témat LoRAs v Civit roste denně. Zdroj: https://civitai.com/
Tato sama komunita, která se snaží naučit, jak produkovat tyto ‘přidružené osobnosti’ pro Hunyuan Video (HV), také ulceruje pro slíbený release image-to-video (I2V) funkcionality v Hunyuan Video.
Co se týče otevřeného zdroje lidské obrazové syntézy, je to velká věc; v kombinaci s růstem Hunyuan LoRAs by to mohlo umožnit uživatelům transformovat fotografie lidí do videí způsobem, který neerozíruje jejich identitu, jakmile se video vyvíjí – což je目前 případ ve všech státních image-to-video generátorech, včetně Kling, Kaiber a slavného RunwayML:
Kliknutím se přehraje. Image-to-video generace z RunwayML’s state-of-the-art Gen 3 Turbo modelu. Avšak, stejně jako všechny podobné a nižší rivální modely, nemůže udržet konzistentní identitu, když se předmět otočí od kamery, a rozlišující rysy počáteční obrazovky se stanou ‘generickou difuzní ženou’. Zdroj: https://app.runwayml.com/
Developováním vlastního LoRA pro osobnost v otázce, jeden by mohl, v HV I2V workflow, použít skutečnou fotografii jako výchozí bod. To je lepší ‘semínko’ než poslat náhodné číslo do modelového latentního prostoru a usadit se pro jakýkoli výsledný semantický scénář. Poté by jeden mohl použít LoRA, nebo více LoRAs, pro udržení konzistence identity, vlasů, oděvu a dalších zásadních aspektů generace.
Potenciálně, dostupnost takové kombinace by mohla představovat jednu z nejepochálních posunů v generativní AI od spuštění Stable Diffusion, s formidabilní generativní silou předanou otevřeným zdrojovým nadšencům, bez regulace (nebo ‘gatekeeping’, pokud dáváte přednost) poskytované obsahovými cenzory v současné generaci populárních gen-vid systémů.
Když píšu, Hunyuan image-to-video je nezaškrtnutý ‘to do’ v Hunyuan Video GitHub repozitáři, s komunitou hobbyistů, kteří hlásí (anekdoticky) Discord komentář od Hunyuan developera, který údajně prohlásil, že release této funkcionality byl odložen na pozdější dobu v Q1 kvůli modelu být ‘too uncensored’.

Oficiální seznam funkcí pro Hunyuan Video. Zdroj: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan
Přesné nebo ne, repozitářový vývojáři podstatně dodali na zbytek Hunyuan seznamu, a proto Hunyuan I2V vypadá, že přijde nakonec, ať už cenzurovaný, necenzurovaný nebo nějakým způsobem ‘unlockable’.
Ale jak můžeme vidět v seznamu výše, I2V release je zřejmě samostatný model úplně – což dělá poměrně nepravděpodobným, že jakýkoli z aktuálních LoRAs v Civit a jinde bude fungovat s ním.
V tomto (nyní) předvídatelném scénáři, LoRA tréninkové rámce, jako Musubi Tuner a OneTrainer budou buď odloženy nebo resetovány v ohledu na podporu nového modelu. Mezitím, jeden nebo dva z nejtechničtějších (a podnikatelských) YouTube AI luminářů budou vydírat své řešení přes Patreon, dokud scéna nedojde.
Únava z upgradu
Téměř nikdo nezažívá únavu z upgradu tolik jako LoRA nebo fine-tuning nadšenec, protože rychlý a konkurenční tempo změn v generativní AI podporuje modelové foundry, jako Stability.ai, Tencent a Black Forest Labs, aby produkovaly větší a (někdy) lepší modely na maximální možné frekvenci.
Od té doby, co tyto nové a vylepšené modely budou mít alespoň odlišné biasy a váhy, a více běžně budou mít odlišnou škálou a/nebo architekturu, to znamená, že fine-tuning komunita musí získat své datové sady znovu a zopakovat náročný tréninkový proces pro novou verzi.
Proto je k dispozici mnoho typů Stable Diffusion LoRA verzí na Civit:

Upgrade trail, visualizovaný v search filter opcích na civit.ai
Pоскольку žádný z těchto lehkých LoRA modelů není kompatibilní s vyššími nebo nižšími modelovými verzemi, a protože mnoho z nich má závislosti na populárních velkých mergech a fine-tunech, které dodržují starší model, významná část komunity má tendenci držet se ‘legacy’ release, podobně jako zákaznická loajalita k Windows XP přetrvávala roky po oficiálním konci podpory.
Adaptace na změnu
Tento předmět přichází na mysl kvůli nové práci od Qualcomm AI Research, která tvrdí, že vyvinula metodu, pomocí které lze stávající LoRAs ‘upgradovat’ na nově vydanou modelovou verzi.

Příklad konverze LoRAs napříč modelovými verzemi. Zdroj: https://arxiv.org/pdf/2501.16559
Tato metoda, nazvaná LoRA-X, nepředstavuje volnou konverzi mezi všemi modely stejného typu (tj. text-to-image modely nebo Large Language Models [LLMs]), ale autoři prokázali účinnou transliteraci LoRA z Stable Diffusion v1.5 > SDXL a konverzi LoRA pro textový model TinyLlama 3T na TinyLlama 2.5T.
LoRA-X přenáší LoRA parametry napříč různými základními modely zachováním adapteru v subspace zdrojového modelu; ale pouze v částech modelu, které jsou dostatečně podobné napříč modelovými verzemi.

Na levé straně, schéma pro způsob, jakým LoRA-X zdroj modelu fine-tune adapter, který je pak upraven pro cílový model. Na pravé straně, obrázky generované cílovými modely SD Eff-v1.0 a SSD-1B, po aplikaci adapterů přenesených z SD-v1.5 a SDXL bez dalšího tréninku.
Zatímco tato nabídka praktické řešení pro scénáře, kde je re-trénink nežádoucí nebo nemožný (jako změna licence na původních tréninkových datech), metoda je omezena na podobné modelové architektury, mezi jinými omezeními.
Though tohle je vzácný výlet do málo prozkoumaného pole, won’t prozkoumáme tuto práci v hloubce kvůli LoRA-X’s mnoha nedostatkům, jako je patrné z komentářů jejích kritiků a poradců na Open Review.
Metodův závislost na subspace podobnosti omezuje jeho aplikaci na úzce související modely, a autoři uznali v recenzním fóru, že LoRA-X nemůže být snadno přenesen napříč významně odlišnými architekturami
Ostatní přístupy PEFT
Možnost udělat LoRAs více přenositelnými napříč verzemi je malý, ale zajímavý směr studia v literatuře, a hlavní příspěvek, který LoRA-X dělá k tomuto úsilí, je jeho tvrzení, že nevyžaduje žádný trénink. To není přísně pravda, pokud si přečtete práci, ale vyžaduje nejméně tréninku ze všech předchozích metod.
LoRA-X je další položka v kánonu Parameter-Efficient Fine-Tuning (PEFT) metod, které řeší výzvu adaptace velkých předtrénovaných modelů na konkrétní úkoly bez rozsáhlého re-tréninku. Tento konceptuální přístup má za cíl upravit minimální počet parametrů, zatímco zachovává výkon.
Mezi nimi jsou:
X-Adapter
X-Adapter framework přenáší fine-tune adapters napříč modely s určitou mírou re-tréninku. Systém má za cíl umožnit předtrénované plug-and-play moduly (jako ControlNet a LoRA) z základního difuzního modelu (tj. Stable Diffusion v1.5) pracovat přímo s upgradovaným difuzním modelem, jako je SDXL, bez re-tréninku – efektivní jako ‘univerzální upgrader’ pro pluginy.
Systém dosahuje tohoto cíle tím, že trénuje další síť, která kontroluje upgradovaný model, pomocí zmrazené kopie základního modelu pro zachování plugin konektorů:

Schéma pro X-Adapter. Zdroj: https://arxiv.org/pdf/2312.02238
X-Adapter byl původně vyvinut a testován pro přenos adapterů z SD1.5 na SDXL, zatímco LoRA-X nabízí širší řadu transliterací.
DoRA (Weight-Decomposed Low-Rank Adaptation)
DoRA je vylepšená fine-tuning metoda, která zlepšuje LoRA pomocí strategie dekompozice váhy, která se více podobá plnému fine-tuning:

DoRA nezkouší pouze kopírovat adapter v zmrazeném prostředí, jako LoRA-X, ale místo toho mění základní parametry váhy, jako je velikost a směr. Zdroj: https://arxiv.org/pdf/2402.09353
DoRA se zaměřuje na zlepšení fine-tuning procesu, rozkládající modelové váhy na velikost a směr (viz obrázek výše). LoRA-X se zaměřuje na umožnění přenosu stávajících fine-tune parametrů mezi různými základními modely
Nicméně, LoRA-X přístup adaptuje projekční techniky vyvinuté pro DORA, a v testech proti tomuto staršímu systému tvrdí, že má lepší DINO skóre.
FouRA (Fourier Low Rank Adaptation)
Publikovaná v červnu 2024, FouRA metoda pochází, stejně jako LoRA-X, z Qualcomm AI Research, a sdílí některé z jeho testovacích promptů a témat.

Příklad distribuční kolaps v LoRA, z 2024 FouRA práce, používající Realistic Vision 3.0 model trénovaný s LoRA a FouRA pro ‘Blue Fire’ a ‘Origami’ styl adapters, napříč čtyřmi semeny. LoRA obrázky vykazují distribuční kolaps a sníženou diverzitu, zatímco FouRA generuje více variabilních výstupů. Zdroj: https://arxiv.org/pdf/2406.08798
FouRA se zaměřuje na zlepšení diverzity a kvality generovaných obrázků adaptací LoRA v frekvenční doméně, pomocí Fourier transform přístupu.
Zde, opět, LoRA-X dosáhl lepších výsledků než Fourier-založený přístup FouRA.
Ačkoli oba rámce spadají do kategorie PEFT, mají velmi odlišné použití a přístupy; v tomto případě je FouRA zřejmě ‘doplňující čísla’ pro testovací kolo s omezenými rivaly pro nové papírové autory.
SVDiff také má odlišné cíle než LoRA-X, ale je silně využíván v novém papíru. SVDiff je navržen pro zlepšení efektivity fine-tuning difuzních modelů a přímo mění hodnoty uvnitř modelových váhových matic, zatímco zachovává singulární vektory nezměněné. SVDiff používá truncated SVD, měnící pouze největší hodnoty, pro úpravu modelových váh.
Tento přístup používá data augmentační techniku nazvanou Cut-Mix-Unmix:

Multi-subjekt generace funguje jako koncept-izolující systém v SVDiff. Zdroj: https://arxiv.org/pdf/2303.11305
Cut-Mix-Unmix je navržen pro pomoc difuznímu modelu naučit se rozpoznávat více odlišných konceptů bez jejich míchání. Centrální myšlenka spočívá v tom, že vezme obrázky různých subjektů a spojí je do jednoho obrázku. Poté je model trénován s prompty, které explicitně popisují samostatné prvky v obrázku. To nutí model rozpoznat a zachovat odlišné koncepty místo jejich míchání.
Během tréninku, další regularizace termín pomáhá zabránit interferenci mezi subjekty. Autorovy teorie tvrdí, že to usnadňuje zlepšení multi-subjekt generace, kde každý prvek zůstává vizuálně odlišný, místo toho, aby se spojil.
SVDiff, vyloučený z LoRA-X testovacího kola, má za cíl vytvořit kompaktní parametrický prostor. LoRA-X, místo toho, se zaměřuje na přenositelnost LoRA parametrů napříč různými základními modely, fungujícími v subspace původního modelu.
Závěr
Metody diskutované zde nejsou jedinými obyvateli PEFT. Další zahrnují QLoRA a QA-LoRA; Prefix Tuning; Prompt-Tuning; a adapter-tuning, mezi jinými.
‘Upgradovatelný LoRA’ je, možná, alchymistický úkol; určitě, nic není okamžitě na obzoru, co by zabránilo LoRA modelérům táhnout své staré datové sady znovu pro nejnovější a nejlepší váhy vydání. Pokud existuje nějaký možný prototypový standard pro váhové revize, schopný přežít změny v architektuře a nafukování parametrů mezi modelovými verzemi, dosud se neobjevil v literatuře, a bude muset být dále extrahován z dat na základě modelu.
První publikováno ve čtvrtek, 30. ledna 2025












