Andersonův úhel

Boj o zero-shot přizpůsobení v generativní AI

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
Timothy Chalomet replaces Jack Nicholson in The Shining (1980), thanks to the new HyperLoRA system. Source: https://arxiv.org/pdf/2503.16944

Pokud chcete vložit sami sebe do populárního nástroje pro generování obrázků nebo videí – ale ještě nejste dostatečně slavní, aby vás základní model rozpoznal – budete muset vyškolit model low-rank adaptation (LoRA) pomocí kolekce svých vlastních fotografií. Jakmile bude tento personalizovaný model LoRA vytvořen, umožní generativnímu modelu zahrnout vaši identitu do budoucích výstupů.

To se běžně nazývá přizpůsobení v oblasti výzkumu syntézy obrázků a videí. Poprvé se objevilo několik měsíců po uvedení Stable Diffusion v létě 2022, kdy projekt Google Research DreamBooth nabídl high-gigabyte modely přizpůsobení, v uzavřené schématu, které bylo brzy adaptováno nadšenci a vydáno komunitě.

Modely LoRA následovaly rychle a nabízely snadnější výuku a mnohem lehčí velikosti souborů, při minimálním nebo žádném nákladu na kvalitu, rychle ovládly scénu přizpůsobení pro Stable Diffusion a jeho následovníky, pozdější modely jako Flux, a nyní nové generativní video modely jako Hunyuan Video a Wan 2.1.

Opakování

Problém je, jak jsme již dříve poznamenali, že každá nová verze modelu vyžaduje novou generaci modelů LoRA, což představuje značnou frakci pro producenty LoRA, kteří mohou vyškolit řadu personalizovaných modelů, pouze aby zjistili, že aktualizace modelu nebo populárnější nový model znamená, že musí začít znovu.

Proto se zero-shot přístupy k přizpůsobení staly silným směrem v literatuře. V tomto scénáři není třeba křivit dataset a školit vlastní sub-model, stačí dodat jednu nebo více fotografií subjektu, který má být vložen do generování, a systém interpretuje tyto vstupní zdroje do smíšeného výstupu.

Níže vidíme, že kromě face-swappingu může systém tohoto typu (zde pomocí PuLID) také zahrnout ID hodnoty do stylu přenosu:

Příklady přenosu obličeje pomocí systému PuLID. Zdroj: https://github.com/ToTheBeginning/PuLID?tab=readme-ov-file

Příklady přenosu obličeje pomocí systému PuLID. Zdroj: https://github.com/ToTheBeginning/PuLID?tab=readme-ov-file

Zatímco nahrazení zdlouhavého a křehkého systému jako LoRA generickým adaptérem je skvělý (a populární) nápad, je to také výzva; extrémní pozornost k detailu a pokrytí získané v procesu školení LoRA je velmi obtížné napodobit v jednorázovém modelu IP-Adapter, který musí odpovídat úrovni detailu a flexibility LoRA bez předchozí výhody analýzy komplexního souboru identifikačních obrázků.

HyperLoRA

S tímto na mysli, je tu zajímavá nová práce od ByteDance, která navrhuje systém, který generuje skutečný kód LoRA na místě, což je目前 jedinečné mezi zero-shot řešeními:

Vlevo, vstupní obrázky. Vpravo od toho, flexibilní rozsah výstupu založený na vstupních obrázcích, efektivní výroba deepfake herců Anthonyho Hopkinse a Anne Hathaway. Zdroj: https://arxiv.org/pdf/2503.16944

Vlevo, vstupní obrázky. Vpravo od toho, flexibilní rozsah výstupu založený na vstupních obrázcích, efektivní výroba deepfake herců Anthonyho Hopkinse a Anne Hathaway. Zdroj: https://arxiv.org/pdf/2503.16944

Práce uvádí:

‘Adapter-based techniky, jako je IP-Adapter, zmrazí parametry základního modelu a využijí architekturu plug-in, aby umožnily zero-shot inference, ale často vykazují nedostatek přirozenosti a autenticity, které nejsou možné přehlédnout při úkolech syntézy portrétů.

‘[My] představujeme parametr-efektivní adaptivní generativní metodu nazvanou HyperLoRA, která využívá adaptivní plug-in síť k generování LoRA váh, slučující superioritní výkon LoRA s zero-shot schopností schématu adapteru.

‘Prostřednictvím našeho pečlivě navrženého síťového struktury a školicí strategie dosahujeme zero-shot personalizované generace portrétů (podporující jak jednoduché, tak i vícesouborové vstupní obrázky) s vysokou fotorealističností, věrností a editabilitou.’

Nejužitečnější je, že systém, jakmile je vyškoleno, může být použit s existujícím ControlNet, umožňujícím vysokou míru specifičnosti generování:

Timothy Chalomet dělá neočekávaně veselý výskyt ve filmu The Shining (1980), založený na třech vstupních fotografiích v HyperLoRA.

Timothy Chalomet dělá neočekávaně veselý výskyt ve filmu The Shining (1980), založený na třech vstupních fotografiích v HyperLoRA, s maskou ControlNet definující výstup (v koncertu s textovým promptem).

Jakmile se týká toho, zda bude nový systém kdy dostupný pro koncové uživatele, ByteDance má rozumnou historii v tomto ohledu, když vydal velmi silný LatentSync framework pro synchronizaci rtů a nedávno vydal také InfiniteYou framework.

Negativně, práce nedává žádný náznak záměru vydat, a školicí zdroje potřebné k rekreaci práce jsou tak enormní, že by to bylo obtížné pro komunitu nadšenců rekreovat (jako u DreamBooth).

Nová práce se nazývá HyperLoRA: Parametr-efektivní adaptivní generace pro syntézu portrétů, a pochází od sedmi výzkumníků z ByteDance a jeho specializovaného oddělení Intelligent Creation.

Metoda

Nová metoda využívá latentní difuzní model Stable Diffusion (LDM) SDXL jako základový model, ačkoli principy se zdají být aplikovatelné na difuzní modely obecně (i když školicí nároky – viz níže – mohou učinit obtížným aplikovat je na generativní video modely).

Školicí proces pro HyperLoRA je rozdělen do tří fází, z nichž každá je navržena tak, aby izolovala a zachovala specifické informace v naučených váhech. Cílem tohoto postupu je zabránit znečištění identifikačních rysů irelevantními prvky, jako je oblečení nebo pozadí, a současně dosáhnout rychlé a stabilní konvergence.

Konceptuální schéma pro HyperLoRA. Model je rozdělen do 'Hyper ID-LoRA' pro identifikační rysy a 'Hyper Base-LoRA' pro pozadí a oblečení. Toto rozdělení snižuje únik rysů. Během školení jsou zmrazeny základní a kódovací moduly SDXL, a aktualizovány pouze moduly HyperLoRA. Při inferenci je vyžadován pouze ID-LoRA k generování personalizovaných obrázků.

Konceptuální schéma pro HyperLoRA. Model je rozdělen do ‘Hyper ID-LoRA’ pro identifikační rysy a ‘Hyper Base-LoRA’ pro pozadí a oblečení. Toto rozdělení snižuje únik rysů. Během školení jsou zmrazeny základní a kódovací moduly SDXL, a aktualizovány pouze moduly HyperLoRA. Při inferenci je vyžadován pouze ID-LoRA k generování personalizovaných obrázků.

První fáze se zaměřuje výhradně na naučení ‘Base-LoRA’ (dolní levá část schématu výše), který zachycuje identifikačně irelevantní detaily.

K vynucení tohoto rozdělení výzkumníci záměrně rozmlžili obličej ve školicích obrázcích, aby model mohl zachytit věci, jako je pozadí, osvětlení a póza – ale ne identitu. Tato ‘rozehřívací’ fáze působí jako filtr, odstraňující nízkoúrovňové rušivé prvky, než začne identifikačně specifické učení.

Ve druhé fázi je zaveden ‘ID-LoRA’ (horní levá část schématu výše). Zde je identifikační rys kódován pomocí dvou paralelních cest: CLIP Vision Transformer (CLIP ViT) pro strukturální rysy a InsightFace AntelopeV2 encoder pro abstraktnější identifikační reprezentace.

Přechodný přístup

CLIP rysy pomáhají modelu konvergovat rychle, ale riskují přeučení, zatímco Antelope vložky jsou stabilnější, ale pomalejší k školení. Proto systém začíná spoléhat se více na CLIP, a postupně fázově Antelope, aby se zabránilo nestabilitě.

Ve třetí fázi jsou zamrzlé zcela CLIP-guided pozornostní vrstvy. Pouze AntelopeV2-spojené pozornostní moduly pokračují ve školení, umožňující modelu rafinovat identifikační uchování bez degradace věrnosti nebo obecnosti dříve naučených komponent.

Tento fázový struktura je v podstatě pokus o disentanglement. Identifikační a neidentifikační rysy jsou nejprve odděleny, a poté rafinovány nezávisle. Je to metodičtější odpověď na obvyklé selhání módů personalizace: identifikační drift, nízká editabilita a přeučení na nahodilé rysy.

Zatímco vážíte

Po CLIP ViT a AntelopeV2 extrahují strukturální a identifikační rysy z daného portrétu, jsou získané rysy předány perceiver resampler (odvozený z výše zmíněného projektu IP-Adapter) – transformer-založený modul, který mapuje rysy na kompaktní sadu koeficientů.

Dva samostatné resamplery jsou použity: jeden pro generování Base-LoRA váh (které kódují pozadí a neidentifikační prvky) a druhý pro ID-LoRA váhy (které se zaměřují na identifikační rysy).

Schéma pro síť HyperLoRA.

Schéma pro síť HyperLoRA.

Výstupní koeficienty jsou poté lineárně kombinovány se sadou naučených LoRA základních matic, produkujících plné LoRA váhy bez potřeby jemného ladění základního modelu.

Tento přístup umožňuje systému generovat personalizované váhy celkem na místě, používající pouze image kódéry a lehkou projekci, zatímco stále využívá schopnost LoRA modifikovat chování základního modelu přímo.

Data a testy

K školení HyperLoRA výzkumníci použili podmnožinu 4,4 milionu obrázků obličeje z datové sady LAION-2B (nyní nejlépe známé jako zdroj dat pro původní modely Stable Diffusion z roku 2022).

InsightFace byl použit k filtrování neportrétních obličeji a více obrázků. Obrázky byly poté anotovány systémem BLIP-2 pro popisky.

Co se týče data augmentation, obrázky byly náhodně ořezány kolem obličeje, ale vždy se zaměřovaly na oblast obličeje.

Respektivní LoRA řady musely přizpůsobit dostupné paměti ve školicí konfiguraci. Proto LoRA řady pro ID-LoRA byly nastaveny na 8, a řady pro Base-LoRA na 4, zatímco osmikrokové gradient accumulation bylo použito k simulaci větší velikosti batche než bylo skutečně možné na hardwaru.

Výzkumníci školovali moduly Base-LoRA, ID-LoRA (CLIP), a ID-LoRA (identifikační vložka) sekvenčně po 20K, 15K, a 55K iteracích. Během školení ID-LoRA byli vzorkováni ze tří kondičních scénářů s pravděpodobnostmi 0,9, 0,05, a 0,05.

Systém byl implementován pomocí PyTorch a Diffusers, a celý školicí proces trval přibližně deset dní na 16 NVIDIA A100 GPU*.

ComfyUI testy

Autoři postavili workflow v ComfyUI syntetizační platformě, aby porovnali HyperLoRA s třemi riválními metodami: InstantID; výše zmíněný IP-Adapter, ve formě IP-Adapter-FaceID-Portrait frameworku; a výše zmíněný PuLID. Konsistentní semena, prompty a vzorkovací metody byly použity napříč všemi rámci.

Autoři poznamenávají, že adapter-založené (ne LoRA-založené) metody obecně vyžadují nižší Classifier-Free Guidance (CFG) měřítko, zatímco LoRA (včetně HyperLoRA) je více permissivní v tomto ohledu.

Proto výzkumníci použili open-source SDXL fine-tuned checkpoint variant LEOSAM’s Hello World napříč testy. Pro kvantitativní testy byla použita Unsplash-50 obrazová datová sada.

Metriky

Pro benchmark věrnosti autoři měřili podobnost obličeje pomocí kosinových vzdáleností mezi CLIP obrazovými vložkami (CLIP-I) a samostatnými identifikačními vložkami (ID Sim) extrahovanými pomocí CurricularFace, modelu, který nebyl použit během školení.

Každá metoda generovala čtyři high-resolution portréty na identitu v testovací sadě, s výsledky poté průměrovány.

Editabilita byla hodnocena ve dvou směrech: srovnáním CLIP-I skórů mezi výstupy s a bez identifikačních modulů (aby se vidělo, jak moc identifikační omezení změnily obraz); a měřením CLIP obraz-textové shody (CLIP-T) napříč deseti promptovými variantami pokrývajícími styl vlasů, doplňky, oblečení, a pozadí.

Autoři zahrnuli Arc2Face základový model do porovnání – benchmark, který byl vyškoleno na pevných popiscích a ořezaných oblastech obličeje.

Pro HyperLoRA byly testovány dvě varianty: jedna používající pouze modul ID-LoRA, a druhá používající jak ID-, tak Base-LoRA, s druhým váženým na 0,4. Zatímco Base-LoRA zlepšila věrnost, mírně omezila editabilitu.

Výsledky pro počáteční kvantitativní srovnání.

Výsledky pro počáteční kvantitativní srovnání.

Z kvantitativních testů autoři komentují:

‘Base-LoRA pomáhá zlepšit věrnost, ale omezuje editabilitu. Ačkoli náš design odděluje obrazové rysy do různých LoRA, je těžké se vyhnout úniku vzájemně. Proto můžeme upravit váhu Base-LoRA, aby se přizpůsobila různým aplikacím.

‘Naše HyperLoRA (Full a ID) dosáhla nejlepší a druhou nejlepší obličejovou věrnost, zatímco InstantID ukázal nadřazenost v obličejové ID podobnosti, ale nižší obličejovou věrnost.

‘Obě tyto metriky by měly být společně zvažovány, aby se vyhodnotila věrnost, protože obličejová ID podobnost je abstraktnější a obličejová věrnost odráží více detailů.’

V kvalitativních testech se různé kompromisy, které jsou součástí základní nabídky, dostávají do popředí (pozor, nemáme prostor reprodukovat všechny obrázky pro kvalitativní výsledky, a odkazujeme čtenáře na zdroj práce pro více obrázků v lepší kvalitě):

Kvalitativní srovnání. Z vrcholu dolů, prompty použité byly: bílé tričko a vlčí uši (viz práce pro další příklady).

Kvalitativní srovnání. Z vrcholu dolů, prompty použité byly: ‘bílé tričko’ a ‘vlčí uši’ (viz práce pro další příklady).

Zde autoři komentují:

‘Kůže portrétů generovaných IP-Adapterem a InstantID má zjevnou AI-generovanou texturu, která je trochu [přesytná] a daleko od fotorealističnosti.

‘Je to běžná slabina adapter-založených metod. PuLID zlepšuje tento problém oslabením intruze do základního modelu, překonávající IP-Adapter a InstantID, ale stále trpící rozmazáním a nedostatkem detailů.

‘Naopak, LoRA přímo modifikuje váhy základního modelu, místo zavedení dalších pozornostních modulů, obvykle generuje vysoce detailní a fotorealistické obrázky.’

Autoři tvrdí, že protože HyperLoRA modifikuje váhy základního modelu přímo, místo spoléhání se na externí pozornostní moduly, zachovává nelineární kapacitu tradičních LoRA-založených metod, potenciálně nabízející výhodu ve věrnosti a umožňující lepší zachycení jemných detailů, jako je barva duhovky.

V kvalitativních porovnáním práce tvrdí, že rozložení HyperLoRA byla více koherentní a lépe sladěná s prompty, a podobná těm, které produkoval PuLID, zatímco zřetelně silnější než InstantID nebo IP-Adapter (které občas selhaly při dodržování promptů nebo produkovaly ne přirozené kompozice).

Další příklady generací ControlNet s HyperLoRA.

Další příklady generací ControlNet s HyperLoRA.

Závěr

Stálý proud různých one-shot přizpůsobovacích systémů za poslední rok a půl získal kvalitu zoufalství. Velmi málo z nabídek udělalo pozoruhodný pokrok ve stavu umění; a ty, které pokročily, mají enormní školicí nároky a/nebo extrémně komplexní nebo náročné inferenční nároky.

Zatímco školicí režim HyperLoRA je stejně dechberoucí jako mnohé nedávné podobné položky, alespoň jeden skončí s modelem, který může zvládnout ad hoc přizpůsobení přímo.

Z dodatkového materiálu práce je patrné, že inferenční rychlost HyperLoRA je lepší než IP-Adapter, ale horší než dvě předchozí metody – a že tyto čísla jsou založena na NVIDIA V100 GPU, který není typickým spotřebitelským hardwarovým vybavením (i když novější ‘domácí’ NVIDIA GPU mohou odpovídat nebo překonat maximum 32GB VRAM V100).

Inferenční rychlosti srovnávacích metod, v milisekundách.

Inferenční rychlosti srovnávacích metod, v milisekundách.

Je spravedlivé říci, že zero-shot přizpůsobení zůstává nevyřešeným problémem z praktického hlediska, protože významné hardwarové požadavky HyperLoRA jsou zřejmě v rozporu s jeho schopností produkovat skutečně dlouhodobý jediný základový model.

 

* Reprezentující buď 640GB nebo 1280GB VRAM, v závislosti na tom, který model byl použit (to není specifikováno)

Poprvé publikováno v pondělí, 24. března 2025

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai