Andersons vinkel

Mot LoRAs som kan Ãķverleva modelluppgraderingar

mm
LÃĪgg till Unite.AI bland dina fÃķredragna kÃĪllor pÃĨ Google
ChatGPT-4o: variation on ‘a 1792x1024 feature article reportage image of a skip full of discarded metal figurines, featuring realistic men and women of all ages and all types’

Sedan min senaste tÃĪckning av tillvÃĪxten i hobbyist Hunyuan Video LoRAs (smÃĨ, trÃĪnade filer som kan injicera anpassade personligheter i multi-miljardparametrars text-till-video och bild-till-video grundmodeller), har antalet relaterade LoRAs som finns tillgÃĪngliga i Civit-samhÃĪllet Ãķkat med 185%.

Trots att det inte finns nÃĨgra sÃĪrskilt enkla eller lÃĨginsatsmetoder fÃķr att skapa en Hunyuan Video LoRA, vÃĪxer katalogen Ãķver kÃĪndis- och tematiska LoRAs pÃĨ Civit dagligen. KÃĪlla: https://civitai.com/

Trots att det inte finns nÃĨgra sÃĪrskilt enkla eller lÃĨginsatsmetoder fÃķr att skapa en Hunyuan Video LoRA, vÃĪxer katalogen Ãķver kÃĪndis- och tematiska LoRAs pÃĨ Civit dagligen. KÃĪlla: https://civitai.com/

Samma samhÃĪlle som kÃĪmpar fÃķr att lÃĪra sig hur man producerar dessa “tillÃĪggs-personligheter” fÃķr Hunyuan Video (HV) ÃĪr ocksÃĨ ulcererar fÃķr den utlovade utgÃĨvan av en bild-till-video (I2V) funktion i Hunyuan Video.

Med avseende pÃĨ Ãķppen kÃĪllkod fÃķr mÃĪnsklig bildsyntes, ÃĪr detta en stor sak; i kombination med tillvÃĪxten av Hunyuan LoRAs, kunde detta mÃķjliggÃķra fÃķr anvÃĪndare att omvandla foton av mÃĪnniskor till videor pÃĨ ett sÃĪtt som inte urholkar deras identitet nÃĪr videon utvecklas – vilket fÃķr nÃĪrvarande ÃĪr fallet i alla state-of-the-art bild-till-video-genererare, inklusive Kling, Kaiber och den mycket firade RunwayML:

Klicka fÃķr att spela. En bild-till-video-generering frÃĨn RunwayML:s state-of-the-art Gen 3 Turbo-modell. Men, liksom alla liknande och mindre rivalmodeller, kan den inte upprÃĪtthÃĨlla en konsekvent identitet nÃĪr ÃĪmnet vÃĪnder sig bort frÃĨn kameran, och de distinkta dragen i startbilden blir en “generisk diffusions-kvinna”. KÃĪlla: https://app.runwayml.com/

Genom att utveckla en anpassad LoRA fÃķr personligheten i frÃĨga, kunde man, i en HV I2V-arbetsflÃķde, anvÃĪnda en riktig foto av dem som en startpunkt. Detta ÃĪr en mycket bÃĪttre “frÃķ” ÃĪn att skicka in ett slumpmÃĪssigt nummer i modellens latenta utrymme och acceptera vad som helst semantiskt scenario som resulterar. Man kunde sedan anvÃĪnda LoRA, eller flera LoRAs, fÃķr att upprÃĪtthÃĨlla konsekvensen av identitet, frisyrer, klÃĪder och andra avgÃķrande aspekter av en generation.

Potentiellt, kunde tillgÃĪngligheten av en sÃĨdan kombination representera en av de mest epokala skiftningarna i generativ AI sedan lanseringen av Stable Diffusion, med formidabel generativ kraft som ÃķverlÃĪmnas till Ãķppen kÃĪllkod-entusiaster, utan den reglering (eller “gatekeeping”, om du fÃķredrar) som tillhandahÃĨlls av innehÃĨllscensurerna i den nuvarande skaran av populÃĪra gen-vid-system.

Som jag skriver, ÃĪr Hunyuan bild-till-video en outredd ‘att-gÃķra’-punkt i Hunyuan Video GitHub-repo, med hobbyistsamhÃĪllet som rapporterar (anekdotiskt) en Discord-kommentar frÃĨn en Hunyuan-utvecklare, som tydligen sa att utgÃĨvan av denna funktion har skjutits upp till nÃĨgon gÃĨng senare i Q1 pÃĨ grund av att modellen ÃĪr ‘fÃķr ocensurerad’.

Den officiella funktionen fÃķr utgivningschecklista fÃķr Hunyuan Video. KÃĪlla: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan

Den officiella funktionen fÃķr utgivningschecklista fÃķr Hunyuan Video. KÃĪlla: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan

Exakt eller inte, har repo-utvecklarna i stort sett levererat pÃĨ resten av Hunyuan-checklistan, och dÃĪrfÃķr verkar Hunyuan I2V vara pÃĨ vÃĪg att anlÃĪnda sÃĨ smÃĨningom, oavsett om den ÃĪr censurerad, ocensurerad eller pÃĨ nÃĨgot sÃĪtt “lÃĨsbar”.

Men som vi kan se i listan ovan, ÃĪr I2V-utgÃĨvan en separat modell i sig – vilket gÃķr det ganska osannolikt att nÃĨgon av de nuvarande blomstrande skÃķrden av HV LoRAs pÃĨ Civit och andra stÃĪllen kommer att fungera med den.

I detta (nu) fÃķrutsÃĪgbara scenario, kommer LoRA-trÃĪningsramar som Musubi Tuner och OneTrainer att antingen sÃĪttas tillbaka eller ÃĨterstÃĪllas i frÃĨga om att stÃķdja den nya modellen. Under tiden kommer en eller tvÃĨ av de mest tekniskt kunniga (och entreprenÃķriella) YouTube AI-luminarierna att utpressa sina lÃķsningar via Patreon tills scenen kommer ikapp.

UppgraderingstrÃķtthet

Knappast nÃĨgon upplever uppdateringstrÃķtthet sÃĨ mycket som en LoRA- eller fine-tuning-entusiast, eftersom den snabba och konkurrenskraftiga takten i generativ AI uppmuntrar modelljÃĪrnverk som Stability.ai, Tencent och Black Forest Labs att producera stÃķrre och (ibland) bÃĪttre modeller i den maximala mÃķjliga frekvensen.

Sedan dessa nya och fÃķrbÃĪttrade modeller kommer att ha ÃĨtminstone olika bias och vikter, och oftare kommer att ha en annan skala och/eller arkitektur, innebÃĪr detta att fine-tuning-samhÃĪllet mÃĨste fÃĨ ut sina datamÃĪngder igen och upprepa den mÃķdosamma trÃĪningsprocessen fÃķr den nya versionen.

DÃĪrfÃķr finns det en mÃĨngfald av Stable Diffusion LoRA-versionstyper tillgÃĪngliga pÃĨ Civit:

UppgraderingsspÃĨret, visualiserat i sÃķkfilteralternativ pÃĨ civit.ai

UppgraderingsspÃĨret, visualiserat i sÃķkfilteralternativ pÃĨ civit.ai

Eftersom ingen av dessa lÃĪtta LoRA-modeller ÃĪr kompatibla med hÃķgre eller lÃĪgre modellversioner, och eftersom mÃĨnga av dem har beroenden av populÃĪra stora skalfÃķrÃĪndringar och fine-tunes som fÃķljer en ÃĪldre modell, tenderar en betydande del av samhÃĪllet att stanna kvar med en “ÃĪldre” version, pÃĨ samma sÃĪtt som kundlojalitet till Windows XP bestod ÃĨr efter officiellt slutat stÃķd.

Anpassning till fÃķrÃĪndring

Detta ÃĪmne kommer i ÃĨtanke pÃĨ grund av en ny artikel frÃĨn Qualcomm AI Research som hÃĪvdar att de har utvecklat en metod dÃĪr befintliga LoRAs kan “uppgraderas” till en nyligen slÃĪppt modellversion.

Exempel pÃĨ konvertering av LoRAs mellan modellversioner. KÃĪlla: https://arxiv.org/pdf/2501.16559

Exempel pÃĨ konvertering av LoRAs mellan modellversioner. KÃĪlla: https://arxiv.org/pdf/2501.16559

Denna metod, som kallas LoRA-X, ÃķverfÃķr LoRA-parametrar mellan olika basmodeller genom att bevara adaptern inom kÃĪllmodellens underutrymme; men endast i delar av modellen som ÃĪr tillrÃĪckligt lika mellan modellversioner.

Till vÃĪnster, ett schema fÃķr hur LoRA-X-kÃĪllmodellen finjusterar en adapter, som sedan justeras fÃķr att passa mÃĨlmodellen med hjÃĪlp av dess egen interna struktur. Till hÃķger, bilder genererade av mÃĨlmodellerna SD Eff-v1.0 och SSD-1B, efter att ha applicerat adapter som ÃķverfÃķrts frÃĨn SD-v1.5 och SDXL utan ytterligare trÃĪningsdata.

Till vÃĪnster, ett schema fÃķr hur LoRA-X-kÃĪllmodellen finjusterar en adapter, som sedan justeras fÃķr att passa mÃĨlmodellen.

Medan detta erbjuder en praktisk lÃķsning fÃķr scenarier dÃĪr omtrÃĪning ÃĪr ÃķnskvÃĪrt eller omÃķjligt (sÃĨsom en ÃĪndring av licensen fÃķr den ursprungliga trÃĪningsdatan), ÃĪr metoden begrÃĪnsad till liknande modellarkitekturer, bland annat.

FastÃĪn detta ÃĪr en sÃĪllsynt utflykt i ett understuderat omrÃĨde, kommer vi inte att undersÃķka denna artikel i djupet pÃĨ grund av LoRA-X:s mÃĨnga brister, som visas av kommentarer frÃĨn dess kritiker och rÃĨdgivare pÃĨ Open Review.

Metodens beroende av underutrymmeslikhet begrÃĪnsar dess tillÃĪmpning till nÃĪra relaterade modeller, och fÃķrfattarna har medgivit i granskningsforumet att LoRA-X inte kan enkelt ÃķverfÃķras mellan betydligt olika arkitekturer.

Andra PEFT-ansatser

MÃķjligheten att gÃķra LoRAs mer portabla mellan versioner ÃĪr en liten men intressant strÃĨng av studier i litteraturen, och det huvudsakliga bidraget som LoRA-X gÃķr till denna strÃĪvan ÃĪr dess pÃĨstÃĨende att det inte krÃĪver nÃĨgon trÃĪningsdata. Detta ÃĪr inte strikt sant, om man lÃĪser artikeln, men det krÃĪver den minsta mÃĪngden trÃĪningsdata av alla tidigare metoder.

LoRA-X ÃĪr en annan post i kanon av Parameter-Efficient Fine-Tuning (PEFT) metoder, som tar itu med utmaningen att anpassa stora fÃķrtrÃĪnade modeller till specifika uppgifter utan omfattande omtrÃĪning. Denna konceptuella ansats syftar till att modifiera ett minimum antal parametrar samtidigt som prestandan upprÃĪtthÃĨlls.

Bland dessa ÃĪr:

X-Adapter

X-Adapter-ramverket ÃķverfÃķr finjusterade adapter mellan modeller med en viss mÃĪngd omtrÃĪning. Systemet syftar till att mÃķjliggÃķra fÃķrtrÃĪnade plug-and-play-moduler (sÃĨsom ControlNet och LoRA) frÃĨn en basdiffusionsmodell (t.ex. Stable Diffusion v1.5) att fungera direkt med en uppgraderad diffusionsmodell som SDXL utan omtrÃĪning – effektivt fungerande som en “universell uppdaterare” fÃķr plug-ins.

Systemet uppnÃĨr detta genom att trÃĪna en ytterligare nÃĪtverk som kontrollerar den uppgraderade modellen, med hjÃĪlp av en frusen kopia av basmodellen fÃķr att bevara plugin-anslutningar:

Schema fÃķr X-Adapter. KÃĪlla: https://arxiv.org/pdf/2312.02238

Schema fÃķr X-Adapter. KÃĪlla: https://arxiv.org/pdf/2312.02238

X-Adapter utvecklades ursprungligen och testades fÃķr att ÃķverfÃķra adapter frÃĨn SD1.5 till SDXL, medan LoRA-X erbjuder en bredare variation av translitterationer.

DoRA (Weight-Decomposed Low-Rank Adaptation)

DoRA ÃĪr en fÃķrbÃĪttrad finjusteringsmetod som fÃķrbÃĪttrar LoRA genom att anvÃĪnda en viktdekompositionstrategi som mer liknar full finjustering:

DoRA ÃĪndrar inte bara fundamentala parametrar av vikterna, sÃĨsom storlek och riktning. KÃĪlla: https://arxiv.org/pdf/2402.09353

DoRA ÃĪndrar inte bara fundamentala parametrar av vikterna, sÃĨsom storlek och riktning. KÃĪlla: https://arxiv.org/pdf/2402.09353

DoRA fokuserar pÃĨ att fÃķrbÃĪttra finjusteringsprocessen i sig, genom att dekomponera modellens vikter i storlek och riktning (se bild ovan). IstÃĪllet fokuserar LoRA-X pÃĨ att mÃķjliggÃķra ÃķverfÃķring av befintliga finjusterade parametrar mellan olika basmodeller

Men LoRA-X-ansatsen anpassar projektionsteknikerna som utvecklats fÃķr DoRA, och i tester mot denna ÃĪldre system hÃĪvdar den en fÃķrbÃĪttrad DINO-poÃĪng.

FouRA (Fourier Low Rank Adaptation)

Publicerad i juni 2024, ÃĪr FouRA-metoden en annan post frÃĨn Qualcomm AI Research, och delar nÃĨgra av dess testprompt och teman.

Exempel pÃĨ distributionskollaps i LoRA, frÃĨn 2024 FouRA-artikeln, med hjÃĪlp av Realistic Vision 3.0-modellen trÃĪnad med LoRA och FouRA fÃķr 'Blue Fire' och 'Origami'-stiladapter, Ãķver fyra frÃķn. LoRA-bilder visar distributionskollaps och minskad diversitet, medan FouRA genererar mer varierade utdata. KÃĪlla: https://arxiv.org/pdf/2406.08798

Exempel pÃĨ distributionskollaps i LoRA, frÃĨn 2024 FouRA-artikeln, med hjÃĪlp av Realistic Vision 3.0-modellen trÃĪnad med LoRA och FouRA fÃķr ‘Blue Fire’ och ‘Origami’-stiladapter, Ãķver fyra frÃķn. KÃĪlla: https://arxiv.org/pdf/2406.08798

FouRA fokuserar pÃĨ att fÃķrbÃĪttra diversiteten och kvaliteten pÃĨ genererade bilder genom att anpassa LoRA i frekvensdomÃĪnen, med hjÃĪlp av en Fourier-transform-ansats.

HÃĪr, igen, kunde LoRA-X uppnÃĨ bÃĪttre resultat ÃĪn den Fourier-baserade ansatsen av FouRA.

FastÃĪn bÃĨda ramverken faller inom PEFT-kategorin, har de mycket olika anvÃĪndningsfall och ansatser; i detta fall ÃĪr FouRA mÃķjligtvis “pÃĨ vÃĪg att fylla i luckorna” fÃķr en testomgÃĨng med begrÃĪnsade liknande rivaler fÃķr den nya artikeln.

SVDiff

SVDiff har ocksÃĨ olika mÃĨl ÃĪn LoRA-X, men ÃĪr starkt utnyttjad i den nya artikeln. SVDiff ÃĪr utformad fÃķr att fÃķrbÃĪttra effektiviteten i finjusteringen av diffusionsmodeller, och modifierar direkt vÃĪrden inom modellens viktmatriker, medan singularvektorerna fÃķrblir ofÃķrÃĪndrade. SVDiff anvÃĪnder trunkerad SVD, modifierar endast de stÃķrsta vÃĪrdena, fÃķr att justera modellens vikter.

Denna ansats anvÃĪnder en datafÃķrstÃĪrkningsmetod som kallas Cut-Mix-Unmix:

FlerÃĪmnesgenerering fungerar som ett koncept-isolerande system i SVDiff. KÃĪlla: https://arxiv.org/pdf/2303.11305

FlerÃĪmnesgenerering fungerar som ett koncept-isolerande system i SVDiff. KÃĪlla: https://arxiv.org/pdf/2303.11305

Cut-Mix-Unmix ÃĪr utformad fÃķr att hjÃĪlpa diffusionsmodellen att lÃĪra sig flera distinkta koncept utan att blanda dem. Den centrala idÃĐn ÃĪr att ta bilder av olika ÃĪmnen och sammanfoga dem till en enda bild. Sedan trÃĪnas modellen med prompt som uttryckligen beskriver de separata elementen i bilden. Detta tvingar modellen att kÃĪnna igen och bevara distinkta koncept i stÃĪllet fÃķr att blanda dem.

Under trÃĪningsprocessen hjÃĪlper en ytterligare regleringsterm till att fÃķrhindra mellanÃĪmnesinterferens. FÃķrfattarnas teori hÃĪvdar att detta mÃķjliggÃķr en fÃķrbÃĪttrad flerÃĪmnesgenerering, dÃĪr varje element fÃķrblir visuellt distinkt, snarare ÃĪn att smÃĪltas samman.

Slutsats

Metoderna som diskuteras hÃĪr ÃĪr inte de enda invÃĨnarna i PEFT. Andra inkluderar QLoRA och QA-LoRA; Prefix Tuning; Prompt-Tuning; och adapter-tuning, bland andra.

“Uppgraderbar LoRA” ÃĪr, kanske, en alkemisk strÃĪvan; sÃĪkert, det finns ingenting omedelbart pÃĨ horisonten som kommer att fÃķrhindra LoRA-modellerna frÃĨn att dra ut sina gamla datamÃĪngder igen fÃķr den senaste och stÃķrsta viktutgÃĨvan. Om det finns nÃĨgon mÃķjlig prototypstandard fÃķr viktrevision, som kan Ãķverleva ÃĪndringar i arkitektur och svÃĪllande parametrar mellan modellversioner, har den inte dykt upp i litteraturen ÃĪnnu, och kommer att behÃķva fortsÃĪtta att extraheras frÃĨn data pÃĨ en per-modellbasis.

 

Publicerad fÃķrsta gÃĨngen torsdag, 30 januari 2025

FÃķrfattare pÃĨ maskinlÃĪrande, domÃĪnspecialist inom mÃĪnsklig bildsyntes. Fd chef fÃķr forskningsinnehÃĨll pÃĨ Metaphysic.ai, till dess upplÃķsning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: [email protected]