AI-modeller och plattformar

Mot LoRAs som kan överleva modelluppgraderingar

mm
Lägg till Unite.AI bland dina föredragna källor på Google
ChatGPT-4o: variation on ‘a 1792x1024 feature article reportage image of a skip full of discarded metal figurines, featuring realistic men and women of all ages and all types’

Sedan min senaste täckning av tillväxten i hobbyist Hunyuan Video LoRAs (små, tränade filer som kan injicera anpassade personligheter i multi-miljardparametrars text-till-video och bild-till-video grundmodeller), har antalet relaterade LoRAs som finns tillgängliga i Civit-samhället ökat med 185%.

Trots att det inte finns några särskilt enkla eller låginsatsmetoder för att skapa en Hunyuan Video LoRA, växer katalogen över kändis- och tematiska LoRAs på Civit dagligen. Källa: https://civitai.com/

Trots att det inte finns några särskilt enkla eller låginsatsmetoder för att skapa en Hunyuan Video LoRA, växer katalogen över kändis- och tematiska LoRAs på Civit dagligen. Källa: https://civitai.com/

Samma samhälle som kämpar för att lära sig hur man producerar dessa “tilläggs-personligheter” för Hunyuan Video (HV) är också ulcererar för den utlovade utgåvan av en bild-till-video (I2V) funktion i Hunyuan Video.

Med avseende på öppen källkod för mänsklig bildsyntes, är detta en stor sak; i kombination med tillväxten av Hunyuan LoRAs, kunde detta möjliggöra för användare att omvandla foton av människor till videor på ett sätt som inte urholkar deras identitet när videon utvecklas – vilket för närvarande är fallet i alla state-of-the-art bild-till-video-genererare, inklusive Kling, Kaiber och den mycket firade RunwayML:

Klicka för att spela. En bild-till-video-generering från RunwayML:s state-of-the-art Gen 3 Turbo-modell. Men, liksom alla liknande och mindre rivalmodeller, kan den inte upprätthålla en konsekvent identitet när ämnet vänder sig bort från kameran, och de distinkta dragen i startbilden blir en “generisk diffusions-kvinna”. Källa: https://app.runwayml.com/

Genom att utveckla en anpassad LoRA för personligheten i fråga, kunde man, i en HV I2V-arbetsflöde, använda en riktig foto av dem som en startpunkt. Detta är en mycket bättre “frö” än att skicka in ett slumpmässigt nummer i modellens latenta utrymme och acceptera vad som helst semantiskt scenario som resulterar. Man kunde sedan använda LoRA, eller flera LoRAs, för att upprätthålla konsekvensen av identitet, frisyrer, kläder och andra avgörande aspekter av en generation.

Potentiellt, kunde tillgängligheten av en sådan kombination representera en av de mest epokala skiftningarna i generativ AI sedan lanseringen av Stable Diffusion, med formidabel generativ kraft som överlämnas till öppen källkod-entusiaster, utan den reglering (eller “gatekeeping”, om du föredrar) som tillhandahålls av innehållscensurerna i den nuvarande skaran av populära gen-vid-system.

Som jag skriver, är Hunyuan bild-till-video en outredd ‘att-göra’-punkt i Hunyuan Video GitHub-repo, med hobbyistsamhället som rapporterar (anekdotiskt) en Discord-kommentar från en Hunyuan-utvecklare, som tydligen sa att utgåvan av denna funktion har skjutits upp till någon gång senare i Q1 på grund av att modellen är ‘för ocensurerad’.

Den officiella funktionen för utgivningschecklista för Hunyuan Video. Källa: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan

Den officiella funktionen för utgivningschecklista för Hunyuan Video. Källa: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan

Exakt eller inte, har repo-utvecklarna i stort sett levererat på resten av Hunyuan-checklistan, och därför verkar Hunyuan I2V vara på väg att anlända så småningom, oavsett om den är censurerad, ocensurerad eller på något sätt “låsbar”.

Men som vi kan se i listan ovan, är I2V-utgåvan en separat modell i sig – vilket gör det ganska osannolikt att någon av de nuvarande blomstrande skörden av HV LoRAs på Civit och andra ställen kommer att fungera med den.

I detta (nu) förutsägbara scenario, kommer LoRA-träningsramar som Musubi Tuner och OneTrainer att antingen sättas tillbaka eller återställas i fråga om att stödja den nya modellen. Under tiden kommer en eller två av de mest tekniskt kunniga (och entreprenöriella) YouTube AI-luminarierna att utpressa sina lösningar via Patreon tills scenen kommer ikapp.

Uppgraderingströtthet

Knappast någon upplever uppdateringströtthet så mycket som en LoRA- eller fine-tuning-entusiast, eftersom den snabba och konkurrenskraftiga takten i generativ AI uppmuntrar modelljärnverk som Stability.ai, Tencent och Black Forest Labs att producera större och (ibland) bättre modeller i den maximala möjliga frekvensen.

Sedan dessa nya och förbättrade modeller kommer att ha åtminstone olika bias och vikter, och oftare kommer att ha en annan skala och/eller arkitektur, innebär detta att fine-tuning-samhället måste få ut sina datamängder igen och upprepa den mödosamma träningsprocessen för den nya versionen.

Därför finns det en mångfald av Stable Diffusion LoRA-versionstyper tillgängliga på Civit:

Uppgraderingsspåret, visualiserat i sökfilteralternativ på civit.ai

Uppgraderingsspåret, visualiserat i sökfilteralternativ på civit.ai

Eftersom ingen av dessa lätta LoRA-modeller är kompatibla med högre eller lägre modellversioner, och eftersom många av dem har beroenden av populära stora skalförändringar och fine-tunes som följer en äldre modell, tenderar en betydande del av samhället att stanna kvar med en “äldre” version, på samma sätt som kundlojalitet till Windows XP bestod år efter officiellt slutat stöd.

Anpassning till förändring

Detta ämne kommer i åtanke på grund av en ny artikel från Qualcomm (QCOM ) AI Research som hävdar att de har utvecklat en metod där befintliga LoRAs kan “uppgraderas” till en nyligen släppt modellversion.

Exempel på konvertering av LoRAs mellan modellversioner. Källa: https://arxiv.org/pdf/2501.16559

Exempel på konvertering av LoRAs mellan modellversioner. Källa: https://arxiv.org/pdf/2501.16559

Denna metod, som kallas LoRA-X, överför LoRA-parametrar mellan olika basmodeller genom att bevara adaptern inom källmodellens underutrymme; men endast i delar av modellen som är tillräckligt lika mellan modellversioner.

Till vänster, ett schema för hur LoRA-X-källmodellen finjusterar en adapter, som sedan justeras för att passa målmodellen med hjälp av dess egen interna struktur. Till höger, bilder genererade av målmodellerna SD Eff-v1.0 och SSD-1B, efter att ha applicerat adapter som överförts från SD-v1.5 och SDXL utan ytterligare träningsdata.

Till vänster, ett schema för hur LoRA-X-källmodellen finjusterar en adapter, som sedan justeras för att passa målmodellen.

Medan detta erbjuder en praktisk lösning för scenarier där omträning är önskvärt eller omöjligt (såsom en ändring av licensen för den ursprungliga träningsdatan), är metoden begränsad till liknande modellarkitekturer, bland annat.

Fastän detta är en sällsynt utflykt i ett understuderat område, kommer vi inte att undersöka denna artikel i djupet på grund av LoRA-X:s många brister, som visas av kommentarer från dess kritiker och rådgivare på Open Review.

Metodens beroende av underutrymmeslikhet begränsar dess tillämpning till nära relaterade modeller, och författarna har medgivit i granskningsforumet att LoRA-X inte kan enkelt överföras mellan betydligt olika arkitekturer.

Andra PEFT-ansatser

Möjligheten att göra LoRAs mer portabla mellan versioner är en liten men intressant strång av studier i litteraturen, och det huvudsakliga bidraget som LoRA-X gör till denna strävan är dess påstående att det inte kräver någon träningsdata. Detta är inte strikt sant, om man läser artikeln, men det kräver den minsta mängden träningsdata av alla tidigare metoder.

LoRA-X är en annan post i kanon av Parameter-Efficient Fine-Tuning (PEFT) metoder, som tar itu med utmaningen att anpassa stora förtränade modeller till specifika uppgifter utan omfattande omträning. Denna konceptuella ansats syftar till att modifiera ett minimum antal parametrar samtidigt som prestandan upprätthålls.

Bland dessa är:

X-Adapter

X-Adapter-ramverket överför finjusterade adapter mellan modeller med en viss mängd omträning. Systemet syftar till att möjliggöra förtränade plug-and-play-moduler (såsom ControlNet och LoRA) från en basdiffusionsmodell (t.ex. Stable Diffusion v1.5) att fungera direkt med en uppgraderad diffusionsmodell som SDXL utan omträning – effektivt fungerande som en “universell uppdaterare” för plug-ins.

Systemet uppnår detta genom att träna en ytterligare nätverk som kontrollerar den uppgraderade modellen, med hjälp av en frusen kopia av basmodellen för att bevara plugin-anslutningar:

Schema för X-Adapter. Källa: https://arxiv.org/pdf/2312.02238

Schema för X-Adapter. Källa: https://arxiv.org/pdf/2312.02238

X-Adapter utvecklades ursprungligen och testades för att överföra adapter från SD1.5 till SDXL, medan LoRA-X erbjuder en bredare variation av translitterationer.

DoRA (Weight-Decomposed Low-Rank Adaptation)

DoRA är en förbättrad finjusteringsmetod som förbättrar LoRA genom att använda en viktdekompositionstrategi som mer liknar full finjustering:

DoRA ändrar inte bara fundamentala parametrar av vikterna, såsom storlek och riktning. Källa: https://arxiv.org/pdf/2402.09353

DoRA ändrar inte bara fundamentala parametrar av vikterna, såsom storlek och riktning. Källa: https://arxiv.org/pdf/2402.09353

DoRA fokuserar på att förbättra finjusteringsprocessen i sig, genom att dekomponera modellens vikter i storlek och riktning (se bild ovan). Istället fokuserar LoRA-X på att möjliggöra överföring av befintliga finjusterade parametrar mellan olika basmodeller

Men LoRA-X-ansatsen anpassar projektionsteknikerna som utvecklats för DoRA, och i tester mot denna äldre system hävdar den en förbättrad DINO-poäng.

FouRA (Fourier Low Rank Adaptation)

Publicerad i juni 2024, är FouRA-metoden en annan post från Qualcomm AI Research, och delar några av dess testprompt och teman.

Exempel på distributionskollaps i LoRA, från 2024 FouRA-artikeln, med hjälp av Realistic Vision 3.0-modellen tränad med LoRA och FouRA för 'Blue Fire' och 'Origami'-stiladapter, över fyra frön. LoRA-bilder visar distributionskollaps och minskad diversitet, medan FouRA genererar mer varierade utdata. Källa: https://arxiv.org/pdf/2406.08798

Exempel på distributionskollaps i LoRA, från 2024 FouRA-artikeln, med hjälp av Realistic Vision 3.0-modellen tränad med LoRA och FouRA för ‘Blue Fire’ och ‘Origami’-stiladapter, över fyra frön. Källa: https://arxiv.org/pdf/2406.08798

FouRA fokuserar på att förbättra diversiteten och kvaliteten på genererade bilder genom att anpassa LoRA i frekvensdomänen, med hjälp av en Fourier-transform-ansats.

Här, igen, kunde LoRA-X uppnå bättre resultat än den Fourier-baserade ansatsen av FouRA.

Fastän båda ramverken faller inom PEFT-kategorin, har de mycket olika användningsfall och ansatser; i detta fall är FouRA möjligtvis “på väg att fylla i luckorna” för en testomgång med begränsade liknande rivaler för den nya artikeln.

SVDiff

SVDiff har också olika mål än LoRA-X, men är starkt utnyttjad i den nya artikeln. SVDiff är utformad för att förbättra effektiviteten i finjusteringen av diffusionsmodeller, och modifierar direkt värden inom modellens viktmatriker, medan singularvektorerna förblir oförändrade. SVDiff använder trunkerad SVD, modifierar endast de största värdena, för att justera modellens vikter.

Denna ansats använder en dataförstärkningsmetod som kallas Cut-Mix-Unmix:

Flerämnesgenerering fungerar som ett koncept-isolerande system i SVDiff. Källa: https://arxiv.org/pdf/2303.11305

Flerämnesgenerering fungerar som ett koncept-isolerande system i SVDiff. Källa: https://arxiv.org/pdf/2303.11305

Cut-Mix-Unmix är utformad för att hjälpa diffusionsmodellen att lära sig flera distinkta koncept utan att blanda dem. Den centrala idén är att ta bilder av olika ämnen och sammanfoga dem till en enda bild. Sedan tränas modellen med prompt som uttryckligen beskriver de separata elementen i bilden. Detta tvingar modellen att känna igen och bevara distinkta koncept i stället för att blanda dem.

Under träningsprocessen hjälper en ytterligare regleringsterm till att förhindra mellanämnesinterferens. Författarnas teori hävdar att detta möjliggör en förbättrad flerämnesgenerering, där varje element förblir visuellt distinkt, snarare än att smältas samman.

Slutsats

Metoderna som diskuteras här är inte de enda invånarna i PEFT. Andra inkluderar QLoRA och QA-LoRA; Prefix Tuning; Prompt-Tuning; och adapter-tuning, bland andra.

“Uppgraderbar LoRA” är, kanske, en alkemisk strävan; säkert, det finns ingenting omedelbart på horisonten som kommer att förhindra LoRA-modellerna från att dra ut sina gamla datamängder igen för den senaste och största viktutgåvan. Om det finns någon möjlig prototypstandard för viktrevision, som kan överleva ändringar i arkitektur och svällande parametrar mellan modellversioner, har den inte dykt upp i litteraturen ännu, och kommer att behöva fortsätta att extraheras från data på en per-modellbasis.

 

Publicerad första gången torsdag, 30 januari 2025

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai