Andersons vinkel

Mod til LoRAs, der kan overleve opgraderinger af modelversioner

mm
FÃļj Unite.AI til dine foretrukne kilder pÃĨ Google
ChatGPT-4o: variation on ‘a 1792x1024 feature article reportage image of a skip full of discarded metal figurines, featuring realistic men and women of all ages and all types’

Siden min seneste dÃĶkning af vÃĶksten i hobbyist Hunyuan Video LoRAs (smÃĨ, trÃĶnede filer der kan injicere brugerdefinerede personligheder i tekst-til-video og billed-til-video grundmodeller), er antallet af relaterede LoRAs pÃĨ Civit-communityet steget med 185%.

Trods det faktum, at der ikke er nogen sÃĶrligt lette eller lav-indsats mÃĨder at lave en Hunyuan Video LoRA, er kataloget af celebrity og tema-LoRAs pÃĨ Civit voksende dagligt. Kilde: https://civitai.com/

Trods det faktum, at der ikke er nogen sÃĶrligt lette eller lav-indsats mÃĨder at lave en Hunyuan Video LoRA, er kataloget af celebrity og tema-LoRAs pÃĨ Civit voksende dagligt. Kilde: https://civitai.com/

Den samme community, der kÃĶmper for at lÃĶre, hvordan man producerer disse ’tilfÃļjelsespersonligheder’ til Hunyuan Video (HV), er ogsÃĨ ulcererende for den lovede udgivelse af en billed-til-video (I2V) funktion i Hunyuan Video.

Med hensyn til open source menneskeskabt billedsynthese, er dette en stor sag; kombineret med vÃĶksten af Hunyuan LoRAs, kunne det enable brugere til at omdanne billeder af mennesker til videoer pÃĨ en mÃĨde, der ikke undergraver deres identitet, da videoen udvikler sig – hvilket er tilfÃĶldet i alle nuvÃĶrende state-of-the-art billed-til-video genereringsmodeller, herunder Kling, Kaiber og den meget fejrede RunwayML:

Klik for at afspille. En billed-til-video generation fra RunwayML’s state-of-the-art Gen 3 Turbo model. Dog kan den ikke opretholde en konsekvent identitet, nÃĨr subjektet vender sig vÃĶk fra kameraet, og de distinkte trÃĶk fra startbilledet bliver en ‘generisk diffusion kvinde’. Kilde: https://app.runwayml.com/

Ved at udvikle en brugerdefineret LoRA for personligheden i question, kunne man i en HV I2V arbejdsproces bruge et rigtigt billede af dem som startpunkt. Dette er et langt bedre ‘frÃļ’ end at sende et tilfÃĶldigt tal ind i modellens latente rum og acceptere, hvad som helst semantisk scenario, der resulterer. Man kunne derefter bruge LoRA’en eller flere LoRAs til at opretholde konsistens i identitet, frisurer, tÃļj og andre afgÃļrende aspekter af en generation.

Potentielt kunne tilgÃĶngeligheden af en sÃĨdan kombination reprÃĶsentere en af de mest epokale skift i generativ AI siden lanceringen af Stable Diffusion, med formidabel generativ kraft overfÃļrt til open source-entusiaster, uden den regulering (eller ‘gatekeeping’, hvis man foretrÃĶkker) leveret af indholdscensorerne i den nuvÃĶrende samling af populÃĶre gen-vid-systemer.

Da jeg skriver, er Hunyuan billed-til-video en ikke-afkrydset ‘at-gÃļre’ i Hunyuan Video GitHub-repoen, med hobbyist-samfundet rapporterende (anekdotisk) en Discord-kommentar fra en Hunyuan-udvikler, der angiveligt udtalte, at udgivelsen af denne funktion er blevet udskudt til senere i Q1 pÃĨ grund af, at modellen er ‘for ukensureret’.

Den officielle funktion udgivelsesliste for Hunyuan Video. Kilde: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan

Den officielle funktion udgivelsesliste for Hunyuan Video. Kilde: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan

PrÃĶcis eller ej, har repo-udviklerne i hÃļj grad leveret pÃĨ resten af Hunyuan-checklisten, og derfor ser det ud til, at Hunyuan I2V vil ankomme til sidst, enten censureret, ukensureret eller pÃĨ en eller anden mÃĨde ‘lÃĨst op’.

Men som vi kan se i listen ovenfor, er I2V-udgivelsen ÃĨbenbart en separat model i sig selv – hvilket gÃļr det ret usandsynligt, at nogen af de nuvÃĶrende LoRAs pÃĨ Civit og andre steder vil fungere med det.

I denne (nu) forudsigelige scenario, LoRA-trÃĶningsrammer sÃĨsom Musubi Tuner og OneTrainer vil enten blive sat tilbage eller nulstillet i forhold til at understÃļtte den nye model. Imens vil en eller to af de mest teknisk kyndige (og ivÃĶrksÃĶtter-) YouTube AI-luminariesne ransom deres lÃļsninger via Patreon, indtil scenen indhenter.

Opgraderings-trÃĶthed

NÃĶsten ingen oplever opgraderings-trÃĶthed sÃĨ meget som en LoRA- eller fine-tuning-entusiast, fordi den hurtige og konkurrerende tempo i generativ AI opmuntrer model-fabrikker sÃĨsom Stability.ai, Tencent og Black Forest Labs til at producere stÃļrre og (nogle gange) bedre modeller i det maksimale viable frekvens.

Siden disse nye og forbedrede modeller vil have mindst forskellige bias og vÃĶgte, og mere almindeligt vil have en anden skala og/eller arkitektur, betyder dette, at fine-tuning-samfundet mÃĨ tage deres datasÃĶt ud igen og gentage den hÃĨrdkÃļrte trÃĶningsproces for den nye version.

Derfor er der en mangfoldighed af Stable Diffusion LoRA-versionstyper til rÃĨdighed pÃĨ Civit:

Opgraderingsstien, visualiseret i sÃļgefiltermuligheder pÃĨ civit.ai

Opgraderingsstien, visualiseret i sÃļgefiltermuligheder pÃĨ civit.ai

Siden ingen af disse letvÃĶgts LoRA-modeller er interoperable med hÃļjere eller lavere modelversioner, og siden mange af dem har afhÃĶngigheder af populÃĶre store skala sammenlÃĶgninger og fine-tunes, der holder fast ved en ÃĶldre model, tenderer en betydelig del af samfundet til at holde fast ved en ‘arv’ udgivelse, pÃĨ samme mÃĨde som kundeloyalitet til Windows XP bestod ÃĨr efter officiel support ophÃļrte.

Tilpasning til forandring

Dette emne kommer i tanke, fordi en ny artikel fra Qualcomm AI Research pÃĨstÃĨr at have udviklet en metode, hvorved eksisterende LoRAs kan ‘opgraderes’ til en nyudgivet modelversion.

Eksempel pÃĨ konvertering af LoRAs mellem modelversioner. Kilde: https://arxiv.org/pdf/2501.16559

Eksempel pÃĨ konvertering af LoRAs mellem modelversioner. Kilde: https://arxiv.org/pdf/2501.16559

Dette betyder ikke, at den nye tilgang, kaldet LoRA-X, kan oversÃĶtte frit mellem alle modeller af samme type (dvs. tekst til billed-modeller eller store sprogmodeller [LLM]); men forfatterne har demonstreret en effektiv translitteration af en LoRA fra Stable Diffusion v1.5 > SDXL, og en konvertering af en LoRA for tekstbaseret TinyLlama 3T-model til TinyLlama 2.5T.

LoRA-X overfÃļrer LoRA-parametre mellem forskellige grundmodeller ved at bevare adapteren inden for kilde-modellens under-rum; men kun i dele af modellen, der er tilstrÃĶkkeligt lignende mellem modelversioner.

Til venstre, et schema for den mÃĨde, hvorpÃĨ LoRA-X kilde-modellen finjusterer en adapter, som derefter justeres til at passe target-modellen ved hjÃĶlp af dens egen interne struktur. Til hÃļjre, billeder genereret af target-modeller SD Eff-v1.0 og SSD-1B, efter anvendelse af adapters overfÃļrt fra SD-v1.5 og SDXL uden yderligere trÃĶning.

Til venstre, et schema for den mÃĨde, hvorpÃĨ LoRA-X kilde-modellen finjusterer en adapter, som derefter justeres til at passe target-modellen.

LoRA-X tilbyder en praktisk lÃļsning for scenarier, hvor gen-trÃĶning er uÃļnsket eller umulig (sÃĨsom en ÃĶndring af licens pÃĨ den oprindelige trÃĶningsdata), men metoden er begrÃĶnset til lignende modelarkitekturer, blandt andre begrÃĶnsninger.

Selvom dette er en sjÃĶlden udflugt i et understudieret felt, vil vi ikke undersÃļge denne artikel i dybden pÃĨ grund af LoRA-X’s talrige mangler, som bevidnet af kommentarer fra dens kritikere og rÃĨdgivere pÃĨ Open Review.

Metodens afhÃĶngighed af under-rum-lighed begrÃĶnser dens anvendelse til tÃĶt beslÃĶgtede modeller, og forfatterne har indrÃļmmet i anmeldelsesforummet, at LoRA-X ikke kan let overfÃļres mellem vÃĶsentligt forskellige arkitekturer.

Andre PEFT-tilgange

Muligheden for at gÃļre LoRAs mere portable mellem versioner er en lille, men interessant trÃĨd i litteraturen, og den vigtigste bidrag, LoRA-X giver til denne strÃĶben, er dets pÃĨstand om, at det ikke krÃĶver trÃĶning. Dette er ikke strengt taget, hvis man lÃĶser artiklen, men det krÃĶver den mindste trÃĶning af alle tidligere metoder.

LoRA-X er endnu en indgang i kanonen af Parameter-Efficient Fine-Tuning (PEFT) metoder, der adresserer udfordringen ved at tilpasse store forudtrÃĶnede modeller til bestemte opgaver uden omfattende gen-trÃĶning. Dette konceptuelle tilgangsmÃĨde sigter mod at modificere et minimalt antal parametre, mens man opretholder ydeevnen.

BemÃĶrkelsesvÃĶrdige blandt disse er:

X-Adapter

X-Adapter-rammen overfÃļrer finjusterede adapters mellem modeller med en vis mÃĶngde gen-trÃĶning. Systemet sigter mod at enable forudtrÃĶnede plug-and-play-moduler (sÃĨsom ControlNet og LoRA) fra en grund-diffusionsmodel (dvs. Stable Diffusion v1.5) til at fungere direkte med en opgraderet diffusionsmodel sÃĨsom SDXL uden gen-trÃĶning – i virkeligheden fungerer det som en ‘universel opgraderer’ for plugins.

Systemet opnÃĨr dette ved at trÃĶne en ekstra netvÃĶrk, der kontrollerer den opgraderede model, ved hjÃĶlp af en frosset kopi af grund-modellen til at bevare plugin-forbindelser:

Schema for X-Adapter. Kilde: https://arxiv.org/pdf/2312.02238

Schema for X-Adapter. Kilde: https://arxiv.org/pdf/2312.02238

X-Adapter blev oprindeligt udviklet og testet til at overfÃļre adapters fra SD1.5 til SDXL, mens LoRA-X tilbyder en bredere variation af translitterationer.

DoRA (Weight-Decomposed Low-Rank Adaptation)

DoRA er en forbedret finjusteringsmetode, der forbedrer LoRA ved at bruge en vÃĶgt-dekompositionsstrategi, der ligner fuld finjustering mere:

DoRA ÃĶndrer ikke blot fundamentale parametre af vÃĶgtene, sÃĨsom stÃļrrelse og retning. Kilde: https://arxiv.org/pdf/2402.09353

DoRA ÃĶndrer ikke blot fundamentale parametre af vÃĶgtene, sÃĨsom stÃļrrelse og retning. Kilde: https://arxiv.org/pdf/2402.09353

DoRA fokuserer pÃĨ at forbedre finjusteringsprocessen selv, ved at dekomponere modellens vÃĶgte i stÃļrrelse og retning (se billedet ovenfor). LoRA-X fokuserer derimod pÃĨ at enable overfÃļring af eksisterende finjusterede parametre mellem forskellige grundmodeller.

Men LoRA-X-tilgangen tilpasser projektions-teknikkerne udviklet til DoRA, og i tests mod denne ÃĶldre system pÃĨstÃĨr det en forbedret DINO-score.

FouRA (Fourier Low Rank Adaptation)

Udgivet i juni 2024, FouRA-metoden kommer, ligesom LoRA-X, fra Qualcomm AI Research, og deler nogle af dens testprompts og temaer.

Eksempler pÃĨ distributions-kollaps i LoRA, fra 2024 FouRA-artiklen, ved hjÃĶlp af Realistic Vision 3.0-modellen trÃĶnet med LoRA og FouRA for 'Blue Fire' og 'Origami'-style adapters, pÃĨ tvÃĶrs af fire seeds. LoRA-billeder viser distributions-kollaps og reduceret diversitet, mens FouRA genererer mere varierede outputs. Kilde: https://arxiv.org/pdf/2406.08798

Eksempler pÃĨ distributions-kollaps i LoRA, fra 2024 FouRA-artiklen, ved hjÃĶlp af Realistic Vision 3.0-modellen trÃĶnet med LoRA og FouRA for ‘Blue Fire’ og ‘Origami’-style adapters, pÃĨ tvÃĶrs af fire seeds. LoRA-billeder viser distributions-kollaps og reduceret diversitet, mens FouRA genererer mere varierede outputs. Kilde: https://arxiv.org/pdf/2406.08798

FouRA fokuserer pÃĨ at forbedre diversiteten og kvaliteten af genererede billeder ved at tilpasse LoRA i frekvensdomÃĶnet, ved hjÃĶlp af en Fourier-transformation-tilgang.

Her igen kunne LoRA-X opnÃĨ bedre resultater end den Fourier-baserede tilgang i FouRA.

Selvom begge rammer falder inden for PEFT-kategorien, har de meget forskellige anvendelsesomrÃĨder og tilgange; i dette tilfÃĶlde er FouRA mÃĨske ‘at fylde hullerne’ for en testrunde med begrÃĶnsede lignende rivaler for den nye artikels forfattere at engagere sig med.

SVDiff

SVDiff har ogsÃĨ forskellige mÃĨl end LoRA-X, men er stÃĶrkt udnyttet i den nye artikel. SVDiff er designet til at forbedre effekten af finjustering af diffusionsmodeller, og ÃĶndrer direkte vÃĶrdier inden for modellens vÃĶgtmatricer, mens de bibeholder de singulÃĶre vektorer uÃĶndrede. SVDiff bruger trunceret SVD, og ÃĶndrer kun de stÃļrste vÃĶrdier, for at justere modellens vÃĶgte.

Denne tilgang bruger en data-forstÃĶrkningsteknik kaldet Cut-Mix-Unmix:

Multi-subjekt-generation fungerer som et koncept-isolerende system i SVDiff. Kilde: https://arxiv.org/pdf/2303.11305

Multi-subjekt-generation fungerer som et koncept-isolerende system i SVDiff. Kilde: https://arxiv.org/pdf/2303.11305

Cut-Mix-Unmix er designet til at hjÃĶlpe diffusionsmodellen med at lÃĶre multiple distinkte koncepter uden at blande dem. Den centrale idÃĐ er at tage billeder af forskellige subjekter og konkatenerer dem til et enkelt billede. Derefter trÃĶnes modellen med prompts, der eksPLICIT beskriver de separate elementer i billedet. Dette tvinger modellen til at genkende og bevare distinkte koncepter i stedet for at blande dem.

Under trÃĶning hjÃĶlper en ekstra regularisering-term med at forhindre kryds-subjekt-interferens. Forfatternes teori pÃĨstÃĨr, at dette faciliterer en forbedret multi-subjekt-generation, hvor hvert element forbliver visuelt distinkt, i stedet for at blande sig sammen.

SVDiff, udeladt fra LoRA-X-testrunden, sigter mod at skabe et kompakt parameter-rum. LoRA-X fokuserer derimod pÃĨ overfÃļrbarheden af LoRA-parametre mellem forskellige grundmodeller ved at operere inden for under-rummet af den oprindelige model.

Konklusion

De metoder, der er diskuteret her, er ikke de eneste beboere i PEFT. Andre inkluderer QLoRA og QA-LoRA; Prefix-Tuning; Prompt-Tuning; og adapter-tuning, blandt andre.

‘Opgraderbar LoRA’ er mÃĨske en alkymisk strÃĶben; bestemt er der intet pÃĨ horisonten, der kan forhindre LoRA-modellÃļrer i at trÃĶkke deres gamle datasÃĶt ud igen for den seneste og bedste vÃĶgt-udgivelse. Hvis der er en mulig prototype-standard for vÃĶgt-revision, der kan overleve ÃĶndringer i arkitektur og ballonerende parametre mellem modelversioner, er det ikke dukket op i litteraturen endnu, og vil fortsat skulle udtrÃĶkkes fra data pÃĨ en per-model-basis.

 

Udgivet fÃļrste gang torsdag, 30. januar 2025

Forfatter til maskinlÃĶringsartikler, domÃĶneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold pÃĨ Metaphysic.ai, indtil oplÃļsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: [email protected]