AI-modeller og platforme

Mod til LoRAs, der kan overleve opgraderinger af modelversioner

mm
Føj Unite.AI til dine foretrukne kilder på Google
ChatGPT-4o: variation on ‘a 1792x1024 feature article reportage image of a skip full of discarded metal figurines, featuring realistic men and women of all ages and all types’

Siden min seneste dækning af væksten i hobbyist Hunyuan Video LoRAs (små, trænede filer der kan injicere brugerdefinerede personligheder i tekst-til-video og billed-til-video grundmodeller), er antallet af relaterede LoRAs på Civit-communityet steget med 185%.

Trods det faktum, at der ikke er nogen særligt lette eller lav-indsats måder at lave en Hunyuan Video LoRA, er kataloget af celebrity og tema-LoRAs på Civit voksende dagligt. Kilde: https://civitai.com/

Trods det faktum, at der ikke er nogen særligt lette eller lav-indsats måder at lave en Hunyuan Video LoRA, er kataloget af celebrity og tema-LoRAs på Civit voksende dagligt. Kilde: https://civitai.com/

Den samme community, der kæmper for at lære, hvordan man producerer disse ’tilføjelsespersonligheder’ til Hunyuan Video (HV), er også ulcererende for den lovede udgivelse af en billed-til-video (I2V) funktion i Hunyuan Video.

Med hensyn til open source menneskeskabt billedsynthese, er dette en stor sag; kombineret med væksten af Hunyuan LoRAs, kunne det enable brugere til at omdanne billeder af mennesker til videoer på en måde, der ikke undergraver deres identitet, da videoen udvikler sig – hvilket er tilfældet i alle nuværende state-of-the-art billed-til-video genereringsmodeller, herunder Kling, Kaiber og den meget fejrede RunwayML:

Klik for at afspille. En billed-til-video generation fra RunwayML’s state-of-the-art Gen 3 Turbo model. Dog kan den ikke opretholde en konsekvent identitet, når subjektet vender sig væk fra kameraet, og de distinkte træk fra startbilledet bliver en ‘generisk diffusion kvinde’. Kilde: https://app.runwayml.com/

Ved at udvikle en brugerdefineret LoRA for personligheden i question, kunne man i en HV I2V arbejdsproces bruge et rigtigt billede af dem som startpunkt. Dette er et langt bedre ‘frø’ end at sende et tilfældigt tal ind i modellens latente rum og acceptere, hvad som helst semantisk scenario, der resulterer. Man kunne derefter bruge LoRA’en eller flere LoRAs til at opretholde konsistens i identitet, frisurer, tøj og andre afgørende aspekter af en generation.

Potentielt kunne tilgængeligheden af en sådan kombination repræsentere en af de mest epokale skift i generativ AI siden lanceringen af Stable Diffusion, med formidabel generativ kraft overført til open source-entusiaster, uden den regulering (eller ‘gatekeeping’, hvis man foretrækker) leveret af indholdscensorerne i den nuværende samling af populære gen-vid-systemer.

Da jeg skriver, er Hunyuan billed-til-video en ikke-afkrydset ‘at-gøre’ i Hunyuan Video GitHub-repoen, med hobbyist-samfundet rapporterende (anekdotisk) en Discord-kommentar fra en Hunyuan-udvikler, der angiveligt udtalte, at udgivelsen af denne funktion er blevet udskudt til senere i Q1 på grund af, at modellen er ‘for ukensureret’.

Den officielle funktion udgivelsesliste for Hunyuan Video. Kilde: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan

Den officielle funktion udgivelsesliste for Hunyuan Video. Kilde: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan

Præcis eller ej, har repo-udviklerne i høj grad leveret på resten af Hunyuan-checklisten, og derfor ser det ud til, at Hunyuan I2V vil ankomme til sidst, enten censureret, ukensureret eller på en eller anden måde ‘låst op’.

Men som vi kan se i listen ovenfor, er I2V-udgivelsen åbenbart en separat model i sig selv – hvilket gør det ret usandsynligt, at nogen af de nuværende LoRAs på Civit og andre steder vil fungere med det.

I denne (nu) forudsigelige scenario, LoRA-træningsrammer såsom Musubi Tuner og OneTrainer vil enten blive sat tilbage eller nulstillet i forhold til at understøtte den nye model. Imens vil en eller to af de mest teknisk kyndige (og iværksætter-) YouTube AI-luminariesne ransom deres løsninger via Patreon, indtil scenen indhenter.

Opgraderings-træthed

Næsten ingen oplever opgraderings-træthed så meget som en LoRA- eller fine-tuning-entusiast, fordi den hurtige og konkurrerende tempo i generativ AI opmuntrer model-fabrikker såsom Stability.ai, Tencent og Black Forest Labs til at producere større og (nogle gange) bedre modeller i det maksimale viable frekvens.

Siden disse nye og forbedrede modeller vil have mindst forskellige bias og vægte, og mere almindeligt vil have en anden skala og/eller arkitektur, betyder dette, at fine-tuning-samfundet må tage deres datasæt ud igen og gentage den hårdkørte træningsproces for den nye version.

Derfor er der en mangfoldighed af Stable Diffusion LoRA-versionstyper til rådighed på Civit:

Opgraderingsstien, visualiseret i søgefiltermuligheder på civit.ai

Opgraderingsstien, visualiseret i søgefiltermuligheder på civit.ai

Siden ingen af disse letvægts LoRA-modeller er interoperable med højere eller lavere modelversioner, og siden mange af dem har afhængigheder af populære store skala sammenlægninger og fine-tunes, der holder fast ved en ældre model, tenderer en betydelig del af samfundet til at holde fast ved en ‘arv’ udgivelse, på samme måde som kundeloyalitet til Windows XP bestod år efter officiel support ophørte.

Tilpasning til forandring

Dette emne kommer i tanke, fordi en ny artikel fra Qualcomm (QCOM ) AI Research påstår at have udviklet en metode, hvorved eksisterende LoRAs kan ‘opgraderes’ til en nyudgivet modelversion.

Eksempel på konvertering af LoRAs mellem modelversioner. Kilde: https://arxiv.org/pdf/2501.16559

Eksempel på konvertering af LoRAs mellem modelversioner. Kilde: https://arxiv.org/pdf/2501.16559

Dette betyder ikke, at den nye tilgang, kaldet LoRA-X, kan oversætte frit mellem alle modeller af samme type (dvs. tekst til billed-modeller eller store sprogmodeller [LLM]); men forfatterne har demonstreret en effektiv translitteration af en LoRA fra Stable Diffusion v1.5 > SDXL, og en konvertering af en LoRA for tekstbaseret TinyLlama 3T-model til TinyLlama 2.5T.

LoRA-X overfører LoRA-parametre mellem forskellige grundmodeller ved at bevare adapteren inden for kilde-modellens under-rum; men kun i dele af modellen, der er tilstrækkeligt lignende mellem modelversioner.

Til venstre, et schema for den måde, hvorpå LoRA-X kilde-modellen finjusterer en adapter, som derefter justeres til at passe target-modellen ved hjælp af dens egen interne struktur. Til højre, billeder genereret af target-modeller SD Eff-v1.0 og SSD-1B, efter anvendelse af adapters overført fra SD-v1.5 og SDXL uden yderligere træning.

Til venstre, et schema for den måde, hvorpå LoRA-X kilde-modellen finjusterer en adapter, som derefter justeres til at passe target-modellen.

LoRA-X tilbyder en praktisk løsning for scenarier, hvor gen-træning er uønsket eller umulig (såsom en ændring af licens på den oprindelige træningsdata), men metoden er begrænset til lignende modelarkitekturer, blandt andre begrænsninger.

Selvom dette er en sjælden udflugt i et understudieret felt, vil vi ikke undersøge denne artikel i dybden på grund af LoRA-X’s talrige mangler, som bevidnet af kommentarer fra dens kritikere og rådgivere på Open Review.

Metodens afhængighed af under-rum-lighed begrænser dens anvendelse til tæt beslægtede modeller, og forfatterne har indrømmet i anmeldelsesforummet, at LoRA-X ikke kan let overføres mellem væsentligt forskellige arkitekturer.

Andre PEFT-tilgange

Muligheden for at gøre LoRAs mere portable mellem versioner er en lille, men interessant tråd i litteraturen, og den vigtigste bidrag, LoRA-X giver til denne stræben, er dets påstand om, at det ikke kræver træning. Dette er ikke strengt taget, hvis man læser artiklen, men det kræver den mindste træning af alle tidligere metoder.

LoRA-X er endnu en indgang i kanonen af Parameter-Efficient Fine-Tuning (PEFT) metoder, der adresserer udfordringen ved at tilpasse store forudtrænede modeller til bestemte opgaver uden omfattende gen-træning. Dette konceptuelle tilgangsmåde sigter mod at modificere et minimalt antal parametre, mens man opretholder ydeevnen.

Bemærkelsesværdige blandt disse er:

X-Adapter

X-Adapter-rammen overfører finjusterede adapters mellem modeller med en vis mængde gen-træning. Systemet sigter mod at enable forudtrænede plug-and-play-moduler (såsom ControlNet og LoRA) fra en grund-diffusionsmodel (dvs. Stable Diffusion v1.5) til at fungere direkte med en opgraderet diffusionsmodel såsom SDXL uden gen-træning – i virkeligheden fungerer det som en ‘universel opgraderer’ for plugins.

Systemet opnår dette ved at træne en ekstra netværk, der kontrollerer den opgraderede model, ved hjælp af en frosset kopi af grund-modellen til at bevare plugin-forbindelser:

Schema for X-Adapter. Kilde: https://arxiv.org/pdf/2312.02238

Schema for X-Adapter. Kilde: https://arxiv.org/pdf/2312.02238

X-Adapter blev oprindeligt udviklet og testet til at overføre adapters fra SD1.5 til SDXL, mens LoRA-X tilbyder en bredere variation af translitterationer.

DoRA (Weight-Decomposed Low-Rank Adaptation)

DoRA er en forbedret finjusteringsmetode, der forbedrer LoRA ved at bruge en vægt-dekompositionsstrategi, der ligner fuld finjustering mere:

DoRA ændrer ikke blot fundamentale parametre af vægtene, såsom størrelse og retning. Kilde: https://arxiv.org/pdf/2402.09353

DoRA ændrer ikke blot fundamentale parametre af vægtene, såsom størrelse og retning. Kilde: https://arxiv.org/pdf/2402.09353

DoRA fokuserer på at forbedre finjusteringsprocessen selv, ved at dekomponere modellens vægte i størrelse og retning (se billedet ovenfor). LoRA-X fokuserer derimod på at enable overføring af eksisterende finjusterede parametre mellem forskellige grundmodeller.

Men LoRA-X-tilgangen tilpasser projektions-teknikkerne udviklet til DoRA, og i tests mod denne ældre system påstår det en forbedret DINO-score.

FouRA (Fourier Low Rank Adaptation)

Udgivet i juni 2024, FouRA-metoden kommer, ligesom LoRA-X, fra Qualcomm AI Research, og deler nogle af dens testprompts og temaer.

Eksempler på distributions-kollaps i LoRA, fra 2024 FouRA-artiklen, ved hjælp af Realistic Vision 3.0-modellen trænet med LoRA og FouRA for 'Blue Fire' og 'Origami'-style adapters, på tværs af fire seeds. LoRA-billeder viser distributions-kollaps og reduceret diversitet, mens FouRA genererer mere varierede outputs. Kilde: https://arxiv.org/pdf/2406.08798

Eksempler på distributions-kollaps i LoRA, fra 2024 FouRA-artiklen, ved hjælp af Realistic Vision 3.0-modellen trænet med LoRA og FouRA for ‘Blue Fire’ og ‘Origami’-style adapters, på tværs af fire seeds. LoRA-billeder viser distributions-kollaps og reduceret diversitet, mens FouRA genererer mere varierede outputs. Kilde: https://arxiv.org/pdf/2406.08798

FouRA fokuserer på at forbedre diversiteten og kvaliteten af genererede billeder ved at tilpasse LoRA i frekvensdomænet, ved hjælp af en Fourier-transformation-tilgang.

Her igen kunne LoRA-X opnå bedre resultater end den Fourier-baserede tilgang i FouRA.

Selvom begge rammer falder inden for PEFT-kategorien, har de meget forskellige anvendelsesområder og tilgange; i dette tilfælde er FouRA måske ‘at fylde hullerne’ for en testrunde med begrænsede lignende rivaler for den nye artikels forfattere at engagere sig med.

SVDiff

SVDiff har også forskellige mål end LoRA-X, men er stærkt udnyttet i den nye artikel. SVDiff er designet til at forbedre effekten af finjustering af diffusionsmodeller, og ændrer direkte værdier inden for modellens vægtmatricer, mens de bibeholder de singulære vektorer uændrede. SVDiff bruger trunceret SVD, og ændrer kun de største værdier, for at justere modellens vægte.

Denne tilgang bruger en data-forstærkningsteknik kaldet Cut-Mix-Unmix:

Multi-subjekt-generation fungerer som et koncept-isolerende system i SVDiff. Kilde: https://arxiv.org/pdf/2303.11305

Multi-subjekt-generation fungerer som et koncept-isolerende system i SVDiff. Kilde: https://arxiv.org/pdf/2303.11305

Cut-Mix-Unmix er designet til at hjælpe diffusionsmodellen med at lære multiple distinkte koncepter uden at blande dem. Den centrale idé er at tage billeder af forskellige subjekter og konkatenerer dem til et enkelt billede. Derefter trænes modellen med prompts, der eksPLICIT beskriver de separate elementer i billedet. Dette tvinger modellen til at genkende og bevare distinkte koncepter i stedet for at blande dem.

Under træning hjælper en ekstra regularisering-term med at forhindre kryds-subjekt-interferens. Forfatternes teori påstår, at dette faciliterer en forbedret multi-subjekt-generation, hvor hvert element forbliver visuelt distinkt, i stedet for at blande sig sammen.

SVDiff, udeladt fra LoRA-X-testrunden, sigter mod at skabe et kompakt parameter-rum. LoRA-X fokuserer derimod på overførbarheden af LoRA-parametre mellem forskellige grundmodeller ved at operere inden for under-rummet af den oprindelige model.

Konklusion

De metoder, der er diskuteret her, er ikke de eneste beboere i PEFT. Andre inkluderer QLoRA og QA-LoRA; Prefix-Tuning; Prompt-Tuning; og adapter-tuning, blandt andre.

‘Opgraderbar LoRA’ er måske en alkymisk stræben; bestemt er der intet på horisonten, der kan forhindre LoRA-modellører i at trække deres gamle datasæt ud igen for den seneste og bedste vægt-udgivelse. Hvis der er en mulig prototype-standard for vægt-revision, der kan overleve ændringer i arkitektur og ballonerende parametre mellem modelversioner, er det ikke dukket op i litteraturen endnu, og vil fortsat skulle udtrækkes fra data på en per-model-basis.

 

Udgivet første gang torsdag, 30. januar 2025

Forfatter inden for maskinlæring, domænespecialist i menneskelig billedsyntese. Tidligere chef for forskningsindhold hos Metaphysic.ai, indtil den blev opløst i DNEGs Brahma.ai.
Websted: martinanderson.ai
Kontakt: martin@martinanderson.ai