Andersons vinkel

Mot LoRAs som kan overleve modelloppgraderinger

mm
Legg til Unite.AI blant dine foretrukne kilder på Google
ChatGPT-4o: variation on ‘a 1792x1024 feature article reportage image of a skip full of discarded metal figurines, featuring realistic men and women of all ages and all types’

Siden min nære dekning av veksten i hobbyist Hunyuan Video LoRAs (små, trente filer som kan injisere egendefinerte personligheter i multi-milliards parameter tekst-til-video og bilde-til-video grunnmodeller), har antallet relaterte LoRAs tilgjengelig på Civit-samfunnet økt med 185%.

Til tross for at det ikke finnes noen spesielt enkle eller lav-innsats måter å lage en Hunyuan Video LoRA, vokser katalogen av celebritets- og tema-LoRAs på Civit daglig. Kilde: https://civitai.com/

Til tross for at det ikke finnes noen spesielt enkle eller lav-innsats måter å lage en Hunyuan Video LoRA, vokser katalogen av celebritets- og tema-LoRAs på Civit daglig. Kilde: https://civitai.com/

Samme samfunn som kjemper for å lære hvordan man produserer disse ‘tilleggs-personlighetene’ for Hunyuan Video (HV), er også ulcererende for den lovet utgivelsen av en bilde-til-video (I2V) funksjonalitet i Hunyuan Video.

I forhold til åpen kildekode menneske-bilde syntese, er dette en stor sak; kombinert med veksten av Hunyuan LoRAs, kunne dette muliggjøre brukere å transformere bilder av mennesker til videoer på en måte som ikke undergraver deres identitet når videoen utvikles – som er tilfelle i alle statlige kunstige intelligens-bilde-til-video genereringer, inkludert Kling, Kaiber og den mye-feirede RunwayML:

Klikk for å spille. En bilde-til-video generering fra RunwayMLs statlige kunstige intelligens Gen 3 Turbo modell. Men, i likhet med alle lignende og mindre rival-modeller, kan den ikke opprettholde konsistent identitet når subjektet vender seg bort fra kameraet, og de distinkte trekkene fra startbildet blir en ‘generisk diffusjons-kvinne’. Kilde: https://app.runwayml.com/

Ved å utvikle en tilpasset LoRA for personligheten i question, kunne en, i en HV I2V arbeidsflyt, bruke et ekte bilde av dem som utgangspunkt. Dette er et mye bedre ‘frø’ enn å sende et tilfeldig tall inn i modellens latente rom og nøye seg med hva som helst semantisk scenario som resulterer. En kunne deretter bruke LoRAen, eller flere LoRAs, for å opprettholde konsistens av identitet, frisyrer, klær og andre avgjørende aspekter av en generering.

Potensielt kunne tilgjengeligheten av en slik kombinasjon representere en av de mest epokale skiftene i generativ AI siden lanseringen av Stable Diffusion, med formidabel generativ kraft overført til åpen kildekode-entusiaster, uten reguleringen (eller ‘gatekeeping’, hvis du foretrekker) som er gitt av innholdssensorene i den nåværende kroppen av populære gen-vid systemer.

Som jeg skriver, er Hunyuan bilde-til-video en uavhaket ‘å gjøre’ i Hunyuan Video GitHub-repo, med hobbyist-samfunnet som rapporterer (anekdotisk) en Discord-kommentar fra en Hunyuan-utvikler, som angivelig uttalte at utgivelsen av denne funksjonaliteten har blitt utsatt til noen gang senere i Q1 på grunn av at modellen er ‘for usensurert’.

Den offisielle funksjonsutgivelseslisten for Hunyuan Video. Kilde: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan

Den offisielle funksjonsutgivelseslisten for Hunyuan Video. Kilde: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan

Nøyaktig eller ikke, har repo-utviklerne i stor grad levert på resten av Hunyuan-listen, og derfor ser det ut til at Hunyuan I2V kommer til å ankomme til slutt, enten sensurert, usensurert eller på en eller annen måte ‘låst opp’.

Men som vi kan se i listen ovenfor, er I2V-utgivelsen en separat modell helt og holdent – som gjør det ganske usannsynlig at noen av de nåværende LoRAs som vokser på Civit og andre steder vil fungere med den.

I denne (nå) forutsigbare scenariet, vil LoRA-trening rammer som Musubi Tuner og OneTrainer enten bli satt tilbake eller nullstilt i forhold til å støtte den nye modellen. I mellomtiden vil en eller to av de mest teknisk-kyndige (og entreprenørielle) YouTube AI-luminærer kunne løse sine løsninger via Patreon til scenen kommer i gang.

Oppgraderingsutmattelse

Nærmest ingen opplever oppgraderingsutmattelse like mye som en LoRA- eller fine-tuning-entusiast, fordi den raske og konkurrerende takten i endringene i generativ AI oppmuntre modell-fundamenter som Stability.ai, Tencent og Black Forest Labs til å produsere større og (av og til) bedre modeller i den maksimale viable frekvensen.

Siden disse nye og forbedrede modellene vil ha forskjellige bias og vekt, og oftere vil ha en annen skala og/eller arkitektur, betyr dette at fine-tuning-samfunnet må få ut sine datasamlinger igjen og gjenta den slitende treningprosessen for den nye versjonen.

Av denne grunn er det en mangfoldighet av Stable Diffusion LoRA-typer tilgjengelig på Civit:

Oppgraderingsstien, visualisert i søkefilteralternativer på civit.ai

Oppgraderingsstien, visualisert i søkefilteralternativer på civit.ai

Siden ingen av disse lettvinte LoRA-modellene er kompatible med høyere eller lavere modellversjoner, og siden mange av dem har avhengigheter til populære store skala sammenslåinger og fine-tunes som hører til en eldre modell, tenderer en betydelig del av samfunnet til å holde fast ved en ‘arv’-utgivelse, på samme måte som kundeloyalitet til Windows XP bestod år etter offisiell støtte sluttet.

Tilpasse seg endring

Dette emnet kommer til minne på grunn av en ny artikkel fra Qualcomm AI Research som hevder å ha utviklet en metode hvor eksisterende LoRAs kan ‘oppgraderes’ til en nyutgitt modellversjon.

Eksempel på konvertering av LoRAs over modellversjoner. Kilde: https://arxiv.org/pdf/2501.16559

Eksempel på konvertering av LoRAs over modellversjoner. Kilde: https://arxiv.org/pdf/2501.16559

Dette betyr ikke at den nye tilnærmingen, tittelen LoRA-X, kan oversette fritt mellom alle modeller av samme type (dvs. tekst-til-bilde modeller eller store språkmodeller [LLM]); men forfatterne har demonstrert en effektiv translitterasjon av en LoRA fra Stable Diffusion v1.5 > SDXL, og en konvertering av en LoRA for tekst-basert TinyLlama 3T-modell til TinyLlama 2.5T.

LoRA-X overfører LoRA-parametere over forskjellige grunnmodeller ved å bevare adapteren innen kilde-modellens underrom; men bare i deler av modellen som er tilstrekkelig like over modellversjoner.

Til venstre, et schema for måten LoRA-X kilde-modellen finjusterer en adapter, som deretter justeres for å passe målmodellen ved hjelp av dens egen interne struktur. Til høyre, bilder generert av målmodellene SD Eff-v1.0 og SSD-1B, etter å ha brukt adaptere overført fra SD-v1.5 og SDXL uten ytterligere trening.

Til venstre, et schema for måten LoRA-X kilde-modellen finjusterer en adapter, som deretter justeres for å passe målmodellen. Til høyre, bilder generert av målmodellene SD Eff-v1.0 og SSD-1B, etter å ha brukt adaptere overført fra SD-v1.5 og SDXL uten ytterligere trening.

Mens dette tilbyr en praktisk løsning for scenarioer hvor om-trening er uønsket eller umulig (så som en endring av lisensen på den opprinnelige treningsdataen), er metoden begrenset til lignende modellarkitekturer, blant andre begrensninger.

Selv om dette er en sjelden foray inn i et understudert felt, vil vi ikke undersøke denne artikkelen i dybden på grunn av LoRA-Xs mange mangler, som er påvist av kommentarer fra dens kritikere og rådgivere på Open Review.

Metodens avhengighet av underrom-lignelse begrenser dens anvendelse til nært beslektede modeller, og forfatterne har innrømmet i gjennomgangsforumet at LoRA-X ikke kan lett overføres over betydelig forskjellige arkitekturer

Andre PEFT-tilnærminger

Muligheten for å gjøre LoRAs mer overførbar over versjoner er en liten, men interessant tråd i litteraturen, og det viktigste bidraget LoRA-X gjør til denne forfølgningen er dets påstand om at det ikke krever noen trening. Dette er ikke strengt tatt, hvis en leser artikkelen, men det krever den minste treningen av alle de foregående metodene.

LoRA-X er en annen inngang i kanonen av Parameter-Efficient Fine-Tuning (PEFT) metoder, som møter utfordringen med å tilpasse store forhånds-trente modeller til spesifikke oppgaver uten omfattende om-trening. Denne konseptuelle tilnærmingen har som mål å modifisere en minimal mengde parametere mens man opprettholder ytelsen.

Bemerkelsesverdig blant disse er:

X-Adapter

X-Adapter-rammeverket overfører fine-tuned adapters over modeller med en viss mengde om-trening. Systemet har som mål å aktivere forhånds-trente plug-and-play-moduler (så som ControlNet og LoRA) fra en grunnmodell (dvs. Stable Diffusion v1.5) til å fungere direkte med en oppgradert diffusjonsmodell som SDXL uten om-trening – effektivt fungerende som en ‘universell oppgrader’ for plugins.

Systemet oppnår dette ved å trene en ekstra nettverk som kontrollerer den oppgraderte modellen, ved hjelp av en frozen kopi av grunnmodellen for å bevare plugin-koblinger:

Schema for X-Adapter. Kilde: https://arxiv.org/pdf/2312.02238

Schema for X-Adapter. Kilde: https://arxiv.org/pdf/2312.02238

X-Adapter ble opprinnelig utviklet og testet for å overføre adaptere fra SD1.5 til SDXL, mens LoRA-X tilbyr en bredere variasjon av translitterasjoner.

DoRA (Weight-Decomposed Low-Rank Adaptation)

DoRA er en forbedret fine-tuning metode som forbedrer LoRA ved å bruke en vekt-dekomposisjonsstrategi som ligner mer på full fine-tuning:

DoRA endrer ikke bare på å kopiere over en adapter i en frozen-miljø, som LoRA-X gjør, men endrer i stedet grunnleggende parametere av vektene, som størrelse og retning. Kilde: https://arxiv.org/pdf/2402.09353

DoRA endrer ikke bare på å kopiere over en adapter i en frozen-miljø, som LoRA-X gjør, men endrer i stedet grunnleggende parametere av vektene, som størrelse og retning. Kilde: https://arxiv.org/pdf/2402.09353

DoRA fokuserer på å forbedre fine-tuning-prosessen selv, ved å dekomponere modellens vekter i størrelse og retning (se bilde over). I stedet fokuserer LoRA-X på å muliggjøre overføring av eksisterende fine-tuned parametere mellom forskjellige grunnmodeller

Likevel tilbyr LoRA-X-tilnærmingen en forbedring av prosjektionsteknikkene utviklet for DoRA, og hevder en forbedret DINO-score i tester mot denne eldre systemet.

FouRA (Fourier Low Rank Adaptation)

Publisert i juni 2024, FouRA-metoden kommer, som LoRA-X, fra Qualcomm AI Research, og deler noen av dens test-prompts og temaer.

Eksempler på distribusjons-kollaps i LoRA, fra 2024 FouRA-artikkelen, som bruker Realistic Vision 3.0-modellen trent med LoRA og FouRA for ‘Blue Fire’ og ‘Origami’-stil adaptere, over fire frø. LoRA-bilder viser distribusjons-kollaps og redusert diversitet, mens FouRA genererer mer varierte utdata. Kilde: https://arxiv.org/pdf/2406.08798

Eksempler på distribusjons-kollaps i LoRA, fra 2024 FouRA-artikkelen, som bruker Realistic Vision 3.0-modellen trent med LoRA og FouRA for ‘Blue Fire’ og ‘Origami’-stil adaptere, over fire frø. LoRA-bilder viser distribusjons-kollaps og redusert diversitet, mens FouRA genererer mer varierte utdata. Kilde: https://arxiv.org/pdf/2406.08798

FouRA fokuserer på å forbedre diversiteten og kvaliteten på genererte bilder ved å tilpasse LoRA i frekvensdomenet, ved hjelp av en Fourier-transform-tilnærming.

Her, igjen, kunne LoRA-X oppnå bedre resultater enn den Fourier-baserte tilnærmingen til FouRA.

Selv om begge rammeverkene faller innenfor PEFT-kategorien, har de svært forskjellige bruksområder og tilnærminger; i dette tilfellet er FouRA ‘å fylle hullene’ for en testrunde med begrensede like-for-like-rivaler for de nye forfatternes engasjement.

SVDiff

SVDiff har også forskjellige mål enn LoRA-X, men er sterkt brukt i den nye artikkelen. SVDiff er designet for å forbedre effektiviteten av fine-tuning av diffusjonsmodeller, og endrer direkte verdier innenfor modellens vekt-matriser, mens den holder singular-vektorene uendret. SVDiff bruker trunkert SVD, og endrer bare de største verdiene, for å justere modellens vekter.

Dette tilnærmingen bruker en data-forsterknings-teknikk kalt Cut-Mix-Unmix:

Flersubjekts-generering opererer som et konsept-isoleringssystem i SVDiff. Kilde: https://arxiv.org/pdf/2303.11305

Flersubjekts-generering opererer som et konsept-isoleringssystem i SVDiff. Kilde: https://arxiv.org/pdf/2303.11305

Cut-Mix-Unmix er designet for å hjelpe diffusjonsmodellen med å lære flere distinkte konsepter uten å blande dem sammen. Den sentrale ideen er å ta bilder av forskjellige subjekter og konkatenerer dem til ett enkelt bilde. Deretter blir modellen trent med prompts som beskriver de separate elementene i bildet. Dette tvinger modellen til å gjenkjenne og bevare distinkte konsepter i stedet for å blande dem sammen.

Under trening hjelper en ekstra reguleringsterm med å forhindre kryss-subjekts-interferens. Forfatternes teori hevder at dette muliggjør en forbedret flersubjekts-generering, hvor hvert element forblir visuelt distinkt, i stedet for å bli slått sammen.

SVDiff, som er ekskludert fra LoRA-X-testrunden, har som mål å skape et kompakt parameter-rom. LoRA-X, derimot, fokuserer på overførbarheten av LoRA-parametere over forskjellige grunnmodeller ved å operere innenfor underrommet til den opprinnelige modellen.

Konklusjon

Metodene diskutert her er ikke de eneste beboerne av PEFT. Andre inkluderer QLoRA og QA-LoRA; Prefix-Tuning; Prompt-Tuning; og adapter-tuning, blant andre.

‘Oppgraderbar LoRA’ er, kanskje, et alkymisk foretak; sikkert, det finnes ingenting umiddelbart på horisonten som vil forhindre LoRA-modellører fra å måtte dra ut sine gamle datasamlinger igjen for den siste og beste vekt-utgivelsen. Hvis det finnes en mulig prototype-standard for vekt-revisjon, som kan overleve endringer i arkitektur og økende parametere mellom modellversjoner, har det ikke dukket opp i litteraturen ennå, og vil fortsette å måtte trekkes ut fra dataene på en per-modell-basis.

 

Publisert torsdag, 30. januar 2025

Forfatter innen maskinlæring, domenespesialist i menneskeskildringssyntese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, inntil det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: [email protected]