Andersons hoek
Naar LoRAs die modelversie-upgrades kunnen overleven

Sinds mijn recente verslag over de groei van hobbyist Hunyuan Video LoRAs (kleine, getrainde bestanden die aangepaste persoonlijkheden kunnen injecteren in multibillion parameter text-to-video en image-to-video foundation modellen), is het aantal gerelateerde LoRAs beschikbaar op de Civit-community met 185% toegenomen.

Ondanks het feit dat er geen gemakkelijke of lageffort manieren zijn om een Hunyuan Video LoRA te maken, groeit de catalogus van celebrity en thema LoRAs op Civit dagelijks. Bron: https://civitai.com/
Dezelfde gemeenschap die worstelt om te leren hoe ze deze ‘add-on persoonlijkheden’ voor Hunyuan Video (HV) kunnen produceren, is ook ulcerating voor de beloofde release van een image-to-video (I2V) functionaliteit in Hunyuan Video.
Met betrekking tot open source human image synthesis, is dit een grote zaak; in combinatie met de groei van Hunyuan LoRAs, kan dit gebruikers in staat stellen om foto’s van mensen om te zetten in video’s op een manier die hun identiteit niet ondermijnt terwijl de video ontwikkelt – wat momenteel het geval is in alle state-of-the-art image-to-video generators, inclusief Kling, Kaiber en de veelgeprezen RunwayML:
Klik om af te spelen. Een image-to-video generatie van RunwayML’s state-of-the-art Gen 3 Turbo model. Echter, net als alle soortgelijke en minder rivaliserende modellen, kan het geen consistente identiteit behouden wanneer het onderwerp zich van de camera afkeert, en worden de distincte kenmerken van het startbeeld een ‘generieke diffusie vrouw’. Bron: https://app.runwayml.com/
Door een aangepaste LoRA voor de persoonlijkheid in kwestie te ontwikkelen, kan men, in een HV I2V workflow, een echte foto van hen als startpunt gebruiken. Dit is een veel beter ‘zaad’ dan een willekeurig nummer in de latent space van het model en genoegen nemen met welk semantisch scenario dan ook. Men kan dan de LoRA, of meerdere LoRAs, gebruiken om de consistentie van identiteit, haardracht, kleding en andere cruciale aspecten van een generatie te behouden.
Potentiële, de beschikbaarheid van een dergelijke combinatie kan een van de meest epochale verschuivingen in generatieve AI sinds de lancering van Stable Diffusion vertegenwoordigen, met formidabele generatieve kracht overgedragen aan open source enthousiastelingen, zonder de regulering (of ‘gatekeeping’, als je dat liever hebt) die wordt geboden door de content censors in de huidige crop van populaire gen vid systemen.
Terwijl ik schrijf, is Hunyuan image-to-video een unticked ‘to do’ in de Hunyuan Video GitHub repo, met de hobbyist community die anekdotisch rapporteert over een Discord comment van een Hunyuan ontwikkelaar, die blijkbaar heeft verklaard dat de release van deze functionaliteit is uitgesteld tot later in Q1 vanwege het model te ‘oncensored’ is.

De officiële functie release checklist voor Hunyuan Video. Bron: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan
Accuraat of niet, de repo ontwikkelaars hebben substantieel geleverd op de rest van de Hunyuan checklist, en dus lijkt Hunyuan I2V set om te arriveren, of het nu gecensureerd, ongecensureerd of op een of andere manier ‘unlockable’ is.
Maar zoals we kunnen zien in de lijst hierboven, is de I2V release blijkbaar een apart model helemaal – wat het vrij onwaarschijnlijk maakt dat enig van de huidige bloeiende oogst van HV LoRAs op Civit en elders zal functioneren met het.
In dit (nu) voorspelbare scenario, LoRA trainingskaders zoals Musubi Tuner en OneTrainer zullen ofwel worden teruggedraaid of gereset in verband met het ondersteunen van het nieuwe model. Ondertussen zal een of twee van de meest technisch onderlegde (en ondernemende) YouTube AI luminaries hun oplossingen via Patreon inzetten totdat de scène zich aanpast.
Upgrade Vermoeidheid
Bijna niemand ervaart upgrade vermoeidheid zo veel als een LoRA of fine-tuning enthousiasteling, omdat de snelle en concurrerende tempo van verandering in generatieve AI model gieterijen zoals Stability.ai, Tencent en Black Forest Labs ertoe aanzet om grotere en (soms) betere modellen te produceren op de maximale haalbare frequentie.
Sinds deze nieuwe en verbeterde modellen ten minste andere biases en gewichten zullen hebben, en vaker een andere schaal en/of architectuur, betekent dit dat de fine-tuning gemeenschap hun datasets opnieuw moet uitvoeren en het zware trainingsproces moet herhalen voor de nieuwe versie.
Om deze reden zijn er meerdere Stable Diffusion LoRA versietypen beschikbaar op Civit:

De upgrade trail, visualized in search filter opties op civit.ai
Sinds geen van deze lichtgewicht LoRA modellen interoperabel zijn met hogere of lagere modelversies, en sinds veel van hen afhankelijk zijn van populaire grote schaal merges en fine-tunes die vasthouden aan een ouder model, heeft een aanzienlijk deel van de gemeenschap de neiging om vast te houden aan een ‘legacy’ release, op dezelfde manier als klantloyaliteit aan Windows XP bleef bestaan jaren na het einde van de officiële ondersteuning.
Aanpassen aan Verandering
Dit onderwerp komt in gedachten vanwege een nieuw artikel van Qualcomm AI Research dat beweert een methode te hebben ontwikkeld om bestaande LoRAs ‘up te graden’ naar een nieuw uitgebrachte modelversie.

Voorbeeld conversie van LoRAs over modelversies. Bron: https://arxiv.org/pdf/2501.16559
Dit betekent niet dat de nieuwe aanpak, getiteld LoRA-X, vrij kan worden vertaald tussen alle modellen van hetzelfde type (d.w.z. tekst-naar-afbeelding modellen, of Large Language Models [LLMs]); maar de auteurs hebben een effectieve transliteratie van een LoRA van Stable Diffusion v1.5 > SDXL gedemonstreerd, en een conversie van een LoRA voor het tekstgebaseerde TinyLlama 3T model naar TinyLlama 2.5T.
LoRA-X transfereert LoRA parameters over verschillende basis modellen door de adapter binnen de subspace van het bronmodel te behouden; maar alleen in delen van het model die voldoende gelijk zijn over modelversies.

Links, een schema voor de manier waarop de LoRA-X bronmodel fine-tunes een adapter, die vervolgens wordt aangepast om te passen bij het doelmodel. Rechts, afbeeldingen gegenereerd door doelmodellen SD Eff-v1.0 en SSD-1B, na het toepassen van adapters overgedragen van SD-v1.5 en SDXL zonder aanvullende training.
Hoewel dit een praktische oplossing biedt voor scenario’s waarin opnieuw trainen ongewenst of onmogelijk is (zoals een wijziging van de licentie op de oorspronkelijke trainingsgegevens), is de methode beperkt tot vergelijkbare modelarchitecturen, onder andere beperkingen.
Hoewel dit een zeldzame uitstap is in een onderbestudeerd veld, zullen we dit artikel niet diepgaand onderzoeken vanwege de vele tekortkomingen van LoRA-X, zoals blijkt uit commentaren van zijn critici en adviseurs op Open Review.
De methode’s afhankelijkheid van subspace gelijkenis beperkt de toepassing tot nauw verwante modellen, en de auteurs hebben toegegeven in de review forum dat LoRA-X niet gemakkelijk kan worden overgedragen tussen significant verschillende architecturen
Andere PEFT Benaderingen
De mogelijkheid om LoRAs meer draagbaar te maken over versies is een kleine maar interessante draad van studie in de literatuur, en de belangrijkste bijdrage die LoRA-X levert aan deze onderneming is zijn bewering dat het geen training vereist. Dit is niet strikt waar, als men het artikel leest, maar het vereist wel de minste training van alle voorgaande methoden.
LoRA-X is een andere entry in het canon van Parameter-Efficient Fine-Tuning (PEFT) methoden, die de uitdaging aanpakken van het aanpassen van grote voorgetrainde modellen aan specifieke taken zonder uitgebreide opnieuw training. Deze conceptuele benadering heeft als doel om een minimale hoeveelheid parameters te wijzigen terwijl de prestaties behouden blijven.
Opvallend onder deze zijn:
X-Adapter
De X-Adapter framework transfereert fine-tuned adapters over modellen met een zekere mate van opnieuw trainen. Het systeem heeft als doel om voorgetrainde plug-and-play modules (zoals ControlNet en LoRA) van een basis diffusie model (d.w.z. Stable Diffusion v1.5) te laten werken rechtstreeks met een verbeterd diffusie model zoals SDXL zonder opnieuw trainen – effectief als een ‘universele upgrader’ voor plugins.
Het systeem bereikt dit door een extra netwerk te trainen dat het verbeterde model controleert, met behulp van een bevroren kopie van het basis model om plugin connectors te behouden:

Schema voor X-Adapter. Bron: https://arxiv.org/pdf/2312.02238
X-Adapter was oorspronkelijk ontwikkeld en getest om adapters over te dragen van SD1.5 naar SDXL, terwijl LoRA-X een bredere variëteit aan transliteraties biedt.
DoRA (Weight-Decomposed Low-Rank Adaptation)
DoRA is een verbeterde fine-tuning methode die LoRA verbetert door een gewichtsdecompositie strategie te gebruiken die meer lijkt op volledige fine-tuning:

DoRA verandert niet alleen de fundamentele parameters van de gewichten, zoals magnitude en richting. Bron: https://arxiv.org/pdf/2402.09353
DoRA richt zich op het verbeteren van het fine-tuning proces zelf, door de gewichten van het model te decomponeren in magnitude en richting (zie afbeelding hierboven). In plaats daarvan richt LoRA-X zich op het mogelijk maken van de overdracht van bestaande fine-tuned parameters tussen verschillende basis modellen
Echter, de LoRA-X benadering past de projectie technieken die zijn ontwikkeld voor DORA, en claimt in tests tegen deze oudere systeem een verbeterde DINO score.
FouRA (Fourier Low Rank Adaptation)
Gepubliceerd in juni 2024, de FouRA methode komt, net als LoRA-X, van Qualcomm AI Research, en deelt enkele van zijn test prompts en thema’s.

Voorbeelden van distributie ineenstorting in LoRA, van de 2024 FouRA paper, met behulp van het Realistic Vision 3.0 model getraind met LoRA en FouRA voor ‘Blue Fire’ en ‘Origami’ stijl adapters, over vier seeds. LoRA afbeeldingen vertonen distributie ineenstorting en verminderde diversiteit, terwijl FouRA meer gevarieerde uitvoer genereert. Bron: https://arxiv.org/pdf/2406.08798
FouRA richt zich op het verbeteren van de diversiteit en kwaliteit van gegenereerde afbeeldingen door LoRA aan te passen in de frequentiedomein, met behulp van een Fourier transformatie benadering.
Hier, opnieuw, was LoRA-X in staat om betere resultaten te behalen dan de Fourier-gebaseerde benadering van FouRA.
Hoewel beide kaders binnen de PEFT categorie vallen, hebben ze heel verschillende use cases en benaderingen; in dit geval is FouRA mogelijk ‘het opvullen van de nummers’ voor een testronde met beperkte gelijkaardige rivalen voor de nieuwe paper’s auteurs om mee te werken.
SVDiff
SVDiff heeft andere doelen dan LoRA-X, maar wordt sterk gebruikt in het nieuwe artikel. SVDiff is ontworpen om de efficiëntie van het fine-tuning van diffusie modellen te verbeteren, en past direct waarden aan binnen de gewichtsmatrices van het model, terwijl de singuliere vectoren ongewijzigd blijven. SVDiff gebruikt afgekapt SVD, waarbij alleen de grootste waarden worden gewijzigd, om de gewichten van het model aan te passen.
Deze benadering gebruikt een data augmentatie techniek genaamd Cut-Mix-Unmix:

Multi-subject generatie werkt als een concept-isolerend systeem in SVDiff. Bron: https://arxiv.org/pdf/2303.11305
Cut-Mix-Unmix is ontworpen om het diffusie model te helpen meerdere distincte concepten te leren zonder ze te mengen. Het centrale idee is om afbeeldingen van verschillende onderwerpen te nemen en ze samen te voegen tot één afbeelding. Vervolgens wordt het model getraind met prompts die de afzonderlijke elementen in de afbeelding beschrijven. Dit dwingt het model om distincte concepten te herkennen en te behouden in plaats van ze te mengen.
Tijdens de training helpt een extra regularisatie term om cross-subject interferentie te voorkomen. De theorie van de auteurs beweert dat dit een verbeterde multi-subject generatie mogelijk maakt, waarbij elk element visueel distinct blijft, in plaats van te worden gefuseerd.
SVDiff, uitgesloten van de LoRA-X testronde, heeft als doel een compacte parameter ruimte te creëren. LoRA-X richt zich daarentegen op de overdraagbaarheid van LoRA parameters over verschillende basis modellen door te werken binnen de subspace van het oorspronkelijke model.
Conclusie
De methoden die hier worden besproken zijn niet de enige inwoners van PEFT. Andere omvatten QLoRA en QA-LoRA; Prefix Tuning; Prompt-Tuning; en adapter-tuning, onder anderen.
De ‘upgradable LoRA’ is, misschien, een alchemistische onderneming; zeker, er is niets direct op de horizon dat LoRA modelers zal tegenhouden om hun oude datasets opnieuw te gebruiken voor de laatste en beste gewichtsrelease. Als er een mogelijke prototype standaard is voor gewichtsrevisie, die in staat is om veranderingen in architectuur en opgeblazen parameters tussen modelversies te overleven, dan is het nog niet verschenen in de literatuur, en zal het moeten blijven worden geëxtraheerd uit de gegevens op een per-model basis.
Eerst gepubliceerd donderdag, 30 januari 2025












