Unghiul lui Anderson
Spre devenirea LoRAs care pot supraviețui actualizărilor de versiune ale modelului

De la ultima mea prezentare a creșterii hobbyiștilor Hunyuan Video LoRAs (fișiere mici, antrenate care pot injecta personalități personalizate în modelele de bază text-la-videoclip și imagine-la-videoclip cu miliarde de parametri), numărul de LoRAs conexe disponibile în comunitatea Civit a crescut cu 185%.

În ciuda faptului că nu există modalități ușoare sau cu efort redus pentru a crea un Hunyuan Video LoRA, catalogul de celebrități și LoRAs tematice de la Civit crește zilnic. Sursă: https://civitai.com/
Comunitatea care se străduiește să învețe cum să producă aceste „personalități suplimentare” pentru Hunyuan Video (HV) este, de asemenea, ulcerată pentru lansarea promisă a unei funcționalități imagine-la-videoclip (I2V) în Hunyuan Video.
În ceea ce privește sinteza de imagini umane deschise, acesta este un mare lucru; combinat cu creșterea LoRAs Hunyuan, ar putea permite utilizatorilor să transforme fotografii de oameni în videoclipuri într-un mod care nu erodează identitatea lor pe măsură ce videoclipul se dezvoltă – ceea ce este, în prezent, cazul tuturor generatorilor de imagine-la-videoclip de ultimă generație, inclusiv Kling, Kaiber și celebrul RunwayML:
Faceți clic pentru a reda. O generație de imagine-la-videoclip de la modelul Gen 3 Turbo de ultimă generație al RunwayML. Cu toate acestea, la fel ca și toate modelele rivale similare și inferioare, nu poate menține o identitate consistentă atunci când subiectul se îndepărtează de cameră, iar caracteristicile distincte ale imaginii de start devin o „femeie de difuzie generică”. Sursă: https://app.runwayml.com/
Prin dezvoltarea unei LoRAs personalizate pentru personalitatea în cauză, s-ar putea, într-un flux de lucru I2V HV, utiliza o fotografie reală a acesteia ca punct de plecare. Acesta este un „semăntător” mult mai bun decât trimiterea unui număr aleatoriu în spațiul latent al modelului și așteptarea rezultatului semantic care rezultă. S-ar putea utiliza apoi LoRA sau mai multe LoRAs pentru a menține consistența identității, a coafurilor, a îmbrăcăminții și a altor aspecte cheie ale unei generații.
Potential, disponibilitatea unei astfel de combinații ar putea reprezenta una dintre cele mai importante schimbări în inteligența artificială generativă de la lansarea Stable Diffusion, cu o putere generativă formidabilă transferată entuziaștilor deschise, fără reglementarea (sau „supravegherea”, dacă preferați) oferită de cenzorii de conținut din sistemul actual de videoclipuri generate.
Pe măsură ce scriu, Hunyuan imagine-la-videoclip este un obiectiv nefinalizat în depozitul GitHub Hunyuan Video, cu comunitatea hobbyiștilor raportând (anecdotic) un comentariu de la un dezvoltator Hunyuan, care, aparent, a declarat că lansarea acestei funcționalități a fost amânată pentru o dată ulterioară în primul trimestru din cauza faptului că modelul este „prea necenzurat”.

Lista oficială de lansare a caracteristicilor pentru Hunyuan Video. Sursă: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan
Exact sau nu, dezvoltatorii depozitului au livrat în mare măsură restul listei de caracteristici Hunyuan, și, prin urmare, Hunyuan I2V pare să apară în cele din urmă, indiferent dacă este cenzurat, necenzurat sau într-un mod „deblocabil”.
Dar, așa cum se poate vedea în lista de mai sus, lansarea I2V este, aparent, un model separat – ceea ce face destul de puțin probabil ca vreuna dintre LoRAs actuale în curs de dezvoltare de la Civit și din alte părți să funcționeze cu aceasta.
În acest scenariu (deja) previzibil, cadrele de antrenare LoRA, cum ar fi Musubi Tuner și OneTrainer, vor fi fie înapoiate, fie resetate în ceea ce privește suportul pentru noul model. Între timp, una sau două dintre cele mai tehnice (și antreprenoriale) personalități AI de pe YouTube vor răscumpăra soluțiile lor prin Patreon până când scena se recuperează.
Oboseala actualizării
Aproape nimeni nu experimentează oboseala actualizării la fel de mult ca un entuziast LoRA sau de finisare, deoarece ritmul rapid și competitiv de schimbare în inteligența artificială generativă încurajează fondurile de modele, cum ar fi Stability.ai, Tencent și Black Forest Labs, să producă modele mai mari și (uneori) mai bune la frecvența maximă viabilă.
Deoarece aceste noi și îmbunătățite modele vor avea, cel puțin, diferite prejudecăți și greutăți, și, mai frecvent, vor avea o scară și/sau arhitectură diferită, acest lucru înseamnă că comunitatea de finisare trebuie să-și scoată din nou seturile de date și să repete procesul de antrenare obositor pentru noua versiune.
Pentru acest motiv, există o mulțime de tipuri de versiuni LoRA Stable Diffusion disponibile la Civit:

Traseul actualizării, vizualizat în opțiunile de filtrare a căutării la civit.ai
Deoarece niciunul dintre aceste modele LoRA ușoare nu este interoperabil cu versiuni de model mai mari sau mai mici, și deoarece multe dintre ele au dependențe de fuziuni și finisări la scară largă populare care se conformează unui model mai vechi, o parte semnificativă a comunității tinde să rămână cu o versiune „moștenită”, în același mod în care loialitatea clienților față de Windows XP a persistat ani după ce suportul oficial a încetat.
Adaptarea la schimbare
Acest subiect vine în minte din cauza unei noi lucrări de la Qualcomm AI Research, care pretinde că a dezvoltat o metodă prin care LoRAs existente pot fi „actualizate” la o versiune nou lansată a modelului.

Exemplu de conversie a LoRAs între versiuni de model. Sursă: https://arxiv.org/pdf/2501.16559
Acest lucru nu înseamnă că abordarea nouă, intitulată LoRA-X, poate traduce liber între toate modelele de același tip (de exemplu, modele text-la-imagine sau modele de limbaj mare [LLM]); dar autorii au demonstrat o transliterare eficientă a unei LoRAs de la Stable Diffusion v1.5 > SDXL și o conversie a unei LoRAs pentru modelul text-based TinyLlama 3T la TinyLlama 2.5T.
LoRA-X transferă parametrii LoRA între diferite modele de bază prin păstrarea adaptatorului în subspațiul modelului sursă; dar numai în părți ale modelului care sunt suficient de asemănătoare între versiuni de model.

Pe partea stângă, un schema pentru modul în care modelul sursă LoRA-X fine-tunează un adaptator, care este apoi ajustat pentru a se potrivi modelului țintă folosind structura sa internă. Pe partea dreaptă, imagini generate de modelele țintă SD Eff-v1.0 și SSD-1B, după aplicarea adaptatorilor transferați de la SD-v1.5 și SDXL fără antrenament suplimentar.
Deși acesta oferă o soluție practică pentru scenariile în care reantrenarea este nedorită sau imposibilă (cum ar fi o schimbare a licenței pentru datele de antrenament inițiale), metoda este limitată la arhitecturi de modele similare, printre alte limitări.
Deși aceasta este o incursiune rară într-un domeniu slab studiat, nu vom examina această lucrare în profunzime din cauza numeroaselor sale limitări, așa cum se evidențiază din comentariile criticilor și consilierilor săi la Open Review.
Metoda se bazează pe asemănarea subspațiului, ceea ce limitează aplicarea sa la modele strâns legate, și autorii au concedat în forumul de revizuire că LoRA-X nu poate fi transferat ușor între arhitecturi semnificativ diferite
Alte abordări PEFT
Posibilitatea de a face LoRAs mai portabile între versiuni este un fir de studiu mic, dar interesant, în literatură, și principala contribuție pe care LoRA-X o aduce acestei urmăriri este susținerea sa că nu necesită antrenament. Acest lucru nu este strict adevărat, dacă citiți lucrarea, dar necesită cel mai puțin antrenament dintre toate metodele anterioare.
LoRA-X este o altă intrare în canonul metodelor de finisare eficientă a parametrilor (PEFT), care abordează provocarea de a adapta modele preantrenate mari la sarcini specifice fără antrenament extins. Acestă abordare conceptuală își propune să modifice un număr minim de parametri, menținând în același timp performanța.
Printre acestea se numără:
X-Adapter
Cadrul X-Adapter transferă adaptori finisați între modele cu o anumită cantitate de reantrenare. Sistemul își propune să permită module preantrenate (cum ar fi ControlNet și LoRA) dintr-un model de difuzie de bază (de exemplu, Stable Diffusion v1.5) să funcționeze direct cu un model de difuzie actualizat, cum ar fi SDXL, fără reantrenare – funcționând, în esență, ca un „actualizator universal” pentru plug-in-uri.
Sistemul realizează acest lucru prin antrenarea unei rețele suplimentare care controlează modelul actualizat, utilizând o copie înghețată a modelului de bază pentru a păstra conectările plug-inului:

Schema pentru X-Adapter. Sursă: https://arxiv.org/pdf/2312.02238
X-Adapter a fost inițial dezvoltat și testat pentru a transfera adaptori de la SD1.5 la SDXL, în timp ce LoRA-X oferă o varietate mai largă de transliterări.
DoRA (Weight-Decomposed Low-Rank Adaptation)
DoRA este o metodă de finisare îmbunătățită care îmbunătățește LoRA prin utilizarea unei strategii de descompunere a greutății care seamănă mai mult cu finisarea completă:

DoRA nu încearcă doar să copieze un adaptator într-un mediu înghețat, așa cum face LoRA-X, ci schimbă parametri fundamentali ai greutăților, cum ar fi magnitudinea și direcția. Sursă: https://arxiv.org/pdf/2402.09353
DoRA se concentrează pe îmbunătățirea procesului de finisare în sine, prin descompunerea greutăților modelului în magnitudine și direcție (a se vedea imaginea de mai sus). În schimb, LoRA-X se concentrează pe facilitarea transferului de parametri finisați existente între diferite modele de bază
Cu toate acestea, abordarea LoRA-X adaptează tehnicile de proiecție dezvoltate pentru DoRA, și în testele împotriva acestui sistem mai vechi pretinde un DINO îmbunătățit.
FouRA (Fourier Low Rank Adaptation)
Publicată în iunie 2024, metoda FouRA vine, la fel ca și LoRA-X, de la Qualcomm AI Research, și împărtășește unele dintre temele și testele sale.

Exemple de colaps de distribuție în LoRA, din lucrarea FouRA din 2024, utilizând modelul Realistic Vision 3.0 antrenat cu LoRA și FouRA pentru adaptori de stil „Foc albastru” și „Origami”, pe patru semințe. Imaginile LoRA prezintă colaps de distribuție și diversitate redusă, în timp ce FouRA generează ieșiri mai variate. Sursă: https://arxiv.org/pdf/2406.08798
FouRA se concentrează pe îmbunătățirea diversității și calității imaginilor generate prin adaptarea LoRA în domeniul frecvenței, utilizând o abordare Fourier.
Aici, din nou, LoRA-X a reușit să obțină rezultate mai bune decât abordarea bazată pe Fourier a FouRA.
Cu toate că ambele cadre se încadrează în categoria PEFT, acestea au cazuri de utilizare și abordări foarte diferite; în acest caz, FouRA este, probabil, „umplerea numărului” pentru o rundă de testare cu rivali limitați și similari pentru autorii noii lucrări.
SVDiff
SVDiff are obiective diferite față de LoRA-X, dar este puternic implicat în noua lucrare. SVDiff este conceput pentru a îmbunătăți eficiența finisării modelelor de difuzie și modifică direct valorile din matricile de greutate ale modelului, păstrând vectorii singulari nemodificați. SVDiff utilizează SVD trunchiat, modificând doar valorile cele mai mari, pentru a ajusta greutățile modelului.
Acestă abordare utilizează o tehnică de augmentare a datelor numită Cut-Mix-Unmix:

Generarea multi-subiect este un sistem de izolare a conceptelor în SVDiff. Sursă: https://arxiv.org/pdf/2303.11305
Cut-Mix-Unmix este conceput pentru a ajuta modelul de difuzie să învețe multiple concepte distincte fără a le amesteca. Ideea centrală este de a lua imagini cu subiecte diferite și de a le concatena într-o singură imagine. Apoi modelul este antrenat cu prompturi care descriu explicit elementele separate din imagine. Acest lucru forțează modelul să recunoască și să păstreze concepte distincte, în loc să le amestece.
În timpul antrenamentului, un termen de regularizare suplimentar ajută la prevenirea interferenței între subiecte. Teoria autorilor susține că acest lucru facilitează o generație multi-subiect îmbunătățită, în care fiecare element rămâne distinct vizual, în loc să fie fuzionat.
SVDiff, exclus din runda de testare LoRA-X, își propune să creeze un spațiu de parametri compact. LoRA-X, în schimb, se concentrează pe transferabilitatea parametrilor LoRA între diferite modele de bază, operând în subspațiul modelului original.
Concluzie
Metodele discutate aici nu sunt singurele locuitori ai PEFT. Altele includ QLoRA și QA-LoRA; Prefix Tuning; Prompt-Tuning; și adapter-tuning, printre altele.
„LoRA actualizabilă” este, poate, o urmărire alchimică; cu siguranță, nu există nimic pe orizont care să prevină modelatorii LoRA să-și scoată din nou seturile de date vechi pentru cea mai recentă și mai bună lansare de greutăți. Dacă există un posibil prototip de standard pentru revizia greutăților, capabil să supraviețuiască schimbărilor de arhitectură și balonării parametrilor între versiuni de model, nu a apărut încă în literatură și va trebui să continue să fie extras din date pe baza fiecărui model.
Publicat pentru prima dată joi, 30 ianuarie 2025












