Andersonin kulma
Kohti LoRA:ja, jotka voivat selviytyä mallin päivityksistä

Sitten viimeisin kattaus Hunyuan Video LoRAn kasvusta, harrastajien LoRA:määrä Civit-yhteisössä on kasvanut 185 %.

Vaikka Hunyuan Video LoRA:n luominen ei ole helppoa tai vaivatonta, Civit- ja muiden yhteisöjen LoRA-valikoima kasvaa päivittäin. Lähde: https://civitai.com/
Sama yhteisö, joka yrittää oppia tuottamaan nämä “lisähenkilöllisyydet” Hunyuan Videolle, odottaa myös kuumeisesti Hunyuan Videon kuvalta-videoksi (I2V) -toiminnallisuuden julkaisua.
Avoimen lähdekoodin ihmiskuvan synteesin suhteen tämä on suuri asia; yhdistettynä Hunyuan LoRA:n kasvun kanssa se voisi mahdollistaa käyttäjien muuttaa valokuvia videoiksi tavalla, joka ei heikennä heidän identiteettiään videon kehittyessä – mikä on tällä hetkellä tapahtumassa kaikissa viimeisimmissä kuva-videogeneraattoreissa, mukaan lukien Kling, Kaiber ja juhlittu RunwayML:
Klikkaa toistamaan. Kuva-videogeneraatio RunwayML:n viimeisimmän Gen 3 Turbo -mallin avulla. Kuitenkin, yhdessä kaikkien muiden vastaavien ja heikompien mallien kanssa, se ei voi ylläpitää johdonmukaista identiteettiä, kun aihe kääntyy pois kamerasta, ja alkuperäisen kuvan erottuvat piirteet muuttuvat “yleiseksi diffuusionaarisiksi naisiksi”. Lähde: https://app.runwayml.com/
Kehittämällä mukautetun LoRA:n kyseiselle henkilölle, voisi, HV I2V -työvirrassa, käyttää oikeaa valokuvaa lähtökohtana. Tämä on paljon parempi “siemen” kuin lähettäminen satunnainen numero mallin latenttiavaruuteen ja sopeutuminen mihin tahansa semanttiseen skenaarioon, joka tuloksena on. Voisi sitten käyttää LoRA:ta tai useita LoRA:ja ylläpitämään identiteetin johdonmukaisuutta, hiusten, vaatetus ja muita keskeisiä generaattorin osia.
Potentialisesti, tällaisen yhdistelmän saatavuus voisi edustaa yhtä merkittävimmistä muutoksista generatiivisessa tekoälyssä sitten Stable Diffusion -julkaisun, jossa voimakas generatiivinen valta on annettu avoimen lähdekoodin harrastajille, ilman sääntelyä (tai “porttien valvontaa”, jos niin haluat) nykyisissä suosituissa gen-vid-järjestelmissä.
Kun kirjoitan tätä, Hunyuan-kuvalta-videota on merkitty “tehtäväksi” Hunyuan Videon GitHub -rekisterissä, ja harrastajayhteisö on raportoinut (anekdoottisesti) Discord -viestin Hunyuan -kehittäjältä, joka ilmoitti, että tämän toiminnallisuuden julkaisu on siirretty takaisin jonkin verran myöhemmäksi Q1:een, koska malli on “liian sensuroimaton”.

Hunyuan Videon virallinen ominaisuusluettelo. Lähde: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan
Tarkkaa tai ei, repo -kehittäjät ovat toimittaneet merkittävästi loput Hunyuan -luettelosta, ja siten Hunyuan I2V näyttää olevan tulossa lopulta, olipa se sensuroitu, sensuroimaton tai jollain tavoin “lukittavissa”.
Mutta kun tarkastelemme listaa yllä, I2V -julkaisu on ilmeisesti erillinen malli kokonaan – mikä tekee siitä melko epätodennäköisen, että mikään nykyisistä kasvavista Hunyuan LoRA:ista Civitissä ja muualla toimisi siinä.
Tässä (jo nyt) ennustettavissa olevassa skenaariossa, LoRA -koulutuskehykset, kuten Musubi Tuner ja OneTrainer, joko jäävät jälkeen tai nollautuvat uuden mallin tukemisessa. Sillä aikaa, yksi tai kaksi teknisesti taitavimpia (ja yrittäjämäisimpiä) YouTube -AI -tähtiä voi vaatia korvausta heidän ratkaisuistaan Patreonin kautta, kunnes skenaario kehittyy.
Päivitysmurtuma
Melkein kukaan ei koe päivitysmurtumaa niin paljon kuin LoRA – tai hienosäätö -harrastaja, koska nopea ja kilpailukykyinen muutoksen tahti generatiivisessa tekoälyssä rohkaisee mallinvalimoja, kuten Stability.ai, Tencent ja Black Forest Labs, tuottamaan suurempia ja (joskus) parempia malleja maksimaalisella taajuudella.
Nämä uudet ja parannetut mallit ovat vähintään erilaisia biasseja ja painoja, ja yleensä niillä on erilainen skaala ja / tai arkkitehtuuri, mikä tarkoittaa, että hienosäätöyhteisöllä on otettava datasetit uudelleen ja toistettava raskas koulutusprosessi uudelle versiolle.
Tästä syystä useita Stable Diffusion LoRA -versiotyyppejä on saatavilla Civitissä:

Päivitysreitti visualisoituna hakusuodattimien valinnoissa civit.ai:ssa
Koska mikään näistä kevyistä LoRA -malleista ei ole yhteensopiva korkeampien tai matalampien malliversioiden kanssa, ja koska useilla niistä on riippuvuutta suosiota saaneista suurista yhdistelmistä ja hienosäätöistä, jotka noudattavat vanhempaa mallia, yhteisön merkittävä osa taipuu pysymään “perinteisessä” julkaisussa, samalla tavoin kuin asiakastuki Windows XP:lle säilyi vuosia virallisen tuen päättymisen jälkeen.
Soveltuminen muutokseen
Tämä aihe tulee mieleen Qualcomm AI -tutkimuksen uuden tutkimuksen myötä, joka väittää kehittäneensä menetelmän, jolla olemassa olevat LoRA:t voidaan “päivittää” uuteen malliversioon.

Esimerkki LoRA:n muunnoksesta malliversioita välillä. Lähde: https://arxiv.org/pdf/2501.16559
Tämä ei tarkoita, että uusi lähestymistapa, nimeltään LoRA-X, voi vapaasti kääntää kaikkia malleja samanlaisiin malleihin (esim. teksti-kuva -malleja tai suuria kielen malleja [LLM]); mutta tekijät ovat osoittaneet tehokkaan LoRA:n translitteroinnin Stable Diffusion v1.5:stä > SDXL:ään, ja LoRA:n käännöksen tekstipohjaisesta TinyLlama 3T -mallista TinyLlama 2.5T:ään.
LoRA-X siirtää LoRA -parametreja eri perusmallien välillä säilyttäen sovittimen lähde-mallin alavuudessa; mutta vain osissa, jotka ovat riittävän samanlaisia malliversioita.

Vasemmalla, LoRA-X -lähde-mallin hienosäätösovitin, jota sitten säätellään sopimaan kohde-malliin sen oman rakenteen avulla. Oikealla, kuvat, jotka on generoitu kohde-malleilla SD Eff-v1.0 ja SSD-1B, soveltaen sovittimia, jotka on siirretty SD-v1.5:stä ja SDXL:stä ilman lisäkoulutusta.
Vaikka tämä tarjoaa käytännöllisen ratkaisun tilanteisiin, joissa uudelleenkoulutus ei ole toivottavaa tai mahdollista (kuten lisensointimuutoksessa alkuperäisessä koulutusdatassa), menetelmä on rajoitettu samankaltaisiin mallirakenteisiin, muun muassa.
Vaikka tämä on harvinainen tutkimusalue, emme tarkastele tätä tutkimusta syvemmälti LoRA-X:n monien puutteiden vuoksi, kuten kriitikoiden ja neuvonantajien kommentit Open Review -palvelussa osoittavat.
Menetelmän riippuvuus alavuuden samankaltaisuudesta rajoittaa sen soveltamista läheisiin malleihin, ja tekijät ovat myöntäneet arvosteluforumissa, että LoRA-X ei voi helposti siirtää merkittävästi erilaisiin arkkitehtuureihin.
Muita PEFT -lähestymistapoja
Mahdollisuus tehdä LoRA:ista enemmän siirrettäviä versioita on pieni, mutta mielenkiintoinen tutkimussuunta kirjallisuudessa, ja LoRA-X:n pääpanostus tähän pyrkimykseen on sen väite, että se ei vaadi koulutusta. Tämä ei ole tiukasti ottaen totta, jos lukee tutkimuksen, mutta se vaatii vähiten koulutusta kaikista aiemmista menetelmistä.
LoRA-X on yksi Parameter-Efficient Fine-Tuning (PEFT) -menetelmistä, jotka ovat suunnattu suurten esikoulutettujen mallien sovittamiseen tiettyihin tehtäviin ilman laajaa uudelleenkoulutusta. Tämä käsitteellinen lähestymistapa pyrkii muuttamaan minimin määrän parametreja säilyttäen suorituskyvyn.
Merkittäviä niistä ovat:
X-Adapter
X-Adapter -kehys siirtää hienosäätösovitteita malleista toisiin tietyn määrän uudelleenkoulutuksen kanssa. Järjestelmä pyrkii mahdollistamaan esikoulutettujen moduulien (kuten ControlNet ja LoRA) suoran käytön päivitetyssä mallissa ilman uudelleenkoulutusta – toimien käytännössä “yleisenä päivitystyökaluna” liitännäisille.
Järjestelmä saavuttaa tämän kouluttamalla lisäverkkoa, joka ohjaa päivitettyä mallia, käyttäen jäätynyttä kopiota perusmallista säilyttääkseen liitännäisliitännät:

X-Adapterin skeema. Lähde: https://arxiv.org/pdf/2312.02238
X-Adapter kehitettiin alun perin ja testattiin siirtämään sovitteita SD1.5:stä SDXL:ään, kun taas LoRA-X tarjoaa laajemman valikoiman translitteraatioita.
DoRA (Weight-Decomposed Low-Rank Adaptation)
DoRA on parannettu hienosäätömenetelmä, joka parantaa LoRA:ta käyttämällä painojen hajoitusstrategiaa, joka muistuttaa enemmän täyttä hienosäätöä:

DoRA ei yritä vain kopioida sovittimen jäätynyssä ympäristössä, kuten LoRA-X, vaan muuttaa perustavanlaatuisia parametreja painoissa, kuten suuruutta ja suuntaa. Lähde: https://arxiv.org/pdf/2402.09353
DoRA keskittyy parantamaan itse hienosäätöprosessia, hajottamalla mallin painot suuruuteen ja suuntaan (ks. yllä oleva kuva). Sen sijaan LoRA-X keskittyy mahdollistamaan olemassa olevien hienosäätöparametrien siirtämisen eri perusmallien välillä
Kuitenkin LoRA-X -lähestymistapa soveltaa DORA:lle kehitettyjä projektio -tekniikoita, ja väittää parannetun DINO -tuloksen testauksissa tämän vanhemman järjestelmän vastaan.
FouRA (Fourier Low Rank Adaptation)
Julkaistu kesäkuussa 2024, FouRA -menetelmä tulee, kuten LoRA-X, Qualcomm AI -tutkimuksesta, ja jakaa joitakin testausaiheita ja -teemoja.

Esimerkkejä LoRA:n jakautumisesta FouRA -tutkimuksesta, käyttäen Realistic Vision 3.0 -mallia, joka on koulutettu LoRA:lla ja FouRA:lla ‘Blue Fire’ – ja ‘Origami’ -tyylisille sovittimille, neljällä siemenellä. LoRA -kuvat näyttävät jakautumista ja vähennettyä monimuotoisuutta, kun taas FouRA generoi monipuolisempia tuloksia. Lähde: https://arxiv.org/pdf/2406.08798
FouRA keskittyy parantamaan generoitujen kuvien monimuotoisuutta ja laatua sovittamalla LoRA:ta taajuusalueella Fourier -muunnoksen avulla.
Tässä, jälleen, LoRA-X pystyi saavuttamaan paremmat tulokset kuin FouRA:n Fourier -lähestymistapa.
Vaikka molemmat kehykset kuuluvat PEFT -luokkaan, niillä on erilaiset soveltamiskohdat ja lähestymistavat; tässä tapauksessa FouRA on “täyttämässä numerot” rajoitetun vertailukierroksen vuoksi.
SVDiff
SVDiff on erilainen tavoite kuin LoRA-X, mutta se on vahvasti liitetty uuteen tutkimukseen. SVDiff on suunniteltu parantamaan diffuusiomallien hienosäätötehokkuutta, ja se muuttaa suoraan arvoja mallin painomatriisissa, pitäen singularivektorit muuttumattomina. SVDiff käyttää loppuvan SVD:tä, muuttaen vain suurimmat arvot, sovittaakseen mallin painoja.
Tämä lähestymistapa käyttää data-augmentaatiotekniikkaa nimeltä Cut-Mix-Unmix:

Moni-aiheisen generoinnin toimintatapa SVDiffissä. Lähde: https://arxiv.org/pdf/2303.11305
Cut-Mix-Unmix on suunniteltu auttamaan diffuusiomallia oppimaan useita erillisiä käsitteitä sekoittamatta niitä. Keskiaivoitus on ottaa eri aiheiden kuvia ja yhdistää ne yhdeksi kuvaksi. Sitten malli koulutetaan vihjeillä, jotka kuvaavat erillisiä elementtejä kuvassa. Tämä pakottaa mallin tunnistamaan ja säilyttämään erillisiä käsitteitä sekoittamatta niitä.
Koulutuksen aikana lisäksi sääntelytermi auttaa estämään aiheiden välistä interferenssiä. Tekijöiden teoria väittää, että tämä edistää parantunutta moni-aiheisen generointia, jossa kunkin elementin säilyttää visuaalisen erottuvuuden, eikä sekoitu muiden kanssa.
SVDiff, joka on poissuljettu LoRA-X -testauskierrosta, pyrkii luomaan tiiviin parametriavaruuden. LoRA-X puolestaan keskittyy LoRA -parametrien siirtämiseen eri perusmallien välillä toimimalla alkuperäisen mallin alavuudessa.
Johtopäätös
Käsitellyt menetelmät eivät ole ainoita asukkaita PEFT:ssa. Muita ovat QLoRA ja QA-LoRA; Prefix-Tuning; Prompt-Tuning; ja adapter-tuning, muun muassa.
“Päivitettävä LoRA” on ehkä alkimistinen tavoite; varmasti, ei ole mitään välittömästi näkyvissä, mikä estäisi LoRA -mallien tekijöitä joutumasta hakemaan vanhat datasetit uusimman ja parhaimman painojen julkaisun vuoksi. Jos on olemassa mahdollinen prototyyppistandardi painojen tarkistamiseen, joka voi selviytyä arkkitehtuurin muutoksista ja parametreiden paisumisesta malliversioiden välillä, se ei ole vielä ilmestynyt kirjallisuuteen, ja sitä on jatkossakin haettava datasta mallikohtaisesti. Julkaistu torstaina, 30. tammikuuta 2025












