Andersonin kulma

Nollan mukauttamisen taistelu generatiivisessa tekoälyssä

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
Timothy Chalomet replaces Jack Nicholson in The Shining (1980), thanks to the new HyperLoRA system. Source: https://arxiv.org/pdf/2503.16944

Jos haluat lisätä itsesi suosittuun kuvan tai videon generointityökaluun, mutta et ole jo tarpeeksi kuuluisa, jotta perusmalli tunnistaisi sinut, sinun on koulutettava matalan sijan sovittaminen (LoRA) -malli omista valokuvistasi. Kun se on luotu, tämä henkilökohtainen LoRA-malli sallii generatiivisen mallin sisällyttää identiteettisi tuleviin tuloksiin.

Tätä kutsutaan yleisesti mukauttamiseksi kuvan ja videon synteesin tutkimusalueella. Se ilmestyi muutaman kuukauden kuluttua Stable Diffusionin ilmestymisestä kesällä 2022, ja Google Researchin DreamBooth -projekti tarjosi korkean gigatavun mukauttamismalleja, suljetussa skeemassa, jota yhteisö sopeutti ja julkaisi.

LoRA-mallit seurasivat pian, ja tarjosivat helpomman koulutuksen ja paljon kevyemmän tiedostokoon, vähäisellä tai ilman laadun menetyksellä, ja ne valloittivat nopeasti mukauttamisen alueen Stable Diffusionille ja sen seuraajille, myöhemmille malleille, kuten Flux, ja nyt uusille generatiivisille videomalleille, kuten Hunyuan Video ja Wan 2.1.

Pesu ja toisto

Ongelma on, kuten olemme aiemmin maininneet, että jokaisen uuden mallin ilmestymisen myötä tarvitaan uusi sukupolvi LoRA-malleja, mikä edustaa merkittävää kitkaa LoRA-tuottajille, jotka saattavat kouluttaa joukon mukauttamismalleja, vain löytääkseen, että mallipäivitys tai suosittu uusi malli edellyttää aloittamista alusta.

Siksi nollan mukauttamismenetelmät ovat tulleet vahvaksi suunnaksi kirjallisuudessa viime aikoina. Tässä skenaariossa sinun ei tarvitse kerätä tietojoukkoa tai kouluttaa omaa alimallia, vaan voit vain toimittaa yhden tai useamman valokuvan, jotka haluat sisällyttää generointiin, ja järjestelmä tulkkaa nämä syötelähteet yhdistetyksi tulokseksi.

Alempana näemme, että kasvojen vaihtamisen lisäksi, tällainen järjestelmä (tässä käytetään PuLID:ia) voi myös sisällyttää ID-arvoja tyylin siirtoon:

Kasvojen ID-siirtymisen esimerkkejä PuLID-järjestelmällä. Lähde: https://github.com/ToTheBeginning/PuLID?tab=readme-ov-file

Kasvojen ID-siirtymisen esimerkkejä PuLID-järjestelmällä. Lähde: https://github.com/ToTheBeginning/PuLID?tab=readme-ov-file

Kun korvaat LoRA-mallin, joka on työläs ja hauras, geneerisellä sovittimella, se on hyvä (ja suosittu) idea, mutta se on myös haasteellista; äärimmäinen tarkkuus ja kattavuus, jotka saavutetaan LoRA-koulutusprosessissa, on erittäin vaikeaa jäljitellä yksittäisessä IP-Adapter -tyyppisessä mallissa, joka on pakotettu vastaamaan LoRA:n tarkkuuden ja joustavuuden tasoa ilman sitä etua, että se voi analysoida kattavan joukon identiteettikuvia.

HyperLoRA

Tässä mielessä on mielenkiintoinen uusi tutkimuspaperi ByteDancen toimesta, joka ehdottaa järjestelmää, joka luo todellisia LoRA-koodia lenkitettynä, mikä on tällä hetkellä ainutlaatuinen nollan mukauttamisratkaisuissa:

Vasemmalla, syötekuva. Oikealla, joustava valikoima tuloksia syötekuville, tehden näin oikein deepfake-kuvia näyttelijöistä Anthony Hopkins ja Anne Hathaway. Lähde: https://arxiv.org/pdf/2503.16944

Vasemmalla, syötekuva. Oikealla, joustava valikoima tuloksia syötekuville, tehden näin oikein deepfake-kuvia näyttelijöistä Anthony Hopkins ja Anne Hathaway. Lähde: https://arxiv.org/pdf/2503.16944

Tutkimuspaperi toteaa:

‘Sovitin perusteella olevat tekniikat, kuten IP-Adapter, jäädyttävät perusmallin parametreja ja käyttävät liitettävää arkkitehtuuria, jotta voidaan mahdollistaa nollan mukauttamisennustus, mutta ne usein osoittavat puutetta luonnollisuudesta ja aidosta, mikä ei ole merkityksetöntä muotokuvien synteesitehtävissä.

‘[Me] esittelemme parametreja tehokkaan sovittamismenetelmän, nimeltään HyperLoRA, joka käyttää sovittavaa liitettävää verkkoa LoRA-painojen luomiseen, yhdistäen LoRA:n erinomaisen suorituskyvyn nollan mukauttamisominaisuuksiin.

‘Meidän huolellisesti suunnitellun verkkostruktuurin ja koulutusstrategian kautta saavutamme nollan mukauttamisen henkilökohtaisen muotokuvan synteesin (tukee sekä yksittäisiä että useita kuvia) korkealla fotorealistisuudella, uskottavuudella ja muokattavuudella.’

Eniten hyödyllistä, koulutettu järjestelmä voidaan käyttää olemassa olevan ControlNet:in kanssa, mahdollistaen korkean tarkkuuden generoinnissa:

Timothy Chalomet tekee odottamattoman iloisen esiintymisen elokuvassa 'The Shining' (1980), perustuen kolmeen syötekuvaan HyperLoRA:ssa.

Timothy Chalomet tekee odottamattoman iloisen esiintymisen elokuvassa ‘The Shining’ (1980), perustuen kolmeen syötekuvaan HyperLoRA:ssa, ControlNet-maskin määrittelemällä tuloksella (yhdessä tekstipromptin kanssa).

Kysymykseen siitä, tulisiko uusi järjestelmä koskaan olemaan saatavilla loppukäyttäjille, ByteDance on osoittanut kohtuullisen rekordin tässä suhteessa, julkaisemalla voimakkaan LatentSync -huulensynkronointikehyksen, ja vastaavasti InfiniteYou -kehyksen.

Negatiivisesti, tutkimuspaperi ei anna mitään merkintää julkaisusta, ja koulutusresursseja, joita tarvitaan työn uudelleenteossa, ovat niin suuret, että se olisi haasteellista harrastajayhteisölle (kuten DreamBoothin kohdalla).

Uusi tutkimuspaperi on nimeltään HyperLoRA: Parametreja tehokas sovittamismenetelmä muotokuvien synteesiin, ja se on peräisin seitsemältä tutkijalta ByteDancen ja ByteDancen omistaman älykkään luomisen osaston toimesta.

Menetelmä

Uusi menetelmä käyttää Stable Diffusionin latenttinen diffuusiomallin (LDM) SDXL:ää perusmallina, vaikka periaatteet näyttävät sovellettavissa diffuusiomalleihin yleisesti (kuitenkin koulutuksen vaatimukset – ks. alla – saattavat tehdä siitä haasteellista soveltaa generatiivisiin videomalleihin).

Koulutusprosessi HyperLoRA:lle on jaettu kolmeen vaiheeseen, joista kunkin tavoitteena on eristää ja säilyttää tiettyjä tietoja opitussa painoissa. Tämän eristetyn prosessin tavoitteena on estää identiteettiin liittyvien piirteiden saastuminen merkityksettömistä elementeistä, kuten vaatetus tai tausta, samalla kun saavutetaan nopea ja vakaan konvergenssi.

Käsitteellinen schema HyperLoRA:lle. Malli on jaettu 'Hyper ID-LoRA':ksi identiteetin piirteille ja 'Hyper Base-LoRA':ksi taustalle ja vaatetusille. Tämä erottelu vähentää piirteiden vuotamista. Koulutuksen aikana SDXL-perus ja koodausohjelmat ovat jäädytettyjä, ja vain HyperLoRA-moduulit ovat päivitettyjä. Johtopäätöksessä vain ID-LoRA vaaditaan henkilökohtaisten kuvien generointiin.

Käsitteellinen schema HyperLoRA:lle. Malli on jaettu ‘Hyper ID-LoRA’:ksi identiteetin piirteille ja ‘Hyper Base-LoRA’:ksi taustalle ja vaatetusille. Tämä erottelu vähentää piirteiden vuotamista. Koulutuksen aikana SDXL-perus ja koodausohjelmat ovat jäädytettyjä, ja vain HyperLoRA-moduulit ovat päivitettyjä. Johtopäätöksessä vain ID-LoRA vaaditaan henkilökohtaisten kuvien generointiin.

Ensimmäisessä vaiheessa keskitytään pelkästään ‘Base-LoRA’:n (alhaalla vasemmalla) oppimiseen, joka sieppaa identiteetistä riippumattomia yksityiskohtia.

Jotta voidaan pakottaa tämä erottelu, tutkijat tarkoituksella sumensivat kasvot koulutuskuville, mahdollistaen mallin kiinnittyä asioihin, kuten tausta, valaistus ja asento – mutta ei identiteetti. Tämä ‘lämmittely’ -vaihe toimii suodattimena, poistaen matalat häiriöt ennen identiteetin mukauttamisen aloittamista.

Toisessa vaiheessa ‘ID-LoRA’ (ylävasemmalla) esitellään. Tässä kasvojen identiteetti koodataan kahdella rinnakkaisella polulla: CLIP -näkemisen muunnos (CLIP ViT) rakenteellisten piirteiden ja InsightFace AntelopeV2 -koodarin abstraktimpien identiteetin edustusten kautta.

Siirtymämenetelmä

CLIP-ominaisuudet auttavat mallin nopeaan konvergenssiin, mutta riski ylisovittumiseen on suuri, kun taas Antelope-upotukset ovat vakaampia, mutta hitaampia kouluttaa. Siksi järjestelmä alkaa luottaa enemmän CLIP:in, ja vaiheittain siirtyy Antelopeen, jotta voidaan välttää epävakaus.

Lopullisessa vaiheessa CLIP-ohjatut huomiokerrokset jäädytetään kokonaan. Vain AntelopeV2:een liittyvät huomio-moduulit jatkavat koulutusta, mahdollistaen mallin hienosäätää identiteetin säilyttämistä ilman aiemmin opittujen komponenttien uskottavuuden heikentymistä.

Tämä vaiheittainen rakenne on perustavasti erottelun yritys. Identiteetti ja ei-identiteetin piirteet eristetään ensin, ja sitten hienosäädetään itsenäisesti. Se on järjestelmällinen vastaus henkilökohtaisen mukauttamisen yleisiin epäonnistumismoodiin: identiteetin siirtymä, matala muokattavuus ja ylisovittuminen sattumaan piirteisiin.

Kun painot

Kun CLIP ViT ja AntelopeV2 ovat poimineet sekä rakenteelliset että identiteetin piirteitä annetusta muotokuvasta, saatavat piirteet ohjataan perceiver-resampleriin (johdettu edellä mainitusta IP-Adapter-projektista) – transformer-pohjaiseen moduuliin, joka kartoittaa piirteet tiiviiseen joukkoon kertoimia.

Kaksi erillistä resampleria käytetään: yksi Base-LoRA-painojen (jotka koodaavat tausta- ja ei-identiteetin elementtejä) luomiseen ja toinen ID-LoRA-painojen (jotka keskittyvät kasvojen identiteettiin) luomiseen.

Schema HyperLoRA-verkon rakenteelle.

Schema HyperLoRA-verkon rakenteelle.

Tulostekoimet yhdistetään lineaarisesti oppimien LoRA-perusmatriisien kanssa, tuottaen täydelliset LoRA-painot ilman tarvetta hienosäätää perusmallia.

Tämä lähestymistapa mahdollistaa järjestelmän luoda henkilökohtaisia painoja täysin lenkitettynä, käyttäen vain kuvankoodareita ja kevyttä projektiota, samalla kun se hyödyntää LoRA:n kykyä muuttaa perusmallin käyttäytymistä suoraan.

Data ja testit

Kouluttaakseen HyperLoRA:n, tutkijat käyttivät 4,4 miljoonan kasvokuvan alijoukkoa LAION-2B -tietojoukosta (jonka parhaiten tunnetaan alkuperäisen Stable Diffusion -mallin 2022 data-lähteenä).

InsightFacea käytettiin suodattamaan pois ei-muotokuvat ja useat kuvat. Kuvat annotoitiin BLIP-2 -kuvatekstintunnistusjärjestelmällä.

Datatransformaation suhteen, kuvat leikattiin satunnaisesti kasvojen ympärille, mutta aina keskittyen kasvojen alueeseen.

Vastaavat LoRA-sijat olivat sopeutettava saatavissa olevaan muistiin koulutusasettelussa. Siksi LoRA-sija ID-LoRA:lle asetettiin 8:aan, ja sija Base-LoRA:lle 4:ään, kun taas kahdeksanaskelinen gradientin kertymä käytettiin simuloimaan suurempaa erän kokoa kuin mitä laitteistossa oli mahdollista.

Tutkijat kouluttivat Base-LoRA-, ID-LoRA- (CLIP) – ja ID-LoRA- (identiteetin upotus) -moduuleja peräkkäin 20 000, 15 000 ja 55 000 iteraatiota. ID-LoRA-koulutuksen aikana he näytteensivät kolmesta ehdosta todennäköisyyksillä 0,9, 0,05 ja 0,05.

Järjestelmä toteutettiin PyTorchilla ja Diffusersilla, ja koko koulutusprosessi kesti noin kymmenen päivää 16 NVIDIA A100 -näytönohjaimella*.

ComfyUI-testit

Tekijät rakensivat työvirran ComfyUI -synteesialustalle vertaamaan HyperLoRA:a kolmea kilpailevaa menetelmää: InstantID; edellä mainittu IP-Adapter, IP-Adapter-FaceID-Portrait -kehyksessä; ja edellä mainittu PuLID. Yhdenmukaiset siemenet, promptit ja näytteistysmenetelmät käytettiin kaikissa kehyksissä.

Tekijät toteavat, että sovittimen perusteella (ei LoRA:lla) menetelmät vaativat yleensä alempia luokitteluohjaus (CFG) -skaaloja, kun taas LoRA (mukaan lukien HyperLoRA) on joustavampi tässä suhteessa.

Siksi tutkijat käyttivät avoimen lähdekoodin SDXL-hienosäätöpistettä LEOSAMin Hei Maailma kaikissa testeissä. Määrällisissä testeissä käytettiin Unsplash-50 -kuvatietojoukkoa.

Mittarit

Uskottavuuden vertailumittariksi tekijät mitättiin kasvojen samankaltaisuutta kosinin etäisyyksillä CLIP-kuvaupotuksista (CLIP-I) ja erillisistä identiteetin upotuksista (ID Sim), jotka poimittiin CurricularFace -mallilla, jota ei käytetty koulutuksessa.

Kunkin menetelmän generoitiin neljä korkearesoluutioista pääkuvausta kullekin identiteetille testijoukossa, ja tulokset keskiarvoitiin.

Muokattavuus arvioitiin sekä vertaamalla CLIP-I-tuloksia tuloksilla ja ilman identiteetin moduuleja (nähdäksesi, kuinka paljon identiteetin rajoitukset muuttivat kuvaa); ja mitattavaa CLIP-kuva-teksti -sopimusta kymmenen promptin vaihtelun kautta, jotka kattoivat hiusten, lisävarusteet, vaatetus ja tausta.

Tekijät sisällyttivät Arc2Face -perusmallin vertailuihin – perusmalli, joka on koulutettu kiinteillä teksteillä ja leikattuilla kasvokuville.

HyperLoRA:lle kaksi varianttia testattiin: yksi, joka käytti vain ID-LoRA-moduulia, ja toinen, joka käytti sekä ID- että Base-LoRA:ta, jälkimmäistä painotettuna 0,4:ään. Vaikka Base-LoRA paransi uskottavuutta, se rajoitti hieman muokattavuutta.

Alkuperäisen määrällisen vertailun tulokset.

Alkuperäisen määrällisen vertailun tulokset.

Määrällisistä testeistä tekijät toteavat:

‘Base-LoRA auttaa parantamaan uskottavuutta, mutta rajoittaa muokattavuutta. Vaikka suunnittelumme erottaa kuvan piirteet eri LoRA:hin, on vaikea välttää toistensa vuotamista. Siksi voimme säätää Base-LoRA:n painoa sopeuttaaksemme eri soveltamistilanteisiin.

‘Meidän HyperLoRA (täysi ja ID) saavuttavat parhaan ja toiseksi parhaan kasvojen uskottavuuden, kun taas InstantID osoittaa ylivoimaa kasvojen ID-samankaltaisuudessa, mutta alempaa kasvojen uskottavuutta.

‘Molemmat mittarit on otettava huomioon yhdessä, arvioitaessa uskottavuutta, koska kasvojen ID-samankaltaisuus on abstraktimpi ja kasvojen uskottavuus heijastaa enemmän yksityiskohtia.’

Laadullisissa testeissä mukana olevat olennaiset vaihdot tulevat esiin (huomaa, että meillä ei ole tilaa toistaa kaikkia kuvia laadullisista tuloksista, ja viitataan alkuperäiseen tutkimuspaperiin lisää kuvia paremmassa resoluutiossa):

Laadullinen vertailu. Ylhäältä alkaen, käytetyt promptit olivat: valkoinen paita ja suden korvat (ks. paperiin lisää esimerkkejä).

Laadullinen vertailu. Ylhäältä alkaen, käytetyt promptit olivat: ‘valkoinen paita’ ja ‘suden korvat’ (ks. paperiin lisää esimerkkejä).

Tässä tekijät toteavat:

‘IP-Adapterin ja InstantID:n generoimien muotokuvien iho näyttää selvästi tekoälylliseltä, mikä on hieman liian kylläinen ja kaukana fotorealistisuudesta.

‘Tämä on yleinen puute sovittimen perusteella olevissa menetelmissä. PuLID parantaa tätä ongelmaa heikentämällä perusmalliin kohdistuvaa häiriötä, ylittäen IP-Adapterin ja InstantID:n, mutta kärsien silti sumenemisesta ja yksityiskohtien puutteesta.

‘Toisaalta LoRA muuttaa perusmallin painoja suoraan ilman lisähuomioita, mikä johtaa yleensä erittäin yksityiskohtaisiin ja fotorealistisiin kuviiin.’

Tekijät väittävät, että koska HyperLoRA muuttaa perusmallin painoja suoraan ilman turvautumista ulkoisiin huomioihin, se säilyttää perinteisten LoRA-pohjaisien menetelmien epälineaarisen kapasiteetin, mikä voi tarjota etua uskottavuudessa ja mahdollistaa paremman sieppaamisen hienoja yksityiskohtia, kuten pupillin väriä.

Laadullisissa vertailuissa tutkimuspaperi väittää, että HyperLoRA:n asetelmat olivat johdonmukaisempia ja paremmin prompteihin sopivia, ja samankaltaisia kuin PuLID:n tuottamat, mutta merkittävästi vahvempia kuin InstantID tai IP-Adapter (joilla oli joskus vaikeuksia seurata prompteja tai tuottaa epäluonnollisia sommitelmia).

Lisää esimerkkejä ControlNet-generaatioista HyperLoRA:lla.

Lisää esimerkkejä ControlNet-generaatioista HyperLoRA:lla.

Johtopäätös

Viimeisten 18 kuukauden jatkuvat erilaiset yksittäiset mukauttamisjärjestelmät ovat saavuttaneet tason, jossa ne ovat käytännössä epätoivoisia. Hyvin harvat tarjonnasta ovat edistäneet tilannetta merkittävästi; ja ne, jotka ovat edistäneet sitä hieman, ovat usein vaatineet koulutukseltaan hämmästyttäviä vaatimuksia ja/tai erittäin monimutkaisia tai resursseja vaativia johtopäätöksiä.

HyperLoRA:n omat koulutusvaatimukset ovat yhtä hengästyttäviä kuin monien viimeaikaisen kaltaisten, mutta ainakin lopputuloksena on malli, joka voi käsitellä ad hoc -mukauttamisen valmiina.

Tutkimuspaperin lisäaineistosta huomataan, että HyperLoRA:n johtopäätöksen nopeus on parempi kuin IP-Adapterin, mutta huonompi kuin kaksi muuta aiempaa menetelmää – ja että nämä luvut perustuvat NVIDIA V100 -näytönohjaimelle, joka ei ole tyypillinen kuluttajien laitteisto (vaikka uudet ‘kotitalouksien’ NVIDIA-näytönohjaimet voivat saavuttaa tai ylittää V100:n 32 GB:n VRAM-maksimin).

Vertailumittareiden johtopäätösaikoja millisekunteina.

Vertailumittareiden johtopäätösaikoja millisekunteina.

On reilua sanoa, että nollan mukauttamisongelma on edelleen ratkaisematta käytännön kannalta, koska HyperLoRA:n merkittävät laitteistovaatimukset ovat kiistanalaisia sen kyvyn kanssa tuottaa todella pitkäaikainen yksittäinen perusmalli.

 

* Edustaa joko 640 GB tai 1280 GB VRAM:ia, riippuen siitä, mikä malli käytettiin (tätä ei ole määritelty)

Julkaistu ensimmäisen kerran maanantaina, 24. maaliskuuta 2025

Kirjoittaja koneoppimisen parissa, ihmiskuvan synteesin asiantuntija. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se sulautui DNEG:n Brahma.ai:ksi.
Verkkosivu: martinanderson.ai
Yhteystiedot: martin@martinanderson.ai