Unghiul lui Anderson

Lupta pentru personalizarea zero-shot în inteligența artificială generativă

mm
Adaugă Unite.AI la sursele tale preferate pe Google
Timothy Chalomet replaces Jack Nicholson in The Shining (1980), thanks to the new HyperLoRA system. Source: https://arxiv.org/pdf/2503.16944

Dacă doriți să vă plasați într-un instrument popular de generare de imagini sau videoclipuri, dar nu sunteți suficient de cunoscut pentru ca modelul de bază să vă recunoască, veți avea nevoie de a antrena un model de adaptare de rang scăzut (LoRA) folosind o colecție de fotografii cu dumneavoastră. Odată creat, acest model LoRA personalizat permite modelului generativ să includă identitatea dvs. în rezultatele viitoare.

Acest lucru este cunoscut sub numele de personalizare în sectorul de cercetare a sintezei de imagini și videoclipuri. A apărut pentru prima dată cu câteva luni după apariția Stable Diffusion în vara anului 2022, cu proiectul DreamBooth de la Google Research, care oferea modele de personalizare de înaltă calitate, într-un schema închis, care a fost ulterior adaptat de entuziaști și lansat în comunitate.

Modelele LoRA au urmat rapid și au oferit o antrenare mai ușoară și dimensiuni de fișier mult mai mici, cu o calitate minimă sau deloc compromisă, cucerind rapid scena personalizării pentru Stable Diffusion și succesorii săi, modelele ulterioare, cum ar fi Flux și noile modele generative de videoclipuri, cum ar fi Hunyuan Video și Wan 2.1.

Spălați și Repetați

Problema este că, așa cum am remarcat anterior, de fiecare dată când apare un nou model, este nevoie de o nouă generație de LoRA pentru a fi antrenată, ceea ce reprezintă o fricțiune considerabilă pentru producătorii de LoRA, care pot antrena o serie de modele personalizate, doar pentru a descoperi că o actualizare a modelului sau un model mai popular înseamnă că trebuie să înceapă totul de la capăt.

Prin urmare, abordările de personalizare zero-shot au devenit un curent puternic în literatura de specialitate în ultimul timp. În acest scenariu, în loc de a curăța o bază de date și de a antrena un submodel, pur și simplu furnizați una sau mai multe fotografii ale subiectului care urmează să fie injectat în generare, iar sistemul interpretează aceste surse de intrare într-un rezultat combinat.

În figura de mai jos, putem vedea că, pe lângă schimbul de fețe, un sistem de acest tip (aici folosind PuLID) poate incorpora valori ID în transferul de stil:

Exemple de transfer de identitate facială folosind sistemul PuLID. Sursă: https://github.com/ToTheBeginning/PuLID?tab=readme-ov-file

Exemple de transfer de identitate facială folosind sistemul PuLID. Sursă: https://github.com/ToTheBeginning/PuLID?tab=readme-ov-file

În timp ce înlocuirea unui sistem laborios și fragil, cum ar fi LoRA, cu un adaptor generic este o idee bună (și populară), este și o provocare; atenția extremă la detalii și acoperirea obținută în procesul de antrenare LoRA este foarte greu de imitat într-un model de tip IP-Adapter, care trebuie să se potrivească cu nivelul de detaliu și flexibilitate al LoRA, fără avantajul anterior de a analiza o bază de date cuprinzătoare de imagini de identitate.

HyperLoRA

Având în vedere acest lucru, există un articol interesant nou de la ByteDance, care propune un sistem care generează cod LoRA pe loc, ceea ce este în prezent unic printre soluțiile zero-shot:

În stânga, imagini de intrare. În dreapta, o gamă flexibilă de ieșire pe baza imaginilor sursă, producând efectiv deepfakes ale actorilor Anthony Hopkins și Anne Hathaway. Sursă: https://arxiv.org/pdf/2503.16944

În stânga, imagini de intrare. În dreapta, o gamă flexibilă de ieșire pe baza imaginilor sursă, producând efectiv deepfakes ale actorilor Anthony Hopkins și Anne Hathaway. Sursă: https://arxiv.org/pdf/2503.16944

Articolul afirmă:

‘Tehnicile bazate pe adaptori, cum ar fi IP-Adapter, îngheață parametrii modelului de bază și folosesc o arhitectură de tip plug-in pentru a permite inferența zero-shot, dar adesea prezintă o lipsă de naturalitate și autenticitate, care nu trebuie neglijate în sarcinile de sinteză a portretelor.

‘[Noi] introducem o metodă de generare adaptivă eficientă din punct de vedere al parametrilor, numită HyperLoRA, care folosește o rețea de tip plug-in adaptivă pentru a genera greutăți LoRA, combinând performanța superioară a LoRA cu capacitatea zero-shot a schemei de adaptare.

‘Prin structura noastră de rețea și strategia de antrenare atent proiectate, realizăm generarea personalizată a portretelor cu zero-shot (susținând atât intrări de imagine simple, cât și multiple) cu fotorealism ridicat, fidelitate și editabilitate.’

Cel mai util, sistemul antrenat poate fi folosit cu ControlNet existent, permițând un nivel ridicat de specificitate în generare:

Timothy Chalomet face o apariție neașteptat de veselă în filmul “The Shining” (1980), pe baza a trei fotografii de intrare în HyperLoRA, cu o mască ControlNet care definește ieșirea (în concert cu un prompt de text).

În ceea ce privește disponibilitatea noului sistem pentru utilizatorii finali, ByteDance are un record rezonabil în acest sens, având lansat deja cadrul puternic de sincronizare a buzelor LatentSync și cadrul InfiniteYou.

Negativ, articolul nu dă niciun indiciu că intenționează să lanseze, iar resursele de antrenare necesare pentru a recrea lucrarea sunt atât de exorbitante încât ar fi dificil pentru comunitatea de entuziaști să o recreate (așa cum a făcut cu DreamBooth).

Noul articol se intitulează HyperLoRA: Generare adaptivă eficientă din punct de vedere al parametrilor pentru sinteza portretelor și provine de la șapte cercetători de la ByteDance și departamentul de creație inteligentă al ByteDance.

Metodă

Noua metodă utilizează modelul de difuzie latentă Stable Diffusion (LDM) SDXL ca model de bază, deși principiile par aplicabile modelelor de difuzie în general (cu toate acestea, cerințele de antrenare – vezi mai jos – ar putea face dificilă aplicarea la modele generative de videoclipuri).

Procesul de antrenare pentru HyperLoRA este împărțit în trei etape, fiecare proiectat pentru a izola și a păstra informații specifice în greutățile învățate. Scopul acestei proceduri închise este de a preveni poluarea caracteristicilor relevante pentru identitate de elemente nerelevante, cum ar fi îmbrăcăminte sau fundal, în același timp realizând o convergență rapidă și stabilă.

Schema conceptuală pentru HyperLoRA. Modelul este împărțit în 'Hyper ID-LoRA' pentru caracteristici de identitate și 'Hyper Base-LoRA' pentru fundal și îmbrăcăminte. Această separare reduce scurgerea de caracteristici. În timpul antrenării, baza SDXL și encodatoarele sunt înghețate, iar doar modulele HyperLoRA sunt actualizate. La inferență, doar ID-LoRA este necesar pentru a genera imagini personalizate.

Schema conceptuală pentru HyperLoRA. Modelul este împărțit în ‘Hyper ID-LoRA’ pentru caracteristici de identitate și ‘Hyper Base-LoRA’ pentru fundal și îmbrăcăminte. Această separare reduce scurgerea de caracteristici. În timpul antrenării, baza SDXL și encodatoarele sunt înghețate, iar doar modulele HyperLoRA sunt actualizate. La inferență, doar ID-LoRA este necesar pentru a genera imagini personalizate.

Prima etapă se concentrează exclusiv pe învățarea unui ‘Base-LoRA’ (stânga jos în imaginea schemei de mai sus), care captează detalii nerelevante pentru identitate.

Pentru a impune această separare, cercetătorii au blurat intenționat fața în imaginile de antrenare, permițând modelului să se concentreze pe lucruri cum ar fi fundalul, iluminarea și poza – dar nu identitatea. Această etapă de “încălzire” acționează ca un filtru, eliminând distorsiunile de nivel scăzut înainte de a începe învățarea identității.

În a doua etapă, un ‘ID-LoRA’ (sus-stânga în imaginea schemei de mai sus) este introdus. Aici, identitatea facială este codificată folosind două căi paralele: un CLIP Vision Transformer (CLIP ViT) pentru caracteristici structurale și InsightFace AntelopeV2 encoder pentru reprezentări abstracte de identitate.

Abordare Tranzitorie

Caracteristicile CLIP ajută modelul să converge rapid, dar riscă supraantrenarea, în timp ce încorporările Antelope sunt mai stabile, dar mai lente în antrenare. Prin urmare, sistemul începe prin a se baza mai mult pe CLIP și treptat introduce Antelope, pentru a evita instabilitatea.

În etapa finală, straturile de atenție ghidate de CLIP sunt înghețate complet. Doar modulele de atenție legate de AntelopeV2 continuă antrenarea, permițând modelului să rafineze conservarea identității fără a degrada fidelitatea sau generalitatea componentelor învățate anterior.

Această structură etapizată este, în esență, o încercare de dezlegare. Caracteristicile de identitate și non-identitate sunt separate mai întâi, apoi rafinate în mod independent. Este o reacție metodică la modurile obișnuite de eșec ale personalizării: drift de identitate, editabilitate scăzută și supraantrenare la caracteristici incidentale.

În Timp Ce Cântărești

După ce CLIP ViT și AntelopeV2 extrag caracteristici structurale și de identitate de la un portret dat, caracteristicile obținute sunt apoi trecute printr-un reamplificator de percepție (derivat din proiectul IP-Adapter) – un modul bazat pe transformator care mapă caracteristicile la un set compact de coeficienți.

Se folosesc doi reamplificatori separați: unul pentru generarea greutăților Base-LoRA (care codifică fundalul și elementele non-identitate) și altul pentru greutățile ID-LoRA (care se concentrează pe identitatea facială).

Schema pentru rețeaua HyperLoRA.

Schema pentru rețeaua HyperLoRA.

Coefficienții de ieșire sunt apoi combinați liniar cu o serie de matrice de bază LoRA învățate, producând greutăți LoRA complete fără a necesita antrenarea fină a modelului de bază.

Acest abordare permite sistemului să genereze greutăți personalizate în întregime pe loc, folosind doar encodatori de imagine și proiecție ușoară, în timp ce încă folosește capacitatea LoRA de a modifica comportamentul modelului de bază direct.

Date și Teste

Pentru a antrena HyperLoRA, cercetătorii au folosit un subset de 4,4 milioane de imagini cu fețe din baza de date LAION-2B (cunoscută acum ca sursa de date pentru modelele originale Stable Diffusion din 2022).

InsightFace a fost folosit pentru a filtra fețele non-portret și multiple imagini. Imaginile au fost apoi annotate cu sistemul de captionare BLIP-2.

În ceea ce privește augmentarea datelor, imaginile au fost decupate aleatoriu în jurul feței, dar întotdeauna s-a concentrat pe regiunea feței.

Rangul respectiv LoRA a trebuit să se adapteze la memoria disponibilă în configurația de antrenare. Prin urmare, rangul LoRA pentru ID-LoRA a fost setat la 8, iar rangul pentru Base-LoRA la 4, în timp ce s-a folosit o acumulare a gradientului cu opt pași pentru a simula o dimensiune de lot mai mare decât cea posibilă pe hardware.

Cercetătorii au antrenat modulele Base-LoRA, ID-LoRA (CLIP) și ID-LoRA (încorporare de identitate) secvențial pentru 20.000, 15.000 și 55.000 de iterații, respectiv. În timpul antrenării ID-LoRA, au eșantionat din trei scenarii de condiționare cu probabilități de 0,9, 0,05 și 0,05.

Sistemul a fost implementat folosind PyTorch și Diffusers, iar procesul complet de antrenare a durat aproximativ zece zile pe 16 GPU-uri NVIDIA A100*.

Teste ComfyUI

Autorii au construit fluxuri de lucru în platforma de sinteză ComfyUI pentru a compara HyperLoRA cu trei metode rivale: InstantID; menționatul anterior IP-Adapter, sub forma cadrului IP-Adapter-FaceID-Portret; și menționatul anterior PuLID. S-au folosit semințe consistente, prompturi și metode de eșantionare în toate cadrurile.

Autorii notează că metodele bazate pe adaptori (și nu pe LoRA) necesită, în general, scări de ghidare a clasificatorului (CFG) mai mici, în timp ce LoRA (inclusiv HyperLoRA) este mai permisivă în acest sens.

Prin urmare, cercetătorii au folosit varianta de punct de referință SDXL fină, LEOSAM’s Hello World, în toate testele. Pentru testele cantitative, s-a folosit baza de date de imagini Unsplash-50.

Metrice

Pentru o benchmark de fidelitate, autorii au măsurat similaritatea facială folosind distanțe cosinus între încorporări de imagine CLIP (CLIP-I) și încorporări de identitate separate (ID Sim) extrase prin CurricularFace, un model care nu a fost folosit în timpul antrenării.

Fiecare metodă a generat patru portrete de înaltă rezoluție pe identitate în setul de test, cu rezultatele mediate.

Editabilitatea a fost evaluată atât prin compararea scorurilor CLIP-I între ieșiri cu și fără modulele de identitate (pentru a vedea cât de mult constrângerile de identitate au alterat imaginea); cât și prin măsurarea alinierii imaginii-text CLIP (CLIP-T) la zece variații de prompt care acoperă coafuri, accesorii, îmbrăcăminte și fundaluri.

Autorii au inclus modelul de bază Arc2Face în comparații – un model de bază antrenat pe captionări fixe și regiuni faciale decupate.

Pentru HyperLoRA, au fost testate două variante: una folosind doar modulul ID-LoRA și alta folosind atât ID-LoRA, cât și Base-LoRA, cu aceasta din urmă ponderată la 0,4. În timp ce Base-LoRA a îmbunătățit fidelitatea, a constrâns puțin editabilitatea.

Rezultatele comparației cantitative inițiale.

Rezultatele comparației cantitative inițiale.

Dintre testele cantitative, autorii comentează:

‘Base-LoRA ajută la îmbunătățirea fidelității, dar limitează editabilitatea. Deși designul nostru decuplează caracteristicile imaginii în LoRA separate, este greu de evitat scurgerea mutuală. Prin urmare, putem ajusta greutatea Base-LoRA pentru a se adapta la diferite scenarii de aplicație.

‘HyperLoRA noastră (complet și ID) realizează cea mai bună și a doua cea mai bună fidelitate a feței, în timp ce InstantID arată superioritate în similaritatea identității feței, dar cu o fidelitate a feței mai scăzută.

‘Ambele aceste metrice ar trebui luate în considerare împreună pentru a evalua fidelitatea, deoarece similaritatea identității feței este mai abstractă și fidelitatea feței reflectă mai multe detalii.’

În testele calitative, compromisurile esențiale implicate în propunerea fundamentală vin în prim-plan (vă rugăm să rețineți că nu avem spațiu pentru a reproduce toate imaginile pentru rezultatele calitative și vă trimitem la articolul sursă pentru mai multe imagini la o rezoluție mai bună):

Comparație calitativă. De sus în jos, prompturile folosite au fost: 'cămășă albă' și 'urechi de lup' (vezi articolul pentru exemple suplimentare).

Comparație calitativă. De sus în jos, prompturile folosite au fost: ‘cămășă albă’ și ‘urechi de lup’ (vezi articolul pentru exemple suplimentare).

Aici, autorii comentează:

‘Pielea portretelor generate de IP-Adapter și InstantID are o textură evident generată de IA, care este puțin suprasaturată și departe de fotorealism.

‘Este o lipsă comună a metodelor bazate pe adaptori. PuLID îmbunătățește această problemă prin slăbirea intruziunii în modelul de bază, depășind IP-Adapter și InstantID, dar suferind totuși de estompare și lipsă de detalii.

‘În schimb, LoRA modifică direct greutățile modelului de bază, în loc de a introduce module de atenție externe, generând de obicei imagini foarte detaliate și fotorealiste.’

Autorii susțin că, deoarece HyperLoRA modifică greutățile modelului de bază direct, în loc de a se baza pe module de atenție externe, păstrează capacitatea neliniară a metodelor tradiționale LoRA, oferind un avantaj potențial în fidelitate și permitând o captură îmbunătățită a detaliilor subtile, cum ar fi culoarea pupilei.

În comparațiile calitative, articolul afirmă că dispozițiile HyperLoRA au fost mai coerente și mai bine aliniate cu prompturile, asemănătoare cu cele produse de PuLID, dar semnificativ mai puternice decât InstantID sau IP-Adapter (care, ocazional, nu au reușit să urmeze prompturile sau au produs compoziții neobișnuite).

Mai multe exemple de generații ControlNet cu HyperLoRA.

Mai multe exemple de generații ControlNet cu HyperLoRA.

Concluzie

Fluxul constant de sisteme de personalizare zero-shot din ultimele 18 luni a căpătat, până acum, o calitate de disperare. Foarte puține dintre ofertele făcute au făcut un progres semnificativ față de stadiul actual; și cele care au făcut un progres mic au, de obicei, cerințe de antrenare exorbitante și/sau cerințe de inferență extrem de complexe sau consumatoare de resurse.

În timp ce regimul de antrenare al HyperLoRA este la fel de înghițitor ca și multe intrări recente similare, cel puțin se termină cu un model care poate gestiona personalizarea ad hoc din cutie.

În conformitate cu materialul suplimentar al articolului, observăm că viteza de inferență a HyperLoRA este mai bună decât a IP-Adapter, dar mai slabă decât a celorlalte două metode anterioare – și că aceste cifre se bazează pe un GPU NVIDIA V100, care nu este hardware-ul tipic pentru consumatori (deși noile GPU-uri NVIDIA “de acasă” pot egaliza sau depăși memoria maximă de 32 GB a V100).

Vitezele de inferență ale metodelor concurente, în milisecunde.

Vitezele de inferență ale metodelor concurente, în milisecunde.

Este corect să spunem că personalizarea zero-shot rămâne o problemă nerezolvată din punct de vedere practic, deoarece cerințele semnificative de hardware ale HyperLoRA sunt, în mod evident, în contradicție cu capacitatea sa de a produce un model de bază unic pe termen lung.

 

* Reprezentând fie 640 GB, fie 1280 GB de VRAM, în funcție de modelul utilizat (acest lucru nu este specificat)

Publicat pentru prima dată luni, 24 martie 2025

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai