Unghiul lui Anderson

Restabilirea și editarea imaginilor umane cu ajutorul inteligenței artificiale

mm
Adaugă Unite.AI la sursele tale preferate pe Google
Montage of examples from supplementary material for the paper 'CompleteMe: Reference-based Human Image Completion' (https://liagm.github.io/CompleteMe/pdf/supp.pdf)

O nouă colaborare între Universitatea din California, Merced și Adobe oferă o avansare a stadiului actual în ceea ce privește completarea imaginilor umane – o sarcină mult studiată de “dezvăluire” a părților ascunse sau ocultate ale imaginilor oamenilor, pentru scopuri precum încercarea virtuală, animație și editare foto.

Pe lângă repararea imaginilor deteriorate sau modificarea lor la discreția utilizatorului, sistemele de completare a imaginilor umane, cum ar fi CompleteMe, pot impune haine noi (prin intermediul unei imagini de referință, așa cum se arată în coloana din mijloc în aceste două exemple) în imagini existente. Aceste exemple provin din PDF-ul suplimentar extins pentru noul articol. Sursa: https://liagm.github.io/CompleteMe/pdf/supp.pdf

Pe lângă repararea imaginilor deteriorate sau modificarea lor la discreția utilizatorului, sistemele de completare a imaginilor umane, cum ar fi CompleteMe, pot impune haine noi (prin intermediul unei imagini de referință, așa cum se arată în coloana din mijloc în aceste două exemple) în imagini existente. Aceste exemple provin din PDF-ul suplimentar extins pentru noul articol. Sursa: https://liagm.github.io/CompleteMe/pdf/supp.pdf

Abordarea nouă, intitulată CompleteMe: Completarea imaginilor umane pe baza referințelor, utilizează imagini de intrare suplimentare pentru a “sugera” sistemului ce conținut ar trebui să înlocuiască secțiunea ascunsă sau lipsă a reprezentării umane (de aceea, aplicabilitatea la cadrele de încercare virtuale bazate pe modă):

Sistemul CompleteMe poate conforma conținutul de referință la partea ocultată sau ascunsă a unei imagini umane.

Sistemul CompleteMe poate conforma conținutul de referință la partea ocultată sau ascunsă a unei imagini umane.

Noul sistem utilizează o arhitectură duală U-Net și un bloc de atenție focalizată pe regiune (RFA) care mobilizează resursele către zona pertinentă a instanței de restaurare a imaginii.

Cercetătorii au propus, de asemenea, un nou sistem de benchmarking conceput pentru a evalua sarcinile de completare pe baza referințelor (deoarece CompleteMe face parte dintr-o direcție de cercetare existentă și în curs de desfășurare în domeniul viziunii computaționale, dar care nu a avut până acum un cadru de benchmark):

În testele efectuate și într-un studiu pe utilizatori bine scalat, noua metodă a obținut rezultate superioare în majoritatea metricilor și, în general, a fost mai bună. În anumite cazuri, metodele rivale au fost complet înșelate de abordarea bazată pe referințe:

Din materialul suplimentar: metoda AnyDoor are dificultăți deosebite în a decide cum să interpreteze o imagine de referință.

Din materialul suplimentar: metoda AnyDoor are dificultăți deosebite în a decide cum să interpreteze o imagine de referință.

Articolul afirmă:

‘Experimentele extinse pe baza noastră de benchmark demonstrează că CompleteMe depășește metodele actuale de ultimă oră, atât cele bazate pe referințe, cât și cele fără referințe, în ceea ce privește metricile cantitative, rezultatele calitative și studiile pe utilizatori.

‘În special în scenariile provocatoare care implică poziții complexe, modele de îmbrăcăminte intricate și accesorii distinctive, modelul nostru obține în mod constant o fidelitate vizuală superioară și o coerență semantică.’

Din nefericire, prezența proiectului pe GitHub nu conține cod, nici nu promite vreunul, și inițiativa, care are și o pagină de proiect modestă, pare a fi concepută ca o arhitectură proprietară.

Un alt exemplu al performanței subiective a noului sistem în comparație cu metodele anterioare. Mai multe detalii mai târziu în articol.

Un alt exemplu al performanței subiective a noului sistem în comparație cu metodele anterioare. Mai multe detalii mai târziu în articol.

Metodă

Cadrul CompleteMe se bazează pe un U-Net de referință, care gestionează integrarea materialului auxiliar în proces, și un U-Net coerent, care permite o gamă mai largă de procese pentru obținerea rezultatului final, așa cum se ilustrează în schema conceptuală de mai jos:

Schema conceptuală pentru CompleteMe. Sursa: https://arxiv.org/pdf/2504.20042

Schema conceptuală pentru CompleteMe. Sursa: https://arxiv.org/pdf/2504.20042

Sistemul încodează mai întâi imaginea de intrare mascată într-o reprezentare latentă. În același timp, U-Net-ul de referință procesează multiple imagini de referință – fiecare arătând regiuni corporale diferite – pentru a extrage caracteristici spațiale detaliate.

Aceste caracteristici trec printr-un bloc de atenție focalizată pe regiune (RFA) încorporat în U-Net-ul “complet”, unde sunt mascate selectiv folosind măști de regiune corespunzătoare, asigurându-se că modelul se concentrează doar pe zonele relevante din imaginile de referință.

Caracteristicile mascate sunt apoi integrate cu caracteristici semantice globale derivate din CLIP, prin intermediul atenției decuplate, permițând modelului să reconstruiască conținutul lipsă cu atât detalii fine, cât și coerență semantică.

Pentru a îmbunătăți realismul și robustețea, procesul de mascare a intrării combină ocultări aleatorii pe bază de grilă cu măști de formă corporală, aplicate cu probabilitate egală, crescând complexitatea regiunilor lipsă pe care modelul trebuie să le completeze.

Pentru referință

Metodele anterioare pentru completarea imaginilor pe baza referințelor s-au bazat în general pe encodatori de nivel semantic. Proiecte de acest fel includ CLIP însuși și DINOv2, ambele extrăgând caracteristici globale din imaginile de referință, dar adesea pierzând detalii spațiale fine necesare pentru păstrarea identității exacte.

Din articolul de lansare pentru abordarea mai veche DINOv2, care este inclusă în testele de comparație din noul studiu: Suprapunerile colorate arată primele trei componente principale din Analiza Componentelor Principale (PCA), aplicate pe patch-uri de imagine din fiecare coloană, evidențiind modul în care DINOv2 grupează părți ale obiectelor similare în imagini variate. În ciuda diferențelor de poziție, stil sau redare, regiuni corespunzătoare (cum ar fi aripi, membre sau roți) sunt asociate în mod constant, ilustrând capacitatea modelului de a învăța structura bazată pe părți fără supraveghere. Sursa: https://arxiv.org/pdf/2304.07193

Din articolul de lansare pentru abordarea mai veche DINOv2, care este inclusă în testele de comparație din noul studiu: Suprapunerile colorate arată primele trei componente principale din Analiza Componentelor Principale (PCA), aplicate pe patch-uri de imagine din fiecare coloană, evidențiind modul în care DINOv2 grupează părți ale obiectelor similare în imagini variate. Sursa: https://arxiv.org/pdf/2304.07193

CompleteMe abordează acest aspect prin intermediul unui U-Net de referință specializat, inițializat din Stable Diffusion 1.5, dar care funcționează fără zgomotul de difuzie.*

Fiecare imagine de referință, care acoperă regiuni corporale diferite, este încodată în caracteristici latente detaliate prin acest U-Net. Caracteristici semantice globale sunt extrase și separate folosind CLIP, iar ambele seturi de caracteristici sunt stocate pentru utilizare eficientă în timpul integrării bazate pe atenție. Astfel, sistemul poate gestiona flexibil multiple intrări de referință, păstrând în același timp informații detaliate despre aspectul exterior.

Orchestrare

U-Net-ul coerent gestionează etapele finale ale procesului de completare. Adaptat din varianta de înlocuire a imaginilor din Stable Diffusion 1.5, primește ca intrare imaginea sursă mascată în formă latentă, alături de caracteristici spațiale detaliate extrase din imaginile de referință și caracteristici semantice globale extrase de encoder-ul CLIP.

Aceste intrări diverse sunt reunite prin blocul RFA, care joacă un rol critic în direcționarea atenției modelului către zonele cele mai relevante din materialul de referință.

Înainte de a intra în mecanismul de atenție, caracteristicile de referință sunt mascate explicit pentru a elimina regiunile nerelevante și apoi concatenate cu reprezentarea latentă a imaginii sursă, asigurându-se că atenția este direcționată cât mai precis posibil.

Pentru a îmbunătăți această integrare, CompleteMe incorporează un mecanism de atenție decuplat, adaptat din cadrul IP-Adapter:

IP-Adapter, parte a căruia este încorporat în CompleteMe, este unul dintre cele mai de succes și des utilizate proiecte din ultimii trei ani tumultuoși de dezvoltare a arhitecturilor de modele de difuzie latentă. Sursa: https://ip-adapter.github.io/

IP-Adapter, parte a căruia este încorporat în CompleteMe, este unul dintre cele mai de succes și des utilizate proiecte din ultimii trei ani tumultuoși de dezvoltare a arhitecturilor de modele de difuzie latentă. Sursa: https://ip-adapter.github.io/

Acest lucru permite modelului să proceseze caracteristici vizuale spațial detaliate și context semantic mai larg prin fluxuri de atenție separate, care sunt ulterior combinate, rezultând o reconstrucție coerentă care, după cum susțin autorii, păstrează atât identitatea, cât și detalii fine.

Benchmarking

În absența unui set de date adecvat pentru completarea pe baza referințelor, cercetătorii au propus propriul lor. Benchmark-ul (fără nume) a fost construit prin curățarea unor perechi de imagini selectate din setul de date WPose, conceput pentru proiectul UniHuman al Adobe Research din 2023.

Exemple de poziții din proiectul UniHuman al Adobe Research din 2023. Sursa: https://github.com/adobe-research/UniHuman?tab=readme-ov-file#data-prep

Exemple de poziții din proiectul UniHuman al Adobe Research din 2023. Sursa: https://github.com/adobe-research/UniHuman?tab=readme-ov-file#data-prep

Cercetătorii au desenat manual măști de sursă pentru a indica zonele de completare, obținând în final 417 grupuri tripartite de imagini constituite din imaginea sursă, mască și imagine de referință.

Două exemple de grupuri derivate inițial din setul de date WPose de referință și curățate extensiv de către cercetătorii noului articol.

Două exemple de grupuri derivate inițial din setul de date WPose de referință și curățate extensiv de către cercetătorii noului articol.

Autorii au utilizat modelul de limbaj mare LLaVA pentru a genera prompturi de text care descriu imaginile sursă.

Metricile utilizate au fost mai extinse decât de obicei; pe lângă raportul semnal-zgomot maxim (PSNR), indicele de similaritate structurală (SSIM) și similaritatea percepției învățate (LPIPS, în acest caz pentru evaluarea regiunilor mascate), cercetătorii au utilizat DINO pentru scoruri de similaritate; DreamSim pentru evaluarea rezultatelor de generare; și CLIP.

Date și teste

Pentru a testa lucrarea, autorii au utilizat atât modelul Stable Diffusion V1.5, cât și modelul de înlocuire a imaginilor 1.5. Encoderul de imagine al sistemului a utilizat modelul de viziune CLIP, împreună cu straturi de proiecție – rețele neurale modeste care restructurează sau aliniază ieșirile CLIP pentru a se potrivi cu dimensiunile caracteristicilor interne utilizate de model.

Antrenamentul a avut loc timp de 30.000 de iterații pe opt GPU-uri NVIDIA A100, sub supravegherea erorii medii pătratice (MSE), la o dimensiune a lotului de 64 și o rată de învățare de 2×10-5. Diverse elemente au fost eliminate aleatoriu pe parcursul antrenamentului, pentru a preveni ca sistemul să supraantreneze datele.

Setul de date a fost modificat din setul de date Parts to Whole, care la rândul său se bazează pe setul de date DeepFashion-MultiModal.

Exemple din setul de date Parts to Whole, utilizat în dezvoltarea datelor curate pentru CompleteMe. Sursa: https://huanngzh.github.io/Parts2Whole/

Exemple din setul de date Parts to Whole, utilizat în dezvoltarea datelor curate pentru CompleteMe. Sursa: https://huanngzh.github.io/Parts2Whole/

Autorii afirmă:

‘Pentru a îndeplini cerințele noastre, am reconstruit perechile de antrenament prin utilizarea imaginilor ocultate cu multiple imagini de referință care captează diverse aspecte ale apariției umane, împreună cu etichetele lor textuale scurte.

‘Fiecare exemplu din setul nostru de date de antrenament include șase tipuri de apariție: îmbrăcăminte pentru partea superioară a corpului, îmbrăcăminte pentru partea inferioară a corpului, îmbrăcăminte pentru întregul corp, păr sau accesorii pentru cap, față și încălțăminte. Pentru strategia de mascare, aplicăm mascare aleatorie pe grilă cu 50% între 1 și 30 de ori, iar pentru ceilalți 50%, utilizăm o mască de formă corporală pentru a crește complexitatea mascării.

‘După pipeline-ul de construire, am obținut 40.000 de perechi de imagini pentru antrenament.’

Metodele rivale anterioare fără referință testate au fost completarea imaginilor umane ocultate pe scară largă (LOHC) și modelul de înlocuire a imaginilor BrushNet; modelele bazate pe referințe testate au fost Paint-by-Example; AnyDoor; LeftRefill; și MimicBrush.

Autorii au început cu o comparație cantitativă pe metricile menționate anterior:

Rezultatele comparației cantitative inițiale.

Rezultatele comparației cantitative inițiale.

În ceea ce privește evaluarea cantitativă, autorii notează că CompleteMe obține scoruri cele mai mari în majoritatea metricilor perceptive, inclusiv CLIP-I, DINO, DreamSim și LPIPS, care sunt menite să capteze alinierea semantică și fidelitatea apariției între ieșire și imaginea de referință.

Cu toate acestea, modelul nu depășește toate liniile de bază în toate domeniile. În mod semnificativ, BrushNet obține cel mai mare scor pe CLIP-T, LeftRefill conduce în SSIM și PSNR, iar MimicBrush depășește ușor pe CLIP-I.

Deși CompleteMe arată rezultate puternice în general, diferențele de performanță sunt modeste în unele cazuri, iar anumite metrici rămân conduse de metodele rivale anterioare. Poate nu în mod nejustificat, autorii prezintă aceste rezultate ca dovezi ale puterii echilibrate a CompleteMe atât în dimensiunile structurale, cât și perceptive.

Ilustrațiile pentru testele calitative efectuate în cadrul studiului sunt prea numeroase pentru a fi reproduse aici, și ne referim cititorul nu numai la articolul sursă, ci și la extinsul PDF suplimentar, care conține multe exemple calitative suplimentare.

Noi subliniem exemplele calitative principale prezentate în articolul principal, împreună cu o selecție de cazuri suplimentare extrase din pool-ul de imagini suplimentare introdus mai devreme în acest articol:

Rezultatele calitative inițiale prezentate în articolul principal. Vă rugăm să consultați articolul sursă pentru o rezoluție mai bună.

Rezultatele calitative inițiale prezentate în articolul principal. Vă rugăm să consultați articolul sursă pentru o rezoluție mai bună.

Despre rezultatele calitative prezentate mai sus, autorii comentează:

‘Având intrări mascate, aceste metode fără referință generează conținut plauzibil pentru regiunile mascate folosind priori de imagine sau prompturi de text.

‘Cu toate acestea, așa cum se indică în cutia roșie, ele nu pot reproduce detalii specifice, cum ar fi tatuaje sau modele de îmbrăcăminte unice, deoarece lipsesc imaginile de referință care să ghideze reconstrucția informațiilor identice.’

O a doua comparație, parte a căreia este prezentată mai jos, se concentrează pe cele patru metode bazate pe referințe Paint-by-Example, AnyDoor, LeftRefill și MimicBrush. Aici a fost furnizată doar o imagine de referință și un prompt de text.

Comparație calitativă cu metodele bazate pe referințe. CompleteMe produce completări mai realiste și păstrează mai bine detalii specifice din imaginea de referință. Cutiile roșii evidențiază zone de interes deosebit.

Comparație calitativă cu metodele bazate pe referințe. CompleteMe produce completări mai realiste și păstrează mai bine detalii specifice din imaginea de referință.

Autorii afirmă:

‘Având o imagine umană mascată și o imagine de referință, alte metode pot genera conținut plauzibil, dar adesea nu reușesc să păstreze informații contextuale din referință în mod precis.

‘În unele cazuri, ele generează conținut nerelevant sau asociază greșit părți corespunzătoare din imaginea de referință. În contrast, CompleteMe completează eficient regiunea mascată, păstrând informații identice și asociază corect părți corespunzătoare ale corpului uman din imaginea de referință.’

Pentru a evalua cât de bine modelele se aliniază cu percepția umană, autorii au efectuat un studiu pe utilizatori care a implicat 15 annotatori și 2.895 de perechi de exemple. Fiecare pereche a comparat rezultatul CompleteMe cu unul dintre cele patru metode bazate pe referințe: Paint-by-Example, AnyDoor, LeftRefill sau MimicBrush.

Anotatorii au evaluat fiecare rezultat pe baza calității vizuale a regiunii completate și a gradului în care aceasta păstrează caracteristici de identitate din imaginea de referință – și aici, evaluând calitatea generală și identitatea, CompleteMe a obținut un rezultat mai definitiv:

Rezultatele studiului pe utilizatori.

Rezultatele studiului pe utilizatori.

Concluzie

Dacă ceva, rezultatele calitative din acest studiu sunt subminate de volumul lor, deoarece o examinare atentă indică faptul că noul sistem este o intrare extrem de eficientă în acest domeniu relativ de nișă, dar foarte căutat, de editare neurală a imaginilor.

Cu toate acestea, necesită o atenție și o mărire suplimentară pentru a aprecia cât de bine sistemul adaptează materialul de referință la zona ocultată în comparație (în aproape toate cazurile) cu metodele anterioare.

Vă recomandăm ferm cititorului să examineze cu atenție materialul suplimentar prezentat în articol, care la prima vedere poate părea confuz sau copleșitor.

Vă recomandăm ferm cititorului să examineze cu atenție materialul suplimentar prezentat în articol, care la prima vedere poate părea confuz sau copleșitor.

 

* Este interesant de remarcat modul în care versiunea V1.5, acum învechită, rămâne o preferință a cercetătorilor – parțial din cauza testării legacy, dar și pentru că este cea mai puțin cenzurată și, posibil, cea mai ușor de antrenat dintre toate iterațiile Stable Diffusion, și nu împărtășește încetarea cenzurii versiunilor FOSS Flux.

Specificarea VRAM nu este furnizată – ar fi fie 40GB, fie 80GB pe card.

Publicat pentru prima dată marți, 29 aprilie 2025

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai