Andersons vinkel

Gjenoppreting og redigering av menneskebilder med AI

mm
Legg til Unite.AI blant dine foretrukne kilder på Google
Montage of examples from supplementary material for the paper 'CompleteMe: Reference-based Human Image Completion' (https://liagm.github.io/CompleteMe/pdf/supp.pdf)

Et nytt samarbeid mellom University of California Merced og Adobe (ADBE ) tilbyr en fremgang i kunnskapsnivået på menneskebildefullstendighet – den mye studerte oppgaven med å “avdekk” skjulte eller skjulte deler av bilder av mennesker, for formål som virtuell prøving, animasjon og foto-redigering.

Foruten å reparere skadde bilder eller endre dem etter brukerens ønske, kan menneskebildefullstendighetssystemer som CompleteMe pålegge nye klær (via en tilhørende referansebilde, som i midtkolonne i disse to eksemplene) i eksisterende bilder. Disse eksemplene er fra den omfattende supplerings-PDFen for den nye artikkelen. Kilde: https://liagm.github.io/CompleteMe/pdf/supp.pdf

Foruten å reparere skadde bilder eller endre dem etter brukerens ønske, kan menneskebildefullstendighetssystemer som CompleteMe pålegge nye klær (via en tilhørende referansebilde, som i midtkolonne i disse to eksemplene) i eksisterende bilder. Disse eksemplene er fra den omfattende supplerings-PDFen for den nye artikkelen. Kilde: https://liagm.github.io/CompleteMe/pdf/supp.pdf

Den nye tilnærmingen, tittelen CompleteMe: Referansebasert menneskebildefullstendighet, bruker suppleringsbilder for å “forslag” til systemet hva innhold som skal erstatte de skjulte eller manglende delene av menneskebildet (hvilket gjør det anvendelig på motebaserte prøve-rammeverk):

CompleteMe-systemet kan tilpasse referanseinnhold til den skjulte eller skjulte delen av et menneskebilde.

CompleteMe-systemet kan tilpasse referanseinnhold til den skjulte eller skjulte delen av et menneskebilde.

Det nye systemet bruker en dobbel U-Net-arkitektur og en Region-Fokusert Oppmerksomhet (RFA)-blokk som samler ressurser til den pertinente delen av bilde-restaureringsinstansen.

Forskerne tilbyr også et nytt og utfordrende benchmark-system designet for å evaluere referansebaserte fullstendighetoppdrag (da CompleteMe er en del av en eksisterende og pågående forskningsstråle i datavisualisering, selv om den ikke har hatt noen benchmark-skjema før nå).

I tester og i en vel-skalert brukerstudie, kom den nye metoden ut som beste i de fleste mål, og beste totalt. I visse tilfeller var rivaliserende metoder fullstendig forvirret av den referansebaserte tilnærmingen:

Fra suppleringsmaterialet: AnyDoor-metoden har særlig vanskeligheter med å tolke en referansebilde.

Fra suppleringsmaterialet: AnyDoor-metoden har særlig vanskeligheter med å tolke en referansebilde.

Artikkelen sier:

‘Omfattende eksperimenter på vårt benchmark viser at CompleteMe overgår state-of-the-art-metoder, både referansebaserte og ikke-referansebaserte, i kvantitative mål, kvalitative resultater og brukerstudier.

‘Spesielt i utfordrende scenarier med komplekse posisjoner, intrikate klesmønster og distinkte tilbehør, oppnår vår modell konsekvent overlegen visuell trofasthet og semantisk kohens.’

Dessverre inneholder prosjektets GitHub-tilstedeværelse ingen kode, og initiativet, som også har en beskjeden prosjektside, ser ut til å være rammet som en proprietær arkitektur.

Ytterligere eksempel på det nye systemets subjektive ytelse mot tidligere metoder. Mer informasjon senere i artikkelen.

Ytterligere eksempel på det nye systemets subjektive ytelse mot tidligere metoder. Mer informasjon senere i artikkelen.

Metode

CompleteMe-rammeverket er underbygget av en Referanse U-Net, som håndterer integreringen av hjelpebildene i prosessen, og en kohesiv U-Net, som akkommoderer en bredere rekke prosesser for å oppnå slutresultatet, som vist i det konseptuelle skjemaet nedenfor:

Det konseptuelle skjemaet for CompleteMe. Kilde: https://arxiv.org/pdf/2504.20042

Det konseptuelle skjemaet for CompleteMe. Kilde: https://arxiv.org/pdf/2504.20042

Systemet koderer først den maskerte inndata-bildet til en latent representasjon. Samtidig behandler Referanse U-Net flere referansebilder – hver viser forskjellige kroppsregioner – for å trekke ut detaljerte romlige trekk.

Disse trekkene går gjennom en Region-fokusert Oppmerksomhet-blokk innbygget i den “fullstendige” U-Net, hvor de velges ut ved hjelp av tilhørende regionmasker, slik at modellen bare fokuserer på relevante områder i referansebildene.

De maskerte trekkene integreres deretter med globale CLIP-avledede semantiske trekk gjennom dekoplet kryssoppmerksomhet, noe som tillater modellen å rekonstruere manglende innhold med både fin detalj og semantisk kohens.

For å forbedre realisme og robusthet, kombinerer inndata-maskeringsprosessen tilfeldige grid-baserte okklusjoner med menneskekroppsformmasker, hver anvendt med lik sannsynlighet, og øker kompleksiteten til de manglende regionene som modellen må fullstendige.

Kun for referanse

Tidligere metoder for referansebasert bilde-utfylling avhengte vanligvis av semantisk-nivå-kodere. Prosjekter av denne typen inkluderer CLIP selv, og DINOv2, begge som trekker ut globale trekk fra referansebilder, men ofte mister de fine romlige detaljene nødvendige for nøyaktig identitetsbevarelse.

Fra utgivelsesartikkelen for den eldre DINOV2-tilnærmingen, som er inkludert i sammenligningstester i den nye studien: De fargede overlagene viser de første tre hovedkomponentene fra Principal Component Analysis (PCA), anvendt på bilde-utklipp innen hver kolonne, og fremhever hvordan DINOv2 grupperer sammen lignende objekt-deler over varierte bilder. Til tross for forskjeller i posisjon, stil eller rendering, er tilsvarende regioner (som vinger, lemmer eller hjul) konsekvent sammenlignet, og illustrerer modellens evne til å lære part-basert struktur uten tilsyn.. Kilde: https://arxiv.org/pdf/2304.07193

Fra utgivelsesartikkelen for den eldre DINOV2-tilnærmingen, som er inkludert i sammenligningstester i den nye studien: De fargede overlagene viser de første tre hovedkomponentene fra Principal Component Analysis (PCA), anvendt på bilde-utklipp innen hver kolonne, og fremhever hvordan DINOv2 grupperer sammen lignende objekt-deler over varierte bilder. Til tross for forskjeller i posisjon, stil eller rendering, er tilsvarende regioner (som vinger, lemmer eller hjul) konsekvent sammenlignet, og illustrerer modellens evne til å lære part-basert struktur uten tilsyn. Kilde: https://arxiv.org/pdf/2304.07193

CompleteMe addresserer dette aspektet gjennom en spesialisert Referanse U-Net initialisert fra Stable Diffusion 1.5, men opererer uten diffusjons-støy-trinnet*.

Hver referansebilde, som dekker forskjellige kroppsregioner, koderes til detaljerte latente trekk gjennom denne U-Net. Globale semantiske trekk trekkes også ut separat ved hjelp av CLIP, og begge sett med trekk lagres for effektiv bruk under oppmerksomhets-basert integrasjon. Dermed kan systemet akkommodere flere referanse-inndata fleksibelt, samtidig som det bevare fine-grainede utseendesinformasjon.

Orkestrering

Den kohesive U-Net håndterer de siste stadiene av fullstendighetsprosessen. Tilpasset fra inpainting-varianten av Stable Diffusion 1.5, tar den inn maskert kilde-bilde i latent form, sammen med detaljerte romlige trekk fra referansebildene og globale semantiske trekk trekke ut av CLIP-koderen.

Disse forskjellige inndata kombineres gjennom RFA-blokken, som spiller en kritisk rolle i å styre modellens fokus mot de mest relevante områdene i referansematerialet.

Før inndataene går inn i oppmerksomhets-mekanismen, maskeres referanse-trekkene uttrykkelig for å fjerne urelaterte regioner og deretter konkateneres med den latente representasjonen av kilde-bildet, slik at oppmerksomheten rettes så presist som mulig.

For å forbedre denne integrasjonen, inkorporerer CompleteMe en dekoplet kryss-oppmerksomhets-mekanisme tilpasset fra IP-Adapter-rammeverket:

IP-Adapter, som er en del av CompleteMe, er ett av de mest suksessfulle og ofte-brukte prosjektene fra de siste tre tumultøse årene med utvikling i latente diffusjonsmodell-arkitekturer. Kilde: https://ip-adapter.github.io/

IP-Adapter, som er en del av CompleteMe, er ett av de mest suksessfulle og ofte-brukte prosjektene fra de siste tre tumultøse årene med utvikling i latente diffusjonsmodell-arkitekturer. Kilde: https://ip-adapter.github.io/

Dette tillater modellen å prosessere romlig detaljerte visuelle trekk og bredere semantisk kontekst gjennom separate oppmerksomhets-strømmer, som senere kombineres, resulterende i en kohesiv rekonstruksjon som, ifølge forfatterne, bevare både identitet og fine-grainede detaljer.

Benchmarking

I fravær av et passende datasett for referansebasert menneske-fullstendighet, har forskerne foreslått sitt eget. Den (navnløse) benchmarken ble konstruert ved å kuratere utvalgte bilde-par fra WPose-datasettet utviklet for Adobe Researchs 2023 UniHuman-prosjekt.

Eksempler på posisjoner fra Adobe Research 2023 UniHuman-prosjekt. Kilde: https://github.com/adobe-research/UniHuman?tab=readme-ov-file#data-prep

Eksempler på posisjoner fra Adobe Research 2023 UniHuman-prosjekt. Kilde: https://github.com/adobe-research/UniHuman?tab=readme-ov-file#data-prep

Forskerne tegnet manuelt kilde-masker for å indikere utfyllingsområdene, og fikk til slutt 417 tripartite bilde-grupper som bestod av et kilde-bilde, maske og referanse-bilde.

To eksempler på grupper derivert initialt fra referanse-WPose-datasett, og kuratert omfattende av forskerne i den nye artikkelen.

To eksempler på grupper derivert initialt fra referanse-WPose-datasett, og kuratert omfattende av forskerne i den nye artikkelen.

Forfatterne brukte LLaVA Large Language Model (LLM) for å generere tekst-prompter som beskriver kilde-bildene.

Mål som ble brukt var mer omfattende enn vanlig; foruten de vanlige Peak Signal-to-Noise Ratio (PSNR), Structural Similarity Index (SSIM) og Lærte Perceptuelle Bilde-Patch-Lignende (LPIPS, i dette tilfellet for å evaluere maskerte regioner), brukte forskerne DINO for ligningspoeng; DreamSim for genereringsresultat-evaluering; og CLIP.

Data og tester

For å teste arbeidet, brukte forfatterne både den standard Stable Diffusion V1.5-modellen og 1.5-utfyllingsmodellen. Systemets bilde-koderer brukte CLIP Vision-modellen, sammen med projeksjonslag – beskjedne neurale nettverk som omformer eller justerer CLIP-utdata for å matche de interne funksjonsdimensjoner som brukes av modellen.

Trening skjedde over 30 000 iterasjoner på åtte NVIDIA A100† GPU-er, overvåket av Gjennomsnittlig Kvadratisk Feil (MSE) tap, med en batch-størrelse på 64 og en læringshastighet på 2×10-5. Forskjellige elementer ble tilfeldig droppet gjennom trening for å forhindre at systemet over-fitter på dataene.

Datasettet ble modifisert fra Parts to Whole-datasettet, som selv er basert på DeepFashion-MultiModal-datasettet.

Eksempler fra Parts to Whole-datasettet, brukt i utviklingen av det kuraterte data for CompleteMe. Kilde: https://huanngzh.github.io/Parts2Whole/

Eksempler fra Parts to Whole-datasettet, brukt i utviklingen av det kuraterte data for CompleteMe. Kilde: https://huanngzh.github.io/Parts2Whole/

Forfatterne sier:

‘For å møte våre krav, [gjenoppbygde] vi trenings-paret ved å bruke okkluderte bilder med flere referanse-bilder som fanger forskjellige aspekter av menneske-utseende sammen med deres korte tekstlige merker.

‘Hver prøve i vårt treningsdata inkluderer seks utseende-typer: øvre kroppsklær, nedre kroppsklær, hele kroppsklær, hår eller hodeplagg, ansikt og sko. For maskerings-strategien, anvender vi 50% tilfeldig grid-masking mellom 1 til 30 ganger, mens for de andre 50% bruker vi en menneskekroppsform-maske for å øke maskerings-kompleksitet.

‘Etter konstruksjons-pipeline, fikk vi 40 000 bilde-par for trening.’

Rivaliserende tidligere ikke-referanse-metoder som ble testet var Stor okkludert menneske-bilde-fullstendighet (LOHC) og plug-and-play-bilde-utfyllingsmodellen BrushNet; referanse-baserte modeller som ble testet var Paint-by-Example; AnyDoor; LeftRefill; og MimicBrush.

Forfatterne startet med en kvantitativ sammenligning på de tidligere nevnte målene:

Resultater for den initielle kvantitative sammenligningen.

Resultater for den initielle kvantitative sammenligningen.

Med hensyn til den kvantitative evalueringen, merker forfatterne at CompleteMe oppnår de høyeste poengene på de fleste perceptuelle mål, inkludert CLIP-I, DINO, DreamSim og LPIPS, som er ment å fange semantisk sammenheng og utseende-trofasthet mellom utdata og referanse-bildet.

Imidlertid overgår modellen ikke alle baselinjer over hele linjen. Spesielt scorer BrushNet høyest på CLIP-T, LeftRefill leder i SSIM og PSNR, og MimicBrush overgår noe på CLIP-I.

mens CompleteMe viser konsekvent sterke resultater totalt, er forskjellene i ytelse beskjedne i noen tilfeller, og visse mål blir fortsatt ledet av konkurrerende tidligere metoder. Kanskje ikke urimelig, rammer forfatterne disse resultatene som bevis på CompleteMe sin balanserte styrke over både strukturelle og perceptuelle dimensjoner.

Illustrasjoner for de kvalitative tester som ble utført i studien er langt for tallrike til å gjengi her, og vi henviser leseren ikke bare til kilde-artikkelen, men også til den omfattende supplerings-PDFen, som inneholder mange flere kvalitative eksempler.

Vi fremhever de primære kvalitative eksemplene presentert i hovedartikkelen, sammen med en utvalg av ekstra tilfeller trukket fra den omfattende bilde-pulen introdusert tidligere i denne artikkelen:

Initielle kvalitative resultater presentert i hovedartikkelen. Vennligst se kilde-artikkelen for bedre oppløsning.

Initielle kvalitative resultater presentert i hovedartikkelen. Vennligst se kilde-artikkelen for bedre oppløsning.

Konklusjon

Hvis noe, så undermineres de kvalitative resultater i denne studien av deres ren mengde, siden nærmere undersøkelse indikerer at det nye systemet er en svært effektiv inngang i dette relativt nisje-men sterkt ettertrakte området av neuralt bilde-redigering.

Imidlertid krever det en del ekstra omsorg og zooming inn på den originale PDFen for å verdsette hvor godt systemet tilpasser referanse-materialet til den okkluderte området i sammenligning (i nesten alle tilfeller) med tidligere metoder.

Vi anbefaler sterkt leseren å nøye eksaminere de initielt forvirrende, om ikke overveldende mengden resultater presentert i suppleringsmaterialet.

Vi anbefaler sterkt leseren å nøye eksaminere de initielt forvirrende, om ikke overveldende mengden resultater presentert i suppleringsmaterialet.

 

* Det er interessant å merke hvordan den nå svært gamle V1.5-utgaven fortsatt er en favoritt blant forskere – delvis på grunn av legacy like-on-like testing, men også fordi det er den minst sensurerte og kanskje mest lett trenebare av alle Stable Diffusion-iterasjonene, og ikke deler den sensur-hindringen til FOSS Flux-utgavene.

† VRAM-spekifikasjon ikke gitt – det ville være enten 40GB eller 80GB per kort.

Først publisert tirsdag, 29. april 2025

Skribent innen maskinlæring, domenespesialist i menneskelig bildesyntese. Tidligere leder for forskningsinnhold hos Metaphysic.ai, frem til oppløsningen i DNEG's Brahma.ai.
Website: martinanderson.ai
Contact: martin@martinanderson.ai