Andersons vinkel
Genopretning og redigering af menneskebilleder med AI

Et nyt samarbejde mellem University of California Merced og Adobe tilbyder en fremgang i tilstanden for menneskebilledeudfylning – den meget studerede opgave at “afsløre” skjulte eller dækkede dele af billeder af mennesker, til formål som f.eks. virtuel prøvning, animation og foto-redigering.

Foruden at reparere beskadigede billeder eller ændre dem efter brugerens ønske, kan menneskebilledeudfyldningssystemer som CompleteMe påføre nye klædningsstykker (via en hjælpe-referencebillede, som i midterkolonnen i disse to eksempler) til eksisterende billeder. Disse eksempler er fra den omfattende supplerende PDF til den nye artikel. Kilde: https://liagm.github.io/CompleteMe/pdf/supp.pdf
Den nye tilgang, med titlen CompleteMe: Reference-baseret menneskebilledeudfylning, bruger supplerende input-billeder til at “forslå” systemet, hvilket indhold der skal erstatte den skjulte eller manglende del af menneskeafbildningen (hvilket også gør den anvendelig til mode-baserede prøvningssystemer):

CompleteMe-systemet kan tilpasse reference-indhold til den skjulte eller dækkede del af et menneskebillede.
Det nye system bruger en dobbelt U-Net-arkitektur og en Region-Focused Attention-blok, der samler ressourcerne til den pertinente del af billedrestaureringsinstansen.
Forskerne tilbyder også et nyt og udfordrende benchmark-system designet til at evaluere reference-baserede udfyldningssystemer (da CompleteMe er en del af en eksisterende og pågående forskningsstræng i computer-vision, selv om den ikke havde nogen benchmark-skema før).
I tests og i en vel-skaleret brugerstudie kom den nye metode ud som den bedste i de fleste målinger og samlet set. I visse tilfælde var rivaliserende metoder fuldstændigt forvirrede af den reference-baserede tilgang:

Fra supplerende materiale: AnyDoor-metoden har særlig svigt at afgøre, hvordan man skal fortolke et referencebillede.
Artiklen fastslår:
‘Omhyggelige eksperimenter på vores benchmark demonstrerer, at CompleteMe overgår state-of-the-art-metoder, både reference-baserede og ikke-reference-baserede, i forhold til kvantitative målinger, kvalitative resultater og brugerstudier.
‘Specielt i udfordrende scenarier med komplekse stillinger, intrikate beklædningsmønstre og karakteristiske tilbehør opnår vores model konsekvent en højere visuel troværdighed og semantisk kohærens.’
Desværre indeholder projektets GitHub-tilstedeværelse ingen kode, og initiativet, der også har en beskeden projekt-side, synes at være ramt som en proprietær arkitektur.

Yderligere eksempel på det nye systems subjektive præstation i forhold til tidligere metoder. Flere detaljer senere i artiklen.
Metode
CompleteMe-rammen er underbygget af en Reference U-Net, der håndterer integrationen af det supplerende materiale i processen, og en kohærent U-Net, der kan håndtere en bredere række processer til at opnå det endelige resultat, som vist i det konceptuelle skema nedenfor:

Det konceptuelle skema for CompleteMe. Kilde: https://arxiv.org/pdf/2504.20042
Systemet kodificerer først det maskerede input-billede til en latent repræsentation. Samtidig behandler Reference U-Net multiple reference-billeder – hver viser forskellige kropsdele – for at trække detaljerede rumlige funktioner ud.
Disse funktioner passerer gennem en Region-Focused Attention-blok indbygget i den “komplette” U-Net, hvor de maskeres selektivt ved hjælp af tilsvarende regionsmasker, hvilket sikrer, at modellen kun fokuserer på relevante områder i reference-billederne.
De maskerede funktioner integreres derefter med globale CLIP-afledte semantiske funktioner gennem decoupled cross-attention, hvilket tillader modellen at genskabe manglende indhold med både fin detalje og semantisk kohærens.
For at forbedre realismen og robustheden kombinerer input-maskeringsprocessen tilfældige grid-baserede dækninger med menneskekropsform-masker, hver anvendt med ligelig sandsynlighed, hvilket øger kompleksiteten af de manglende områder, som modellen skal udfylde.
Kun til reference
Tidligere metoder til reference-baseret billedudfylning afhængigt typisk af semantisk niveau-kodificeringer. Projekter af denne type omfatter CLIP selv og DINOv2, som begge trækker globale funktioner ud af reference-billeder, men ofte mister de fine rumlige detaljer, der er nødvendige for præcis identitetsbevarelse.

Fra udgivelsesartiklen for den ældre DINOV2-tilgang, som er inkluderet i sammenligningstests i den nye studie: De farvede overlag viser de første tre hovedkomponenter fra Principal Component Analysis (PCA), anvendt på billedstykke inden for hver kolonne, hvilket fremhæver, hvordan DINOv2 grupperer lignende objektdel sammen på tværs af varierede billeder. Trods forskelle i stilling, stil eller rendering er tilsvarende områder (som vinger, lemmer eller hjul) konsekvent matchet, hvilket illustrerer modellens evne til at lære part-baseret struktur uden overvågning. Kilde: https://arxiv.org/pdf/2304.07193
CompleteMe adresserer dette aspekt gennem en specialiseret Reference U-Net initialiseret fra Stable Diffusion 1.5, men opererer uden diffusionsstøj-trin*.
Hver reference-billede, der dækker forskellige kropsdele, kodificeres til detaljerede latente funktioner gennem denne U-Net. Globale semantiske funktioner udtrækkes også separat ved hjælp af CLIP, og begge sæt funktioner cachelagres for effektiv brug under attention-baseret integration. Derved kan systemet fleksibelt håndtere multiple reference-input, samtidig med at det bevare fine-grænse-udseende-oplysninger.
Orkestrering
Den kohærente U-Net håndterer de endelige stadier af udfyldningsprocessen. Tilpasset fra inpainting-varianten af Stable Diffusion 1.5, tager den maskede kilde-billede i latent form som input, sammen med detaljerede rumlige funktioner trukket fra reference-billederne og globale semantiske funktioner udtrukket af CLIP-kodificeringen.
Disse forskellige input kombineres gennem RFA-blokken, der spiller en kritisk rolle i at styre modellens fokus mod de mest relevante områder af reference-materialet.
Før indgangen til attention-mekanismen maskeres reference-funktionerne eksplicit for at fjerne ikke-relaterede områder og derefter konkateneres med den latente repræsentation af kilde-billedet, hvilket sikrer, at attention rettes så præcist som muligt.
For at forbedre denne integration inkorporerer CompleteMe en decoupled cross-attention-mekanisme tilpasset fra IP-Adapter-rammen:

IP-Adapter, en del af hvilken er inkorporeret i CompleteMe, er et af de mest succesfulde og ofte-brugte projekter fra de sidste tre tumultariske år af udvikling i latent diffusionsmodel-arkitekturer. Kilde: https://ip-adapter.github.io/
Dette tillader modellen at behandle rumligt detaljerede visuelle funktioner og bredere semantisk kontekst gennem separate attention-strømme, som senere kombineres, hvilket resulterer i en kohærent rekonstruktion, som forfatterne hævder, bevare både identitet og fine-grænse-detajler.
Benchmarking
I mangelen på en passende dataset for reference-baseret menneskeudfylning har forskerne foreslået deres egen. Den (uopdagede) benchmark blev konstrueret ved at kuratere udvalgte billedpar fra WPose-datasættet udviklet til Adobe Research’s 2023 UniHuman-projekt.

Eksempler på stillinger fra Adobe Research 2023 UniHuman-projekt. Kilde: https://github.com/adobe-research/UniHuman?tab=readme-ov-file#data-prep
Forskerne tegnede manuelt kilde-masker for at indikere udfyldningsområderne, og fik til sidst 417 tredelte billedgrupper, der bestod af et kilde-billede, maske og reference-billede.

To eksempler på grupper, der oprindeligt stammer fra reference-WPose-datasættet og er kurateret omfattende af artiklens forskere.
Forfatterne brugte LLaVA Large Language Model (LLM) til at generere tekst-prompts, der beskriver kilde-billederne.
Målinger, der blev brugt, var mere omfattende end normalt; ud over den sædvanlige Peak Signal-to-Noise Ratio (PSNR), Structural Similarity Index (SSIM) og Learned Perceptual Image Patch Similarity (LPIPS, i dette tilfælde for at evaluere maskede regioner), brugte forskerne DINO til ligningskarakter; DreamSim til evaluering af genereringsresultater; og CLIP.
Data og tests
For at teste arbejdet brugte forfatterne både den standard Stable Diffusion V1.5-model og 1.5-inpainting-modellen. Systemets billed-kodificeringsmodel brugte CLIP Vision-modellen, sammen med projektil-lag – beskedne neurale netværk, der omformer eller justerer CLIP-udgangene til at matche de interne funktion-dimensioner, der bruges af modellen.
Træningen fandt sted i 30.000 iterationer over otte NVIDIA A100† GPU’er, overvåget af Mean Squared Error (MSE)-tab, med en batch-størrelse på 64 og en læringsrate på 2×10-5. Forskellige elementer blev tilfældigt droppet under træningen for at forhindre, at systemet overfitted på data.
Datasættet blev modificeret fra Parts to Whole-datasættet, som selv er baseret på DeepFashion-MultiModal-datasættet.

Eksempler fra Parts to Whole-datasættet, brugt i udviklingen af det kuraterede data til CompleteMe. Kilde: https://huanngzh.github.io/Parts2Whole/
Forfatterne fastslår:
‘For at opfylde vores krav, [genopbyggede] vi træningsparrene ved at bruge dækkede billeder med multiple reference-billeder, der fanger forskellige aspekter af menneskeudseende samt deres korte tekstuelle mærker.
‘Hver prøve i vores træningsdata indeholder seks udseende-typer: øvre kropsbeklædning, nedre kropsbeklædning, hele kropsbeklædning, hår eller hovedbeklædning, ansigt og sko. For maskeringsstrategien anvender vi 50% tilfældig grid-masking mellem 1 til 30 gange, mens for de andre 50% bruger vi en menneskekropsform-maske for at øge maskeringskompleksiteten.
‘Efter konstruktionspipeline fik vi 40.000 billedpar til træning.’
Rivaliserende tidligere ikke-reference-metoder, der blev testet, var Large occluded human image completion (LOHC) og plug-and-play billedudfylning-modellen BrushNet; reference-baserede modeller, der blev testet, var Paint-by-Example; AnyDoor; LeftRefill; og MimicBrush.
Forfatterne startede med en kvantitativ sammenligning på de tidligere nævnte målinger:

Resultater for den indledende kvantitative sammenligning.
Med hensyn til den kvantitative evaluering bemærker forfatterne, at CompleteMe opnår de højeste score på de fleste perceptuelle målinger, herunder CLIP-I, DINO, DreamSim og LPIPS, der er designet til at fange semantisk alignment og udseende-trofasthed mellem output og reference-billede.
Men modellen overgår ikke alle baseline-metoder på tværs af brættet. Bemærkelsesværdigt scorer BrushNet højest på CLIP-T, LeftRefill fører i SSIM og PSNR, og MimicBrush overgår lidt på CLIP-I.
mens CompleteMe viser konsekvent stærke resultater samlet set, er forskellene i præstationer beskedne i visse tilfælde, og visse målinger forbliver ledet af konkurrerende tidligere metoder. Forfatterne fremstiller disse resultater som bevis for CompleteMe’s balancerede styrke på både strukturelle og perceptuelle dimensioner.
Illustrationer for de kvalitative tests, der blev gennemført i studiet, er alt for talrige til at reproducere her, og vi henviser læseren ikke kun til kilde-artiklen, men også til den omfattende supplerende PDF, som indeholder mange yderligere kvalitative eksempler.
Vi fremhæver de primære kvalitative eksempler, der præsenteres i hovedartiklen, sammen med en udvalg af yderligere tilfælde trukket fra den supplerende billed-pool introduceret tidligere i denne artikel:

Indledende kvalitative resultater præsenteret i hovedartiklen. Henvis venligst til kilde-artiklen for bedre opløsning.
Om de kvalitative resultater, der vises ovenfor, bemærker forfatterne:
‘Givet maskede input, genererer disse ikke-reference-metoder plausibelt indhold for de maskede regioner ved hjælp af billed-priorer eller tekst-prompts.
‘Men, som indikeret i den røde boks, kan de ikke genskabe specifikke detaljer, såsom tatoveringer eller unikke beklædningsmønstre, da de mangler reference-billeder til at guide rekonstruktionen af identisk information.’
En anden sammenligning, en del af hvilken vises nedenfor, fokuserer på de fire reference-baserede metoder Paint-by-Example, AnyDoor, LeftRefill og MimicBrush. Her blev kun ét reference-billede og en tekst-prompt givet.

Kvalitativ sammenligning med reference-baserede metoder. CompleteMe producerer mere realistiske udfyldninger og bevare bedre specifikke detaljer fra reference-billedet. De røde bokse fremhæver områder af særlig interesse.
Forfatterne fastslår:
‘Givet et masked menneskebillede og et reference-billede, kan andre metoder generere plausibelt indhold, men ofte mislykkes med at bevare kontekstuel information fra reference-billedet nøjagtigt.
‘I visse tilfælde genererer de irrelevant indhold eller mapper forkert tilsvarende dele fra reference-billedet. I modsætning hertil udfylder CompleteMe den masked region effektivt ved at bevare identisk information og korrekt mappe tilsvarende kropsdele fra reference-billedet.’
For at evaluere, hvor godt modellerne er i overensstemmelse med menneskelig perception, gennemførte forfatterne en brugerstudie med 15 annotatorer og 2.895 prøvepar. Hvert par sammenlignede output fra CompleteMe med en af de fire reference-baserede baseline-metoder: Paint-by-Example, AnyDoor, LeftRefill eller MimicBrush.
Annotatorerne vurderede hver resultats visuelle kvalitet og udstrækningen, hvori det bevarede identitetsfunktioner fra reference-billedet – og her, hvor man vurderede samlet kvalitet og identitet, opnåede CompleteMe et mere definitivt resultat:

Resultater fra brugerstudiet.
Konklusion
Hvis noget, så underminerer de kvalitative resultater i denne studie deres egen størrelse, da en nærmere undersøgelse afslører, at det nye system er en meget effektiv indgang i dette relativt niche, men meget efterspurgte område af neural billed-redigering.
Men det kræver lidt ekstra omhu og zoom på den originale PDF for at værdsætte, hvor godt systemet tilpasser reference-materialet til den dækkede område i sammenligning (i næsten alle tilfælde) med tidligere metoder.

Vi anbefaler stærkt læseren at undersøge nøje den initiativt forvirrende, hvis ikke overvældende mængde af resultater præsenteret i det supplerende materiale.
* Det er interessant at bemærke, hvordan den nu stærkt forældede V1.5-udgave stadig er en favorit blandt forskere – delvist på grund af arv fra tidligere test, men også fordi det er den mindst censurerede og muligvis lettest trænbar af alle Stable Diffusion-iterationer, og ikke deler den censurerende hæmning af de FOSS Flux-udgaver.
† VRAM-specifikation ikke angivet – det ville være enten 40GB eller 80GB per kort.
Først udgivet tirsdag, 29. april 2025












