Andersons vinkel

ÅterstÃĪlla och redigera mÃĪnskliga bilder med AI

mm
LÃĪgg till Unite.AI bland dina fÃķredragna kÃĪllor pÃĨ Google
Montage of examples from supplementary material for the paper 'CompleteMe: Reference-based Human Image Completion' (https://liagm.github.io/CompleteMe/pdf/supp.pdf)

En ny samarbetsinsats mellan University of California Merced och Adobe erbjuder en framsteg pÃĨ den senaste utvecklingen inom mÃĪnsklig bildkomplettering – den vÃĪlstuderade uppgiften att “avslÃķja” dolda eller occluderade delar av bilder av mÃĪnniskor, fÃķr ÃĪndamÃĨl som virtuell provning, animation och foto-redigering.

FÃķrutom att reparera skadade bilder eller ÃĪndra dem enligt anvÃĪndarens ÃķnskemÃĨl, kan mÃĪnskliga bildkompletterings-system som CompleteMe infÃķra nya klÃĪder (via en adjungerad referensbild, som i den mittersta kolumnen i dessa tvÃĨ exempel) i befintliga bilder. Dessa exempel ÃĪr frÃĨn den omfattande supplementÃĪra PDF-filen fÃķr den nya artikeln. KÃĪlla: https://liagm.github.io/CompleteMe/pdf/supp.pdf

FÃķrutom att reparera skadade bilder eller ÃĪndra dem enligt anvÃĪndarens ÃķnskemÃĨl, kan mÃĪnskliga bildkompletterings-system som CompleteMe infÃķra nya klÃĪder (via en adjungerad referensbild, som i den mittersta kolumnen i dessa tvÃĨ exempel) i befintliga bilder. Dessa exempel ÃĪr frÃĨn den omfattande supplementÃĪra PDF-filen fÃķr den nya artikeln. KÃĪlla: https://liagm.github.io/CompleteMe/pdf/supp.pdf

Den nya metoden, med titeln CompleteMe: Referensbaserad mÃĪnsklig bildkomplettering, anvÃĪnder supplementÃĪra inmatningsbilder fÃķr att “fÃķreslÃĨ” fÃķr systemet vilket innehÃĨll som ska ersÃĪtta den dolda eller saknade delen av den mÃĪnskliga avbildningen (dÃĪrfÃķr ÃĪr den tillÃĪmplig fÃķr modebaserade provningsramverk):

CompleteMe-systemet kan anpassa referensinnehÃĨll till den occluderade eller dolda delen av en mÃĪnsklig bild.

CompleteMe-systemet kan anpassa referensinnehÃĨll till den occluderade eller dolda delen av en mÃĪnsklig bild.

Det nya systemet anvÃĪnder en dubbel U-Net-arkitektur och en Region-Focused Attention (RFA)-block som samordnar resurser till den relevanta delen av bildÃĨterstÃĪllningsinstansen.

Forskarna presenterar ocksÃĨ ett nytt och utmanande benchmark-system fÃķr att utvÃĪrdera referensbaserade kompletteringsuppgifter (eftersom CompleteMe ÃĪr en del av en befintlig och pÃĨgÃĨende forskningsstrÃĪng inom datorseende, men som tidigare saknat en benchmark-schema).

I tester och i en vÃĪl skalad anvÃĪndarstudie kom den nya metoden ut som bÃĪst i de flesta mÃĨtt, och som bÃĪst totalt. I vissa fall var rivaliserande metoder helt fÃķrvirrade av den referensbaserade metoden:

FrÃĨn supplementÃĪr material: AnyDoor-metoden har sÃĪrskild svÃĨrighet att tolka en referensbild.

FrÃĨn supplementÃĪr material: AnyDoor-metoden har sÃĪrskild svÃĨrighet att tolka en referensbild.

Artikeln sÃĪger:

‘Omfattande experiment pÃĨ vÃĨr benchmark visar att CompleteMe ÃķvertrÃĪffar state-of-the-art-metoder, bÃĨde referensbaserade och icke-referensbaserade, i termer av kvantitativa mÃĨtt, kvalitativa resultat och anvÃĪndarstudier.

‘SÃĪrskilt i utmanande scenarier som involverar komplexa poser, intrikata klÃĪdmÃķnster och distinkta tillbehÃķr, uppnÃĨr vÃĨr modell konsekvent ÃķverlÃĪgsen visuell trohet och semantisk samstÃĪmmighet.’

TyvÃĪrr innehÃĨller projektets GitHub-nÃĪrvaro ingen kod, och initiativet, som ocksÃĨ har en blygsam projektsida, verkar ramas som en proprietÃĪr arkitektur.

Ytterligare exempel pÃĨ det nya systemets subjektiva prestanda mot tidigare metoder. Mer information senare i artikeln.

Ytterligare exempel pÃĨ det nya systemets subjektiva prestanda mot tidigare metoder. Mer information senare i artikeln.

Metod

CompleteMe-ramverket vilar pÃĨ en Referens U-Net, som hanterar integrationen av det tillÃĪggsinnehÃĨll i processen, och en sammanhÃĨllen U-Net, som tillÃĨter en bredare mÃĪngd processer fÃķr att erhÃĨlla det slutliga resultatet, som visas i den konceptuella schemat nedan:

Den konceptuella schemat fÃķr CompleteMe. KÃĪlla: https://arxiv.org/pdf/2504.20042

Den konceptuella schemat fÃķr CompleteMe. KÃĪlla: https://arxiv.org/pdf/2504.20042

Systemet kodar fÃķrst den maskerade inmatningsbilden till en latent representation. Samtidigt bearbetar Referens U-Net flera referensbilder – var och en visar olika kroppsomrÃĨden – fÃķr att extrahera detaljerade rumsliga funktioner.

Dessa funktioner passerar genom en Region-Focused Attention-block som ÃĪr inbÃĪddad i den “kompletta” U-Net, dÃĪr de maskeras selektivt med hjÃĪlp av motsvarande regionmasker, vilket sÃĪkerstÃĪller att modellen fokuserar endast pÃĨ relevanta omrÃĨden i referensbilderna.

De maskerade funktionerna integreras sedan med globala CLIP-hÃĪrledda semantiska funktioner genom avkopplad cross-attention, vilket tillÃĨter modellen att rekonstruera saknad innehÃĨll med bÃĨde fin detalj och semantisk samstÃĪmmighet.

FÃķr att fÃķrbÃĪttra realismen och robustheten kombinerar inmatningsmaskeringsprocessen slumpmÃĪssiga gridbaserade occlusioner med mÃĪnskliga kroppsformsmasker, var och en tillÃĪmpad med lika sannolikhet, vilket Ãķkar komplexiteten hos de saknade omrÃĨden som modellen mÃĨste slutfÃķra.

Endast fÃķr referens

Tidigare metoder fÃķr referensbaserad bildkomplettering fÃķrlitade sig vanligtvis pÃĨ semantiska nivÃĨer-kodare. Projekt av denna typ inkluderar CLIP sjÃĪlv och DINOv2, som bÃĨda extraherar globala funktioner frÃĨn referensbilder, men ofta fÃķrlorar de fina rumsliga detaljerna som behÃķvs fÃķr exakt identitetshantering.

FrÃĨn utgivningsartikeln fÃķr den ÃĪldre DINOV2-metoden, som ingÃĨr i jÃĪmfÃķrelsetester i den nya studien: De fÃĪrgade Ãķverlagren visar de tre fÃķrsta huvudkomponenterna frÃĨn Principal Component Analysis (PCA), tillÃĪmpad pÃĨ bildfragment inom varje kolumn, vilket visar hur DINOv2 grupperar liknande objekt-delar tillsammans Ãķver varierade bilder. Trots skillnader i pose, stil eller rendering, matchas motsvarande regioner (sÃĨsom vingar, lemmar eller hjul) konsekvent, vilket visar modellens fÃķrmÃĨga att lÃĪra sig delbaserad struktur utan Ãķverinseende. KÃĪlla: https://arxiv.org/pdf/2304.07193

FrÃĨn utgivningsartikeln fÃķr den ÃĪldre DINOV2-metoden, som ingÃĨr i jÃĪmfÃķrelsetester i den nya studien: De fÃĪrgade Ãķverlagren visar de tre fÃķrsta huvudkomponenterna frÃĨn Principal Component Analysis (PCA), tillÃĪmpad pÃĨ bildfragment inom varje kolumn, vilket visar hur DINOv2 grupperar liknande objekt-delar tillsammans Ãķver varierade bilder. Trots skillnader i pose, stil eller rendering, matchas motsvarande regioner (sÃĨsom vingar, lemmar eller hjul) konsekvent, vilket visar modellens fÃķrmÃĨga att lÃĪra sig delbaserad struktur utan Ãķverinseende. KÃĪlla: https://arxiv.org/pdf/2304.07193

CompleteMe hanterar detta genom en specialiserad Referens U-Net initierad frÃĨn Stable Diffusion 1.5, men som opererar utan diffusionsbrussteget*.

Varje referensbild, som tÃĪcker olika kroppsomrÃĨden, kodas till detaljerade latenta funktioner genom denna U-Net. Globala semantiska funktioner extraheras ocksÃĨ separat med hjÃĪlp av CLIP, och bÃĨda funktionssatserna cachelagras fÃķr effektiv anvÃĪndning under attention-baserad integration. SÃĨledes kan systemet hantera flera referensinmatningar flexibelt, samtidigt som det bevarar fina detaljer i utseendet.

Orkestrering

Den sammanhÃĨllna U-Net hanterar de slutliga stadierna av kompletteringsprocessen. Anpassad frÃĨn inpainting-varianten av Stable Diffusion 1.5, tar den inmatningsmaskerade kÃĪllbilden i latent form, tillsammans med detaljerade rumsliga funktioner dragna frÃĨn referensbilderna och globala semantiska funktioner extraherade av CLIP-kodaren.

Dessa olika inmatningar kombineras genom RFA-blocket, som spelar en kritisk roll i att styra modellens fokus mot de mest relevanta omrÃĨdena i referensmaterialet.

Innan de gÃĨr in i uppmÃĪrksamhetsmekanismen maskeras referensfunktionerna explicit fÃķr att ta bort orelaterade regioner och sedan konkateneras med den latenta representationen av kÃĪllbilden, vilket sÃĪkerstÃĪller att uppmÃĪrksamheten riktas sÃĨ exakt som mÃķjligt.

FÃķr att fÃķrbÃĪttra denna integration inkorporerar CompleteMe en avkopplad cross-attention-mekanism anpassad frÃĨn IP-Adapter-ramverket:

IP-Adapter, som ÃĪr en del av CompleteMe, ÃĪr ett av de mest framgÃĨngsrika och ofta anvÃĪnda projekten frÃĨn de senaste tre turbulenta ÃĨren av utveckling inom latenta diffusionsmodellarkitekturer. KÃĪlla: https://ip-adapter.github.io/

IP-Adapter, som ÃĪr en del av CompleteMe, ÃĪr ett av de mest framgÃĨngsrika och ofta anvÃĪnda projekten frÃĨn de senaste tre turbulenta ÃĨren av utveckling inom latenta diffusionsmodellarkitekturer. KÃĪlla: https://ip-adapter.github.io/

Detta tillÃĨter modellen att bearbeta rumsligt detaljerade visuella funktioner och bredare semantisk kontext genom separata uppmÃĪrksamhetsstrÃķmmar, som senare kombineras, vilket resulterar i en sammanhÃĪngande rekonstruktion som, enligt fÃķrfattarna, bevarar bÃĨde identitet och fina detaljer.

Benchmarking

I avsaknad av en lÃĪmplig dataset fÃķr referensbaserad mÃĪnsklig komplettering, har forskarna fÃķreslagit sin egen. Den (obnamngivna) benchmarken konstruerades genom att kurera utvalda bildpar frÃĨn WPose-datasetet som utvecklats fÃķr Adobe Researchs 2023 UniHuman-projekt.

Exempel pÃĨ poser frÃĨn Adobe Research 2023 UniHuman-projekt. KÃĪlla: https://github.com/adobe-research/UniHuman?tab=readme-ov-file#data-prep

Exempel pÃĨ poser frÃĨn Adobe Research 2023 UniHuman-projekt. KÃĪlla: https://github.com/adobe-research/UniHuman?tab=readme-ov-file#data-prep

Forskarna ritade manuellt kÃĪllmasker fÃķr att ange kompletteringsomrÃĨdena, och fick slutligen 417 tripartita bildgrupper som bestod av en kÃĪllbild, mask och referensbild.

TvÃĨ exempel pÃĨ grupper som ursprungligen hÃĪmtats frÃĨn WPose-datasetet och kuraterats omfattande av forskarna i den nya artikeln.

TvÃĨ exempel pÃĨ grupper som ursprungligen hÃĪmtats frÃĨn WPose-datasetet och kuraterats omfattande av forskarna i den nya artikeln.

FÃķrfattarna anvÃĪnde LLaVA Large Language Model (LLM) fÃķr att generera textprompt som beskriver kÃĪllbilderna.

MÃĨtt som anvÃĪndes var mer omfattande ÃĪn vanligt; fÃķrutom den vanliga Peak Signal-to-Noise Ratio (PSNR), Structural Similarity Index (SSIM) och Learned Perceptual Image Patch Similarity (LPIPS, i detta fall fÃķr att utvÃĪrdera maskerade omrÃĨden), anvÃĪnde forskarna DINO fÃķr likhetspoÃĪng; DreamSim fÃķr utvÃĪrdering av generationsresultat; och CLIP.

Data och tester

FÃķr att testa arbetet anvÃĪnde fÃķrfattarna bÃĨde standard-Stable Diffusion V1.5-modellen och 1.5-inpainting-modellen. Systemets bildkodare anvÃĪnde CLIP Vision-modellen, tillsammans med projiceringsskikt – blygsamma neurala nÃĪtverk som omformar eller justerar CLIP-utdata fÃķr att matcha de interna funktiondimensioner som anvÃĪnds av modellen.

TrÃĪning ÃĪgde rum under 30 000 iterationer Ãķver ÃĨtta NVIDIA A100† GPU:er, Ãķvervakade av Mean Squared Error (MSE)-fÃķrlust, med en batchstorlek pÃĨ 64 och en inlÃĪrningshastighet pÃĨ 2×10-5. Olika element slumpmÃĪssigt droppades under trÃĪning fÃķr att fÃķrhindra att systemet Ãķveranpassade pÃĨ data.

Datasetet modifierades frÃĨn Parts to Whole-datasetet, som i sin tur bygger pÃĨ DeepFashion-MultiModal-datasetet.

Exempel frÃĨn Parts to Whole-datasetet, som anvÃĪndes i utvecklingen av det kuraterade data fÃķr CompleteMe. KÃĪlla: https://huanngzh.github.io/Parts2Whole/

Exempel frÃĨn Parts to Whole-datasetet, som anvÃĪndes i utvecklingen av det kuraterade data fÃķr CompleteMe. KÃĪlla: https://huanngzh.github.io/Parts2Whole/

FÃķrfattarna skriver:

‘FÃķr att uppfylla vÃĨra krav, byggde vi om trÃĪningsparen genom att anvÃĪnda occluderade bilder med flera referensbilder som fÃĨngar olika aspekter av mÃĪnskligt utseende, tillsammans med deras korta textuella etiketter.

‘Varje exempel i vÃĨr trÃĪningsdata innehÃĨller sex utseendetyper: Ãķverkroppsplagg, underkroppsplagg, helkroppsplagg, hÃĨr eller huvudbonad, ansikte och skor. FÃķr maskeringsstrategin, tillÃĪmpade vi 50% slumpmÃĪssig gridmaskering mellan 1 till 30 gÃĨnger, medan fÃķr de andra 50%, anvÃĪnde vi en mÃĪnsklig kroppsformsmask fÃķr att Ãķka maskeringskomplexiteten.

‘Efter konstruktionspipelinen fick vi 40 000 bildpar fÃķr trÃĪning.’

Rivaliserande tidigare icke-referens-metoder som testades var Large occluded human image completion (LOHC) och plug-and-play-bildinpainting-modellen BrushNet; referensbaserade modeller som testades var Paint-by-Example; AnyDoor; LeftRefill; och MimicBrush.

FÃķrfattarna bÃķrjade med en kvantitativ jÃĪmfÃķrelse pÃĨ de tidigare nÃĪmnda mÃĨtten:

Resultat fÃķr den initiala kvantitativa jÃĪmfÃķrelsen.

Resultat fÃķr den initiala kvantitativa jÃĪmfÃķrelsen.

Med avseende pÃĨ den kvantitativa utvÃĪrderingen noterar fÃķrfattarna att CompleteMe uppnÃĨr de hÃķgsta poÃĪngen pÃĨ de flesta perceptuella mÃĨtten, inklusive CLIP-I, DINO, DreamSim och LPIPS, som ÃĪr avsedda att fÃĨnga semantisk samstÃĪmmighet och utseendefidelitet mellan utdata och referensbild.

Men modellen ÃķvertrÃĪffar inte alla baslinjer Ãķver hela linjen. Noterbart ÃĪr att BrushNet uppnÃĨr den hÃķgsta poÃĪngen pÃĨ CLIP-T, LeftRefill leder i SSIM och PSNR, och MimicBrush ÃķvertrÃĪffar nÃĨgot pÃĨ CLIP-I.

Medan CompleteMe visar konsekvent starka resultat totalt sett, ÃĪr prestandaskillnaderna blygsamma i vissa fall, och vissa mÃĨtt fÃķrblir ledda av rivaliserande tidigare metoder. Kanske inte orÃĪttvist, rammar fÃķrfattarna dessa resultat som bevis fÃķr CompleteMe:s balanserade styrka Ãķver bÃĨde strukturella och perceptuella dimensioner.

Illustrationer fÃķr de kvalitativa tester som utfÃķrdes i studien ÃĪr alltfÃķr mÃĨnga fÃķr att ÃĨterges hÃĪr, och vi hÃĪnvisar lÃĪsaren inte bara till kÃĪllartikeln, utan ocksÃĨ till den omfattande supplementÃĪra PDF-filen, som innehÃĨller mÃĨnga ytterligare kvalitativa exempel.

Vi betonar de primÃĪra kvalitativa exemplen som presenteras i huvudartikeln, tillsammans med ett urval av ytterligare fall som hÃĪmtats frÃĨn den supplementÃĪra bildpoolen som introducerades tidigare i denna artikel:

Initiala kvalitativa resultat presenterade i huvudartikeln. VÃĪnligen se kÃĪllartikeln fÃķr bÃĪttre upplÃķsning.

Initiala kvalitativa resultat presenterade i huvudartikeln. VÃĪnligen se kÃĪllartikeln fÃķr bÃĪttre upplÃķsning.

Av de kvalitativa resultaten som visas ovan, kommenterar fÃķrfattarna:

‘Givet maskerade inmatningar, genererar dessa icke-referensmetoder trovÃĪrdigt innehÃĨll fÃķr de maskerade omrÃĨdena med hjÃĪlp av bildprioriteter eller textprompt.

‘Men, som indikeras i den rÃķda rutan, kan de inte reproducera specifika detaljer som tatueringar eller unika klÃĪdmÃķnster, eftersom de saknar referensbilder fÃķr att vÃĪgleda rekonstruktionen av identisk information.’

En andra jÃĪmfÃķrelse, som delvis visas nedan, fokuserar pÃĨ de fyra referensbaserade metoderna Paint-by-Example, AnyDoor, LeftRefill och MimicBrush. HÃĪr tillhandahÃķlls endast en referensbild och en textprompt.

Kvalitativ jÃĪmfÃķrelse med referensbaserade metoder. CompleteMe producerar mer realistiska kompletteringar och bevarar bÃĪttre specifika detaljer frÃĨn referensbilden. De rÃķda rutorna markerar omrÃĨden av sÃĪrskilt intresse.

Kvalitativ jÃĪmfÃķrelse med referensbaserade metoder. CompleteMe producerar mer realistiska kompletteringar och bevarar bÃĪttre specifika detaljer frÃĨn referensbilden. De rÃķda rutorna markerar omrÃĨden av sÃĪrskilt intresse.

FÃķrfattarna skriver:

‘Givet en maskerad mÃĪnsklig bild och en referensbild, kan andra metoder generera trovÃĪrdigt innehÃĨll, men ofta misslyckas de med att bevara kontextuell information frÃĨn referensen korrekt.

‘I vissa fall genererar de irrelevant innehÃĨll eller kartlÃĪgger felaktigt motsvarande delar frÃĨn referensbilden. I kontrast, kompleterar CompleteMe effektivt det maskerade omrÃĨdet genom att korrekt bevara identisk information och rÃĪtt kartlÃĪgga motsvarande delar av den mÃĪnskliga kroppen frÃĨn referensbilden.’

FÃķr att utvÃĪrdera hur vÃĪl modellerna stÃĪmmer Ãķverens med mÃĪnsklig perception, genomfÃķrde fÃķrfattarna en anvÃĪndarstudie som involverade 15 annotatorer och 2 895 exempelpar. Varje par jÃĪmfÃķrde CompleteMe:s utdata med en av de fyra referensbaserade baslinjerna: Paint-by-Example, AnyDoor, LeftRefill eller MimicBrush.

Annotatorerna utvÃĪrderade varje resultat baserat pÃĨ den visuella kvaliteten pÃĨ det kompletterade omrÃĨdet och den utstrÃĪckning till vilken det bevarade identitetsfunktioner frÃĨn referensen – och hÃĪr, nÃĪr det gÃĪller att utvÃĪrdera Ãķvergripande kvalitet och identitet, fick CompleteMe ett mer definitivt resultat:

Resultat frÃĨn anvÃĪndarstudien.

Resultat frÃĨn anvÃĪndarstudien.

Slutsats

Om nÃĨgot, sÃĨ fÃķrstÃķrs de kvalitativa resultaten i denna studie av deras ren volym, eftersom en noggrann granskning visar att det nya systemet ÃĪr en mycket effektiv entrÃĐ i detta relativt nischade men het eftertraktade omrÃĨde av neural bildredigering.

Men det krÃĪver lite extra omsorg och zoomning-in pÃĨ den ursprungliga PDF-filen fÃķr att uppskatta hur vÃĪl systemet anpassar referensmaterialet till det occluderade omrÃĨdet i jÃĪmfÃķrelse (i nÃĪstan alla fall) med tidigare metoder.

Vi rekommenderar starkt lÃĪsaren att noggrant granska den initialt fÃķrvirrande, om inte ÃķvervÃĪldigande, mÃĪngd av resultat som presenteras i det supplementÃĪra materialet.

Vi rekommenderar starkt lÃĪsaren att noggrant granska den initialt fÃķrvirrande, om inte ÃķvervÃĪldigande, mÃĪngd av resultat som presenteras i det supplementÃĪra materialet.

 

* Det ÃĪr intressant att notera hur den nu fÃķrÃĨldrade V1.5-utgÃĨvan fortfarande ÃĪr en favorit bland forskare – delvis pÃĨ grund av legacy-liknande tester, men ocksÃĨ fÃķr att den ÃĪr den minst censurerade och mÃķjligen mest lÃĪtttrÃĪnade av alla Stable Diffusion-iterationer, och inte delar den censuriska hÃĪmningen av de fria Flux-utgÃĨvorna.

† VRAM-specifikationen anges inte – den skulle vara antingen 40 GB eller 80 GB per kort.

Publicerad fÃķrsta gÃĨngen tisdagen den 29 april 2025

FÃķrfattare pÃĨ maskinlÃĪrning, domÃĪnspecialist inom mÃĪnsklig bildsyntes. Fd chef fÃķr forskningsinnehÃĨll pÃĨ Metaphysic.ai, till dess upplÃķsning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: [email protected]