AI-modeller og platforme

BrushNet: Plug og Play-billede inpainting med dual-branch diffusion

mm
Føj Unite.AI til dine foretrukne kilder på Google

Billede inpainting er et af de klassiske problemer i computer vision, og det sigter mod at genskabe maskerede områder i et billede med plausibel og naturlig indhold. Eksisterende arbejde, der anvender traditionelle billede inpainting-teknikker som Generative Adversarial Networks eller GANS, og Variational Auto-Encoders eller VAEs, kræver ofte hjælp fra auxiliary hand-engineered features, men leverer ikke tilfredsstillende resultater. Over de seneste år har diffusion-baserede metoder vundet popularitet inden for computer vision-fællesskabet på grund af deres bemærkelsesværdige højkvalitets billede-genereringskapaciteter, output-diversitet og fine-grained kontrol. De første forsøg på at anvende diffusion-modeller til tekst-guidet billede inpainting modificerede den standard denoising-strategi ved at sample maskerede områder fra en pre-trænet diffusion-model, og de umaskerede områder fra det givne billede. Selvom disse metoder resulterede i tilfredsstillende præstationer på simple billede inpainting-opgaver, havde de svært ved at håndtere komplekse masker, tekstprompts og billedeindhold, hvilket resulterede i en generel mangel på koherens. Mangel på koherens i disse metoder kan primært tilskrives deres begrænsede perceptuelle viden om masker-grænser og umaskerede billede-region kontekst.

Trods fremskridt, forskning og udvikling af disse modeller over de seneste år, er billede inpainting stadig en stor udfordring for computer vision-udviklere. Nuværende tilpasninger af diffusion-modeller til billede inpainting-opgaver indebærer modificering af sampling-strategien eller udvikling af inpainting-specifikke diffusion-modeller, der ofte lider under reduceret billede-kvalitet og inkonsistente semantik. For at tackle disse udfordringer og banke vejen for billede inpainting-modeller, vil vi i denne artikel tale om BrushNet, en ny plug og play dual-branch ingeniører ramme, der indlejrer pixel-niveau maskerede billede-funktioner i enhver pre-trænet diffusion-model, hvilket garanterer koherens og forbedret resultat på billede inpainting-opgaver. BrushNet-rammen introducerer en ny paradigm, under hvilken rammen dividerer billede-funktioner og støjende latente i separate grene. Divisionen af billede-funktioner og støjende latente reducerer læringens belastning for modellen drastisk og faciliterer en nuanceret inkorporering af essentiel maskeret billede-information i en hierarkisk facon. Ud over BrushNet-rammen, vil vi også tale om BrushBench og BrushData, der faciliterer segmentations-baseret præstationsvurdering og billede inpainting-træning henholdsvis.

Denne artikel sigter mod at dække BrushNet-rammen i dybden, og vi udforsker mekanismen, metoden, arkitekturen af rammen sammen med dens sammenligning med state of the art-rammer. Så lad os komme i gang.

BrushNet: Billede Inpainting med Dual-Branch Diffusion

Billede inpainting, en metode, der forsøger at genskabe de manglende områder i et billede, mens den opretholder den overordnede koherens, har været et langvarigt problem i computer vision-feltet og har generet udviklere og forskere i flere år. Billede inpainting finder sine anvendelser på tværs af en bred vifte af computer vision-opgaver, herunder billede-redigering og virtuelle prøver. For nylig har diffusion-modeller som Stable Diffusion og Stable Diffusion 1.5 demonstreret bemærkelsesværdig evne til at generere højkvalitets billeder og giver brugerne fleksibiliteten til at kontrollere semantisk og strukturel kontrol. Den bemærkelsesværdige potentiale af diffusion-modeller er det, der har fået forskere til at anvende diffusion-modeller til højkvalitets billede inpainting-opgaver, der er i overensstemmelse med input-tekstprompts.

De metoder, der anvendes af traditionelle diffusion-baserede tekst-guidede inpainting-rammer, kan deles i to kategorier, Sampling Strategi Modificering og Dedicated Inpainting Modeller. Sampling strategi modificering metoden modificerer den standard denoising-proces ved at sample maskerede områder fra en pre-trænet diffusion-model, og kopierer umaskerede områder fra det givne billede i hver denoising-trin. Selvom sampling strategi modificering tilgange kan implementeres i arbitrære diffusion-modeller, resulterer de ofte i inkohærente inpainting-resultater, da de har begrænsede perceptuelle kundskaber om masker-grænser og umaskerede billede-region kontekst. På den anden side, dedikerer inpainting-modeller fin-justerer en billede inpainting-model, der er specifikt designet ved at udvide dimensionerne af input-kanalen i den grundlæggende diffusion-model til at inkorporere korrupt billede og masker. Selvom dedikerer inpainting-modeller giver diffusion-modellen mulighed for at generere mere tilfredsstillende resultater med specialiserede shape-aware og content-aware modeller, kan det måske ikke være den bedste arkitektoniske design for billede inpainting-modeller.

Som demonstreret i følgende billede, dedikerer inpainting-modeller fusionerer maskeret billede latent, støjende latent, tekst og mask på et tidligt stadium. Den arkitektoniske design af disse dedikerer inpainting-modeller påvirker let maskeret billede-funktioner og forhindrer de efterfølgende lag i UNet-arkitekturen fra at opnå rene maskeret billede-funktioner på grund af tekstens indflydelse. Yderligere, håndtering af generation og betingelse i en enkelt gren pålægger yderligere belastning på UNet-arkitekturen, og da disse tilgange også kræver fin-justering i forskellige variationer af diffusion-baggrund, er disse tilgange ofte tidskrævende med begrænsede overførselsmuligheder.

Det kan synes, at tilføje en ekstra gren til at trække maskeret billede-funktioner kan være en adequat løsning på ovennævnte problemer, men eksisterende rammer resulterer ofte i at trække og indsætte utilstrækkelige oplysninger, når de anvendes direkte til inpainting. Som følge heraf, resulterer eksisterende rammer som ControlNet i utilfredsstillende resultater, når de sammenlignes med dedikerer inpainting-modeller. For at tackle dette problem på den mest effektive måde mulig, introducerer BrushNet-rammen en ekstra gren til den originale diffusion-netværk og skaber dermed en mere egnet arkitektur for billede inpainting-opgaver. Design og arkitektur af BrushNet-rammen kan sammenfattes i tre punkter.

  1. I stedet for at initialisere convolution-lag random, implementerer BrushNet-rammen en VAE-encoder til at behandle det maskerede billede. Derved kan BrushNet-rammen trække billede-funktioner for tilpasning til UNet-distributionen mere effektivt.
  2. BrushNet-rammen inkorporerer gradvist det fulde UNet-funktion-lag lag for lag i den pre-trænede UNet-arkitektur, en hierarkisk tilgang, der giver tæt per-pixel kontrol.
  3. BrushNet-rammen fjerner tekst-cross-attention fra UNet-komponenten for at sikre, at kun ren billede-information behandles i den ekstra gren. Yderligere, foreslår BrushNet-modellen også at implementere en blurred blending-strategi for at opnå bedre konsistens samt en højere grad af kontrollabilitet i umaskerede områder af billedet.

BrushNet: Metode og Arkitektur

Følgende figur giver os en kort oversigt over BrushNet-rammen.

Som det kan ses, anvender rammen en dual-branch-strategi for maskeret billede-vejledning og anvender blending-operationer med en blurred mask for at sikre bedre bevarelse af umaskerede områder. Det er værd at bemærke, at BrushNet-rammen kan justere den tilføjede skala for at opnå fleksibel kontrol. For et givet maskeret billede-input og masken, udgangs-inkluderer BrushNet-modellen et inpainteret billede. Modellen nedsamplet masken for at tilpasse størrelsen af latent og det maskerede billede indføres som input til VAE-encoderen for at tilpasse distributionen af latent-rummet. Modellen konkatenerer derefter det maskerede billede-latent, det støjende latent og det nedsamplede mask og anvender det som input. Funktionerne, som modellen trækker, tilføjes derefter til den pre-trænede UNet-lag efter en zero-convolution-blok. Efter denoising, modellen blender det maskerede billede og det genererede billede med en blurred mask.

Maskeret Billede-Vejledning

BrushNet-rammen indsætter det maskerede billede-funktion i den pre-trænede diffusion-netværk ved hjælp af en ekstra gren, der adskiller funktionstrækningen af maskerede billeder fra processen med billede-generering eksplicit. Inputtet dannes ved at konkatenerer det maskerede billede-latent, det støjende latent og det nedsamplede mask. For at være mere specifik, giver det støjende latent information om billede-generering under den aktuelle generation-proces og hjælper rammen med at forbedre den semantiske koherens af det maskerede billede-funktion. BrushNet-rammen trækker derefter det maskerede billede-latent fra det maskerede billede ved hjælp af en Variational AutoEncoder. Yderligere, anvender rammen cubic-interpolation til at nedsample masken i et forsøg på at sikre, at mask-størrelsen er i overensstemmelse med det maskerede billede-latent og det støjende latent. For at behandle det maskerede billede-funktion, implementerer BrushNet-rammen en kopi af den pre-trænede diffusion-model og udelader cross-attention-lagene i diffusion-modellen. Årsagen er, at de pre-trænede vægte af diffusion-modellen fungerer som en stærk prior for at trække funktionerne af det maskerede billede, og udelader cross-attention-lagene sikrer, at modellen kun behandler ren billede-information i den ekstra gren. BrushNet-rammen indsætter funktionerne i den frosne diffusion-model lag for lag, hvilket giver tæt per-pixel kontrol, og anvender også zero-convolution-lag for at etablere en forbindelse mellem den trænede BrushNet-model og den låste model, hvilket sikrer, at skadelig støj ikke har nogen indflydelse på de skjulte tilstande i den trænede kopi under de første træningsfaser.

Blending-Operation

Som nævnt tidligere, udfører blending-operationen i latent-rummet ofte omskalering af masker, hvilket resulterer i flere uændrelser, og BrushNet-rammen møder et lignende problem, når den omskalrer masken for at tilpasse størrelsen af latent-rummet. Yderligere, er det værd at bemærke, at kodning og dekodning i Variational AutoEncoders har begrænsede operationer og kan ikke sikre fuldstændig billede-rekonstruktion. For at sikre, at rammen genskaber et fuldstændigt konsistent billede af det umaskerede område, har eksisterende arbejde implementeret forskellige teknikker som kopiering af umaskerede områder fra det originale billede. Selvom denne tilgang fungerer, resulterer den ofte i en mangel på semantisk koherens i generationen af de endelige resultater. På den anden side, møder andre metoder som latent blending-operationer vanskeligheder ved at bevare den ønskede information i umaskerede områder.

Fleksibel Kontrol

Den arkitektoniske design af BrushNet-rammen gør det til en egnet valg for plug og play-integrationer indbygget i forskellige pre-trænede diffusion-modeller og giver fleksibel bevarelse af skala. Da BrushNet-rammen ikke ændrer vægtene af den pre-trænede diffusion-model, har udviklere fleksibiliteten til at integrere det som en plug og play-komponent med en fin-justeret diffusion-model, hvilket giver let adoption og eksperimentering med pre-trænede modeller. Yderligere, har udviklere også mulighed for at kontrollere bevarelse-skalaen af umaskerede områder ved at inkorporere funktionerne af BrushNet-modellen i den frosne diffusion-model med den givne vægt w, der bestemmer indflydelsen af BrushNet-rammen på bevarelse-skalaen, hvilket giver udviklere mulighed for at justere de ønskede niveauer af bevarelse. Endelig, giver BrushNet-rammen brugerne mulighed for at justere blurring-skalaen og beslutte, om eller ikke at implementere blurring-operationen, hvilket giver mulighed for fleksible justeringer og fine-grained kontrol over billede inpainting-processen.

BrushNet: Implementering og Resultater

For at analysere dens resultater, foreslår BrushNet-rammen BrushBench, en segmentations-baseret billede inpainting-dataset med over 600 billeder, hvor hvert billede er ledsaget af en menneske-annoteret mask og caption-annotation. Billederne i benchmark-datasettet er fordelt jævnt mellem naturlige og kunstige billeder og sikrer også en jævn fordeling mellem forskellige kategorier, hvilket giver en fair vurdering på tværs af forskellige kategorier. For at forbedre analysen af inpainting-opgaver yderligere, kategoriserer BrushNet-rammen datasettet i to distinkte dele på basis af de metoder, der anvendes: segmentations-baseret og brush-masks.

Kvantitativ Sammenligning

Følgende tabel sammenligner BrushNet-rammen med eksisterende diffusion-baserede billede inpainting-modeller på BrushBench-datasettet med Stable Diffusion som grundmodel.

Som det kan ses, demonstrerer BrushNet-rammen bemærkelsesværdig effektivitet på tværs af maskeret område-bevarelse, tekst-tilpasning og billede-kvalitet. Yderligere, modeller som Stable Diffusion Inpainting, HD-Painter, PowerPaint og andre demonstrerer stærk præstation på billede inside-inpainting-opgaver, selvom de ikke kan gentage deres præstation på outside-inpainting-opgaver, især i forhold til tekst-tilpasning og billede-kvalitet. I alt, giver BrushNet-rammen de stærkeste resultater.

Yderligere, sammenligner følgende tabel BrushNet-rammen med eksisterende diffusion-baserede billede inpainting-modeller på EditBench-datasettet, og præstationen er sammenlignelig med den, der observeres på BrushBench-datasettet. Resultaterne indikerer, at BrushNet-rammen giver stærk præstation på tværs af en bred vifte af billede inpainting-opgaver med forskellige mask-typer.

Kvalitativ Sammenligning

Følgende figur sammenligner kvalitativt BrushNet-rammen med eksisterende billede inpainting-metoder, med resultater, der dækker kunstig intelligens og naturlige billeder på tværs af forskellige inpainting-opgaver, herunder random mask inpainting, segmentations-mask inside-inpainting og segmentations-mask outside-inpainting.

Som det kan ses, giver BrushNet-rammen bemærkelsesværdige resultater i forhold til koherens af det umaskerede område og de kohærente områder og realiserer med held baggrundsinformationens bevidsthed på grund af implementeringen af den dual-branch-decoupling-tilgang. Yderligere, giver den uberørte gren af den pre-trænede diffusion-model også fordelene ved at dække forskellige data-domæner som anime og maleri bedre, hvilket resulterer i bedre præstation på tværs af forskellige scenarier.

Endelige Tanker

I denne artikel har vi talt om BrushNet, en ny plug og play dual-branch ingeniører ramme, der indlejrer pixel-niveau maskerede billede-funktioner i enhver pre-trænet diffusion-model, hvilket garanterer koherens og forbedret resultat på billede inpainting-opgaver. BrushNet-rammen introducerer en ny paradigm, under hvilken rammen dividerer billede-funktioner og støjende latente i separate grene. Divisionen af billede-funktioner og støjende latente reducerer læringens belastning for modellen drastisk og faciliterer en nuanceret inkorporering af essentiel maskeret billede-information i en hierarkisk facon. Ud over BrushNet-rammen, vil vi også tale om BrushBench og BrushData, der faciliterer segmentations-baseret præstationsvurdering og billede inpainting-træning henholdsvis.

En ingeniør af profession, en forfatter af hjerte. Kunal er en teknisk forfatter med en dyb kærlighed og forståelse af AI og ML, dedikeret til at forenkle komplekse koncepter inden for disse felter gennem sin engagerende og informative dokumentation.