AI-modeller och plattformar
HD-Painter: Text-Guided Image Inpainting med HÃķg UpplÃķsning med Diffusionsmodeller
Diffusionsmodeller har utan tvekan revolutionerat AI- och ML-industrin, med tillÃĪmpningar i realtid som har blivit en integrerad del av vÃĨra dagliga liv. Efter att text-till-bild-modeller visat sin anmÃĪrkningsvÃĪrda fÃķrmÃĨga, har diffusionsbaserade bildmanipulationstekniker, sÃĨsom kontrollerad generering, specialiserad och personlig bildsyntes, objektnivÃĨbildredigering, prompt-villkorad variation och redigering, dykt upp som heta forskningsteman pÃĨ grund av deras tillÃĪmpningar inom datorseendeindustrin.
Men trots deras imponerande fÃķrmÃĨgor och exceptionella resultat, har text-till-bild-ramverk, sÃĪrskilt text-till-bild-inpainting-ramverk, fortfarande potential fÃķr utveckling. Dessa inkluderar fÃķrmÃĨgan att fÃķrstÃĨ globala scener, sÃĪrskilt nÃĪr man avbullrar bilden i hÃķga diffusionssteg. FÃķr att tackla detta problem, introducerade forskare HD-Painter, ett helt utbildningsfritt ramverk som fÃķljer prompt-instruktioner exakt och skalar till hÃķgupplÃķsta bildinpainting sammanhÃĪngande. HD-Painter-ramverket anvÃĪnder en Prompt Aware Introverted Attention (PAIntA)-lager, som utnyttjar promptinformation fÃķr att fÃķrbÃĪttra sjÃĪlvuppmÃĪrksamhetsskÃķr, vilket resulterar i bÃĪttre textaligneringsgenerering.
FÃķr att ytterligare fÃķrbÃĪttra sammanhÃĪngningen i prompten, introducerar HD-Painter-modellen en Reweighting Attention Score Guidance (RASG)-ansats. Denna ansats integrerar en post-hoc-provtagningstrategi i den allmÃĪnna formen av DDIM-komponenten sÃķmlÃķst, vilket fÃķrhindrar utomfÃķrdelning av latenta skift. Dessutom har HD-Painter-ramverket en specialiserad superupplÃķsningsteknik som ÃĪr anpassad fÃķr inpainting, vilket mÃķjliggÃķr utvidgning till stÃķrre skalor och tillÃĨter HD-Painter-ramverket att slutfÃķra de saknade regionerna i bilden med upplÃķsningar upp till 2K.
HD-Painter: Text-Guided Image Inpainting
Text-till-bild-diffusionsmodeller har verkligen varit ett betydande ÃĪmne inom AI- och ML-industrin under de senaste mÃĨnaderna, med modeller som visat imponerande fÃķrmÃĨgor i realtid Ãķver olika praktiska tillÃĪmpningar. FÃķrutbildade text-till-bild-genereringsmodeller som DALL-E, Imagen och Stable Diffusion har visat sin lÃĪmplighet fÃķr bildkomplettering genom att kombinera avbullrade (genererade) okÃĪnda regioner med diffunderade kÃĪnda regioner under den bakÃĨtriktade diffusionsprocessen. Trots att de producerar visuellt tilltalande och vÃĪlharmoniserade utdata, kÃĪmpar existerande modeller fÃķr att fÃķrstÃĨ den globala scenen, sÃĪrskilt under den hÃķga diffusionssteget avbullringsprocessen. Genom att modifiera fÃķrutbildade text-till-bild-diffusionsmodeller fÃķr att inkorporera ytterligare kontextinformation, kan de finjusteras fÃķr text-guidad bildkomplettering.
FÃķrutom det, ÃĪr text-guidad inpainting och text-guidad bildkomplettering viktiga omrÃĨden av intresse fÃķr forskare. Detta intresse drivs av det faktum att text-guidade inpainting-modeller kan generera innehÃĨll i specifika regioner av en ingÃĨngsbild baserat pÃĨ textprompt, vilket leder till potentiella tillÃĪmpningar sÃĨsom retuschering av specifika bildregioner, modifiering av subjektsattribut som fÃĪrger eller klÃĪder och tillÃĪgg eller ersÃĪttning av fÃķremÃĨl. Sammanfattningsvis har text-till-bild-diffusionsmodeller nyligen uppnÃĨtt en utanfÃķr jÃĪmfÃķrelse framgÃĨng, tack vare deras exceptionellt realistiska och visuellt tilltalande genereringsfÃķrmÃĨga.

Men en majoritet av existerande ramverk visar prompt-fÃķrsummelse i tvÃĨ scenarier. Det fÃķrsta ÃĪr Bakgrundsdominans nÃĪr modellen slutfÃķr den okÃĪnda regionen genom att ignorera prompten i bakgrunden, medan det andra scenariot ÃĪr nÃĪrliggande objektdominans nÃĪr modellen propagerar de kÃĪnda regionernas fÃķremÃĨl till den okÃĪnda regionen med hjÃĪlp av visuell kontextsannolikhet snarare ÃĪn den ingÃĨngsprompten. Det ÃĪr mÃķjligt att bÃĨda dessa problem kan vara ett resultat av den vanliga inpainting-diffusions fÃķrmÃĨga att tolka den textprompten korrekt eller blanda den med den kontextinformation som erhÃĨlls frÃĨn den kÃĪnda regionen.
FÃķr att tackla dessa hinder, introducerar HD-Painter-ramverket Prompt Aware Introverted Attention eller PAIntA-lagret, som anvÃĪnder promptinformation fÃķr att fÃķrbÃĪttra sjÃĪlvuppmÃĪrksamhetsskÃķr, vilket resulterar i bÃĪttre textaligneringsgenerering. PAIntA anvÃĪnder den givna textuella villkoret fÃķr att fÃķrbÃĪttra sjÃĪlvuppmÃĪrksamhet med mÃĨlet att reducera pÃĨverkan av icke-prompt-relevant information frÃĨn bildregionen, samtidigt som man Ãķkar bidraget frÃĨn de kÃĪnda pixlarna som ÃĪr anpassade till prompten. FÃķr att ytterligare fÃķrbÃĪttra text-alignmenten av de genererade resultaten, implementerar HD-Painter-ramverket en post-hoc-vÃĪgledningsmetod som utnyttjar cross-attention-skÃķr. Men implementeringen av den vanliga post-hoc-vÃĪgledningsmekanismen kan orsaka utomfÃķrdelning av latenta skift som ett resultat av den extra gradienttermen i diffusions ekvationen. UtomfÃķrdelning av latenta skift kommer slutligen att resultera i en fÃķrsÃĪmring av kvaliteten pÃĨ den genererade utmatningen. FÃķr att tackla detta hinder, implementerar HD-Painter-ramverket Reweighting Attention Score Guidance eller RASG, en metod som integrerar en post-hoc-provtagningstrategi i den allmÃĪnna formen av DDIM-komponenten sÃķmlÃķst. Det mÃķjliggÃķr ramverket att generera visuellt trovÃĪrdiga inpainting-resultat genom att vÃĪgleda provet mot prompt-anpassade latenter och innehÃĨlla dem i deras trÃĪnade domÃĪn.
Genom att distribuera bÃĨde RASH- och PAIntA-komponenterna i sin arkitektur, har HD-Painter-ramverket en betydande fÃķrdel gentemot existerande, inklusive state-of-the-art, inpainting- och text-till-bild-diffusionsmodeller, eftersom det lyckas lÃķsa det existerande problemet med prompt-fÃķrsummelse. Dessutom erbjuder bÃĨde RASH- och PAIntA-komponenterna plug-and-play-funktionalitet, vilket gÃķr dem kompatibla med diffusionsbaserade inpainting-modeller fÃķr att tackla de utmaningar som nÃĪmns ovan. Dessutom, genom att implementera en tid-iterativ blandningsteknik och genom att utnyttja fÃķrmÃĨgorna hos hÃķgupplÃķsta diffusionsmodeller, kan HD-Painter-pipelinen fungera effektivt fÃķr upp till 2K-upplÃķsning inpainting.
FÃķr att sammanfatta, syftar HD-Painter till att gÃķra fÃķljande bidrag inom omrÃĨdet:
- Det syftar till att lÃķsa problemet med prompt-fÃķrsummelse av bakgrunden och nÃĪrliggande objektdominans som upplevs av text-guidade bildinpainting-ramverk genom att implementera Prompt Aware Introverted Attention eller PAIntA-lagret i sin arkitektur.
- Det syftar till att fÃķrbÃĪttra text-alignmenten av utmatningen genom att implementera Reweighting Attention Score Guidance eller RASG-lagret i sin arkitektur, vilket mÃķjliggÃķr HD-Painter-ramverket att utfÃķra post-hoc-vÃĪgled provtagning samtidigt som det fÃķrhindrar utomfÃķrdelning av latenta skift.
- Det syftar till att utforma en effektiv utbildningsfri text-guidad bildkompletteringspipeline som kan ÃķvertrÃĪffa de existerande state-of-the-art-ramverken, och som anvÃĪnder den enkla men effektiva inpainting-specialiserade superupplÃķsningstekniken fÃķr att utfÃķra text-guidad bildinpainting upp till 2K-upplÃķsning.
HD-Painter: Metod och Arkitektur
Innan vi tittar pÃĨ arkitekturen, ÃĪr det viktigt att fÃķrstÃĨ de tre grundlÃĪggande koncepten som utgÃķr grunden fÃķr HD-Painter-ramverket: Bildinpainting, Post-Hoc-VÃĪgledning i Diffusionsramverk och Inpainting-Specifika Arkitekturblock.
Bildinpainting ÃĪr en metod som syftar till att fylla i de saknade regionerna inom en bild samtidigt som den sÃĪkerstÃĪller den visuella tilltalandheten hos den genererade bilden. Traditionella djupinlÃĪrningsramverk implementerade metoder som anvÃĪnde kÃĪnda regioner fÃķr att propagera djupa funktioner. Men infÃķrandet av diffusionsmodeller har resulterat i utvecklingen av inpainting-modeller, sÃĪrskilt text-guidade bildinpainting-ramverk. Traditionellt ersÃĪtter en fÃķrutbildad text-till-bild-diffusionsmodell den omaskerade regionen av latensen med hjÃĪlp av den brusiga versionen av den kÃĪnda regionen under provtagningen. Ãven om denna metod fungerar till viss del, fÃķrsÃĪmrar den kvaliteten pÃĨ den genererade utmatningen avsevÃĪrt, eftersom den avbullrande nÃĪtverket bara ser den brusiga versionen av den kÃĪnda regionen. FÃķr att tackla detta hinder, har vissa metoder syftat till att finjustera den fÃķrutbildade text-till-bild-modellen fÃķr att uppnÃĨ text-guidad bildinpainting. Genom att implementera denna metod, kan ramverket generera en slumpmÃĪssig mask via konkatenering, eftersom modellen kan villkora den avbullrande ramen pÃĨ den omaskerade regionen.
Vidare, har traditionella djupinlÃĪrningsmodeller implementerat specialdesignade lager fÃķr effektiv inpainting, med vissa ramverk som kan extrahera information effektivt och producera visuellt tilltalande bilder genom att infÃķra specialkonvolutionslager fÃķr att hantera de kÃĪnda regionerna av bilden. Vissa ramverk har till och med lagt till en kontextuell uppmÃĪrksamhetslag i sin arkitektur fÃķr att reducera de oÃķnskade tunga berÃĪkningskraven fÃķr all-till-all-sjÃĪlvuppmÃĪrksamhet fÃķr hÃķgkvalitativ inpainting.
Slutligen, ÃĪr post-hoc-vÃĪgledningsmetoder bakÃĨtriktade diffusionsprovtagningar som vÃĪgleder den fÃķljande latenta prediktionen mot en specifik funktionminimeringsobjekt. Post-hoc-vÃĪgledningsmetoder ÃĪr av stor hjÃĪlp nÃĪr det gÃĪller att generera visuellt innehÃĨll, sÃĪrskilt i nÃĪrvaro av ytterligare begrÃĪnsningar. Men post-hoc-vÃĪgledningsmetoder har en betydande nackdel: de kan orsaka fÃķrsÃĪmring av bildkvaliteten, eftersom de tenderar att skifta den latenta genereringsprocessen med en gradientterm.
Kommande till arkitekturen av HD-Painter, formulerar ramverket fÃķrst text-guidad bildkompletteringsproblemet och introducerar sedan tvÃĨ diffusionsmodeller, nÃĪmligen Stable Inpainting och Stable Diffusion. HD-Painter-modellen introducerar sedan PAIntA- och RASG-blocken och slutligen anlÃĪnder vi till inpainting-specifik superupplÃķsningsteknik.
Stable Diffusion och Stable Inpainting
Stable Diffusion ÃĪr en diffusionsmodell som opererar inom latensrummet av en autoencoder. FÃķr text-till-bild-syntes, implementerar Stable Diffusion-ramverket en textuell prompt fÃķr att vÃĪgleda processen. Den vÃĪgledande funktionen har en struktur som liknar UNet-arkitekturen, och cross-attention-lagren villkoras pÃĨ de textuella prompterna. Dessutom kan Stable Diffusion-modellen utfÃķra bildinpainting med vissa modifikationer och finjusteringar. FÃķr att uppnÃĨ detta, konkateneras funktionerna av den maskerade bilden som genereras av encoder med den nedskalade binÃĪra masken till latensen. Den resulterande tensorn matas sedan in i UNet-arkitekturen fÃķr att erhÃĨlla den uppskattade bruset. Ramverket initierar sedan de nytillagda konvolutionsfilterna med nollor, medan resten av UNet initieras med fÃķrutbildade kontrollpunkter frÃĨn Stable Diffusion-modellen.

OvanstÃĨende figur visar en Ãķversikt av HD-Painter-ramverket, som bestÃĨr av tvÃĨ stadier. I det fÃķrsta stadiet, implementerar HD-Painter-ramverket text-guidad bildmÃĨlning, medan det i det andra stadiet mÃĨlar specifika superupplÃķsningar av utmatningen. FÃķr att fylla i de saknade regionerna och fÃķr att vara konsekvent med ingÃĨngsprompten, tar modellen en fÃķrutbildad inpainting-diffusionsmodell, ersÃĪtter sjÃĪlvuppmÃĪrksamhetslagren med PAIntA-lager och implementerar RASG-mekanismen fÃķr att utfÃķra en bakÃĨtriktad diffusionsprocess. Modellen avkodar sedan den slutliga uppskattade latensen, vilket resulterar i en inmÃĨlad bild. HD-Painter implementerar sedan den superstabila diffusionsmodellen fÃķr att mÃĨla den ursprungliga storleken pÃĨ bilden och implementerar diffusionsbakprocessen av Stable Diffusion-ramverket, villkorad pÃĨ den lÃĨgupplÃķsta ingÃĨngsbilden. Modellen blandar den avbullrade prediktionen med den ursprungliga bildens kodning efter varje steg i den kÃĪnda regionen och erhÃĨller den fÃķljande latensen. Slutligen avkodar modellen latensen och implementerar Poisson-blandning fÃķr att undvika kanter.
Prompt Aware Introverted Attention eller PAIntA
Existerande inpainting-modeller som Stable Inpainting tenderar att lita mer pÃĨ den visuella kontexten runt inpainting-omrÃĨdet och ignorera den ingÃĨngsprompten. Baserat pÃĨ anvÃĪndarupplevelsen, kan detta problem delas in i tvÃĨ klasser: nÃĪrliggande objektdominans och bakgrundsdominans. Problemet med visuell kontextdominans Ãķver ingÃĨngsprompten kan vara ett resultat av den endast-spatiala och prompt-fria naturen hos sjÃĪlvuppmÃĪrksamhetslagren. FÃķr att tackla detta problem, introducerar HD-Painter-ramverket Prompt Aware Introverted Attention eller PAIntA, som anvÃĪnder cross-attention-matriser och en inpainting-mask fÃķr att kontrollera utmatningen av sjÃĪlvuppmÃĪrksamhetslagren i den okÃĪnda regionen.
Prompt Aware Introverted Attention-komponenten tillÃĪmpar fÃķrst projiceringsskikt fÃķr att erhÃĨlla nycklar, vÃĪrden och frÃĨgor, tillsammans med likhetsmatrisen. Modellen justerar sedan uppmÃĪrksamhetsskÃķr fÃķr de kÃĪnda pixlarna fÃķr att mildra den starka pÃĨverkan av den kÃĪnda regionen Ãķver den okÃĪnda regionen och definierar en ny likhetsmatris genom att utnyttja den textuella prompten.

Reweighting Attention Score Guidance eller RASG
HD-Painter-ramverket antar en post-hoc-provtagningstrategi fÃķr att ytterligare fÃķrbÃĪttra genereringsalignmenten med de textuella prompterna. Tillsammans med ett objektfunktion, syftar post-hoc-provtagningstrategin till att utnyttja de Ãķppna-vokabulÃĪra segmenteringsEGenskaperna hos cross-attention-lagren. Men denna metod med vanlig post-hoc-vÃĪgledning har potentialen att skifta domÃĪnen fÃķr diffusionslatent, vilket kan fÃķrsÃĪmra kvaliteten pÃĨ den genererade bilden. FÃķr att tackla detta problem, implementerar HD-Painter-modellen Reweighting Attention Score Guidance eller RASG-mekanismen, som introducerar en gradient-omviktning som resulterar i bevarande av latentdomÃĪn.
HD-Painter: Experiment och Resultat
FÃķr att analysera dess prestanda, jÃĪmfÃķrs HD-Painter-ramverket med nuvarande state-of-the-art-modeller, inklusive Stable Inpainting, GLIDE och BLD eller Blended Latent Diffusion, Ãķver 10000 slumpmÃĪssiga prover, dÃĪr prompten vÃĪljs som etiketten fÃķr den valda instansmasken.

Som det kan observeras, ÃķvertrÃĪffar HD-Painter-ramverket existerande ramverk pÃĨ tre olika metriker med en betydande marginal, sÃĪrskilt fÃķrbÃĪttringen av 1,5 poÃĪng pÃĨ CLIP-mÃĪtningen och skillnaden i genererad noggrannhetsskÃķr pÃĨ cirka 10% frÃĨn andra state-of-the-art-metoder.

Vidare, visar fÃķljande figur en kvalitativ jÃĪmfÃķrelse av HD-Painter-ramverket med andra inpainting-ramverk. Som det kan observeras, ÃĨterstÃĪller andra baslinje-modeller antingen de saknade regionerna i bilden som en fortsÃĪttning av de kÃĪnda regionernas fÃķremÃĨl, ignorerande prompten, eller genererar en bakgrund. Ã andra sidan, kan HD-Painter-ramverket generera mÃĨlfÃķremÃĨlen framgÃĨngsrikt tack vare implementeringen av PAIntA- och RASG-komponenterna i sin arkitektur.

Slutliga Tankar
I denna artikel, har vi talat om HD-Painter, en utbildningsfri text-guidad hÃķgupplÃķsningsinpainting-metod som tacklar utmaningarna som upplevs av existerande inpainting-ramverk, inklusive prompt-fÃķrsummelse och nÃĪrliggande objektdominans. HD-Painter-ramverket implementerar ett Prompt Aware Introverted Attention eller PAIntA-lager, som anvÃĪnder promptinformation fÃķr att fÃķrbÃĪttra sjÃĪlvuppmÃĪrksamhetsskÃķr, vilket resulterar i bÃĪttre textaligneringsgenerering.
FÃķr att ytterligare fÃķrbÃĪttra sammanhÃĪngningen i prompten, introducerar HD-Painter-modellen en Reweighting Attention Score Guidance eller RASG-ansats, som integrerar en post-hoc-provtagningstrategi i den allmÃĪnna formen av DDIM-komponenten sÃķmlÃķst, fÃķr att fÃķrhindra utomfÃķrdelning av latenta skift. Dessutom introducerar HD-Painter-ramverket en specialiserad superupplÃķsningsteknik som ÃĪr anpassad fÃķr inpainting, vilket mÃķjliggÃķr utvidgning till stÃķrre skalor och tillÃĨter HD-Painter-ramverket att slutfÃķra de saknade regionerna i bilden med upplÃķsningar upp till 2K.












