AI-modeller och plattformar

HD-Painter: Text-Guided Image Inpainting med Hög Upplösning med Diffusionsmodeller

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Diffusionsmodeller har utan tvekan revolutionerat AI- och ML-industrin, med tillämpningar i realtid som har blivit en integrerad del av våra dagliga liv. Efter att text-till-bild-modeller visat sin anmärkningsvärda förmåga, har diffusionsbaserade bildmanipulationstekniker, såsom kontrollerad generering, specialiserad och personlig bildsyntes, objektnivåbildredigering, prompt-villkorad variation och redigering, dykt upp som heta forskningsteman på grund av deras tillämpningar inom datorseendeindustrin.

Men trots deras imponerande förmågor och exceptionella resultat, har text-till-bild-ramverk, särskilt text-till-bild-inpainting-ramverk, fortfarande potential för utveckling. Dessa inkluderar förmågan att förstå globala scener, särskilt när man avbullrar bilden i höga diffusionssteg. För att tackla detta problem, introducerade forskare HD-Painter, ett helt utbildningsfritt ramverk som följer prompt-instruktioner exakt och skalar till högupplösta bildinpainting sammanhängande. HD-Painter-ramverket använder en Prompt Aware Introverted Attention (PAIntA)-lager, som utnyttjar promptinformation för att förbättra självuppmärksamhetsskör, vilket resulterar i bättre textaligneringsgenerering.

För att ytterligare förbättra sammanhängningen i prompten, introducerar HD-Painter-modellen en Reweighting Attention Score Guidance (RASG)-ansats. Denna ansats integrerar en post-hoc-provtagningstrategi i den allmänna formen av DDIM-komponenten sömlöst, vilket förhindrar utomfördelning av latenta skift. Dessutom har HD-Painter-ramverket en specialiserad superupplösningsteknik som är anpassad för inpainting, vilket möjliggör utvidgning till större skalor och tillåter HD-Painter-ramverket att slutföra de saknade regionerna i bilden med upplösningar upp till 2K.

HD-Painter: Text-Guided Image Inpainting

Text-till-bild-diffusionsmodeller har verkligen varit ett betydande ämne inom AI- och ML-industrin under de senaste månaderna, med modeller som visat imponerande förmågor i realtid över olika praktiska tillämpningar. Förutbildade text-till-bild-genereringsmodeller som DALL-E, Imagen och Stable Diffusion har visat sin lämplighet för bildkomplettering genom att kombinera avbullrade (genererade) okända regioner med diffunderade kända regioner under den bakåtriktade diffusionsprocessen. Trots att de producerar visuellt tilltalande och välharmoniserade utdata, kämpar existerande modeller för att förstå den globala scenen, särskilt under den höga diffusionssteget avbullringsprocessen. Genom att modifiera förutbildade text-till-bild-diffusionsmodeller för att inkorporera ytterligare kontextinformation, kan de finjusteras för text-guidad bildkomplettering.

Förutom det, är text-guidad inpainting och text-guidad bildkomplettering viktiga områden av intresse för forskare. Detta intresse drivs av det faktum att text-guidade inpainting-modeller kan generera innehåll i specifika regioner av en ingångsbild baserat på textprompt, vilket leder till potentiella tillämpningar såsom retuschering av specifika bildregioner, modifiering av subjektsattribut som färger eller kläder och tillägg eller ersättning av föremål. Sammanfattningsvis har text-till-bild-diffusionsmodeller nyligen uppnått en utanför jämförelse framgång, tack vare deras exceptionellt realistiska och visuellt tilltalande genereringsförmåga.

Men en majoritet av existerande ramverk visar prompt-försummelse i två scenarier. Det första är Bakgrundsdominans när modellen slutför den okända regionen genom att ignorera prompten i bakgrunden, medan det andra scenariot är närliggande objektdominans när modellen propagerar de kända regionernas föremål till den okända regionen med hjälp av visuell kontextsannolikhet snarare än den ingångsprompten. Det är möjligt att båda dessa problem kan vara ett resultat av den vanliga inpainting-diffusions förmåga att tolka den textprompten korrekt eller blanda den med den kontextinformation som erhålls från den kända regionen.

För att tackla dessa hinder, introducerar HD-Painter-ramverket Prompt Aware Introverted Attention eller PAIntA-lagret, som använder promptinformation för att förbättra självuppmärksamhetsskör, vilket resulterar i bättre textaligneringsgenerering. PAIntA använder den givna textuella villkoret för att förbättra självuppmärksamhet med målet att reducera påverkan av icke-prompt-relevant information från bildregionen, samtidigt som man ökar bidraget från de kända pixlarna som är anpassade till prompten. För att ytterligare förbättra text-alignmenten av de genererade resultaten, implementerar HD-Painter-ramverket en post-hoc-vägledningsmetod som utnyttjar cross-attention-skör. Men implementeringen av den vanliga post-hoc-vägledningsmekanismen kan orsaka utomfördelning av latenta skift som ett resultat av den extra gradienttermen i diffusions ekvationen. Utomfördelning av latenta skift kommer slutligen att resultera i en försämring av kvaliteten på den genererade utmatningen. För att tackla detta hinder, implementerar HD-Painter-ramverket Reweighting Attention Score Guidance eller RASG, en metod som integrerar en post-hoc-provtagningstrategi i den allmänna formen av DDIM-komponenten sömlöst. Det möjliggör ramverket att generera visuellt trovärdiga inpainting-resultat genom att vägleda provet mot prompt-anpassade latenter och innehålla dem i deras tränade domän.

Genom att distribuera både RASH- och PAIntA-komponenterna i sin arkitektur, har HD-Painter-ramverket en betydande fördel gentemot existerande, inklusive state-of-the-art, inpainting- och text-till-bild-diffusionsmodeller, eftersom det lyckas lösa det existerande problemet med prompt-försummelse. Dessutom erbjuder både RASH- och PAIntA-komponenterna plug-and-play-funktionalitet, vilket gör dem kompatibla med diffusionsbaserade inpainting-modeller för att tackla de utmaningar som nämns ovan. Dessutom, genom att implementera en tid-iterativ blandningsteknik och genom att utnyttja förmågorna hos högupplösta diffusionsmodeller, kan HD-Painter-pipelinen fungera effektivt för upp till 2K-upplösning inpainting.

För att sammanfatta, syftar HD-Painter till att göra följande bidrag inom området:

  1. Det syftar till att lösa problemet med prompt-försummelse av bakgrunden och närliggande objektdominans som upplevs av text-guidade bildinpainting-ramverk genom att implementera Prompt Aware Introverted Attention eller PAIntA-lagret i sin arkitektur.
  2. Det syftar till att förbättra text-alignmenten av utmatningen genom att implementera Reweighting Attention Score Guidance eller RASG-lagret i sin arkitektur, vilket möjliggör HD-Painter-ramverket att utföra post-hoc-vägled provtagning samtidigt som det förhindrar utomfördelning av latenta skift.
  3. Det syftar till att utforma en effektiv utbildningsfri text-guidad bildkompletteringspipeline som kan överträffa de existerande state-of-the-art-ramverken, och som använder den enkla men effektiva inpainting-specialiserade superupplösningstekniken för att utföra text-guidad bildinpainting upp till 2K-upplösning.

HD-Painter: Metod och Arkitektur

Innan vi tittar på arkitekturen, är det viktigt att förstå de tre grundläggande koncepten som utgör grunden för HD-Painter-ramverket: Bildinpainting, Post-Hoc-Vägledning i Diffusionsramverk och Inpainting-Specifika Arkitekturblock.

Bildinpainting är en metod som syftar till att fylla i de saknade regionerna inom en bild samtidigt som den säkerställer den visuella tilltalandheten hos den genererade bilden. Traditionella djupinlärningsramverk implementerade metoder som använde kända regioner för att propagera djupa funktioner. Men införandet av diffusionsmodeller har resulterat i utvecklingen av inpainting-modeller, särskilt text-guidade bildinpainting-ramverk. Traditionellt ersätter en förutbildad text-till-bild-diffusionsmodell den omaskerade regionen av latensen med hjälp av den brusiga versionen av den kända regionen under provtagningen. Även om denna metod fungerar till viss del, försämrar den kvaliteten på den genererade utmatningen avsevärt, eftersom den avbullrande nätverket bara ser den brusiga versionen av den kända regionen. För att tackla detta hinder, har vissa metoder syftat till att finjustera den förutbildade text-till-bild-modellen för att uppnå text-guidad bildinpainting. Genom att implementera denna metod, kan ramverket generera en slumpmässig mask via konkatenering, eftersom modellen kan villkora den avbullrande ramen på den omaskerade regionen.

Vidare, har traditionella djupinlärningsmodeller implementerat specialdesignade lager för effektiv inpainting, med vissa ramverk som kan extrahera information effektivt och producera visuellt tilltalande bilder genom att införa specialkonvolutionslager för att hantera de kända regionerna av bilden. Vissa ramverk har till och med lagt till en kontextuell uppmärksamhetslag i sin arkitektur för att reducera de oönskade tunga beräkningskraven för all-till-all-självuppmärksamhet för högkvalitativ inpainting.

Slutligen, är post-hoc-vägledningsmetoder bakåtriktade diffusionsprovtagningar som vägleder den följande latenta prediktionen mot en specifik funktionminimeringsobjekt. Post-hoc-vägledningsmetoder är av stor hjälp när det gäller att generera visuellt innehåll, särskilt i närvaro av ytterligare begränsningar. Men post-hoc-vägledningsmetoder har en betydande nackdel: de kan orsaka försämring av bildkvaliteten, eftersom de tenderar att skifta den latenta genereringsprocessen med en gradientterm.

Kommande till arkitekturen av HD-Painter, formulerar ramverket först text-guidad bildkompletteringsproblemet och introducerar sedan två diffusionsmodeller, nämligen Stable Inpainting och Stable Diffusion. HD-Painter-modellen introducerar sedan PAIntA- och RASG-blocken och slutligen anländer vi till inpainting-specifik superupplösningsteknik.

Stable Diffusion och Stable Inpainting

Stable Diffusion är en diffusionsmodell som opererar inom latensrummet av en autoencoder. För text-till-bild-syntes, implementerar Stable Diffusion-ramverket en textuell prompt för att vägleda processen. Den vägledande funktionen har en struktur som liknar UNet-arkitekturen, och cross-attention-lagren villkoras på de textuella prompterna. Dessutom kan Stable Diffusion-modellen utföra bildinpainting med vissa modifikationer och finjusteringar. För att uppnå detta, konkateneras funktionerna av den maskerade bilden som genereras av encoder med den nedskalade binära masken till latensen. Den resulterande tensorn matas sedan in i UNet-arkitekturen för att erhålla den uppskattade bruset. Ramverket initierar sedan de nytillagda konvolutionsfilterna med nollor, medan resten av UNet initieras med förutbildade kontrollpunkter från Stable Diffusion-modellen.

Ovanstående figur visar en översikt av HD-Painter-ramverket, som består av två stadier. I det första stadiet, implementerar HD-Painter-ramverket text-guidad bildmålning, medan det i det andra stadiet målar specifika superupplösningar av utmatningen. För att fylla i de saknade regionerna och för att vara konsekvent med ingångsprompten, tar modellen en förutbildad inpainting-diffusionsmodell, ersätter självuppmärksamhetslagren med PAIntA-lager och implementerar RASG-mekanismen för att utföra en bakåtriktad diffusionsprocess. Modellen avkodar sedan den slutliga uppskattade latensen, vilket resulterar i en inmålad bild. HD-Painter implementerar sedan den superstabila diffusionsmodellen för att måla den ursprungliga storleken på bilden och implementerar diffusionsbakprocessen av Stable Diffusion-ramverket, villkorad på den lågupplösta ingångsbilden. Modellen blandar den avbullrade prediktionen med den ursprungliga bildens kodning efter varje steg i den kända regionen och erhåller den följande latensen. Slutligen avkodar modellen latensen och implementerar Poisson-blandning för att undvika kanter.

Prompt Aware Introverted Attention eller PAIntA

Existerande inpainting-modeller som Stable Inpainting tenderar att lita mer på den visuella kontexten runt inpainting-området och ignorera den ingångsprompten. Baserat på användarupplevelsen, kan detta problem delas in i två klasser: närliggande objektdominans och bakgrundsdominans. Problemet med visuell kontextdominans över ingångsprompten kan vara ett resultat av den endast-spatiala och prompt-fria naturen hos självuppmärksamhetslagren. För att tackla detta problem, introducerar HD-Painter-ramverket Prompt Aware Introverted Attention eller PAIntA, som använder cross-attention-matriser och en inpainting-mask för att kontrollera utmatningen av självuppmärksamhetslagren i den okända regionen.

Prompt Aware Introverted Attention-komponenten tillämpar först projiceringsskikt för att erhålla nycklar, värden och frågor, tillsammans med likhetsmatrisen. Modellen justerar sedan uppmärksamhetsskör för de kända pixlarna för att mildra den starka påverkan av den kända regionen över den okända regionen och definierar en ny likhetsmatris genom att utnyttja den textuella prompten.

Reweighting Attention Score Guidance eller RASG

HD-Painter-ramverket antar en post-hoc-provtagningstrategi för att ytterligare förbättra genereringsalignmenten med de textuella prompterna. Tillsammans med ett objektfunktion, syftar post-hoc-provtagningstrategin till att utnyttja de öppna-vokabulära segmenteringsEGenskaperna hos cross-attention-lagren. Men denna metod med vanlig post-hoc-vägledning har potentialen att skifta domänen för diffusionslatent, vilket kan försämra kvaliteten på den genererade bilden. För att tackla detta problem, implementerar HD-Painter-modellen Reweighting Attention Score Guidance eller RASG-mekanismen, som introducerar en gradient-omviktning som resulterar i bevarande av latentdomän.

HD-Painter: Experiment och Resultat

För att analysera dess prestanda, jämförs HD-Painter-ramverket med nuvarande state-of-the-art-modeller, inklusive Stable Inpainting, GLIDE och BLD eller Blended Latent Diffusion, över 10000 slumpmässiga prover, där prompten väljs som etiketten för den valda instansmasken.

Som det kan observeras, överträffar HD-Painter-ramverket existerande ramverk på tre olika metriker med en betydande marginal, särskilt förbättringen av 1,5 poäng på CLIP-mätningen och skillnaden i genererad noggrannhetsskör på cirka 10% från andra state-of-the-art-metoder.

Vidare, visar följande figur en kvalitativ jämförelse av HD-Painter-ramverket med andra inpainting-ramverk. Som det kan observeras, återställer andra baslinje-modeller antingen de saknade regionerna i bilden som en fortsättning av de kända regionernas föremål, ignorerande prompten, eller genererar en bakgrund. Å andra sidan, kan HD-Painter-ramverket generera målföremålen framgångsrikt tack vare implementeringen av PAIntA- och RASG-komponenterna i sin arkitektur.

Slutliga Tankar

I denna artikel, har vi talat om HD-Painter, en utbildningsfri text-guidad högupplösningsinpainting-metod som tacklar utmaningarna som upplevs av existerande inpainting-ramverk, inklusive prompt-försummelse och närliggande objektdominans. HD-Painter-ramverket implementerar ett Prompt Aware Introverted Attention eller PAIntA-lager, som använder promptinformation för att förbättra självuppmärksamhetsskör, vilket resulterar i bättre textaligneringsgenerering.

För att ytterligare förbättra sammanhängningen i prompten, introducerar HD-Painter-modellen en Reweighting Attention Score Guidance eller RASG-ansats, som integrerar en post-hoc-provtagningstrategi i den allmänna formen av DDIM-komponenten sömlöst, för att förhindra utomfördelning av latenta skift. Dessutom introducerar HD-Painter-ramverket en specialiserad superupplösningsteknik som är anpassad för inpainting, vilket möjliggör utvidgning till större skalor och tillåter HD-Painter-ramverket att slutföra de saknade regionerna i bilden med upplösningar upp till 2K.

Kunal Kejriwal är en backend‑ingenjör som specialiserar sig på Python, PostgreSQL, Redis och molninfrastruktur på GCP och AWS. Med tre års erfarenhet av att bygga och skala produktionssystem skriver han om AI‑infrastruktur, distribuerade system och arkitekturen bakom distribution av maskininlärningsarbetsbelastningar.