AI-modeller og platforme

HD-Painter: HÃļjoplÃļselig tekst-guidet billed-indmalning med diffusionsmodeller

mm
FÃļj Unite.AI til dine foretrukne kilder pÃĨ Google

Diffusionsmodeller har uden tvivl revolutioneret AI- og ML-industrien, med deres anvendelser i realtid blevet en integreret del af vores daglige liv. Efter tekst-til-billede-modeller viste deres bemÃĶrkelsesvÃĶrdige evner, opstod diffusionsbaserede billedmanipulationsteknikker, sÃĨsom kontrollerbar generering, specialiseret og personlig billedsynthese, objekt-niveau billedredigering, prompt-betingede variationer og redigering, som varme forskningsemner pÃĨ grund af deres anvendelser i computer vision-industrien.

Men pÃĨ trods af deres imponerende evner og exceptionelle resultater, tekst-til-billede-rammer, sÃĶrligt tekst-til-billede-indmalningsrammer, har stadig potentiale til udvikling. Disse omfatter evnen til at forstÃĨ globale scener, isÃĶr nÃĨr stÃļjen af billedet i hÃļj diffusions-tidssteg. For at lÃļse dette problem, introducerede forskere HD-Painter, en fuldstÃĶndig trÃĶningsfri ramme, der nÃļjagtigt fÃļlger prompt-instruktioner og skalerer til hÃļjoplÃļselig billed-indmalning sammenhÃĶngende. HD-Painter-rammen anvender en Prompt Aware Introverted Attention (PAIntA)-lag, der udnytter prompt-information til at forbedre selv-attention-scores, hvilket resulterer i bedre tekst-alignment-generering.

For at yderligere forbedre sammenhÃĶngen af prompten, introducerer HD-Painter-modellen en Reweighting Attention Score Guidance (RASG)-tilgang. Denne tilgang integrerer en post-hoc-sampling-strategi i den generelle form af DDIM-komponenten sammenhÃĶngende, og forhindrer ud af distributions-latent-skift. Derudover har HD-Painter-rammen en specialiseret super-resolution-teknik, der er tilpasset billed-indmalning, og som tillader rammen at udvide til stÃļrre skalaer og fuldfÃļre manglende regioner i billedet med oplÃļsninger op til 2K.

HD-Painter: Tekst-guidet billed-indmalning

Tekst-til-billede-diffusionsmodeller har virkelig vÃĶret et betydeligt emne i AI- og ML-industrien i de seneste mÃĨneder, med modeller, der demonstrerer imponerende realtids-kapaciteter pÃĨ tvÃĶrs af forskellige praktiske anvendelser. ForudtrÃĶnede tekst-til-billede-genereringsmodeller som DALL-E, Imagen og Stable Diffusion har vist deres egnethed til billedfuldendelse ved at sammenfÃļje afstÃļvede (genererede) ukendte regioner med diffusede kendte regioner under den bakwards diffusionsproces. Trods at de producerer visuelt tiltalende og vel-harmoniserede output, kÃĶmper eksisterende modeller med at forstÃĨ den globale scene, sÃĶrligt under den hÃļje diffusions-tidssteg-afstÃļvningproces. Ved at modificere forudtrÃĶnede tekst-til-billede-diffusionsmodeller til at inkorporere yderligere kontekst-information, kan de tilpasse sig til tekst-guidet billedfuldendelse.

Desuden er tekst-guidet billed-indmalning og tekst-guidet billedfuldendelse vigtige omrÃĨder for forskere. Dette interesse er drevet af det faktum, at tekst-guidet billed-indmalningsmodeller kan generere indhold i bestemte regioner af et input-billede baseret pÃĨ tekstuelle prompter, hvilket fÃļrer til potentielle anvendelser sÃĨsom retouchering af bestemte billedregioner, modificering af subjekt-egenskaber som farver eller tÃļj, og tilfÃļjelse eller erstatning af objekter. For at sammenfatte, har tekst-til-billede-diffusionsmodeller nylig opnÃĨet uhÃļrt succes pÃĨ grund af deres exceptionelt realistiske og visuelt tiltalende genereringskapaciteter.

Men en majoritet af eksisterende rammer demonstrerer prompt-neglekt i to scenarier. Det fÃļrste er Baggrundsdominans, nÃĨr modellen fuldfÃļrer den ukendte region ved at ignorere prompten i baggrunden, mens det andet scenario er nÃĶr-objekt-dominans, nÃĨr modellen propagerer kendte region-objekter til den ukendte region ved hjÃĶlp af visuel kontekst-lignings sandsynlighed snarere end input-prompten. Det er en mulighed, at begge disse problemer kan vÃĶre et resultat af, at diffusionsmodellernes evne til at fortolke den tekstuelle prompt nÃļjagtigt eller blande den med kontekst-informationen fra den kendte region.

For at lÃļse disse problemer, introducerer HD-Painter-rammen Prompt Aware Introverted Attention eller PAIntA-laget, der anvender prompt-information til at forbedre selv-attention-scores, hvilket resulterer i bedre tekst-alignment-generering. PAIntA anvender den givne tekstuelle betingelse til at forbedre selv-attention-scores med det formÃĨl at reducere indvirkningen af ikke-prompt-relevant information fra billedregionen, samtidig med at bidrage til kendte pixels, der er alignet med prompten. For at yderligere forbedre tekst-alignmenten af de genererede resultater, implementerer HD-Painter-rammen en post-hoc-guidance-metode, der udnytter cross-attention-scores. Men implementeringen af den oprindelige post-hoc-guidance-mekanisme kan fÃļre til ud af distributions-latent-skift som fÃļlge af den ekstra gradient-term i diffusionsligningen. Ud af distributions-skiftet vil til sidst resultere i en nedgang i kvaliteten af det genererede output. For at lÃļse dette problem, implementerer HD-Painter-rammen en Reweighting Attention Score Guidance eller RASG-mekanisme, der introducerer en gradient-vÃĶgtningsmekanisme, der resulterer i latent-domÃĶne-bevarelse.

Ved at implementere bÃĨde RASH- og PAIntA-komponenterne i sin arkitektur, har HD-Painter-rammen en betydelig fordel over eksisterende, herunder state-of-the-art, billed-indmalnings- og tekst-til-billede-diffusionsmodeller, da den lÃļser det eksisterende problem med prompt-neglekt. Desuden tilbyder bÃĨde RASH- og PAIntA-komponenterne plug-and-play-funktionalitet, der gÃļr dem kompatible med diffusionsbaserede billed-indmalningsmodeller til at lÃļse de nÃĶvnte udfordringer. Yderligere kan HD-Painter-pipelines operere effektivt for op til 2K-oplÃļsning-billed-indmalning ved at implementere en tids-iterativ blending-teknologi og ved at udnytte kapaciteterne af hÃļjoplÃļselige diffusionsmodeller.

For at sammenfatte, har HD-Painter til formÃĨl at bidrage til fÃļlgende i feltet:

  1. Det har til formÃĨl at lÃļse prompt-neglekt-problemet med baggrund og nÃĶr-objekt-dominans, der opleves af tekst-guidet billed-indmalningsrammer, ved at implementere Prompt Aware Introverted Attention eller PAIntA-laget i sin arkitektur.
  2. Det har til formÃĨl at forbedre tekst-alignmenten af outputtet ved at implementere Reweighting Attention Score Guidance eller RASG-laget i sin arkitektur, der tillader HD-Painter-rammen at udfÃļre post-hoc-guidet sampling, samtidig med at forhindre ud af distributions-latent-skift.
  3. Det har til formÃĨl at designe en effektiv trÃĶningsfri tekst-guidet billedfuldendelses-pipeline, der kan overgÃĨ eksisterende state-of-the-art-rammer, og ved at anvende en enkel, men effektiv billed-indmalnings-specialiseret super-resolution-ramme til at udfÃļre tekst-guidet billed-indmalning op til 2K-oplÃļsning.

HD-Painter: Metode og Arkitektur

FÃļr vi ser pÃĨ arkitekturen, er det vigtigt at forstÃĨ de tre grundlÃĶggende koncepter, der danner grundlaget for HD-Painter-rammen: Billed-indmalning, Post-Hoc-Guidance i Diffusionsrammer og Billed-indmalnings-specifikke Arkitektur-blokke.

Billed-indmalning er en tilgang, der sigter mod at udfylde manglende regioner i et billede, samtidig med at sikre det visuelle udtryk af det genererede billede. Traditionelle dyb-lÃĶrings-rammer implementerede metoder, der anvendte kendte regioner til at propagerer dybe funktioner. Men introduktionen af diffusionsmodeller har fÃļrt til udviklingen af billed-indmalningsmodeller, sÃĶrligt tekst-guidet billed-indmalningsrammer. Traditionelt erstatter en forudtrÃĶnet tekst-til-billede-diffusionsmodel den umaskerede region af latent ved at anvende den stÃļjede version af den kendte region under sampling-processen. Selvom denne tilgang virker til en vis udstrÃĶkning, degraderer den kvaliteten af det genererede output betydeligt, da den afstÃļvning-netvÃĶrk kun ser den stÃļjede version af den kendte region. For at lÃļse dette problem, har nogle tilgange forsÃļgt at tilpasse den forudtrÃĶnede tekst-til-billede-model til at opnÃĨ tekst-guidet billedfuldendelse.

Ved at gÃĨ videre, har traditionelle dyb-lÃĶrings-modeller implementeret speciel design-lag til effektiv billed-indmalning, og nogle rammer har kunnet trÃĶkke information effektivt og producere visuelt tiltalende billeder ved at introducere speciel konvolutions-lag til at hÃĨndtere kendte regioner af billedet. Nogle rammer har endda tilfÃļjet en kontekstuel attention-lag i deres arkitektur for at reducere de uÃļnskede tungt beregningskrÃĶvende krav til alle-til-alle-selv-attention for hÃļj-kvalitets-billed-indmalning.

Til sidst er post-hoc-guidance-metoder bakwards diffusions-sampling-metoder, der guider den nÃĶste latent-prÃĶdiktion mod en bestemt funktion-minimerings-objektiv. Post-hoc-guidance-metoder er af stor hjÃĶlp, nÃĨr det kommer til at generere visuelt indhold, isÃĶr i tilfÃĶlde af yderligere begrÃĶnsninger. Men post-hoc-guidance-metoder har en stor ulempe: de kan fÃļre til billed-kvalitets-degradering, da de tenderer til at skifte latent-genererings-processen med en gradient-term.

Komment til arkitekturen af HD-Painter, formulerer rammen fÃļrst tekst-guidet billedfuldendelses-problemet og introducerer derefter to diffusionsmodeller, nemlig Stable Inpainting og Stable Diffusion. HD-Painter-modellen introducerer derefter PAIntA- og RASG-blokke og til sidst billed-indmalnings-specifikke super-resolution-teknik.

Stable Diffusion og Stable Inpainting

Stable Diffusion er en diffusionsmodel, der opererer inden for latent-rummet af en autoencoder. Til tekst-til-billede-syntese implementerer Stable Diffusion-rammen en tekstuel prompt til at guide processen. Guiden har en struktur lignende UNet-arkitekturen, og cross-attention-lagene betinger den pÃĨ den tekstuelle prompt. Yderligere kan Stable Diffusion-modellen udfÃļre billed-indmalning med nogle modifikationer og tilpasning. For at opnÃĨ dette, kombineres funktionerne af den maskerede billede, der er genereret af encoderen, med den downscaled binÃĶre maske til latent. Den resulterende tensor indsÃĶttes derefter i UNet-arkitekturen for at opnÃĨ den estimerede stÃļj. Rammen initialiserer derefter de nyligt tilfÃļjede konvolutions-filtre med nul, mens resten af UNet initialiseres ved hjÃĶlp af forudtrÃĶnede checkpoints fra Stable Diffusion-modellen.

Figuren ovenfor viser oversigten over HD-Painter-rammen, der bestÃĨr af to stadier. I det fÃļrste stadium implementerer HD-Painter-rammen tekst-guidet billed-maling, mens det andet stadium udfÃļrer specifik super-resolution af outputtet. For at udfylde manglende regioner og for at vÃĶre konsistent med input-prompten, tager modellen en forudtrÃĶnet billed-indmalnings-diffusionsmodel, erstatter selv-attention-lagene med PAIntA-lag og implementerer RASG-mekanismen for at udfÃļre en bakwards diffusions-proces. Modellen dekoder derefter den endelige estimerede latent, hvilket resulterer i et indmalet billede. HD-Painter implementerer derefter den super-stabile diffusionsmodel til at udfylde det originale billed-stÃļrrelse, og implementerer diffusions-bagwards-processen af Stable Diffusion-rammen betinget pÃĨ det lavt oplÃļste input-billede. Modellen blander de afstÃļvede forudsigelser med den originale billed-kodning efter hvert trin i den kendte region og afleder den nÃĶste latent. Til sidst dekoder modellen latent og implementerer Poisson-blending for at undgÃĨ kant-artefakter.

Prompt Aware Introverted Attention eller PAIntA

Eksisterende billed-indmalningsmodeller som Stable Inpainting tenderer til at afhÃĶnge mere af den visuelle kontekst omkring billed-indmalnings-omrÃĨdet og ignorere den input-bruger-prompt. PÃĨ baggrund af bruger-oplevelsen kan dette problem kategoriseres i to klasser: nÃĶr-objekt-dominans og baggrund-dominans. Problemet med visuel kontekst-dominans over input-prompten kan vÃĶre et resultat af, at selv-attention-lagene kun er rumlige og prompt-frie. For at lÃļse dette problem, introducerer HD-Painter-rammen Prompt Aware Introverted Attention eller PAIntA, der anvender cross-attention-matricer og en billed-indmalnings-maske til at kontrollere outputtet af selv-attention-lagene i den ukendte region.

Prompt Aware Introverted Attention-komponenten anvender fÃļrst projektions-lag til at fÃĨ nÃļgle, vÃĶrdier og forespÃļrgsler samt lignings-matrixen. Modellen justerer derefter attention-scores af kendte pixels for at minimere den stÃĶrke indvirkning af den kendte region over den ukendte region, og definerer en ny lignings-matrix ved at udnytte den tekstuelle prompt.

Reweighting Attention Score Guidance eller RASG

HD-Painter-rammen adopterer en post-hoc-sampling-guidance-metode til at forbedre genererings-alignment med den tekstuelle prompt yderligere. Sammen med et objekt-funktions-formÃĨl, sigter post-hoc-sampling-guidance-tilgangen til at udnytte ÃĨben-vokabular-segmenterings-egenskaberne af cross-attention-lagene. Men denne tilgang af oprindelig post-hoc-guidance har potentialet til at skifte latent-domÃĶnet af diffusions-latent, hvilket kan degradere kvaliteten af det genererede billede. For at lÃļse dette problem, implementerer HD-Painter-modellen Reweighting Attention Score Guidance eller RASG-mekanismen, der introducerer en gradient-vÃĶgtnings-mekanisme, der resulterer i latent-domÃĶne-bevarelse.

HD-Painter: Eksperimenter og Resultater

For at analysere dens prÃĶstation, sammenlignes HD-Painter-rammen med nuvÃĶrende state-of-the-art-modeller, herunder Stable Inpainting, GLIDE og BLD eller Blended Latent Diffusion over 10000 tilfÃĶldige prÃļver, hvor prompten er valgt som mÃĶrket pÃĨ den valgte instans-maske.

Som det kan observeres, overgÃĨr HD-Painter-rammen eksisterende rammer pÃĨ tre forskellige metrikker med en betydelig margin, isÃĶr forbedringen af 1,5 point pÃĨ CLIP-metrikken og forskellen i genereret nÃļjagtighed-score pÃĨ omkring 10% fra andre state-of-the-art-metoder.

Ved at gÃĨ videre, viser fÃļlgende figur den kvalitative sammenligning af HD-Painter-rammen med andre billed-indmalnings-rammer. Som det kan observeres, genskaber andre baseline-modeller enten manglende regioner i billedet som en fortsÃĶttelse af kendte region-objekter, uden at tage hensyn til prompten, eller de genererer en baggrund. PÃĨ den anden side kan HD-Painter-rammen generere mÃĨl-objekterne med succes takket vÃĶre implementeringen af PAIntA- og RASG-komponenterne i sin arkitektur.

Afsluttende tanker

I denne artikel har vi talt om HD-Painter, en trÃĶningsfri tekst-guidet hÃļjoplÃļselig billed-indmalnings-tilgang, der lÃļser udfordringerne, der opleves af eksisterende billed-indmalnings-rammer, herunder prompt-neglekt og nÃĶr-objekt-dominans. HD-Painter-rammen implementerer en Prompt Aware Introverted Attention eller PAIntA-lag, der anvender prompt-information til at forbedre selv-attention-scores, hvilket resulterer i bedre tekst-alignment-generering.

For at yderligere forbedre sammenhÃĶngen af prompten, introducerer HD-Painter-modellen en Reweighting Attention Score Guidance eller RASG-tilgang, der integrerer en post-hoc-sampling-strategi i den generelle form af DDIM-komponenten sammenhÃĶngende for at forhindre ud af distributions-latent-skift. Yderligere introducerer HD-Painter-rammen en specialiseret super-resolution-teknik, der er tilpasset billed-indmalning, og som tillader rammen at udvide til stÃļrre skalaer og fuldfÃļre manglende regioner i billedet med oplÃļsninger op til 2K.

En ingeniÃļr af profession, en forfatter af hjerte. Kunal er en teknisk forfatter med en dyb kÃĶrlighed og forstÃĨelse af AI og ML, dedikeret til at forenkle komplekse koncepter inden for disse felter gennem sin engagerende og informative dokumentation.