AI-modeller og platforme

HD-Painter: Højopløselig tekst-guidet billed-indmalning med diffusionsmodeller

mm
Føj Unite.AI til dine foretrukne kilder på Google

Diffusionsmodeller har uden tvivl revolutioneret AI- og ML-industrien, med deres anvendelser i realtid blevet en integreret del af vores daglige liv. Efter tekst-til-billede-modeller viste deres bemærkelsesværdige evner, opstod diffusionsbaserede billedmanipulationsteknikker, såsom kontrollerbar generering, specialiseret og personlig billedsynthese, objekt-niveau billedredigering, prompt-betingede variationer og redigering, som varme forskningsemner på grund af deres anvendelser i computer vision-industrien.

Men på trods af deres imponerende evner og exceptionelle resultater, tekst-til-billede-rammer, særligt tekst-til-billede-indmalningsrammer, har stadig potentiale til udvikling. Disse omfatter evnen til at forstå globale scener, især når støjen af billedet i høj diffusions-tidssteg. For at løse dette problem, introducerede forskere HD-Painter, en fuldstændig træningsfri ramme, der nøjagtigt følger prompt-instruktioner og skalerer til højopløselig billed-indmalning sammenhængende. HD-Painter-rammen anvender en Prompt Aware Introverted Attention (PAIntA)-lag, der udnytter prompt-information til at forbedre selv-attention-scores, hvilket resulterer i bedre tekst-alignment-generering.

For at yderligere forbedre sammenhængen af prompten, introducerer HD-Painter-modellen en Reweighting Attention Score Guidance (RASG)-tilgang. Denne tilgang integrerer en post-hoc-sampling-strategi i den generelle form af DDIM-komponenten sammenhængende, og forhindrer ud af distributions-latent-skift. Derudover har HD-Painter-rammen en specialiseret super-resolution-teknik, der er tilpasset billed-indmalning, og som tillader rammen at udvide til større skalaer og fuldføre manglende regioner i billedet med opløsninger op til 2K.

HD-Painter: Tekst-guidet billed-indmalning

Tekst-til-billede-diffusionsmodeller har virkelig været et betydeligt emne i AI- og ML-industrien i de seneste måneder, med modeller, der demonstrerer imponerende realtids-kapaciteter på tværs af forskellige praktiske anvendelser. Forudtrænede tekst-til-billede-genereringsmodeller som DALL-E, Imagen og Stable Diffusion har vist deres egnethed til billedfuldendelse ved at sammenføje afstøvede (genererede) ukendte regioner med diffusede kendte regioner under den bakwards diffusionsproces. Trods at de producerer visuelt tiltalende og vel-harmoniserede output, kæmper eksisterende modeller med at forstå den globale scene, særligt under den høje diffusions-tidssteg-afstøvningproces. Ved at modificere forudtrænede tekst-til-billede-diffusionsmodeller til at inkorporere yderligere kontekst-information, kan de tilpasse sig til tekst-guidet billedfuldendelse.

Desuden er tekst-guidet billed-indmalning og tekst-guidet billedfuldendelse vigtige områder for forskere. Dette interesse er drevet af det faktum, at tekst-guidet billed-indmalningsmodeller kan generere indhold i bestemte regioner af et input-billede baseret på tekstuelle prompter, hvilket fører til potentielle anvendelser såsom retouchering af bestemte billedregioner, modificering af subjekt-egenskaber som farver eller tøj, og tilføjelse eller erstatning af objekter. For at sammenfatte, har tekst-til-billede-diffusionsmodeller nylig opnået uhørt succes på grund af deres exceptionelt realistiske og visuelt tiltalende genereringskapaciteter.

Men en majoritet af eksisterende rammer demonstrerer prompt-neglekt i to scenarier. Det første er Baggrundsdominans, når modellen fuldfører den ukendte region ved at ignorere prompten i baggrunden, mens det andet scenario er nær-objekt-dominans, når modellen propagerer kendte region-objekter til den ukendte region ved hjælp af visuel kontekst-lignings sandsynlighed snarere end input-prompten. Det er en mulighed, at begge disse problemer kan være et resultat af, at diffusionsmodellernes evne til at fortolke den tekstuelle prompt nøjagtigt eller blande den med kontekst-informationen fra den kendte region.

For at løse disse problemer, introducerer HD-Painter-rammen Prompt Aware Introverted Attention eller PAIntA-laget, der anvender prompt-information til at forbedre selv-attention-scores, hvilket resulterer i bedre tekst-alignment-generering. PAIntA anvender den givne tekstuelle betingelse til at forbedre selv-attention-scores med det formål at reducere indvirkningen af ikke-prompt-relevant information fra billedregionen, samtidig med at bidrage til kendte pixels, der er alignet med prompten. For at yderligere forbedre tekst-alignmenten af de genererede resultater, implementerer HD-Painter-rammen en post-hoc-guidance-metode, der udnytter cross-attention-scores. Men implementeringen af den oprindelige post-hoc-guidance-mekanisme kan føre til ud af distributions-latent-skift som følge af den ekstra gradient-term i diffusionsligningen. Ud af distributions-skiftet vil til sidst resultere i en nedgang i kvaliteten af det genererede output. For at løse dette problem, implementerer HD-Painter-rammen en Reweighting Attention Score Guidance eller RASG-mekanisme, der introducerer en gradient-vægtningsmekanisme, der resulterer i latent-domæne-bevarelse.

Ved at implementere både RASH- og PAIntA-komponenterne i sin arkitektur, har HD-Painter-rammen en betydelig fordel over eksisterende, herunder state-of-the-art, billed-indmalnings- og tekst-til-billede-diffusionsmodeller, da den løser det eksisterende problem med prompt-neglekt. Desuden tilbyder både RASH- og PAIntA-komponenterne plug-and-play-funktionalitet, der gør dem kompatible med diffusionsbaserede billed-indmalningsmodeller til at løse de nævnte udfordringer. Yderligere kan HD-Painter-pipelines operere effektivt for op til 2K-opløsning-billed-indmalning ved at implementere en tids-iterativ blending-teknologi og ved at udnytte kapaciteterne af højopløselige diffusionsmodeller.

For at sammenfatte, har HD-Painter til formål at bidrage til følgende i feltet:

  1. Det har til formål at løse prompt-neglekt-problemet med baggrund og nær-objekt-dominans, der opleves af tekst-guidet billed-indmalningsrammer, ved at implementere Prompt Aware Introverted Attention eller PAIntA-laget i sin arkitektur.
  2. Det har til formål at forbedre tekst-alignmenten af outputtet ved at implementere Reweighting Attention Score Guidance eller RASG-laget i sin arkitektur, der tillader HD-Painter-rammen at udføre post-hoc-guidet sampling, samtidig med at forhindre ud af distributions-latent-skift.
  3. Det har til formål at designe en effektiv træningsfri tekst-guidet billedfuldendelses-pipeline, der kan overgå eksisterende state-of-the-art-rammer, og ved at anvende en enkel, men effektiv billed-indmalnings-specialiseret super-resolution-ramme til at udføre tekst-guidet billed-indmalning op til 2K-opløsning.

HD-Painter: Metode og Arkitektur

Før vi ser på arkitekturen, er det vigtigt at forstå de tre grundlæggende koncepter, der danner grundlaget for HD-Painter-rammen: Billed-indmalning, Post-Hoc-Guidance i Diffusionsrammer og Billed-indmalnings-specifikke Arkitektur-blokke.

Billed-indmalning er en tilgang, der sigter mod at udfylde manglende regioner i et billede, samtidig med at sikre det visuelle udtryk af det genererede billede. Traditionelle dyb-lærings-rammer implementerede metoder, der anvendte kendte regioner til at propagerer dybe funktioner. Men introduktionen af diffusionsmodeller har ført til udviklingen af billed-indmalningsmodeller, særligt tekst-guidet billed-indmalningsrammer. Traditionelt erstatter en forudtrænet tekst-til-billede-diffusionsmodel den umaskerede region af latent ved at anvende den støjede version af den kendte region under sampling-processen. Selvom denne tilgang virker til en vis udstrækning, degraderer den kvaliteten af det genererede output betydeligt, da den afstøvning-netværk kun ser den støjede version af den kendte region. For at løse dette problem, har nogle tilgange forsøgt at tilpasse den forudtrænede tekst-til-billede-model til at opnå tekst-guidet billedfuldendelse.

Ved at gå videre, har traditionelle dyb-lærings-modeller implementeret speciel design-lag til effektiv billed-indmalning, og nogle rammer har kunnet trække information effektivt og producere visuelt tiltalende billeder ved at introducere speciel konvolutions-lag til at håndtere kendte regioner af billedet. Nogle rammer har endda tilføjet en kontekstuel attention-lag i deres arkitektur for at reducere de uønskede tungt beregningskrævende krav til alle-til-alle-selv-attention for høj-kvalitets-billed-indmalning.

Til sidst er post-hoc-guidance-metoder bakwards diffusions-sampling-metoder, der guider den næste latent-prædiktion mod en bestemt funktion-minimerings-objektiv. Post-hoc-guidance-metoder er af stor hjælp, når det kommer til at generere visuelt indhold, især i tilfælde af yderligere begrænsninger. Men post-hoc-guidance-metoder har en stor ulempe: de kan føre til billed-kvalitets-degradering, da de tenderer til at skifte latent-genererings-processen med en gradient-term.

Komment til arkitekturen af HD-Painter, formulerer rammen først tekst-guidet billedfuldendelses-problemet og introducerer derefter to diffusionsmodeller, nemlig Stable Inpainting og Stable Diffusion. HD-Painter-modellen introducerer derefter PAIntA- og RASG-blokke og til sidst billed-indmalnings-specifikke super-resolution-teknik.

Stable Diffusion og Stable Inpainting

Stable Diffusion er en diffusionsmodel, der opererer inden for latent-rummet af en autoencoder. Til tekst-til-billede-syntese implementerer Stable Diffusion-rammen en tekstuel prompt til at guide processen. Guiden har en struktur lignende UNet-arkitekturen, og cross-attention-lagene betinger den på den tekstuelle prompt. Yderligere kan Stable Diffusion-modellen udføre billed-indmalning med nogle modifikationer og tilpasning. For at opnå dette, kombineres funktionerne af den maskerede billede, der er genereret af encoderen, med den downscaled binære maske til latent. Den resulterende tensor indsættes derefter i UNet-arkitekturen for at opnå den estimerede støj. Rammen initialiserer derefter de nyligt tilføjede konvolutions-filtre med nul, mens resten af UNet initialiseres ved hjælp af forudtrænede checkpoints fra Stable Diffusion-modellen.

Figuren ovenfor viser oversigten over HD-Painter-rammen, der består af to stadier. I det første stadium implementerer HD-Painter-rammen tekst-guidet billed-maling, mens det andet stadium udfører specifik super-resolution af outputtet. For at udfylde manglende regioner og for at være konsistent med input-prompten, tager modellen en forudtrænet billed-indmalnings-diffusionsmodel, erstatter selv-attention-lagene med PAIntA-lag og implementerer RASG-mekanismen for at udføre en bakwards diffusions-proces. Modellen dekoder derefter den endelige estimerede latent, hvilket resulterer i et indmalet billede. HD-Painter implementerer derefter den super-stabile diffusionsmodel til at udfylde det originale billed-størrelse, og implementerer diffusions-bagwards-processen af Stable Diffusion-rammen betinget på det lavt opløste input-billede. Modellen blander de afstøvede forudsigelser med den originale billed-kodning efter hvert trin i den kendte region og afleder den næste latent. Til sidst dekoder modellen latent og implementerer Poisson-blending for at undgå kant-artefakter.

Prompt Aware Introverted Attention eller PAIntA

Eksisterende billed-indmalningsmodeller som Stable Inpainting tenderer til at afhænge mere af den visuelle kontekst omkring billed-indmalnings-området og ignorere den input-bruger-prompt. På baggrund af bruger-oplevelsen kan dette problem kategoriseres i to klasser: nær-objekt-dominans og baggrund-dominans. Problemet med visuel kontekst-dominans over input-prompten kan være et resultat af, at selv-attention-lagene kun er rumlige og prompt-frie. For at løse dette problem, introducerer HD-Painter-rammen Prompt Aware Introverted Attention eller PAIntA, der anvender cross-attention-matricer og en billed-indmalnings-maske til at kontrollere outputtet af selv-attention-lagene i den ukendte region.

Prompt Aware Introverted Attention-komponenten anvender først projektions-lag til at få nøgle, værdier og forespørgsler samt lignings-matrixen. Modellen justerer derefter attention-scores af kendte pixels for at minimere den stærke indvirkning af den kendte region over den ukendte region, og definerer en ny lignings-matrix ved at udnytte den tekstuelle prompt.

Reweighting Attention Score Guidance eller RASG

HD-Painter-rammen adopterer en post-hoc-sampling-guidance-metode til at forbedre genererings-alignment med den tekstuelle prompt yderligere. Sammen med et objekt-funktions-formål, sigter post-hoc-sampling-guidance-tilgangen til at udnytte åben-vokabular-segmenterings-egenskaberne af cross-attention-lagene. Men denne tilgang af oprindelig post-hoc-guidance har potentialet til at skifte latent-domænet af diffusions-latent, hvilket kan degradere kvaliteten af det genererede billede. For at løse dette problem, implementerer HD-Painter-modellen Reweighting Attention Score Guidance eller RASG-mekanismen, der introducerer en gradient-vægtnings-mekanisme, der resulterer i latent-domæne-bevarelse.

HD-Painter: Eksperimenter og Resultater

For at analysere dens præstation, sammenlignes HD-Painter-rammen med nuværende state-of-the-art-modeller, herunder Stable Inpainting, GLIDE og BLD eller Blended Latent Diffusion over 10000 tilfældige prøver, hvor prompten er valgt som mærket på den valgte instans-maske.

Som det kan observeres, overgår HD-Painter-rammen eksisterende rammer på tre forskellige metrikker med en betydelig margin, især forbedringen af 1,5 point på CLIP-metrikken og forskellen i genereret nøjagtighed-score på omkring 10% fra andre state-of-the-art-metoder.

Ved at gå videre, viser følgende figur den kvalitative sammenligning af HD-Painter-rammen med andre billed-indmalnings-rammer. Som det kan observeres, genskaber andre baseline-modeller enten manglende regioner i billedet som en fortsættelse af kendte region-objekter, uden at tage hensyn til prompten, eller de genererer en baggrund. På den anden side kan HD-Painter-rammen generere mål-objekterne med succes takket være implementeringen af PAIntA- og RASG-komponenterne i sin arkitektur.

Afsluttende tanker

I denne artikel har vi talt om HD-Painter, en træningsfri tekst-guidet højopløselig billed-indmalnings-tilgang, der løser udfordringerne, der opleves af eksisterende billed-indmalnings-rammer, herunder prompt-neglekt og nær-objekt-dominans. HD-Painter-rammen implementerer en Prompt Aware Introverted Attention eller PAIntA-lag, der anvender prompt-information til at forbedre selv-attention-scores, hvilket resulterer i bedre tekst-alignment-generering.

For at yderligere forbedre sammenhængen af prompten, introducerer HD-Painter-modellen en Reweighting Attention Score Guidance eller RASG-tilgang, der integrerer en post-hoc-sampling-strategi i den generelle form af DDIM-komponenten sammenhængende for at forhindre ud af distributions-latent-skift. Yderligere introducerer HD-Painter-rammen en specialiseret super-resolution-teknik, der er tilpasset billed-indmalning, og som tillader rammen at udvide til større skalaer og fuldføre manglende regioner i billedet med opløsninger op til 2K.

Kunal Kejriwal er en backend-ingeniør med speciale i Python, PostgreSQL, Redis og cloud-infrastruktur på GCP og AWS. Med tre års erfaring i at bygge og skalere produktionssystemer skriver han om AI-infrastruktur, distribuerede systemer og arkitekturen bag implementering af maskinlæringsarbejdsbelastninger.