AI-mallit ja alustat
HD-Painter: Tekstiohjattu kuvankorjaus korkealla resoluutiolla Diffuusiomalleilla
Diffuusiomallit ovat selvästi vallanneet AI- ja ML-alan, ja niiden sovellukset ovat nykyään olennainen osa arkeamme. Kun teksti-kuvamallit osoittivat merkittävät kykynsä, diffuusiopohjaiset kuvamanipulaatiotekniikat, kuten ohjattu generointi, erikoistunut ja henkilökohtainen kuvasynteesi, objektin tason kuvankäsittely, ohjattu muuntelu ja muokkaus, nousivat tärkeiksi tutkimusaiheiksi sovelluksiinsa tietokoneen näköalalla.
Vaikka diffuusiomallit ovat osoittaneet vaikuttavat kykynsä ja poikkeukselliset tulokset, teksti-kuvakehykset, erityisesti teksti-kuvankorjauskehykset, tarvitsevat edelleen kehittämistä. Näihin kuuluvat kyky ymmärtää globaaleja kohtauksia, erityisesti kuvan denoisauksen aikana korkeissa diffuusioiden aikatauluissa. Ratkaisemaan tämän ongelman, tutkijat esittivät HD-Painterin, täysin koulutusvapaan kehyksen, joka seuraa ohjeistuksia tarkasti ja skaalautuu yhdenmukaisesti korkearesoluutioisiin kuvankorjauksiin. HD-Painter-kehyksessä käytetään Prompt Aware Introverted Attention (PAIntA) -kerrosta, joka hyödyntää ohjeistusinformaatiota parantamaan itsehuomion arvoja, johtaen parempaan tekstin sopimiseen.
Jotta ohjeistuksen yhdenmukaisuutta voidaan parantaa edelleen, HD-Painter-malli esittää Reweighting Attention Score Guidance (RASG) -lähestymistavan. Tämä lähestymistapa integroi jälkikäteen näytteenottostategian yleiseen DDIM-komponentin muotoon, estäen latenttijakautumisen siirtymisen. Lisäksi HD-Painter-kehyksessä on erikoistunut superresoluutio-tekniikka, joka on suunniteltu kuvankorjaukseen, mahdollistaen laajentaa suurempiin mittakaavoihin ja täyttää kuvan puuttuvat alueet resoluutiolla jopa 2K.
HD-Painter: Tekstiohjattu kuvankorjaus
Teksti-kuvadiffuusiomallit ovat olleet merkittävä aihe AI- ja ML-alalla viime kuukausina, ja mallit ovat osoittaneet vaikuttavat kykynsä monissa sovelluksissa. Esikoulutetut teksti-kuvagenerointimallit, kuten DALL-E, Imagen ja Stable Diffusion, ovat osoittaneet soveltuvuutensa kuvankorjaukseen yhdistämällä denoisoituja (generoituja) tuntemattomia alueita diffuusoiduilla tunnetuilla alueilla takaisin diffuusioprosessissa. Vaikka nämä mallit tuottavat visuaalisesti miellyttäviä ja harmonisia tuloksia, ne kamppailevat globaalin kohtauksen ymmärtämisessä, erityisesti korkeissa diffuusioiden aikatauluissa. Muokkaamalla esikoulutettuja teksti-kuvadiffuusiomalleja sisältämään lisää kontekstiinformaatiota, niitä voidaan hienosäätää tekstiohjatuksi kuvankorjaukseksi.
Lisäksi diffuusiomalleissa tekstiohjattu kuvankorjaus ja tekstiohjattu kuvan täydentäminen ovat merkittäviä tutkimusalueita, ja niiden kiinnostus johtuu siitä, että tekstiohjattu kuvankorjausmallit voivat generoida sisältöä tiettyihin syötekuvan alueisiin perustuen tekstipromptteihin, johtaen sovelluksiin kuten kuvien retusoimiseen, aiheiden ominaisuuksien muokkaamiseen, kuten värin tai vaatetus, ja lisäämiseen tai korvaamiseen. Yhteenvetona, teksti-kuvadiffuusiomallit ovat saavuttaneet poikkeuksellista menestystä viime aikoina, ja niiden generoivat kyky on ollut erittäin realistinen ja visuaalisesti miellyttävä.

Kuitenkin useimmat olemassa olevat kehykset osoittavat ohjeistuksen laiminlyöntiä kahdessa skenaariossa. Ensimmäinen on taustan hallitsevuus, kun malli täyttää tuntemattoman alueen ohjeistuksen sijaan taustalla, ja toinen skenaario on läheisen objektin hallitsevuus, kun malli propagoi tunnetun alueen objekteja tuntemattomaan alueeseen visuaalisen kontekstin todennäköisyyden sijaan syöteohjeistuksen. On mahdollista, että molemmat ongelmat johtuvat diffuusiokorjausmallien kyvystä tulkita tekstipromptteja tarkasti tai sekoittaa ne kontekstiinformaatiota, jota saadaan tunnetusta alueesta.
Ratkaistakseen nämä esteet, HD-Painter-kehyksessä esitetään Prompt Aware Introverted Attention (PAIntA) -kerros, joka käyttää ohjeistusinformaatiota parantamaan itsehuomion arvoja, johtaen parempaan tekstin sopimiseen. PAIntA käyttää annettua tekstikonditionaalia parantamaan itsehuomion arvoa tavoitteena vähentää ei-ohjeistuksen mukaisen informaation vaikutusta kuvan alueelta ja samaan aikaan lisätä tunnettujen pikselien osuutta, jotka ovat ohjeistuksen mukaisia. Jotta tekstisopimista voidaan parantaa edelleen, HD-Painter-kehyksessä toteutetaan jälkikäteen ohjausmenetelmä, joka hyödyntää ristihuomion arvoja.
Käyttämällä sekä PAIntA- että RASG-komponentteja arkkitehtuurissaan, HD-Painter-kehyksellä on merkittävä etu verrattuna olemassa oleviin, mukaan lukien valtavirtaisten, kuvankorjaus- ja teksti-kuvadiffuusiomalleihin, koska se ratkaisee olemassa olevan ohjeistuksen laiminlyöntiongelman. Lisäksi sekä RASH- että PAIntA-komponentit tarjoavat plug and play -toiminnallisuuden, mikä mahdollistaa niiden yhdistämisen diffuusiopohjaisiin kuvankorjausmalleihin haastavien yllä mainittujen ongelmien ratkaisemiseksi. Lisäksi toteuttamalla aikaisempaan yhdistämismenetelmän ja hyödyntämällä korkearesoluutio-diffuusiomallien kykyjä, HD-Painter-pipeline voi toimia tehokkaasti jopa 2K-resoluution kuvankorjauksessa.
Yhteenvetona, HD-Painter pyrkii tekemään seuraavat panokset alalla:
- Se pyrkii ratkaisemaan taustan ja läheisen objektin hallitsevuuden ongelman, joita tekstiohjattu kuvankorjauskehykset kokevat, toteuttamalla Prompt Aware Introverted Attention (PAIntA) -kerroksen arkkitehtuurissaan.
- Se pyrkii parantamaan tekstin sopimista tulosteessa toteuttamalla Reweighting Attention Score Guidance (RASG) -kerroksen arkkitehtuurissaan, joka mahdollistaa jälkikäteen ohjatun näytteenottamisen estäen latenttijakautumisen siirtymisen.
- Se pyrkii suunnittelemaan tehokkaan koulutusvapaan tekstiohjatun kuvankorjauspipelineen, joka pystyy ylittämään olemassa olevat valtavirtaiset kehykset, ja käyttämään yksinkertaista mutta tehokasta kuvankorjaus-erikoistunutta superresoluutiomenetelmää tekstiohjatun kuvankorjauksen suorittamiseen jopa 2K-resoluutioon.
HD-Painter: Menetelmä ja Arkkitehtuuri
Ennen kuin tarkastelemme arkkitehtuuria, on olennaista ymmärtää kolme perusasiaa, jotka muodostavat HD-Painter-kehyksen perustan: Kuvankorjaus, Jälkikäteen ohjaus diffuusiokehyksissä, ja Kuvankorjauskohtaiset arkkitehtuurin osat.
Kuvankorjaus on lähestymistapa, joka pyrkii täyttämään kuvan puuttuvat alueet varmistamalla, että generoitu kuva on visuaalisesti miellyttävä. Perinteiset syvät oppimismallit toteuttivat menetelmiä, jotka käyttivät tunnettuja alueita syvien ominaisuuksien propagoimiseen. Diffuusiomallien kehittymisen myötä kuvankorjausmallit, erityisesti tekstiohjattu kuvankorjaus, ovat kehittyneet. Perinteisesti esikoulutettu teksti-kuvadiffuusiomalli korvaa latentin unmasked-alueen käyttämällä noisattua versiota tunnetusta alueesta näytteenottoprosessissa. Vaikka tämä lähestymistapa toimii jossain määrin, se heikentää merkittävästi generoidun tuloksen laatua, koska denoisingsieveri näkee vain noisatun version tunnetusta alueesta.
Kuvankorjauskohtaiset arkkitehtuurin osat ovat olennaisia kuvankorjauksen tehokkaalle suorittamiselle. Jotkut mallit ovat lisänneet kontekstuaalisen huomion kerroksen arkkitehtuuriinsa vähentämään epätodennäköisen kaikkien kaikkia vastaan itsehuomion raskaita laskentavaatimuksia korkealaatuisessa kuvankorjauksessa.
Lopulta jälkikäteen ohjausmenetelmät ovat takaisin diffuusioprosessin näytteenottomenetelmiä, jotka ohjaavat seuraavan askelen latenttiprediktioita tietyn funktion minimointitavoitteen suuntaan. Jälkikäteen ohjausmenetelmät ovat hyödyllisiä visuaalisen sisällön generoimisessa, erityisesti lisärajoitusten läsnä ollessa. Kuitenkin jälkikäteen ohjausmenetelmillä on merkittävä haitta: ne voivat johtaa kuvan laadun heikentymiseen, koska ne siirtävät latenttigenerointiprosessia gradientin avulla.
Tulevaisuudessa HD-Painter-arkkitehtuuriin, kehyksessä määritellään tekstiohjattu kuvankorjausongelma, ja sitten esitetään kaksi diffuusiomallia, nimittäin Stable Inpainting ja Stable Diffusion. HD-Painter-malli esittää PAIntA- ja RASG-kerrokset, ja lopulta päädytään kuvankorjauskohtaiseen superresoluutio-tekniikkaan.
Stable Diffusion ja Stable Inpainting
Stable Diffusion on diffuusiomalli, joka toimii autoenkooderin latenttilaissa. Teksti-kuvasynteesille Stable Diffusion -kehyksessä toteutetaan tekstipromptti ohjaamaan prosessia. Ohjausfunktiolla on samanlainen rakenne kuin UNet-arkkitehtuurilla, ja ristihuomion kerrokset ehdottavat tekstipromptteja. Lisäksi Stable Diffusion -malli voi suorittaa kuvankorjausta joitakin muutoksia ja hienosäätöä. Tämän saavuttamiseksi malli yhdistää maskatun kuvan piirteitä, jotka on generoitu kooderin avulla, pienennetylle binäärimaskille latentteihin. Tuloksena oleva tensori syötetään sitten UNet-arkkitehtuuriin arvioitavan kohina-arvon saamiseksi.

Yllä oleva kuva esittää HD-Painter-kehyksen yleiskatsauksen, joka koostuu kahdesta vaiheesta. Ensimmäisessä vaiheessa HD-Painter-kehyksessä toteutetaan tekstiohjattu kuvamaalaus, ja toisessa vaiheessa malli korjaa tietyn superresoluution tulostetta. Täyttääkseen puuttuvat alueet ja pysyäkseen ohjeistuksen mukaisena, malli ottaa esikoulutetun kuvankorjausdiffuusiomallin, korvaa itsehuomion kerrokset PAIntA-kerroksilla ja toteuttaa RASG-mekanismin suorittaakseen takaisin diffuusioprosessin. Malli dekoodaa lopullisen arvioidun latentin, josta seuraa korjattu kuva. HD-Painter toteuttaa sitten super-stable diffuusiomallin korjatakseen alkuperäisen kokoisen kuvan ja toteuttaa diffuusioprosessin takaisin Stable Diffusion -kehyksen ehdottaen matalaresoluutioista syötekuvaa. Malli yhdistää denoisoituneet ennusteet alkuperäisen kuvan koodauksen jokaisen askelen jälkeen tunnetussa alueessa ja johtaa seuraavaa latenttia. Lopulta malli dekoodaa latentin ja toteuttaa Poisson-sekoituksen välttääkseen reunojen epäilyjä.
Prompt Aware Introverted Attention eli PAIntA
Olemassa olevat kuvankorjausmallit, kuten Stable Inpainting, luottavat enemmän visuaaliseen kontekstiin korjausalueen ympärillä ja laiminlyövät syöteohjeistuksen. Käyttäjäkokemuksen perusteella tämä ongelma voidaan luokitella kahteen luokkaan: läheisen objektin hallitsevuus ja taustan hallitsevuus. Visuaalisen kontekstin hallitsevuuden ohjeistuksista johtuva ongelma saattaa johtua itsehuomion kerrosten ainoastaan spatiaalisesta ja ohjeistuksettoman luonteesta. Ratkaistakseen tämän ongelman, HD-Painter-kehyksessä esitetään Prompt Aware Introverted Attention (PAIntA), joka käyttää ristihuomion matriiseja ja korjausmaskia ohjaamaan itsehuomion kerrosten tulostetta tuntemattomassa alueessa.
Prompt Aware Introverted Attention -komponentti soveltaa ensin projektiokerroksia saadakseen avain-, arvo- ja kysymysvektorit sekä samankaltaisuusmatriisin. Malli sitten säätää tunnettujen pikselien huomioarvoja vähentämään tunnetun alueen vahvan vaikutuksen tuntemattomaan alueeseen ja määrittelee uuden samankaltaisuusmatriisin hyödyntämällä tekstiprompttia.

Reweighting Attention Score Guidance eli RASG
HD-Painter-kehyksessä otetaan käyttöön jälkikäteen näytteenottomenetelmä parantamaan generoinnin sopimista tekstipromptteihin edelleen. Yhdessä objektiivisen funktion kanssa jälkikäteen näytteenottomenetelmä pyrkii hyödyntämään avoimen sanastojen segmentointiominaisuuksia ristihuomion kerroksissa. Kuitenkin tämä perusjälkikäteen ohjausmenetelmä voi siirtää diffuusiolatentin jakautumista, mikä voi heikentää generoidun kuvan laatua. Ratkaistakseen tämän ongelman, HD-Painter-malli toteuttaa Reweighting Attention Score Guidance (RASG) -mekanismin, joka esittää gradientin uudelleenpainotusmenetelmän, josta seuraa latenttijakautumisen säilyttäminen.
HD-Painter: Kokeet ja Tulokset
Analyysiakseen HD-Painter-kehyksen suorituskykyä verrataan nykyisiin valtavirtaisiin malleihin, mukaan lukien Stable Inpainting, GLIDE ja BLD (Blended Latent Diffusion), 10 000:sta satunnaisesta näytteestä, joissa ohjeistus on valittu valitun instanssimaskin etikettinä.

Kuten voidaan havaita, HD-Painter-kehyksessä ylittää olemassa olevat kehykset kolmella eri mittarilla merkittävällä marginaalilla, erityisesti 1,5 pisteen parannuksella CLIP-mittarilla ja 10 prosentin eroa generoituun tarkkuusarvoon verrattuna muihin valtavirtaisiin menetelmiin.

Jatkamalla, seuraava kuva esittää laadullisen vertailun HD-Painter-kehyksen ja muiden korjauskehyksien välillä. Kuten voidaan havaita, muut vertailumallit joko rekonstruoivat puuttuvat alueet kuvassa jatkamalla tunnetun alueen objekteja ohjeistuksen sijaan tai ne generoivat taustan. Toisaalta HD-Painter-kehyksessä voidaan generoida kohde-objekteja onnistuneesti PAIntA- ja RASG-komponenttien toteuttamisen ansiosta sen arkkitehtuurissa.

Lopputajat
Tässä artikkelissa olemme keskustelleet HD-Painterista, koulutusvapaasta tekstiohjatusta korkearesoluutioisesta kuvankorjausmenetelmästä, joka ratkaisee olemassa olevat haasteet, mukaan lukien ohjeistuksen laiminlyönnin ja läheisen objektin hallitsevuuden. HD-Painter-kehyksessä esitetään Prompt Aware Introverted Attention (PAIntA) -kerros, joka käyttää ohjeistusinformaatiota parantamaan itsehuomion arvoja, johtaen parempaan tekstin sopimiseen.
Parantamaan ohjeistuksen yhdenmukaisuutta edelleen, HD-Painter-malli esittää Reweighting Attention Score Guidance (RASG) -lähestymistavan, joka integroi jälkikäteen näytteenottostategian yleiseen DDIM-komponentin muotoon esteettömästi estäen latenttijakautumisen siirtymisen. Lisäksi HD-Painter-kehyksessä on erikoistunut superresoluutio-tekniikka, joka on suunniteltu kuvankorjaukseen, mahdollistaen laajentaa suurempiin mittakaavoihin ja täyttää kuvan puuttuvat alueet resoluutiolla jopa 2K.












