AI-mallit ja alustat
BrushNet: Kuvauskorjaus kahdella haarakontrollilla
Kuvankorjaus on yksi klassisista ongelmista tietokoneen näön alalla, ja se pyrkii palauttamaan maskattuja alueita kuvassa uskottavalla ja luonnollisella sisällöllä. Olemassa olevat työt, jotka käyttävät perinteisiä kuvankorjausmenetelmiä, kuten Generative Adversarial Networks (GAN) ja Variational Auto-Encoders (VAE), vaativat usein apuominaisuuksia, mutta eivät toisaalta tarjoa tyydyttäviä tuloksia. Viime vuosina diffuusiomenetelmät ovat saaneet suosiota tietokoneen näön yhteisössä niiden huippuluokan kuvagenerointikapasiteettien, tulostenvaihtelun ja hienojakoisuuden ansiosta. Alkuvaiheessa diffuusiomalleja käytettiin tekstiohjatulla kuvankorjauksella, jossa maskatut alueet otettiin esikoulutetusta diffuusiomallista ja maskaamattomat alueet kopioitiin annetusta kuvasta. Vaikka nämä menetelmät johtivat tyydyttäviin tuloksiin yksinkertaisissa kuvankorjaustehtävissä, ne kamppailivat monimutkaisilla maskin muodoilla, tekstiprompteilla ja kuvasisällöllä, mikä johti yleiseen epäjohdonmukaisuuteen. Epäjohdonmukaisuus, jota havaittiin näissä menetelmissä, voidaan pääasiassa verrata niiden rajoitettuun havaintotietoon maskin rajoista ja maskaamattoman kuvan kontekstista.
Huolimatta edistymisestä, tutkimuksesta ja kehityksestä näiden mallien parissa viime vuosina, kuvankorjaus on edelleen suuri este tietokoneen näön kehittäjille. Nykyiset diffuusiomallien sovellukset kuvankorjaustehtäviin vaativat usein muutoksia näytteenottostategiassa tai erityisesti kuvankorjaukseen suunnitellun diffuusiomallin kehittämistä, mikä usein johtaa heikentyneeseen kuvanlaatuun ja epäjohdonmukaisiin semantiikkaan. Näiden haasteiden voittamiseksi ja kuvankorjausmallien kehittämiseksi, tässä artikkelissa käsitellään BrushNetiä, uutta, liittämistä varten suunniteltua, kaksiraiteista suunnittelukehystä, joka upottaa pikotason maskatun kuvan ominaisuudet mihin tahansa esikoulutettuun diffuusiomalliin, taaten siten yhdenmukaisuuden ja parannetun tuloksen kuvankorjaustehtävissä. BrushNet-kehys esittää uuden paradigman, jossa kehys jakaa kuvan ominaisuudet ja meluisat latentit eri haaroihin. Kuvan ominaisuuksien ja meluisien latenttien jako vähentää mallin oppimiskuormaa merkittävästi ja mahdollistaa tarkan maskatun kuvan tiedon sisällyttämisen hierarkkisesti. Lisäksi BrushNet-kehystä, käsitellään myös BrushBenchiä ja BrushDataa, jotka mahdollistavat segmentointipohjaisen suorituskyvyn arvioinnin ja kuvankorjauskoulutuksen.

Tämä artikkeli pyrkii kattamaan BrushNet-kehystä syvällisemmin, ja tutkitaan mekanismia, menetelmää, arkkitehtuuria ja vertaillaan sitä valmiisiin kehyksiin. Joten aloitetaan.
BrushNet: Kuvankorjaus kahdella haarakontrollilla
Kuvankorjaus, menetelmä, joka pyrkii palauttamaan maskatut alueet kuvassa ylläpitäen yleistä yhdenmukaisuutta, on ollut pitkäaikainen ongelma tietokoneen näön alalla, ja se on vaivannut kehittäjiä ja tutkijoita jo useita vuosia. Kuvankorjaus soveltuu laajasti erilaisiin tietokoneen näön tehtäviin, mukaan lukien kuvankäsittely ja virtuaalikokeilut. Viimeaikaisissa tutkimuksissa diffuusiomallit, kuten Stable Diffusion ja Stable Diffusion 1.5, ovat osoittaneet merkittävän kyvyn generoida laadukkaita kuvia ja tarjoavat käyttäjille joustavan valvonnan semanttisista ja rakenteellisista ohjauksista. Diffuusiomallien merkittävä potentiaali on saanut tutkijat turvautumaan diffuusiomalleihin laadukkaisiin kuvankorjaustehtäviin, jotka ovat linjassa syöte-ohjetekstien kanssa.
Perinteisten diffuusiopohjaisien tekstiohjattujen kuvankorjauskehysten menetelmät voidaan jakaa kahteen kategoriaan, Näytteenottostategian muutos ja Omistettujen kuvankorjausmallien. Näytteenottostategian muutosmuotoilu muuttaa standardin puhdistusprosessia ottamalla maskatut alueet esikoulutetusta diffuusiomallista ja kopioimalla maskaamattomat alueet annetusta kuvasta jokaisessa puhdistusvaiheessa. Vaikka näytteenottostategian muutoslähestymistavat voidaan toteuttaa mielivaltaisissa diffuusiomalleissa, ne usein johtavat epäjohdonmukaisiin kuvankorjaustuloksiin, koska niillä on rajoitettu havaintotieto maskin rajoista ja maskaamattoman kuvan kontekstista. Toisaalta omistetut kuvankorjausmallit hienosäätävät kuvankorjausmallia, joka on suunniteltu erityisesti laajentamalla perusdiffuusiomallin syötekanavan ulottuvuutta sisällyttääkseen viallisen kuvan ja maskin. Vaikka omistetut kuvankorjausmallit mahdollistavat diffuusiomallille generoida tyydyttävämpiä tuloksia erityisesti suunnitelluilla muoto- ja sisältöherkillä malleilla, se saattaa olla tai ei ole parhain arkkitehtoninen suunnitteluratkaisu kuvankorjausmalleille.
Kuten seuraavasta kuvasta voidaan havaita, omistetut kuvankorjausmallit yhdistävät maskatun kuvan latentin, meluisan latentin, tekstin ja maskin varhaisessa vaiheessa. Omistettujen kuvankorjausmallien arkkitehtoninen suunnittelu vaikuttaa helposti maskatun kuvan ominaisuuksiin ja estää myöhemmät kerrokset UNet-arkkitehtuurissa saamasta puhtaita maskattuja kuvan ominaisuuksia tekstin vaikutuksen takia. Lisäksi yhden haaran käsittely generoinnista ja ehdosta yhdessä haaraa lisää UNet-arkkitehtuurin kuormitusta, ja koska nämä lähestymistavat vaativat myös hienosäätöä eri diffuusiopohjaisissa muunnelmissa, ne ovat usein aikaa vieviä ja niillä on rajoitettu siirtäminen.

Se saattaa vaikuttaa siltä, että lisäämällä erillisen haaran maskattujen kuvan ominaisuuksien poistamiseen, voisi olla riittävä ratkaisu edellä mainittuihin ongelmiin, mutta olemassa olevat kehykset usein johtavat riittämättömän tiedon poistamiseen ja lisäämiseen, kun sovelletaan suoraan kuvankorjaukseen. Tämän seurauksena olemassa olevat kehykset, kuten ControlNet, antavat tyydyttämättömiä tuloksia verrattuna omistettuihin kuvankorjausmalleihin. Tämän ongelman ratkaisemiseksi tehokkaimmalla tavalla, BrushNet-kehys esittää lisähaaran alkuperäiseen diffuusioverkkoon, luoden siten sovellettavamman arkkitehtuurin kuvankorjaustehtäville. BrushNet-kehys voidaan tiivistää kolmeen pääkohtaan.
- Sen sijaan, että konvoluutio kerrokset aloitettaisiin satunnaisesti, BrushNet-kehys toteuttaa VAE-kooderin maskatun kuvan prosessointiin. Tämän seurauksena BrushNet-kehys pystyy poistamaan kuvan ominaisuudet sopeutumiseen UNet-jakeluun tehokkaammin.
- BrushNet-kehys ottaa täydellisen UNet-ominaisuuskerroksen kerros kerrokselta esikoulutettuun UNet-arkkitehtuuriin, hierarkkinen lähestymistapa, joka mahdollistaa tiheän pikotason valvonnan.
- BrushNet-kehys poistaa tekstin ristivalvonnan UNet-komponentista, varmistaen, että vain puhdas kuvatieto otetaan huomioon lisähaaressa. Lisäksi BrushNet-malli ehdottaa sumean sekoittamisstrategian toteuttamista saavuttaaksesi paremman yhdenmukaisuuden ja suuremman valvontavaihtelun maskaamattomissa kuvan alueissa.
BrushNet : Menetelmä ja Arkkitehtuuri
Seuraava kuva antaa lyhyen katsauksen BrushNet-kehystä.

Kuten voidaan havaita, kehys käyttää kaksiraiteista strategiaa maskatun kuvan ohjaamiseen ja käyttää sekoittamisoperaatioita sumealla maskilla varmistaaksesi paremman säilyttämisen maskaamattomissa alueissa. On huomionarvoista, että BrushNet-kehys on kykeneväinen säätämään lisättyä skaalaa saavuttaaksesi joustavan valvonnan. Annetun maskatun kuvan syötteen ja maskin kanssa, BrushNet-malli tuottaa korjatun kuvan. Malli alentaa maskin koon sovittamaan latentin kokoon ja maskattu kuva syötetään VAE-kooderille kuvan jakelun kohdistamiseksi latenttille. Malli yhdistää sitten maskatun kuvan latentin, meluisan latentin ja alennetun maskin ja käyttää sitä syötteenä. Ominaisuudet, joita malli poistaa, lisätään esikoulutettuun UNet-kerrokseen nollakonvoluutiovaiheen jälkeen. Puhdistuksen jälkeen malli sekoittaa maskatun kuvan ja generoidun kuvan sumealla maskilla.
Maskatun Kuvan Ohjaus
BrushNet-kehys lisää maskatun kuvan ominaisuudet esikoulutettuun diffuusioverkkoon lisähaaran avulla, joka erottaa maskattujen kuvien ominaisuuksien poistamisen kuvan generoimisprosessista eksplisiittisesti. Syöte muodostetaan yhdistämällä maskatun kuvan latentti, meluisa latentti ja alennettu maski. Tarkemmin sanottuna meluisa latentti tarjoaa tietoa kuvan generoimisesta nykyisessä generoimisprosessissa ja auttaa kehystä parantamaan maskatun kuvan semanttista yhdenmukaisuutta. BrushNet-kehys poistaa sitten maskatun kuvan latentin maskatusta kuvasta Variational AutoEncoderin avulla. Lisäksi kehys käyttää kuubista interpolointia alentamaan maskin kokoa varmistaaksesi, että maskin koko on linjassa maskatun kuvan latentin ja meluisan latentin kanssa. Maskatun kuvan ominaisuuksien prosessointiin BrushNet-kehys toteuttaa esikoulutetun diffuusiomallin kopion ja poistaa diffuusiomallin ristivalvontakerrokset. Syy on, että esikoulutetun diffuusiomallin esikoulutetut painot toimivat vahvana etuoikeutena maskatun kuvan ominaisuuksien poistamiseen, ja ristivalvontakerrosten poistaminen varmistaa, että malli ottaa huomioon vain puhdas kuvatieto lisähaaressa. BrushNet-kehys lisää ominaisuudet jäädytettyyn diffuusiomalliin kerros kerrokselta, mahdollistaen siten tiheän pikotason valvonnan, ja käyttää myös nollakonvoluutio kerroksia vahvistamaan yhteyden koulutettavan BrushNet-mallin ja lukituksen välillä, varmistaen, että haitallinen melu ei vaikuta piilotettuihin tiloihin koulutettavassa kopiossa alkuvaiheessa.
Sekoittamisoperaatio
Kuten mainittiin aiemmin, sekoittamisoperaation suorittaminen latenttilaskentatilassa muuttaa usein maskin kokoja, mikä johtaa useisiin epätarkkuuksiin, ja BrushNet-kehys kohtaa saman ongelman, kun se muuttaa maskin kokoa latenttilaskentatilan koon kanssa. On huomionarvoista, että koodaus- ja dekoodausoperaatiot Variational AutoEncodereissa ovat sisäisesti rajoitettuja ja eivät välttämättä takaa täydellistä kuvan rekonstruktioita. Varmistaaksesi, että kehys rekonstruoii täysin yhdenmukaisen kuvan maskaamattomasta alueesta, olemassa olevat työt ovat toteuttaneet erilaisia tekniikoita, kuten kopiointia maskaamattomista alueista alkuperäisestä kuvasta. Vaikka lähestymistapa toimii, se usein johtaa semanttisen yhdenmukaisuuden puutteeseen lopputuloksissa. Toisaalta menetelmät, kuten latenttisekoittamisoperaatiot, kohtaavat vaikeuksia säilyttää haluttu tieto maskaamattomissa alueissa.
Joustava Valvonta
BrushNet-kehys on sovellettavissa luontaisesti moniin esikoulutettuihin diffuusiomalleihin ja mahdollistaa joustavan säilyttämisen. Koska BrushNet-kehys ei muuta esikoulutetun diffuusiomallin painoja, kehittäjillä on joustavuus integroida se helposti esikoulutettuun diffuusiomalliin, mikä mahdollistaa helpon omaksumisen ja kokeilun esikoulutetuilla malleilla. Lisäksi kehittäjillä on myös mahdollisuus valvoa maskaamattomien alueiden säilyttämisen astetta ottamalla BrushNet-mallin ominaisuudet esikoulutettuun UNet-malliin annetulla painolla, joka määrää BrushNet-kehys vaikutuksen säilyttämiseen, tarjoamalla kehittäjille mahdollisuuden mukauttaa haluamiaan säilyttämisen tasoja. Lopulta BrushNet-kehys sallii käyttäjien säätää sumeen skaalaa ja päättää, toteutetaanko sumeen operaatio, jolloin maskaamattomien alueiden säilyttämisen aste voidaan helposti mukauttaa, jättäen tilaa joustaville säätöille ja hienojakoiselle valvonnalle kuvankorjausprosessissa.
BrushNet : Toteutus ja Tulokset
Tuloksensa analysoimiseksi BrushNet-kehys ehdottaa BrushBenchiä, segmentointipohjaista kuvankorjausdatasettiä, joka sisältää yli 600 kuvaa, joista jokainen on varustettu ihmisen annotoimalla maskilla ja kuvauksella. Datasetin kuvat ovat jakautuneet tasaisesti luonnollisten ja keinotekoisien kuvien välillä ja myös varmistavat tasaisen jakautumisen eri luokkien välillä, mahdollistaen reilun arvioinnin eri luokkien välillä. Tuloksien analysoimiseksi tarkemmin, BrushNet-kehys jakaa datasetin kahteen erilliseen osaan menetelmien perusteella: segmentointipohjaisiin ja siveltimien maskkeihin.
Määrällinen Vertailu
Seuraava taulukko vertaa BrushNet-kehystä olemassa oleviin diffuusiopohjaisiin kuvankorjausmalleihin BrushBench-datasetissä, jossa Stable Diffusion on perusmalli.

Kuten voidaan havaita, BrushNet-kehys osoittaa merkittävää tehokkuutta maskattujen alueiden säilyttämisessä, tekstin linjauksessa ja kuvanlaadussa. Lisäksi mallit, kuten Stable Diffusion Inpainting, HD-Painter, PowerPaint ja muut, osoittavat vahvaa suorituskykyä kuvankorjaustehtävissä sisäpuolella, vaikka ne eivät pysty toistamaan suorituskykyään ulkopuolella, erityisesti tekstin linjauksessa ja kuvanlaadussa. Yleisesti ottaen BrushNet-kehys tarjoaa vahvimmat tulokset.
Lisäksi seuraava taulukko vertaa BrushNet-kehystä olemassa oleviin diffuusiopohjaisiin kuvankorjausmalleihin EditBench-datasetissä, ja suorituskyky on verrattavissa siihen, mitä havaittiin BrushBench-datasetissä. Tulokset osoittavat, että BrushNet-kehys tarjoaa vahvan suorituskyvyn laajasti erilaisissa kuvankorjaustehtävissä erilaisilla maskityypeillä.

Laadullinen Vertailu
Seuraava kuva vertaa laadullisesti BrushNet-kehystä olemassa oleviin kuvankorjausmenetelmiin, ja tulokset kattavat sekä tekoälyn että luonnolliset kuvat erilaisissa kuvankorjaustehtävissä, mukaan lukien satunnainen maskin korjaus, segmentointi sisäpuolella ja segmentointi ulkopuolella.

Kuten voidaan havaita, BrushNet-kehys tarjoaa merkittäviä tuloksia maskaamattomien alueiden yhdenmukaisuudessa ja yhdenmukaisissa alueissa, ja onnistuu toteuttamaan taustatiedon tietoisuuden kaksiraiteisen erottamisen ansiosta. Lisäksi esikoulutetun diffuusiomallin muuttumaton haara tarjoaa etua eri tietokoneen näön sovellusten, kuten anime ja maalaus, käsittelyssä, johtuen siitä, että ne tarjoavat paremman suorituskyvyn erilaisissa tilanteissa.

Loppusanat
Tässä artikkelissa on käsitelty BrushNetiä, uutta, liittämistä varten suunniteltua, kaksiraiteista suunnittelukehystä, joka upottaa pikotason maskatun kuvan ominaisuudet mihin tahansa esikoulutettuun diffuusiomalliin, taaten siten yhdenmukaisuuden ja parannetun tuloksen kuvankorjaustehtävissä. BrushNet-kehys esittää uuden paradigman, jossa kehys jakaa kuvan ominaisuudet ja meluisat latentit eri haaroihin. Kuvan ominaisuuksien ja meluisien latenttien jako vähentää mallin oppimiskuormaa merkittävästi ja mahdollistaa tarkan maskatun kuvan tiedon sisällyttämisen hierarkkisesti. Lisäksi BrushNet-kehystä, käsitellään myös BrushBenchiä ja BrushDataa, jotka mahdollistavat segmentointipohjaisen suorituskyvyn arvioinnin ja kuvankorjauskoulutuksen.












