Andersonin kulma

Viheriön erottamisen parantaminen Stabilille diffuusiomallille

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
Diverse Stable Diffusion green screen-based prompts, https://stablediffusionweb.com/

Vaikka yhteisöllinen ja sijoittajien innostus visuaalista generatiivista tekoälyä kohtaan on suurta, tällaisista järjestelmistä tuotettu ulostulo ei aina ole valmis käytettäväksi todellisessa maailmassa; yksi esimerkki tästä on, että gen AI -järjestelmät tuottavat usein koko kuvia (tai sarjoja kuvia videon tapauksessa), sen sijaan yksittäisiä, erillisiä elementtejä, joita useat sovellukset multimediassa ja visuaalisten efektien parissa tarvitsevat.

Yksinkertainen esimerkki tästä on klippi, joka on suunniteltu “leijumaan” valitun taustan yläpuolella:

The light-grey checkered background, perhaps most familiar to Photoshop users, has come to represent the alpha channel, or transparency channel, even in simple consumer items such as stock images.

Harmaa ruutukuviotausta, joka on ehkä tutuin Photoshop-käyttäjille, on tullut edustamaan alfakanavaa tai läpinäkyvyyden kanavaa, jopa yksinkertaisissa kuluttajatuotteissa, kuten osana valokuvia.

Tällainen läpinäkyvyys on ollut yleisesti saatavilla yli kolmenkymmenen vuoden ajan; digitaalisen vallankumouksen myötä 1990-luvun alussa käyttäjät pystyivät jo erottamaan elementtejä videoista ja kuvista yhä monipuolisemman joukon työkalujen ja tekniikoiden avulla.

Esimerkiksi sinisen tai vihreän taustan poistamisen haaste videomateriaalista, joka oli aikaisemmin kallisten kemiallisten prosessien ja käsintehdyt maskit (sekä optiset tulostimet), muuttui muutamassa minuutissa järjestelmissä kuten Adoben After Effects ja Photoshop (sekä monissa muissa ilmais- ja omistusohjelmissa ja -järjestelmissä).

Kun elementti on erillinen, alfakanava (joka on käytännössä maski, joka peittää kaiken epäolennaisen sisällön) mahdollistaa minkä tahansa videon elementin helpon yhdistämisen uusiin taustoihin tai yhdistämisen muiden erillisten elementtien kanssa.

Esimerkkejä alfakanavista, joissa on esitetty niiden vaikutukset aleimmassa rivissä. Lähde: https://helpx.adobe.com/photoshop/using/saving-selections-alpha-channel-masks.html

Esimerkkejä alfakanavista, joissa on esitetty niiden vaikutukset aleimmassa rivissä. Lähde: https://helpx.adobe.com/photoshop/using/saving-selections-alpha-channel-masks.html

Poistaminen

Tietokoneen näön kannalta alfakanavien luominen kuuluu semanttiseen segmentaatioon, ja avoimet lähdekoodiprojektit kuten Metan Segment Anything tarjoavat tekstipohjaisen menetelmän kohdistettujen objektien erottamiseen ja poistamiseen semanttisesti parannetun objektin tunnistamisen kautta.

Segment Anything -kehys on käytetty laajasti visuaalisten efektien erottamis- ja poistoprosesseissa, kuten Alpha-CLIP-projektissa.

Esimerkkejä poistoja Segment Anything -kehikossa Alpha-CLIP-kehikossa: Lähde: https://arxiv.org/pdf/2312.03818

Esimerkkejä poistoja Segment Anything -kehikossa Alpha-CLIP-kehikossa: Lähde: https://arxiv.org/pdf/2312.03818

On olemassa monia vaihtoehtoisia semanttisia segmentaatiomenetelmiä, joita voidaan soveltaa alfakanavien määrittämiseen.

Semanttinen segmentaatio kuitenkin riippuu koulutusdatasta, joka saattaa ei sisällä kaikkia objektin luokkia, jotka on tarpeen erottaa. Vaikka mallit, jotka on koulutettu erittäin suurilla määrillä dataa, voivat mahdollistaa laajemman joukon objektien tunnistamisen (käytännössä perusmallit tai maailmanmallit), ne ovat kuitenkin rajoitettuja niiden luokkien osalla, joita ne on koulutettu tunnistamaan parhaiten.

Semanttiset segmentaatiomenetelmät kuten Segment Anything voivat kärsiä tietyistä objekteista tai niiden osista, kuten esitetty tässä epäselvien ohjeiden tuloksena. Lähde: https://maucher.pages.mi.hdm-stuttgart.de/orbook/deeplearning/SAM.html

Semanttiset segmentaatiomenetelmät kuten Segment Anything voivat kärsiä tietyistä objekteista tai niiden osista, kuten esitetty tässä epäselvien ohjeiden tuloksena. Lähde: https://maucher.pages.mi.hdm-stuttgart.de/orbook/deeplearning/SAM.html

Milloin tahansa semanttinen segmentaatio on yhtä paljon jälkikäteen prosessi kuin vihreä tausta -menetelmä, ja se on pakko erottaa elementtejä ilman yksittäisen taustavärin etua, jota voidaan tehokkaasti tunnistaa ja poistaa.

Tästä syystä se on joskus käyttäjäyhteisölle tullut ajatuksena, että kuvia ja videoita voidaan generoida sisältäen vihreän taustan, jota voidaan poistaa perinteisin menetelmin.

Valitettavasti suositut latentti diffuusiomallit kuten Stable Diffusion usein kohtaavat vaikeuksia tuottaessaan erittäin elävän vihreän taustan. Tämä johtuu siitä, että mallien koulutusdata ei yleensä sisällä paljon esimerkkejä tällaisesta erikoistuneesta skenaariosta. Vaikka järjestelmä onnistuu, “vihreä” -käsite taipuu levittäytymään ei-toivottavalla tavalla etualan kohteeseen johtuen konseptin sekaantumisesta:

<img class=" wp-image-209501" src="https://www.unite.ai/wp-content/uploads/2024/12/Stable-Diffusion.jpg" alt="Yllä näemme, että Stable Diffusion on priorisoinut kuvan aitoutta tarpeen luoda yksittäinen vihreän sävy luomalla käytännössä todellisen maailman ongelman, joka esiintyy perinteisissä vihreän taustan skenaarioissa. Alla näemme, että "vihreä" -käsite on saastuttanut etualan kuvan. Mitä enemmän ohje keskittyy "vihreään" -käsitteeseen, sitä pahemmaksi tämä ongelma todennäköisesti tulee. Lähde: https://stablediffusionweb.com/” width=”672″ height=”673″ /> Yllä näemme, että Stable Diffusion on priorisoinut kuvan aitoutta tarpeen luoda yksittäinen vihreän sävy luomalla käytännössä todellisen maailman ongelman, joka esiintyy perinteisissä vihreän taustan skenaarioissa. Lähde: https://stablediffusionweb.com/

Vaikka kehittyneitä menetelmiä käytetään, sekä naisen mekko että miehen solmio (alemmassa kuvassa) taipuvat “poistumaan” vihreän taustan kanssa – ongelma, joka johtaa takaisin valokuvakemikaalisten värjäysmenetelmien ja 1970- ja 1980-lukujen valokuvausprosessien aikaan.

Aina mallin puutteita voidaan voittaa heittämällä tiettyä dataa ongelmaan ja omistamalla merkittäviä koulutusresursseja. Järjestelmät kuten Stanfordin 2024 tarjoama LayerDiffuse luo hienosäädetyn mallin, joka pystyy tuottamaan kuvia, joissa on alfakanavat:

Stanfordin LayerDiffuse-projekti koulutettiin miljoonalla sovellettavalla kuvalla, joka antoi mallille läpinäkyvyyden ominaisuudet. Lähde: https://arxiv.org/pdf/2402.17113

Stanfordin LayerDiffuse-projekti koulutettiin miljoonalla sovellettavalla kuvalla, joka antoi mallille läpinäkyvyyden ominaisuudet. Lähde: https://arxiv.org/pdf/2402.17113

Valitettavasti, lisäksi huomattavasta kuraamis- ja koulutusresursseista, jotka vaaditaan tähän lähestymistapaan, datasetti, jota käytettiin LayerDiffuseen, ei ole julkinen, mikä rajoittaa mallien, jotka on koulutettu siitä, käyttöä. Vaikka tämä este ei olisi olemassa, tämä lähestymistapa on vaikea mukauttaa tai kehittää tietyille käyttötarkoituksille.

Hieman myöhemmin vuonna 2024 Adobe Research teki yhteistyötä Stonybrookin yliopiston kanssa ja tuotti MAGICK -nimisen tekoälymenetelmän, joka perustui diffuusiokuvien mukauttamiseen.

Vuoden 2024 julkaisusta, esimerkki hienojakoisesta alfakanavan poistosta MAGICKissa. Lähde: https://openaccess.thecvf.com/content/CVPR2024/papers/Burgert_MAGICK_A_Large-scale_Captioned_Dataset_from_Matting_Generated_Images_using_CVPR_2024_paper.pdf

Vuoden 2024 julkaisusta, esimerkki hienojakoisesta alfakanavan poistosta MAGICKissa. Lähde: https://openaccess.thecvf.com/content/CVPR2024/papers/Burgert_MAGICK_A_Large-scale_Captioned_Dataset_from_Matting_Generated_Images_using_CVPR_2024_paper.pdf

150 000:aa erillistä, tekoälyllisesti generoituja objekteja käytettiin kouluttamaan MAGICKia, jotta järjestelmä kehittäisi intuitiivisen ymmärryksen erottamisesta:

Esimerkkejä MAGICKin koulutusaineistosta.

Esimerkkejä MAGICKin koulutusaineistosta.

Tämä aineisto, kuten alkuperäinen artikkeli toteaa, oli erittäin vaikea tuottaa edellä mainituista syistä – diffuusiomenetelmillä on vaikea luoda kiinteitä, avainkohtaisia värejä. Tämän vuoksi manuaalinen valinta generoituista maskeista oli välttämätöntä.

Tämä logistinen pullonkaula johtaa jälleen kerran järjestelmään, jota ei voida helposti kehittää tai mukauttaa, vaan sen on käytettävä alun perin koulutetun kyvyn rajoissa.

TKG-DM – ‘Alkuperäinen’ kroma-erottelu latentille diffuusiomallille

Saksalais-ja japanilaisen tutkijaryhmän yhteistyö on ehdottanut vaihtoehtoa tällaisille koulutusmenetelmille, joka on kykenevä – kuten artikkeli toteaa – saavuttamaan parempia tuloksia kuin edellä mainitut menetelmät ilman erityisen koulutetun aineiston tarvetta.

TKG-DM muuttaa satunnaisen melun, joka aloittaa generoivan kuvan, jotta se pystyy tuottamaan kiinteän, avainkohtaisen taustan - missä tahansa värissä. Lähde: https://arxiv.org/pdf/2411.15580

TKG-DM muuttaa satunnaisen melun, joka aloittaa generoivan kuvan, jotta se pystyy tuottamaan kiinteän, avainkohtaisen taustan – missä tahansa värissä. Lähde: https://arxiv.org/pdf/2411.15580

Uusi menetelmä lähestyy ongelmaa generoinnin tasolla optimoimalla satunnaisen melun, josta kuva generoidaan latentissa diffuusiomallissa (LDM) kuten Stable Diffusion.

Lähestymistapa perustuu aiempaan tutkimukseen Stable Diffusion -jakelun värikartasta ja pystyy tuottamaan taustaväriä millä tahansa tavalla, vähemmän (tai ei ollenkaan) avainvärisen taustan sekaantumista etualan sisältöön verrattuna muihin menetelmiin.

Alkumelua ehdotetaan kanavan keskiarvon siirtymällä, joka pystyy vaikuttamaan osiin denoisingssa, ilman värisignaalin sekaantumista etualan sisältöön.

Alkumelua ehdotetaan kanavan keskiarvon siirtymällä, joka pystyy vaikuttamaan osiin denoisingssa, ilman värisignaalin sekaantumista etualan sisältöön.

Artikkeli toteaa:

‘Laajat kokeilumme osoittavat, että TKG-DM parantaa FID- ja mask-FID -tuloksia 33,7 %:lla ja 35,9 %:lla vastaavasti.

‘Näin ollen, harjoitteluvapaa mallimme kilpailee hienosäädettyjen mallien kanssa, tarjoten tehokkaan ja monipuolisen ratkaisun visuaalisten sisältöluomisen tehtäville, jotka vaativat tarkkaa etu- ja taustan valvontaa. ‘

Uusi artikkeli on nimeltään TKG-DM: Harjoitteluvapaa kroma-avain sisällön generoiminen diffuusiomalli, ja se tulee seitsemältä tutkijalta Hosei-yliopistosta Tokiossa ja RPTU Kaiserslautern-Landau & DFKI GmbH:stä Kaiserslauternissa.

Menetelmä

Uusi lähestymistapa laajentaa Stable Diffusionin arkkitehtuuria ehdottamalla alkuperäistä Gaussian-melua kanavan keskiarvon siirtymällä (CMS), joka tuottaa melumalleja, jotka ovat suunniteltu edistämään toivottua taustan ja etualan erottamista generoituissa tuloksissa.

Ehdotetun järjestelmän työkalu.

Ehdotetun järjestelmän työkalu.

CMS säätää kunkin värikukan keskiarvoa säilyttäen samalla denoisingsprosessin yleisen kehityksen.

Tekijät selittävät:

‘Generoidaksemme etualakohteen kroma-avain taustalla, sovellemme aloitusmelun valintastrategiaa, joka yhdistää selektiivisesti alkuperäisen [melun] ja aloitusvärin [melun] 2D-Gaussian [maskin] avulla.

‘Tämä maski luo asteittaisen siirtymän säilyttämällä alkuperäisen melun etualueella ja soveltamalla väriksiirtynyttä melua taustaan.’

Taustan kroma-väri halutaan kanavalla, joka on aloitettu tyhjällä tekstiohjeella, kun taas etualan sisältö luodaan semanttisesti käyttäjän tekstiohjeesta.

Taustan kroma-väri halutaan kanavalla, joka on aloitettu tyhjällä tekstiohjeella, kun taas etualan sisältö luodaan semanttisesti käyttäjän tekstiohjeesta.

Itsehuomio ja ristiinhuomio käytetään erottamaan kuvan kaksi puolta (kromatausta ja etualan sisältöä). Itsehuomio auttaa etualan kohteen sisäisessä johdonmukaisuudessa, kun taas ristiinhuomio ylläpitää uskollisuutta tekstiohjeeseen. Artikkeli korostaa, että koska taustakuvat ovat yleensä vähemmän yksityiskohtaisia ja korostettuja generoinneissa, niiden heikompi vaikutus on suhteellisen helppo voittaa ja korvata puhtaalla värillä.

Visualisointi itsehuomion ja ristiinhuomion vaikutuksesta kroma-tyylin generoinnissa.

Visualisointi itsehuomion ja ristiinhuomion vaikutuksesta kroma-tyylin generoinnissa.

Data ja testit

TKG-DM testattiin käyttäen Stable Diffusion V1.5:ää ja Stable Diffusion SDXL:ää. Kuvat generoitiin 512x512px ja 1024x1024px resoluutioilla.

Kuvat luotiin käyttäen Stable Diffusionin DDIM-ajuria oletusarvoisella 7,5 ohjauskaavalla ja 50 denoisingsvaiheella. Kohdennettu taustaväri oli vihreä, josta tuli dominoiva poistomenetelmä.

Uusi lähestymistapa verrattiin DeepFloydiin MAGICKin asetuksilla; hienosäädettyyn alhaisen sijainnin diffuusiomalliin GreenBack LoRAan; ja myös edellä mainittuun LayerDiffuseen.

3000 kuvaa MAGICKin aineistosta käytettiin datana.

Esimerkkejä MAGICKin aineistosta, josta 3000 kuvaa valittiin uuden järjestelmän testaamiseen. Lähde: https://ryanndagreat.github.io/MAGICK/Explorer/magick_rgba_explorer.html

Esimerkkejä MAGICKin aineistosta, josta 3000 kuvaa valittiin uuden järjestelmän testaamiseen. Lähde: https://ryanndagreat.github.io/MAGICK/Explorer/magick_rgba_explorer.html

Mittareina käytettiin Fréchet Inception Distanceiä (FID) etualan laadun arvioimiseen. He myös kehittivät projektiin liittyvän mittarin nimeltä m-FID, joka käyttää BiRefNet-järjestelmää arvioidakseen tuloksesta saatavan maskin laatu.

Visuaaliset vertailut BiRefNet-järjestelmän ja aiempien menetelmien välillä. Lähde: https://arxiv.org/pdf/2401.03407

Visuaaliset vertailut BiRefNet-järjestelmän ja aiempien menetelmien välillä. Lähde: https://arxiv.org/pdf/2401.03407

Testataksesi semanttista yhdenmukaisuutta syötteen kanssa, CLIP-Sentence (CLIP-S) ja CLIP-Image (CLIP-I) -menetelmiä käytettiin. CLIP-S arvioi ohjeiden uskollisuutta, ja CLIP-I visuaalista samankaltaisuutta todellisuuden kanssa.

Ensimmäinen joukko laadullisia tuloksia uudesta menetelmästä, tällä kertaa Stable Diffusion V1.5:lle. Viittaa lähde-PDF:hen paremman resoluution vuoksi.

Ensimmäinen joukko laadullisia tuloksia uudesta menetelmästä, tällä kertaa Stable Diffusion V1.5:lle. Viittaa lähde-PDF:hen paremman resoluution vuoksi.

Tekijät väittävät, että tulokset (visualisoidut yllä ja alla, SD1.5 ja SDXL) osoittavat, että TKG-DM saavuttaa parempia tuloksia ilman ohjeiden suunnittelua tai mallin koulutus- tai hienosäätötarvetta.

SDXL:n laadulliset tulokset. Viittaa lähde-PDF:hen paremman resoluution vuoksi.

SDXL:n laadulliset tulokset. Viittaa lähde-PDF:hen paremman resoluution vuoksi.

He huomaavat, että kun ohje kroma-avaimelle annetaan, Stable Diffusion 1.5:llä on vaikeuksia tuottaa puhdas tausta, kun taas SDXL (joka suoriutuu hieman paremmin) tuottaa epävakaita vaaleita vihreitä sävyjä, jotka voivat häiritä kroma-prosessin erottamista.

He huomaavat myös, että vaikka LayerDiffuse tuottaa hyvin eriytyneitä taustoja, se joskus menettää yksityiskohtia, kuten tarkkoja numeroita tai kirjaimia, ja he toteavat, että tämä johtuu rajoituksista aineistossa. He lisäävät, että maskin generointi epäonnistuu joskus, mikä johtaa “leikkaamattomiin” kuviin.

Laadullisissa testeissä, vaikka LayerDiffuse näyttää olevan etuoikeutettu SDXL:ssä FID:ssä, tekijät korostavat, että tämä on erityisen koulutetun aineiston seuraus, joka käytännössä muodostaa “leivitetyn” ja joustamattoman tuotteen. Mikä tahansa aineisto, jota ei ole kattavasti tai riittävästi edustettuina tässä aineistossa, ei välttämättä suoriudu yhtä hyvin, ja edelleen hienosäätö uusille luokille asettaa käyttäjälle kuraamis- ja koulutuskuorman.

Määrälliset vertailutulokset. LayerDiffusen ilmeinen etu, artikkeli viittaa, tulee joustavuuden ja koulutusresurssien kustannuksella.

Määrälliset vertailutulokset. LayerDiffusen ilmeinen etu, artikkeli viittaa, tulee joustavuuden ja koulutusresurssien kustannuksella.

Artikkeli toteaa:

‘DeepFloyd’n korkeat FID-, m-FID- ja CLIP-I -tulokset heijastavat sen samankaltaisuutta todellisuuden kanssa DeepFloyd’n tuloksien perusteella. Kuitenkin tämä samankaltaisuus antaa sille luonnollisen etun, mikä tekee siitä epäreilun vertailun kuvanlaadun kannalta. Sen alempi CLIP-S -tulos osoittaa heikompaa tekstien yhdenmukaisuutta muihin malleihin verrattuna.’

‘Kaiken kaikkiaan nämä tulokset korostavat mallimme kykyä tuottaa laadukkaita, tekstien mukaisia etualoja ilman koulutusta, tarjoten tehokkaan kroma-avain sisällön generoimisen ratkaisun.’

Lopulta tutkijat suorittivat käyttäjätutkimuksen arvioidakseen ohjeiden noudattamista eri menetelmissä. Sata osallistujaa pyydettiin arvioimaan 30 kuvaparia kustakin menetelmästä, joissa kohteet oli poistettu BiRefNetillä ja manuaalisilla hienosäätöillä kaikissa esimerkeissä. Tekijöiden harjoitteluvapaa lähestymistapa suosittiin tässä tutkimuksessa.

Tulokset käyttäjätutkimuksesta.

Tulokset käyttäjätutkimuksesta.

TKG-DM on yhteensopiva suositun ControlNet -kolmannen osapuolen järjestelmän kanssa Stable Diffusionille, ja tekijät väittävät, että se tuottaa parempia tuloksia kuin ControlNetin omat kyvyt saavuttaa tällainen erottelu.

Johtopäätös

Ehkä merkittävin johtopäätös tästä uudesta artikkelista on latenttisten diffuusiomallien sekaantumisen laajuus, vastakohtana yleiselle yleisön käsitykselle, jonka mukaan ne voivat helposti erottaa kuvien ja videoiden osia generoidessaan uutta sisältöä.

Tutkimus korostaa myös tutkimus- ja harrastajayhteisön suuntautumista hienosäätöön jälkikäteen ratkaisuksi mallien puutteille – ratkaisu, joka aina kohdistuu tiettyihin luokkiin tai tietynluokkaisiin objekteihin. Tällaisessa skenaariossa hienosäätömalli toimii erittäin hyvin rajoitettujen luokkien osalla tai toleroiden hyvin suuremmalla määrällä mahdollisia luokkia ja objekteja, riippuen koulutusaineistojen määrästä.

Tämän vuoksi on virkistävää nähdä ainakin yksi ratkaisu, joka ei riipu tällaisista työllisistä ja kyseenalaisista ratkaisuista.

 

* Vuoden 1978 elokuvan Superman kuvaamisen aikana, näyttelijä Christopher Reeve joutui pukeutumaan turkoosiin Superman -pukuun sinisen taustaprosessin kuvaamiseen, jotta ikoninen sininen puku ei olisi poistunut. Puvun sininen väri palautettiin myöhemmin värikkaiden sävyjen avulla.

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: [email protected]