Andersons vinkel

Forbedring av Grønn Skjerm-Generering for Stabil Diffusjon

mm
Legg til Unite.AI blant dine foretrukne kilder på Google
Diverse Stable Diffusion green screen-based prompts, https://stablediffusionweb.com/

Til tross for entusiasme og investorer rundt visuell generativ AI, er utdataene fra slike systemer ikke alltid klare for virkelighetsbruk; et eksempel er at gen AI-systemer tenderer til å utgi hele bilder (eller en rekke bilder, i tilfelle av video), snarere enn enkelte, isolerte elementer som vanligvis kreves for diverse anvendelser i multimedia, og for visuelle effekter-utøvere.

Et enkelt eksempel på dette er klipp-kunst designet for å ‘flyte’ over hva som helst bakgrunn som brukeren har valgt:

Eksempler på alfa-kanaler, med deres effekter avbildet i nedre rad. Kilde: https://helpx.adobe.com/photoshop/using/saving-selections-alpha-channel-masks.html

Eksempler på alfa-kanaler, med deres effekter avbildet i nedre rad. Kilde: https://helpx.adobe.com/photoshop/using/saving-selections-alpha-channel-masks.html

Dropp ut

I datavisualisering, skapes alfa-kanaler innenfor semantisk segmentering, med åpne kildeprosjekter som Meta’s Segment Anything som gir en tekst-promptabel metode for å isolere/ trekke ut målobjekt, gjennom semantisk forbedret objekterkjennelse.

Segment Anything-rammeverket har blitt brukt i en rekke visuelle effekter-utvinning og isoleringsarbeidsflyter, som Alpha-CLIP-prosjektet.

Eksempler på utvinning ved hjelp av Segment Anything, i Alpha-CLIP-rammeverket: Kilde: https://arxiv.org/pdf/2312.03818

Eksempler på utvinning ved hjelp av Segment Anything, i Alpha-CLIP-rammeverket: Kilde: https://arxiv.org/pdf/2312.03818

Det finnes mange alternative semantiske segmenteringsmetoder som kan tilpasses oppgaven med å tildele alfa-kanaler.

Likevel, semantisk segmentering avhenger av trent data som kanskje ikke inneholder alle kategorier av objekter som må trekkes ut. Selv om modeller trent på svært store datamengder kan aktivere en bredere rekke objekter å bli gjenkjent (i virkeligheten blir grunnleggende modeller eller verdensmodeller), er de likevel begrenset av klassene de er trent til å gjenkjenne mest effektivt.

Semantisk segmenteringssystemer som Segment Anything kan ha vanskeligheter med å identifisere visse objekter, eller deler av objekter, som vist her i utdata fra tvetydige promter. Kilde: https://maucher.pages.mi.hdm-stuttgart.de/orbook/deeplearning/SAM.html

Semantisk segmenteringssystemer som Segment Anything kan ha vanskeligheter med å identifisere visse objekter, eller deler av objekter, som vist her i utdata fra tvetydige promter. Kilde: https://maucher.pages.mi.hdm-stuttgart.de/orbook/deeplearning/SAM.html

I alle fall, er semantisk segmentering like mye en post facto prosess som en grønnskjerm-prosess, og må isolere elementer uten fordelen av en enkelt stripe bakgrunnsfarge som kan bli effektivt gjenkjent og fjernet.

Av denne grunn, har det noen ganger skjedd for brukersamfunnet at bilder og videoer kan bli generert med grønnskjerm-bakgrunner som kan bli fjernet på vanlig måte.

Uheldigvis, har populære latent diffusjonsmodeller som Stabil Diffusjon noen ganger vanskeligheter med å rendre en virkelig levende grønnskjerm. Dette skyldes at modellens treningsdata vanligvis ikke inneholder mange eksempler på denne ganske spesialiserte scenariet. Selv når systemet lykkes, har ideen om ‘grønn’ en tendens til å spre seg på en uønsket måte til forgrunnsobjektet, på grunn av konsept entanglement:

Ovenfor ser vi at Stabil Diffusjon har prioritet autentisitet av bilde over behovet for å skape en enkelt intensitet av grønn, effektivt replikerer virkelige verdensproblemer som oppstår i tradisjonelle grønnskjerm-scenarier. Under ser vi at 'grønn'-konseptet har forurenset forgrunnsbildet. Jo mer prompten fokuserer på 'grønn'-konseptet, jo verre vil dette problemet sannsynligvis bli. Kilde: https://stablediffusionweb.com/

Ovenfor ser vi at Stabil Diffusjon har prioritet autentisitet av bilde over behovet for å skape en enkelt intensitet av grønn, effektivt repliserer virkelige verdensproblemer som oppstår i tradisjonelle grønnskjerm-scenarier. Under ser vi at ‘grønn’-konseptet har forurenset forgrunnsbildet. Jo mer prompten fokuserer på ‘grønn’-konseptet, jo verre vil dette problemet sannsynligvis bli. Kilde: https://stablediffusionweb.com/

Til tross for de avanserte metodene i bruk, ville både kvinnenens kjole og mannens slips (i de nedre bildene ovenfor) tendere til å ‘drope ut’ sammen med den grønne bakgrunnen – et problem som går tilbake* til dagene med foto-kjemiske prosesser og optiske skrivere i 1970- og 1980-årene.

Som alltid, kan modellens mangler overvinnes ved å kaste spesifikke data på et problem, og å bruke betydelige treningsressurser. Systemer som Stanford’s 2024-tilbud LayerDiffuse skaper en fine-tuned modell som er i stand til å generere bilder med alfa-kanaler:

Stanford LayerDiffuse-prosjektet ble trent på en million passende bilder som kunne gi modellen transparenskapasiteter. Kilde: https://arxiv.org/pdf/2402.17113

Stanford LayerDiffuse-prosjektet ble trent på en million passende bilder som kunne gi modellen transparenskapasiteter. Kilde: https://arxiv.org/pdf/2402.17113

Uheldigvis, i tillegg til de betydelige kurering- og treningsressursene som kreves for denne tilnærmingen, er datasett som ble brukt for LayerDiffuse ikke offentlig tilgjengelig, og begrenser bruken av modeller trent på det. Selv om denne hindringen ikke eksisterte, er denne tilnærmingen vanskelig å tilpasse eller utvikle for spesifikke anvendelser.

Litt senere i 2024, samarbeidet Adobe Research med Stonybrook University for å produsere MAGICK, en AI-utvinningstilnærming trent på egenskapt diffusjonsbilder.

Fra 2024-papiret, et eksempel på fin-grå alfa-kanal-utvinning i MAGICK. Kilde: https://openaccess.thecvf.com/content/CVPR2024/papers/Burgert_MAGICK_A_Large-scale_Captioned_Dataset_from_Matting_Generated_Images_using_CVPR_2024_paper.pdf

Fra 2024-papiret, et eksempel på fin-grå alfa-kanal-utvinning i MAGICK. Kilde: https://openaccess.thecvf.com/content/CVPR2024/papers/Burgert_MAGICK_A_Large-scale_Captioned_Dataset_from_Matting_Generated_Images_using_CVPR_2024_paper.pdf

150 000 uttrukne, AI-genererte objekter ble brukt til å trene MAGICK, så systemet ville utvikle en intuitiv forståelse av utvinning:

Eksempler fra MAGICK-treningsdatasettet.

Eksempler fra MAGICK-treningsdatasettet.

Dette datasettet, som kilde-papiret sier, var svært vanskelig å generere på grunn av den nevnte årsaken – at diffusjonsmetoder har vanskeligheter med å skape solide, nøkkelbare farger. Derfor var manuell seleksjon av de genererte mattene nødvendig.

Denne logistiske flaskenalen fører igjen til et system som ikke kan utvikles eller tilpasses lett, men må brukes innenfor sin opprinnelige treningsomfang.

TKG-DM – ‘Native’ Chroma Extraction for a Latent Diffusion Model

Et nytt samarbeid mellom tyske og japanske forskere har foreslått en alternativ til slike treningsmetoder, i stand til å oppnå bedre resultater enn ovennevnte metoder, uten å treningsdataene på spesialkurerte datasett.

TKG-DM endrer det tilfeldige støyen som seeds en generativt bilde så det er bedre i stand til å produsere en solid, nøkkelbar bakgrunn – i noen farge. Kilde: https://arxiv.org/pdf/2411.15580

TKG-DM endrer det tilfeldige støyen som seeds en generativt bilde så det er bedre i stand til å produsere en solid, nøkkelbar bakgrunn – i noen farge. Kilde: https://arxiv.org/pdf/2411.15580

Den nye metoden nærmer seg problemet på genereringsnivå, ved å optimere tilfeldig støy fra hvilken et bilde genereres i en latent diffusjonsmodell (LDM) som Stabil Diffusjon.

Tilnærmingen bygger på en tidligere undersøkelse av fargeskjemaet til en Stabil Diffusjonsfordeling, og er i stand til å produsere bakgrunnsfarge av noen type, med mindre (eller ingen) entanglement av nøkkelbakgrunnsfarge inn i forgrunnsinnhold, sammenlignet med andre metoder.

Initial støy er betinget av en kanal-gjennomsnittsforSky som kan påvirke aspekter av denøyningprosessen, uten å entangle fargesignalet inn i forgrunnsinnholdet.

Initial støy er betinget av en kanal-gjennomsnittsforSky som kan påvirke aspekter av denøyningprosessen, uten å entangle fargesignalet inn i forgrunnsinnholdet.

Papiret sier:

‘Våre omfattende eksperimenter viser at TKG-DM forbedrer FID og mask-FID-poeng med 33,7% og 35,9%, henholdsvis.

‘Derfor er vår treningsfrie modell like god som fine-tuned modeller, og tilbyr en effektiv og fleksibel løsning for ulike visuelle innholdsskapingsoppgaver som krever presis forgrunn og bakgrunnskontroll. ‘

Den nye papiret heter TKG-DM: Treningsfri Chroma Key Innholdsgenerering Diffusjonsmodell, og kommer fra syv forskere på Hosei University i Tokyo og RPTU Kaiserslautern-Landau & DFKI GmbH, i Kaiserslautern.

Metode

Den nye tilnærmingen utvider arkitekturen til Stabil Diffusjon ved å betinge den initielle Gaussiske støyen gjennom en kanal gjennomsnittsforSky (CMS), som produserer støymønster designet til å fremme ønsket bakgrunn/forgrunn-separasjon i det genererte resultatet.

Skjema for arbeidsflyten til det foreslåtte systemet.

Skjema for det foreslåtte systemet.

CMS justerer gjennomsnittet av hver fargekanal mens den generelle utviklingen av denøyningprosessen opprettholdes.

Forfatterne forklarer:

‘For å generere forgrunnsobjektet på chroma-nøkkelbakgrunnen, anvender vi en init støy-seleksjonsstrategi som selektivt kombinerer den initielle [støy] og den init farge [støy] ved hjelp av en 2D Gaussisk [maske].

‘Denne masken skaper en gradvis overgang ved å bevare den opprinnelige støyen i forgrunnsområdet og anvende farge-forSkyt støyen til bakgrunnsområdet.’

Den ønskede fargekanalen for bakgrunnschromafargen er instantiert med en null-tekstprompt, mens det faktiske forgrunnsinnholdet er skapt semantisk fra brukerens tekstinstruksjon.

Den ønskede fargekanalen for bakgrunnschromafargen er instantiert med en null-tekstprompt, mens det faktiske forgrunnsinnholdet er skapt semantisk fra brukerens tekstinstruksjon.

Selv-oppmerksomhet og kryss-oppmerksomhet brukes til å skille de to aspektene av bildet (chroma-bakgrunnen og forgrunnsinnholdet). Selv-oppmerksomhet hjelper med intern konsistens av forgrunnsobjektet, mens kryss-oppmerksomhet opprettholder trofasthet til tekstprompten. Papiret påpeker at siden bakgrunnsbilder vanligvis er mindre detaljerte og betonet i genereringer, er deres svakere innflytelse relativt enkel å overvinne og erstatte med en stripe ren farge.

En visualisering av påvirkningen av selv-oppmerksomhet og kryss-oppmerksomhet i chroma-stil-genereringsprosessen.

En visualisering av påvirkningen av selv-oppmerksomhet og kryss-oppmerksomhet i chroma-stil-genereringsprosessen.

Data og tester

TKG-DM ble testet ved hjelp av Stabil Diffusjon V1.5 og Stabil Diffusjon SDXL. Bilder ble generert i 512x512px og 1024x1024px, henholdsvis.

Bilder ble skapt ved hjelp av DDIM-scheduler som er innbygget i Stabil Diffusjon, med en veiledningsskala på 7,5, med 50 denøyningstrinn. Den målrettede bakgrunnsfargen var grønn, nå den dominante dropout-metoden.

Den nye tilnærmingen ble sammenlignet med DeepFloyd, under innstillingene som ble brukt for MAGICK; til den fine-tuned lav-rang diffusjonsmodell GreenBack LoRA; og også til den ovennevnte LayerDiffuse.

For data, ble 3000 bilder fra MAGICK-datasettet brukt.

Eksempler fra MAGICK-datasettet, fra hvilke 3000 bilder ble kurert i tester for det nye systemet. Kilde: https://ryanndagreat.github.io/MAGICK/Explorer/magick_rgba_explorer.html

Eksempler fra MAGICK-datasettet, fra hvilke 3000 bilder ble kurert i tester for det nye systemet. Kilde: https://ryanndagreat.github.io/MAGICK/Explorer/magick_rgba_explorer.html

For målinger, ble Fréchet Inception Distance (FID) brukt til å vurdere forgrunnskvalitet. De utviklet også en prosjektspesifikk måling kalt m-FID, som bruker BiRefNet-systemet til å vurdere kvaliteten på den resulterende masken.

Visuelle sammenligninger av BiRefNet-systemet mot tidligere metoder. Kilde: https://arxiv.org/pdf/2401.03407

Visuelle sammenligninger av BiRefNet-systemet mot tidligere metoder. Kilde: https://arxiv.org/pdf/2401.03407

Til å teste semantisk sammenstilling med inndata-promptene, ble CLIP-Setning (CLIP-S) og CLIP-Bilde (CLIP-I) metoder brukt. CLIP-S vurderer prompt-trofasthet, og CLIP-I den visuelle likheten til grunn-sannheten.

Første sett med kvalitative resultater for den nye metoden, denne gangen for Stabil Diffusjon V1.5. Vennligst se kilde-PDF for bedre oppløsning.

Første sett med kvalitative resultater for den nye metoden, denne gangen for Stabil Diffusjon V1.5. Vennligst se kilde-PDF for bedre oppløsning.

Forfatterne hevder at resultatene (visualisert ovenfor og under, SD1.5 og SDXL, henholdsvis) demonstrerer at TKG-DM oppnår bedre resultater uten prompt-engineering eller nødvendighet for å trene eller fine-tune en modell.

SDXL kvalitative resultater. Vennligst se kilde-PDF for bedre oppløsning.

SDXL kvalitative resultater. Vennligst se kilde-PDF for bedre oppløsning.

De observerer at med en prompt til å fremme en grønn bakgrunn i de genererte resultatene, har Stabil Diffusjon 1.5 vanskeligheter med å generere en ren bakgrunn, mens SDXL (selv om den utfører litt bedre) produserer ustabile lysegrønne nyanser som kan interferere med separasjon i en chroma-prosess.

De påpeker videre at selv om LayerDiffuse genererer godt adskilte bakgrunner, mister den noen ganger detaljer, som nøyaktige tall eller bokstaver, og forfatterne tilskriver dette begrensninger i datasettet. De legger til at mask-generering også noen ganger feiler, noe som fører til ‘ukuttede’ bilder.

For kvantitative tester, selv om LayerDiffuse åpenbart har en fordel i SDXL for FID, understreker forfatterne at dette er et resultat av et spesialisert datasett som effektivt utgjør en ‘bakt’ og ikke-fleksibel produkt. Som nevnt tidligere, kan noen objekter eller klasser som ikke er dekket i dette datasettet, eller ikke dekket tilstrekkelig, kanskje ikke fungere like godt, mens videre fine-tuning for å akkommodere nye klasser presenterer brukeren med en kurering- og treningsbyrde.

Kvantitative resultater for sammenligningene. LayerDiffuse's åpenbare fordel, papiret antyder, kommer på bekostning av fleksibilitet, og byrden av datakurering og -treningsressurser.

Kvantitative resultater for sammenligningene. LayerDiffuse’s åpenbare fordel, papiret antyder, kommer på bekostning av fleksibilitet, og byrden av datakurering og -treningsressurser.

Papiret sier:

‘DeepFloyd’s høye FID, m-FID, og CLIP-I-poeng reflekterer likheten til grunn-sannheten basert på DeepFloyd’s utdata. Likevel, gir denne sammenstillingen en innebygd fordel, noe som gjør det uegnet som en rettferdig benchmark for bildekvalitet. Dens lavere CLIP-S-poeng indikerer også svakere tekst-sammenstilling sammenlignet med andre modeller.

Samlet sett understreker disse resultatene modellens evne til å generere høykvalitets, tekst-orienterte forgrunner uten fine-tuning, og tilbyr en effektiv chroma-nøkkel-innholdsgenereringsløsning.’

Til slutt, gjennomførte forskerne en brukerstudie for å vurdere prompt-adherens over ulike metoder. 100 deltakere ble bedt om å vurdere 30 bildepar fra hver metode, med objekter uttrukket ved hjelp av BiRefNet og manuelle forbedringer over alle eksempler. Forfatternes treningsfrie tilnærming ble foretrukket i denne studien.

Resultater fra brukerstudien.

Resultater fra brukerstudien.

TKG-DM er kompatibelt med det populære ControlNet tredjeparts-system for Stabil Diffusjon, og forfatterne hevder at det produserer bedre resultater enn ControlNet’s innbyggede evne til å oppnå denne typen separasjon.

Konklusjon

Kanskje det mest bemerkelsesverdige takeaway fra denne nye papiret er omfanget av hvilken latent diffusjonsmodeller er entangled, i motsetning til den populære offentlige oppfatningen av at de kan lett skille aspekter av bilder og videoer når de genererer nytt innhold.

Studien understreker også omfanget av hvilken forsknings- og hobbyist-samfunnet har vendt seg til fine-tuning som en post facto løsning for modellens mangler – en løsning som alltid vil adresse spesifikke klasser og typer objekter. I en slik situasjon, vil en fine-tuned modell enten fungere svært godt på en begrenset mengde klasser, eller fungere tålerbart godt på en mye større mengde mulige klasser og objekter, ifølge større mengder data i treningssettene.

Derfor er det friskt å se at det minst en løsning som ikke avhenger av slike arbeidskrevende og tvilsomme løsninger.

 

* Under innspillingen av 1978-filmen Superman, ble skuespilleren Christopher Reeve pålagt å bære en turkis Superman-drakt for blåskjerm-prosessbilder, for å unngå at den ikoniske blå drakten ble slettet. Draktens blå farge ble senere restaurert via farge-justering.

Forfatter innen maskinlæring, domenespesialist i menneskeskildringssyntese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, inntil det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: [email protected]