Andersons vinkel
FÃķrbÃĪttring av Green Screen Generation fÃķr Stable Diffusion

Trots entusiasm frÃĨn samhÃĪllet och investerare kring visuell generativ AI, ÃĪr utdata frÃĨn sÃĨdana system inte alltid redo fÃķr anvÃĪndning i den verkliga vÃĪrlden; ett exempel ÃĪr att gen AI-system tenderar att producera hela bilder (eller en serie bilder, i fallet med video), snarare ÃĪn enskilda, isolerade element som vanligtvis krÃĪvs fÃķr olika tillÃĪmpningar inom multimedia och fÃķr visuella effekter.
Ett enkelt exempel pÃĨ detta ÃĪr klipp- konst som ÃĪr utformad fÃķr att âflytaâ Ãķver valfri bakgrund som anvÃĪndaren har valt:

Den ljust grÃĨa rutiga bakgrunden, som kanske ÃĪr mest bekant fÃķr Photoshop-anvÃĪndare, har kommit att representera alfa-kanalen eller transparenskanalen, ÃĪven i enkla konsumentartiklar som lagerbilder.
Transparens av detta slag har varit allmÃĪnt tillgÃĪnglig i Ãķver trettio ÃĨr; sedan den digitala revolutionen i bÃķrjan av 1990-talet har anvÃĪndare kunnat extrahera element frÃĨn video och bilder genom en alltmer sofistikerad serie verktyg och tekniker.
Till exempel var utmaningen att âslÃĪppa utâ blÃĨskÃĪrm och grÃķn skÃĪrm-bakgrunder i videofilm, som tidigare var ett dyrt och tidskrÃĪvande arbete med kemiska processer och optiska skrivare (samt handgjorda mattor), blev nu ett arbete som kunde utfÃķras pÃĨ nÃĨgra minuter med system som Adobe After Effects och Photoshop (bland mÃĨnga andra fria och proprietÃĪra program och system).
NÃĪr ett element har isolerats, tillÃĨter en alfa-kanal (i princip en mask som dÃķljer allt icke-relevant innehÃĨll) att varje element i videon kan lÃĪggas Ãķver nya bakgrunder eller komponeras med andra isolerade element.

Exempel pÃĨ alfa-kanaler, med deras effekter avbildade i den nedre raden. KÃĪlla: https://helpx.adobe.com/photoshop/using/saving-selections-alpha-channel-masks.html
SlÃĪppa ut
I datorseende faller skapandet av alfa-kanaler under semantisk segmentering, med Ãķppen kÃĪllkodsprojekt som Metas Segment Anything som tillhandahÃĨller en textpromptbar metod fÃķr att isolera/extrahera mÃĨlobjekt, genom semantiskt fÃķrbÃĪttrad objekterkÃĪnning.
Segment Anything-ramverket har anvÃĪnts i en mÃĪngd olika visuella effekter och extraktionsarbetsflÃķden, sÃĨsom Alpha-CLIP-projektet.

Exempel pÃĨ extraktioner med Segment Anything, i Alpha-CLIP-ramverket: KÃĪlla: https://arxiv.org/pdf/2312.03818
Det finns mÃĨnga alternativa semantiska segmenteringsmetoder som kan anpassas fÃķr uppgiften att tilldela alfa-kanaler.
Men semantisk segmentering bygger pÃĨ trÃĪningsdata som kanske inte innehÃĨller alla kategorier av objekt som behÃķver extraheras. Ãven om modeller som trÃĪnats pÃĨ mycket stora datamÃĪngder kan mÃķjliggÃķra en bredare variation av objekt som kan erkÃĪnnas (i princip blir de grundlÃĪggande modeller eller vÃĪrldsmodeller), ÃĪr de ÃĪndÃĨ begrÃĪnsade av de klasser som de trÃĪnats fÃķr att kÃĪnna igen mest effektivt.

Semantiska segmenteringssystem som Segment Anything kan ha svÃĨrt att identifiera vissa objekt eller delar av objekt, som visas hÃĪr i utdata frÃĨn tvetydiga prompter. KÃĪlla: https://maucher.pages.mi.hdm-stuttgart.de/orbook/deeplearning/SAM.html
I alla fall ÃĪr semantisk segmentering lika mycket en post facto-process som en grÃķn skÃĪrm-procedur, och mÃĨste isolera element utan fÃķrdelen av en enda swathe av bakgrunds fÃĪrg som kan erkÃĪnnas och tas bort.
FÃķr denna anledning har det ibland fÃķreslagits att bilder och videor kunde genereras med grÃķn skÃĪrm-bakgrunder som kunde tas bort pÃĨ konventionellt sÃĪtt.
TyvÃĪrr har populÃĪra latent diffusionsmodeller som Stable Diffusion ofta svÃĨrt att rendera en riktigt livlig grÃķn skÃĪrm. Detta beror pÃĨ att modellens trÃĪningsdata inte vanligtvis innehÃĨller mÃĨnga exempel pÃĨ denna ganska specialiserade scenario. Ãven nÃĪr systemet lyckas tenderar idÃĐn om âgrÃķnâ att spridas pÃĨ ett ovÃĪntat sÃĪtt till fÃķrgrundsobjektet, pÃĨ grund av koncept sammanflÃĪtning:

Ovan ser vi att Stable Diffusion har prioriterat autenticitet i bilden Ãķver behovet av att skapa en enda intensitet av grÃķn, effektivt replikerande realvÃĪrldens problem som uppstÃĨr i traditionella grÃķn skÃĪrm-scenarier. Nedan ser vi att âgrÃķnâ-konceptet har fÃķrorenat fÃķrgrunds bilden. Ju mer prompten fokuserar pÃĨ âgrÃķnâ-konceptet, desto vÃĪrre kommer detta problem att bli. KÃĪlla: https://stablediffusionweb.com/
Trots de avancerade metoderna som anvÃĪnds, skulle bÃĨde kvinnans klÃĪnning och mannens slips (i de nedre bilderna ovan) tendera att âslÃĪppa utâ tillsammans med den grÃķna bakgrunden â ett problem som gÃĨr tillbaka till dagarna med foto kemiska processer och optiska skrivare pÃĨ 1970- och 1980-talen.
Som alltid kan modellens brister Ãķvervinnas genom att kasta specifik data pÃĨ problemet och ÃĪgna betydande trÃĪningsresurser. System som Stanfords 2024-erbjudande LayerDiffuse skapar en finjusterad modell som kan generera bilder med alfa-kanaler:

Stanfords LayerDiffuse-projekt trÃĪnades pÃĨ en miljon lÃĪmpliga bilder som kunde ge modellen transparensfÃķrmÃĨga. KÃĪlla: https://arxiv.org/pdf/2402.17113
TyvÃĪrr, fÃķrutom de betydande urval- och trÃĪningsresurser som krÃĪvs fÃķr denna metod, ÃĪr dataset som anvÃĪndes fÃķr LayerDiffuse inte offentligt tillgÃĪngligt, vilket begrÃĪnsar anvÃĪndningen av modeller som trÃĪnats pÃĨ det. Ãven om detta hinder inte fanns, ÃĪr denna metod svÃĨr att anpassa eller utveckla fÃķr specifika anvÃĪndningsfall.
Lite senare 2024 samarbetade Adobe Research med Stonybrook University fÃķr att producera MAGICK, en AI-extraktionsmetod trÃĪnad pÃĨ anpassade diffusionsbilder.

FrÃĨn 2024-papperet, ett exempel pÃĨ finbearbetad alfa-kanal-extraktion i MAGICK. KÃĪlla: https://openaccess.thecvf.com/content/CVPR2024/papers/Burgert_MAGICK_A_Large-scale_Captioned_Dataset_from_Matting_Generated_Images_using_CVPR_2024_paper.pdf
150 000 extraherade, AI-genererade objekt anvÃĪndes fÃķr att trÃĪna MAGICK, sÃĨ att systemet skulle utveckla en intuitiv fÃķrstÃĨelse fÃķr extraktion:

Exempel frÃĨn MAGICK-trÃĪningsdatasetet.
Denna dataset, som kÃĪllpapperet anger, var mycket svÃĨr att generera pÃĨ grund av att diffusionsmetoder har svÃĨrt att skapa solida, nyckelbara fÃĪrger. DÃĪrfÃķr var manuell urval av de genererade mattorna nÃķdvÃĪndig.
Denna logistiska flaskhals leder ÃĨterigen till ett system som inte kan utvecklas eller anpassas lÃĪtt, utan mÃĨste anvÃĪndas inom dess ursprungliga trÃĪningsomrÃĨde.
TKG-DM â âNativeâ Chroma Extraction fÃķr en Latent Diffusionsmodell
Ett nytt samarbete mellan tyska och japanska forskare har fÃķreslagit ett alternativ till sÃĨdana trÃĪnade metoder, som kan â enligt papperet â uppnÃĨ bÃĪttre resultat ÃĪn de ovan nÃĪmnda metoderna, utan behov av att trÃĪna pÃĨ sÃĪrskilt kuraterade dataset.

TKG-DM ÃĪndrar det slumpmÃĪssiga bruset som initierar en genererad bild sÃĨ att det blir bÃĪttre kapabelt att producera en solid, nyckelbar bakgrund â i vilken fÃĪrg som helst. KÃĪlla: https://arxiv.org/pdf/2411.15580
Den nya metoden nÃĪrmar sig problemet pÃĨ generationsnivÃĨ, genom att optimera det slumpmÃĪssiga bruset frÃĨn vilket en bild genereras i en latent diffusionsmodell (LDM) som Stable Diffusion.
TillvÃĪgagÃĨngssÃĪttet bygger pÃĨ en tidigare undersÃķkning av fÃĪrgschemat i en Stable Diffusion-distribution, och kan producera bakgrunds fÃĪrg av alla slag, med mindre (eller inget) sammanflÃĪtning av den nyckelbara bakgrunds fÃĪrgen in i fÃķrgrunds innehÃĨll, jÃĪmfÃķrt med andra metoder.

Initialt brus konditionerat av en kanalmedelshift som kan pÃĨverka aspekter av den avbrusningsprocessen, utan att sammanflÃĪta fÃĪrgsignalen in i fÃķrgrunds innehÃĨllet.
Papperet anger:
âVÃĨra omfattande experiment visar att TKG-DM fÃķrbÃĪttrar FID och mask-FID-poÃĪng med 33,7% respektive 35,9%.
âSÃĨledes ÃķvertrÃĪffar vÃĨr trÃĪningsfri modell finjusterade modeller, och erbjuder en effektiv och mÃĨngsidig lÃķsning fÃķr olika visuella innehÃĨllsskapande uppgifter som krÃĪver exakt fÃķrgrunds- och bakgrunds kontroll. â
Den nya papperet heter TKG-DM: TrÃĪningsfri Chroma Key InnehÃĨlls Generation Diffusionsmodell, och kommer frÃĨn sju forskare Ãķver Hosei University i Tokyo och RPTU Kaiserslautern-Landau & DFKI GmbH, i Kaiserslautern.
Metod
Den nya tillvÃĪgagÃĨngssÃĪttet utvidgar arkitekturen fÃķr Stable Diffusion genom att konditionera det initiala gaussiska bruset genom en kanal medelshift (CMS), som producerar brusmÃķnster som ÃĪr utformade fÃķr att uppmuntra Ãķnskad bakgrunds-/fÃķrgrunds separation i den genererade bilden.

Schema fÃķr det fÃķreslagna systemet.
CMS justerar medelvÃĪrdet fÃķr varje fÃĪrgkanal samtidigt som den allmÃĪnna utvecklingen av avbrusningsprocessen upprÃĪtthÃĨlls.
FÃķrfattarna fÃķrklarar:
âFÃķr att generera fÃķrgrundsobjektet pÃĨ chroma-nyckelbakgrunden, anvÃĪnder vi en initbrusvalstrategi som selektivt kombinerar det initiala [bruset] och initfÃĪrg[bruset] med hjÃĪlp av en 2D-gaussisk [mask].
âDenna mask skapar en gradvis ÃķvergÃĨng genom att bevara det ursprungliga bruset i fÃķrgrundsomrÃĨdet och applicera fÃĪrgskiftat brus till bakgrundsomrÃĨdet.â

FÃĪrgkanalen som Ãķnskas fÃķr bakgrundschromafÃĪrgen initieras med en null-textprompt, medan den faktiska fÃķrgrunds innehÃĨllet skapas semantiskt frÃĨn anvÃĪndarens textinstruktion.
SjÃĪlvuppmÃĪrksamhet och korsuppmÃĪrksamhet anvÃĪnds fÃķr att separera de tvÃĨ aspekterna av bilden (bakgrundschroma och fÃķrgrunds innehÃĨll). SjÃĪlvuppmÃĪrksamhet hjÃĪlper till med intern konsekvens i fÃķrgrundsobjektet, medan korsuppmÃĪrksamhet upprÃĪtthÃĨller trohet mot textprompten. Papperet pÃĨpekar att eftersom bakgrunds bilder vanligtvis ÃĪr mindre detaljerade och betonade i generationer, ÃĪr deras svagare inflytande relativt lÃĪtt att Ãķvervinna och ersÃĪtta med en swathe av ren fÃĪrg.

En visualisering av inflytandet av sjÃĪlvuppmÃĪrksamhet och korsuppmÃĪrksamhet i chroma-stilgenereringsprocessen.
Data och Tester
TKG-DM testades med Stable Diffusion V1.5 och Stable Diffusion SDXL. Bilder genererades i 512x512px och 1024x1024px, respectively.
Bilder skapades med hjÃĪlp av DDIM-schemat som ÃĪr inbyggt i Stable Diffusion, med en vÃĪgledningsskala pÃĨ 7,5, och 50 avbrusningssteg. Den mÃĨlbakgrunds fÃĪrgen var grÃķn, nu den dominerande dropout-metoden.
Den nya metoden jÃĪmfÃķrdes med DeepFloyd, under de instÃĪllningar som anvÃĪndes fÃķr MAGICK; till den finjusterade lÃĨg-rankdiffusionsmodellen GreenBack LoRA; och ÃĪven till den ovan nÃĪmnda LayerDiffuse.
FÃķr data anvÃĪndes 3000 bilder frÃĨn MAGICK-datasetet.

Exempel frÃĨn MAGICK-datasetet, frÃĨn vilket 3000 bilder valdes ut fÃķr tester av det nya systemet. KÃĪlla: https://ryanndagreat.github.io/MAGICK/Explorer/magick_rgba_explorer.html
FÃķr mÃĨtt anvÃĪndes FrÃĐchet Inception Distance (FID) fÃķr att bedÃķma fÃķrgrunds kvalitet. De utvecklade ocksÃĨ en projektspecifik mÃĨtt som kallas m-FID, som anvÃĪnder BiRefNet-systemet fÃķr att bedÃķma kvaliteten pÃĨ den resulterande masken.

Visuella jÃĪmfÃķrelser av BiRefNet-systemet mot tidigare metoder. KÃĪlla: https://arxiv.org/pdf/2401.03407
FÃķr att testa semantisk anpassning till indata-prompter anvÃĪndes CLIP-Sentence (CLIP-S) och CLIP-Image (CLIP-I)-metoderna. CLIP-S utvÃĪrderar prompttrohet, och CLIP-I den visuella likheten till grund sanning.

FÃķrsta uppsÃĪttningen kvalitativa resultat fÃķr den nya metoden, denna gÃĨng fÃķr Stable Diffusion V1.5. VÃĪnligen se kÃĪll-PDF fÃķr bÃĪttre upplÃķsning.
FÃķrfattarna hÃĪvdar att resultaten (visuellt ovan och nedan, SD1.5 och SDXL, respektive) visar att TKG-DM uppnÃĨr ÃķverlÃĪgsna resultat utan prompt-engineering eller behov av att trÃĪna eller finjustera en modell.

SDXL kvalitativa resultat. VÃĪnligen se kÃĪll-PDF fÃķr bÃĪttre upplÃķsning.
De observerar att med en prompt fÃķr att framkalla en grÃķn bakgrund i de genererade resultaten, har Stable Diffusion 1.5 svÃĨrt att generera en ren bakgrund, medan SDXL (ÃĪven om den presterar lite bÃĪttre) producerar ostabila ljusgrÃķna nyanser som kan stÃķra separationen i en chroma-process.
De noterar vidare att medan LayerDiffuse genererar vÃĪl separerade bakgrunder, fÃķrlorar den ibland detaljer, sÃĨsom exakta siffror eller bokstÃĪver, och fÃķrfattarna tillskriver detta begrÃĪnsningar i datasetet. De tillÃĪgger att maskgenerering ibland misslyckas, vilket leder till âoklipptaâ bilder.
FÃķr kvantitativa tester, ÃĪven om LayerDiffuse tycks ha en fÃķrdel i SDXL fÃķr FID, betonar fÃķrfattarna att detta ÃĪr resultatet av ett specialiserat dataset som i princip utgÃķr en âinbakadâ och icke-flexibel produkt. Som tidigare nÃĪmnts kan alla objekt eller klasser som inte tÃĪcks av detta dataset, eller som inte tÃĪcks tillrÃĪckligt, inte fungera lika bra, medan ytterligare finjustering fÃķr att anpassa sig till nya klasser presenterar anvÃĪndaren med en urvals- och trÃĪningsbÃķrda.

Kvantitativa resultat fÃķr jÃĪmfÃķrelserna. LayerDiffuses tydliga fÃķrdel, enligt papperet, kommer pÃĨ bekostnad av flexibilitet och bÃķrdan av dataurval och trÃĪning.
Papperet anger:
âDeepFloyds hÃķga FID, m-FID och CLIP-I-poÃĪng reflekterar dess likhet med grund sanningen baserat pÃĨ DeepFloyds utdata. Men denna anpassning ger det en inbyggd fÃķrdel, vilket gÃķr det olÃĪmpligt som en rÃĪttvis benchmark fÃķr bildkvalitet. Dess lÃĪgre CLIP-S-poÃĪng indikerar dessutom svagare textanpassning jÃĪmfÃķrt med andra modeller.
Sammanfattningsvis betonar dessa resultat vÃĨr modells fÃķrmÃĨga att generera hÃķgkvalitativa, textanpassade fÃķrgrundsdelar utan finjustering, och erbjuder en effektiv chroma-nyckel-innehÃĨllsgenereringslÃķsning.â
Slutligen genomfÃķrde forskarna en anvÃĪndarstudie fÃķr att utvÃĪrdera promptanpassning Ãķver de olika metoderna. 100 deltagare fick bedÃķma 30 bildpar frÃĨn varje metod, med objekt extraherade med BiRefNet och manuella fÃķrbÃĪttringar Ãķver alla exempel. FÃķrfattarnas trÃĪningsfria tillvÃĪgagÃĨngssÃĪtt fÃķredrogs i denna studie.

Resultat frÃĨn anvÃĪndarstudien.
TKG-DM ÃĪr kompatibelt med det populÃĪra ControlNet-systemet fÃķr Stable Diffusion, och fÃķrfattarna hÃĪvdar att det producerar ÃķverlÃĪgsna resultat jÃĪmfÃķrt med ControlNets naturliga fÃķrmÃĨga att uppnÃĨ denna typ av separation.
Slutsats
Kanske den mest anmÃĪrkningsvÃĪrda slutsatsen frÃĨn detta nya papper ÃĪr den omfattning i vilken latent diffusionsmodeller ÃĪr sammanflÃĪtade, i kontrast till den allmÃĪnna uppfattningen att de kan lÃĪtt separera aspekter av bilder och videor nÃĪr de genererar nytt innehÃĨll.
Studien betonar ytterligare den omfattning i vilken forskar- och hobbyistgemenskapen har vÃĪnt sig till finjustering som en post facto-lÃķsning fÃķr modellernas brister â en lÃķsning som alltid kommer att hantera specifika klasser och typer av objekt. I ett sÃĨdant scenario kommer en finjusterad modell att antingen fungera mycket bra pÃĨ en begrÃĪnsad mÃĪngd klasser, eller ocksÃĨ fungera tillrÃĪckligt bra pÃĨ en mycket stÃķrre mÃĪngd mÃķjliga klasser och objekt, enligt hÃķgre mÃĪngder data i trÃĪningsuppsÃĪttningarna.
DÃĪrfÃķr ÃĪr det uppfriskande att se ÃĨtminstone en lÃķsning som inte fÃķrlitar sig pÃĨ sÃĨdana mÃķdosamma och eventuellt oÃĪrliga lÃķsningar.
Â
* Under inspelningen av filmen Superman frÃĨn 1978, var skÃĨdespelaren Christopher Reeve tvungen att bÃĪra en turkos Superman-kostym fÃķr blÃĨskÃĪrmsprocessbilder, fÃķr att undvika att den ikoniska blÃĨ kostymen skulle raderas. Kostymens blÃĨ fÃĪrg ÃĨterstÃĪlldes senare via fÃĪrgkorrigering.












