Modely a platformy AI
Vylepšení generace zeleného pozadí pro stabilní difuzi

Přestože je kolem vizuálně generativní AI velká komunita a investoři, výstup z těchto systémů není vždy připraven pro použití v reálném světě; jedním z příkladů je, že systémy AI generují celé obrázky (nebo řadu obrázků, v případě videa), místo jednotlivých, izolovaných prvků, které jsou obvykle požadovány pro různé aplikace v multimédiích a pro praktiky vizuálních efektů.
Jednoduchým příkladem je clip-art, který je navržen tak, aby “plaval” nad libovolným cílovým pozadím, které uživatel vybral:

Světle šedá čtvercová pozadí, možná nejznámější uživatelům Photoshopu, se stalo symbolem alfa kanálu, nebo průhledového kanálu, i v jednoduchých spotřebitelských položkách, jako jsou stock obrázky.
Průhlednost tohoto typu je k dispozici již více než třicet let; od digitální revoluce na počátku 90. let mohou uživatelé extrahovat prvky z videa a obrázků pomocí stále sofistikovanějších sad nástrojů a technik.
Například výzva “odstranění” modrých a zelených pozadí ve videu, dříve doménou drahých chemických procesů a optických tiskáren (stejně jako ručně vytvořených matric), se stala prací několika minut v systémech, jako je Adobe’s After Effects a Photoshop aplikace (mezi mnoha dalšími bezplatnými a proprietárními programy a systémy).
Jakmile je prvek izolován, alfa kanál (efektivně maska, která zakrývá jakékoli nežádoucí obsah) umožňuje libovolnému prvku ve videu být snadno superponován nad novými pozadími, nebo komponován s jinými izolovanými prvky.

Příklady alfa kanálů, se svými účinky zobrazenými v dolní řadě. Source: https://helpx.adobe.com/photoshop/using/saving-selections-alpha-channel-masks.html
Odstranění
V počítačovém vidění, vytváření alfa kanálů spadá do kategorie semantické segmentace, s otevřenými projekty, jako je Meta’s Segment Anything, které poskytují textově aktivovatelnou metodu izolace/extrakce cílových objektů, prostřednictvím semanticky vylepšené objektové rozpoznávání.
Framework Segment Anything byl použit v širokém spektru vizuálních efektů extrakčních a izolačních workflow, jako je Alpha-CLIP projekt.

Příklady extrakcí pomocí Segment Anything, v rámci Alpha-CLIP frameworku: Source: https://arxiv.org/pdf/2312.03818
Existuje mnoho alternativních metod semantické segmentace, které lze přizpůsobit úkolu přiřazování alfa kanálů.
Avšak semantická segmentace závisí na trénovaných datech, která nemusí obsahovat všechny kategorie objektů, které jsou požadovány k extrakci. Ačkoli modely trénované na velmi velkých objemech dat mohou umožnit širší rozsah objektů, které lze rozpoznat (efektivně se stávají základními modely, nebo modely světa), jsou nicméně omezeny třídami, které jsou trénovány k rozpoznání nejúčinněji.

Systémy semantické segmentace, jako je Segment Anything, mohou mít potíže s identifikací určitých objektů, nebo částí objektů, jak je ukázáno zde v výstupu z ambivalentních promptů. Source: https://maucher.pages.mi.hdm-stuttgart.de/orbook/deeplearning/SAM.html
V každém případě je semantická segmentace stejně tak post facto proces, jako je procedura zeleného pozadí, a musí izolovat prvky bez výhody jediného swahu pozadí, který lze účinně rozpoznat a odstranit.
Proto se někdy stalo, že uživatelé si uvědomili, že obrázky a videa by mohla být generována se zelenými pozadími, která by mohla být okamžitě odstraněna pomocí konvenčních metod.
Bohužel, populární latentní difuzní modely, jako je Stable Diffusion, často mají potíže s renderováním skutečného zeleného pozadí. To je proto, že trénovací data modelů obvykle neobsahují mnoho příkladů této poměrně specializované scénáře. I když systém uspěje, tendence “zelené” se šíří nechtěně do popředí subjektu, kvůli entanglementu:

Nahoře vidíme, že Stable Diffusion upřednostňuje autentičnost obrazu před potřebou vytvořit jedinou intenzitu zelené, efektivní replikace reálných problémů, které se vyskytují v tradičních scénářích zeleného pozadí. Dole vidíme, že koncept “zelené” znečistil popřední obraz. Čím více se prompt zaměřuje na koncept “zelené”, tím horší bude tento problém. Source: https://stablediffusionweb.com/
Přes pokročilé metody, které se používají, by se šaty ženy a kravata muže (v dolních obrazech nahoře) tendenci “odstranit” spolu se zeleným pozadím – problém, který sahá zpět do dnů fotochemických emulzních barevných odstraňovačů v 70. a 80. letech.
Jako vždy, nedostatky modelu lze překonat tím, že se na problém vrhne specifická data, a že se věnují značné trénovací zdroje. Systémy, jako je Stanford’s 2024 nabídka LayerDiffuse, vytvářejí fine-tuned model, který je schopen generovat obrázky s alfa kanály:

Projekt Stanford LayerDiffuse byl trénován na milionu vhodných obrázků, které jsou schopny vdechnout modelu transparentnost. Source: https://arxiv.org/pdf/2402.17113
Bohužel, kromě značných kurátorských a trénovacích zdrojů, které jsou požadovány pro tento přístup, je dataset použitý pro LayerDiffuse není veřejně dostupný, což omezuje použití modelů trénovaných na něm. I kdyby tato překážka neexistovala, je tento přístup obtížný na přizpůsobení nebo vývoj pro specifické použití.
O něco později v roce 2024, Adobe (ADBE ) Research spolupracoval s Stonybrook University, aby vytvořil MAGICK, AI extrakční přístup trénovaný na vlastních difuzních obrazech.

Z roku 2024, příklad jemné extrakce alfa kanálu v MAGICK. Source: https://openaccess.thecvf.com/content/CVPR2024/papers/Burgert_MAGICK_A_Large-scale_Captioned_Dataset_from_Matting_Generated_Images_using_CVPR_2024_paper.pdf
150 000 extrahovaných, AI-generovaných objektů bylo použito k trénování MAGICK, aby systém získal intuitivní pochopení extrakce:

Vzorky z trénovací sady MAGICK.
Tato sada, jak je uvedeno v původním článku, byla velmi obtížná na generování, protože difuzní metody mají potíže s vytvářením pevných, klíčovatelných barev. Proto byla nutná ruční selekce generovaných matric.
Tento logistický úzký profil opět vede k systému, který nelze snadno vyvinout nebo přizpůsobit, ale musí být použit v rámci své počáteční trénovací kapacity.
TKG-DM – ‘Rodné’ Chroma Extrakce pro Latentní Difuzní Model
Nová spolupráce mezi německými a japonskými výzkumníky navrhla alternativu k takovým trénovaným metodám, schopnou – jak uvádí článek – dosáhnout lepších výsledků než výše zmíněné metody, bez potřeby trénovat na speciálně kurátorských datech.

TKG-DM mění náhodný šum, který inicializuje generativní obraz, aby byl lépe schopen produkovat pevné, klíčovatelné pozadí – v libovolné barvě. Source: https://arxiv.org/pdf/2411.15580
Nová metoda se zabývá problémem na úrovni generace, optimalizací náhodného šumu, ze kterého je generován obraz v latentním difuzním modelu (LDM), jako je Stable Diffusion.
Přístup vychází z předchozího výzkumu barevného schématu Stable Diffusion distribuce a je schopen produkovat pozadí libovolné barvy, s méně (nebo žádným) propojením klíčové barvy pozadí do popředního obsahu, ve srovnání s jinými metodami.

Počáteční šum je podmíněn kanálovým průměrným posunem, který může ovlivnit aspekty denozíngového procesu, bez propojení barevného signálu do popředního obsahu.
Článek uvádí:
‘Naše rozsáhlé experimenty prokázaly, že TKG-DM zlepšuje FID a mask-FID skóre o 33,7 % a 35,9 %, resp.
‘Takže náš trénovací model rivality fine-tuned modely, nabízí efektivní a všestranné řešení pro různé úkoly vizuálního obsahu, které vyžadují přesnou kontrolu popředí a pozadí. ‘
Nový článek se jmenuje TKG-DM: Trénovací ‘Rodné’ Chroma Klíčovací Difuzní Model a pochází od sedmi výzkumníků z Hosei University v Tokiu a RPTU Kaiserslautern-Landau & DFKI GmbH, v Kaiserslauternu.
Metoda
Nový přístup rozšiřuje architekturu Stable Diffusion kondicionováním počátečního Gaussova šumu prostřednictvím kanálového průměrného posunu (CMS), který produkuje šumové vzory navržené tak, aby podporovaly požadované rozdělení pozadí a popředí ve generovaném výsledku.

Schéma workflow navrhovaného systému.
CMS upravuje průměr každého barevného kanálu, zatímco zachovává obecný vývoj denozíngového procesu.
Autoři vysvětlují:
‘Pro generování popředního objektu na chroma klíčovém pozadí, používáme strategii výběru počátečního šumu, která selektivně kombinuje počáteční šum a počáteční barevný šum pomocí 2D Gaussova masky.
‘Tato maska vytváří plynulý přechod zachováním původního šumu v popředním regionu a aplikací barevně posunutého šumu na pozadí.’

Barevný kanál požadovaný pro pozadí chroma barvy je inicializován s null textovým promptem, zatímco skutečný popřední obsah je vytvořen semanticky z uživatelem zadaného textového pokynu.
Self-attention a cross-attention se používají k oddělení dvou aspektů obrazu (chroma pozadí a popředního obsahu). Self-attention pomáhá s vnitřní konzistencí popředního objektu, zatímco cross-attention udržuje věrnost textovému promptu. Článek uvádí, že поскольку pozadí je obvykle méně detailní a zdůrazněné v generacích, jeho slabší vliv je relativně snadné překonat a nahradit swatem čisté barvy.

Vizualizace vlivu self-attention a cross-attention v procesu generování chroma stylu.
Data a Testy
TKG-DM byl testován pomocí Stable Diffusion V1.5 a Stable Diffusion SDXL. Obrázky byly generovány v rozlišení 512x512px a 1024x1024px.
Obrázky byly vytvořeny pomocí DDIM scheduleru native pro Stable Diffusion, s guidance scale 7,5, a 50 denozíngovými kroky. Cílová pozadí barva byla zelená, nyní dominantní metoda odstranění.
Nový přístup byl porovnán s DeepFloyd, pod nastavením použitým pro MAGICK; s fine-tuned low-rank difuzní model GreenBack LoRA; a také s výše zmíněným LayerDiffuse.
Pro data byly použity 3000 obrázků ze sady MAGICK.

Příklady ze sady MAGICK, ze které byly vybrány 3000 obrázků pro testy nového systému. Source: https://ryanndagreat.github.io/MAGICK/Explorer/magick_rgba_explorer.html
Pro metriky byly použity Fréchet Inception Distance (FID) pro hodnocení kvality popředí. Autoři také vyvinuli projekt-specifickou metriku nazvanou m-FID, která používá BiRefNet systém pro hodnocení kvality výsledné masky.

Vizuální srovnání systému BiRefNet s předchozími metodami. Source: https://arxiv.org/pdf/2401.03407
Pro testování semantické shody s vstupními prompty byly použity metody CLIP-Sentence (CLIP-S) a CLIP-Image (CLIP-I). CLIP-S hodnotí věrnost promptu, a CLIP-I vizuální podobnost s ground truth.

První sada kvalitativních výsledků pro novou metodu, tentokrát pro Stable Diffusion V1.5. Prosím, odkážete se na zdroj PDF pro lepší rozlišení.
Autoři tvrdí, že výsledky (zobrazené výše a níže, SD1.5 a SDXL, resp.) prokazují, že TKG-DM dosahuje lepších výsledků bez prompt-inženýrství nebo nutnosti trénovat nebo fine-tunovat model.

SDXL kvalitativní výsledky. Prosím, odkážete se na zdroj PDF pro lepší rozlišení.
Autoři pozorují, že se Stable Diffusion 1.5 má potíže s generováním čistého pozadí, zatímco SDXL (ačkoli funguje trochu lépe) produkuje nestabilní světle zelené tóny, které jsou náchylné k interferenci se separací v procesu chroma.
Dále poznamenávají, že zatímco LayerDiffuse generuje dobře oddělená pozadí, občas ztrácí detaily, jako jsou přesné čísla nebo písmena, a autoři připisují to omezením v sadě dat. Přidávají, že generování masky občas selže, což vede k “nepřezdívkovaným” obrázkům.
Pro kvantitativní testy, i když LayerDiffuse zdánlivě má výhodu v SDXL pro FID, autoři zdůrazňují, že to je výsledek specializované sady dat, která efektivně tvoří “upečený” a neflexibilní produkt. Jak je zmíněno dříve, libovolné objekty nebo třídy, které nejsou pokryty v této sadě dat, nebo nejsou dostatečně pokryty, nemusí fungovat stejně dobře, zatímco další fine-tunování pro přizpůsobení novým třídám představuje pro uživatele zátěž kurátorských a trénovacích zdrojů.

Kvantitativní výsledky pro srovnání. Zjevná výhoda LayerDiffuse, článek naznačuje, přichází na úkor flexibility a zátěže kurátorských a trénovacích zdrojů.
Článek uvádí:
‘DeepFloyd’s vysoké FID, m-FID a CLIP-I skóre odrážejí jeho podobnost s ground truth na základě DeepFloyd’s výstupu. Nicméně, tato shoda mu dává vnitřní výhodu, činí ho nevhodným jako férový benchmark pro kvalitu obrazu. Jeho nižší CLIP-S skóre dále naznačuje slabší textovou shodu ve srovnání s jinými modely.
‘Celkově, tyto výsledky podtrhují schopnost našeho modelu generovat vysoké kvalitní, textově shodné popředí bez fine-tuningu, nabízí efektivní řešení pro generování obsahu s chroma klíčem.’
Nakonec, výzkumníci provedli uživatelskou studii, aby vyhodnotili shodu promptů napříč různými metodami. Sto účastníků bylo požádáno, aby hodnotilo 30 párů obrázků z každé metody, s předměty extrahovanými pomocí BiRefNet a ručními úpravami napříč všemi příklady. Trénovací přístup autorů byl preferován v této studii.

Výsledky uživatelské studie.
TKG-DM je kompatibilní s populárním ControlNet třetím systémem pro Stable Diffusion, a autoři tvrdí, že produkuje lepší výsledky než native schopnost ControlNetu dosáhnout tohoto druhu separace.
Závěr
Možná nejvýznamnější poznatek z tohoto nového článku je rozsah, v jakém jsou latentní difuzní modely propojené, na rozdíl od veřejného mínění, že mohou snadno oddělit aspekty obrazů a videí při generování nového obsahu.
Studie dále zdůrazňuje rozsah, v jakém výzkumná a hobbyistická komunita se obrátila na fine-tuning jako post facto opravu pro nedostatky modelů – řešení, které vždy řeší specifické třídy a typy objektů. V takové situaci, fine-tuned model bude buď fungovat velmi dobře na omezeném počtu tříd, nebo bude fungovat snášenlivě dobře na mnohem větším objemu možných tříd a objektů, v závislosti na vyšších objemech dat ve trénovacích sadách.
Proto je osvěžující vidět alespoň jedno řešení, které se neopírá o taková zdlouhavá a sporná řešení.
* Natáčení filmu Superman z roku 1978, herec Christopher Reeve musel nosit tyrkysový Supermanův kostým pro modro-ekranové záběry, aby se zabránilo ikonickému modrému kostýmu, který by byl vymazán. Kostýmova modrá barva byla později obnovena pomocí barevného gradingu.












