Andersonův úhel
Umění obrazové matování, které chápe scény

V dokumentárním filmu, který doprovází DVD vydání z roku 2003 Alien3 (1992), legendární vizuální efekt Richard Edlund vzpomínal s hrůzou na “sumo wrestling” fotochemické extrakce matice, který dominoval vizuálním efektům mezi koncem 30. let a koncem 80. let. Edlund popsal proces jako “sumo wrestling” ve srovnání s digitálními modrozelenými technikami, které převzaly v počátcích 90. let (a od té doby se vrátil k této metafoře).
Extrahování předního prvku (jako je osoba nebo model lodi) z pozadí, aby se mohla vyříznutá obrazová složka složit do pozadí, se původně provádělo natáčením předního objektu proti jednotnému modrému nebo zelenému pozadí.

Námahavé fotochemické procesy extrakce pro VFX záběr ILM pro ‘Návrat Jediů’ (1983). Zdroj: https://www.youtube.com/watch?v=qwMLOjqPmbQ
V výsledném záběru by se poté izolovalo pozadí chemicky a použilo se jako šablona k přetisku předního objektu (nebo osoby) v optickém tiskárně jako “plovoucí” objekt v jinak transparentní filmové buňce.
Proces se nazýval barevná separace překrytí (CSO) – i když tento termín se později stal více spojený s hrubými ‘Chromakey’ videoefekty v nižších rozpočtových televizních výstupech 70. a 80. let, které byly dosaženy analogovými spíše než chemickými nebo digitálními prostředky.

Demonstrace Color Separation Overlay v roce 1970 pro britskou dětskou show ‘Blue Peter’. Zdroj: https://www.bbc.co.uk/archive/blue_peter_noakes_CSO/zwb9vwx
V každém případě, ať už pro filmové nebo video prvky, poté mohla být extrahovaná stopáž vložena do jakékoli jiné stopáže.
I když Disneyho poměrně dražší a proprietární sodiový parový proces (který se řídil žlutou barvou a byl také použit pro Alfreda Hitchcocka v roce 1963 v hororu Ptačí) poskytoval lepší definici a ostřejší matice, fotochemická extrakce zůstala namáhavá a nespolehlivá.

Disneyho proprietární sodiový parový proces vyžadoval pozadí blízko žluté části spektra. Zde Angela Lansbury visí na lanech během produkce VFX-laced sekvence pro ‘Bedknobs and Broomsticks’ (1971). Zdroj
Mimo digitální matování
V 90. letech digitální revoluce zrušila chemikálie, ale ne potřebu zelených pozadí. Bylo možné odstranit zelené (nebo jakékoli jiné) pozadí jednoduše hledáním pixelů v rámci tolerance rozsahu této barvy v pixelovém editoru, jako je Photoshop, a v nové generaci video-kompozičních sad, které mohly automaticky odstranit barevná pozadí. Téměř přes noc, šedesát let optického tisku bylo odsunuto do historie.
Posledních deset let urychleného počítačového vidění výzkumu zavádí extrakci matice do třetí éry, zadávající výzkumníkům úkol vyvinout systémy, které mohou extrahovat vysoké kvality matice bez potřeby zelených pozadí. Na Arxivu samotném jsou články související s inovacemi v strojovém učení založené na extrakci předního plánu týdenním prvkem.
Umístění nás do obrazu
Tento akademický a průmyslový zájem o extrakci AI již dopadl na spotřebitelský prostor: hrubé, ale funkční implementace jsou nám všem známy ve formě Zoom a Skype filtrů, které mohou nahradit naše obývací pokoje tropickými ostrovy, atd., ve videohovorech.
Jedna věc je, že nejlepší matice stále vyžadují zelené pozadí, jak Zoom poznamenal minulou středu.

Vlevo, muž před zeleným pozadím, s dobře extrahovanými vlasy prostřednictvím funkce Zoom Virtual Background. Vpravo, žena před normálním domácím pozadím, s vlasy extrahovanými algoritmicky, méně přesně a s vyšším výpočetním požadavkem. Zdroj: https://support.zoom.us/hc/en-us/articles/210707503-Changing-your-Virtual-Background-image
Další článek z platformy Zoom Support varuje, že extrakce bez zeleného pozadí také vyžaduje větší výpočetní výkon ve snímacím zařízení.
Potřebujeme odstranit to
Zlepšení kvality, portability a ekonomie zdrojů pro “v divočině” matoucí systémy (tj. izolaci lidí bez potřeby zelených pozadí) jsou relevantní pro mnoho dalších sektorů a aktivit než jen videohovory.
Pro vývoj datových sad nabízí zlepšená rozpoznání obličeje, hlavy a těla možnost zajištění, aby se do počítačových modelů lidských subjektů nedostaly nežádoucí pozadí; přesnější izolace by výrazně zlepšila semantické segmentační techniky navržené pro rozlišení a asimilaci domén (tj. ‘kočka’, ‘osoba’, ‘loď’), a zlepšila by VAE a transformer-based obrazové syntetické systémy, jako je OpenAI nový DALL-E 2; a lepší extrakční algoritmy by snížily potřebu drahého manuálního rotoskopování v nákladných VFX potrubích.
Skutečností je, že vzestup multimodálních (obvykle text-obrázek) metodologií, kde je doména, jako je “kočka”, zakódována jak jako obraz, tak s přidruženými textovými odkazy, již proniká do obrazové processingu. Jedním z nedávných příkladů je Text2Live architektura, která používá multimodální (text-obrázek) trénink pro vytváření videí, mezi mnoha dalšími možnostmi, křišťálových labutí a skleněných žiraf.
Scéně-vědomé AI matování
Velká část výzkumu do AI-založeného automatického matování se zaměřila na rozpoznání hranic a hodnocení pixel-založených skupin uvnitř obrazu nebo video snímku. Nový výzkum z Číny nabízí extrakční potrubí, které zlepšuje vymezení a kvalitu matice tím, že využívá textové popisy scény (multimodální přístup, který získal trakci ve výzkumu počítačového vidění za posledních 3-4 let), tvrdí, že zlepšil předchozí metody několika způsoby.

Příklad SPG-IM extrakce (poslední obraz, dolní pravá), ve srovnání s předchozími metodami. Zdroj: https://arxiv.org/pdf/2204.09276.pdf
Výzva pro sub-sektor výzkumu extrakce spočívá ve vývoji pracovních postupů, které vyžadují minimální ruční anotaci a lidskou intervenci – ideálně žádnou. Kromě nákladových implikací autoři nového článku pozorují, že anotace a ruční segmentace provedené outsourcovanými pracovníky v různých kulturách mohou způsobit, že obrázky jsou označeny nebo dokonce segmentovány odlišnými způsoby, vedoucí k nekonzistentním a nespokojeným algoritmům.
Jedním z příkladů je subjektivní interpretace toho, co definuje “přední objekt”:

Z nového článku: předchozí metody LFM a MODNet (‘GT’ znamená Ground Truth, ‘ideální’ výsledek často dosažený manuálně nebo nealgoritmickými metodami) mají různé a různě účinné názory na definici předního obsahu, zatímco nová metoda SPG-IM lépe vymezuje ‘blízký obsah’ prostřednictvím kontextu scény.
Pro řešení tohoto problému autoři vyvinuli dvoufázový potrubí nazvaný Situational Perception Guided Image Matting (SPG-IM). Dvoufázová architektura encoder/decoder se skládá z Situational Perception Distillation (SPD) a Situational Perception Guided Matting (SPGM).
Nejprve SPD předtrénuje vizuálně-textové transformace funkcí, generuje popisky vhodné pro jejich přidružené obrázky. Poté je předpověď předního masky povolena spojením potrubí s novou saliency prediction technikou.
Pak SPGM výstup odhaduje alfa matice na základě surového RGB obrazového vstupu a generovaného masky získaného v prvním modulu.
Cílem je situational perception guidance, kde systém má kontextuální pochopení toho, co obraz skládá, umožňující mu rámcovat – například – výzvu extrahování složitých vlasů z pozadí proti známým charakteristikám takového konkrétního úkolu.

V příkladu níže SPG-IM rozumí, že lana jsou intrinsicní pro ‘padák’, zatímco MODNet selhává v uchování a definování těchto detailů. Podobně výše je kompletní struktura hřišťového zařízení libovolně ztracena v MODNet.
Nový článek se nazývá Situational Perception Guided Image Matting a pochází od výzkumníků z OPPO Research Institute, PicUp.ai a Xmotors.
Inteligentní automatické matice
SPG-IM také nabízí Adaptive Focal Transformation (AFT) Refinement Network, který může zpracovat lokální detaily a globální kontext samostatně, umožňující “inteligentní matice”.

Porozumění kontextu scény, v tomto případě ‘dívka s koněm’, může potenciálně usnadnit extrahování předního plánu než předchozí metody.
Článek uvádí:
‘Věříme, že vizuální reprezentace z vizuálně-textové úlohy, například image captioning, se zaměřují na více sémanticky komplexní signály mezi a) objektem a objektem a b) objektem a okolním prostředím, aby generovaly popisky, které mohou pokrýt jak globální informace, tak lokální detaily. Kromě toho, ve srovnání s drahými pixelovými anotacemi obrazového matování, textové popisky lze získat ve velmi nízkých nákladech.’
Architektura SPD je společně předtrénována s University of Michigan’s VirTex transformer-based textovým dekodérem, který se učí vizuální reprezentace z sémanticky hustých popisků.

VirTex společně trénuje ConvNet a Transformery prostřednictvím image-popisky párů a přenáší získané poznatky do downstream vizuálních úkolů, jako je objektové rozpoznávání. Zdroj: https://arxiv.org/pdf/2006.06666.pdf
Mezi jinými testy a ablačními studiemi autoři otestovali SPG-IM proti státním trimap-založeným metodám Deep Image Matting (DIM), IndexNet, Context-Aware Image Matting (CAM), Guided Contextual Attention (GCA), FBA, a Semantic Image Mapping (SIM).
Mezi jinými předchozími rámci testovanými byly trimap-free přístupy LFM, HAttMatting, a MODNet. Pro spravedlivé srovnání byly testovací metody adaptovány na základě různých metodologií; kde nebyl k dispozici kód, byly techniky článku reprodukovány z popsané architektury.
Článek uvádí:
‘Naše SPG-IM překonává všechny soutěžící trimap-free metody ([LFM], [HAttMatting], a [MODNet]) o velkou marži. Mezitím náš model také ukazuje pozoruhodnou převahu nad státními trimap-založenými a maskou-vedenými metodami z hlediska všech čtyř metrik napříč veřejnými datovými sadami (tj. Composition-1K, Distinction-646, a Human-2K), a naše Multi-Object-1K benchmark.’
A pokračuje:
‘Můžeme jasně vidět, že naše metoda zachovává jemné detaily (například vlasy, průhledné textury a hranice) bez vedení trimapu. Kromě toho, ve srovnání s ostatními soutěžícími trimap-free modely, naše SPG-IM může zachovat lepší globální sémantickou kompletnost.’
Poprvé zveřejněno 24. dubna 2022.















