Andersons hoek

AI-afbeelding matting die scènes begrijpt

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

In de extra documentaire die bij de dvd-uitgave van Alien3 (1992) uit 2003 zit, herinnerde de legendarische visuele effectenman Richard Edlund zich met horror aan het ‘sumo worstelen’ van fotochemische matte-extractie dat het visuele effectenwerk tussen de late jaren dertig en de late jaren tachtig domineerde. Edlund beschreef de hit-and-miss-natuur van het proces als ‘sumo worstelen’, in vergelijking met de digitale blauw/groene schermtechnieken die in de vroege jaren negentig de overhand kregen (en hij is daar later nog eens op teruggekomen).

Het extraheren van een voorgrondelement (zoals een persoon of een ruimteschipmodel) uit een achtergrond, zodat het uitgeknipte beeld in een achtergrondplaat kan worden samengesteld, werd oorspronkelijk bereikt door het voorgrondelement tegen een uniform blauwe of groene achtergrond te filmen.

Laborieuze fotochemische extractieprocessen voor een VFX-shot van ILM voor 'Return of the Jedi' (1983). Source: https://www.youtube.com/watch?v=qwMLOjqPmbQ

Laborieuze fotochemische extractieprocessen voor een VFX-shot van ILM voor ‘Return of the Jedi’ (1983). Source: https://www.youtube.com/watch?v=qwMLOjqPmbQ

In de resulterende beelden zou de achtergrondkleur later chemisch geïsoleerd worden en gebruikt worden als sjabloon om het voorgrondelement (of persoon) in een optische printer opnieuw af te drukken als een ‘ zwevend’ object in een doorzichtige filmcel.

Het proces stond bekend als kleurseparatie-overlaging (CSO) – hoewel deze term later meer geassocieerd zou raken met de grove ‘Chromakey’ video-effecten in televisie-uitzendingen met een lager budget in de jaren zeventig en tachtig, die met analoge middelen in plaats van chemische of digitale middelen werden bereikt.

Een demonstratie van Color Separation Overlay in 1970 voor de Britse kindershow 'Blue Peter'. Source: https://www.bbc.co.uk/archive/blue_peter_noakes_CSO/zwb9vwx

Een demonstratie van Color Separation Overlay in 1970 voor de Britse kindershow ‘Blue Peter’. Source: https://www.bbc.co.uk/archive/blue_peter_noakes_CSO/zwb9vwx

In elk geval, of het nu voor film- of video-elementen was, kon het geëxtraheerde beeld daarna in elk ander beeld worden ingevoegd.

Hoewel Disney’s opvallend duurdere en propriëtaire natriumvaporproces (dat specifiek op geel was afgestemd en ook gebruikt werd voor Alfred Hitchcocks horrorfilm The Birds uit 1963) betere definities en scherpe mattes opleverde, bleef fotochemische extractie een omslachtig en onbetrouwbaar proces.

Disney's propriëtaire natriumvapor-extractieproces vereiste achtergronden bij de gele kant van het spectrum. Hier hangt Angela Lansbury aan draden tijdens de productie van een VFX-beeld voor 'Bedknobs and Broomsticks' (1971). Source

Disney’s propriëtaire natriumvapor-extractieproces vereiste achtergronden bij de gele kant van het spectrum. Hier hangt Angela Lansbury aan draden tijdens de productie van een VFX-beeld voor ‘Bedknobs and Broomsticks’ (1971). Source

Verder dan digitale matting

In de jaren negentig deed de digitale revolutie afstand van de chemicaliën, maar niet van de behoefte aan groene schermen. Het was nu mogelijk om de groene (of elke andere) achtergrondkleur te verwijderen door simpelweg te zoeken naar pixels binnen een tolerantiebereik van die kleur in pixel-editingsoftware zoals Photoshop, en een nieuwe generatie video-compositing suites die automatisch de gekleurde achtergronden konden uitschakelen. Bijna overeenkomstig werden zestig jaar van de optische printindustrie naar de geschiedenisboeken verwezen.

De laatste tien jaar van GPU-versnelde computer visieonderzoek brengt matte-extractie naar een derde tijdperk, waarin onderzoekers worden opgedragen systemen te ontwikkelen die hoge kwaliteit mattes kunnen extraheren zonder de behoefte aan groene schermen. Alleen al op Arxiv zijn papers over innovaties in machine learning-gebaseerde voorgrondextractie een wekelijks verschijnsel.

Ons in beeld brengen

Deze focus van academische en industriële interesse in AI-extractie heeft al impact op de consumentenmarkt: grove maar werkzame implementaties zijn ons allen bekend in de vorm van Zoom en Skype filters die onze woonkamers op de achtergrond kunnen vervangen door tropische eilanden, enz., in videconferenties.

Hoewel de beste mattes nog steeds een groen scherm vereisen, zoals Zoom aangaf, kan dit proces nog steeds verbeterd worden.

Links, een man voor een groen scherm, met goed geëxtraheerd haar via Zoom's Virtual Background-functie. Rechts, een vrouw voor een normale huiskamersituatie, met haar geëxtraheerd via algoritmes, minder nauwkeurig, en met hogere rekenvereisten. Source: https://support.zoom.us/hc/en-us/articles/210707503-Changing-your-Virtual-Background-image

Links, een man voor een groen scherm, met goed geëxtraheerd haar via Zoom’s Virtual Background-functie. Rechts, een vrouw voor een normale huiskamersituatie, met haar geëxtraheerd via algoritmes, minder nauwkeurig, en met hogere rekenvereisten. Source: https://support.zoom.us/hc/en-us/articles/210707503-Changing-your-Virtual-Background-image

Een verdere post van het Zoom Support-platform waarschuwt dat het extraheren zonder groen scherm ook meer rekenkracht in het opnameapparaat vereist.

De noodzaak om het uit te knippen

Verbeteringen in kwaliteit, portabiliteit en resource-economie voor ‘in het wild’ matte-extractiesystemen (d.w.z. het isoleren van mensen zonder de behoefte aan groene schermen) zijn relevant voor veel meer sectoren en activiteiten dan alleen videconferentiefilters.

Voor datasetontwikkeling biedt verbeterde gezichts-, hoofd- en lichaamsherkenning de mogelijkheid om te garanderen dat extrinsieke achtergrondelementen niet worden getraind in computer visie modellen van menselijke onderwerpen; nauwkeurigere isolatie zou semantische segmentatie technieken aanzienlijk verbeteren die zijn ontworpen om domeinen te onderscheiden en te assimileren (d.w.z. ‘kat’, ‘persoon’, ‘boot’), en verbeteren VAE en transformer gebaseerde beeldsynthesesystemen zoals OpenAI’s nieuwe DALL-E 2; en betere extractiealgoritmes zouden de noodzaak voor dure handmatige rotoscoping in dure VFX-pijplijnen terugdringen.

Feitelijk is de opkomst van multimodale (meestal tekst/afbeelding) methoden, waarbij een domein zoals ‘kat’ zowel als afbeelding als met bijbehorende tekstverwijzingen wordt gecodeerd, al aan het binnendringen in beeldverwerking. Een recent voorbeeld is de Text2Live architectuur, die multimodale (tekst/afbeelding) training gebruikt om video’s te maken van, onder andere, kristallen zwanen en glazen giraffen.

Scene-Aware AI Matting

Een aanzienlijk deel van het onderzoek naar AI-gebaseerde automatische matting heeft zich gericht op begrenzingsherkenning en evaluatie van pixel-gebaseerde groeperingen binnen een beeld- of videoframe. Nieuw onderzoek uit China biedt echter een extractiepijplijn die de afbakening en mattekwaliteit verbetert door tekstgebaseerde beschrijvingen van een scène te gebruiken (een multimodale aanpak die de afgelopen 3-4 jaar aan populariteit heeft gewonnen in de computer visieonderzoekssector), en claimt op verschillende manieren verbeteringen ten opzichte van eerdere methoden te hebben behaald.

Een voorbeeld van SPG-IM-extractie (laatste beeld, rechtsonder), in vergelijking met concurrerende eerdere methoden. Source: https://arxiv.org/pdf/2204.09276.pdf

Een voorbeeld van SPG-IM-extractie (laatste beeld, rechtsonder), in vergelijking met concurrerende eerdere methoden. Source: https://arxiv.org/pdf/2204.09276.pdf

De uitdaging voor het extractieonderzoekonderdeel is om workflows te produceren die een minimum aan handmatige annotatie en menselijke interventie vereisen – ideaal gezien helemaal geen. Bovendien merken de onderzoekers van het nieuwe artikel op dat annotaties en handmatige segmentaties die door uitbesteedde crowdworkers over verschillende culturen heen worden uitgevoerd, ertoe kunnen leiden dat beelden op verschillende manieren worden gelabeld of zelfs gesegmenteerd, waardoor inconsistentie en onbevredigende algoritmes ontstaan.

Een voorbeeld hiervan is de subjectieve interpretatie van wat een ‘voorgrondelement’ definieert:

Uit het nieuwe artikel: eerdere methoden LFM en MODNet ('GT' staat voor Ground Truth, een 'ideale' resultaat dat vaak handmatig of met niet-algoritme methoden wordt bereikt), hebben verschillende en verschillend effectieve benaderingen van de definitie van voorgrondinhoud, terwijl de nieuwe SPG-IM-methode 'near content' beter afbakent door middel van scènecontext.

Uit het nieuwe artikel: eerdere methoden LFM en MODNet (‘GT’ staat voor Ground Truth, een ‘ideale’ resultaat dat vaak handmatig of met niet-algoritme methoden wordt bereikt), hebben verschillende en verschillend effectieve benaderingen van de definitie van voorgrondinhoud, terwijl de nieuwe SPG-IM-methode ‘near content’ beter afbakent door middel van scènecontext.

Om dit aan te pakken, hebben de onderzoekers een tweestaps pijplijn ontwikkeld met de naam Situational Perception Guided Image Matting (SPG-IM). De tweestaps encoder/decoder architectuur bestaat uit Situational Perception Distillation (SPD) en Situational Perception Guided Matting (SPGM).

De SPG-IM-architectuur.

De SPG-IM-architectuur.

Eerst voert SPD vooraf visuele-naar-tekstuele functietransformaties uit, waardoor onderschriften gegenereerd worden die bij de bijbehorende beelden horen. Vervolgens maakt SPGM een geschatte alfamatie mogelijk op basis van de ruwe RGB-beeldinvoer en de gegenereerde masker die in de eerste module is verkregen.

Het doel is scènecontextuele begeleiding, waarbij het systeem een contextueel begrip heeft van wat de afbeelding bestaat uit, waardoor het bijvoorbeeld de uitdaging van het extraheren van complex haar van een achtergrond tegen bekende kenmerken van een dergelijke specifieke taak kan afbakenen.

In het onderstaande voorbeeld begrijpt SPG-IM dat de koorden inherent zijn aan een 'parachute', waar MODNet deze details niet kan behouden en definiëren. Ook hierboven verliest MODNet willekeurig de complete structuur van het speeltoestel.

In het onderstaande voorbeeld begrijpt SPG-IM dat de koorden inherent zijn aan een ‘parachute’, waar MODNet deze details niet kan behouden en definiëren. Ook hierboven verliest MODNet willekeurig de complete structuur van het speeltoestel.

Het nieuwe artikel heet Situational Perception Guided Image Matting en komt van onderzoekers bij het OPPO Research Institute, PicUp.ai en Xmotors.

Intelligente geautomatiseerde mattes

SPG-IM biedt ook een Adaptive Focal Transformation (AFT) Refinement Network dat lokale details en globale context afzonderlijk kan verwerken, waardoor ‘intelligente mattes’ mogelijk worden.

Het begrijpen van scènecontext, in dit geval 'meisje met paard', kan mogelijk het extraheren van de voorgrond gemakkelijker maken dan eerdere methoden.

Het begrijpen van scènecontext, in dit geval ‘meisje met paard’, kan mogelijk het extraheren van de voorgrond gemakkelijker maken dan eerdere methoden.

Het artikel zegt:

‘We geloven dat visuele voorstellingen van de visuele-naar-tekstuele taak, bijv. afbeeldingsonderschriften, zich richten op meer semantisch volledige signalen tussen a) object naar object en b) object naar omgeving om beschrijvingen te genereren die zowel globale informatie als lokale details kunnen omvatten. Bovendien zijn tekstlabels veel goedkoper te verzamelen dan de dure pixelannotatie van beeldmatting.’

De SPD-tak van de architectuur wordt gezamenlijk voorgetraind met de University of Michigan’s VirTex transformer-gebaseerde tekstuele decoder, die visuele voorstellingen leert van semantisch dichte onderschriften.

VirTex traint een ConvNet en Transformers gezamenlijk via beeld-onderschrift paren, en brengt de verkregen inzichten over naar downstream visietaken zoals objectdetectie. Source: https://arxiv.org/pdf/2006.06666.pdf

VirTex traint een ConvNet en Transformers gezamenlijk via beeld-onderschrift paren, en brengt de verkregen inzichten over naar downstream visietaken zoals objectdetectie. Source: https://arxiv.org/pdf/2006.06666.pdf

Onder andere tests en ablatieonderzoeken testten de onderzoekers SPG-IM tegen state-of-the-art trimap gebaseerde methoden Deep Image Matting (DIM), IndexNet, Context-Aware Image Matting (CAM), Guided Contextual Attention (GCA), FBA, en Semantic Image Mapping (SIM).

Andere eerdere kaders die getest werden, waren trimap-vrije benaderingen LFM, HAttMatting, en MODNet. Voor een eerlijke vergelijking werden de testmethoden aangepast op basis van de verschillende methoden; waar code niet beschikbaar was, werden de technieken van het artikel opnieuw geproduceerd op basis van de beschreven architectuur.

Het artikel zegt:

‘Onze SPG-IM overtreft alle concurrerende trimap-vrije methoden ([LFM], [HAttMatting], en [MODNet]) met een grote marge. Bovendien toont ons model ook opvallende superioriteit ten opzichte van state-of-the-art (SOTA) trimap-gebaseerde en masker-geleide methoden in termen van alle vier metrics over de openbare datasets (d.w.z. Composition-1K, Distinction-646, en Human-2K), en onze Multi-Object-1K benchmark.’

En gaat verder:

‘Het kan duidelijk worden waargenomen dat onze methode fijne details (bijv. haarpuntlocaties, transparante texturen en grenzen) behoudt zonder de leiding van trimap. Bovendien kan onze SPG-IM beter globale semantische volledigheid behouden dan andere concurrerende trimap-vrije modellen.’

 

Publicatie op 24 april 2022.

Schrijver over machine learning, domeinspecialist in humane beeldsynthese. Voormalig hoofd van onderzoeksinhoud bij Metaphysic.ai, tot de opheffing ervan in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai