Andersons vinkel

AI-billede matning, der forstår scener

mm
Føj Unite.AI til dine foretrukne kilder på Google

I den ekstra dokumentar, der følger med DVD-udgivelsen af Alien3 (1992), mindes visuelle effekter-legenden Richard Edlund med rædsel den ‘sumo-wrestling’ af foto kemisk matte-ekstraktion, der dominerede visuelle effekter-arbejde mellem sen 1930’erne og sen 1980’erne. Edlund beskrev processens hit-and-miss-natur som ‘sumo-wrestling’ i sammenligning med de digitale blå/grøn-skærm-teknikker, der overtog i begyndelsen af 1990’erne (og han har returneret til metaforen siden).

At udtrække et forgrundselement (såsom en person eller et rumskib-model) fra en baggrund, således at det udskårne billede kan komponeres ind i en baggrundsskive, blev oprindeligt opnået ved at filme forgrundselementet mod en ensartet blå eller grøn baggrund.

Besværlige foto kemiske ekstraktionsprocesser for en VFX-optagelse af ILM til 'Return of the Jedi' (1983). Kilde: https://www.youtube.com/watch?v=qwMLOjqPmbQ

Besværlige foto kemiske ekstraktionsprocesser for en VFX-optagelse af ILM til ‘Return of the Jedi’ (1983). Kilde: https://www.youtube.com/watch?v=qwMLOjqPmbQ

I den resulterende optagelse ville baggrundsfarven herefter blive isoleret kemisk og brugt som en skabelon til at genudskrive forgrundselementet (eller person) i en optisk printer som et ‘flydende’ objekt i en ellers gennemsigtig filmcelle.

Processen blev kendt som farveseparation-overlæg (CSO) – selvom denne betegnelse senere blev mere associeret med de grove ‘Chromakey’ videoeffekter i lavbudgetterede tv-udsendelser i 1970’erne og 1980’erne, som blev opnået med analoge frem for kemiske eller digitale midler.

En demonstration af Color Separation Overlay i 1970 til den britiske børneudsendelse 'Blue Peter'. Kilde: https://www.bbc.co.uk/archive/blue_peter_noakes_CSO/zwb9vwx

En demonstration af Color Separation Overlay i 1970 til den britiske børneudsendelse ‘Blue Peter’. Kilde: https://www.bbc.co.uk/archive/blue_peter_noakes_CSO/zwb9vwx

På samme måde, enten for film- eller videoelementer, kunne det herefter udtrukne materiale indsættes i andre optagelser.

Selv om Disneys bemærkelsesværdigt dyre og proprietære natrium-vapor-proces (som nøglede på gul, specifikt, og også blev brugt til Alfred Hitchcocks 1963 horror The Birds) gav bedre definition og skarpere mattes, forblev foto kemisk ekstraktion en besværlig og upålidelig proces.

Disneys proprietære natrium-vapor-ekstraktionsproces krævede baggrunde nær den gule ende af spektret. Her er Angela Lansbury ophængt i wire under produktionen af en VFX-læs sekvens til 'Bedknobs and Broomsticks' (1971). Kilde

Disneys proprietære natrium-vapor-ekstraktionsproces krævede baggrunde nær den gule ende af spektret. Her er Angela Lansbury ophængt i wire under produktionen af en VFX-læs sekvens til ‘Bedknobs and Broomsticks’ (1971). Kilde

Uden for digital matning

I 1990’erne gjorde den digitale revolution det muligt at undvære kemikalierne, men ikke grønne skærme. Det var herefter muligt at fjerne den grønne (eller hvilken som helst) baggrund ved blot at søge efter pixel inden for en tolerance-række af den farve i pixel-redigeringsssoftware som Photoshop, og en ny generation af video-kompositing-suites, der kunne automatisk nøgle ud baggrundsfarverne. Næsten over nat blev tres år af optisk trykkeindustrien sendt til historien.

De sidste ti år af GPU-accelereret computer vision-forskning har ført matte-ekstraktion ind i en tredje æra, hvor forskerne har til opgave at udvikle systemer, der kan ekstrahere højkvalitets-mattes uden behov for grønne skærme. På Arxiv alene er artikler relateret til innovationer i maskinlærings-baseret forgrund-ekstraktion en ugentlig begivenhed.

At sætte os på billedet

Dette fokus på akademisk og industrielle interesser i AI-ekstraktion har allerede haft indvirkning på forbrugerområdet: grove, men brugbare implementationer er velkendte for os alle i form af Zoom og Skype filtre, der kan erstatte vores stue-baggrunde med tropiske øer osv. i video-konference-opkald.

Men de bedste mattes kræver stadig en grøn skærm, som Zoom bemærkede forleden.

Venstre, en mand foran en grøn skærm, med godt udtrukket hår via Zooms Virtual Background-funktion. Højre, en kvinde foran en normal stue-scene, med hår udtrukket algoritmerisk, mindre præcist og med højere beregningskrav. Kilde: https://support.zoom.us/hc/en-us/articles/210707503-Changing-your-Virtual-Background-image

Venstre, en mand foran en grøn skærm, med godt udtrukket hår via Zooms Virtual Background-funktion. Højre, en kvinde foran en normal stue-scene, med hår udtrukket algoritmerisk, mindre præcist og med højere beregningskrav. Kilde: https://support.zoom.us/hc/en-us/articles/210707503-Changing-your-Virtual-Background-image

En yderligere artikel fra Zoom Support-platformen advarer om, at non-grøn-skærm-ekstraktion også kræver større beregningskraft i optageenheden.

Behovet for at skære det ud

Forbedringer i kvalitet, portabilitet og ressource-økonomi for ‘i det vilde’ matte-ekstraktions-systemer (dvs. isolering af mennesker uden behov for grønne skærme) er relevante for mange flere sektorer og aktiviteter end blot video-konference-filtre.

For datasæt-udvikling tilbyder forbedret ansigt-, fuld-hoved- og fuld-krops-genkendelse muligheden for at sikre, at ekstra baggrundselementer ikke bliver trænet ind i computer-vision-modeller af menneskelige subjekter; mere præcis isolering ville betydeligt forbedre semantisk segmentering teknikker designet til at skelne og assimilere domæner (dvs. ‘kat’, ‘person’, ‘båd’), og forbedre VAE og transformator-baserede billed-syntese-systemer som OpenAIs nye DALL-E 2; og bedre ekstraktions-algoritmer ville reducere behovet for dyre manuelle rotoscoping i dyre VFX-pipelines.

I virkeligheden er den stigende multimodale (som regel tekst/billede) metoder, hvor et domæne som ‘kat’ kodificeres både som et billede og med tilhørende tekst-referencer, allerede i gang med at få indflydelse på billed-behandling. Et nyligt eksempel er Text2Live arkitekturen, der bruger multimodal (tekst/billede) træning til at skabe videoer af, blandt mange andre muligheder, krystal-svaner og glas-giraffer.

Scene-bevidst AI-matning

En stor del af forskningen i AI-baseret automatisk matning har fokuseret på grænse-genkendelse og vurdering af pixel-baserede grupperinger inden for et billede eller video-ramme. Men ny forskning fra Kina tilbyder en ekstraktions-pipeline, der forbedrer afgrænsning og matte-kvalitet ved at udnytte tekst-baserede beskrivelser af en scene (en multimodal tilgang, der har fået fodfæste i computer-vision-forskningen i de sidste 3-4 år), og hævder at have forbedret tidligere metoder på flere måder.

Et eksempel på SPG-IM-ekstraktion (sidste billede, nederst til højre), sammenlignet med tidligere metoder. Kilde: https://arxiv.org/pdf/2204.09276.pdf

Et eksempel på SPG-IM-ekstraktion (sidste billede, nederst til højre), sammenlignet med tidligere metoder. Kilde: https://arxiv.org/pdf/2204.09276.pdf

Udfordringen for ekstraktions-forsknings-undersektoren er at producere arbejdsgange, der kræver en absolut minimum af manuel annotation og menneskelig indgriben – idealt, ingen. Ud over de økonomiske implikationer bemærker forskerne bag den nye artikel, at annotationer og manuelle segmenteringer udført af udliciterede crowdworkers på tværs af forskellige kulturer kan føre til, at billeder bliver mærket eller endda segmenteret på forskellige måder, hvilket fører til inkonsistente og utilfredsstillende algoritmer.

Et eksempel på dette er den subjektive fortolkning af, hvad der definerer et ‘forground-objekt’:

Fra den nye artikel: tidligere metoder LFM og MODNet ('GT' betyder Ground Truth, et 'ideelt' resultat ofte opnået manuelt eller ved ikke-algoritmeriske metoder), har forskellige og forskelligt effektive tilgange til definitionen af forgrund-indhold, hvorimod den nye SPG-IM-metode mere effektivt afgrænser 'nær-indhold' gennem scene-kontekst.

Fra den nye artikel: tidligere metoder LFM og MODNet (‘GT’ betyder Ground Truth, et ‘ideelt’ resultat ofte opnået manuelt eller ved ikke-algoritmeriske metoder), har forskellige og forskelligt effektive tilgange til definitionen af forgrund-indhold, hvorimod den nye SPG-IM-metode mere effektivt afgrænser ‘nær-indhold’ gennem scene-kontekst.

For at imødekomme dette har forskerne udviklet en to-trins pipeline kaldet Situational Perception Guided Image Matting (SPG-IM). Den to-trins encoder/decoder-arkitektur består af Situational Perception Distillation (SPD) og Situational Perception Guided Matting (SPGM).

SPG-IM-arkitekturen.

SPG-IM-arkitekturen.

Først forudtræner SPD visuel-til-tekstlige funktionstransformationer, genererer beskrivelser, der er passende for deres tilhørende billeder. Efter dette aktiveres forgrund-masken-forudsigelse ved at tilslutte pipeline til en ny saliency-forudsigelsesteknik.

Herefter udskriver SPGM en anslået alpha-matte baseret på det rå RGB-billede-input og den genererede maske, der er opnået i den første modul.

Formålet er situation-perception-guidance, hvor systemet har en kontekstuel forståelse af, hvad billedet består af, hvilket tillader det at definere – for eksempel – udfordringen ved at udtrække komplekst hår fra en baggrund mod kendte karakteristika af en sådan specifik opgave.

I eksemplet nedenfor forstår SPG-IM, at linerne er intrinsic til en 'faldskærm', hvor MODNet fejler i at fastholde og definere disse detaljer. Ligeså ovenfor bliver den komplette struktur af legeapparatusen arbitrært tabt i MODNet.

I eksemplet nedenfor forstår SPG-IM, at linerne er intrinsic til en ‘faldskærm’, hvor MODNet fejler i at fastholde og definere disse detaljer. Ligeså ovenfor bliver den komplette struktur af legeapparatusen arbitrært tabt i MODNet.

Den nye artikel er titlen Situational Perception Guided Image Matting og kommer fra forskere ved OPPO Research Institute, PicUp.ai og Xmotors.

Intelligent Automatiseret Matning

SPG-IM tilbyder også et Adaptivt Fokal Transformation (AFT) Refinement Network, der kan behandle lokale detaljer og globale kontekster separat, hvilket muliggør ‘intelligent matning’.

At forstå scene-kontekst, i dette tilfælde 'pige med hest', kan potentielt gøre forgrund-ekstraktion lettere end tidligere metoder.

At forstå scene-kontekst, i dette tilfælde ‘pige med hest’, kan potentielt gøre forgrund-ekstraktion lettere end tidligere metoder.

Artiklen fastslår:

‘Vi mener, at visuelle repræsentationer fra det visuel-til-tekstlige arbejde, f.eks. billed-beskrivelse, fokuserer på mere semantisk komplette signaler mellem a) objekt til objekt og b) objekt til den omgivende omgivelse for at generere beskrivelser, der kan dække både den globale information og lokale detaljer. Derudover, i forhold til den dyre pixel-annotation af billed-matning, kan tekst-mærker samles på en meget lav kost.

SPD-grenen af arkitekturen er fælles-forudtrænet med University of Michigans VirTex transformer-baseret tekst-dekoder, der lærer visuelle repræsentationer fra semantisk tætte beskrivelser.

VirTex træner fælles en ConvNet og Transformers via billed-tekst-par, og overfører de opnåede indsigt til downstream-vision-opgaver såsom objekt-genkendelse. Kilde: https://arxiv.org/pdf/2006.06666.pdf

VirTex træner fælles en ConvNet og Transformers via billed-tekst-par, og overfører de opnåede indsigt til downstream-vision-opgaver såsom objekt-genkendelse. Kilde: https://arxiv.org/pdf/2006.06666.pdf

Blandt andre tests og ablation-studier testede forskerne SPG-IM mod state-of-the-art trimap-baserede metoder Deep Image Matting (DIM), IndexNet, Context-Aware Image Matting (CAM), Guided Contextual Attention (GCA), FBA, og Semantic Image Mapping (SIM).

Andre tidligere rammer, der blev testet, omfattede trimap-frie tilgange LFM, HAttMatting, og MODNet. For en fair sammenligning blev test-metoderne tilpasset på basis af de forskellige metoder; hvor kode ikke var tilgængelig, blev papirets teknikker genskabt fra den beskrevne arkitektur.

Den nye artikel fastslår:

‘Vores SPG-IM overgår alle konkurrerende trimap-frie metoder ([LFM], [HAttMatting], og [MODNet]) med en stor margin. Samtidig viser vores model også en bemærkelsesværdig overlegenhed over state-of-the-art (SOTA) trimap-baserede og mask-guidede metoder i forhold til alle fire målinger på offentlige datasæt (dvs. Composition-1K, Distinction-646, og Human-2K), og vores Multi-Object-1K-benchmark.’

Og fortsætter:

‘Det kan tydeligt observeres, at vores metode bevarer fine detaljer (f.eks. hårtip-sites, gennemsigtige teksturer og grænser) uden vejledning af trimap. Derudover, i sammenligning med andre konkurrerende trimap-frie modeller, kan vores SPG-IM fastholde bedre global semantisk fuldstændighed.’

 

Offentliggjort første gang 24. april 2022.

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai