Andersons vinkel

AI-bildeutklipping som forstår scener

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

I den ekstra dokumentaren som følger med DVD-utgivelsen av Alien3 (1992), husker visual effects-legenden Richard Edlund med frykt den ‘sumo-bryting’ av foto-kjemisk matte-utvinning som dominerte visuelle effekter mellom siste 1930-årene og slutten av 1980-årene. Edlund beskrev prosessen som ‘sumo-bryting’, i sammenligning med de digitale blå/grønne skjerme-teknikkene som tok over på begynnelsen av 1990-tallet (og han har returnert til metaforen siden).

Utvinning av et forgrunns-element (så som en person eller et romskip-modell) fra en bakgrunn, slik at det utklippede bildet kan komponeres inn i en bakgrunnsplate, ble opprinnelig oppnådd ved å filme forgrunns-objektet mot en ensartet blå eller grønn bakgrunn.

Møysommelige foto-kjemiske utvinningsprosesser for en VFX-Scene av ILM for 'Return of the Jedi' (1983). Kilde: https://www.youtube.com/watch?v=qwMLOjqPmbQ

Møysommelige foto-kjemiske utvinningsprosesser for en VFX-Scene av ILM for ‘Return of the Jedi’ (1983). Kilde: https://www.youtube.com/watch?v=qwMLOjqPmbQ

I den resulterende filmen ville bakgrunnsfargen deretter bli isolert kjemisk og brukt som en mal til å gjenskrive forgrunns-objektet (eller person) i en optisk skriver som et ‘flytende’ objekt i en ellers transparent filmcelle.

Prosessen ble kjent som farge-separasjon-overlapp (CSO) – selv om denne betegnelsen ville bli mer assosiert med de grove ‘Chromakey’ video-effekter i lavbudsjett-TV-utgaver på 1970- og 1980-tallet, som ble oppnådd med analoge middel i stedet for kjemiske eller digitale.

En demonstrasjon av Color Separation Overlay i 1970 for den britiske barneserien 'Blue Peter'. Kilde: https://www.bbc.co.uk/archive/blue_peter_noakes_CSO/zwb9vwx

En demonstrasjon av Color Separation Overlay i 1970 for den britiske barneserien ‘Blue Peter’. Kilde: https://www.bbc.co.uk/archive/blue_peter_noakes_CSO/zwb9vwx

Uansett, enten for film eller video-elementer, kunne det utvunne bildet deretter bli satt inn i andre bilder.

Disney’s merkbart dyre og proprietære natrium-vapor-prosess (som ble nøklet på gul, spesifikt, og også brukt for Alfred Hitchcocks 1963-skrekkfilm The Birds) ga bedre definisjon og skarpe mattes, men foto-kjemisk utvinning forble møysommelig og upålitelig.

Disney's proprietære natrium-vapor-utvinningsprosess krevde bakgrunner nær den gule enden av spekteret. Her er Angela Lansbury hengt i wire under produksjonen av en VFX-laget sekvens for 'Bedknobs and Broomsticks' (1971). Kilde

Disney’s proprietære natrium-vapor-utvinningsprosess krevde bakgrunner nær den gule enden av spekteret. Her er Angela Lansbury hengt i wire under produksjonen av en VFX-laget sekvens for ‘Bedknobs and Broomsticks’ (1971). Kilde

Bortenfor digital matte

På 1990-tallet gjorde den digitale revolusjonen slutt på kjemikaliene, men ikke behovet for grønne skjermer. Det var nå mulig å fjerne den grønne (eller hvilken som helst) bakgrunnsfargen bare ved å søke etter piksler innenfor en toleranse-område av den fargen, i piksel-redigeringsprogramvare som Photoshop, og en ny generasjon av video-komposisjonssuiter som kunne automatisk nøkkel ut de fargede bakgrunnene. Nærmest over natten, seksti år av optisk trykk-industrien ble sendt til historien.

De siste ti årene av GPU-akselerert datavisjonsforskning har ført matte-utvinning inn i en tredje alder, med å gi forskerne i oppgave å utvikle systemer som kan utvinne høykvalitets-mattes uten behov for grønne skjermer. På Arxiv alene er papirer relatert til innovasjoner i maskinlæring-basert forgrunns-utvinning en ukentlig begivenhet.

Plassere oss i bildet

Dette fokuset på akademisk og industriell interesse i AI-utvinning har allerede hatt innvirkning på forbrukerrommet: grove, men brukbare implementeringer er kjent for oss alle i form av Zoom og Skype filtre som kan erstatte våre stue-bakgrunner med tropiske øyer, osv., i video-konferansesamtaler.

Likevel, de beste mattene krever fortsatt en grønn skjerm, som Zoom noterte forrige uke.

Venstre, en mann foran en grønn skjerm, med godt utvunnet hår via Zooms Virtuell Bakgrunn-funksjon. Høyre, en kvinne foran en vanlig hjemmebakgrunn, med hår utvunnet algoritmisk, mindre nøyaktig, og med høyere beregningskrav. Kilde: https://support.zoom.us/hc/en-us/articles/210707503-Changing-your-Virtual-Background-image

Venstre, en mann foran en grønn skjerm, med godt utvunnet hår via Zooms Virtuell Bakgrunn-funksjon. Høyre, en kvinne foran en vanlig hjemmebakgrunn, med hår utvunnet algoritmisk, mindre nøyaktig, og med høyere beregningskrav. Kilde: https://support.zoom.us/hc/en-us/articles/210707503-Changing-your-Virtual-Background-image

En ytterligere post fra Zoom Support-plattformen advarer om at non-grønn-skjerm-utvinning også krever større beregningskraft i innspillingsenheten.

Behovet for å kutte det ut

Forbedringer i kvalitet, portabilitet og ressursøkonomi for ‘i villmarken’ matte-utvinnings-systemer (dvs. isolere mennesker uten behov for grønne skjermer) er relevante for mange flere sektorer og aktiviteter enn bare video-konferanse-filtre.

For datasett-utvikling, bedret hår-, hele-hode- og hele-kropp-gjenkjenning tilbyr muligheten for å sikre at utenomstående bakgrunns-elementer ikke blir trent inn i datavisjonsmodeller av menneskelige subjekter; mer nøyaktig isolering ville betydelig forbedre semantisk segmentering -teknikker designet for å skille og assimilere domener (dvs. ‘katt’, ‘person’, ‘båt’), og forbedre VAE og transformer-baserte bilde-syntese-systemer som OpenAIs nye DALL-E 2; og bedre utvinningsalgoritmer ville kutte ned på behovet for dyre manuelle rotoscoping i kostbare VFX-pipelines.

I virkeligheten, er den økende multimodale (vanligvis tekst/bilde) metodene, hvor et domene som ‘katt’ blir kodet både som et bilde og med assosierte tekst-referanser, allerede påvirker bilde-behandling. Et nylig eksempel er Text2Live -arkitekturen, som bruker multimodal (tekst/bilde) trening for å lage videoer av, blant mange andre muligheter, krystal-svaner og glass-giraffer.

Scene-bevisst AI-matte

En god del forskning på AI-basert automatisk matte har fokusert på grense-gjenkjenning og evaluering av piksel-basert gruppering innen et bilde eller video-ramme. Likevel, ny forskning fra Kina tilbyr en utvinnings-pipeline som forbedrer avgrensning og matte-kvalitet ved å bruke tekst-basert beskrivelser av en scene (en multimodal tilnærming som har fått fotfeste i datavisjons-forskningen de siste 3-4 årene), og hevder å ha forbedret tidligere metoder på flere måter.

Et eksempel på SPG-IM-utvinning (siste bilde, nederst til høyre), sammenlignet med tidligere metoder. Kilde: https://arxiv.org/pdf/2204.09276.pdf

Et eksempel på SPG-IM-utvinning (siste bilde, nederst til høyre), sammenlignet med tidligere metoder. Kilde: https://arxiv.org/pdf/2204.09276.pdf

Utfordringen for utvinnings-forsknings-undersektoren er å produsere arbeidsflyter som krever en minimal mengde manuell annotasjon og menneskelig inngripen – ideal sett ingen. Foruten kostnadene, observerer forskerne i den nye artikkelen at annotasjoner og manuelle segmenteringer utført av crowdsourcere over ulike kulturer kan føre til at bilder blir merket eller til og med segmentert på ulike måter, noe som fører til inkonsistente og utilfredsstillende algoritmer.

Et eksempel på dette er den subjektive tolkningen av hva som definerer et ‘forgrunns-objekt’:

Fra den nye artikkelen: tidligere metoder LFM og MODNet ('GT' betyr Grunn-sannhet, et 'ideelt' resultat ofte oppnådd manuelt eller ved ikke-algoritmiske metoder), har ulike og forskjellige effektive tilnærminger til definisjonen av forgrunns-innhold, hvor den nye SPG-IM-metoden mer effektivt avgrenser 'nær-innhold' gjennom scene-kontekst.

Fra den nye artikkelen: tidligere metoder LFM og MODNet (‘GT’ betyr Grunn-sannhet, et ‘ideelt’ resultat ofte oppnådd manuelt eller ved ikke-algoritmiske metoder), har ulike og forskjellige effektive tilnærminger til definisjonen av forgrunns-innhold, hvor den nye SPG-IM-metoden mer effektivt avgrenser ‘nær-innhold’ gjennom scene-kontekst.

For å møte dette, har forskerne utviklet en to-trinns pipeline kalt Situational Perception Guided Image Matting (SPG-IM). Den to-trinns encoder/decoder-arkitekturen består av Situational Perception Distillation (SPD) og Situational Perception Guided Matting (SPGM).

SPG-IM-arkitekturen.

SPG-IM-arkitekturen.

Først forbereder SPD visuell-til-tekstlige funksjonstransformasjoner, og genererer beskrivelser som er egnet for deres assosierte bilder. Deretter aktiveres forgrunns-masken-prediksjon ved å koble pipeline til en ny saliens-prediksjons -teknikk.

Deretter utsteder SPGM en estimert alpha-matte basert på det rå RGB-bilde-innput og den genererte masken som ble oppnådd i den første modulen.

Målet er situasjons-persepsjon-guidning, hvor systemet har en kontekstuell forståelse av hva bildet består av, og lar det ramme – for eksempel – utfordringen med å utvinne kompleks hår fra en bakgrunn mot kjente karakteristika av en slik spesifikk oppgave.

I eksempelet under, forstår SPG-IM at tauene er innebygget i en 'fallskjerm', hvor MODNet ikke klarer å beholde og definere disse detaljene. Liksom ovenfor, blir den komplette strukturen av lekeapparatet tilfeldig tapt i MODNet.

I eksempelet under, forstår SPG-IM at tauene er innebygget i en ‘fallskjerm’, hvor MODNet ikke klarer å beholde og definere disse detaljene. Liksom ovenfor, blir den komplette strukturen av lekeapparatet tilfeldig tapt i MODNet.

Den nye artikkelen heter Situational Perception Guided Image Matting, og kommer fra forskere ved OPPO Research Institute, PicUp.ai og Xmotors.

Intelligent Automatisert Matte

SPG-IM tilbyr også et Adaptivt Fokal Transformasjons (AFT) Refinement Network som kan prosessere lokale detaljer og globale kontekster separat, og muliggjør ‘intelligente mattes’.

Forståelse av scene-kontekst, i dette tilfellet 'jente med hest', kan potensielt gjøre forgrunns-utvinning enklere enn tidligere metoder.

Forståelse av scene-kontekst, i dette tilfellet ‘jente med hest’, kan potensielt gjøre forgrunns-utvinning enklere enn tidligere metoder.

Artikkelen sier:

‘Vi tror at visuelle representasjoner fra visuell-til-tekstlige oppgaver, f.eks. bildeckapsling, fokuserer på mer semantisk komplette signaler mellom a) objekt til objekt og b) objekt til omgivelsene for å generere beskrivelser som kan dekke både global info og lokale detaljer. I tillegg, i sammenligning med den dyre piksel-annotasjonen av bilde-utvinning, kan tekst-merker samles inn i stor mengde til en svært lav kostnad.’

Arkitekturens SPD-gren er felles-forberedt med University of Michigans VirTex transformer-basert tekst-dekoder, som lærer visuelle representasjoner fra semantisk tette beskrivelser.

VirTex trener felles en ConvNet og Transformers via bilde-tekst-par, og overfører de oppnådde innsiktene til nedstrøms visjon-oppgaver som objekt-gjenkjenning. Kilde: https://arxiv.org/pdf/2006.06666.pdf

VirTex trener felles en ConvNet og Transformers via bilde-tekst-par, og overfører de oppnådde innsiktene til nedstrøms visjon-oppgaver som objekt-gjenkjenning. Kilde: https://arxiv.org/pdf/2006.06666.pdf

Blant andre tester og ablasjons-studier, testet forskerne SPG-IM mot state-of-the-art trimap-baserte metoder Deep Image Matting (DIM), IndexNet, Context-Aware Image Matting (CAM), Guided Contextual Attention (GCA), FBA, og Semantic Image Mapping (SIM).

Andre tidligere rammer som ble testet inkluderte trimap-frie tilnærminger LFM, HAttMatting, og MODNet. For en rettferdig sammenligning, ble test-metodene tilpasset basert på de ulike metodene; hvor kode ikke var tilgjengelig, ble papirets teknikker reprodusert fra den beskrevne arkitekturen.

Artikkelen sier:

‘Vår SPG-IM overgår alle konkurrerende trimap-frie metoder ([LFM], [HAttMatting], og [MODNet]) med en stor margin. Samtidig viser vår modell også bemerkelsesverdig overlegenhet over state-of-the-art (SOTA) trimap-baserte og mask-guidede metoder i forhold til alle fire målinger over offentlige datasett (dvs. Composition-1K, Distinction-646, og Human-2K), og vår Multi-Object-1K benchmark.’

Og fortsetter:

‘Det kan være åpenbart observert at vår metode beholder fine detaljer (f.eks. hår-tipp-steder, transparente teksturer og grenser) uten veiledning av trimap. I tillegg, i sammenligning med andre konkurrerende trimap-frie modeller, kan vår SPG-IM beholde bedre global semantisk kompletthet.’

 

Først publisert 24. april 2022.

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai