Unghiul lui Anderson

Matting de imagine AI care înțelege scenele

mm
Adaugă Unite.AI la sursele tale preferate pe Google

În documentarul extras care însoțește lansarea DVD-ului din 2003 al filmului Alien3 (1992), legenda efectelor vizuale Richard Edlund și-a amintit cu groază de “lupta de sumo” a extracției fotochimice a matelor care a dominat lucrările de efecte vizuale între sfârșitul anilor 1930 și sfârșitul anilor 1980. Edlund a descris natura aleatorie a procesului ca “luptă de sumo”, în comparație cu tehnicile digitale de ecran albastru/verde care au preluat controlul la începutul anilor 1990 (și a revenit la metafora de atunci).

Extracția unui element din prim-plan (cum ar fi o persoană sau un model de navă spațială) dintr-un fundal, astfel încât imaginea decupată să poată fi compusă într-un fundal, a fost inițial realizată prin filmarea obiectului din prim-plan împotriva unui fundal uniform albastru sau verde.

Procese laborioase de extracție fotochimică pentru un cadru VFX de la ILM pentru 'Return of the Jedi' (1983). Sursă: https://www.youtube.com/watch?v=qwMLOjqPmbQ

Procese laborioase de extracție fotochimică pentru un cadru VFX de la ILM pentru ‘Return of the Jedi’ (1983). Sursă: https://www.youtube.com/watch?v=qwMLOjqPmbQ

În filmarea rezultată, culoarea fundalului ar fi ulterior izolată chimic și utilizată ca șablon pentru a reimprima obiectul din prim-plan (sau persoana) într-o imprimantă optică ca un obiect “plutitor” într-o celulă de film transparentă.

Procesul a fost cunoscut sub numele de suprapunere a separării culorilor (CSO) – deși acest termen ar deveni ulterior mai asociat cu efectele video crude ‘Chromakey’ din producțiile de televiziune cu buget redus din anii 1970 și 1980, care au fost realizate cu mijloace analogice, nu chimice sau digitale.

O demonstrație a suprapunerii separării culorilor în 1970 pentru emisiunea britanică pentru copii 'Blue Peter'. Sursă: https://www.bbc.co.uk/archive/blue_peter_noakes_CSO/zwb9vwx

O demonstrație a suprapunerii separării culorilor în 1970 pentru emisiunea britanică pentru copii ‘Blue Peter’. Sursă: https://www.bbc.co.uk/archive/blue_peter_noakes_CSO/zwb9vwx

În orice caz, indiferent dacă este vorba de elemente de film sau video, ulterior, imaginea extrasă putea fi inserată în orice altă imagine.

Deși procesul de sodiu-vapor al Disney, notabil mai scump și proprietar, care a codat pe galben (și a fost utilizat și pentru filmul de groază din 1963 al lui Alfred Hitchcock, Păsările) a oferit o definiție și margini mai clare, extracția fotochimică a rămas o procedură laborioasă și neverosimilă.

Procesul de extracție cu sodiu-vapor al Disney a necesitat fundaluri aproape de capătul spectrului galben. Aici, Angela Lansbury este suspendată pe sârmă în timpul producerii unei secvențe VFX pentru 'Bedknobs and Broomsticks' (1971). Sursă

Procesul de extracție cu sodiu-vapor al Disney a necesitat fundaluri aproape de capătul spectrului galben. Aici, Angela Lansbury este suspendată pe sârmă în timpul producerii unei secvențe VFX pentru ‘Bedknobs and Broomsticks’ (1971). Sursă

Dincolo de mattingul digital

În anii 1990, revoluția digitală a eliminat substanțele chimice, dar nu și nevoia de ecrane verzi. A devenit posibil să se înlăture fundalul verde (sau orice altă culoare) pur și simplu prin căutarea pixelilor dintr-o anumită gamă de culori, în software-ul de editare a pixelilor, cum ar fi Photoshop, și într-o nouă generație de suite de compunere video care puteau să izoleze automat fundalurile colorate. Aproape peste noapte, șaizeci de ani din industria imprimării optice au fost condamnați la istorie.

Ultimele zece ani de cercetare accelerată de GPU în domeniul viziunii computaționale au adus extracția matelor într-o a treia epocă, solicitând cercetătorilor dezvoltarea unor sisteme care să poată extrage măști de înaltă calitate fără nevoia de ecrane verzi. La Arxiv, articolele legate de inovațiile în extracția bazată pe învățarea automată a prim-planului sunt o apariție săptămânală.

Punându-ne în imagine

Acest loc de interes academic și industrial în extracția AI a avut deja un impact asupra spațiului consumator: implementări crude, dar funcționale, ne sunt familiare tuturor sub forma filtrilor Zoom și Skype care pot înlocui fundalurile noastre de cameră cu insule tropicale, etc., în apeluri video.

Cu toate acestea, cele mai bune măști necesită încă un ecran verde, așa cum a notat Zoom săptămâna trecută.

Stânga, un bărbat în fața unui ecran verde, cu părul extras bine prin funcția Virtual Background a Zoom. Dreapta, o femeie în fața unei scene domestice normale, cu părul extras algoritmic, mai puțin precis și cu cerințe de calcul mai mari. Sursă: https://support.zoom.us/hc/en-us/articles/210707503-Changing-your-Virtual-Background-image

Stânga, un bărbat în fața unui ecran verde, cu părul extras bine prin funcția Virtual Background a Zoom. Dreapta, o femeie în fața unei scene domestice normale, cu părul extras algoritmic, mai puțin precis și cu cerințe de calcul mai mari. Sursă: https://support.zoom.us/hc/en-us/articles/210707503-Changing-your-Virtual-Background-image

Un articol ulterioară de pe platforma Zoom Support avertizează că extracția fără ecran verde necesită și o putere de calcul mai mare în dispozitivul de captură.

Nevoia de a decupa

Îmbunătățirile calității, portabilității și economiei de resurse pentru sistemele de decupare “în sălbăticie” (adică izolarea oamenilor fără nevoia de ecrane verzi) sunt relevante pentru multe sectoare și activități, nu numai pentru filtrele de videoconferință.

Pentru dezvoltarea seturilor de date, recunoașterea feței, a capului și a corpului oferă posibilitatea de a asigura că elementele de fundal nu sunt integrate în modelele de viziune computațională ale subiecților umani; o izolare mai precisă ar îmbunătăți tehnicile de segmentare semantică destinate să distingă și să asimileze domenii (de exemplu, ‘pisică’, ‘persoană’, ‘barcă’), și ar îmbunătăți sistemele de sinteză de imagini bazate pe VAE și transformator precum noul DALL-E 2 de la OpenAI; și algoritmii de extracție mai buni ar reduce nevoia de rotoscopie manuală costisitoare în fluxurile de lucru VFX.

De fapt, ascendența metodologiilor multimodale (de obicei text/imaginile), în care un domeniu precum “pisică” este codat atât ca imagine, cât și cu referințe textuale asociate, a început deja să pătrundă în procesarea imaginilor. Un exemplu recent este arhitectura Text2Live, care utilizează antrenamentul multimodal (text/imaginile) pentru a crea videoclipuri cu, printre altele, lebădă cristal și girafă de sticlă.

Matting AI conștient de scenă

O mare parte din cercetarea privind mattingul automat bazat pe IA s-a axat pe recunoașterea marginilor și evaluarea grupărilor de pixeli dintr-o imagine sau cadru video. Cu toate acestea, o nouă cercetare din China oferă o conductă de extracție care îmbunătățește conturarea și calitatea măștii prin utilizarea descrierilor textuale ale unei scene (o abordare multimodală care a câștigat teren în sectorul cercetării viziunii computaționale în ultimii 3-4 ani), susținând că a îmbunătățit metodele anterioare în mai multe moduri.

Un exemplu de extracție SPG-IM, comparat cu metodele anterioare. Sursă: https://arxiv.org/pdf/2204.09276.pdf

Un exemplu de extracție SPG-IM, comparat cu metodele anterioare. Sursă: https://arxiv.org/pdf/2204.09276.pdf

Provocarea pentru subsectorul de cercetare a extracției constă în a produce fluxuri de lucru care să necesite un minimum de intervenție și anotare manuală – ideal, deloc. Pe lângă implicațiile de cost, cercetătorii noului articol observă că anotările și segmentările manuale realizate de lucrători din mulțime din diverse culturi pot duce la imagini etichetate sau chiar segmentate în moduri diferite, ceea ce conduce la algoritmi inconstienți și nesatisfăcători.

Un exemplu în acest sens este interpretarea subiectivă a ceea ce definește un “obiect din prim-plan”:

Din noul articol: metodele anterioare LFM și MODNet ('GT' înseamnă Adevărul de pe teren, un rezultat

Din noul articol: metodele anterioare LFM și MODNet (‘GT’ înseamnă Adevărul de pe teren, un rezultat “ideal” adesea realizat manual sau prin metode nealgoritmice) au abordări diferite și variabil eficiente pentru definirea conținutului din prim-plan, în timp ce noua metodă SPG-IM delimitează mai eficient “conținutul apropiat” prin contextul scenei.

Pentru a aborda această problemă, cercetătorii au dezvoltat o conductă în două etape numită Matting de imagine ghidat de percepția situațională (SPG-IM). Arhitectura cu două etape, encoder/decoder, constă din Distilarea percepției situaționale (SPD) și Matting ghidat de percepția situațională (SPGM).

Arhitectura SPG-IM.

Arhitectura SPG-IM.

Mai întâi, SPD preantrenează transformările vizuale-textuale, generând titluri potrivite pentru imaginile asociate. După aceea, predicția măștii din prim-plan este activată prin conectarea conductei la o tehnică nouă de predicție a salienței.

Apoi, SPGM produce o mască alfa estimată pe baza intrării brute RGB și a măștii generate în primul modul.

Obiectivul este ghidarea percepției situaționale, în care sistemul are o înțelegere contextuală a ceea ce reprezintă imaginea, permițându-i să abordeze – de exemplu – provocarea extragerii părului complex dintr-un fundal împotriva caracteristicilor cunoscute ale unei astfel de sarcini specifice.

În exemplul de mai jos, SPG-IM înțelege că firele sunt intrinseci unui

În exemplul de mai jos, SPG-IM înțelege că firele sunt intrinseci unui “parapant”, în timp ce MODNet nu reușește să păstreze și să definească aceste detalii. La fel, structura completă a aparatului de joacă este pierdută arbitrar în MODNet.

Noul articol se numește Matting de imagine ghidat de percepția situațională și provine de la cercetători de la OPPO Research Institute, PicUp.ai și Xmotors.

Măști automate inteligente

SPG-IM oferă, de asemenea, o rețea de rafinare a transformării focale adaptive (AFT) care poate procesa detalii locale și context global separat, facilitând “măști inteligente”.

Înțelegerea contextului scenei, în acest caz

Înțelegerea contextului scenei, în acest caz “fată cu cal”, poate face extragerea din prim-plan mai ușoară decât metodele anterioare.

Articolul afirmă:

‘Credem că reprezentările vizuale din sarcina vizual-textuală, de exemplu, descrierea imaginii, se concentrează pe semnale mai cuprinzătoare semantic între a) obiect la obiect și b) obiect și mediul înconjurător pentru a genera descrieri care pot acoperi atât informațiile globale, cât și detaliile locale. În plus, comparativ cu annotarea pixelilor scumpă a mattingului de imagine, etichetele textuale pot fi colectate în masă la un cost foarte mic.’

Ramura SPD a arhitecturii este antrenată împreună cu decodificatorul textual bazat pe transformator al Universității din Michigan, VirTex, care învață reprezentări vizuale din descrieri semantice dense.

VirTex antrenează împreună o rețea ConvNet și Transformatori prin cupluri imagine-descriere și transferă insight-urile obținute către sarcinile vizuale descendente, cum ar fi detectarea obiectelor. Sursă: https://arxiv.org/pdf/2006.06666.pdf

VirTex antrenează împreună o rețea ConvNet și Transformatori prin cupluri imagine-descriere și transferă insight-urile obținute către sarcinile vizuale descendente, cum ar fi detectarea obiectelor. Sursă: https://arxiv.org/pdf/2006.06666.pdf

Printre alte teste și studii de ablație, cercetătorii au testat SPG-IM împotriva metodelor bazate pe trimap de ultimă generație, Deep Image Matting (DIM), IndexNet, Context-Aware Image Matting (CAM), Guided Contextual Attention (GCA), FBA și Semantic Image Mapping (SIM).

Alte cadre anterioare testate au inclus abordări fără trimap LFM, HAttMatting și MODNet. Pentru o comparație corectă, metodele de test au fost adaptate pe baza metodologiilor diferite; unde codul nu a fost disponibil, tehnicile articolului au fost reproduse din arhitectura descrisă.

Noul articol afirmă:

‘SPG-IM nostru depășește toate metodele fără trimap ([LFM], [HAttMatting] și [MODNet]) cu o marjă largă. În același timp, modelul nostru arată, de asemenea, o superioritate remarcabilă față de metodele bazate pe trimap și ghidate de masca de ultimă generație în ceea ce privește toți cei patru parametri de pe seturile de date publice (adică Composition-1K, Distinction-646 și Human-2K) și benchmark-ul nostru Multi-Object-1K.’

Și continuă:

‘Se poate observa clar că metoda noastră păstrează detalii fine (de exemplu, site-urile vârfurilor de păr, texturile transparente și marginile) fără ghidarea trimapului. În plus, comparativ cu alte modele fără trimap, SPG-IM nostru poate păstra o mai bună integritate semantică globală.’

 

Publicat pentru prima dată pe 24 aprilie 2022.

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai