Kąt Andersona

Inteligentne wyodrębnianie obrazu, które rozumie sceny

mm
Dodaj Unite.AI do preferowanych źródeł w Google

W dodatkowym dokumencie towarzyszącym wydaniu DVD z 2003 roku filmu Obcy 3 (1992), legenda efektów wizualnych Richard Edlund wspominał z przerażeniem o “sumo wrestlingu” fotochemicznego wyodrębniania mat, które dominowało w pracy efektów wizualnych między późnymi latami 30. i późnymi latami 80. Edlund opisał charakter przypadkowy tego procesu jako “sumo wrestling”, w porównaniu z cyfrowymi technikami niebieskiego/zielonego ekranu, które zdominowały w początkach lat 90. (i powrócił do tej metafory od czasu).

Wyodrębnianie elementu pierwszoplanowego (takiego jak osoba lub model statku kosmicznego) z tła, aby można było skomponować wyodrębniony obraz w tle, było pierwotnie osiągane przez nagranie obiektu pierwszoplanowego na jednolitym niebieskim lub zielonym tle.

Najdroższe procesy fotochemicznego wyodrębniania dla efektu VFX przez ILM dla 'Powrót Jedi' (1983). Źródło: https://www.youtube.com/watch?v=qwMLOjqPmbQ

Najdroższe procesy fotochemicznego wyodrębniania dla efektu VFX przez ILM dla ‘Powrót Jedi’ (1983). Źródło: https://www.youtube.com/watch?v=qwMLOjqPmbQ

W wynikającym materiale, kolor tła był następnie izolowany chemicznie i używany jako szablon do ponownego wydruku obiektu pierwszoplanowego (lub osoby) w optycznej drukarce jako “pływający” obiekt w przeźroczystej komórce filmowej.

Proces ten był znany jako nakładka separacji kolorów (CSO) – chociaż ten termin ostatecznie stał się bardziej związany z grubymi Chromakey efektami wizualnymi w niższym budżecie telewizyjnym z lat 70. i 80., które były osiągane za pomocą analogowych, a nie chemicznych lub cyfrowych środków.

Demonstracja nakładki separacji kolorów w 1970 roku dla brytyjskiego programu dziecięcego 'Blue Peter'. Źródło: https://www.bbc.co.uk/archive/blue_peter_noakes_CSO/zwb9vwx

Demonstracja nakładki separacji kolorów w 1970 roku dla brytyjskiego programu dziecięcego ‘Blue Peter’. Źródło: https://www.bbc.co.uk/archive/blue_peter_noakes_CSO/zwb9vwx

W każdym przypadku, niezależnie od tego, czy chodzi o elementy filmowe czy wideo, wyodrębniony materiał można było następnie wstawić do dowolnego innego materiału.

Chociaż znacznie droższy i własny proces sodowy Disneya (który kluczował na żółto, a także użyty dla horroru Alfreda Hitchcocka z 1963 roku Ptaki) dawał lepszą definicję i ostrzejsze maty, fotochemiczne wyodrębnianie pozostało uciążliwe i niewiarygodne.

Własny proces sodowy Disneya wymagał tła w pobliżu żółtego końca widma. Tutaj Angela Lansbury jest zawieszona na drutach podczas produkcji sekwencji VFX dla 'Kotków i miotłów' (1971). Źródło

Własny proces sodowy Disneya wymagał tła w pobliżu żółtego końca widma. Tutaj Angela Lansbury jest zawieszona na drutach podczas produkcji sekwencji VFX dla ‘Kotków i miotłów’ (1971). Źródło

Poza cyfrowym wyodrębnianiem

W latach 90. rewolucja cyfrowa pozbyła się chemikaliów, ale nie potrzeby zielonych ekranów. Stało się możliwe usunięcie zielonego (lub innego koloru) tła, po prostu wyszukując piksele w zakresie tolerancji tego koloru w oprogramowaniu do edycji pikseli, takim jak Photoshop, oraz nowej generacji pakietów kompozycji wideo, które mogły automatycznie wykluczyć kolorowe tła. Praktycznie z dnia na dzień, sześćdziesiąt lat przemysłu drukowania optycznego zostało zaliczonych do historii.

Ostatnie dziesięć lat przyspieszonej komputerowo wizji komputera jest wprowadzaniem wyodrębniania mat w trzecią erę, nakazując badaczom opracowanie systemów, które mogą wyodrębnić wysokiej jakości maty bez potrzeby zielonych ekranów. Na Arxiv sam, artykuły związane z innowacjami w opartym na maszynowym uczeniu wyodrębnianiu pierwszoplanu są cotygodniową cechą.

Umieszczanie nas w obrazie

Ten ośrodek akademickiego i przemysłowego zainteresowania AI wyodrębnianiem już wpłynął na przestrzeń konsumencką: szorstkie, ale działające implementacje są nam wszystkim znane w postaci Zoom i Skype filtrów, które mogą zastąpić nasze tła w pokojach z tropikalnymi wyspami itp. w wideokonferencjach.

Jednak najlepsze maty nadal wymagają zielonego ekranu, jak Zoom zauważył w zeszłym tygodniu.

Po lewej, mężczyzna przed zielonym ekranem, z dobrze wyodrębnionymi włosami za pomocą funkcji Virtual Background Zoom. Po prawej, kobieta przed normalnym domowym tłem, z włosami wyodrębnionymi algorytmicznie, mniej dokładnie i z wyższymi wymaganiami obliczeniowymi. Źródło: https://support.zoom.us/hc/en-us/articles/210707503-Changing-your-Virtual-Background-image

Po lewej, mężczyzna przed zielonym ekranem, z dobrze wyodrębnionymi włosami za pomocą funkcji Virtual Background Zoom. Po prawej, kobieta przed normalnym domowym tłem, z włosami wyodrębnionymi algorytmicznie, mniej dokładnie i z wyższymi wymaganiami obliczeniowymi. Źródło: https://support.zoom.us/hc/en-us/articles/210707503-Changing-your-Virtual-Background-image

Dodatkowy artykuł z platformy Zoom Support ostrzega, że wyodrębnianie bez zielonego ekranu wymaga również większej mocy obliczeniowej w urządzeniu do przechwytywania.

Potrzeba wycięcia

Ulepszenia jakości, przenośności i gospodarki zasobów dla systemów wyodrębniania “w dzicz” (tj. izolowania ludzi bez potrzeby zielonych ekranów) są istotne dla wielu więcej sektorów i działań niż tylko filtry wideokonferencyjne.

Dla rozwoju zestawów danych, poprawiona rozpoznawalność twarzy, pełnej głowy i pełnego ciała oferuje możliwość zapewnienia, że niepotrzebne elementy tła nie są wytrenowane w modelach wizji komputera dotyczących ludzi; bardziej dokładna izolacja znacznie poprawiłaby techniki segmentacji semantycznej zaprojektowane do rozróżniania i asymilacji domen (tj. ‘kot’, ‘osoba’, ‘łódź’), oraz poprawiłaby systemy syntezy obrazu oparte na VAE i transformer, takie jak nowy DALL-E 2 od OpenAI; oraz lepsze algorytmy wyodrębniania zmniejszyłyby potrzebę drogiej ręcznej rotoskoping w kosztownych potokach VFX.

W istocie, dominacja multimodalnych (zwykle tekstowych/obrazowych) metodologii, gdzie domena, taka jak “kot”, jest zakodowana zarówno jako obraz, jak i z powiązanymi odniesieniami tekstowymi, już wpływa na przetwarzanie obrazu. Jednym z niedawnych przykładów jest architektura Text2Live, która wykorzystuje multimodalne (tekst/obraz) szkolenie do tworzenia filmów z, między innymi, kryształowymi łabędziami i szklanymi żyrafami.

Wyodrębnianie AI świadome sceny

Dużo badań nad automatycznym wyodrębnianiem AI skupiło się na rozpoznawaniu granic i ocenie grupowania pikseli wewnątrz obrazu lub ramki wideo. Jednak nowe badania z Chin oferują potok wyodrębniania, który poprawia wyodrębnianie i jakość maty, wykorzystując opis tekstowy sceny (multimodalny podejście, które zyskało na popularności w sektorze badań wizji komputera w ciągu ostatnich 3-4 lat), twierdząc, że poprawiło wcześniejsze metody na wiele sposobów.

Przykład wyodrębniania SPG-IM (ostatni obraz, dolny prawy), w porównaniu z poprzednimi metodami. Źródło: https://arxiv.org/pdf/2204.09276.pdf

Przykład wyodrębniania SPG-IM (ostatni obraz, dolny prawy), w porównaniu z poprzednimi metodami. Źródło: https://arxiv.org/pdf/2204.09276.pdf

Wyzwanie postawione dla podsektora badań nad wyodrębnianiem jest opracowanie potoków, które wymagają minimalnej ręcznej adnotacji i interwencji człowieka – idealnie, żadnej. Poza implikacjami kosztowymi, badacze nowego artykułu zauważają, że adnotacje i ręczne segmentacje przeprowadzane przez zlecanych pracowników w różnych kulturach mogą powodować, że obrazy są oznaczane lub nawet segmentowane na różne sposoby, prowadząc do niespójnych i niezadowalających algorytmów.

Jednym z przykładów jest subiektywna interpretacja tego, co definiuje “obiekt pierwszoplanowy”:

Z nowego artykułu: poprzednie metody LFM i MODNet ('GT' oznacza Ground Truth, 'idealny' wynik często osiągany ręcznie lub niealgorytmicznie), mają różne i różnie skuteczne podejścia do definicji zawartości pierwszoplanowej, podczas gdy nowa metoda SPG-IM skuteczniej wyodrębnia 'zawartość w pobliżu' za pomocą kontekstu sceny.

Z nowego artykułu: poprzednie metody LFM i MODNet (‘GT’ oznacza Ground Truth, ‘idealny’ wynik często osiągany ręcznie lub niealgorytmicznie), mają różne i różnie skuteczne podejścia do definicji zawartości pierwszoplanowej, podczas gdy nowa metoda SPG-IM skuteczniej wyodrębnia ‘zawartość w pobliżu’ za pomocą kontekstu sceny.

Aby rozwiązać ten problem, badacze opracowali dwuetapowy potok zatytułowany Wyodrębnianie obrazu kierowane percepcją sytuacyjną (SPG-IM). Dwuetapowa architektura kodera/dekodera składa się z Destylacji Percepcji Sytuacyjnej (SPD) i Wyodrębniania kierowanego Percepcją Sytuacyjną (SPGM).

Architektura SPG-IM.

Architektura SPG-IM.

Po pierwsze, SPD wstępnie trenuje transformacje cech wizualno-tekstowych, generując opisy odpowiednie dla powiązanych obrazów. Następnie, predykcja maski pierwszoplanowej jest włączona przez połączenie potoku z nową techniką predykcji saliencji.

Następnie SPGM wytwarza oszacowany matte alfa na podstawie surowego wejścia RGB i wygenerowanej maski uzyskanej w pierwszym module.

Celem jest wytyczna percepcji sytuacyjnej, w której system ma kontekstowe zrozumienie tego, co składa się na obraz, pozwalając mu ramować – na przykład – wyzwanie wyodrębniania złożonych włosów z tła przeciwko znanym cechom takiego konkretnego zadania.

Poniżej, SPG-IM rozumie, że linie są wewnętrzne dla 'spadochronu', podczas gdy MODNet nie potrafi utrzymać i zdefiniować tych szczegółów. Podobnie powyżej, cała struktura urządzenia playgroundowego jest arbitralnie utracona w MODNet.

Poniżej, SPG-IM rozumie, że linie są wewnętrzne dla ‘spadochronu’, podczas gdy MODNet nie potrafi utrzymać i zdefiniować tych szczegółów. Podobnie powyżej, cała struktura urządzenia playgroundowego jest arbitralnie utracona w MODNet.

Nowy artykuł zatytułowany jest Wyodrębnianie obrazu kierowane percepcją sytuacyjną, i pochodzi od badaczy z OPPO Research Institute, PicUp.ai i Xmotors.

Inteligentne automatyczne maty

SPG-IM oferuje również Sieć Udoskonalenia Przekształcenia Fokalnego (AFT), która może przetwarzać szczegóły lokalne i kontekst globalny oddzielnie, ułatwiając ‘inteligentne maty’.

Zrozumienie kontekstu sceny, w tym przypadku 'dziewczyna z koniem', może potencjalnie ułatwić wyodrębnianie pierwszoplanu bardziej niż poprzednie metody.

Zrozumienie kontekstu sceny, w tym przypadku ‘dziewczyna z koniem’, może potencjalnie ułatwić wyodrębnianie pierwszoplanu bardziej niż poprzednie metody.

Artykuł stwierdza:

‘Wierzymy, że reprezentacje wizualne z zadania wizualno-tekstowego, np. opisywanie obrazu, koncentrują się na bardziej semantycznie kompletnych sygnałach między a) obiektem a obiektem i b) obiektem a otoczeniem, aby wygenerować opisy, które mogą obejmować zarówno informacje globalne, jak i lokalne. Ponadto, w porównaniu z drogą adnotacją pikseli w wyodrębnianiu obrazu, etykiety tekstowe mogą być zbierane w bardzo niskim koszcie.’

Gałąź SPD architektury jest wspólnie wstępnie trenowana z transformerem opartym na decoderze Uniwersytetu Michigan VirTex, który uczy się reprezentacji wizualnych z gęstych podpisów.

VirTex trenuje wspólnie ConvNet i Transformers za pomocą par obraz-podpis, i przenosi uzyskane spostrzeżenia do zadań wizji, takich jak wykrywanie obiektów. Źródło: https://arxiv.org/pdf/2006.06666.pdf

VirTex trenuje wspólnie ConvNet i Transformers za pomocą par obraz-podpis, i przenosi uzyskane spostrzeżenia do zadań wizji, takich jak wykrywanie obiektów. Źródło: https://arxiv.org/pdf/2006.06666.pdf

Wśród innych testów i badań, badacze przetestowali SPG-IM przeciwko metodom opartym na trimapie, takim jak Deep Image Matting (DIM), IndexNet, Context-Aware Image Matting (CAM), Guided Contextual Attention (GCA), FBA, i Semantic Image Mapping (SIM).

Inne wcześniejsze ramy testowe obejmowały podejścia bez trimapu LFM, HAttMatting, i MODNet. Dla uczciwej porównania, metody testowe zostały dostosowane na podstawie różnych metodologii; gdzie kod nie był dostępny, techniki artykułu zostały odtworzone z opisanej architektury.

Nowy artykuł stwierdza:

‘Nasze SPG-IM przewyższa wszystkie konkurencyjne metody bez trimapu ([LFM], [HAttMatting], i [MODNet]) o dużą różnicę. Ponadto, nasz model pokazuje znaczną wyższość nad metody oparte na trimapie i maskach wiodących w kierunku wszystkich czterech metryk w publicznych zestawach danych (tj. Composition-1K, Distinction-646, i Human-2K), i naszym benchmarkiem Multi-Object-1K.’

I kontynuuje:

‘Można zobaczyć, że nasza metoda zachowuje drobne szczegóły (np. miejsca włosów, przeźroczyste tekstury i granice) bez wytycznych trimapu. Ponadto, w porównaniu z innymi konkurencyjnymi modelami bez trimapu, nasze SPG-IM może zachować lepszą globalną kompletność semantyczną.’

 

Pierwotnie opublikowane 24 kwietnia 2022.

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai