Погляд Anderson

AI‑матування зображень, яке розуміє сцени

mm
Додайте Unite.AI до бажаних джерел у Google

У додатковому документальному фільмі, що супроводжував випуск DVD 2003 року фільму Alien3 (1992), легенда візуальних ефектів Річард Едлунд з жахом згадав «сума‑боротьбу» фотохімічного видобутку мату, яка домінувала у роботі над візуальними ефектами кінець 1930‑х до кінець 1980‑х. Едлунд описав непостійний характер процесу як «сума‑боротьбу», у порівнянні з цифровими техніками синьо‑зеленого екрану, які перейнялися на початку 1990‑х (і він з того часу повернувся до цієї метафори).

Виділення переднього елементу (наприклад, людини або моделі космічного корабля) з фону, щоб вирізане зображення можна було композиціонувати на фон, спочатку здійснювалося шляхом зйомки переднього об’єкта на рівномірному синьому або зеленому фоні.

Laborious photochemical extraction processes for a VFX shot by ILM for 'Return of the Jedi' (1983).

Laborious photochemical extraction processes for a VFX shot by ILM for ‘Return of the Jedi’ (1983).

У отриманих кадрах колір фону потім хімічно виділявся і використовувався як шаблон для повторного друку переднього об’єкта (або людини) в оптичному принтері як «плаваючого» об’єкта в інакше прозорій плівковій клітинці.

Процес називали color separation overlay (CSO) — хоча згодом цей термін став більш асоціюватися з грубими ‘Chromakey’ відеоефектами у низькобюджетних телевізійних випусках 1970‑х і 1980‑х років, які досягалися за допомогою аналогових, а не хімічних чи цифрових засобів.

A demonstration of Color Separation Overlay in 1970 for the British children's show 'Blue Peter'. Source: https://www.bbc.co.uk/archive/blue_peter_noakes_CSO/zwb9vwx[/caption]

A demonstration of Color Separation Overlay in 1970 for the British children’s show ‘Blue Peter’. Source: https://www.businessinsider.com/mary-poppins-disney-changed-movies-classic-visual-effects-green-screen-2018-12

У будь‑якому випадку, чи то для кіно, чи для відео, після цього видобуте відео можна було вставляти в будь‑яке інше відео.

Хоча значно дорожчий і власний процес натрійного пару Disney (який працював на жовтому кольорі, зокрема, і був також використаний у жахливому фільмі Альфреда Хічкока 1963 року The Birds) забезпечував кращу чіткість і більш різкі матові, фотохімічне виділення залишалося надзвичайно трудомістким і ненадійним.

[caption id="attachment_181256" align="alignnone" width="482"]Disney's proprietary sodium vapor extraction process required backgrounds near the yellow end of the spectrum. Here, Angela Lansbury is suspended on wires during the production of a VFX-laced sequence for 'Bedknobs and Broomsticks' (1971). Source Disney’s proprietary sodium vapor extraction process required backgrounds near the yellow end of the spectrum. Here, Angela Lansbury is suspended on wires during the production of a VFX-laced sequence for ‘Bedknobs and Broomsticks’ (1971). Source

Поза цифровим матуванням

У 1990‑х роках цифрова революція відмовилася від хімікатів, хоча потреба у зелених екранах залишилася. Тепер можна було видаляти зелений (або будь‑який інший) фон просто шляхом пошуку пікселів у межах допустимого діапазону цього кольору у програмах для редагування пікселів, таких як Photoshop, і новому поколінні пакетів відео‑композиції, які могли автоматично видаляти кольорові фони. Майже за одну ніч шістдесят років індустрії оптичного друку було відправлено в історію.

Останні десять років досліджень комп’ютерного зору з прискоренням GPU вводять видобуток мату в третю епоху, ставлячи перед дослідниками завдання розробити системи, які можуть видобувати високоякісні мати без потреби у зелених екранах. Лише на Arxiv щотижня з’являються статті, пов’язані з інноваціями у видобутку переднього плану на основі машинного навчання.

Розміщуючи нас у кадрі

Цей центр академічного та промислового інтересу до AI‑видобутку вже вплинув на споживчий ринок: грубі, але працездатні реалізації нам всім знайомі у вигляді фільтрів Zoom та Skype, які можуть замінювати фон нашої вітальні на тропічні острови тощо під час відеоконференцій.

Проте найкращі мати все ще потребують зеленого екрану, як Zoom зазначив у середу.

Left, a man in front of a green screen, with well-extracted hair via Zoom's Virtual Background feature. Left, a woman in front of a normal domestic scene, with hair extracted algorithmically, less accurately, and with higher computing requirements. Source: https://support.zoom.us/hc/en-us/articles/210707503-Changing-your-Virtual-Background-image[/caption]

Left, a man in front of a green screen, with well-extracted hair via Zoom’s Virtual Background feature. Right, a woman in front of a normal domestic scene, with hair extracted algorithmically, less accurately, and with higher computing requirements. Source: https://support.zoom.us/hc/en-us/articles/360043484511

Подальший допис на платформі підтримки Zoom застерігає, що видобуток без зеленого екрану також вимагає більшої обчислювальної потужності в пристрої захоплення.

Потреба вирізати

Покращення якості, портативності та економії ресурсів у системах видобутку мату «в польових умовах» (тобто ізоляції людей без потреби у зелених екранах) мають значення для багатьох інших галузей і завдань, а не лише для фільтрів відеоконференцій.

Для розробки наборів даних покращене розпізнавання облич, повних голів та всього тіла дає можливість забезпечити, щоб зайві елементи фону не потрапляли у навчання моделей комп’ютерного зору, що розпізнають людей; більш точна ізоляція значно покращить техніки семантичної сегментації, призначені для розрізнення та асиміляції доменів (наприклад, ‘cat’, ‘person’, ‘boat’), а також удосконалить системи синтезу зображень на базі VAE та трансформерів, такі як новий DALL‑E 2 від OpenAI; кращі алгоритми видобутку скоротять потребу у дорогому ручному ротоскопуванні у витратних VFX‑конвеєрах.

Насправді, підйом мультимодальних (зазвичай текст/зображення) методологій, де домен, такий як «cat», кодується як зображенням, так і пов’язаними текстовими посиланнями, вже проникає у обробку зображень. Один недавній приклад — архітектура Text2Live, яка використовує мультимодальне (текст/зображення) навчання для створення відео, серед безлічі інших можливостей, кришталевих лебедів та скляних жирафів.

Сцено‑усвідомлююче AI‑матування

Багато досліджень у галузі автоматичного AI‑матування зосереджувалися на розпізнаванні меж та оцінці піксельних групувань всередині зображення чи відеокадру. Однак нове дослідження з Китаю пропонує конвеєр видобутку, який покращує розмежування та якість мату, використовуючи текстові описи сцени (мультимодальний підхід, який набув популярності в дослідницькому секторі комп’ютерного зору за останні 3‑4 роки), стверджуючи, що вдосконалив попередні методи у кількох аспектах.

[caption id="attachment_181258" align="alignnone" width="1112"]An example SPG-IM extraction (last image, lower right), compared against competing prior methods. Source: https://arxiv.org/pdf/2204.09276.pdf[/caption] An example SPG-IM extraction (last image, lower right), compared against competing prior methods. Source: https://www.unite.ai/wp-content/uploads/2022/04/foreground-extraction.jpg

Завдання, що стоїть перед підрозділом досліджень видобутку, — створити робочі процеси, які потребують мінімуму ручної анотації та людського втручання — ідеально — жодного. Окрім фінансових наслідків, дослідники нової статті зазначають, що анотації та ручні сегментації, виконані залученими зовнішніми працівниками з різних культур, можуть призводити до різного маркування чи навіть сегментації зображень, що створює непослідовні та незадовільні алгоритми.

Одним прикладом цього є суб’єктивна інтерпретація того, що визначає «об’єкт переднього плану»:

[caption id="attachment_181259" align="alignnone" width="1200"]From the new paper: prior methods LFM and MODNet ('GT' signifies Ground Truth, an 'ideal' result often achieved manually or by non-algorithmic methods), have different and variously effective takes on the definition of foreground content, whereas the new SPG-IM method more effectively delineates 'near content' through scene context. From the new paper: prior methods LFM and MODNet (‘GT’ signifies Ground Truth, an ‘ideal’ result often achieved manually or by non-algorithmic methods), have different and variously effective takes on the definition of foreground content, whereas the new SPG-IM method more effectively delineates ‘near content’ through scene context.

Для вирішення цієї проблеми дослідники розробили двоетапний конвеєр під назвою Situational Perception Guided Image Matting (SPG-IM). Двоетапна архітектура кодувальник/декодувальник включає Situational Perception Distillation (SPD) та Situational Perception Guided Matting (SPGM).

The SPG-IM architecture.

The SPG-IM architecture.

Спочатку SPD передтренує перетворення візуальних у текстові ознаки, створюючи підписи, що відповідають їхнім зображенням. Після цього передбачення маски переднього плану активується шляхом підключення конвеєра до нової техніки прогнозування важливості.

Потім SPGM генерує оцінкову альфа‑мату на основі вхідного необробленого RGB‑зображення та створеної маски, отриманої в першому модулі.

Метою є керування ситуаційним сприйняттям, коли система має контекстуальне розуміння того, з чого складається зображення, що дозволяє, наприклад, сформулювати задачу видобутку складних волосся з фону, враховуючи відомі характеристики такого специфічного завдання.

In the example below, SPG-IM understands that the cords are intrinsic to a 'parachute', where MODNet fails to retain and define these details. Likewise above, the complete structure of the playground apparatus is arbitrarily lost in MODNet.

In the example below, SPG-IM understands that the cords are intrinsic to a ‘parachute’, where MODNet fails to retain and define these details. Likewise above, the complete structure of the playground apparatus is arbitrarily lost in MODNet.

Нова стаття називається Situational Perception Guided Image Matting і написана дослідниками з OPPO Research Institute, PicUp.ai та Xmotors.

Інтелектуальні автоматичні мати

SPG-IM також пропонує мережу уточнення Adaptive Focal Transformation (AFT), яка може окремо обробляти локальні деталі та глобальний контекст, сприяючи створенню «інтелектуальних матів».

Understanding scene context, in this case 'girl with horse', can potentially make foreground extraction easier than prior methods.

Understanding scene context, in this case ‘girl with horse’, can potentially make foreground extraction easier than prior methods.

У статті зазначено:

‘Ми вважаємо, що візуальні представлення, отримані з візуально‑текстового завдання, наприклад підписування зображень, зосереджуються на більш семантично комплексних сигналах між a) об’єктом та об’єктом і b) об’єктом та навколишнім середовищем, щоб створювати описи, які охоплюють як глобальну інформацію, так і локальні деталі. Крім того, у порівнянні з дорогим піксельним анотованням матування зображень, текстові мітки можна збирати масово за дуже низькою вартістю.’

Гілка SPD архітектури спільно передтренується з трансформер‑базованим текстовим декодером VirTex Мічиганського університету, який навчає візуальні представлення на основі семантично насичених підписів.

VirTex jointly trains a ConvNet and Transformers via image-caption couplets, and transfers the obtained insights to downstream vision tasks such as object detection. Source: https://arxiv.org/pdf/2006.06666.pdf[/caption] VirTex jointly trains a ConvNet and Transformers via image-caption couplets, and transfers the obtained insights to downstream vision tasks such as object detection. Source: https://link.springer.com/chapter/10.1007/11567646_16

Серед інших тестів і абляційних досліджень дослідники порівняли SPG-IM із передовими trimap-базованими методами Deep Image Matting (DIM), IndexNet, Context‑Aware Image Matting (CAM), Guided Contextual Attention (GCA), FBA, та Semantic Image Mapping (SIM).

Серед інших випробуваних попередніх фреймворків були підходи без trimap, такі як LFM, HAttMatting та MODNet. Для справедливого порівняння методи тестування були адаптовані відповідно до різних методологій; коли код був недоступний, техніки статті були відтворені за описаною архітектурою.

У новій статті зазначено:

‘Наш SPG-IM перевершує всі конкурентні методи без trimap ([LFM], [HAttMatting] та [MODNet]) з великою перевагою. При цьому наша модель також демонструє значну перевагу над передовими (SOTA) trimap‑базованими та маскою‑керованими методами за всіма чотирма метриками на публічних наборах даних (тобто Composition‑1K, Distinction‑646 та Human‑2K), а також нашим бенчмарком Multi‑Object‑1K.’

‘Очевидно, що наш метод зберігає дрібні деталі (наприклад, кінчики волосся, прозорі текстури та контури) без керування trimap. Крім того, у порівнянні з іншими конкурентними моделями без trimap, наш SPG‑IM зберігає кращу глобальну семантичну цілісність.’

 

Перший раз опубліковано 24 квітня 2022 року.

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai