Взгляд Anderson
Интеллектуальное маттирование изображений, понимающее сцены

В документальном фильме, сопровождающем выпуск DVD фильма Чужой 3 (1992) 2003 года, легенда визуальных эффектов Ричард Эдлунд вспомнил с ужасом о “сумо-борьбе” фотохимического маттирования, которая доминировала в работе визуальных эффектов между концом 1930-х и концом 1980-х годов. Эдлунд описал процесс как “сумо-борьбу” по сравнению с цифровыми методами синего/зеленого экрана, которые стали доминирующими в начале 1990-х годов (и он вернулся к этой метафоре с тех пор).
Извлечение переднего элемента (такого как человек или модель космического корабля) из фона, чтобы вырезанное изображение можно было составить в фоновой пластине, изначально осуществлялось путем съемки переднего объекта на фоне единого синего или зеленого цвета.

Трудоемкие фотохимические процессы извлечения для кадра VFX от ILM для ‘Возвращения Джедая’ (1983). Источник: https://www.youtube.com/watch?v=qwMLOjqPmbQ
В полученных кадрах цвет фона затем изолировался химически и использовался как шаблон для повторной печати переднего объекта (или человека) в оптическом принтере в виде “плавающего” объекта в прозрачной пленке.
Этот процесс назывался цветовым наложением (CSO) – хотя этот термин позже стал более связанным с грубыми хромакей видеоэффектами в телевизионных продуктах с низким бюджетом 1970-х и 1980-х годов, которые были достигнуты аналоговыми, а не химическими или цифровыми средствами.

Демонстрация Color Separation Overlay в 1970 году для британской детской программы ‘Blue Peter’. Источник: https://www.bbc.co.uk/archive/blue_peter_noakes_CSO/zwb9vwx
В любом случае, независимо от того, для фильма или видеоэлементов, извлеченные кадры можно было вставить в любые другие кадры.
Хотя заметно более дорогой и проприетарный сodium-vapor процесс Disney (который ключился на желтый цвет и также использовался для фильма Альфреда Хичкока “Птицы” 1963 года) давал лучшее определение и более четкие маты, фотохимическое извлечение оставалось трудоемким и ненадежным.

Проприетарный процесс извлечения sodium vapor Disney требовал фонов gần конца спектра. Здесь Анджела Лэнсбери подвешена на проводах во время производства VFX-sequences для ‘Bedknobs and Broomsticks’ (1971). Источник
За пределами цифрового маттирования
В 1990-х годах цифровая революция избавилась от химикатов, но не от необходимости в зеленых экранах. Стало возможным удалить зеленый (или любой другой цвет) фон, просто найдя пиксели в пределах диапазона этого цвета в программном обеспечении для редактирования пикселей, таком как Photoshop, и в новом поколении видеокомпозитных пакетов, которые могли автоматически исключать цветные фоны. Почти за одну ночь шестьдесят лет отрасли оптической печати были отнесены к истории.
Последние десять лет ускоренных вычислений на GPU в области компьютерного зрения привели матирование в третью эпоху, поставив перед исследователями задачу разработки систем, которые могут извлекать высококачественные маты без необходимости в зеленых экранах. На Arxiv alone, статьи, связанные с инновациями в области извлечения переднего плана на основе машинного обучения, являются еженедельной особенностью.
Поместив нас в картину
Этот центр академического и промышленного интереса к извлечению на основе ИИ уже повлиял на потребительское пространство: грубые, но работающие реализации знакомы нам в виде Zoom и Skype фильтров, которые могут заменить наши фоновые изображения на тропические острова и т. д. в видеоконференциях.
Однако лучшие маты все еще требуют зеленого экрана, как Zoom отметил в прошлый вторник.

Слева, человек перед зеленым экраном, с хорошо извлеченной волосами через функцию Virtual Background Zoom. Справа, женщина перед обычной домашней сценой, с волосами, извлеченными алгоритмически, менее точно и с более высокими вычислительными требованиями. Источник: https://support.zoom.us/hc/en-us/articles/210707503-Changing-your-Virtual-Background-image
Дополнительный пост с платформы Zoom Support предупреждает, что извлечение без зеленого экрана также требует большей вычислительной мощности в устройстве захвата.
Необходимость вырезать
Улучшения качества, портативности и экономии ресурсов для систем матирования “в дикой природе” (т. е. изоляции людей без необходимости в зеленых экранах) имеют отношение к многим другим секторам и занятиям, чем просто видеоконференции.
Для разработки наборов данных улучшенное распознавание лица, головы и тела предлагает возможность обеспечить, чтобы посторонние фоновые элементы не были обучены в модели компьютерного зрения человека; более точная изоляция значительно улучшит семантическую сегментацию техники, предназначенные для различения и ассимиляции доменов (т. е. ‘кот’, ‘человек’, ‘лодка’), и улучшит VAE и трансформер-основанные системы синтеза изображений, такие как новая DALL-E 2 от OpenAI; и лучшие алгоритмы извлечения уменьшат необходимость в дорогостоящей ручной ротоскопии в дорогих VFX-пipelines.
На самом деле, восхождение мультимодальных (обычно текст/изображение) методов, где домен, такой как “кот”, кодируется как изображение и с связанными текстовыми ссылками, уже делает успехи в обработке изображений. Одним из недавних примеров является Text2Live архитектура, которая использует мультимодальное (текст/изображение) обучение для создания видеороликов, среди прочего, кристаллических лебедей и стеклянных жирафов.
Сцена-осведомленное маттирование ИИ
Значительная часть исследований по автоматическому матированию на основе ИИ была сосредоточена на распознавании границ и оценке группировки пикселей внутри изображения или кадра видео. Однако новые исследования из Китая предлагают пайплайн извлечения, который улучшает разделение и качество матов, используя текстовые описания сцены (мультимодальный подход, который получил распространение в области компьютерного зрения в последние 3-4 года), утверждая, что они улучшили предыдущие методы несколькими способами.

Пример SPG-IM извлечения (последнее изображение, нижний правый), сравненный с предыдущими методами. Источник: https://arxiv.org/pdf/2204.09276.pdf
Вызов, поставленный перед подотраслью извлечения, состоит в том, чтобы создать рабочие процессы, которые требуют минимального количества ручных аннотаций и вмешательства человека – идеально, никакого. Кроме стоимостных последствий, исследователи новой статьи отмечают, что аннотации и ручные сегментации, выполненные аутсорсинговыми работниками в различных культурах, могут привести к тому, что изображения будут помечены или даже сегментированы по-разному, что приведет к несовместимым и неудовлетворительным алгоритмам.
Одним из примеров является субъективная интерпретация того, что определяет “передний объект”:

Из новой статьи: предыдущие методы LFM и MODNet (‘GT’ означает Ground Truth, ‘идеальный’ результат, часто достигаемый вручную или неалгоритмическими методами), имеют разные и различные эффективные подходы к определению переднего контента, тогда как новый метод SPG-IM более эффективно определяет ‘близкий контент’ через контекст сцены.
Чтобы решить эту проблему, исследователи разработали двухэтапный пайплайн под названием Ситуационное восприятие, управляемое маттированием изображений (SPG-IM). Двухэтапная архитектура кодирования/декодирования состоит из Ситуационного восприятия (SPD) и Ситуационного восприятия, управляемого маттированием (SPGM).
Сначала SPD предварительно обучает визуально-текстовые преобразования функций, генерируя подписи, соответствующие их связанным изображениям. После этого предсказание маски переднего плана включается путем подключения пайплайна к новой технике предсказания салиентности.
Затем SPGM выводит оцененный альфа-мат, основанный на входном RGB-изображении и сгенерированной маске, полученной в первом модуле.
Цель состоит в ситуационном руководстве, при котором система имеет контекстное понимание того, что состоит изображение, что позволяет ей поставить – например – задачу извлечения сложных волос из фона против известных характеристик такого конкретного задания.

В примере ниже SPG-IM понимает, что шнурки являются неотъемлемой частью ‘парашюта’, тогда как MODNet не может сохранить и определить эти детали. Аналогично выше, полная структура детской площадки теряется в MODNet.
Новая статья озаглавлена Ситуационное восприятие, управляемое маттированием изображений и исходит от исследователей из OPPO Research Institute, PicUp.ai и Xmotors.
Интеллектуальные автоматические маты
SPG-IM также предлагает сеть уточнения Адаптивного фокусного преобразования (AFT), которая может обрабатывать локальные детали и глобальный контекст отдельно, что позволяет создавать “интеллектуальные маты”.

Понимание контекста сцены, в данном случае ‘девочка с лошадью’, может потенциально сделать извлечение переднего плана проще, чем предыдущие методы.
Статья гласит:
‘Мы считаем, что визуальные представления из визуально-текстовой задачи, например, подписывание изображений, фокусируются на более семантически полных сигналах между а) объектом и объектом и б) объектом и окружающей средой для генерации описаний, которые могут охватить как глобальную информацию, так и локальные детали. Кроме того, по сравнению с дорогой пиксельной аннотацией маттирования изображений, текстовые метки можно собирать в огромных количествах при очень низкой стоимости.’
Архитектура имеет ветвь SPD, которая предварительно обучена с трансформатором на основе текстового декодера Университета Мичигана VirTex, который учит визуальные представления из семантически плотных подписей.

VirTex совместно обучает ConvNet и трансформеры через пары изображений и подписей и передает полученные знания в задачи компьютерного зрения, такие как обнаружение объектов. Источник: https://arxiv.org/pdf/2006.06666.pdf
Среди других тестов и исследований исследователи протестировали SPG-IM против современных тримап-основанных методов Deep Image Matting (DIM), IndexNet, Context-Aware Image Matting (CAM), Guided Contextual Attention (GCA), FBA, и Semantic Image Mapping (SIM).
Другие предыдущие фреймворки, протестированные, включали тримап-свободные подходы LFM, HAttMatting, и MODNet. Для справедливого сравнения, методы тестирования были адаптированы на основе различных методологий; где код был недоступен, техники статьи были воспроизведены из описанной архитектуры.
Статья гласит:
‘Наш SPG-IM превосходит все конкурирующие тримап-свободные методы ([LFM], [HAttMatting], и [MODNet]) на большом отрыве. Тем временем, наша модель также показывает замечательное превосходство над современными тримап-основанными и маской-управляемыми методами по всем четырем метрикам на публичных наборах данных (т. е. Composition-1K, Distinction-646, и Human-2K), и наш Multi-Object-1K бенчмарк.’
И продолжает:
‘Можно явно наблюдать, что наш метод сохраняет тонкие детали (например, кончики волос, прозрачные текстуры и границы) без руководства тримапа. Кроме того, по сравнению с другими конкурирующими тримап-свободными моделями, наш SPG-IM может сохранить лучшую глобальную семантическую полноту.’
Опубликовано впервые 24 апреля 2022 года.















