Взгляд Anderson

ST-NeRF: Композитинг и редактирование для синтеза видео

mm
Добавьте Unite.AI в избранные источники в Google
ST-NeRF

Китайский исследовательский консорциум разработал техники, которые позволяют добавить возможности редактирования и композитинга в один из самых горячих секторов исследований синтеза изображений за последний год – Нейронные поля радианса (NeRF). Система называется ST-NeRF (Пространственно-временное согласованное нейронное поле радианса).

На изображении ниже то, что кажется физическим движением камеры, на самом деле является просто пользователем, который “прокручивает” точки зрения на видеоконтент, существующий в 4D-пространстве. Точка зрения не привязана к выступлению людей, изображенных на видео, чьи движения можно просмотреть с любой части 180-градусного радиуса.

ST-NeRF

Каждый аспект видео представляет собой дискретно захваченный элемент, составленный в связную сцену, которую можно динамически исследовать.

Эти аспекты можно свободно дублировать в сцене или изменять размер:

ST-NeRF

Кроме того, временное поведение каждого аспекта можно легко изменить, замедлить, обратить или манипулировать любым способом, открывая путь к архитектурам фильтров и чрезвычайно высокому уровню интерпретируемости.

Два отдельных аспекта NeRF, работающих с разными скоростями в одной сцене. Источник: https://www.youtube.com/watch?v=Wp4HfOwFGP4

Два отдельных аспекта NeRF, работающих с разными скоростями в одной сцене. Источник: https://www.youtube.com/watch?v=Wp4HfOwFGP4

Не нужно ротоскопировать исполнителей или среду, или заставлять исполнителей выполнять свои движения слепо и вне контекста предполагаемой сцены. Вместо этого кадры захватываются естественным образом с помощью массива из 16 видеокамер, покрывающих 180 градусов:

16 камер ST-NeRF

Три элемента, изображенные выше, два человека и среда, являются отдельными и выделены только для иллюстрации. Каждый из них можно заменить, и каждый можно вставить в сцену на более ранней или более поздней точке их индивидуальной временной шкалы.

Три элемента, изображенные выше, два человека и среда, являются отдельными и выделены только для иллюстрации. Каждый из них можно заменить, и каждый можно вставить в сцену на более ранней или более поздней точке их индивидуальной временной шкалы.

ST-NeRF является инновацией в области исследований Нейронных полей радианса (NeRF), машинного обучения, в котором несколько точек зрения синтезируются в навигируемое виртуальное пространство путем обширной тренировки (хотя захват с одной точки зрения также является подсектором исследований NeRF).

Нейронные поля радианса работают путем сбора нескольких точек зрения в единую связную и навигируемую 3D-пространство, с пробелами между покрытием, оцененными и отображенными нейронной сетью. Когда используется видео (а не статические изображения), необходимые ресурсы рендеринга часто значительны. Источник: https://www.matthewtancik.com/nerf

Нейронные поля радианса работают путем сбора нескольких точек зрения в единую связную и навигируемую 3D-пространство, с пробелами между покрытием, оцененными и отображенными нейронной сетью. Когда используется видео (а не статические изображения), необходимые ресурсы рендеринга часто значительны. Источник: https://www.matthewtancik.com/nerf

Интерес к NeRF стал интенсивным за последние девять месяцев, и список, поддерживаемый Reddit, список производных или исследовательских работ NeRF в настоящее время включает шестьдесят проектов.

 

Некоторые из многих ответвлений оригинальной работы NeRF. Источник: https://crossminds.ai/graphlist/nerf-neural-radiance-fields-ai-research-graph-60708936c8663c4cfa875fc2/

Некоторые из многих ответвлений оригинальной работы NeRF. Источник: https://crossminds.ai/graphlist/nerf-neural-radiance-fields-ai-research-graph-60708936c8663c4cfa875fc2/

Доступная тренировка

Статья является совместной работой исследователей из Шанхайского технологического университета и DGene Digital Technology, и была принята с некоторым энтузиазмом на Open Review.

ST-NeRF предлагает несколько инноваций над предыдущими инициативами в области ML-выведенных навигируемых видеопространств. Не менее важно, что он достигает высокого уровня реализма с помощью только 16 камер. Хотя DyNeRF от Facebook использует только на две камеры больше, он предлагает гораздо более ограниченный навигируемый дугу.

Пример среды DyNeRF от Facebook, с более ограниченной областью движения и большим количеством камер на квадратный фут, необходимых для реконструкции сцены. Источник: https://neural-3d-video.github.io

Пример среды DyNeRF от Facebook, с более ограниченной областью движения и большим количеством камер на квадратный фут, необходимых для реконструкции сцены. Источник: https://neural-3d-video.github.io

Помимо отсутствия возможности редактировать и композитить отдельные аспекты, DyNeRF особенно дорог в плане вычислительных ресурсов. Напротив, китайские исследователи утверждают, что стоимость тренировки их данных составляет где-то между $900-$3,000, по сравнению с $30,000 для модели видеогенерации DVDGAN и интенсивных систем, таких как DyNeRF.

Рецензенты также отметили, что ST-NeRF делает значительную инновацию в разделении процесса обучения движения от процесса синтеза изображения. Это разделение позволяет редактировать и композитить, в то время как предыдущие подходы были ограничены и линейны по сравнению.

Хотя 16 камер является очень ограниченным массивом для такой полной полукруговой точки зрения, исследователи надеются сократить это число в дальнейшей работе с помощью использования прокси-предварительно просканированных статических фонов и более данных-ориентированных подходов к моделированию сцены. Они также надеются включить возможности перенастройки освещения, недавнюю инновацию в исследованиях NeRF.

Решение ограничений ST-NeRF

В контексте академических работ CS, которые склонны выбрасывать фактическую применимость новой системы в конце абзаца, даже ограничения, которые исследователи признают для ST-NeRF, являются необычными.

Они наблюдают, что система в настоящее время не может индивидуализировать и отдельно отображать определенные объекты в сцене, потому что люди в кадрах сегментируются в отдельные сущности с помощью системы, предназначенной для распознавания людей, а не объектов – проблема, которая, кажется, легко решается с помощью YOLO и подобных фреймворков, с более сложной работой по извлечению видео человека уже выполненной.

Хотя исследователи отмечают, что в настоящее время невозможно сгенерировать замедленное движение, кажется, что нет препятствий для реализации этого с помощью существующих инноваций в интерполяции кадров, таких как DAIN и RIFE.

Как и во всех реализациях NeRF, и во многих других областях исследований компьютерного зрения, ST-NeRF может не справиться с экстремальными случаями перекрытия, когда объект временно перекрывается другим человеком или объектом, и может быть трудно непрерывно отслеживать или точно восстанавливать позже. Как и везде, эта трудность может потребовать решения вверх по течению. Тем временем исследователи признают, что ручное вмешательство необходимо в этих перекрытых кадрах.

Наконец, исследователи наблюдают, что процедуры сегментации человека в настоящее время полагаются на цветовые различия, которые могут привести к непреднамеренному объединению двух людей в один блок сегментации – препятствие, не ограниченное ST-NeRF, но intrinsic к используемой библиотеке, и которое, возможно, можно решить с помощью анализа оптического потока и других появляющихся техник.

Опубликовано впервые 7 мая 2021 г.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: [email protected]