Взгляд Anderson
ST-NeRF: Композитинг и редактирование для синтеза видео

Китайский исследовательский консорциум разработал техники, которые позволяют добавить возможности редактирования и композитинга в один из самых горячих секторов исследований синтеза изображений за последний год – Нейронные поля радианса (NeRF). Система называется ST-NeRF (Пространственно-временное согласованное нейронное поле радианса).
На изображении ниже то, что кажется физическим движением камеры, на самом деле является просто пользователем, который “прокручивает” точки зрения на видеоконтент, существующий в 4D-пространстве. Точка зрения не привязана к выступлению людей, изображенных на видео, чьи движения можно просмотреть с любой части 180-градусного радиуса.

Каждый аспект видео представляет собой дискретно захваченный элемент, составленный в связную сцену, которую можно динамически исследовать.
Эти аспекты можно свободно дублировать в сцене или изменять размер:

Кроме того, временное поведение каждого аспекта можно легко изменить, замедлить, обратить или манипулировать любым способом, открывая путь к архитектурам фильтров и чрезвычайно высокому уровню интерпретируемости.

Два отдельных аспекта NeRF, работающих с разными скоростями в одной сцене. Источник: https://www.youtube.com/watch?v=Wp4HfOwFGP4

Не нужно ротоскопировать исполнителей или среду, или заставлять исполнителей выполнять свои движения слепо и вне контекста предполагаемой сцены. Вместо этого кадры захватываются естественным образом с помощью массива из 16 видеокамер, покрывающих 180 градусов:


Три элемента, изображенные выше, два человека и среда, являются отдельными и выделены только для иллюстрации. Каждый из них можно заменить, и каждый можно вставить в сцену на более ранней или более поздней точке их индивидуальной временной шкалы.
ST-NeRF является инновацией в области исследований Нейронных полей радианса (NeRF), машинного обучения, в котором несколько точек зрения синтезируются в навигируемое виртуальное пространство путем обширной тренировки (хотя захват с одной точки зрения также является подсектором исследований NeRF).

Нейронные поля радианса работают путем сбора нескольких точек зрения в единую связную и навигируемую 3D-пространство, с пробелами между покрытием, оцененными и отображенными нейронной сетью. Когда используется видео (а не статические изображения), необходимые ресурсы рендеринга часто значительны. Источник: https://www.matthewtancik.com/nerf
Интерес к NeRF стал интенсивным за последние девять месяцев, и список, поддерживаемый Reddit, список производных или исследовательских работ NeRF в настоящее время включает шестьдесят проектов.

Некоторые из многих ответвлений оригинальной работы NeRF. Источник: https://crossminds.ai/graphlist/nerf-neural-radiance-fields-ai-research-graph-60708936c8663c4cfa875fc2/
Доступная тренировка
Статья является совместной работой исследователей из Шанхайского технологического университета и DGene Digital Technology, и была принята с некоторым энтузиазмом на Open Review.
ST-NeRF предлагает несколько инноваций над предыдущими инициативами в области ML-выведенных навигируемых видеопространств. Не менее важно, что он достигает высокого уровня реализма с помощью только 16 камер. Хотя DyNeRF от Facebook использует только на две камеры больше, он предлагает гораздо более ограниченный навигируемый дугу.

Пример среды DyNeRF от Facebook, с более ограниченной областью движения и большим количеством камер на квадратный фут, необходимых для реконструкции сцены. Источник: https://neural-3d-video.github.io
Помимо отсутствия возможности редактировать и композитить отдельные аспекты, DyNeRF особенно дорог в плане вычислительных ресурсов. Напротив, китайские исследователи утверждают, что стоимость тренировки их данных составляет где-то между $900-$3,000, по сравнению с $30,000 для модели видеогенерации DVDGAN и интенсивных систем, таких как DyNeRF.
Рецензенты также отметили, что ST-NeRF делает значительную инновацию в разделении процесса обучения движения от процесса синтеза изображения. Это разделение позволяет редактировать и композитить, в то время как предыдущие подходы были ограничены и линейны по сравнению.
Хотя 16 камер является очень ограниченным массивом для такой полной полукруговой точки зрения, исследователи надеются сократить это число в дальнейшей работе с помощью использования прокси-предварительно просканированных статических фонов и более данных-ориентированных подходов к моделированию сцены. Они также надеются включить возможности перенастройки освещения, недавнюю инновацию в исследованиях NeRF.
Решение ограничений ST-NeRF
В контексте академических работ CS, которые склонны выбрасывать фактическую применимость новой системы в конце абзаца, даже ограничения, которые исследователи признают для ST-NeRF, являются необычными.
Они наблюдают, что система в настоящее время не может индивидуализировать и отдельно отображать определенные объекты в сцене, потому что люди в кадрах сегментируются в отдельные сущности с помощью системы, предназначенной для распознавания людей, а не объектов – проблема, которая, кажется, легко решается с помощью YOLO и подобных фреймворков, с более сложной работой по извлечению видео человека уже выполненной.
Хотя исследователи отмечают, что в настоящее время невозможно сгенерировать замедленное движение, кажется, что нет препятствий для реализации этого с помощью существующих инноваций в интерполяции кадров, таких как DAIN и RIFE.
Как и во всех реализациях NeRF, и во многих других областях исследований компьютерного зрения, ST-NeRF может не справиться с экстремальными случаями перекрытия, когда объект временно перекрывается другим человеком или объектом, и может быть трудно непрерывно отслеживать или точно восстанавливать позже. Как и везде, эта трудность может потребовать решения вверх по течению. Тем временем исследователи признают, что ручное вмешательство необходимо в этих перекрытых кадрах.
Наконец, исследователи наблюдают, что процедуры сегментации человека в настоящее время полагаются на цветовые различия, которые могут привести к непреднамеренному объединению двух людей в один блок сегментации – препятствие, не ограниченное ST-NeRF, но intrinsic к используемой библиотеке, и которое, возможно, можно решить с помощью анализа оптического потока и других появляющихся техник.
Опубликовано впервые 7 мая 2021 г.












