Погляд Anderson
ST-NeRF: композиція та редагування для синтезу відео

Консорціум китайських дослідників розробив техніки для надання можливостей редагування та композиції одному з найгарячіших напрямків досліджень синтезу зображень останнього року – Нейронним полям радіанції (NeRF). Система називається ST-NeRF (Просторово-часове узгоджене нейронне поле радіанції).
Що здається фізичним рухом камери на зображенні нижче, насправді просто користувач “прокручує” точки зору на відеоконтент, який існує в 4D-просторі. Точка зору не прив’язана до виконання людей, зображених на відео, чиїх рухів можна спостерігати з будь-якої частини 180-градусного радіуса.

Кожна грань у відео є дискретно захопленим елементом, композитованим у суцільну сцену, яку можна динамічно досліджувати.
Грані можна вільно дублювати у сцені або змінювати розмір:

Крім того, тимчасову поведінку кожної грани можна легко змінити, сповільнити, запустити у зворотному напрямку або маніпулювати будь-яким чином, відкриваючи шлях до архітектур фільтрів та дуже високого рівня інтерпретації.

Дві окремі грани NeRF працюють з різними швидкостями в одній сцені. Джерело: https://www.youtube.com/watch?v=Wp4HfOwFGP4

Не потрібно ротоскопіювати виконавців або середовища, або мати виконавців виконувати свої рухи сліпо та поза контекстом запланованої сцени. Замість цього кадри захоплюються природно за допомогою масиву з 16 відеокамер, що покривають 180 градусів:


Три елементи, зображені вище, два людини та середовище, є окремими та обведеними тільки для ілюстративних цілей. Кожен з них можна замінити, і кожен можна вставити в сцену на раніше або пізніше етапі їх індивідуальної хронології захоплення.
ST-NeRF є інновацією у сфері досліджень Нейронних полів радіанції (NeRF), машинного навчання, яке синтезує декілька точок зору у навігаційному віртуальному просторі за допомогою інтенсивної підготовки (хоча захоплення з однієї точки зору також є підсектором досліджень NeRF).

Нейронні поля радіанції працюють шляхом збору декількох точок зору у суцільний та навігаційний 3D-простір, з прогалинами між покриттям, оціненими та відтвореними нейронною мережею. Коли використовується відео (а не статичні зображення), необхідні ресурси для рендерингу часто суттєві. Джерело: https://www.matthewtancik.com/nerf
Інтерес до NeRF став дуже інтенсивним за останні дев’ять місяців, і список, підтримуваний Reddit, паперів NeRF наразі налічує шістдесят проектів.

Лише кілька з багатьох відгалужень оригінальної праці NeRF. Джерело: https://crossminds.ai/graphlist/nerf-neural-radiance-fields-ai-research-graph-60708936c8663c4cfa875fc2/
Доступна підготовка
Паперу є спільною роботою дослідників університету Шанхай Тех та DGene Digital Technology, і була прийнята з деяким ентузіазмом на Open Review.
ST-NeRF пропонує ряд інновацій над попередніми ініціативами у сфері ML-відведених навігаційних відео-просторів. Не менш важливо, вона досягає високого рівня реалізму лише за допомогою 16 камер. Хоча система DyNeRF від Facebook використовує лише на дві камери більше, вона пропонує значно обмеженіший навігаційний арк.

Приклад середовища DyNeRF від Facebook, з обмеженішим рухом та більшою кількістю камер на квадратний фут для реконструкції сцени. Джерело: https://neural-3d-video.github.io
Крім відсутності можливості редагування та композитування окремих граней, DyNeRF особливо дорогий у термінах обчислювальних ресурсів. Натомість китайські дослідники стверджують, що вартість підготовки їхніх даних становить близько 900-3000 доларів, у порівнянні з 30 000 доларів для моделі генерації відео DVDGAN та інтенсивних систем, таких як DyNeRF.
Рецензенти також відзначили, що ST-NeRF робить значну інновацію у відокремленні процесу навчання руху від процесу синтезу зображення. Це відокремлення дозволяє редагування та композитування, тоді як попередні підходи були обмежені та лінійними порівняно.
Хоча 16 камер є дуже обмеженим масивом для такої повної півкругової точки зору, дослідники сподіваються зменшити це число у майбутній роботі за допомогою використання проксі-передсканованих статичних фонів та більш даних-орієнтованих підходів моделювання сцени. Вони також сподіваються включити можливості перезапису освітлення, недавню інновацію у сфері досліджень NeRF.
Вирішення обмежень ST-NeRF
У контексті академічних робіт з комп’ютерних наук, які часто відкидають фактичну придатність нової системи у кінцевому абзаці, навіть обмеження, які дослідники визнають для ST-NeRF, є незвичайними.
Вони спостерігають, що система зараз не може індивідуалізувати та окремо відтворити окремі об’єкти у сцені, оскільки люди у кадрах розрізняються на окремі сутності за допомогою системи, призначеної для розпізнавання людей, а не об’єктів – проблема, яка здається легко розв’язною за допомогою YOLO та подібних框ок, з більш важкою роботою витягування відео людини вже виконаною.
Хоча дослідники відзначають, що зараз не可能 генерувати慢мо, здається, немає нічого, що могло б запобігти реалізації цього за допомогою існуючих інновацій у інтерполяції кадрів, таких як DAIN та RIFE.
Як і у всіх реалізаціях NeRF, та у багатьох інших галузях досліджень комп’ютерного зору, ST-NeRF може зазнати невдачі у випадках сильної окулюації, коли об’єкт тимчасово закритий іншим об’єктом чи людиною, і може бути важко продовжувати відстежувати чи точно відновлювати пізніше. Як і у інших випадках, ця трудність може чекати на рішення у верхньому рівні. Тим часом дослідники погоджуються, що ручне втручання необхідне у цих окультованих кадрах.
Нарешті, дослідники спостерігають, що процедури сегментації людини зараз залежать від кольорових відмінностей, які могли б привести до ненавмисного злиття двох людей у один блок сегментації – проблема, яка не обмежується лише ST-NeRF, а є внутрішньою для бібліотеки, яка використовується, і яку можна perhaps вирішити за допомогою аналізу оптичного потоку та інших нових технік.
Перша публікація 7 травня 2021 року.












