Взгляд Anderson
NeRF делает еще один шаг к замене CGI

Исследователи из MIT и Google сделали большой шаг в решении одной из наиболее фундаментальных проблем, возникающих при использовании новой технологии, основанной на искусственном интеллекте, которая может потенциально заменить CGI – разделение изображений, полученных с помощью нейронных радиационных полей (NeRF), на их составные визуальные компоненты, чтобы их можно было переупаковать и переосветить.
Новый подход, называемый NeRFactor, эффективно разделяет захваченные изображения на нормали для каждого объекта (на которые можно назначить текстуры), видимость света, альбедо (долю падающего света, отражаемого от поверхности) и функции двустороннего распределения отражения (BRDF).
С этими аспектами, выделенными отдельно, становится возможным не только переключать текстуры для отдельных объектов или групп объектов, но также добавлять новые и уникальные источники света и реализовывать тени, не учитывая те, которые были захвачены многокамерными массивами, генерирующими входные данные для изображений NeRF.

Нормали, видимость, альбедо и BRDF, разделенные с помощью NeRFactor. Источник: https://www.youtube.com/watch?v=UUVSPJlwhPg
Модель поддерживает мягкие или жесткие тени от произвольных, задаваемых пользователем источников света и разделяет четыре аспекта захваченного видео программно, используя реконструкционную потерю, данные из предыдущих расчетов BRDF и базовую простую регуляризацию гладкости.


Рабочий процесс NeRFactor, извлекающий отдельные аспекты изображений, полученных из многокамерных массивов. Источник: https://arxiv.org/pdf/2106.01970.pdf
NeRFactor использует зонд HDR-света, хорошо известный подход, который проник в визуальную промышленность и искусство с момента его введения в 1998 году, для оценки возможных путей для лучей, что позволяет использовать произвольное освещение. Поскольку это генерирует неограниченное количество возможных параметров, зонд HDR-света фильтруется через многослойный перцептрон (MLP), который сопоставляет воспринимаемую геометрию с зондом без попытки рассчитать полную карту объема освещения для пространства модели.

Два нейронных радиационных поля используются для демонстрации пяти моделей освещения, возможных с помощью NeRFactor. Нажмите на изображение для более высокого разрешения.
Причина для размышлений
Новое исследование, возможно, наиболее значимо в разделении слоев захваченных изображений, которые контролируют отражение. Это остается одной из самых больших проблем для изображений нейронных радиационных полей, поскольку действительно новая и гибкая система NeRF не только должна быть способна заменять текстуры, но также должна иметь способ отражать движущиеся объекты (помимо фиксированной среды), которые обычно учитываются в рабочем процессе CGI.

Эта проблема была недавно отмечена в отношении впечатляющего нового исследования Intel по преобразованию кадров видеоигр в фотореалистичное видео с помощью сверток нейронных сетей. В таких рабочих процессах многие “запечатанные” аспекты исходного материала должны стать дискретными и заменяемыми, и это, по сути, легче решить для переосвещения (которое является функцией геометрии, отображаемой в NeRF), чем для отражений (которые используют “внекадровую” геометрию, которая полностью находится вне области модели).
Следовательно, выделение слоев в видео NeRF, которые облегчают отражение, приближает NeRF на один шаг к решению проблемы отражения.
Использование HDR-окружения уже решает проблему генерации отражений окружающей среды (т.е. неба, пейзажей и других “фиксированных” факторов окружения), но новые подходы будут необходимы для введения движущихся и динамических отражений.
Фотограмметрия с NeRF
Изображения нейронных радиационных полей используют анализ машинного обучения для разработки полностью объемного пространства из сцены или объекта, захваченного с нескольких углов.

Различные схемы, основанные на NeRF, которые появились в последнем году, использовали разнообразное количество камер-устройств; некоторые используют 16 или более камер, другие – только одну или две. Во всех случаях промежуточные точки зрения “заполняются” (т.е. интерпретируются), чтобы сцена или объект могли быть плавно перемещены.
Результирующая сущность – это полностью объемное пространство с внутренним трехмерным пониманием, которое можно использовать многими способами, включая возможность генерации традиционных сеток CGI из 3D-парсированной суммы входных изображений.
NeRF в контексте “Новой CGI”
Изображения нейронных радиационных полей получены直接 из изображений реального мира, включая движущиеся изображения людей, объектов и сцен. В отличие от этого, методология CGI “изучает” и интерпретирует мир, требуя от квалифицированных работников построения сеток, систем управления и текстур, которые используют реальные изображения (т.е. захваты лица и окружения). Это остается по сути интерпретативным и ремесленным подходом, который дорог и трудоемок.
Кроме того, CGI имела постоянные проблемы с эффектом “неуютной долины” в своих усилиях по воссозданию человеческих подобий, что не представляет никаких ограничений для подхода, основанного на NeRF, который просто захватывает видео или изображения реальных людей и манипулирует ими.
Дальше, NeRF может генерировать традиционную геометрию сетки CGI直接 из фотографий по мере необходимости, и фактически может заменить многие ручные процедуры, которые всегда были необходимы в компьютерной графике.
Проблемы для NeRF
Это последнее исследование из MIT и Google происходит в контексте настоящего потока работ по NeRF за последний год, многие из которых предложили решения различных проблем, возникших при первоначальной работе 2020 года.
В апреле инновация китайского исследовательского консорциума предоставила способ дискретно выделить отдельные временные шкалы аспектов в сцене NeRF, включая людей.

Китайское исследование позволяет пользователям копировать, вставлять и изменять размер захваченных элементов, освобождая их от линейной временной шкалы исходного видео. Источник: https://www.youtube.com/watch?v=Wp4HfOwFGP4
Этот подход не только позволяет представить сцену с любой точки зрения, захваченной камерным массивом (и не только с одной точки зрения, представленной в типичном видеозаписи), но также позволяет универсально композировать – и даже представить два аспекта из одного и того же кадра, которые работают в своих собственных временных рамках (или даже работают в обратном направлении, если необходимо).

Китайское исследование позволяет пользователям копировать, вставлять и изменять размер захваченных элементов, освобождая их от линейной временной шкалы исходного видео. Источник: https://www.youtube.com/watch?v=Wp4HfOwFGP4
Одной из самых больших проблем для NeRF является снижение значительных ресурсов, необходимых для обучения сцены, и это было решено в ряде недавних работ. Например, Институт интеллектуальных систем Макса Планка最近 представил KiloNeRF, который не только ускоряет время рендеринга в 1000 раз, но также позволяет NeRF работать интерактивно.

KiloNeRF работает в интерактивной среде со скоростью 50 кадров в секунду на GTX 1080ti. Источник: https://github.com/creiser/kilonerf
Однако инновация скорости NeRF, которая действительно захватила воображение исследователей и общественности в 2021 году, стала PlenOctrees сотрудничество, возглавляемое Университетом Калифорнии в Беркли, которое предлагает рендеринг нейронных радиационных полей в реальном времени:
Влияние интерактивных возможностей PlenOctrees было воспроизведено в интерактивном веб-интерфейсе.

Живое интерактивное движение объекта PlenOctrees в Firefox (движение более плавное и динамичное, чем это GIF представляет). Источник: http://alexyu.net/plenoctrees/demo/
Кроме того, Recursive-NeRF (из работы мая 2021 года исследователей Университета Цинхуа) предлагает высококачественный рекурсивный рендеринг по требованию. Вместо того, чтобы заставлять пользователя рендерить всю сцену, включая части, которые могут не быть видны, Recursive-NeRF предоставляет что-то вроде сжатия JPEG, и может генерировать дискретные под-NeRF для обработки дополнительных изображений по требованию – достигая огромной экономии вычислительных ресурсов.

Сохранение деталей при отказе от ненужных расчетов рендеринга с помощью Recursive-NeRF. Нажмите на изображение для более высокого разрешения. Источник: https://arxiv.org/pdf/2105.09103.pdf
Другие подходы включают FastNeRF, который утверждает, что достигает высококачественного нейронного рендеринга со скоростью 200 кадров в секунду.
Было отмечено, что многие методов оптимизации для NeRF включают “запекание” сцены, закрепляя аспекты, которые желательно отрендерить, и отбрасывая другие аспекты, что ограничивает исследование, но значительно ускоряет интерактивность.
Недостатком этого является то, что нагрузка смещается от GPU к хранилищу, поскольку запеченные сцены занимают огромное количество места на диске; в некоторой степени это можно смягчить, уменьшив запеченные данные, хотя это также предполагает определенный компромисс в плане закрытия путей исследования или интерактивности.
Что касается захвата движения и риггинга, новый подход от Университетов Чжэцзян и Корнелл, представленный в мае, предложил метод для воссоздания анимируемых людей с помощью полей смешанных весов и скелетных структур, интерпретированных из входного видео:

Полученная скелетная структура в Animatable NeRF. Источник: https://www.youtube.com/watch?v=eWOSWbmfJo4

Когда NeRF будет иметь свой “Парк Юрского периода”?
Несмотря на быстрый темп прогресса в синтезе изображений с помощью нейронных радиационных полей, только в этот период будет установлена какая-либо “закон сохранения” для того, насколько развертываемой может стать NeRF. В плане временной шкалы, аналогичной истории CGI, NeRF в настоящее время находится на уровне 1973 года, прямо перед первым использованием CGI в Вестворлде.
Это не означает, что NeRF обязательно должен ждать девять лет для своего эквивалентного рубежа Гнева Хана или десятилетий для прорывов, которые CGI достигла под эгидой Джеймса Кэмерона в 1989 году в Бездне или в 1991 году в Терминатор 2 – и затем, технология действительно революционный момент прорыва в 1993 году в Парке Юрского периода.

Сцена изображений изменилась значительно с момента длительного периода застоя фотохимических визуальных эффектов, которые доминировали в кинопроизводстве и телевидении с рождения кино до начала 1990-х годов. Наступление революции ПК и ускорение закона Мура привели к революции CGI, которая в противном случае могла бы произойти уже в 1960-х годах.
Остается неизвестным, есть ли какое-либо препятствие, которое могло бы задержать прогресс NeRF на такой долгий период – и не могут ли последующие инновации в области компьютерного зрения в meantime полностью обойти NeRF как основного претендента на трон CGI, характеризуя нейронные радиационные поля как короткоживущую “факс-машина” синтеза изображений.
На данный момент NeRF не использовался в каком-либо контексте вне академических исследований; но стоит отметить, что такие крупные игроки, как Google Research, и многие из наиболее известных лабораторий компьютерного зрения, конкурируют за последний прорыв NeRF.
Многие из наиболее больших препятствий NeRF начали решаться в этом году; если последующие исследования предложат решение проблемы отражения, и многие нити исследований по оптимизации NeRF объединятся в решающее решение проблемы значительных вычислительных и/или хранилищных требований технологии, NeRF действительно имеет шанс стать “новой CGI” в течение следующих пяти лет.












