Взгляд Anderson

Пересветка нейронных радиационных полей с помощью любой среды

mm
Добавьте Unite.AI в избранные источники в Google

В новой статье из Института Макса Планка и MIT предложен метод получения истинного распознавания содержимого нейронных радиационных полей (NeRF) от освещения, которое присутствовало при сборе данных, что позволяет ad hoc средам полностью заменить освещение в сцене NeRF:

Новый метод, примененный к реальным данным. Заметно, что метод работает даже с архивными данными этого типа, которые не учитывали новую трубу при сборе данных. Несмотря на это, получается реалистичное и заданное пользователем управление освещением.

Новый метод, примененный к реальным данным. Заметно, что метод работает даже с архивными данными этого типа, которые не учитывали новую трубу при сборе данных. Несмотря на это, получается реалистичное и заданное пользователем управление освещением. Источник: https://arxiv.org/pdf/2207.13607.pdf

Новый подход использует популярную открытую программу 3D-анимации Blender для создания виртуальной световой сцены, где отображаются множество возможных сценариев освещения и в конечном итоге обучаются в специальном слое модели NeRF, который может вместить любую среду, которую пользователь хочет использовать для освещения сцены.

Изображение части трубы, которая использует Blender для создания виртуальных световых сцен извлеченной геометрии. Предыдущие методы, следующие аналогичным линиям, использовали фактические световые сцены для предоставления этих данных, что является обременительным требованием для дискретных объектов и невозможным для внешних видов. В верхнем левом углу двух правых картинок мы видим среды, которые диктуют освещение сцены. Эти среды могут быть созданы пользователем, что приближает NeRF к гибкости современного подхода CGI.

Изображение части трубы, которая использует Blender для создания виртуальных световых сцен извлеченной геометрии. Предыдущие методы, следующие аналогичным линиям, использовали фактические световые сцены для предоставления этих данных, что является обременительным требованием для дискретных объектов и невозможным для внешних видов. В верхнем левом углу двух правых картинок мы видим среды, которые диктуют освещение сцены. Эти среды могут быть созданы пользователем, что приближает NeRF к гибкости современного подхода CGI.

Метод был протестирован на Mitsuba2 и других предыдущих работах PhySG, RNR, Neural-PIL и NeRFactor, используя только прямую модель освещения, и получил лучшие результаты:

Результаты нового метода, сравненные с другими подходами под различными функциями потерь. Исследователи утверждают, что их подход дает лучшие результаты, которые оцениваются по пиковой сигнал-шумовой величине (PSNR), структурному коэффициенту подобия (SSIM) и эффективному, хотя и эксцентричному, коэффициенту подобия образов (LPIPS).

Результаты нового метода, сравненные с другими подходами под различными функциями потерь. Исследователи утверждают, что их подход дает лучшие результаты, которые оцениваются по пиковой сигнал-шумовой величине (PSNR), структурному коэффициенту подобия (SSIM) и эффективному, хотя и эксцентричному, коэффициенту подобия образов (LPIPS).

В статье говорится:

‘Наши качественные и количественные результаты демонстрируют явный шаг вперед в плане восстановления параметров сцены, а также качества синтеза нашего подхода под новыми видами и условиями освещения по сравнению с предыдущим состоянием искусства.’

Исследователи заявляют, что они в конечном итоге опубликуют код проекта.

Необходимость редактируемости NeRF

Такое распознавание оказалось заметной проблемой для исследователей нейронных радиационных полей, поскольку NeRF по сути является техникой фотограмметрии, которая рассчитывает значение пикселя тысяч возможных путей от точки зрения, присваивает значения RGBD и собирает матрицу этих значений в объемное представление. В своей основе NeRF определяется освещением.

Фактически, несмотря на впечатляющие визуальные эффекты и широкое внедрение NVIDIA (NVDA ), NeRF заметно “жесткий” – в терминах CGI, “запечатанный”. Поэтому исследовательское сообщество сосредоточилось на улучшении его применимости и универсальности в этом отношении за последние 12-18 месяцев.

В плане значимости ставки этого этапа высоки и включают возможность трансформации индустрии визуальных эффектов из творческой и совместной модели, построенной вокруг генерации сеток, динамики движения и текстурирования, в модель, построенную на обратном рендеринге, где трубопровод VFX питается реальными фотографиями реальных вещей (или даже, возможно, реальных и синтезированных моделей), а не оцененными, художественными приближениями.

На данный момент есть относительно мало причин для беспокойства среди сообщества визуальных эффектов, по крайней мере, с точки зрения нейронных радиационных полей. NeRF имеет только начальные способности в плане риггинга, вложения, контроля глубины, артикуляции… и, конечно, также в отношении освещения. Сопровождающее видео для другой новой статьи, которая предлагает базовые деформации для геометрии NeRF, иллюстрирует огромный разрыв между текущим состоянием искусства в CGI и семинальными усилиями техник нейронного рендеринга.

Разбор элементов

Тем не менее, поскольку необходимо начинать где-то, исследователи новой статьи приняли CGI в качестве промежуточного контролирующего и производственного механизма, который теперь является общим подходом к жестким潜ным пространствам GAN и几乎 непроницаемым и линейным сетям NeRF.

По сути, центральной задачей является вычисление глобального освещения (GI, которое не имеет прямого применения в нейронном рендеринге) в эквивалентную предварительно вычисленную передачу радиации (PRT, которую можно адаптировать к нейронному рендерингу) расчет.

GI – это теперь почитаемая техника рендеринга CGI, которая моделирует способ, которым свет отражается от поверхностей и на другие поверхности, и включает эти области отраженного света в рендер для добавления реализма.

PRT используется в качестве промежуточной функции освещения в новом подходе, и тот факт, что это дискретная и редактируемая составляющая, является тем, что достигает распознавания. Новый метод моделирует материал объекта NeRF с помощью обученной PRT.

Фактическое освещение сцены исходных данных восстанавливается в виде среды в процессе, и сама геометрия сцены извлекается в виде подписанного поля расстояний (SDF), которое в конечном итоге предоставит традиционную сетку для Blender для работы на виртуальной световой сцене.

Обзор трубы для нового метода.

Обзор трубы для нового метода.

Первым этапом в процессе является извлечение геометрии сцены из доступных многовидовых изображений через неявную реконструкцию поверхности, с помощью методов, используемых в сотрудничестве NeuS 2021 года.

Для разработки нейронного поля передачи радиации (NRTF, которое будет содержать данные освещения) исследователи использовали дифференцируемый трассировщик пути Mitsuba 2.

Это облегчает совместную оптимизацию функции распределения рассеяния в обоих направлениях (BSDF), а также генерацию начальной среды. Как только BSDF создан, трассировщик пути можно использовать в Blender (см. встроенное видео прямо выше) для создания виртуальных рендеров сцены с одним светом за раз (OLAT).

NRTF затем обучается с помощью комбинированного потерь между фотореалистичными эффектами материала и синтетическими данными, которые не связаны друг с другом.

Сравнение с предшественником NeRFactor по проблемам новой синтезии вида и пересветки.

Сравнение с предшественником NeRFactor по проблемам новой синтезии вида и пересветки.

Путь к освещению

Требования к обучению для этого метода, хотя и заметно меньше, чем исходные времена обучения NeRF, не являются незначительными. На NVIDIA Quadro RTX 8000 с 48 ГБ видеопамяти предварительное обучение для начальной оценки света и текстуры занимает 30 минут; обучение OLAT (т. е. обучение виртуальных световых сцен) занимает восемь часов; и окончательная совместная оптимизация между распознанными синтетическими и реальными данными занимает еще 16 часов для достижения оптимального качества.

Более того, полученное нейронное представление не может работать в реальном времени, занимая, по словам исследователей, “несколько секунд на кадр”.

Исследователи заключают:

‘Наши результаты демонстрируют явное улучшение над текущим состоянием искусства, в то время как будущая работа может включать дальнейшее улучшение времени выполнения и совместное рассуждение геометрии, материала и освещения сцены.’

 

Опубликовано впервые 28 июля 2022 года.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai