Взгляд Anderson

Нейронная рендеринг: NeRF выходит на свежий воздух

mm
Добавьте Unite.AI в избранные источники в Google

Сотрудничество между Google Research и Гарвардским университетом привело к разработке нового метода создания 360-градусных нейронных видео полных сцен с использованием Нейронных радиационных полей (NeRF). Новый подход приближает NeRF к повседневному абстрактному использованию в любой среде, без ограничений моделей на столе или закрытых внутренних сценариев.

Источник: https://www.youtube.com/watch?v=YStDS2-Ln1s

Смотрите полное видео в конце статьи. Источник: https://www.youtube.com/watch?v=YStDS2-Ln1s

Mip-NeRF 360 может обрабатывать расширенные фоны и ‘бесконечные’ объекты, такие как небо, потому что, в отличие от большинства предыдущих итераций, он устанавливает ограничения на то, как интерпретируются лучи света, и создает границы внимания, которые рационализируют иначе длительные времена обучения. Смотрите новое сопровождающее видео, встроенное в конце этой статьи, для получения дополнительных примеров и более глубокого понимания процесса.

Новая статья озаглавлена Mip-NeRF 360: Неограниченные антиалиасные нейронные радиационные поля и возглавляется старшим исследователем Google Research Джоном Барроном.

Чтобы понять прорыв, необходимо иметь базовое понимание того, как функционирует синтез изображений на основе нейронных радиационных полей.

Что такое NeRF?

Это проблематично описать сеть NeRF в терминах ‘видео’, поскольку это ближе к полностью 3D-реализованной, но основанной на ИИ виртуальной среде, где множество точек зрения из отдельных фотографий (включая кадры видео) используются для сборки сцены, которая технически существует только в латентном пространстве алгоритма машинного обучения – но из которой можно извлечь необычно большое количество точек зрения и видео по желанию.

Изображение множества точек захвата камеры, которые предоставляют данные, которые NeRF собирает в нейронную сцену (изображено справа).

Изображение множества точек захвата камеры, которые предоставляют данные, которые NeRF собирает в нейронную сцену (изображено справа).

Информация, полученная из участвующих фотографий, обучается в матрицу, подобную традиционной voxel-сетке в потоках CGI, в которой каждая точка в 3D-пространстве заканчивается значением, что делает сцену навигируемой.

Традиционная voxel-матрица помещает информацию пикселя (которая обычно существует в 2D-контексте, таком как сетка пикселей файла JPEG) в трехмерное пространство. Источник: https://www.researchgate.net/publication/344488704_Processing_and_analysis_of_airborne_full-waveform_laser_scanning_data_for_the_characterization_of_forest_structure_and_fuel_properties

Традиционная voxel-матрица помещает информацию пикселя (которая обычно существует в 2D-контексте, таком как сетка пикселей файла JPEG) в трехмерное пространство. Источник: ResearchGate

После расчета промежутков между фотографиями (если необходимо), путь каждого возможного пикселя каждого участвующего изображения эффективно ‘трассируется’ и присваивается значение цвета, включая значение прозрачности (без которого нейронная матрица была бы совершенно непрозрачной или совершенно пустой).

Как и voxel-сетки, и в отличие от пространства 3D-координат на основе CGI, ‘внутренность’ ‘закрытого’ объекта не существует в матрице NeRF. Вы можете разрезать барабанную установку CGI и посмотреть внутрь, если хотите; но что касается NeRF, существование барабанной установки заканчивается, когда значение непрозрачности его поверхности равно ‘1’.

Более широкий взгляд на пиксель

Mip-NeRF 360 является расширением исследования из марта 2021 года, которое эффективно ввело эффективное антиалиасинг в NeRF без исчерпывающего суперсемплирования.

Традиционный NeRF рассчитывает только один путь пикселя, который склонен производить тот же вид ‘жаггисов’, что характеризовало ранние форматы изображений в Интернете, а также ранние игровые системы. Эти зубчатые края были решены различными методами, обычно включающими выборку соседних пикселей и нахождение среднего представления.

Поскольку традиционный NeRF выбирает только один путь пикселя, Mip-NeRF ввел ‘конический’ сбор, похожий на широкий луч фонарика, который предоставляет достаточно информации о смежных пикселях для производства экономически эффективного антиалиасинга с улучшенной детализацией.

Конический конус-сбор, который использует Mip-NeRF, разрезается на конические усечения (ниже), которые затем 'размыты', чтобы представить нечеткое гауссовское пространство, которое можно использовать для расчета точности и aliasing пикселя. Источник: https://www.youtube.com/watch?v=EpH175PY1A0

Конический конус-сбор, который использует Mip-NeRF, разрезается на конические усечения (нижнее изображение), которые затем ‘размыты’, чтобы создать нечеткие гауссовские пространства, которые можно использовать для расчета точности и aliasing пикселя. Источник: https://www.youtube.com/watch?v=EpH175PY1A0

Улучшение по сравнению с стандартной реализацией NeRF было заметным:

Mip-NeRF (справа), выпущенный в марте 2021 года, предоставляет улучшенную детализацию через более полный, но экономически эффективный антиалиасный конвейер, а не просто 'размытие' пикселей, чтобы избежать зубчатых краев. Источник: https://jonbarron.info/mipnerf/

Mip-NeRF (справа), выпущенный в марте 2021 года, предоставляет улучшенную детализацию через более полный, но экономически эффективный антиалиасный конвейер, а не просто ‘размытие’ пикселей, чтобы избежать зубчатых краев. Источник: https://jonbarron.info/mipnerf/

NeRF без ограничений

Статья марта оставила три проблемы нерешенными в отношении использования Mip-NeRF в неограниченных средах, которые могут включать очень远ние объекты, включая небо. Новая статья решает эту проблему, применяя кальман-стиль warp к гауссовским распределениям Mip-NeRF.

Во-вторых, более крупные сцены требуют большей мощности обработки и более длительных времен обучения, что Mip-NeRF 360 решает, ‘дистиллируя’ геометрию сцены с помощью небольшого ‘предложения’ мульти-слойного перцептрона (MLP), который предварительно ограничивает геометрию, предсказанную стандартным NeRF MLP. Это ускоряет обучение в три раза.

Наконец, более крупные сцены склонны делать дискретизацию интерпретированной геометрии неоднозначной, что приводит к тому же виду артефактов, с которыми знакомы геймеры, когда выход игры ‘разрывается’. Новая статья решает эту проблему, создавая новый регуляризатор для интервалов лучей Mip-NeRF.

Справа мы видим нежелательные артефакты в Mip-NeRF из-за трудности ограничения такой большой сцены. Слева мы видим, что новый регуляризатор оптимизировал сцену достаточно хорошо, чтобы удалить эти нарушения.

Справа мы видим нежелательные артефакты в Mip-NeRF из-за трудности ограничения такой большой сцены. Слева мы видим, что новый регуляризатор оптимизировал сцену достаточно хорошо, чтобы удалить эти нарушения.

Чтобы узнать больше о новой статье, смотрите видео ниже, а также видео-введение марта 2021 года в Mip-NeRF. Вы также можете узнать больше о исследованиях NeRF, просмотрев нашу статью до сих пор.

Оригинально опубликовано 25 ноября 2021 года
21 декабря 2021 года, 12:25 – Заменил мертвое видео. – MA

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai