Взгляд Anderson

Нейронный рендеринг: NeRF выходит на свежий воздух

mm
Добавьте Unite.AI в избранные источники в Google

Сотрудничество Google Research и Гарвардского университета разработало новый метод создания 360‑градусного нейронного видео полных сцен с использованием Neural Radiance Fields (NeRF). Этот новаторский подход приближает NeRF к повседневному абстрактному использованию в любой среде, не ограничивая его настольными моделями или закрытыми внутренними сценариями.

Source: https://www.youtube.com/watch?v=zBSH-k9GbV4

Смотрите в конце статьи полное видео. Источник: https://www.youtube.com/watch?v=zBSH-k9GbV4

Mip-NeRF 360 может обрабатывать расширенные фоны и «бесконечные» объекты, такие как небо, потому что, в отличие от большинства предыдущих вариантов, он устанавливает ограничения на интерпретацию световых лучей и создает границы внимания, что сокращает иначе длительные времена обучения. Смотрите новое сопроводительное видео, встроенное в конец этой статьи, для дополнительных примеров и более подробного понимания процесса.

Новая статья называется Mip-NeRF 360: Unbounded Anti-Aliased Neural Radiance Fields и возглавляется старшим научным сотрудником Google Research Джоном Барроном.

Чтобы понять прорыв, необходимо базовое понимание того, как работает синтез изображений на основе нейронных полей излучения.

Что такое NeRF?

Трудно описать сеть NeRF в терминах «видео», поскольку она ближе к полностью реализованному в 3D, но AI‑based (основанному на ИИ) виртуальному окружению, где несколько точек зрения из отдельных фотографий (включая кадры видео) используются для объединения сцены, существующей технически лишь в латентном пространстве алгоритма машинного обучения, но из которой можно произвольно извлекать огромное количество ракурсов и видео.

A depiction of the multiple camera capture points that provide the data which NeRF assembles into a neural scene (pictured right).

Изображение множества точек захвата камер, предоставляющих данные, которые NeRF собирает в нейронную сцену (см. справа).

Информация, полученная из предоставленных фотографий, обучается в матрицу, похожую на традиционную воксельную сетку в CGI‑рабочих процессах, где каждая точка в 3D‑пространстве получает значение, делая сцену навигационной.

A traditional voxel matrix places pixel information (which normally exists in a 2D context, such as the pixel grid of a JPEG file) into a three-dimensional space. Source: https://www.researchgate.net/publication/344488704_Processing_and_analysis_of_airborne_full-waveform_laser_scanning_data_for_the_characterization_of_forest_structure_and_fuel_properties

Традиционная воксельная матрица помещает пиксельную информацию (обычно существующую в 2D‑контексте, например, в пиксельной сетке JPEG‑файла) в трехмерное пространство. Источник: ResearchGate

После вычисления промежутков между фотографиями (при необходимости) путь каждого потенциального пикселя каждой предоставленной фотографии эффективно «прослеживается лучом» и получает цветовое значение, включая значение прозрачности (без которого нейронная матрица была бы полностью непрозрачной или полностью пустой).

Как и воксельные сетки, и в отличие от 3D‑координатного пространства, основанного на CGI, «внутренняя» часть «закрытого» объекта не существует в матрице NeRF. Вы можете открыть CGI‑барабанную установку и заглянуть внутрь, если хотите; однако для NeRF существование барабана заканчивается, когда значение непрозрачности его поверхности достигает «1».

Шире взгляд на пиксель

Mip-NeRF 360 — это расширение исследования марта 2021 года, которое эффективно внедрило экономичное анти‑алиасинг в NeRF без исчерпывающего сверхсэмплинга.

Традиционно NeRF вычисляет лишь один путь пикселя, что склонно к появлению так называемых ‘jaggies’, характерных для ранних форматов изображений в интернете, а также ранних игровых систем. Эти зубчатые края решались различными методами, обычно включающими выборку соседних пикселей и поиск среднего представления.

Поскольку традиционный NeRF выбирает только один путь пикселя, Mip-NeRF ввёл «конусную» зону захвата, похожую на широкоугольный фонарь, которая предоставляет достаточно информации о смежных пикселях для экономичного анти‑алиасинга с повышенной детализацией.

The conical cone catchment that Mip-NeRF uses is sliced up into conical frustums (below), which is further 'blurred' to represent a vaguer Gaussian space that can be used to calculate the accuracy and aliasing of a pixel. Source: https://www.youtube.com/watch?v=EpH175PY1A0

Конусная зона захвата, используемая Mip-NeRF, разбивается на конусные усечения (см. ниже), которые далее «размываются», создавая размытые гауссовы пространства, которые можно использовать для расчёта точности и алиасинга пикселя. Источник: https://www.youtube.com/watch?v=EpH175PY1A0

Улучшение по сравнению со стандартной реализацией NeRF было заметным:

Mip-NeRF (right), released in март 2021, provides improved detail through a more comprehensive but economical aliasing pipeline, rather than just 'blurring' pixels to avoid jagged edges. Source: https://jonbarron.info/mipnerf/

Mip-NeRF (справа), выпущенный в марте 2021 года, обеспечивает улучшенную детализацию благодаря более полной, но экономичной цепочке анти‑алиасинга, а не просто «размазыванию» пикселей для избежания зубчатых краёв. Источник: https://jonbarron.info/mipnerf/

NeRF без границ

В марте в статье оставались три нерешённые проблемы применения Mip-NeRF в неограниченных средах, которые могут включать очень удалённые объекты, включая небо. Новая статья решает их, применяя камановский искажение к гауссианам Mip-NeRF.

Во‑вторых, более крупные сцены требуют большей вычислительной мощности и длительного времени обучения, что Mip-NeRF 360 решает, «дистиллируя» геометрию сцены с помощью небольшого «предлагающего» многослойного перцептрона (MLP), который предварительно ограничивает геометрию, предсказываемую большим стандартным NeRF‑MLP. Это ускоряет обучение в три раза.

Наконец, крупные сцены часто делают дискретизацию интерпретируемой геометрии неоднозначной, что приводит к артефактам, знакомым геймерам, когда игровой вывод «разрывается». Новая статья решает это, создав новый регулятор для интервалов лучей Mip-NeRF.

On the right, we see unwanted artifacts in Mip-NeRF due to the difficulty in bounding such a large scene. On the left, we see that the new regularizer has optimized the scene well enough to remove these disturbances.

Справа видны нежелательные артефакты в Mip-NeRF из‑за сложности ограничить такую большую сцену. Слева видно, что новый регулятор достаточно оптимизировал сцену, чтобы устранить эти помехи.

Чтобы узнать больше о новой статье, посмотрите видео ниже, а также видеовведение марта 2021 года к Mip-NeRF. Вы также можете узнать больше о исследованиях NeRF, изучив нашу текущую подборку.

Первоначально опубликовано 25 ноября 2021
21 декабря 2021, 12:25pm — заменено неработающее видео. — MA

Автор в области машинного обучения, специалист по синтезу человеческих изображений. Бывший руководитель отдела исследовательского контента в Metaphysic.ai, до его объединения с Brahma.ai от DNEG.
Веб‑сайт: martinanderson.ai
Контакт: martin@martinanderson.ai