Взгляд Anderson
NeRFocus: Принесение легкого управления фокусом в нейронные радиационные поля

Новое исследование из Китая предлагает метод достижения доступного управления эффектами глубины резкости для нейронных радиационных полей (NeRF), что позволяет конечному пользователю регулировать фокус и динамически изменять конфигурацию виртуальной линзы в пространстве рендеринга.
Техника, озаглавленная NeRFocus, реализует новый подход “тонкой линзовой съемки” для фокусной трассировки и инновационный P-обучение, вероятностную стратегию обучения, которая устраняет необходимость в специальных наборах данных для глубины резкости и упрощает рабочий процесс обучения с фокусом.

Статья статья озаглавлена NeRFocus: Нейронное радиационное поле для 3D синтетического размытия и исходит от четырех исследователей из Шенженского филиала Пекинского университета и лаборатории Пэн Чена в Шенжене, института, финансируемого правительством провинции Гуандун.
Решение проблемы фовеального локуса внимания в NeRF
Если NeRF когда-либо займет свое место в качестве действительной технологии управления для виртуальной и дополненной реальности, ему понадобится легкий метод достижения реалистичного фовеального рендеринга, где большинство ресурсов рендеринга концентрируются вокруг взгляда пользователя, а не распределяются безразлично на низком разрешении по всему доступному визуальному пространству.

Из статьи 2021 года Foveated Neural Radiance Fields for Real-Time and Egocentric Virtual Reality мы видим локус внимания в новой схеме фовеального рендеринга для NeRF. Источник: https://arxiv.org/pdf/2103.16365.pdf
Необходимой частью аутентичности будущих развертываний эгоцентрического NeRF будет способность системы отражать способность человеческого глаза переключать фокус по уменьшающейся плоскости перспективы (см. первое изображение выше).
Этот градиент фокуса также является перцептивным индикатором масштаба сцены; вид с вертолета, летящего над городом, будет иметь нулевые навигируемые поля фокуса, поскольку вся сцена существует за пределами внешней способности фокусировки зрителя, в то время как осмотр миниатюрной или “близкой” сцены не только позволит “переключать фокус”, но и должен, ради реализма, содержать узкую глубину резкости по умолчанию.
Ниже представлено видео, демонстрирующее первоначальные возможности NeRFocus, предоставленное нам соответствующим автором:
За пределами ограниченных фокальных плоскостей
Осознавая необходимость управления фокусом, несколько проектов NeRF в последние годы сделали положение для него, хотя все попытки на данный момент являются по сути обходными путями или же включают заметные пост-обработочные рутины, которые делают их маловероятными вкладами в реальные среды, в конечном итоге предназначенные для технологий нейронных радиационных полей.
Синтетический контроль фокуса в нейронных структурах рендеринга был предпринят различными методами за последние 5-6 лет – например, с помощью сегментационной сети для ограждения переднего и заднего плана данных, а затем для обобщенного размытия фона – общее решение для простых двухплоскостных эффектов фокуса.

Из статьи ‘Автоматическая сегментация портретов для стилизации изображений’, обычное, анимационное разделение фокальных плоскостей. Источник: https://jiaya.me/papers/portrait_eg16.pdf
Много плоскостных представлений добавляют несколько виртуальных “анимационных ячеек” к этому парадигме, например, используя оценку глубины для разрезания сцены на ступенчатый, но управляемый градиент отдельных фокальных плоскостей, а затем оркестрируя глубоко-зависимые ядра для синтеза размытия.
Кроме того, и очень актуально для потенциальных сред AR/VR, разница между двумя точками зрения стерео-камеры может быть использована в качестве замены глубины – метод, предложенный исследователями Google в 2015 году.

Из статьи Google ‘Быстрое стерео в пространстве билатеральной обработки для синтетического размытия’, разница между двумя точками зрения обеспечивает карту глубины, которая может облегчить размытие. Однако этот подход неаутентичен в ситуации, описанной выше, где фотография явно сделана с объективом 35-50 мм (стандарт SLR), но экстремальное размытие фона произошло бы только с объективом, превышающим 200 мм, который имеет ограниченную фокальную плоскость, производящую узкую глубину резкости в обычных, человеко-размерных средах. Источник
Подходы этого типа склонны демонстрировать артефакты краев, поскольку они пытаются представить два отдельных и ограниченных краями сферы фокуса как непрерывный фокальный градиент.
В 2021 году инициатива RawNeRF предложила функциональность с высоким динамическим диапазоном (HDR), с большим контролем над ситуациями низкой освещенности, и, казалось бы, впечатляющую способность переключать фокус:

RawNeRF переключает фокус красиво (если, в данном случае, неаутентично, из-за нереалистичных фокальных плоскостей), но требует высоких вычислительных затрат. Источник: https://bmild.github.io/rawnerf/
Однако RawNeRF требует обременительного предварительного расчета для своих много плоскостных представлений обученного NeRF, что приводит к рабочему процессу, который не может быть легко адаптирован к более легким или низко-задержанным реализациям NeRF.
Моделирование виртуальной линзы
Сам NeRF основан на модели образования изображения с помощью маленького отверстия, которая рендерит всю сцену четко, подобно стандартной сцене CGI (до различных подходов, которые рендерят размытие как пост-обработку или внутренний эффект на основе глубины резкости).
NeRFocus создает виртуальную “тонкую линзу” (а не “безлинзовое” отверстие), которая рассчитывает путь пучка каждого входящего пикселя и рендерит его直接, эффективно инвертируя стандартный процесс захвата изображения, который работает пост фактум на световом входе, уже затронутом рефрактивными свойствами конструкции линзы.

Эта модель вводит ряд возможностей для рендеринга контента внутри фрустума (крупнейшего круга влияния, изображенного на изображении выше).
Расчет правильного цвета и плотности для каждого многослойного перцептрона (MLP) в этом более широком диапазоне возможностей является дополнительной задачей. Это было решено ранее путем применения обучения с учителем к большому количеству изображений DLSR, что включает создание дополнительных наборов данных для вероятностного рабочего процесса обучения – эффективно включающего трудоемкую подготовку и хранение нескольких возможных вычисленных ресурсов, которые могут или не могут быть необходимы.
NeRFocus преодолевает это с помощью P-обучения, где наборы данных для обучения генерируются на основе базовых операций размытия. Таким образом, модель формируется с операциями размытия, врожденными и навигируемыми.

Диаметр отверстия устанавливается в ноль во время обучения, и заранее определенные вероятности используются для случайного выбора ядра размытия. Этот полученный диаметр используется для масштабирования диаметров каждой составной конусной формы, позволяя MLP точно предсказать радиацию и плотность фрустумов (широкие круги на изображениях выше, представляющие максимальную зону преобразования для каждого пикселя)
Авторы новой статьи отмечают, что NeRFocus потенциально совместим с подходом, основанным на HDR, RawNeRF, который может помочь в рендеринге определенных сложных секций, таких как размытые блики, и многих других вычислительно-интенсивных эффектов, которые бросали вызов рабочим процессам CGI в течение тридцати или более лет.
Процесс не требует дополнительных требований к времени и/или параметрам по сравнению с предыдущими подходами, такими как основной NeRF и Mip-NeRF (и, предположительно, Mip-NeRF 360, хотя это не рассматривается в статье), и применим как общее расширение центральной методологии нейронных радиационных полей.
Опубликовано впервые 12 марта 2022 года.












