Взгляд Anderson

Новая CGI: Создание нейронных кварталов с помощью Block-NeRF

mm
Добавьте Unite.AI в избранные источники в Google

Нейронные поля радианса (NeRF) позволяют воссоздавать и исследовать объекты внутри нейронных сетей, используя только множественные фотографии с разных точек зрения в качестве входных данных, без сложности и расходов традиционных методов CGI.

Однако этот процесс является вычислительно дорогим, что изначально ограничивало среды NeRF сценариями типа “на столе”. Тем не менее, NeRF был принят посвященным, даже френетическим исследовательским сообществом, которое за последний год включило внешние реконструкции, а также редактируемые нейронные люди, помимо многих других инноваций.

Теперь новая исследовательская инициатива, в которую входят участники Google Research, признает возможные жесткие ограничения на оптимизацию NeRF и вместо этого концентрируется на соединении сред NeRF для создания кварталов по требованию, состоящих из нескольких координированных экземпляров NeRF.

Точка зрения из сети Block-NeRF из связанных NeRF.. См. встроенное видео в конце статьи, а также исходную ссылку для высококачественных полноформатных дополнительных видео. Источник: https://waymo.com/research/block-nerf/

Точка зрения из сети Block-NeRF из связанных NeRF. См. встроенное видео в конце статьи, а также исходную ссылку для высококачественных полноформатных дополнительных видео. Источник: https://waymo.com/research/block-nerf/

Навигация по сети связанных NeRF эффективно делает NeRF масштабируемым и модульным, обеспечивая навигируемые среды, которые загружают дополнительные части квартала по мере необходимости, подобно методам оптимизации ресурсов в видеоиграх, где то, что находится за углом, редко загружается до тех пор, пока не станет ясно, что среда будет нужна.

В крупной кампании по разъединению отдельных аспектов, таких как погода и час, Block-NeRF также вводит “кодировки внешнего вида”, что позволяет динамически изменять время суток:

Изменение времени суток с помощью Block-NeRF. См. встроенное видео в конце статьи, а также исходную ссылку для высококачественных полноформатных дополнительных видео. Источник: https://waymo.com/research/block-nerf/

Изменение времени суток с помощью Block-NeRF. См. встроенное видео в конце статьи, а также исходную ссылку для высококачественных полноформатных дополнительных видео. Источник: https://waymo.com/research/block-nerf/

Новая статья предполагает, что оптимизация NeRF приближается к своему собственному термическому пределу, и что будущие развертывания нейронных радиационных сред в виртуальной реальности, других типах интерактивных сфер и VFX-работе, скорее всего, будут зависеть от параллельных операций, подобно тому, как закон Мура в конечном итоге уступил место многопроцессорным архитектурам, параллельным оптимизациям и новым подходам к кэшированию.

Авторы статьи (названной Block-NeRF: Масштабируемая большая сцена нейронной синтеза вида) использовали 2,8 миллиона изображений для создания крупнейшей нейронной сцены, когда-либо предпринимаемой – серии кварталов в Сан-Франциско.

Block-NeRF проходит по собору Грейс в Сан-Франциско. См. встроенное видео в конце статьи, а также исходную ссылку для высококачественных полноформатных дополнительных видео. Источник: https://waymo.com/research/block-nerf/

Block-NeRF проходит по собору Грейс в Сан-Франциско. См. встроенное видео в конце статьи, а также исходную ссылку для высококачественных полноформатных дополнительных видео. Источник: https://waymo.com/research/block-nerf/

Ведущий автор статьи, представляющий UC Berkley, – Мэтью Танчик, соавтор нейронных полей радианса, который выполнил эту работу во время стажировки в компании Waymo, разрабатывающей технологию автономного вождения, хоста страницы проекта. Эта инициатива также предлагает видеообзор на YouTube, встроенный в конце этой статьи, а также многочисленные поддерживающие и дополнительные видео примеры на странице проекта.

Статья написана в соавторстве с несколькими другими создателями NeRF, включая Бена Милденхолла (Google Research), Пратула П. Шринивасана (Google Research) и Джонатана Т. Баррона (Google Research). Другими участниками являются Винсент Кассер, Синчен Ян, Сабик Прадхан, Хенрик Кретцшмар и Винсент Кассер, все из Waymo.

Block-NeRF был разработан в основном как исследование виртуальных сред для автономных транспортных систем, включая самоходные автомобили и беспилотники.

Дорога Эмбаркадеро с точки зрения 180 градусов в Block-NeRF. См. встроенное видео в конце статьи, а также исходную ссылку для высококачественных полноформатных дополнительных видео. Источник: https://waymo.com/research/block-nerf/

Дорога Эмбаркадеро с точки зрения 180 градусов в Block-NeRF. См. встроенное видео в конце статьи, а также исходную ссылку для высококачественных полноформатных дополнительных видео. Источник: https://waymo.com/research/block-nerf/

Другие факторы, которые можно динамически изменять в Block-NeRF, – это диафрагма объектива (см. изображение выше), погода и сезоны.

Однако изменение сезона может привести к связанным изменениям в окружающей среде, таким как деревья без листьев, что требует еще более обширного набора входных данных, чем был сконструирован для Block-NeRF. В статье говорится:

‘[Листья] меняются сезонно и движутся на ветру; это приводит к размытым представлениям деревьев и растений. Аналогично, временные несоответствия в обучающих данных, такие как строительные работы, не обрабатываются автоматически и требуют ручной переобучения затронутых блоков.’

Апокалиптическая визуализация

Если вы посмотрите на видео, встроенное в конце, вы заметите Ходячие мертвецы-стиль пустоты в сетевой среде Block-NeRF. По различным причинам, не в последнюю очередь для предоставления симулированной стартовой среды для робототехнических систем, автомобилей, пешеходов и других временных объектов были намеренно удалены из исходного материала, но это оставило некоторые артефакты, такие как тени “удаленных” припаркованных транспортных средств:

Фантомная тень удаленной машины. Источник: https://waymo.com/research/block-nerf/

Фантомная тень удаленной машины. Источник: https://waymo.com/research/block-nerf/

Чтобы обеспечить ряд световых сред, таких как день или ночь, сети были обучены включать дезентанглированные потоки данных, связанных с каждым желаемым состоянием. На изображении ниже мы видим вкладывающиеся потоки для кадров Block-NeRF шоссе днем и ночью:

Фасеты, доступные по требованию, за кажущимся

Фасеты, доступные по требованию, за кажущимся “выпеченным” рендером Block-NeRF, позволяющие пользователю включить ночь по мере необходимости. Источник: https://waymo.com/research/block-nerf/

Экологические и этические соображения

За последние несколько лет исследовательские работы начали включать оговорки и免ения относительно возможных этических и экологических последствий предложенной работы. В случае Block-NeRF авторы отмечают, что энергетические требования высоки, и что учет краткосрочных и долгосрочных временных объектов (таких как листья на деревьях и строительные работы соответственно) потребует регулярного повторного сканирования исходных данных, что приведет к увеличению “наблюдения” в городских районах, чьи нейронные модели необходимо поддерживать в актуальном состоянии.

Авторы заявляют:

‘В зависимости от масштаба, на котором применяется эта работа, ее вычислительные требования могут привести к или усугубить экологический ущерб, если энергия, используемая для вычислений, приводит к увеличению выбросов углекислого газа. Как упоминалось в статье, мы предвидим дальнейшую работу, такую как методы кэширования, которые могли бы уменьшить вычислительные требования и, таким образом, смягчить экологический ущерб.’

Что касается наблюдения, они продолжают:

‘Будущие применения этой работы могут включать еще более крупные усилия по сбору данных, что вызывает дальнейшие проблемы с конфиденциальностью. Хотя подробные изображения общественных дорог уже можно найти на сервисах, таких как Google Street View, наша методология может способствовать повторным и более регулярным сканированиям окружающей среды. Некоторые компании в области автономного вождения также известны тем, что выполняют регулярные сканирования территории с помощью своего флота транспортных средств; однако некоторые могут использовать только сканирование LiDAR, которое может быть менее чувствительным, чем сбор камерных изображений.’

Методы и решения

Индивидуальные среды NeRF можно масштабировать, в теории, до любого размера перед сборкой в массив Block-NeRF. Это открывает путь к включению содержимого, которое определенно подвержено изменению, такого как деревья, и к идентификации и управлению строительными работами, которые могут сохраняться во времени в течение даже лет повторного захвата, но, вероятно, будут развиваться и в конечном итоге станут последовательными сущностями.

Однако в этом первоначальном исследовательском выходе отдельные блоки NeRF ограничены фактическими городскими кварталами каждой изображенной среды, сшитыми вместе, с перекрытием 50%, обеспечивающим последовательный переход от одного блока к другому, когда пользователь перемещается по сети.

Каждый блок ограничен географическим фильтром. Авторы отмечают, что эта часть框架а открыта для автоматизации, и, удивительно, что их реализация опирается на OpenStreetMap, а не на Google Maps.

Радиус пересечения для 'активного' пространства рендеринга Block-NeRF. Источник: Waymo

Радиус пересечения для ‘активного’ пространства рендеринга Block-NeRF. Источник: Waymo

Блоки обучаются параллельно, с необходимыми блоками, отображаемыми по требованию. Инновационные коды внешнего вида также оркестрируются среди набора блоков, гарантируя, что один не перемещается неожиданно в разную погоду, время суток или даже сезон.

Сегменты Block-NeRF обусловлены экспозицией аналогично High Dynamic Range (HDR) в фотографическом исходном материале. Источник: Waymo

Сегменты Block-NeRF обусловлены экспозицией аналогично High Dynamic Range (HDR) в фотографическом исходном материале. Источник: Waymo

Возможность переключения освещения и других переменных окружающей среды получена из генеративных латентных оптимизаций, введенных в NeRF в дикой природе (NeRF-W), который сам получил этот метод из исследовательской работы Facebook AI 2019 года Оптимизация латентного пространства генеративных сетей.

Модель семантической сегментации, созданная для Panoptic-DeepLab в 2020 году, используется для блокирования нежелательных элементов (таких как люди и транспортные средства)

Данные

Установив, что общие городские наборы данных, такие как CityScapes, не подходят для такой интенсивной детальной работы, как Block-NeRF, исследователи создали собственный набор данных. Данные изображений были получены из 12 камер, охватывающих 360-градусный вид, с кадрами, снятыми с частотой 10 Гц и скалярным значением экспозиции.

Кварталы Сан-Франциско, охваченные этой работой, – это Аламо-Сквер и Мишн-Бей. Для захватов Аламо-Сквер была покрыта площадь примерно 960м x 570м, разделенная на 35 экземпляров Block-NeRF, каждый из которых был обучен на данных из 38 до 48 разных данных сбора, с общим временем вождения от 18 до 28 минут.

Количество изображений, вносящих вклад в каждый Block-NeRF, варьировалось от 64 575 до 108 216, и общее время вождения, представленное для этой области, составило 13,4 часа за 1 330 разных данных сбора. Это привело к 2 818 745 обучающим изображениям только для Аламо-Сквер. См. статью для дополнительных подробностей о сборе данных для Мишн-Бей.

 

Опубликовано впервые 11 февраля 2022 года.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai