Взгляд Anderson

К Времени Реального ИИ Человека С Помощью Нейронной Люмиграфической Рендеринга

mm
Добавьте Unite.AI в избранные источники в Google
Neural Lumigraph Rendering

Несмотря на текущую волну интереса к Нейронным Радиационным Полем (NeRF), технологии, способной создавать 3D среды и объекты, эта новая технология синтеза изображений все еще требует большого количества времени обучения и не имеет реализации, которая позволяла бы создавать интерфейсы в реальном времени.

Однако сотрудничество между некоторыми известными компаниями и академическими кругами предлагает новый взгляд на эту проблему (известную как Новый Синтез Видов, или NVS).

Исследовательская работа, озаглавленная Нейронная Люмиграфическая Рендеринга, утверждает, что достигла улучшения на два порядка по сравнению с современным уровнем, что представляет собой несколько шагов к рендерингу в реальном времени с помощью машинных обучающих трубопроводов.

Нейронная Люмиграфическая Рендеринга (справа) предлагает лучшее разрешение артефактов смешивания и улучшенное обработку окуляции по сравнению с предыдущими методами. Source: https://www.youtube.com/watch?v=maVF-7x9644

Нейронная Люмиграфическая Рендеринга (справа) предлагает лучшее разрешение артефактов смешивания и улучшенное обработку окуляции по сравнению с предыдущими методами. Source.

Хотя авторы работы указывают только Стэнфордский университет и компанию Raxium (которая в настоящее время работает в режиме скрытности), в состав участников входят главный архитектор машинного обучения в Google, компьютерный ученый в Adobe и технический директор в StoryFile (которая недавно попала в заголовки с помощью ИИ-версии Уильяма Шатнера).

Что касается недавнего публичного выступления Шатнера, StoryFile, по-видимому, использует НЛР в своей новой технологии создания интерактивных, сгенерированных ИИ сущностей на основе характеристик и историй отдельных людей.

StoryFile предлагает использовать эту технологию в музейных экспозициях, интерактивных онлайн-историях, голографических дисплеях, дополненной реальности (AR) и документации наследия – и также, по-видимому, рассматривает потенциальные новые применения НЛР в интервью при приеме на работу и виртуальных свиданиях:

Предлагаемые использования из онлайн-видео StoryFile. Source: https://www.youtube.com/watch?v=2K9J6q5DqRc

Предлагаемые использования из онлайн-видео StoryFile. Source: https://www.youtube.com/watch?v=2K9J6q5DqRc

Объемная Съемка Для Новый Синтеза Видов Интерфейсов И Видео

Принцип объемной съемки, в ряде работ, посвященных этой теме, заключается в идее съемки статических изображений или видео объекта и использовании машинного обучения для “заполнения” точек зрения, которые не были покрыты исходным массивом камер.

Source: https://research.fb.com/wp-content/uploads/2019/06/Neural-Volumes-Learning-Dynamic-Renderable-Volumes-from-Images.pdf

Source: https://research.fb.com/wp-content/uploads/2019/06/Neural-Volumes-Learning-Dynamic-Renderable-Volumes-from-Images.pdf

На изображении выше, взятом из исследования ИИ Facebook 2019 года (см. ниже), мы видим четыре этапа объемной съемки: несколько камер получают изображения/видео; архитектура кодирования/декодирования (или другие архитектуры) рассчитывает и объединяет относительность точек зрения; алгоритмы рей-марчинга рассчитывают воксели (или другие XYZ пространственные геометрические единицы) каждой точки в объемном пространстве; и (в большинстве недавних работ) происходит обучение для синтеза полной сущности, которую можно манипулировать в реальном времени.

Именно эта часто обширная и ресурсоемкая фаза обучения до сих пор не позволяла новому синтезу вида выйти за рамки реального времени или высокоотзывчивой съемки.

Тот факт, что Новый Синтез Видов создает полную 3D карту объемного пространства, означает, что относительно просто склеить эти точки вместе в традиционную сгенерированную компьютером сетку, эффективно захватывая и артикулируя сгенерированного ИИ человека (или любой другой относительно ограниченный объект) на лету.

Подходы, которые используют NeRF, полагаются на облака точек и карты глубины для генерации интерполяций между разреженными точками зрения устройств съемки:

NeRF может генерировать объемную глубину путем расчета карт глубины, а не генерации сеток. Source: https://www.youtube.com/watch?v=JuH79E8rdKc

NeRF может генерировать объемную глубину путем расчета карт глубины, а не генерации сеток. Source: https://www.youtube.com/watch?v=JuH79E8rdKc

Хотя NeRF способен рассчитывать сетки, большинство реализаций не используют это для генерации объемных сцен.

Напротив, подход Implicit Differentiable Renderer (IDR), опубликованный Институтом Вейцмана науки в октябре 2020 года, основан на использовании информации о 3D сетке, автоматически сгенерированной из массива камер:

Примеры захватов IDR, преобразованных в интерактивные сетки. Source: https://www.youtube.com/watch?v=C55y7RhJ1fE

Примеры захватов IDR, преобразованных в интерактивные сетки. Source: https://www.youtube.com/watch?v=C55y7RhJ1fE

Хотя NeRF не имеет возможности IDR для оценки формы, IDR не может сравниться с NeRF по качеству изображения, и оба требуют обширных ресурсов для обучения и сбора (хотя недавние инновации в NeRF начинают решать эту проблему).

НЛР использует специальный камерный штатив с 16 камерами GoPro HERO7 и 6 центральными камерами Back-Bone H7PRO. Для рендеринга в реальном времени эти камеры работают с частотой не менее 60 кадров в секунду. Source: https://arxiv.org/pdf/2103.11571.pdf

НЛР использует специальный камерный штатив с 16 камерами GoPro HERO7 и 6 центральными камерами Back-Bone H7PRO. Для рендеринга в реальном времени эти камеры работают с частотой не менее 60 кадров в секунду. Source: https://arxiv.org/pdf/2103.11571.pdf

Вместо этого Нейронная Люмиграфическая Рендеринга использует SIREN (Синусоидальные Представления Сетей) для объединения сильных сторон каждого подхода в свою собственную структуру, которая предназначена для генерации вывода, который можно直接 использовать в существующих трубопроводах графики в реальном времени.

SIREN использовался для аналогичных реализаций в течение последнего года и теперь представляет собой популярный вызов API для хобби-Colab в сообществах синтеза изображений; однако инновация НЛР заключается в применении SIREN к двумерному многовидовому контролю изображений, что представляет проблему из-за того, что SIREN производит переобученный, а не обобщенный вывод.

После извлечения сетки из массива изображений сетка растрируется через OpenGL, и позиции вершин сетки сопоставляются с соответствующими пикселями, после чего рассчитывается смешивание различных вкладывающих карт.

Результирующая сетка более общая и представительная, чем сетка NeRF (см. изображение ниже), требует меньше расчетов и не применяет чрезмерные детали к областям (таким как гладкая кожа лица), которые не могут извлечь выгоду из этого:

Source: https://arxiv.org/pdf/2103.11571.pdf

Source: https://arxiv.org/pdf/2103.11571.pdf

С другой стороны, НЛР пока не имеет возможности для динамического освещения или переосвещения, и вывод ограничен теневыми картами и другими соображениями освещения, полученными во время съемки. Исследователи намерены решить эту проблему в будущей работе.

Кроме того, работа признает, что формы, сгенерированные НЛР, не так точны, как некоторые альтернативные подходы, такие как Пиксельный Выбор Видов для Неструктурированного Многовидового Стерео, или исследование Института Вейцмана, упомянутое ранее.

Возрождение Объемного Синтеза Изображений

Идея создания 3D сущностей из ограниченной серии фотографий с помощью нейронных сетей предшествует NeRF, с видными работами, датированными 2007 годом или ранее. В 2019 году исследовательское отделение ИИ Facebook опубликовало фундаментальную исследовательскую работу, Нейронные Объемы: Обучение Динамических Рендерабельных Объемов из Изображений, которая впервые позволила создавать интерфейсы в реальном времени для синтетических людей, сгенерированных на основе машинного обучения объемной съемки.

Исследование Facebook 2019 года позволило создать интерфейс в реальном времени для объемного человека. Source: https://research.fb.com/publications/neural-volumes-learning-dynamic-renderable-volumes-from-images/

Исследование Facebook 2019 года позволило создать интерфейс в реальном времени для объемного человека. Source: https://research.fb.com/publications/neural-volumes-learning-dynamic-renderable-volumes-from-images/

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai