Погляд Anderson

Нейронний рендеринг: NeRF гуляє на свіжому повітрі

mm
Додайте Unite.AI до бажаних джерел у Google

Спільна робота Google Research та Гарвардського університету розробила новий метод створення 360‑градусного нейронного відео повних сцен за допомогою Neural Radiance Fields (NeRF). Цей новаторський підхід наближає NeRF до повсякденного абстрактного використання в будь‑якому середовищі, не обмежуючись моделями на столі чи закритими інтер’єрними сценаріями.

Source: https://www.youtube.com/watch?v=zBSH-k9GbV4

Дивіться кінець статті для повного відео. Джерело: https://www.youtube.com/watch?v=zBSH-k9GbV4

Mip-NeRF 360 може обробляти розширені фони та «нескінченні» об’єкти, такі як небо, оскільки, на відміну від більшості попередніх версій, він встановлює обмеження на інтерпретацію світлових променів і створює межі уваги, що скорочують надто довгі часи навчання. Дивіться нове супровідне відео, вбудоване в кінець цієї статті, для більшої кількості прикладів та розширеного розуміння процесу.

Новий документ новий документ називається Mip-NeRF 360: Unbounded Anti-Aliased Neural Radiance Fields і написаний старшим науковим співробітником Google Research Джоном Барроном.

Що таке NeRF?

Проблематично описувати мережу NeRF у термінах «відео», оскільки вона ближче до повністю 3D‑реалізованого, але AI‑заснованого віртуального середовища, де кілька точок зору з окремих фотографій (включно з кадрами відео) використовуються для зшивання сцени, яка технічно існує лише в латентному просторі алгоритму машинного навчання, — проте з якої можна за бажанням отримати надзвичайно багато точок зору та відео.

A depiction of the multiple camera capture points that provide the data which NeRF assembles into a neural scene (pictured right).

Зображення кількох точок захоплення камер, які надають дані, що NeRF збирає у нейронну сцену (праворуч).

Інформація, отримана з внесених фотографій, навчається у матрицю, схожу на традиційну воксельну сітку у CGI‑процесах, оскільки кожна точка в 3D‑просторі отримує значення, що робить сцену навігаційною.

A traditional voxel matrix places pixel information (which normally exists in a 2D context, such as the pixel grid of a JPEG file) into a three-dimensional space. Source: https://www.researchgate.net/publication/344488704_Processing_and_analysis_of_airborne_full-waveform_laser_scanning_data_for_the_characterization_of_forest_structure_and_fuel_properties

Традиційна воксельна матриця розміщує піксельну інформацію (яка зазвичай існує у 2D‑контексті, наприклад, піксельна сітка JPEG‑файлу) у тривимірний простір. Джерело: https://www.researchgate.net/publication/344488704_Processing_and_analysis_of_airborne_full-waveform_laser_scanning_data_for_the_characterization_of_forest_structure_and_fuel_properties

Після розрахунку проміжного простору між фотографіями (за потреби) шлях кожного можливого пікселя кожної внесеної фотографії ефективно «трасується» променем і отримує колірне значення, включаючи прозорість (без якої нейронна матриця була б повністю непрозорою або повністю порожньою).

Як і воксельні сітки, і на відміну від 3D‑координатного простору, заснованого на CGI, «внутрішня» частина «закритого» об’єкта не існує у матриці NeRF. Ви можете розкрити CGI‑барабанну установку і подивитися всередину, якщо бажаєте; проте для NeRF існування барабанної установки закінчується, коли значення непрозорості її поверхні дорівнює «1».

Ширший погляд на піксель

Mip-NeRF 360 — це розширення дослідження березня 2021 року, яке ефективно впровадило ефективне згладжування до NeRF без витратного суперсемплювання.

NeRF традиційно обчислює лише один шлях пікселя, що схильне до появи типових ‘зубців’, які характеризували ранні інтернет‑формати зображень, а також старі ігрові системи. Ці зубчасті краї вирішували різними методами, зазвичай шляхом вибірки сусідніх пікселів та знаходження середнього представлення.

Оскільки традиційний NeRF вибирає лише один шлях пікселя, Mip-NeRF впровадив «конічну» зону захоплення, схожу на широкий промінь ліхтарика, яка забезпечує достатньо інформації про сусідні пікселі для економічного згладжування з підвищеною деталізацією.

The conical cone catchment that Mip-NeRF uses is sliced up into conical frustums (below), which is further 'blurred' to represent a vaguer Gaussian space that can be used to calculate the accuracy and aliasing of a pixel. Source: https://www.youtube.com/watch?v=EpH175PY1A0

Конічна зона захоплення, яку використовує Mip-NeRF, розрізана на конічні усічені конуси (нижче), які додатково «розмиваються», щоб представити більш розпливний гаусів простір, який можна використати для обчислення точності та згладжування пікселя. Джерело: https://www.youtube.com/watch?v=EpH175PY1A0

Покращення порівняно зі стандартною реалізацією NeRF було помітним:

Mip-NeRF (right), released in березень 2021, provides improved detail through a more comprehensive but economical aliasing pipeline, rather than just 'blurring' pixels to avoid jagged edges. Source: https://jonbarron.info/mipnerf/

Mip-NeRF (праворуч), випущений у березні 2021 року, забезпечує покращену деталізацію завдяки більш комплексному, але економічному процесу згладжування, а не лише «розмиванню» пікселів для уникнення зубчастих країв. Джерело: https://jonbarron.info/mipnerf/

NeRF без обмежень

У березневій статті залишилося три нерозв’язаних питання щодо використання Mip-NeRF у безмежних середовищах, які можуть включати дуже далекі об’єкти, зокрема небо. Новий документ вирішує це, застосовуючи камановський варп до гаусіан Mip-NeRF.

По‑друге, великі сцени потребують більшої обчислювальної потужності та довших часів навчання, що Mip-NeRF 360 вирішує шляхом «дистиляції» геометрії сцени за допомогою малого «пропозиційного» багатошарового перцептрону (MLP), який попередньо обмежує геометрію, передбачену великим стандартним NeRF MLP. Це пришвидшує навчання втричі.

Нарешті, великі сцени часто ускладнюють дискретизацію інтерпретованої геометрії, що призводить до артефактів, які геймери можуть впізнати, коли графіка «рветься». Новий документ вирішує це, створюючи новий регуляризатор для інтервалів променів Mip-NeRF.

On the right, we see unwanted artifacts in Mip-NeRF due to the difficulty in bounding such a large scene. On the left, we see that the new regularizer has optimized the scene well enough to remove these disturbances.

Праворуч ми бачимо небажані артефакти в Mip-NeRF через складність обмеження такої великої сцени. Ліворуч ми бачимо, що новий регуляризатор оптимізував сцену достатньо, щоб усунути ці порушення.

Щоб дізнатися більше про новий документ, перегляньте відео нижче, а також вступне відео березня 2021 року до Mip-NeRF. Ви також можете дізнатися більше про дослідження NeRF, переглянувши нашу матеріальну базу до цього часу.

Оригінально опубліковано 25 листопада 2021
21 грудня 2021, 12:25pm — Замінено недоступне відео. — MA

Автор у галузі машинного навчання, фахівець у сфері синтезу зображень людей. Колишній керівник дослідницького контенту в Metaphysic.ai, до його злиття з Brahma.ai, що належить DNEG.
Веб‑сайт: martinanderson.ai
Контакт: martin@martinanderson.ai