Погляд Anderson

Пересвітлення нейронних радіанційних полів з довільною картою середовища

mm
Додайте Unite.AI до бажаних джерел у Google

У новій роботі Інституту Макса Планка та Массачусетського технологічного інституту запропоновано техніку отримання справжнього розрізнення вмісту нейронних радіанційних полів (NeRF) від освітлення, яке було присутнє під час збору даних, що дозволяє ад хок карти середовища повністю замінити освітлення в сцені NeRF:

Нова техніка, застосована до реальних даних. Варто зазначити, що метод працює навіть з архівованими даними цього типу, які не брали до уваги новий конвеєр під час збору даних. Незважаючи на це, отримується реалістичний і заданий користувачем контроль освітлення Source: https://arxiv.org/pdf/2207.13607.pdf

Нова техніка, застосована до реальних даних. Варто зазначити, що метод працює навіть з архівованими даними цього типу, які не брали до уваги новий конвеєр під час збору даних. Незважаючи на це, отримується реалістичний і заданий користувачем контроль освітлення. Source: https://arxiv.org/pdf/2207.13607.pdf

Новий підхід використовує популярну відкриту програму 3D-анімації Blender для створення “віртуальної світлової сцени”, де відтворюються численні ітерації можливих сценаріїв освітлення та eventually тренуються у спеціальному шарі моделі NeRF, який може вміщувати будь-яку карту середовища, яку користувач хоче використовувати для освітлення сцени.

Зображення частини конвеєра, який використовує Blender для створення віртуальної світлової сцени видобутих геометрій. Попередні методи, які слідують подібним лініям, використовували фактичні світлові сцени для надання цих даних, що є обтяжливим вимогами для дискретних об'єктів та неможливим для зовнішніх виглядів. У верхньому лівому куті двох правих зображень ми бачимо карти середовища, які визначають освітлення сцени. Їх можна довільно створювати кінцевим користувачем, що приносить NeRF на крок ближче до гнучкості сучасного підходу CGI.

Зображення частини конвеєра, який використовує Blender для створення віртуальної світлової сцени видобутих геометрій. Попередні методи, які слідують подібним лініям, використовували фактичні світлові сцени для надання цих даних, що є обтяжливим вимогами для дискретних об’єктів та неможливим для зовнішніх виглядів. У верхньому лівому куті двох правих зображень ми бачимо карти середовища, які визначають освітлення сцени. Їх можна довільно створювати кінцевим користувачем, що приносить NeRF на крок ближче до гнучкості сучасного підходу CGI.

Підхід був протестований проти інверсної системи рендерингу Mitsuba2 та проти попередніх робіт PhySG, RNR, Neural-PIL та NeRFactor, використовуючи лише пряму модель освітлення, та отримав найкращі результати:

Результати нової техніки, порівняні з іншими підходами під різними функціями втрат. Дослідники стверджують, що їхній підхід дає最高 якість методів, з результатами, оціненими через пік сигнал-шумового співвідношення (PSNR), індекс подібності структури (SSIM) та ефективний, хоча й екцентричний, навчений перцептивний образовий патч-симетрії (LPIPS).

Результати нової техніки, порівняні з іншими підходами під різними функціями втрат. Дослідники стверджують, що їхній підхід дає最高 якість методів, з результатами, оціненими через пік сигнал-шумового співвідношення (PSNR), індекс подібності структури (SSIM) та ефективний, хоча й екцентричний, навчений перцептивний образовий патч-симетрії (LPIPS).

У роботі зазначено:

‘Наші якісні та кількісні результати демонструють явний крок вперед щодо відновлення параметрів сцени, а також синтезу якості нашого підходу під новими виглядами та умовами освітлення порівняно з попереднім станом мистецтва.’

Дослідники заявляють, що вони згодом опублікують код проекту.

Потрібність редагування NeRF

Таке розрізнення виявилося суттєвим викликом для дослідників нейронних радіанційних полів, оскільки NeRF є суттєво фотограмметричною технікою, яка обчислює значення пікселів тисяч можливих шляхів від точки огляду, присвоює значення RGBD, та збирає матрицю цих значень у об’ємне представлення. У своєму ядрі NeRF визначається освітленням.

Фактично, незважаючи на вражаючі візуальні ефекти та широке застосування NVIDIA (NVDA ), NeRF є досить “жорстким” – у термінах CGI, “запечатаним”. Тому дослідницька спільнота зосередилася на поліпшенні його доступності та гнучкості за останні 12-18 місяців.

За значенням, ставки для такого етапу є високими та включають можливість перетворення індустрії візуальних ефектів з творчої та колаборативної моделі, заснованої на генерації сіток, динаміці руху та текстурі, на модель, побудовану на оберненому рендерингу, де конвеєр візуальних ефектів живиться реальними фотографіями реальних речей (або навіть, можливо, реальних та синтезованих моделей), а не оціненими, художніми наближеннями.

Наразі немає суттєвих підстав для занепокоєння серед спільноти візуальних ефектів, принаймні з боку нейронних радіанційних полів. NeRF має лише зароджувальні здібності щодо з’єднання, вкладення, контролю глибини, артикуляції…та, безумовно, також щодо освітлення. Супровідне відео до іншої нової роботи, яка пропонує первинні деформації для геометрії NeRF, демонструє величезну пропасть між поточним станом мистецтва у CGI та семінальними зусиллями технік нейронного рендерингу.

Вибір елементів

Незважаючи на це, оскільки потрібно починати десь, дослідники нової роботи прийняли CGI як проміжну контрольну та виробничу механіку, яка зараз є поширеним підходом до жорстких латентних просторів GAN та майже непроникних лінійних мереж NeRF.

Ефективно, центральним викликом є обчислення глобального освітлення (GI, яке не має прямого застосування у нейронному рендерингу) у еквівалентному попередньо обчисленому переносу радіації (PRT, яке можна адаптувати до нейронного рендерингу) розрахунку.

GI є тепер пошанованим технікою рендерингу CGI, яка моделює спосіб, яким світло відбивається від поверхонь та на інші поверхні, та включає ці області відбитого світла у рендер для додання реалізму.

PRT використовується як проміжна функція освітлення у новому підході, та те, що це дискретна та редагована компонента, досягає розрізнення. Новий метод моделює матеріал об’єкта NeRF із навченим PRT.

Фактичне освітлення сцени оригінальних даних відновлюється як карта середовища у процесі, та сама геометрія сцени видобувається як підписаний поліноміальний поліном (SDF), який згодом надасть традиційну сітку для Blender для роботи у віртуальній світловій сцені.

Огляд конвеєра для нової техніки.

Огляд конвеєра для нової техніки.

Перший етап у процесі полягає у видобуванні геометрії сцени з доступних зображень багаторазового вигляду через імпліцитну поверхневу реконструкцію, за допомогою технік, використаних у дослідженні NeuS 2021 року.

Для розробки нейронного радіанційного поля переносу (NRTF, яке буде вміщувати дані освітлення), дослідники використовували диференційований трасувальник шляхів Mitsuba 2.

Це забезпечує спільну оптимізацію двонаправленої функції розсіювання (BSDF), а також генерацію початкової карти середовища. Як тільки створено BSDF, трасувальник шляхів можна використовувати у Blender (див. вкладене відео прямо вище) для створення віртуальних рендерів сцени “один світло за раз” (OLAT).

NRTF потім тренується з комбінованою втратою між фотореалістичними матеріальними ефектами та синтетичними даними, які не сплетені між собою.

Порівняння з попереднім NeRFactor щодо викликів нової синтезу вигляду та перезапису освітлення.

Порівняння з попереднім NeRFactor щодо викликів нової синтезу вигляду та перезапису освітлення.

Дорога до освітлення

Вимоги до тренування цієї техніки, хоча й суттєво менші, ніж оригінальні часи тренування NeRF, не є незначними. На NVIDIA Quadro RTX 8000 з 48 ГБ відеопам’яті, попереднє тренування для початкової оцінки освітлення та текстури триває 30 хвилин; тренування OLAT (тобто тренування віртуальної світлової сцени) триває 8 годин; та остаточна спільна оптимізація між розрізненими синтетичними та реальними даними триває ще 16 годин для досягнення оптимальної якості.

Крім того, отримане нейронне представлення не може працювати в реальному часі, займаючи, згідно з дослідниками, “кілька секунд на кадр”.

Дослідники висновують:

‘Наші результати демонструють явний крок вперед щодо поліпшення поточного стану мистецтва, тоді як майбутня робота могла б включати подальше поліпшення часу виконання та спільне розуміння геометрії, матеріалу та освітлення сцени.’

 

Перша публікація 28 липня 2022 року.

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai