Погляд Anderson
NeRF робить ще один крок до заміни CGI

Дослідники з MIT і Google зробили великий крок у вирішенні однієї з найбільш фундаментальних перешкод для нової технології, керованої штучним інтелектом, яка може в кінцевому підсумку замінити CGI – розділення нейронного радіанційного поля (NeRF) на його складові візуальні компоненти, щоб зображення можна було перефарбувати та переосвітлити.
Новий підхід, названий NeRFactor, ефективно розділяє захоплені зображення на нормалі об’єктів (на які можна призначити текстури), видимість світла, альбедо (відношення випадкового світла, що відбивається від поверхні) та двовимірні функції розподілу відбиття (BRDF).
З цими аспектами, ізольованими окремо, стало можливим не тільки міняти текстури окремих об’єктів або груп об’єктів, але також додавати нові та унікальні джерела світла та реалізації тіні, виключаючи ті, які були захоплені багатокамерними масивами, що генерують вхідні дані для зображень NeRF.

Нормалі, видимість, альбедо та BRDF, розділені під NeRFactor. Джерело: https://www.youtube.com/watch?v=UUVSPJlwhPg
Модель підтримує м’які або тверді тіні з довільних джерел світла, визначених користувачем, і розділяє чотири аспекти захопленого відео програмно, використовуючи реконструкційну втрату, дані з попередніх розрахунків BRDF та базову просту регуляризацію гладкості.


Робочий процес NeRFactor, який виділяє окремо діючі аспекти зображень, отриманих з багатокамерних масивів. Джерело: https://arxiv.org/pdf/2106.01970.pdf
NeRFactor використовує зонд світла високої чіткості, добре встановлений підхід, який проникнув у візуальну промисловість та мистецтво з моменту його введення у 1998 році, для оцінки можливих шляхів променів, що дозволяє довільне освітлення. Оскільки це генерує величезну кількість можливих параметрів, зонд світла фільтрується через багаторівневу перцептронну мережу (MLP), яка відображає сприйману геометрію на зонд без спроби обчислити повний об’ємний картографічний простір моделі.

Два моделі нейронного радіанційного поля використовуються для демонстрації п’яти моделей освітлення, можливих під NeRFactor. Натисніть на зображення для вищої роздільної здатності.
Причина для роздуму
Нові дослідження, можливо, найважливіші в тому, що вони розділяють шари захоплених зображень, які контролюють відбиття. Це залишається однією з найбільших перешкод для зображень нейронного радіанційного поля, оскільки真正но новий і гнучкий систем NeRF буде потрібно не тільки заміняти текстури, але й мати можливість відбивати рухомі об’єкти (крім лише фіксованого середовища), які зазвичай обліковуються у робочому процесі CGI.

Ця проблема була відзначена недавно щодо нового дослідження Intel щодо перетворення відеозаписів відеоігор у фотореалістичне відео за допомогою конволюційних нейронних мереж. У таких робочих процесах багато “запечатаних” аспектів вихідного матеріалу потрібно буде зробити дискретними та заміними, і це, ймовірно, легше розв’язати для переосвітлення (яке є функцією геометрії, що виконується в NeRF), ніж для відбиття (яке використовує “зовнішню” геометрію, яка повністю поза межами моделі).
Отже, ізоляція шарів у відео NeRF, які сприяють відбиттю, робить NeRF ще одним кроком ближче до вирішення своєї “проблеми відбиття”.
Використання середовища високої чіткості вже вирішує проблему генерації відбиттів світу (тобто неба, ландшафтів та інших “фіксованих” факторів середовища), але нові підходи будуть потрібні для введення рухомих та динамічних відбиттів.
Фотограмметрія з NeRF
Зображення нейронного радіанційного поля використовує аналіз машинного навчання для розробки повністю об’ємного простору з сцени або об’єкта, який був захоплений з декількох кутів.

Різні схеми, засновані на NeRF, які з’явилися за останній рік, використовували різну кількість камер-джерел; деякі використовують 16 або більше камер, інші – лише одну або дві. У всіх випадках проміжні точки зору “заповнюються” (тобто інтерпретуються), щоб сцену або об’єкт можна було плавно переміщувати.
Результатом є повністю об’ємний простір з вбудованим тривимірним розумінням, яке можна використовувати багатьма способами, включаючи можливість генерації традиційних моделей CGI з 3D-парсованої суми вхідних зображень.
NeRF у контексті “Нової CGI”
Зображення нейронного радіанційного поля отримані безпосередньо з зображень реального світу, включаючи рухомі зображення людей, об’єктів та сцен. На відміну від цього, методологія CGI “вивчає” та інтерпретує світ, вимагаючи кваліфікованих працівників для створення моделей, скелетів та текстур, які використовують зображення реального світу (тобто захоплення обличчя та середовища).
Крім того, CGI мав тривалі проблеми з ефектом “долини незручності” у своїх зусиллях щодо відтворення подібностей людей, що не становить жодної перешкоди для підходу NeRF, який просто захоплює відео чи зображення реальних людей та маніпулює ним.
Крім того, NeRF може генерувати традиційну геометрію моделей CGI безпосередньо з фотографій за необхідності, і фактично замінює багато ручних процедур, які завжди були необхідні у комп’ютерній графіці.
Перешкоди для NeRF
Ці останні дослідження з MIT і Google відбуваються в контексті справжньої повені робіт NeRF за останній рік, багато з яких пропонують рішення різних перешкод, які виникли у початковій роботі 2020 року.
У квітні інновація китайського дослідницького консорціуму надала спосіб відокремити окремі хронології аспектів сцени NeRF, включаючи людей.

Китайські дослідження дозволяють кінцевим користувачам копіювати, вставляти та змінювати захоплені елементи, виокремлюючи їх з лінійної хронології вихідного джерела відео. Джерело: https://www.youtube.com/watch?v=Wp4HfOwFGP4
Цей підхід не тільки дозволяє уявляти сцену з будь-якого кута, захопленого камерним масивом (і не тільки з одного виду, представленого у типовому відеозаписі), але також дозволяє гнучке композитинг – і навіть можливість представити два аспекти з одного й того ж кадру, які працюють у своїх індивідуальних часових рамках (або навіть рухаються у зворотному напрямку, якщо необхідно).

Китайські дослідження дозволяють кінцевим користувачам копіювати, вставляти та змінювати захоплені елементи, виокремлюючи їх з лінійної хронології вихідного джерела відео. Джерело: https://www.youtube.com/watch?v=Wp4HfOwFGP4
Однією з найбільших перешкод для NeRF є зниження суттєвих ресурсів, необхідних для навчання сцени, і це було розглянуто у декількох останніх роботах. Наприклад, Інститут інтелектуальних систем імені Макса Планка недавно представив KiloNeRF, який не тільки прискорює часи рендерингу у 1000 разів, але також дозволяє NeRF працювати інтерактивно.

KiloNeRF працює у інтерактивному середовищі з частотою 50 кадрів у секунду на GTX 1080ti. Джерело: https://github.com/creiser/kilonerf
Однак інновація NeRF, яка справді захопила уяву дослідників та громадськості у 2021 році, стала співпрацею PlenOctrees, очоленою Університетом Каліфорнії у Берклі, яка пропонує рендеринг нейронного радіанційного поля в реальному часі:
Ефект інтерактивних можливостей PlenOctrees був відтворений у веб-інтерфейсі.

Живий інтерактивний рух об’єкта PlenOctrees у Firefox (рух гладший і більш динамічний, ніж це зображення). Джерело: http://alexyu.net/plenoctrees/demo/
Крім того, Recursive-NeRF (з травня 2021 року роботи дослідників Університету Цінхуа) пропонує високоякісне рекурсивне рендеринг на вимогу. Замість того, щоб зобов’язувати користувача рендерити всю сцену, включаючи частини, які можуть не бути видимими, Recursive-NeRF пропонує щось на зразок стиснення JPEG, і може генерувати окремі під-NeRF для обробки додаткових зображень на вимогу – досягнувши величезну економію обчислювальних ресурсів.

Збереження деталей при виключенні непотрібних розрахунків рендерингу з Recursive-NeRF. Натисніть на зображення для вищої роздільної здатності. Джерело: https://arxiv.org/pdf/2105.09103.pdf
Інші підходи включають FastNeRF, який стверджує, що досягає високоякісного нейронного рендерингу на частоті 200 кадрів у секунду.
Було відзначено, що багато оптимізаційних технік для NeRF включають “запікання” сцени, зобов’язуючись щодо тих аспектів, які потрібно відтворити, і виключення інших аспектів, що обмежує дослідження, але суттєво прискорює інтерактивність.
Недоліком цього є те, що тягар переходить з GPU на сховище, оскільки запечені сцени займають величезну кількість місця на диску; до певної міри це можна пом’якшити, знижуючи роздільну здатність запечених даних, хоча це також включає певне зобов’язання щодо закриття шляхів дослідження або інтерактивності.
Відносно захоплення руху та скелетування, новий підхід з Університетів Чжецзян та Корнелла, виявлений у травні, пропонував метод для відтворення анімованих людей за допомогою полів ваги змішування та скелетних структур, інтерпретованих з вхідного відео:

Похідна скелетна структура в Animatable NeRF. Джерело: https://www.youtube.com/watch?v=eWOSWbmfJo4

Коли NeRF матиме свій момент “Парку Юрського періоду”?
Незважаючи на швидкий темп прогресу у синтезі зображень за допомогою нейронного радіанційного поля, лише зараз буде встановлено jakýсь “закон термодинаміки” щодо того, як розгорнутим NeRF можна стати. У плані хронології історії CGI, NeRF зараз перебуває на рівні 1973 року, прямо перед першим використанням CGI у фільмі Westworld.
Це не означає, що NeRF обов’язково потрібно буде чекати дев’ять років на свій аналог Wrath Of Khan або десятиліття на подібні прориви, яких досягла CGI під ентузіастичним патронатом Джеймса Кемерона у фільмах 1989 року The Abyss або 1991 року Terminator 2 – і тоді, технологічна прорив у 1993 році у фільмі Парк Юрського періоду.

Сцена зображень змінилася значно з довгого періоду застою фотохімічних візуальних ефектів, які домінували у кіно- та телевізійній продукції з моменту народження кіно до початку 1990-х років. Розробка революції персональних комп’ютерів та прискорення закону Мура привели до революції CGI, яка могла б відбутися вже у 1960-х роках.
Залишається невідомим, чи є якась бар’єр така непохитна, що могла б утримувати прогрес NeRF протягом так довгого часу – і чи не можуть наступні інновації у комп’ютерному баченні зовсім витіснити NeRF як основного претендента на трон CGI, характеризуючи нейронне радіанційне поле як короткочасний “факс-апарат” нейронної синтезу зображень.
На даний момент NeRF не було використано у жодному контексті поза академічними дослідженнями; однак варто відзначити, що великі гравці, такі як Google Research, і багато найвідоміших лабораторій комп’ютерного бачення, змагаються за останні прориви NeRF.
Багато найбільших перешкод NeRF почали безпосередньо вирішуватися цього року; якщо наступні дослідження пропонуватимуть рішення проблеми відбиття, і якщо багато ниток досліджень NeRF зібуться у вирішальне рішення суттєвих вимог до обробки та/або сховища технології, NeRF справді має шанс стати “новою CGI” протягом наступних п’яти років.












