Погляд Anderson
До реального часу штучних людей з допомогою нейронного луміграфічного рендерингу

Незважаючи на поточну хвилю інтересу до нейронних полів радіанції (NeRF), технології, здатної створювати штучні 3D-оточення та об’єкти, цей новий підхід до технології синтезу зображень все ще потребує великої кількості часу навчання, і не має реалізації, яка дозволяє реальний час, високочутливі інтерфейси.
Однак, співробітництво між деякими видатними іменами в галузі та академії пропонує новий погляд на цю проблему (загально відому як Новый Синтез Виду, або NVS).
Дослідницька робота, озаглавлена Нейронний Луміграфічний Рендеринг, стверджує, що покращення стану мистецтва близько двох порядків, що представляє кілька кроків до реального часу CG-рендерингу через трубопроводи машинного навчання.

Нейронний Луміграфічний Рендеринг (праворуч) пропонує кращу розв’язання артефактів змішування, і покращене оброблення окулювання порівняно з попередніми методами. Джерело.
Хоча автори статті вказують лише Стенфордський університет і компанію Raxium (яка зараз працює в режимі стелсу), серед учасників також є головний архітектор машинного навчання в Google, комп’ютерний вчений в Adobe, і технічний директор в StoryFile (яка нещодавно потрапила в заголовки новин з штучним інтелектом версією Вільяма Шетнера).
Відносно недавньої кампанії з публічності Шетнера, StoryFile, здається, використовує NLR у своєму новому процесі створення інтерактивних, штучних сутностей на основі характеристик і розповідей окремих людей.
StoryFile бачить використання цієї технології в музейних експозиціях, інтерактивних онлайн-розповідях, голографічних дисплеях, доповненої реальності (AR), і документуванні спадщини – і, здається, також розглядає потенційні нові застосування NLR у процесі набору працівників і віртуальних побачень:

Предложені застосування з онлайн-відео StoryFile. Джерело: https://www.youtube.com/watch?v=2K9J6q5DqRc
Об’ємний Захват Для Нового Синтезу Виду Інтерфейсів І Відео
Принцип об’ємного захоплення, по всьому ряду робіт, які накопичуються на цю тему, полягає в ідей захоплення статичних зображень або відео об’єкта, і використання машинного навчання для “заповнення” точок зору, які не були покриті початковим масивом камер.

Джерело: https://research.fb.com/wp-content/uploads/2019/06/Neural-Volumes-Learning-Dynamic-Renderable-Volumes-from-Images.pdf
На зображенні вище, взятої з досліджень штучного інтелекту Facebook 2019 року (див. нижче), ми бачимо чотири стадії об’ємного захоплення: кілька камер отримують зображення/відео; архітектура кодувача/декодувача (або інші архітектури) обчислюють і конкатенують відносність точок зору; алгоритми рей-марчингу обчислюють воксели (або інші XYZ-геометричні одиниці) кожної точки в об’ємному просторі; і (у більшості недавніх робіт) відбувається навчання для синтезу повної сутності, яку можна маніпулювати в реальному часі.
Це часто тривале і даних-інтенсивне навчання фази було причиною того, що новий синтез виду залишається поза межами реального часу або високочутливих захоплень.
Факт того, що Новый Синтез Виду створює повну 3D-карту об’ємного простору, означає, що відносно легко шити ці точки разом у традиційну комп’ютерну сітку, ефективно захоплюючи і артикулюючи штучного людини (або будь-який інший відносно обмежений об’єкт) на льоту.
Підходи, які використовують NeRF, залежать від хмар точок і глибинних карт для генерації інтерполяцій між рідкими точками зору захоплювальних пристроїв:

NeRF може генерувати об’ємну глибину через обчислення глибинних карт, а не генерацію CG-сіток. Джерело: https://www.youtube.com/watch?v=JuH79E8rdKc
Хоча NeRF здатний обчислювати сітки, більшість реалізацій не використовують це для генерації об’ємних сцен.
Натомість, підхід Implicit Differentiable Renderer (IDR), опублікований Інститутом науки Вейцмана в жовтні 2020 року, спирається на використання 3D-сіткових даних, автоматично згенерованих з захоплених масивів:

Приклади IDR-захоплення, перетворені на інтерактивні CGI-сітки. Джерело: https://www.youtube.com/watch?v=C55y7RhJ1fE
Хоча NeRF не має можливості IDR для оцінки форми, IDR не може порівнятися з NeRF за якістю зображення, і обидва вимагають великих ресурсів для навчання і збірки (хоча недавні інновації в NeRF починають вирішувати цю проблему).

НЛР-камера з 16 камерами GoPro HERO7 і 6 центральними камерами Back-Bone H7PRO. Для ‘реального часу’ рендерингу ці камери працюють з мінімумом 60 кадрів в секунду. Джерело: https://arxiv.org/pdf/2103.11571.pdf
Натомість, Нейронний Луміграфічний Рендеринг використовує SIREN (Синусоїдальні Представницькі Мережі), щоб включити сильні сторони кожного підходу у свій власний каркас, який призначений для генерації виходу, який безпосередньо можна використовувати в існуючих трубопроводах реального часу.
SIREN вже використовувався для подібних реалізацій протягом останнього року, і тепер представляє популярний API-дзвінок для хобі-Colab у спільнотах синтезу зображень; однак, інновація NLR полягає в застосуванні SIREN до двовимірної багатогранної супервізії зображень, яка є проблематичною через те, наскільки SIREN генерує надмірно підігнані, а не узагальнені виходи.
Після того, як CG-сітка витягнута з масиву зображень, сітка растеризується через OpenGL, і вершинні позиції сітки відображаються на відповідні пікселі, після чого відбувається обчислення змішування різних внесків карт:
Результатна сітка більш узагальнена і репрезентативна, ніж у NeRF (див. зображення нижче), вимагає менше обчислень, і не застосовує надмірну деталізацію до областей (таких як гладка шкіра обличчя), які не можуть отримати від цього користі:
На негативній стороні, NLR поки що не має можливості для динамічного освітлення або переосвітлення, і вихід обмежений тіньовими картами та іншими освітлювальними факторами, отриманими під час захоплення. Дослідники планують вирішити цю проблему в майбутній роботі.
Крім того, стаття визнає, що форми, згенеровані NLR, не такі точні, як деякі інші підходи, такі як Піксельний вибір виду для неструктурованого багатогранного стерео, або дослідження Інституту Вейцмана, згадані раніше.
Рост Об’ємного Синтезу Зображень
Ідея створення 3D-сутностей з обмеженої серії фотографій з нейронними мережами передує NeRF, з видатними роботами, датованими 2007 роком або раніше. У 2019 році дослідницький відділ штучного інтелекту Facebook створив фундаментальну дослідницьку роботу, Нейронні Об’ємні: Навчання Динамічних Рендерованих Об’ємів з Зображень, яка вперше дозволила створити реактивні інтерфейси для штучних людей, згенерованих об’ємним захопленням на основі машинного навчання.

Дослідження Facebook 2019 року дозволило створити реактивний інтерфейс для об’ємної людини. Джерело: https://research.fb.com/publications/neural-volumes-learning-dynamic-renderable-volumes-from-images/













