Погляд Anderson

Чи можуть HDR-довершені реальності Apple вирішити проблему відбитків для нейронного рендерингу?

mm
Додайте Unite.AI до бажаних джерел у Google

Тверда, довгострокова інвестиція Apple у технології доповненої реальності прискорюється цього року, з новим набором інструментів для розробників для збереження та конвертації реальних об’єктів у фрагменти доповненої реальності, а також розростання галузі, яка переконана, що спеціалізовані окуляри доповненої реальності будуть підтримувати ці іммерсивні досвіди, які можуть бути забезпечені цією бурею досліджень та розробок.

У числі нових відомостей про зусилля Apple у сфері доповненої реальності, нова стаття від комп’ютерного відділу компанії пропонує метод використання 360-градусних панорамних зображень високої динамічної діапазону (HDR) для забезпечення сценоспецифічних відбитків та освітлення для об’єктів, які накладаються на сцени доповненої реальності.

Стаття, написана інженером комп’ютерного відділу Apple Говрі Соманатом та старшим менеджером машинного навчання Данієлем Курцем, пропонує динамічне створення реального часу HDR-довершених середовищ за допомогою конволюційної нейронної мережі (CNN), яка працює у мобільному процесорному середовищі. Результатом є те, що відбивні об’єкти можуть буквально віддзеркалювати нові, невидані середовища за вимогою:

У новому робочому процесі генерації об'єктів Apple, тиск-конвертер створюється за допомогою фотограмметрії разом із його навколишнім середовищем, що призводить до переконливих відбитків, які не «запечатані» у текстурі. Джерело: https://docs-assets.developer.apple.com/

У новому робочому процесі генерації об’єктів Apple, тиск-конвертер створюється за допомогою фотограмметрії разом із його навколишнім середовищем, що призводить до переконливих відбитків, які не «запечатані» у текстурі. Джерело: https://docs-assets.developer.apple.com/

Метод, представлений на CVPR 2021, робить знімок усієї сцени та використовує EnvMapNet CNN для оцінки візуально повного панорамного зображення HDR, також відомого як «світовий зонд».

Результатом є карта, яка визначає сильні джерела світла (підкреслені в кінці вищезазначеної анімації) та враховує їх при рендерингу віртуальних об’єктів.

Архітектура EnvMapNet, яка обробляє обмежені зображення у повносценічні світлові зонди. Джерело: https://arxiv.org/pdf/2011.10687.pdf

Архітектура EnvMapNet, яка обробляє обмежені зображення у повносценічні світлові зонди. Джерело: https://arxiv.org/pdf/2011.10687.pdf

Алгоритм може працювати менше 9 мілісекунд на iPhone XS та здатний рендерити об’єкти, які віддзеркалюють світло, в реальному часі, з зменшенням напрямку похибки на 50% порівняно з попередніми підходами до цієї проблеми.

Світлові зонди

Світлові середовища високої динамічної діапазону були фактором у візуальних ефектах з моменту появи зображень високої динамічної діапазону (винахід 1986 року) та стали помітним фактором завдяки розвитку комп’ютерної техніки у 1990-х роках. Хтось, хто дивиться за кадром, міг помітити сюрреалістичну присутність техніків, які тримають дзеркальні кулі на палицях – зображення, які будуть використані як середовищні фактори при реконструкції CGI-елементів сцени.

Джерело: https://beforesandafters.com/

Джерело: https://beforesandafters.com/

Однак, використання хромових куль для відбиткової текстури передує 1990-м рокам, сягаючи 1983 року, коли була опублікована стаття Пірамідальні параметри, яка містила статичні зображення відбивного CGI-робота у стилі, який став знаменитим майже через десятиліття завдяки «рідкому металу» ефектам у фільмі Джеймса Кемерона Термінатор 2: Судний день.

Середовища HDR у нейронному рендерингу?

Нейронний рендеринг пропонує можливість генерації фотореалістичних відео з дуже розріджених входних даних, включаючи грубі карти сегментації.

Intel ISL’s сегментація>образ нейронного рендерингу (2017). Джерело: https://awesomeopensource.com/project/CQFIO/PhotographicImageSynthesis

Intel ISL’s сегментація>образ нейронного рендерингу (2017). Джерело: https://awesomeopensource.com/project/CQFIO/PhotographicImageSynthesis

У травні дослідники Intel показали нову ініціативу у сфері нейронної синтезу зображень, де кадри з Grand Theft Auto V були використані для генерації фотореалістичних виходів на основі наборів даних німецьких вулиць.

Джерело: https://www.youtube.com/watch?v=0fhUJT21-bs

Джерело: https://www.youtube.com/watch?v=0fhUJT21-bs

Проблема у розробці середовищ нейронного рендерингу, які можуть бути адаптовані до різних умов освітлення, полягає у виділенні змісту об’єкта з середовищних факторів, які на нього впливають.

На даний момент відбитки та анізотропні ефекти залишаються функціями або原始ного набору даних (що робить їх негнучкими), або вимагають такого самого типу схеми, яку використовували дослідники Intel, яка генерує напівфотореалістичні виходи з грубого (ігрового) двигуна, виконує сегментацію на ньому та потім застосовує стилевий перехід з «запечатаного» набору даних (такого як німецький набір даних вуличних виглядів, використаний у недавніх дослідженнях).

У цьому нейронному рендерингу (кадри Grand Theft Auto V знаходяться ліворуч), транспортний засіб спереду демонструє переконливе блиск та навіть насичує датчик фіктивної віртуальної камери відбитками від сонця. Але цей аспект освітлення походить від освітнього двигуна оригінальних ігрових кадрів, оскільки нейронні фрагменти сцени не мають автономних та самовідносних структур освітлення, які можна змінити.

У цьому нейронному рендерингу (кадри Grand Theft Auto V знаходяться ліворуч), транспортний засіб спереду демонструє переконливе блиск та навіть насичує датчик фіктивної віртуальної камери відбитками від сонця. Але цей аспект освітлення походить від освітнього двигуна оригінальних ігрових кадрів, оскільки нейронні фрагменти сцени не мають автономних та самовідносних структур освітлення, які можна змінити.

Відбитки у NeRF

Зображення, отримані з нейронних радіаційних полів (NeRF), також стикаються з проблемами.

Підхід NeRFactor від MIT та Google виділяє нормалі, видимість (тіні), текстуру та локальну альбедо, але не віддзеркалює середовище, оскільки існує у вакуумі. Джерело: https://arxiv.org/pdf/2106.01970.pdf

Підхід NeRFactor від MIT та Google виділяє нормалі, видимість (тіні), текстуру та локальну альбедо, але не віддзеркалює середовище, оскільки існує у вакуумі. Джерело: https://arxiv.org/pdf/2106.01970.pdf

NeRF може вирішити цю проблему за допомогою такого самого типу HDR-карт, який використовує Apple. Кожна піксель у нейронному радіаційному полі обчислюється на траєкторії від віртуальної камери до точки, де «промінь» не може рухатися далі, подібно до трасування променів у традиційному CGI. Додавання HDR-вхідних даних до обчислення цього променя є потенційним методом досягнення справжніх середовищних відбитків, і є аналогом методів глобального освітлення або радіоз性的 рендерингу у CGI, при яких сцена або об’єкт частково освітлюється сприйнятими відбитками свого середовища.

Хоча гарантовано, що матриця HDR не полегшить обчислювальні витрати NeRF, велика кількість досліджень у цій галузі зараз зосереджена на вирішенні цього аспекту обробки. Невід’ємно, відбитки є одним з багатьох факторів, які чекають у крилі, щоб знову заповнити та викликати цю новооптимізовану архітектуру. Однак, NeRF не може досягти свого повного потенціалу як окрема нейронна методологія синтезу зображень та відео без прийняття способу обліку навколишнього середовища.

Відбитки у трубопроводах нейронного рендерингу

У гіпотетичній HDR-довершеній версії сценарію нейронного рендерингу Intel GTA V, один HDR не міг би вмістити динамічні відбитки, які потрібно виразити у рухомих об’єктах. Наприклад, щоб побачити свій власний транспортний засіб, відбитий у транспортному засобі спереду, коли він під’їжджає до світлофора, передній транспортний засіб міг би мати свій власний анімований HDR-сонд, роздільна здатність якого погіршувалася б поступово, коли він віддаляється від точки зору користувача, став би низькорозрядним та лише репрезентативним, коли від’їжджає у відстань – близькість-орієнтований LOD, подібний до «відстані малювання» у відеоіграх.

Справжній потенціал роботи Apple у сфері HDR-освітлення та відбиткових карт не полягає у тому, що це особливо інноваційно, оскільки воно будується на попередніх роботах у галузі загальної синтезу зображень та розробці сцен доповненої реальності. Радше, можливий прорив представлений тим, як серйозні місцеві обчислювальні обмеження поєдналися з інноваціями Apple у сфері машинного навчання M-серії для виробництва легкого, низьколатентного HDR-картографування, призначеного для роботи під обмеженими ресурсами.

Якщо цю проблему можна вирішити економічно, то появі семантичної сегментації>фотореалістичної відеосинтезу може бути зроблений значний крок вперед.

Джерело: https://docs-assets.developer.apple.com/

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: [email protected]