Погляд Anderson

Нейронне рендеринг: NeRF робить прогулянку на свіжому повітрі

mm
Додайте Unite.AI до бажаних джерел у Google

Колаборація між Google Research та Гарвардським університетом розробила новий метод створення 360-градусного нейронного відео повних сцен за допомогою Нейронних радіаційних полів (NeRF). Цей новий підхід робить NeRF ще ближчим до повсякденного абстрактного використання в будь-якому середовищі, без обмежень до моделей на столі або закритих інтер’єрних сцен.

Джерело: https://www.youtube.com/watch?v=YStDS2-Ln1s

Перегляньте повне відео в кінці статті. Джерело: https://www.youtube.com/watch?v=YStDS2-Ln1s

Mip-NeRF 360 може обробляти розширені фони та «безкінечні» об’єкти, такі як небо, оскільки, на відміну від більшості попередніх ітерацій, він встановлює обмеження на інтерпретацію променів світла та створює межі уваги, які раціоналізують тривалі часи навчання. Перегляньте нове супровідне відео, вкладене в кінці цієї статті, для отримання більшої кількості прикладів та розширеної інформації про процес.

Нова робота стаття називається Mip-NeRF 360: Безмежні антиаліасовані нейронні радіаційні поля та очолюється старшим науковим співробітником Google Research Джоном Барроном.

Щоб зрозуміти прорив, необхідно мати базове розуміння того, як функціонує синтез зображень на основі нейронних радіаційних полів.

Що таке NeRF?

Це проблематично описувати мережу NeRF у термінах «відео», оскільки це ближче до повністю тривимірної, але основаної на штучному інтелекті віртуальної середовищі, де 여러 точки зору з одного фото (включно з кадрами відео) використовуються для створення сцени, яка технічно існує лише в латентному просторі алгоритму машинного навчання – але з якої можна витягнути надзвичайну кількість точок зору та відео за бажанням.

Зображення декількох точок захоплення камери, які забезпечують дані, які NeRF збирає в нейронну сцену (зображено праворуч).

Зображення декількох точок захоплення камери, які забезпечують дані, які NeRF збирає в нейронну сцену (зображено праворуч).

Інформація, отримана з фотографій, навчається в матриці, схожій на традиційну voxel grid у потоках CGI, оскільки кожна точка в тривимірному просторі отримує значення, що робить сцену навігаційною.

Традиційна voxel матриця розміщує інформацію пікселів (яка зазвичай існує в двовимірному контексті, наприклад, у вигляді сітки пікселів файлу JPEG) у тривимірному просторі. Джерело: https://www.researchgate.net/publication/344488704_Processing_and_analysis_of_airborne_full-waveform_laser_scanning_data_for_the_characterization_of_forest_structure_and_fuel_properties

Традиційна voxel матриця розміщує інформацію пікселів (яка зазвичай існує в двовимірному контексті, наприклад, у вигляді сітки пікселів файлу JPEG) у тривимірному просторі. Джерело: ResearchGate

Після розрахунку проміжного простору між фотографіями (якщо необхідно), шлях кожного можливого пікселя кожної фотографії ефективно «відслідковується» та отримує значення кольору, включаючи значення прозорості (без якого нейронна матриця була б повністю непрозорою чи повністю порожньою).

Як і voxel grid, і на відміну від простору 3D-координат на основі CGI, «внутрішня» частина «закритого» об’єкта не існує в матриці NeRF. Ви можете розрізати барабанний набір CGI та подивитися всередину, якщо хочете; але що стосується NeRF, існування барабанного набору закінчується, коли значення непрозорості його поверхні дорівнює «1».

Ширший погляд на піксель

Mip-NeRF 360 є розширенням дослідження з березня 2021 року, яке ефективно ввело ефективне антиаліасинг у NeRF без вичерпного суперсемплінгу.

Традиційний NeRF розраховуємо лише один шлях пікселя, який схильний виробляти такі «шуми», які характеризували ранні інтернет-формати зображень, а також ранні ігрові системи. Ці шуми були вирішені різними методами, зазвичай включаючи вибірку сусідніх пікселів та знаходження середнього представлення.

Оскільки традиційний NeRF вибірково обробляє лише один шлях пікселя, Mip-NeRF ввела «конічний» приймач, подібний до широкопроменевого прожектора, який забезпечує достатньо інформації про сусідні пікселі для отримання економічного антиаліасингу з покращеною деталізацією.

Конічний приймач, який використовує Mip-NeRF, розрізаний на конічні фрусти (нижнє зображення), який далі «розмитий», щоб представити нечіткий гаусівський простір, який можна використовувати для розрахунку точності та антиаліасингу пікселя. Джерело: https://www.youtube.com/watch?v=EpH175PY1A0

Конічний приймач, який використовує Mip-NeRF, розрізаний на конічні фрусти (нижнє зображення), який далі «розмитий», щоб представити нечіткий гаусівський простір, який можна використовувати для розрахунку точності та антиаліасингу пікселя. Джерело: https://www.youtube.com/watch?v=EpH175PY1A0

Покращення над стандартною реалізацією NeRF було помітним:

Mip-NeRF (праворуч), випущений у березні 2021 року, забезпечує покращену деталізацію завдяки більш повному, але економічному антиаліасинговому потоку, а не просто «розмиттю» пікселів, щоб уникнути шумів. Джерело: https://jonbarron.info/mipnerf/

Mip-NeRF (праворуч), випущений у березні 2021 року, забезпечує покращену деталізацію завдяки більш повному, але економічному антиаліасинговому потоку, а не просто «розмиттю» пікселів, щоб уникнути шумів. Джерело: https://jonbarron.info/mipnerf/

NeRF Безмежний

Стаття березня залишила три нерозв’язані проблеми щодо використання Mip-NeRF у безмежних середовищах, які можуть включати дуже віддалені об’єкти, включаючи небо. Нова робота вирішує це, застосовуючи кальманівський перетворення до гаусівських розподілів Mip-NeRF.

Другою проблемою є те, що більші сцени вимагають більшої обчислювальної потужності та триваліших часів навчання, які Mip-NeRF 360 вирішує, «відстоюючи» геометрію сцени за допомогою малих «пропозиційних» багатошарових перцептронів (MLP), які попередньо обмежують геометрію, передбачену великим стандартним NeRF MLP. Це прискорює навчання у три рази.

Нарешті, більші сцени схильні зробити дискретизацію інтерпретованої геометрії неоднозначною, що призводить до такого типу артефактів, з якими можуть бути знайомі геймери, коли вивід гри «розривається». Нова робота вирішує це, створюючи новий регулятор для інтервалів променів Mip-NeRF.

Зліва ми бачимо небажані артефакти в Mip-NeRF через труднощі у обмеженні такої великої сцени. Праворуч ми бачимо, що новий регулятор оптимізував сцену досить добре, щоб видалити ці порушення.

Зліва ми бачимо небажані артефакти в Mip-NeRF через труднощі у обмеженні такої великої сцени. Праворуч ми бачимо, що новий регулятор оптимізував сцену досить добре, щоб видалити ці порушення.

Щоб дізнатися більше про нову роботу, перегляньте відео нижче, а також відео-інтродукцію березня 2021 року до Mip-NeRF. Ви також можете дізнатися більше про дослідження NeRF, переглянувши нашу висвітлення на сьогодні.

Опубліковано 25 листопада 2021 року
21 грудня 2021 року, 12:25 – Замінено мертве відео. – MA

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai