Sudut Anderson

Rendering Neural: NeRF Berjalan di Udara Segar

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Sebuah kolaborasi antara Google Research dan Harvard University telah mengembangkan metode baru untuk membuat video neural 360‑derajat dari adegan lengkap menggunakan Neural Radiance Fields (NeRF). Pendekatan baru ini membawa NeRF selangkah lebih dekat ke penggunaan abstrak kasual di lingkungan apa pun, tanpa dibatasi pada model tabletop atau skenario interior tertutup.

Source: https://www.youtube.com/watch?v=zBSH-k9GbV4

Lihat akhir artikel untuk video lengkap. Sumber: https://www.youtube.com/watch?v=zBSH-k9GbV4

Mip-NeRF 360 dapat menangani latar belakang yang luas dan objek ‘tak terbatas’ seperti langit, karena, tidak seperti kebanyakan iterasi sebelumnya, ia menetapkan batas pada cara sinar cahaya ditafsirkan, dan menciptakan batas perhatian yang menjustifikasi waktu pelatihan yang lama. Lihat video pendamping baru yang disematkan di akhir artikel ini untuk contoh lebih lanjut, serta wawasan mendalam tentang prosesnya.

Makalah baru berjudul Mip-NeRF 360: Unbounded Anti-Aliased Neural Radiance Fields, dan dipimpin oleh Senior Staff Research Scientist di Google Research, Jon Barron.

Untuk memahami terobosan ini, diperlukan pemahaman dasar tentang cara kerja sintesis gambar berbasis neural radiance field.

Apa itu NeRF?

Sulit untuk mendeskripsikan jaringan NeRF dalam istilah ‘video’, karena ia lebih mendekati lingkungan virtual yang sepenuhnya 3D namun berbasis AI, di mana banyak sudut pandang dari foto tunggal (termasuk frame video) digunakan untuk merajut sebuah adegan yang secara teknis hanya ada di ruang laten algoritma pembelajaran mesin – namun dari situ dapat diekstrak sejumlah besar sudut pandang dan video sesuka hati.

A depiction of the multiple camera capture points that provide the data which NeRF assembles into a neural scene (pictured right).

Sebuah gambaran tentang banyak titik penangkapan kamera yang menyediakan data yang dirakit NeRF menjadi sebuah adegan neural (gambar kanan).

Informasi yang dihasilkan dari foto-foto kontribusi dilatih menjadi sebuah matriks yang mirip dengan voxel grid tradisional dalam alur kerja CGI, di mana setiap titik dalam ruang 3D memiliki nilai, sehingga adegan dapat dinavigasi.

A traditional voxel matrix places pixel information (which normally exists in a 2D context, such as the pixel grid of a JPEG file) into a three-dimensional space. Source: https://www.researchgate.net/publication/344488704_Processing_and_analysis_of_airborne_full-waveform_laser_scanning_data_for_the_characterization_of_forest_structure_and_fuel_properties

Matriks voxel tradisional menempatkan informasi piksel (yang biasanya ada dalam konteks 2D, seperti grid piksel file JPEG) ke dalam ruang tiga dimensi. Sumber: ResearchGate

Setelah menghitung ruang antar foto (jika diperlukan), jalur setiap piksel potensial dari setiap foto kontribusi secara efektif ‘ray-traced’ dan diberikan nilai warna, termasuk nilai transparansi (tanpa nilai ini matriks neural akan sepenuhnya tidak tembus pandang, atau sepenuhnya kosong).

Seperti voxel grid, dan tidak seperti ruang koordinat 3D berbasis CGI, ‘interior’ dari objek ‘tertutup’ tidak ada dalam matriks NeRF. Anda dapat membuka drum kit CGI dan melihat di dalamnya, jika mau; tetapi bagi NeRF, keberadaan drum kit berakhir ketika nilai opasitas permukaannya menjadi ‘1’.

Pandangan Lebih Luas tentang Piksel

Mip-NeRF 360 adalah perpanjangan dari penelitian dari Maret 2021, yang secara efektif memperkenalkan anti-aliasing efisien ke NeRF tanpa supersampling yang berlebihan.

NeRF secara tradisional menghitung hanya satu jalur piksel, yang cenderung menghasilkan jenis ‘jaggies’ yang menjadi ciri format gambar internet awal, serta sistem game sebelumnya. Tepi bergerigi ini diselesaikan dengan berbagai metode, biasanya melibatkan sampling piksel tetangga dan menemukan representasi rata-rata.

Karena NeRF tradisional hanya mensampling satu jalur piksel tersebut, Mip-NeRF memperkenalkan area penangkapan ‘konikal’, seperti senter berbalik lebar, yang memberikan cukup informasi tentang piksel tetangga untuk menghasilkan anti-aliasing ekonomis dengan detail yang lebih baik.

The conical cone catchment that Mip-NeRF uses is sliced up into conical frustums (below), which is further 'blurred' to represent a vaguer Gaussian space that can be used to calculate the accuracy and aliasing of a pixel. Source: https://www.youtube.com/watch?v=EpH175PY1A0

Penangkapan kerucut konikal yang digunakan Mip-NeRF dipotong menjadi frustum konikal (gambar bawah), yang selanjutnya ‘diburamkan’ untuk menciptakan ruang Gaussian samar yang dapat digunakan menghitung akurasi dan aliasing sebuah piksel. Sumber: https://www.youtube.com/watch?v=EpH175PY1A0

Peningkatan dibandingkan implementasi NeRF standar sangat terlihat:

Mip-NeRF (right), released in Maret 2021, provides improved detail through a more comprehensive but economical aliasing pipeline, rather than just 'blurring' pixels to avoid jagged edges. Source: https://jonbarron.info/mipnerf/

Mip-NeRF (kanan), dirilis pada Maret 2021, memberikan detail yang lebih baik melalui pipeline aliasing yang lebih komprehensif namun ekonomis, alih-alih sekadar ‘memburamkan’ piksel untuk menghindari tepi bergerigi. Sumber: https://jonbarron.info/mipnerf/

NeRF Tak Terbatas

Makalah Maret meninggalkan tiga masalah yang belum terpecahkan terkait penggunaan Mip-NeRF dalam lingkungan tak terbatas yang mungkin mencakup objek sangat jauh, termasuk langit. Makalah baru menyelesaikannya dengan menerapkan warp bergaya Kalman pada Gaussian Mip-NeRF.

Kedua, adegan yang lebih besar membutuhkan daya pemrosesan lebih tinggi dan waktu pelatihan yang lebih lama, yang Mip-NeRF 360 selesaikan dengan ‘menyaring’ geometri adegan menggunakan multi-layer perceptron (MLP) kecil ‘proposal’, yang mempre-batas geometri yang diprediksi oleh MLP NeRF standar yang besar. Ini mempercepat pelatihan tiga kali lipat.

Terakhir, adegan yang lebih besar cenderung membuat diskritisasi geometri yang ditafsirkan menjadi ambigu, menghasilkan jenis artefak yang mungkin dikenal gamer ketika output game ‘robek’. Makalah baru mengatasinya dengan membuat regularizer baru untuk interval sinar Mip-NeRF.

On the right, we see unwanted artifacts in Mip-NeRF due to the difficulty in bounding such a large scene. On the left, we see that the new regularizer has optimized the scene well enough to remove these disturbances.

Di kanan, terlihat artefak yang tidak diinginkan pada Mip-NeRF karena kesulitan dalam membatasi adegan yang begitu besar. Di kiri, terlihat regularizer baru telah mengoptimalkan adegan cukup baik untuk menghilangkan gangguan tersebut.

Untuk mengetahui lebih lanjut tentang makalah baru, tonton video di bawah, serta video pengantar Maret 2021 tentang Mip-NeRF. Anda juga dapat mempelajari lebih lanjut tentang riset NeRF dengan melihat liputan kami sejauh ini.

Awalnya dipublikasikan 25 November 2021
21 Desember 2021, 12:25pm – Video mati diganti. – MA

Penulis tentang pembelajaran mesin, spesialis domain dalam sintesis gambar manusia. Mantan kepala konten riset di Metaphysic.ai, hingga dibubarkannya menjadi Brahma.ai milik DNEG.
Website: martinanderson.ai
Kontak: martin@martinanderson.ai