Góc nhìn Anderson

Kết Xuất Neural: NeRF Tản Bộ Trong Không Khí Tươi

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Một sự hợp tác giữa Google Research và Đại học Harvard đã phát triển một phương pháp mới để tạo video neural 360 độ của các cảnh hoàn chỉnh bằng cách sử dụng Neural Radiance Fields (NeRF). Cách tiếp cận mới này đưa NeRF tiến một bước gần hơn tới việc sử dụng trừu tượng một cách thông thường trong bất kỳ môi trường nào, mà không bị giới hạn ở các mô hình trên bàn hoặc các kịch bản nội thất đóng kín.

Source: https://www.youtube.com/watch?v=zBSH-k9GbV4

Xem cuối bài viết để xem video đầy đủ. Nguồn: https://www.youtube.com/watch?v=zBSH-k9GbV4

Mip-NeRF 360 có thể xử lý nền mở rộng và các đối tượng ‘vô hạn’ như bầu trời, vì khác với hầu hết các phiên bản trước, nó đặt giới hạn cho cách các tia sáng được diễn giải, và tạo ra các ranh giới chú ý giúp hợp lý hoá thời gian huấn luyện kéo dài. Xem video mới kèm theo được nhúng ở cuối bài viết này để xem thêm ví dụ và hiểu sâu hơn về quy trình.

Bài báo mới có tiêu đề Mip-NeRF 360: Unbounded Anti-Aliased Neural Radiance Fields, và do Senior Staff Research Scientist tại Google Research Jon Barron dẫn dắt.

Để hiểu được bước đột phá này, cần có một hiểu biết cơ bản về cách hoạt động của việc tổng hợp hình ảnh dựa trên trường phát xạ neural.

NeRF là gì?

Thật khó để mô tả một mạng NeRF dưới dạng một ‘video’, vì nó gần hơn với một môi trường ảo được hiện thực hoá đầy đủ 3D nhưng dựa trên AI, nơi nhiều góc nhìn từ các bức ảnh đơn (bao gồm các khung video) được dùng để ghép lại một cảnh mà về mặt kỹ thuật chỉ tồn tại trong không gian tiềm ẩn của thuật toán học máy – nhưng từ đó có thể trích xuất một số lượng khổng lồ các góc nhìn và video theo ý muốn.

A depiction of the multiple camera capture points that provide the data which NeRF assembles into a neural scene (pictured right).

Một mô tả về các điểm chụp camera đa dạng cung cấp dữ liệu mà NeRF lắp ráp thành một cảnh neural (hình bên phải).

Thông tin thu được từ các ảnh đóng góp được huấn luyện thành một ma trận tương tự như lưới voxel truyền thống trong quy trình CGI, ở chỗ mỗi điểm trong không gian 3D đều có một giá trị, cho phép di chuyển trong cảnh.

A traditional voxel matrix places pixel information (which normally exists in a 2D context, such as the pixel grid of a JPEG file) into a three-dimensional space. Source: https://www.researchgate.net/publication/344488704_Processing_and_analysis_of_airborne_full-waveform_laser_scanning_data_for_the_characterization_of_forest_structure_and_fuel_properties

Một ma trận voxel truyền thống đặt thông tin pixel (thường tồn tại trong ngữ cảnh 2D, như lưới pixel của tệp JPEG) vào không gian ba chiều. Nguồn: https://www.researchgate.net/publication/344488704_Processing_and_analysis_of_airborne_full-waveform_laser_scanning_data_for_the_characterization_of_forest_structure_and_fuel_properties

Sau khi tính toán không gian xen kẽ giữa các ảnh (nếu cần), đường đi của mỗi pixel khả thi của mỗi ảnh đóng góp được thực chất ‘theo tia’ và gán một giá trị màu, bao gồm cả giá trị độ trong suốt (nếu không có, ma trận neural sẽ hoàn toàn mờ đục hoặc hoàn toàn trống rỗng).

Giống như lưới voxel, và không giống không gian tọa độ 3D dựa trên CGI, ‘bên trong’ của một vật thể ‘đóng kín’ không tồn tại trong ma trận NeRF. Bạn có thể mở một bộ trống CGI và nhìn bên trong nếu muốn; nhưng đối với NeRF, sự tồn tại của bộ trống kết thúc khi giá trị độ mờ của bề mặt nó bằng ‘1’.

Một Góc Nhìn Rộng Hơn của Một Pixel

Mip-NeRF 360 là một mở rộng của nghiên cứu từ tháng 3 năm 2021, thực tế đã giới thiệu kỹ thuật chống răng cưa hiệu quả cho NeRF mà không cần siêu mẫu hoá tốn kém.

NeRF truyền thống chỉ tính một đường đi của pixel duy nhất, điều này dễ gây ra loại ‘jaggies’ đặc trưng cho các định dạng hình ảnh internet đầu thời, cũng như các hệ thống trò chơi trước đây. Những cạnh răng cưa này đã được giải quyết bằng nhiều phương pháp, thường là lấy mẫu các pixel lân cận và tìm đại diện trung bình.

Vì NeRF truyền thống chỉ lấy mẫu một đường đi pixel duy nhất, Mip-NeRF đã giới thiệu một vùng thu thập ‘hình nón’, giống như một đèn pha chùm rộng, cung cấp đủ thông tin về các pixel gần kề để tạo ra chống răng cưa kinh tế với chi tiết được cải thiện.

The conical cone catchment that Mip-NeRF uses is sliced up into conical frustums (below), which is further 'blurred' to represent a vaguer Gaussian space that can be used to calculate the accuracy and aliasing of a pixel. Source: https://www.youtube.com/watch?v=EpH175PY1A0

Vùng thu thập hình nón mà Mip-NeRF sử dụng được cắt thành các khối nón (bên dưới), sau đó được ‘mờ’ hơn để đại diện cho một không gian Gaussian mờ hơn có thể dùng để tính độ chính xác và hiện tượng răng cưa của một pixel. Nguồn: https://www.youtube.com/watch?v=EpH175PY1A0

Sự cải tiến so với triển khai NeRF tiêu chuẩn là đáng chú ý:

Mip-NeRF (right), released in tháng 3 2021, provides improved detail through a more comprehensive but economical aliasing pipeline, rather than just 'blurring' pixels to avoid jagged edges. Source: https://jonbarron.info/mipnerf/

Mip-NeRF (bên phải), phát hành vào tháng 3 năm 2021, cung cấp chi tiết cải thiện thông qua một quy trình chống răng cưa toàn diện nhưng kinh tế hơn, thay vì chỉ ‘làm mờ’ các pixel để tránh các cạnh răng cưa. Nguồn: https://jonbarron.info/mipnerf/

NeRF Không Giới Hạn

Bài báo tháng Ba đã để lại ba vấn đề chưa được giải quyết liên quan đến việc sử dụng Mip-NeRF trong môi trường không giới hạn có thể bao gồm các đối tượng rất xa, bao gồm cả bầu trời. Bài báo mới giải quyết vấn đề này bằng cách áp dụng một phép biến dạng kiểu Kalman lên các Gaussian của Mip-NeRF.

Thứ hai, các cảnh lớn hơn đòi hỏi sức mạnh xử lý cao hơn và thời gian huấn luyện kéo dài, điều mà Mip-NeRF 360 giải quyết bằng cách ‘tinh chế’ hình học cảnh với một ‘đề xuất’ nhỏ mạng perceptron đa lớp (MLP), trước khi giới hạn hình học do một MLP NeRF tiêu chuẩn lớn dự đoán. Điều này tăng tốc độ huấn luyện gấp ba lần.

Cuối cùng, các cảnh lớn hơn thường làm cho việc rời rạc hoá hình học được diễn giải trở nên mơ hồ, dẫn đến các hiện tượng lỗi mà các game thủ có thể quen thuộc khi đầu ra trò chơi ‘rách’. Bài báo mới giải quyết vấn đề này bằng cách tạo ra một bộ chuẩn hoá mới cho các khoảng thời gian tia của Mip-NeRF.

On the right, we see unwanted artifacts in Mip-NeRF due to the difficulty in bounding such a large scene. On the left, we see that the new regularizer has optimized the scene well enough to remove these disturbances.

Bên phải, chúng ta thấy các lỗi không mong muốn trong Mip-NeRF do khó khăn trong việc giới hạn một cảnh lớn như vậy. Bên trái, chúng ta thấy bộ chuẩn hoá mới đã tối ưu cảnh đủ để loại bỏ những nhiễu này.

Để tìm hiểu thêm về bài báo mới, hãy xem video dưới đây, và cũng xem video giới thiệu tháng 3 năm 2021 về Mip-NeRF. Bạn cũng có thể tìm hiểu thêm về nghiên cứu NeRF bằng cách xem các bài viết của chúng tôi cho đến nay.

Được xuất bản lần đầu vào ngày 25 tháng 11 năm 2021
21 tháng 12 năm 2021, 12:25pm – Đã thay thế video chết. – MA

Nhà viết về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng bộ phận nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó sáp nhập vào Brahma.ai của DNEG.
Website: martinanderson.ai
Contact: martin@martinanderson.ai