Góc nhìn Anderson
Rendering thần kinh: NeRF Takes a Walk in the Fresh Air

Sự hợp tác giữa Google Research và Harvard University đã phát triển một phương pháp mới để tạo ra video thần kinh 360 độ của các cảnh hoàn chỉnh bằng cách sử dụng Neural Radiance Fields (NeRF). Phương pháp mới này đưa NeRF gần hơn với việc sử dụng trừu tượng thông thường trong bất kỳ môi trường nào, mà không bị giới hạn bởi mô hình bàn hoặc cảnh nội thất đóng.

Xem video đầy đủ ở cuối bài viết. Nguồn: https://www.youtube.com/watch?v=YStDS2-Ln1s
Mip-NeRF 360 có thể xử lý các nền tảng mở rộng và các vật thể ‘vô tận’ như bầu trời, vì, không giống như hầu hết các phiên bản trước, nó đặt giới hạn cách ánh sáng được giải thích và tạo ra các ranh giới chú ý giúp giảm thời gian đào tạo.
Bài báo mới có tiêu đề Mip-NeRF 360: Unbounded Anti-Aliased Neural Radiance Fields, và được dẫn dắt bởi Senior Staff Research Scientist tại Google Research Jon Barron.
Để hiểu được đột phá này, cần phải có kiến thức cơ bản về cách tổng hợp hình ảnh dựa trên trường bức xạ thần kinh hoạt động.
NeRF là gì?
Thật khó để mô tả một mạng NeRF theo nghĩa của một ‘video’, vì nó gần giống với một môi trường ảo 3D hoàn chỉnh nhưng dựa trên AI, nơi nhiều góc nhìn từ các bức ảnh đơn (bao gồm cả khung hình video) được sử dụng để khâu lại một cảnh mà về mặt kỹ thuật chỉ tồn tại trong không gian tiềm ẩn của một thuật toán học máy – nhưng từ đó có thể trích xuất một số lượng lớn góc nhìn và video theo ý muốn.

Một hình ảnh về các điểm chụp ảnh đa giác cung cấp dữ liệu mà NeRF lắp ráp thành một cảnh thần kinh (hình bên phải).
Thông tin được rút ra từ các bức ảnh đóng góp được đào tạo vào một ma trận tương tự như một lưới voxel truyền thống trong các công việc CGI, nơi mỗi điểm trong không gian 3D kết thúc với một giá trị, làm cho cảnh trở nên có thể điều hướng.

Một ma trận voxel truyền thống đặt thông tin pixel (thường tồn tại trong một ngữ cảnh 2D, như lưới pixel của một tệp JPEG) vào một không gian ba chiều. Nguồn: ResearchGate
Sau khi tính toán không gian giữa các bức ảnh (nếu cần), đường đi của mỗi pixel có thể của mỗi bức ảnh đóng góp được hiệu chỉnh và gán một giá trị màu, bao gồm cả giá trị trong suốt (không có đó, ma trận thần kinh sẽ hoàn toàn không trong suốt hoặc hoàn toàn trống).
Giống như lưới voxel, và khác với không gian 3D dựa trên CGI, ‘bên trong’ của một vật thể ‘đóng’ không tồn tại trong một ma trận NeRF. Bạn có thể mở một bộ trống CGI và nhìn vào bên trong, nhưng đối với NeRF, sự tồn tại của bộ trống kết thúc khi giá trị không trong suốt của bề mặt bằng ‘1’.
Một góc nhìn rộng hơn về một pixel
Mip-NeRF 360 là một phần mở rộng của nghiên cứu từ tháng 3 năm 2021, đã giới thiệu hiệu quả chống aliasing cho NeRF mà không cần lấy mẫu quá mức.
NeRF truyền thống chỉ tính toán một đường đi pixel, điều này có xu hướng tạo ra loại ‘jaggies’ đã đặc trưng cho các định dạng hình ảnh internet sớm, cũng như các hệ thống trò chơi trước. Những cạnh nhám này được giải quyết bằng các phương pháp khác nhau, thường liên quan đến việc lấy mẫu các pixel lân cận và tìm một đại diện trung bình.
Vì NeRF truyền thống chỉ lấy mẫu một đường đi pixel, Mip-NeRF đã giới thiệu một khu vực thu ‘nón’ rộng, như một chiếc đèn pin rộng, cung cấp đủ thông tin về pixel lân cận để tạo ra chống aliasing kinh tế với chi tiết cải thiện.

Khu vực thu ‘nón’ của Mip-NeRF được cắt thành các hình nón (hình dưới), được ‘làm mờ’ thêm để tạo ra không gian Gaussian mơ hồ có thể được sử dụng để tính toán độ chính xác và aliasing của một pixel. Nguồn: https://www.youtube.com/watch?v=EpH175PY1A0
Cải thiện so với triển khai NeRF tiêu chuẩn là đáng chú ý:

Mip-NeRF (phải), phát hành vào tháng 3 năm 2021, cung cấp chi tiết cải thiện thông qua một đường ống chống aliasing toàn diện nhưng kinh tế hơn, thay vì chỉ ‘làm mờ’ pixel để tránh các cạnh nhám. Nguồn: https://jonbarron.info/mipnerf/
NeRF Không giới hạn
Bài báo tháng 3 để lại ba vấn đề chưa được giải quyết liên quan đến việc sử dụng Mip-NeRF trong các môi trường không giới hạn có thể bao gồm các vật thể rất xa, bao gồm cả bầu trời. Bài báo mới giải quyết vấn đề này bằng cách áp dụng một phương pháp Kalman cho các Gaussian của Mip-NeRF.
Thứ hai, các cảnh lớn hơn đòi hỏi nhiều sức mạnh xử lý và thời gian đào tạo kéo dài, điều mà Mip-NeRF 360 giải quyết bằng cách ‘chưng cất’ hình học cảnh với một mạng nơ-ron đa lớp nhỏ (MLP), giúp dự đoán hình học được dự đoán bởi một NeRF MLP tiêu chuẩn. Điều này làm giảm thời gian đào tạo xuống ba lần.
Cuối cùng, các cảnh lớn hơn có xu hướng làm cho việc rời rạc hóa hình học được giải thích trở nên mơ hồ, dẫn đến các hiện tượng mà các game thủ có thể quen thuộc khi đầu ra ‘vỡ’. Bài báo mới giải quyết vấn đề này bằng cách tạo ra một bộ điều chỉnh mới cho các khoảng thời gian tia của Mip-NeRF.

Ở bên phải, chúng ta thấy các hiện tượng không mong muốn trong Mip-NeRF do khó khăn trong việc giới hạn một cảnh lớn như vậy. Ở bên trái, chúng ta thấy rằng bộ điều chỉnh mới đã tối ưu hóa cảnh đủ tốt để loại bỏ những xáo trộn này.
Để tìm hiểu thêm về bài báo mới, hãy xem video dưới đây, cũng như video giới thiệu Mip-NeRF vào tháng 3 năm 2021. Bạn cũng có thể tìm hiểu thêm về nghiên cứu NeRF bằng cách xem phần giới thiệu của chúng tôi cho đến nay.
Được xuất bản lần đầu vào ngày 25 tháng 11 năm 2021
21 tháng 12 năm 2021, 12:25 chiều – Thay thế video đã chết. – MA










