Góc nhìn Anderson
NeRFocus: Đưa Kiểm Soát Tiêu Cự Nhẹ Nhàng Đến Các Trường Neural Radiance

Nghiên cứu mới từ Trung Quốc cung cấp một phương pháp để đạt được kiểm soát chi phí về hiệu ứng độ sâu trường cho các Trường Neural Radiance (NeRF), cho phép người dùng cuối điều chỉnh tiêu cự và thay đổi cấu hình của ống kính ảo trong không gian kết xuất.
Được đặt tên là NeRFocus, kỹ thuật này thực hiện một cách tiếp cận mới về ‘hình ảnh ống kính mỏng’ để điều khiển tiêu cự, và đổi mới P-training, một chiến lược đào tạo xác suất mà không cần các tập dữ liệu chuyên dụng về độ sâu trường, và đơn giản hóa quy trình đào tạo cho phép tiêu cự.

Bài báo này có tiêu đề NeRFocus: Trường Neural Radiance cho Defocus Tổng Hợp 3D, và đến từ bốn nhà nghiên cứu từ Trường Sĩ Quan Thượng Hải tại Đại học Bắc Kinh, và Phòng Thí Nghiệm Peng Cheng tại Thượng Hải, một viện được tài trợ bởi Chính phủ Tỉnh Quảng Đông.
Địa Chỉ Tiêu Cự Foveated trong NeRF
Nếu NeRF muốn trở thành một công nghệ lái xe hợp lệ cho thực tế ảo và thực tế tăng cường, nó sẽ cần một phương pháp nhẹ để cho phép kết xuất foveated thực tế, nơi hầu hết tài nguyên kết xuất tập trung xung quanh tầm nhìn của người dùng, chứ không phải được phân phối một cách không phân biệt với độ phân giải thấp hơn trên toàn bộ không gian hình ảnh có sẵn.

Từ bài báo năm 2021 Foveated Neural Radiance Fields for Real-Time and Egocentric Virtual Reality, chúng ta thấy tiêu cự trong một sơ đồ kết xuất foveated mới cho NeRF. Nguồn: https://arxiv.org/pdf/2103.16365.pdf
Một phần quan trọng của tính xác thực của các triển khai tương lai của egocentric NeRF sẽ là khả năng của hệ thống phản ánh khả năng của mắt người để chuyển đổi tiêu cự trên một mặt phẳng góc nhìn (xem hình đầu tiên trên).
Gradient tiêu cự này cũng là một chỉ số nhận thức về quy mô của cảnh; tầm nhìn từ một máy bay trực thăng bay trên một thành phố sẽ có không có trường tiêu cự có thể điều hướng, vì toàn bộ cảnh nằm ngoài khả năng tập trung ngoài cùng của người xem, trong khi việc kiểm tra một cảnh nhỏ hoặc ‘gần’ sẽ không chỉ cho phép ‘racking tiêu cự’, mà còn nên, vì tính thực tế, chứa một trường tiêu cự hẹp theo mặc định.
Dưới đây là một video trình diễn các khả năng ban đầu của NeRFocus, được cung cấp bởi tác giả tương ứng của bài báo:
Beyond Mặt Phẳng Tiêu Cự Hạn Chế
Nhận thức được các yêu cầu về kiểm soát tiêu cự, một số dự án NeRF trong những năm gần đây đã cung cấp các điều khoản cho nó, mặc dù tất cả các nỗ lực cho đến nay đều là các giải pháp thay thế một cách nào đó, hoặc đòi hỏi các quy trình hậu xử lý đáng kể khiến chúng không thể đóng góp cho các môi trường thời gian thực cuối cùng được hình dung cho các công nghệ Trường Neural Radiance.
Kiểm soát tiêu cự tổng hợp trong các khung kết xuất thần kinh đã được thử nghiệm bằng các phương pháp khác nhau trong khoảng 5-6 năm qua – ví dụ, bằng cách sử dụng một mạng phân đoạn để phân chia dữ liệu tiền cảnh và hậu cảnh, và sau đó để làm mờ hậu cảnh một cách chung chung – một giải pháp phổ biến cho các hiệu ứng tiêu cự hai mặt phẳng đơn giản.

Từ bài báo ‘Automatic Portrait Segmentation for Image Stylization’, một sự tách biệt mặt phẳng tiêu cự theo phong cách hoạt hình. Nguồn: https://jiaya.me/papers/portrait_eg16.pdf
Các biểu diễn đa mặt phẳng thêm một số ‘tấm hoạt hình ảo’ vào mô hình này, ví dụ bằng cách sử dụng ước tính độ sâu để cắt cảnh thành một gradient tiêu cự rời rạc nhưng có thể quản lý, và sau đó điều khiển các hạt nhân phụ thuộc vào độ sâu để tổng hợp độ mờ.
Ngoài ra, và rất liên quan đến các môi trường AR/VR tiềm năng, sự khác biệt giữa hai góc nhìn của một thiết lập máy ảnh stereo có thể được sử dụng như một đại diện cho độ sâu – một phương pháp được đề xuất bởi Google Research vào năm 2015.

Từ bài báo dẫn đầu bởi Google Fast Bilateral-Space Stereo for Synthetic Defocus, sự khác biệt giữa hai góc nhìn cung cấp một bản đồ độ sâu có thể tạo điều kiện cho việc làm mờ. Tuy nhiên, cách tiếp cận này không chính xác trong tình huống được hình dung ở trên, nơi ảnh được chụp rõ ràng với một ống kính 35-50mm (tiêu chuẩn SLR), nhưng sự làm mờ cực độ của hậu cảnh sẽ chỉ xảy ra với một ống kính vượt quá 200mm, có một mặt phẳng tiêu cự bị hạn chế nghiêm ngặt tạo ra trường tiêu cự hẹp trong môi trường bình thường, kích thước con người. Nguồn
Các cách tiếp cận này có xu hướng thể hiện các hiện tượng mép, vì chúng cố gắng đại diện cho hai quả cầu tiêu cự riêng biệt và bị giới hạn bởi mép như một gradient tiêu cự liên tục.
Vào năm 2021, sáng kiến RawNeRF đã cung cấp chức năng High Dynamic Range (HDR) với khả năng kiểm soát tốt hơn trong các tình huống ánh sáng yếu, và khả năng điều chỉnh tiêu cự ấn tượng:

RawNeRF điều chỉnh tiêu cự một cách đẹp (mặc dù trong trường hợp này, không chính xác do các mặt phẳng tiêu cự không thực tế), nhưng đi kèm với chi phí tính toán cao. Nguồn: https://bmild.github.io/rawnerf/
Tuy nhiên, RawNeRF đòi hỏi sự tiền xử lý tốn kém cho các biểu diễn đa mặt phẳng của NeRF được đào tạo, dẫn đến một quy trình làm việc không thể dễ dàng thích nghi với các triển khai NeRF nhẹ hơn hoặc thấp hơn.
Mô Hình Hóa Ống Kính Ảo
NeRF bản thân nó được dựa trên mô hình hình ảnh ống kính nhỏ, mà kết xuất toàn bộ cảnh một cách sắc nét giống như một cảnh CGI mặc định (trước khi các cách tiếp cận khác nhau kết xuất độ mờ như một hiệu ứng hậu xử lý hoặc nội tại dựa trên độ sâu trường).
NeRFocus tạo ra một ‘ống kính mỏng’ ảo (thay vì một ‘khẩu độ không kính’) mà tính toán đường dẫn của mỗi pixel đầu vào và kết xuất nó trực tiếp, hiệu quả là đảo ngược quá trình chụp ảnh tiêu chuẩn, hoạt động sau khi ánh sáng đầu vào đã bị ảnh hưởng bởi các tính chất khúc xạ của thiết kế ống kính.

Mô hình này giới thiệu một loạt các khả năng cho việc kết xuất nội dung bên trong hình nón (vòng tròn ảnh hưởng lớn nhất được mô tả trong hình ảnh trên).
Tính toán màu sắc và mật độ chính xác cho mỗi perceptron đa lớp (MLP) trong số các khả năng rộng lớn hơn này là một nhiệm vụ bổ sung. Điều này đã được giải quyết trước bằng cách áp dụng đào tạo giám sát cho một số lượng lớn hình ảnh DLSR, đòi hỏi việc tạo ra các tập dữ liệu bổ sung cho một quy trình đào tạo xác suất – hiệu quả liên quan đến việc chuẩn bị và lưu trữ các tài nguyên tính toán bổ sung có thể cần hoặc không cần.
NeRFocus vượt qua điều này bằng cách P-training, nơi các tập dữ liệu đào tạo được tạo ra dựa trên các hoạt động làm mờ cơ bản. Vì vậy, mô hình được hình thành với các hoạt động làm mờ nội tại và có thể điều hướng.

Đường kính khẩu độ được đặt thành zero trong quá trình đào tạo, và các xác suất định trước được sử dụng để chọn một hạt nhân làm mờ một cách ngẫu nhiên. Đường kính thu được này được sử dụng để tăng tỷ lệ đường kính của mỗi nón hợp thành, cho phép MLP dự đoán chính xác độ sáng và mật độ của các hình nón (các vòng tròn rộng trong hình ảnh trên, đại diện cho vùng chuyển đổi tối đa cho mỗi pixel)
Các tác giả của bài báo mới quan sát thấy rằng NeRFocus có khả năng tương thích với cách tiếp cận HDR của RawNeRF, điều này có thể giúp trong việc kết xuất một số phần khó khăn, chẳng hạn như các điểm nổi bật làm mờ và nhiều hiệu ứng tính toán khác mà đã thách thức các quy trình CGI trong ba mươi năm hoặc hơn.
Quá trình này không đòi hỏi các yêu cầu bổ sung về thời gian và/hoặc tham số so với các cách tiếp cận trước đó như NeRF cốt lõi và Mip-NeRF (và, theo giả định, Mip-NeRF 360, mặc dù điều này không được đề cập trong bài báo), và có thể áp dụng như một phần mở rộng chung cho phương pháp luận trung tâm của các trường neural radiance.
Được xuất bản lần đầu vào ngày 12 tháng 3 năm 2022.












