Góc nhìn Anderson

Tái chiếu sáng các trường Neural Radiance với bất kỳ bản đồ môi trường nào

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Một bài báo mới từ Viện Max Planck và MIT đã đề xuất một kỹ thuật để đạt được sự tách rời thực sự của nội dung trường Neural Radiance Fields (NeRF) khỏi ánh sáng hiện diện khi dữ liệu được thu thập, cho phép ad hoc bản đồ môi trường hoàn toàn thay thế ánh sáng trong một cảnh NeRF:

Kỹ thuật mới được áp dụng cho dữ liệu thực. Điều đáng chú ý là phương pháp này hoạt động ngay cả trên dữ liệu lưu trữ của loại này, không tính đến đường ống mới khi dữ liệu được thu thập. Mặc dù vậy, kiểm soát ánh sáng thực tế và theo chỉ định của người dùng vẫn được đạt được.

Kỹ thuật mới được áp dụng cho dữ liệu thực. Điều đáng chú ý là phương pháp này hoạt động ngay cả trên dữ liệu lưu trữ của loại này, không tính đến đường ống mới khi dữ liệu được thu thập. Mặc dù vậy, kiểm soát ánh sáng thực tế và theo chỉ định của người dùng vẫn được đạt được. Nguồn: https://arxiv.org/pdf/2207.13607.pdf

Phương pháp mới sử dụng chương trình hoạt hình 3D mã nguồn mở phổ biến Blender để tạo một ‘sân khấu ánh sáng ảo’, nơi nhiều lần lặp của các kịch bản ánh sáng có thể được kết xuất và cuối cùng được đào tạo vào một lớp đặc biệt trong mô hình NeRF có thể chứa bất kỳ bản đồ môi trường nào mà người dùng muốn sử dụng để chiếu sáng cảnh.

Một hình ảnh của phần đường ống tận dụng Blender để tạo ra các cảnh ảo của hình học được trích xuất. Các phương pháp trước đây theo các dòng tương tự đã sử dụng các sân khấu ánh sáng thực để cung cấp dữ liệu này, điều này là một yêu cầu khó khăn đối với các đối tượng rời rạc và không thể đối với các cảnh quan ngoài trời. Ở phía trên bên trái của hai hình ảnh bên phải, chúng ta có thể thấy các bản đồ môi trường quy định ánh sáng của cảnh. Những bản đồ này có thể được tạo một cách tùy ý bởi người dùng cuối, mang NeRF đến gần hơn với sự linh hoạt của một phương pháp CGI hiện đại.

Một hình ảnh của phần đường ống tận dụng Blender để tạo ra các cảnh ảo của hình học được trích xuất. Các phương pháp trước đây theo các dòng tương tự đã sử dụng các sân khấu ánh sáng thực để cung cấp dữ liệu này, điều này là một yêu cầu khó khăn đối với các đối tượng rời rạc và không thể đối với các cảnh quan ngoài trời. Ở phía trên bên trái của hai hình ảnh bên phải, chúng ta có thể thấy các bản đồ môi trường quy định ánh sáng của cảnh. Những bản đồ này có thể được tạo một cách tùy ý bởi người dùng cuối, mang NeRF đến gần hơn với sự linh hoạt của một phương pháp CGI hiện đại.

Phương pháp này đã được thử nghiệm chống lại khung khổ ngược Mitsuba2 và cũng chống lại các công việc trước đây PhySG, RNR, Neural-PILNeRFactor, chỉ sử dụng một mô hình chiếu sáng trực tiếp và đạt được điểm số tốt nhất:

Kết quả của kỹ thuật mới, so sánh với các phương pháp tương đương dưới các hàm mất mát khác nhau. Các nhà nghiên cứu cho rằng phương pháp của họ mang lại phương pháp chất lượng cao nhất, với kết quả được đánh giá thông qua Tỷ lệ tín hiệu trên tiếng ồn đỉnh (PSNR), Chỉ số đo lường sự tương似 về cấu trúc (SSIM) và sự tương đồng về hình ảnh được học theo cảm nhận (LPIPS) hiệu quả nếu không chính xác.

Kết quả của kỹ thuật mới, so sánh với các phương pháp tương đương dưới các hàm mất mát khác nhau. Các nhà nghiên cứu cho rằng phương pháp của họ mang lại phương pháp chất lượng cao nhất, với kết quả được đánh giá thông qua Tỷ lệ tín hiệu trên tiếng ồn đỉnh (PSNR), Chỉ số đo lường sự tương似 về cấu trúc (SSIM) và sự tương đồng về hình ảnh được học theo cảm nhận (LPIPS) hiệu quả nếu không chính xác.

Bài báo cho biết:

‘Kết quả định lượng và định tính của chúng tôi chứng minh một bước tiến rõ ràng trong việc thu hồi các tham số cảnh cũng như chất lượng tổng hợp của phương pháp của chúng tôi dưới các góc nhìn và điều kiện ánh sáng mới so với trạng thái hiện tại của nghệ thuật.’

Các nhà nghiên cứu cho biết họ sẽ sớm phát hành mã cho dự án.

Sự cần thiết của tính chỉnh sửa NeRF

Loại tách rời này đã chứng minh là một thách thức đáng kể cho các nhà nghiên cứu về trường Neural Radiance Fields, vì NeRF cơ bản là một kỹ thuật photogrammetry tính toán giá trị pixel của hàng nghìn đường dẫn có thể từ một điểm nhìn, gán giá trị RGBD và lắp ráp một ma trận của các giá trị này thành một biểu diễn thể tích. Về cốt lõi, NeRF được định nghĩa bởi ánh sáng.

Trên thực tế, mặc dù có hình ảnh ấn tượng và sự áp dụng rộng rãi của NVIDIA (NVDA ), NeRF đáng chú ý là ‘cứng nhắc’ – theo thuật ngữ CGI, ‘nướng’. Do đó, cộng đồng nghiên cứu đã tập trung vào việc cải thiện tính linh hoạt và khả năng ứng dụng của nó trong khía cạnh này trong 12-18 tháng qua.

Về mặt ý nghĩa, các ставка cho loại cột mốc này rất cao và bao gồm khả năng chuyển đổi ngành công nghiệp hiệu ứng hình ảnh từ một mô hình sáng tạo và hợp tác dựa trên việc tạo lưới, động lực học và kết cấu, sang một mô hình được xây dựng xung quanh đảo ngược kết xuất, nơi đường ống VFX được cung cấp bởi các bức ảnh thực tế của các vật thể thực (hoặc thậm chí là mô hình tổng hợp), chứ không phải là các ước tính, gần đúng thủ công.

Hiện tại, vẫn còn ít lý do để lo lắng trong cộng đồng hiệu ứng hình ảnh, ít nhất là từ trường Neural Radiance Fields. NeRF chỉ có khả năng ghép, lồng, kiểm soát độ sâu, động… và chắc chắn cũng trong mối quan hệ với ánh sáng. Video đồng hành cho một bài báo mới khác, cung cấp biến dạng cơ bản cho hình học NeRF, minh họa sự khác biệt lớn giữa trạng thái hiện tại của nghệ thuật trong CGI và những nỗ lực tiên phong của các kỹ thuật kết xuất thần kinh.

Lọc các yếu tố

Tuy nhiên, vì cần phải bắt đầu từ đâu đó, các nhà nghiên cứu của bài báo mới đã áp dụng CGI làm cơ chế kiểm soát và sản xuất trung gian, hiện là một phương pháp phổ biến để đối với không gian ẩn cứng của GAN và mạng tuyến tính gần như không thấm của NeRF.

Cơ bản, thách thức trung tâm là tính toán chiếu sáng toàn cầu (GI, không có khả năng áp dụng trực tiếp trong kết xuất thần kinh) thành một chuyển giao bức xạ trước (PRT, có thể được điều chỉnh cho kết xuất thần kinh) tính toán.

GI là một kỹ thuật kết xuất CGI lâu đời mô hình hóa cách ánh sáng phản xạ từ bề mặt này sang bề mặt khác và kết hợp các khu vực ánh sáng phản xạ này vào kết xuất, để tăng tính thực tế.

PRT được sử dụng như một hàm chiếu sáng trung gian trong phương pháp mới và thực tế nó là một thành phần rời rạc và có thể chỉnh sửa là điều đạt được sự tách rời. Phương pháp mới mô hình hóa vật liệu của đối tượng NeRF với một PRT được học.

Ánh sáng thực tế của cảnh ban đầu được thu hồi như một bản đồ môi trường trong quá trình này và hình học cảnh được trích xuất như một trường khoảng cách có dấu (SDF) sẽ cung cấp một lưới truyền thống cho Blender hoạt động trong sân khấu ánh sáng ảo.

Tổng quan về đường ống cho kỹ thuật mới.

Tổng quan về đường ống cho kỹ thuật mới.

Giai đoạn đầu tiên trong quá trình này là trích xuất hình học cảnh từ các hình ảnh đa góc nhìn có sẵn thông qua việc xây dựng lại bề mặt ngầm.

Để phát triển một trường bức xạ thần kinh (NRTF, sẽ chứa dữ liệu chiếu sáng), các nhà nghiên cứu đã sử dụng Mitsuba 2 trình kết xuất đường dẫn có thể phân biệt.

Điều này tạo điều kiện cho việc tối ưu hóa chung của một hàm phân bố tán xạ hai chiều (BSDF) cũng như việc tạo ra một bản đồ môi trường ban đầu.

Khi BSDF được tạo, trình kết xuất đường dẫn có thể được sử dụng trong Blender (xem video nhúng trực tiếp ở trên) để tạo ra các kết xuất cảnh ảo một ánh sáng tại một thời điểm (OLAT).

NRTF sau đó được đào tạo với một sự kết hợp giữa mất mát vật liệu ảnh thực và dữ liệu tổng hợp, không bị rối với nhau.

So sánh với người tiền nhiệm NeRFactor, về những thách thức của tổng hợp góc nhìn mới và chiếu sáng lại.

So sánh với người tiền nhiệm NeRFactor, về những thách thức của tổng hợp góc nhìn mới và chiếu sáng lại.

Con đường đến sự chiếu sáng

Yêu cầu đào tạo cho kỹ thuật này, mặc dù đáng kể thấp hơn so với thời gian đào tạo NeRF ban đầu, không đáng kể. Trên NVIDIA Quadro RTX 8000 với 48GB VRAM, đào tạo sơ bộ cho ước tính ánh sáng và kết cấu ban đầu mất 30 phút; đào tạo OLAT (tức là đào tạo các cảnh ảo) mất 8 giờ; và tối ưu hóa chung cuối cùng giữa dữ liệu tổng hợp và thực bị tách rời mất thêm 16 giờ để đạt được chất lượng tối ưu.

Hơn nữa, biểu diễn thần kinh kết quả không thể chạy trong thời gian thực, mất, theo các nhà nghiên cứu ‘vài giây mỗi khung hình’.

Các nhà nghiên cứu kết luận:

‘Kết quả của chúng tôi chứng minh một sự cải thiện rõ ràng so với trạng thái hiện tại của nghệ thuật trong khi công việc trong tương lai có thể liên quan đến việc cải thiện thời gian chạy và lý luận chung của hình học, vật liệu và chiếu sáng cảnh.’

 

Được xuất bản lần đầu vào ngày 28 tháng 7 năm 2022.

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai