Góc nhìn Anderson

NeRF: Nghiên cứu Cùng Facebook Phát triển Tổng hợp Video Tĩnh/Động

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Một sự hợp tác giữa Viện Bách khoa và Đại học bang Virginia và Facebook đã giải quyết một trong những thách thức chính trong tổng hợp video NeRF: trộn tự do hình ảnh tĩnh và động trong các trường bức xạ thần kinh (NeRF) đầu ra.

Hệ thống có thể tạo ra các cảnh có thể điều hướng, có cả yếu tố video động và môi trường tĩnh, mỗi yếu tố được ghi lại tại chỗ, nhưng được tách ra thành các khía cạnh có thể điều khiển của một môi trường ảo:

Hơn nữa, nó đạt được điều này từ một điểm nhìn duy nhất, mà không cần một mảng máy ảnh đa chiều có thể ràng buộc các sáng kiến như này vào một môi trường phòng thu.

Bài báo này, có tiêu đề Tổng hợp Xem từ Video Động Monocular, không phải là bài báo đầu tiên phát triển một quy trình làm việc NeRF monocular, nhưng dường như là bài báo đầu tiên đào tạo đồng thời một mô hình thay đổi theo thời gian và một mô hình tĩnh từ cùng một đầu vào, và tạo ra một khuôn khổ cho phép video động tồn tại trong một môi trường NeRF ‘đã được lập bản đồ trước’, tương tự như các môi trường ảo thường bao quanh các diễn viên trong các bộ phim khoa học viễn tưởng có ngân sách cao.

Beyond D-NeRF

Các nhà nghiên cứu đã phải tái tạo sự linh hoạt của NeRF động (D-NeRF) với chỉ một điểm nhìn, và không phải là nhiều máy ảnh mà D-NeRF sử dụng. Để giải quyết vấn đề này, họ đã dự đoán luồng cảnh trước và sau, và sử dụng thông tin này để phát triển một trường bức xạ bị biến dạng theo thời gian.

Chỉ với một điểm nhìn, cần phải sử dụng phân tích dòng quang 2D để có được các điểm 3D trong các khung hình tham chiếu. Điểm 3D được tính toán sau đó được đưa trở lại vào máy ảnh ảo để thiết lập một ‘luồng cảnh’ phù hợp với dòng quang được tính toán với dòng quang được ước tính.

Vào thời gian đào tạo, các yếu tố động và tĩnh được hòa giải thành một mô hình đầy đủ như các khía cạnh riêng biệt có thể truy cập.

Bằng cách bao gồm tính toán mất thứ tự độ sâu, mô hình và áp dụng quy chuẩn hóa nghiêm ngặt dự đoán luồng cảnh trong D-NeRF, vấn đề về hiệu ứng mờ chuyển động được giảm thiểu đáng kể.

Mặc dù nghiên cứu này có rất nhiều điều để cung cấp về việc quy chuẩn hóa tính toán NeRF, và cải thiện đáng kể sự linh hoạt và tiện lợi của việc khám phá đầu ra từ một điểm nhìn duy nhất, ít nhất cũng đáng chú ý là sự tách biệt và tái tích hợp mới của các yếu tố NeRF động và tĩnh.

Phụ thuộc vào một máy ảnh duy nhất, một hệ thống như vậy không thể tái tạo lại tầm nhìn toàn diện của một mảng máy ảnh đa chiều NeRF, nhưng nó có thể đi bất cứ nơi nào, và không cần một xe tải.

NeRF – Tĩnh Hay Video?

Gần đây, chúng tôi đã xem xét một số nghiên cứu NeRF ấn tượng mới từ Trung Quốc, có khả năng tách biệt các yếu tố trong một cảnh NeRF động được ghi lại với 16 máy ảnh.

ST-NeRF

ST-NeRF (ở trên) cho phép người xem thay đổi vị trí của các yếu tố riêng biệt trong một cảnh được ghi lại, và thậm chí thay đổi kích thước của chúng, thay đổi tốc độ phát lại, đóng băng chúng hoặc chạy chúng ngược lại. Ngoài ra, ST-NeRF cho phép người dùng ‘cuộn’ qua bất kỳ phần nào của cung 180 độ được ghi lại bởi 16 máy ảnh.

Tuy nhiên, các nhà nghiên cứu của bài báo ST-NeRF thừa nhận trong phần kết luận rằng thời gian luôn chạy trong một hoặc hướng khác dưới hệ thống này, và rằng việc thay đổi ánh sáng và áp dụng hiệu ứng cho các môi trường thực sự là video, chứ không phải là môi trường NeRF ‘đã được lập bản đồ tĩnh’ không chứa các thành phần di chuyển, và không cần phải được ghi lại như video.

Các Môi trường NeRF Tĩnh Có thể Chỉnh sửa Cao

Một cảnh NeRF tĩnh, bây giờ được tách biệt khỏi các đoạn video động, dễ dàng được xử lý và tăng cường theo nhiều cách, bao gồm cả việc thay đổi ánh sáng, như được đề xuất vào đầu năm nay bởi NeRV (Trường bức xạ và trường khả năng Neural cho việc thay đổi ánh sáng và tổng hợp xem), cung cấp một bước đầu tiên trong việc thay đổi ánh sáng và / hoặc kết cấu của một môi trường hoặc vật thể NeRF:

Thay đổi ánh sáng của một vật thể NeRF với NeRV. Nguồn: https://www.youtube.com/watch?v=4XyDdvhhjVo

Thay đổi ánh sáng của một vật thể NeRF với NeRV. Nguồn: https://www.youtube.com/watch?v=4XyDdvhhjVo

Thay đổi kết cấu trong NeRV, bao gồm cả hiệu ứng đặc tính thực tế. Vì cơ sở của mảng ảnh là tĩnh, nên dễ dàng hơn để xử lý và tăng cường một khía cạnh NeRF theo cách này hơn là bao gồm hiệu ứng trên một loạt các khung hình video, làm cho việc tiền xử lý ban đầu và đào tạo sau này trở nên nhẹ hơn và dễ dàng hơn.

Thay đổi kết cấu trong NeRV, bao gồm cả hiệu ứng đặc tính thực tế. Vì cơ sở của mảng ảnh là tĩnh, nên dễ dàng hơn để xử lý và tăng cường một khía cạnh NeRF theo cách này hơn là bao gồm hiệu ứng trên một loạt các khung hình video, làm cho việc tiền xử lý ban đầu và đào tạo sau này trở nên nhẹ hơn và dễ dàng hơn.

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: [email protected]