Góc nhìn Anderson

NeRF Di Chuyển Một Bước Tiếp Cận Để Thay Thế CGI

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Những nhà nghiên cứu tại MIT và Google đã thực hiện một bước tiến lớn trong việc giải quyết một trong những trở ngại cơ bản nhất đối với công nghệ AI mới nổi, có thể thay thế CGI trong tương lai – tách biệt hình ảnh trường bức xạ thần kinh (NeRF) thành các thành phần hình ảnh riêng biệt, để hình ảnh có thể được tái kết cấu và tái chiếu sáng.

Phương pháp mới, được gọi là NeRFactor, hiệu quả chia hình ảnh thu được thành các mặt phẳng đối tượng riêng biệt (trên đó có thể gán kết cấu), ánh sáng nhìn thấy, albedo (tỷ lệ ánh sáng chiếu tới bị phản xạ khỏi bề mặt) và các hàm phân bố phản xạ hai chiều (BRDFs).

Với những khía cạnh này được cô lập, có thể không chỉ chuyển đổi kết cấu cho các đối tượng hoặc nhóm đối tượng riêng biệt, mà còn thêm các nguồn ánh sáng và triển khai bóng mới, loại bỏ bất kỳ nguồn nào được chụp bởi các mảng máy ảnh đa chiều tạo ra đầu vào cho hình ảnh NeRF.

Các mặt phẳng đối tượng, ánh sáng nhìn thấy, albedo và BRDF được tách biệt dưới NeRFactor. Nguồn: https://www.youtube.com/watch?v=UUVSPJlwhPg

Các mặt phẳng đối tượng, ánh sáng nhìn thấy, albedo và BRDF được tách biệt dưới NeRFactor. Nguồn: https://www.youtube.com/watch?v=UUVSPJlwhPg

Mô hình hỗ trợ bóng mềm hoặc bóng cứng từ các nguồn ánh sáng tùy ý, người dùng định nghĩa và tách bốn khía cạnh của video thu được một cách lập trình, sử dụng sự mất mát tái tạo, dữ liệu từ các tính toán trước của BRDF và quy chuẩn hóa trơn tru cơ bản.

Quy trình làm việc của NeRFactor, trích xuất các khía cạnh riêng biệt của hình ảnh có thể hành động được từ các mảng máy ảnh đa chiều. Nguồn: https://arxiv.org/pdf/2106.01970.pdf

NeRFactor sử dụng một đầu dò ánh sáng độ phân giải cao (HDR), một phương pháp đã được thiết lập từ lâu và đã thâm nhập vào lĩnh vực công nghiệp và nghệ thuật thị giác kể từ khi nó được giới thiệu vào năm 1998, để đánh giá các tuyến đường có thể cho các tia, cho phép chiếu sáng tùy ý. Vì điều này tạo ra một số lượng tham số không thể kiểm soát, đầu dò ánh sáng được lọc qua một mạng nơ-ron đa lớp (MLP), ánh xạ hình học nhận thức đến đầu dò mà không cố gắng tính toán một bản đồ thể tích chiếu sáng hoàn chỉnh cho không gian mô hình.

Hai mô hình trường bức xạ thần kinh được sử dụng để chứng minh năm mô hình chiếu sáng có thể dưới NeRFactor. Nhấp vào hình ảnh để có độ phân giải cao hơn.

Lý Do Để Tái Xem Xét

Nghiên cứu mới này có lẽ quan trọng nhất trong việc tách các lớp của hình ảnh thu được mà kiểm soát phản xạ. Đây vẫn là một trong những thách thức lớn nhất đối với hình ảnh trường bức xạ thần kinh, vì một hệ thống NeRF thực sự mới và linh hoạt sẽ không chỉ cần thay thế kết cấu, mà quan trọng là sẽ cần một số cách để phản xạ các đối tượng di chuyển (ngoài môi trường cố định) mà thông thường sẽ được tính toán trong một quy trình CGI.

Vấn đề này đã được lưu ý gần đây liên quan đến nghiên cứu mới của Intel về chuyển đổi hình ảnh trò chơi thành video siêu thực thông qua mạng nơ-ron tích chập. Trong các quy trình như vậy, nhiều khía cạnh ‘nướng’ của vật liệu nguồn sẽ cần trở nên rời rạc và có thể hoán đổi, và điều này có thể dễ dàng giải quyết hơn cho việc tái chiếu sáng (đây là một hàm của hình học được kết xuất trong NeRF) hơn là phản xạ (sử dụng ‘hình học ngoài màn hình’ nằm hoàn toàn ngoài phạm vi của mô hình).

Do đó, cô lập các lớp trong video NeRF mà tạo điều kiện cho phản xạ mang NeRF đến gần hơn một bước để giải quyết thách thức ‘phản xạ’ của nó.

Sử dụng môi trường HDR đã giải quyết vấn đề tạo ra phản xạ môi trường thế giới (tức là bầu trời, phong cảnh và các yếu tố môi trường ‘cố định’ khác), nhưng các phương pháp mới sẽ được cần để giới thiệu phản xạ di chuyển và động.

Photogrammetry Với NeRF

Hình ảnh trường bức xạ thần kinh sử dụng phân tích học máy để phát triển một không gian hoàn toàn thể tích từ một cảnh hoặc đối tượng đã được chụp từ nhiều góc độ.

Các lược đồ NeRF dựa trên đã xuất hiện trong năm qua đã sử dụng một số lượng thiết bị máy ảnh đa dạng; một số sử dụng 16 hoặc nhiều máy ảnh, những máy ảnh khác chỉ sử dụng một hoặc hai. Trong tất cả các trường hợp, các điểm nhìn trung gian được ‘điền’ (tức là giải thích) để cảnh hoặc đối tượng có thể được điều hướng một cách linh hoạt.

Kết quả là một không gian hoàn toàn thể tích, với một sự hiểu biết nội tại 3D có thể được khai thác theo nhiều cách, bao gồm khả năng tạo ra các lưới CGI truyền thống từ tổng 3D-parsed của các hình ảnh đầu vào.

NeRF Trong Bối Cảnh Của Một ‘CGI Mới’

Hình ảnh trường bức xạ thần kinh được vẽ trực tiếp từ hình ảnh của thế giới thực, bao gồm cả hình ảnh di chuyển của người, đối tượng và cảnh. Ngược lại, một phương pháp CGI ‘nghiên cứu’ và giải thích thế giới, đòi hỏi phải có những công nhân có kỹ năng để xây dựng lưới, giá đỡ và kết cấu mà sử dụng hình ảnh thế giới thực (tức là chụp khuôn mặt và môi trường). Nó vẫn là một phương pháp giải thích và thủ công mà tốn kém và tốn thời gian.

Ngoài ra, CGI đã gặp phải những vấn đề liên tục với hiệu ứng ‘thung lũng kỳ lạ’ trong nỗ lực tái tạo sự giống người, điều này không gây ra bất kỳ hạn chế nào cho một phương pháp NeRF.

Hơn nữa, NeRF có thể tạo ra hình học lưới CGI truyền thống trực tiếp từ ảnh khi cần, và thực tế có thể thay thế nhiều thủ tục thủ công mà luôn cần thiết trong hình ảnh được tạo bằng máy tính.

Thách Thức Đối Với NeRF

Nghiên cứu mới nhất này từ MIT và Google đến trong bối cảnh một lượng lớn các bài báo NeRF trong năm qua, nhiều trong số đó đã cung cấp các giải pháp cho các thách thức khác nhau được đặt ra bởi bài báo năm 2020 ban đầu.

Vào tháng 4, một sự đổi mới từ một tập đoàn nghiên cứu Trung Quốc đã cung cấp một cách cách ly riêng biệt các dòng thời gian riêng biệt của các khía cạnh trong một cảnh NeRF, bao gồm cả người.

ST-NeRF

Phương pháp nghiên cứu của Trung Quốc cho phép người dùng sao chép, dán và thay đổi kích thước các yếu tố được chụp, tách chúng ra khỏi dòng thời gian tuyến tính của video nguồn ban đầu. Nguồn: https://www.youtube.com/watch?v=Wp4HfOwFGP4

Phương pháp này không chỉ cho phép tưởng tượng lại cảnh từ bất kỳ góc độ nào được chụp bởi mảng máy ảnh (và không chỉ góc nhìn đơn được đại diện trong một bản ghi video thông thường), mà còn cho phép compositing linh hoạt – và thậm chí khả năng thể hiện hai khía cạnh từ cùng một cảnh quay đang chạy trong các khung thời gian riêng biệt (hoặc thậm chí chạy ngược lại, nếu cần).

Hai khía cạnh NeRF riêng biệt chạy ở các tốc độ khác nhau trong cùng một cảnh. Nguồn: https://www.youtube.com/watch?v=Wp4HfOwFGP4

Phương pháp nghiên cứu của Trung Quốc cho phép người dùng sao chép, dán và thay đổi kích thước các yếu tố được chụp, tách chúng ra khỏi dòng thời gian tuyến tính của video nguồn ban đầu. Nguồn: https://www.youtube.com/watch?v=Wp4HfOwFGP4

Một trong những thách thức lớn nhất đối với NeRF là giảm thiểu các tài nguyên đáng kể cần thiết để đào tạo một cảnh, và điều này đã được giải quyết trong một số bài báo gần đây. Ví dụ, Viện Max Planck về Hệ thống Thông minh đã giới thiệu KiloNeRF, không chỉ tăng tốc thời gian kết xuất lên 1000 lần, mà còn cho phép NeRF hoạt động tương tác.

KiloNeRF chạy một môi trường tương tác ở 50fps trên GTX 1080ti. Nguồn: https://github.com/creiser/kilonerf

KiloNeRF chạy một môi trường tương tác ở 50fps trên GTX 1080ti. Nguồn: https://github.com/creiser/kilonerf

Tuy nhiên, sự đổi mới về tốc độ NeRF thực sự đã thu hút trí tưởng tượng của các nhà nghiên cứu và công chúng trong năm 2021 là sự hợp tác PlenOctrees, do UC Berkeley dẫn đầu, cung cấp kết xuất thời gian thực của Trường bức xạ thần kinh:

Hiệu ứng của khả năng tương tác PlenOctrees đã được tái tạo trong một giao diện web trực tiếp.

Chuyển động trực tiếp của một đối tượng PlenOctrees trong Firefox (chuyển động trơn tru và động hơn so với GIF này). Nguồn: http://alexyu.net/plenoctrees/demo/

Chuyển động trực tiếp của một đối tượng PlenOctrees trong Firefox (chuyển động trơn tru và động hơn so với GIF này). Nguồn: http://alexyu.net/plenoctrees/demo/

Ngoài ra, Recursive-NeRF (từ một bài báo tháng 5 năm 2021 của các nhà nghiên cứu tại Đại học Tsinghua) cung cấp kết xuất đệ quy chất lượng cao theo yêu cầu. Thay vì buộc người dùng phải kết xuất toàn bộ cảnh, bao gồm cả phần mà có thể không được nhìn thấy, Recursive-NeRF cung cấp một thứ gì đó tương tự như nén mất dữ liệu của JPEG, và có thể tạo ra các sub-NeRF rời rạc để xử lý hình ảnh bổ sung theo yêu cầu – đạt được một tiết kiệm lớn về tài nguyên tính toán.

Giữ lại chi tiết trong khi loại bỏ các tính toán kết xuất không cần thiết với Recursive-NeRF. Nguồn: https://arxiv.org/pdf/2105.09103.pdf

Giữ lại chi tiết trong khi loại bỏ các tính toán kết xuất không cần thiết với Recursive-NeRF. Nhấp vào hình ảnh để có độ phân giải cao hơn. Nguồn: https://arxiv.org/pdf/2105.09103.pdf

Các phương pháp khác bao gồm FastNeRF, tuyên bố đạt được kết xuất thần kinh chất lượng cao ở 200fps.

Đã được lưu ý rằng nhiều kỹ thuật tối ưu hóa cho NeRF liên quan đến ‘nướng’ cảnh, bằng cách cam kết với các khía cạnh được mong muốn để kết xuất và loại bỏ các khía cạnh khác, điều này hạn chế việc khám phá nhưng tăng tốc độ tương tác rất nhiều.

Nhược điểm của điều này là căng thẳng chuyển từ GPU sang lưu trữ, vì các cảnh ‘nướng’ chiếm một lượng không gian đĩa lớn; đến một mức độ nhất định, điều này có thể được giảm thiểu bằng cách giảm mẫu dữ liệu ‘nướng’, mặc dù điều này cũng liên quan đến một cam kết nhất định, về mặt đóng cửa các con đường khám phá hoặc tương tác.

Về việc bắt giữ chuyển động và giá đỡ, một phương pháp mới từ Đại học Zheijang và Cornell, được tiết lộ vào tháng 5, cung cấp một phương pháp để tái tạo con người có thể hoạt hình bằng cách sử dụng các trường trọng lượng kết hợp và cấu trúc xương được giải thích từ video đầu vào:

Cấu trúc xương được suy dẫn trong Animatable NeRF. Nguồn: https://www.youtube.com/watch?v=eWOSWbmfJo4

Cấu trúc xương được suy dẫn trong Animatable NeRF. Nguồn: https://www.youtube.com/watch?v=eWOSWbmfJo4

Khi Nào NeRF Sẽ Có ‘Khoảnh Khắc Jurassic Park’?

Mặc dù tiến độ nhanh chóng trong tổng hợp hình ảnh thông qua trường bức xạ thần kinh, nhưng chỉ trong giai đoạn này, bất kỳ loại ‘định luật nhiệt động lực học’ nào sẽ được thiết lập cho việc triển khai NeRF có thể trở nên khả thi. Về mặt lịch sử của CGI, NeRF hiện đang lơ lửng vào năm 1973, ngay trước sử dụng đầu tiên của CGI trong Westworld.

Điều đó không có nghĩa là NeRF nhất thiết phải chờ chín năm để đạt được cột mốc tương đương Wrath Of Khan, hoặc hàng thập kỷ để đạt được những đột phá mà CGI đã đạt được dưới sự bảo trợ nhiệt tình của James Cameron trong The Abyss năm 1989 hoặc Terminator 2 năm 1991 – và sau đó, khoảnh khắc đột phá thực sự của công nghệ trong Jurassic Park năm 1993.

Cảnh quan hình ảnh đã thay đổi rất nhiều kể từ thời kỳ đình trệ lâu dài của hiệu ứng hình ảnh hóa học, chiếm ưu thế trong sản xuất phim và truyền hình từ khi ra đời cho đến những năm 1990. Sự ra đời của cuộc cách mạng PC và sự tăng tốc của định luật Moore đã dẫn đến cuộc cách mạng CGI, điều này có thể đã xảy ra sớm nhất là vào những năm 1960.

Nó vẫn còn phải xem liệu có bất kỳ rào cản nào không thể vượt qua mà có thể giữ lại tiến bộ của NeRF trong thời gian dài như vậy – và nếu những đổi mới tiếp theo trong thị giác máy tính có thể không vượt qua NeRF như một ứng cử viên hàng đầu cho vương miện CGI, mô tả trường bức xạ thần kinh như một ‘máy fax’ ngắn ngủi của tổng hợp hình ảnh thần kinh.

Cho đến nay, NeRF vẫn chưa được sử dụng trong bất kỳ ngữ cảnh nào ngoài nghiên cứu học thuật; nhưng đáng chú ý là các bên lớn như Google Research và nhiều phòng thí nghiệm nghiên cứu thị giác máy tính hàng đầu đang cạnh tranh để đạt được đột phá NeRF mới nhất.

Nhiều thách thức lớn nhất của NeRF đã bắt đầu được giải quyết trực tiếp trong năm nay; nếu nghiên cứu tiếp theo cung cấp một giải pháp cho vấn đề ‘phản xạ’, và nhiều luồng nghiên cứu tối ưu hóa NeRF hợp nhất thành một giải pháp quyết định cho nhu cầu xử lý và / hoặc lưu trữ đáng kể của công nghệ, NeRF thực sự có cơ hội trở thành ‘CGI mới’ trong năm năm tới.

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai