Góc nhìn Anderson

Hướng tới Con người Trí tuệ Nhân tạo Thực thời với Rendering Lumigraph Neural

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google
Neural Lumigraph Rendering

Mặc dù hiện tại có một làn sóng quan tâm đến các Trường Neuron Quang (NeRF), một công nghệ có khả năng tạo ra môi trường và vật thể 3D được tạo bởi trí tuệ nhân tạo, nhưng cách tiếp cận mới này để tổng hợp hình ảnh vẫn đòi hỏi một lượng lớn thời gian đào tạo và thiếu một triển khai cho phép giao diện thời gian thực, phản hồi cao.

Tuy nhiên, một sự hợp tác giữa một số tên tuổi ấn tượng trong ngành công nghiệp và học thuật cung cấp một cách nhìn mới về thách thức này (được gọi chung là Tổng hợp Hình ảnh Mới, hoặc NVS).

Bài nghiên cứu bài viết, có tiêu đề Rendering Lumigraph Neural, tuyên bố một sự cải tiến về tình trạng hiện tại của khoảng hai cấp độ, đại diện cho một số bước tiến tới việc渲染 đồ họa máy tính thời gian thực thông qua các đường ống học máy.

Rendering Lumigraph Neural (bên phải) cung cấp độ phân giải tốt hơn của các hiện tượng trộn và xử lý che khuất tốt hơn so với các phương pháp trước đó. Source: https://www.youtube.com/watch?v=maVF-7x9644

Rendering Lumigraph Neural (bên phải) cung cấp độ phân giải tốt hơn của các hiện tượng trộn và xử lý che khuất tốt hơn so với các phương pháp trước đó. Source.

Mặc dù chỉ có tên của các tác giả từ Đại học Stanford và công ty công nghệ hiển thị holographic Raxium (hiện đang hoạt động ở chế độ ẩn), các đóng góp bao gồm một kiến trúc sư máy học chính tại Google, một nhà khoa học máy tính tại Adobe và giám đốc công nghệ tại StoryFile (đã tạo ra tiêu đề gần đây với một phiên bản trí tuệ nhân tạo của William Shatner).

Về việc quảng bá gần đây của Shatner, StoryFile dường như đang sử dụng NLR trong quá trình mới để tạo ra các thực thể tương tác được tạo bởi trí tuệ nhân tạo dựa trên đặc điểm và câu chuyện của từng người.

StoryFile hình dung việc sử dụng công nghệ này trong các triển lãm bảo tàng, các câu chuyện tương tác trực tuyến, hiển thị holographic, thực tế ảo (AR) và tài liệu di sản – và cũng dường như đang xem xét các ứng dụng mới của NLR trong các cuộc phỏng vấn tuyển dụng và các ứng dụng hẹn hò ảo:

Các ứng dụng được đề xuất từ một video trực tuyến của StoryFile. Source: https://www.youtube.com/watch?v=2K9J6q5DqRc

Các ứng dụng được đề xuất từ một video trực tuyến của StoryFile. Source: https://www.youtube.com/watch?v=2K9J6q5DqRc

Thu thập Volumetric để Tổng hợp Hình ảnh Mới và Video

Nguyên tắc của việc thu thập volumetric, trên toàn bộ phạm vi của các bài báo đang tích lũy về chủ đề này, là ý tưởng của việc chụp các hình ảnh tĩnh hoặc video của một đối tượng, và sử dụng học máy để ‘điền vào’ các điểm nhìn mà không được bao phủ bởi mảng camera ban đầu.

Source: https://research.fb.com/wp-content/uploads/2019/06/Neural-Volumes-Learning-Dynamic-Renderable-Volumes-from-Images.pdf

Source: https://research.fb.com/wp-content/uploads/2019/06/Neural-Volumes-Learning-Dynamic-Renderable-Volumes-from-Images.pdf

Trong hình ảnh trên, lấy từ nghiên cứu AI của Facebook năm 2019 (xem dưới), chúng ta thấy bốn giai đoạn của việc thu thập volumetric: nhiều camera thu được hình ảnh/hình ảnh; kiến trúc mã hóa/giải mã (hoặc các kiến trúc khác) tính toán và kết hợp mối quan hệ giữa các điểm nhìn; các thuật toán ray-marching tính toán các voxel (hoặc các đơn vị hình học không gian XYZ khác) của mỗi điểm trong không gian volumetric; và (trong hầu hết các bài báo gần đây) việc đào tạo diễn ra để tổng hợp một thực thể hoàn chỉnh có thể được xử lý trong thời gian thực.

Điều này thường đòi hỏi một giai đoạn đào tạo rộng lớn và nặng về dữ liệu, điều mà đến nay đã giữ tổng hợp hình ảnh mới khỏi phạm vi của thời gian thực hoặc thu thập phản hồi cao.

Sự thật rằng Tổng hợp Hình ảnh Mới tạo ra một bản đồ 3D hoàn chỉnh của không gian volumetric có nghĩa là nó tương đối đơn giản để khâu các điểm này lại với nhau thành một lưới đồ họa máy tính truyền thống, hiệu quả thu được và diễn đạt một con người CGI (hoặc bất kỳ đối tượng nào khác có giới hạn tương đối) theo cách thức.

Các phương pháp sử dụng NeRF dựa trên các đám mây điểm và bản đồ độ sâu để tạo ra các nội suy giữa các điểm nhìn thưa thớt của các thiết bị thu thập:

NeRF có thể tạo ra độ sâu volumetric thông qua tính toán của các bản đồ độ sâu, chứ không phải tạo ra các lưới đồ họa máy tính. Source: https://www.youtube.com/watch?v=JuH79E8rdKc

NeRF có thể tạo ra độ sâu volumetric thông qua tính toán của các bản đồ độ sâu, chứ không phải tạo ra các lưới đồ họa máy tính. Source: https://www.youtube.com/watch?v=JuH79E8rdKc

Mặc dù NeRF có khả năng tính toán các lưới, nhưng hầu hết các triển khai không sử dụng điều này để tạo ra các cảnh volumetric.

Ngược lại, cách tiếp cận của Bộ kết xuất khác biệt (IDR) được xuất bản bởi Viện Khoa học Weizmann vào tháng 10 năm 2020, dựa trên việc khai thác thông tin lưới 3D được tạo tự động từ các mảng thu thập:

Các ví dụ về các bản thu thập IDR được chuyển đổi thành các lưới đồ họa máy tính tương tác. Source: https://www.youtube.com/watch?v=C55y7RhJ1fE

Các ví dụ về các bản thu thập IDR được chuyển đổi thành các lưới đồ họa máy tính tương tác. Source: https://www.youtube.com/watch?v=C55y7RhJ1fE

Mặc dù NeRF thiếu khả năng ước tính hình dạng của IDR, IDR không thể匹 với chất lượng hình ảnh của NeRF, và cả hai đòi hỏi tài nguyên rộng lớn để đào tạo và thu thập (mặc dù các đổi mới gần đây trong NeRF đang bắt đầu địa chỉ vấn đề này).

Tấm giá đỡ camera tùy chỉnh của NLR với 16 camera GoPro HERO7 và 6 camera Back-Bone H7PRO trung tâm. Để渲染 thời gian thực, những camera này hoạt động với tốc độ tối thiểu 60fps. Source: https://arxiv.org/pdf/2103.11571.pdf

Tấm giá đỡ camera tùy chỉnh của NLR với 16 camera GoPro HERO7 và 6 camera Back-Bone H7PRO trung tâm. Để渲染 thời gian thực, những camera này hoạt động với tốc độ tối thiểu 60fps. Source: https://arxiv.org/pdf/2103.11571.pdf

Thay vào đó, Rendering Lumigraph Neural sử dụng SIREN (Mạng lưới biểu diễn Sinusoidal) để kết hợp các điểm mạnh của mỗi cách tiếp cận vào khuôn khổ của nó, được thiết kế để tạo ra đầu ra có thể được sử dụng trực tiếp trong các đường ống đồ họa máy tính thời gian thực.

SIREN đã được sử dụng cho các triển khai tương tự trong suốt năm qua, và hiện đại diện cho một gọi API phổ biến cho các notebook Colab trong các cộng đồng tổng hợp hình ảnh; tuy nhiên, sự đổi mới của NLR là áp dụng SIREN cho việc giám sát hình ảnh đa góc 2D, điều này gây khó khăn do mức độ mà SIREN tạo ra đầu ra quá phù hợp chứ không phải tổng quát.

Sau khi lưới được trích xuất từ các hình ảnh mảng, lưới được raster hóa thông qua OpenGL, và các vị trí đỉnh của lưới được ánh xạ đến các pixel tương ứng, sau đó trộn của các bản đồ đóng góp được tính toán.

Lưới kết quả được tổng quát hóa và đại diện hơn so với lưới của NeRF (xem hình dưới), đòi hỏi ít tính toán hơn, và không áp dụng chi tiết quá mức vào các khu vực (chẳng hạn như da mặt mịn) mà không thể được hưởng lợi từ nó:

Source: https://arxiv.org/pdf/2103.11571.pdf

Source: https://arxiv.org/pdf/2103.11571.pdf

Về mặt tiêu cực, NLR vẫn chưa có khả năng chiếu sáng động hoặc chiếu sáng lại, và đầu ra bị hạn chế ở các bản đồ bóng và các yếu tố chiếu sáng khác được thu được tại thời điểm thu thập. Các nhà nghiên cứu dự định sẽ giải quyết vấn đề này trong các công việc tương lai.

Ngoài ra, bài báo thừa nhận rằng các hình dạng được tạo ra bởi NLR không chính xác như một số cách tiếp cận thay thế, chẳng hạn như Lựa chọn điểm nhìn theo từng điểm cho Stereo đa góc không có cấu trúc, hoặc nghiên cứu của Viện Weizmann được đề cập trước đó.

Sự trỗi dậy của Tổng hợp Hình ảnh Volumetric

Ý tưởng về việc tạo ra các thực thể 3D từ một loạt ảnh hạn chế với các mạng lưới thần kinh đã tiền đạo NeRF, với các bài báo tầm nhìn đi ngược lại năm 2007 hoặc trước đó. Vào năm 2019, bộ phận nghiên cứu AI của Facebook đã sản xuất một bài báo nghiên cứu mang tính bước ngoặt, Neural Volumes: Học các thể tích có thể được tạo ra động từ Hình ảnh, lần đầu tiên cho phép tạo ra các giao diện phản hồi cho các con người tổng hợp được tạo bởi việc thu thập volumetric dựa trên máy học.

Nghiên cứu năm 2019 của Facebook đã cho phép tạo ra một giao diện người dùng phản hồi cho một người volumetric. Source: https://research.fb.com/publications/neural-volumes-learning-dynamic-renderable-volumes-from-images/

Nghiên cứu năm 2019 của Facebook đã cho phép tạo ra một giao diện người dùng phản hồi cho một người volumetric. Source: https://research.fb.com/publications/neural-volumes-learning-dynamic-renderable-volumes-from-images/

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai