Góc nhìn Anderson

Công Nghệ CGI Mới: Tạo Khu Vực Neural Với Block-NeRF

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Trường Điện Tử Neuron (NeRF) cho phép các vật thể được tái tạo và khám phá trong mạng nơ-ron bằng cách sử dụng nhiều hình ảnh từ các góc nhìn khác nhau làm đầu vào, mà không cần sự phức tạp và tốn kém của các phương pháp CGI truyền thống.

Tuy nhiên, quá trình này đòi hỏi tính toán phức tạp, ban đầu hạn chế môi trường NeRF ở các kịch bản mô hình bàn. Tuy nhiên, NeRF đã được một cộng đồng nghiên cứu chuyên dụng áp dụng, và trong hơn một năm qua, họ đã cho phép tái tạo môi trường ngoài trời cũng như con người neuron có thể chỉnh sửa, cùng với nhiều đổi mới khác.

Bây giờ, một sáng kiến nghiên cứu mới, bao gồm sự tham gia của Google Research, nhận ra các giới hạn cứng về tối ưu hóa NeRF, và tập trung vào việc ghép các môi trường NeRF lại với nhau để tạo ra các khu vực trên nhu cầu bao gồm nhiều thể hiện NeRF được phối hợp.

Góc nhìn từ mạng Block-NeRF của các NeRF liên kết. Xem video nhúng ở cuối bài viết, và cũng liên kết nguồn cho các video phụ trợ độ phân giải cao. Nguồn: https://waymo.com/research/block-nerf/

Góc nhìn từ mạng Block-NeRF của các NeRF liên kết. Xem video nhúng ở cuối bài viết, và cũng liên kết nguồn cho các video phụ trợ độ phân giải cao. Nguồn: https://waymo.com/research/block-nerf/

Điều hướng mạng lưới NeRF liên kết hiệu quả làm cho NeRF có thể mở rộng và mô-đun, cung cấp môi trường có thể điều hướng mà tải thêm phần của khu vực khi cần, theo cách tương tự như các phương pháp tối ưu hóa tài nguyên của trò chơi điện tử, nơi những gì xung quanh góc là hiếm khi được tải cho đến khi môi trường cần được tải.

Trong một nỗ lực lớn để phân tách các khía cạnh riêng biệt như thời tiết và giờ, Block-NeRF cũng giới thiệu ‘mã ngoại hình’, cho phép thay đổi động thời gian trong ngày:

Thay đổi thời gian trong ngày với Block-NeRF. Xem video nhúng ở cuối bài viết, và cũng liên kết nguồn cho các video phụ trợ độ phân giải cao. Nguồn: https://waymo.com/research/block-nerf/

Thay đổi thời gian trong ngày với Block-NeRF. Xem video nhúng ở cuối bài viết, và cũng liên kết nguồn cho các video phụ trợ độ phân giải cao. Nguồn: https://waymo.com/research/block-nerf/

Bài báo mới cho rằng tối ưu hóa NeRF đang tiếp cận giới hạn nhiệt của nó, và rằng các triển khai trong tương lai của môi trường bức xạ neuron trong thực tế ảo, các loại hình tương tác khác, và công việc VFX, có thể phụ thuộc vào các hoạt động song song, tương tự như cách mà Luật Moore cuối cùng đã nhường chỗ cho các kiến trúc đa lõi, tối ưu hóa song song và các phương pháp mới để lưu trữ.

Tác giả của bài báo (được gọi là Block-NeRF: Tổng hợp Xem Neuron Cảnh Lớn Có thể mở rộng) đã sử dụng 2,8 triệu hình ảnh để tạo ra cảnh neuron lớn nhất từ trước đến nay – một loạt các khu phố ở San Francisco.

Block-NeRF điều hướng Nhà thờ Grace Cathedral. Xem video nhúng ở cuối bài viết, và cũng liên kết nguồn cho các video phụ trợ độ phân giải cao. Nguồn: https://waymo.com/research/block-nerf/

Block-NeRF điều hướng Nhà thờ Grace Cathedral. Xem video nhúng ở cuối bài viết, và cũng liên kết nguồn cho các video phụ trợ độ phân giải cao. Nguồn: https://waymo.com/research/block-nerf/

Tác giả chính của bài báo, đại diện cho UC Berkley, là Matthew Tancik, đồng sáng lập của Trường Điện Tử Neuron, người đã thực hiện công việc này trong thời gian thực tập tại công ty công nghệ lái xe tự động Waymo, chủ trì trang dự án. Sáng kiến này cũng cung cấp một video tổng quan trên YouTube, nhúng ở cuối bài viết, cùng với nhiều video hỗ trợ và phụ trợ tại trang dự án.

Bài báo được đồng tác giả bởi một số người sáng lập NeRF khác, bao gồm Ben Mildenhall (Google Research), Pratul P. Srinivasan (Google Research), và Jonathan T. Barron (Google Research). Các đóng góp khác là Vincent Casser, Xinchen Yan, Sabeek Pradhan, Henrik Kretzschmar và Vincent Casser, tất cả từ Waymo.

Block-NeRF được phát triển chủ yếu như một nghiên cứu về môi trường ảo cho các hệ thống xe tự động, bao gồm xe tự lái và máy bay không người lái.

Con đường Embarcadero từ góc nhìn 180 độ trong Block-NeRF. Xem video nhúng ở cuối bài viết, và cũng liên kết nguồn cho các video phụ trợ độ phân giải cao. Nguồn: https://waymo.com/research/block-nerf/

Con đường Embarcadero từ góc nhìn 180 độ trong Block-NeRF. Xem video nhúng ở cuối bài viết, và cũng liên kết nguồn cho các video phụ trợ độ phân giải cao. Nguồn: https://waymo.com/research/block-nerf/

Các yếu tố khác có thể được thay đổi động trong Block-NeRF là khẩu độ ống kính (xem hình ảnh trên), thời tiết và mùa.

Tuy nhiên, việc thay đổi mùa có thể gây ra các thay đổi liên quan trong môi trường, chẳng hạn như cây cối không có lá, điều này đòi hỏi một tập dữ liệu đầu vào rộng lớn hơn so với Block-NeRF. Bài báo cho biết:

‘[Lá cây] thay đổi theo mùa và di chuyển trong gió; điều này dẫn đến các biểu diễn mờ của cây cối và thực vật. Tương tự, sự không nhất quán về thời gian trong dữ liệu đào tạo, chẳng hạn như công việc xây dựng, không được xử lý tự động và đòi hỏi phải đào tạo lại các khối bị ảnh hưởng.’

Rendering Tận Thế

Nếu bạn xem video nhúng ở cuối bài viết, bạn sẽ thấy một sự Walking Dead-style thưa thớt trong môi trường Block-NeRF được liên kết. Vì nhiều lý do, không chỉ để cung cấp một môi trường ảo cho các hệ thống robot, xe tự lái, người đi bộ và các vật thể tạm thời khác đã được cố ý xóa khỏi tài liệu nguồn, nhưng điều này đã để lại một số di tích phía sau, chẳng hạn như bóng của các phương tiện đỗ xe bị xóa:

Bóng của một chiếc xe bị xóa. Nguồn: https://waymo.com/research/block-nerf/

Bóng của một chiếc xe bị xóa. Nguồn: https://waymo.com/research/block-nerf/

Để thích ứng với các môi trường ánh sáng khác nhau như ngày hoặc đêm, mạng lưới đã được đào tạo để kết hợp các luồng dữ liệu tách biệt liên quan đến từng điều kiện mong muốn. Trong hình ảnh dưới đây, chúng ta thấy các luồng dữ liệu đóng góp cho hình ảnh Block-NeRF của một con đường vào ban ngày và ban đêm:

Các mặt của Block-NeRF cho phép người dùng chuyển đổi giữa ngày và đêm. Nguồn: https://waymo.com/research/block-nerf/

Các mặt của Block-NeRF cho phép người dùng chuyển đổi giữa ngày và đêm. Nguồn: https://waymo.com/research/block-nerf/

Xem Xét Môi Trường và Đạo Đức

Trong những năm gần đây, các bài báo nghiên cứu đã bắt đầu bao gồm các cảnh báo và免 trách về các tác động môi trường và đạo đức có thể xảy ra của công việc được đề xuất. Trong trường hợp của Block-NeRF, các tác giả lưu ý rằng các yêu cầu năng lượng là cao, và việc tính toán các vật thể tạm thời ngắn hạn và dài hạn (chẳng hạn như lá trên cây và công việc xây dựng) sẽ đòi hỏi phải quét lại dữ liệu nguồn thường xuyên, dẫn đến tăng ‘giám sát’ trong các khu vực đô thị mà mô hình neuron cần được cập nhật.

Các tác giả cho biết:

‘Tùy thuộc vào quy mô công việc này được áp dụng, nhu cầu tính toán của nó có thể dẫn đến hoặc làm trầm trọng thêm thiệt hại môi trường nếu năng lượng sử dụng cho tính toán dẫn đến tăng lượng khí thải carbon. Như đã đề cập trong bài báo, chúng tôi dự đoán sẽ có thêm công việc, chẳng hạn như các phương pháp lưu trữ, có thể giảm nhu cầu tính toán và do đó giảm thiểu thiệt hại môi trường.’

Về giám sát, họ tiếp tục:

‘Các ứng dụng trong tương lai của công việc này có thể đòi hỏi nỗ lực thu thập dữ liệu lớn hơn, điều này gây ra các lo ngại về quyền riêng tư. Mặc dù hình ảnh chi tiết của đường phố công cộng đã có sẵn trên các dịch vụ như Google Street View, phương pháp của chúng tôi có thể thúc đẩy việc quét lại môi trường thường xuyên hơn. Một số công ty trong lĩnh vực xe tự lái cũng được biết đến là thực hiện quét khu vực thường xuyên bằng đội xe của họ; tuy nhiên, một số chỉ sử dụng quét LiDAR, có thể ít nhạy cảm hơn so với việc thu thập hình ảnh từ máy ảnh.’

Phương Pháp và Giải Pháp

Các môi trường NeRF riêng lẻ có thể được thu nhỏ xuống, về lý thuyết, đến bất kỳ kích thước nào trước khi được lắp ráp thành một mảng Block-NeRF. Điều này mở ra con đường để bao gồm các nội dung có thể thay đổi, chẳng hạn như cây cối, và để xác định và quản lý các công trình xây dựng, có thể tồn tại trong thời gian qua nhiều năm thu thập lại, nhưng có thể tiến hóa và cuối cùng trở thành các thực thể nhất quán.

Tuy nhiên, trong lần nghiên cứu ban đầu này, các khối NeRF rời rạc được hạn chế ở các khối thành phố thực tế của từng môi trường được mô tả, được khâu lại với nhau, với độ chồng lấp 50% đảm bảo chuyển đổi nhất quán từ một khối này sang khối khác khi người dùng điều hướng mạng lưới.

Mỗi khối được giới hạn bởi một bộ lọc địa lý. Các tác giả lưu ý rằng phần này của khuôn khổ là mở cho tự động hóa, và, đáng ngạc nhiên, rằng việc triển khai của họ dựa trên OpenStreetMap chứ không phải Google Maps.

Bán kính giao lộ cho không gian render 'hoạt động' của Block-NeRF. Nguồn: Waymo

Bán kính giao lộ cho không gian render ‘hoạt động’ của Block-NeRF. Nguồn: Waymo

Các khối được đào tạo song song, với các khối cần thiết được render theo yêu cầu. Các mã ngoại hình sáng tạo cũng được dàn xếp trong tập hợp các khối, đảm bảo rằng người dùng không di chuyển bất ngờ vào thời tiết, thời gian trong ngày hoặc thậm chí một mùa khác.

Các đoạn Block-NeRF được điều kiện hóa về độ phơi sáng theo cách tương tự như HDR trong tài liệu nguồn ảnh. Nguồn: Waymo

Các đoạn Block-NeRF được điều kiện hóa về độ phơi sáng theo cách tương tự như HDR trong tài liệu nguồn ảnh. Nguồn: Waymo

Khả năng chuyển đổi ánh sáng và các biến số môi trường khác được suy ra từ các tối ưu hóa潜 ẩn được giới thiệu trong NeRF trong tự nhiên (NeRF-W), mà bản thân nó được suy ra từ bài báo nghiên cứu của Facebook AI năm 2019 Optimizing the Latent Space of Generative Networks.

Một mô hình phân đoạn ngữ nghĩa được tạo ra cho Panoptic-DeepLab vào năm 2020 được sử dụng để loại bỏ các yếu tố không mong muốn (chẳng hạn như người và xe)

Dữ Liệu

Khi nhận thấy rằng các tập dữ liệu đô thị phổ biến như CityScapes không phù hợp với công việc chi tiết như Block-NeRF, các nhà nghiên cứu đã tạo ra tập dữ liệu của riêng họ. Dữ liệu hình ảnh được thu thập từ 12 máy ảnh bao gồm góc nhìn 360 độ, với hình ảnh được chụp ở 10 Hz với giá trị phơi sáng vô hướng.

Các khu phố ở San Francisco được bao phủ là Alamo Square và Mission Bay. Đối với các bản chụp Alamo Square, một khu vực khoảng 960m x 570m được bao phủ, chia thành 35 thể hiện Block-NeRF, mỗi thể hiện được đào tạo trên dữ liệu từ 38 đến 48 lần thu thập dữ liệu khác nhau, với tổng thời gian lái xe là 18-28 phút.

Số lượng hình ảnh đóng góp cho mỗi Block-NeRF nằm trong khoảng từ 64.575 đến 108.216, và tổng thời gian lái xe được đại diện cho khu vực này là 13,4 giờ trên 1.330 lần thu thập dữ liệu khác nhau. Điều này dẫn đến 2.818.745 hình ảnh đào tạo chỉ cho Alamo Square. Xem bài báo để biết thêm chi tiết về thu thập dữ liệu cho Mission Bay.

 

Được xuất bản lần đầu vào ngày 11 tháng 2 năm 2022.

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai