Anderson의 관점

새로운 CGI: 블록-NeRF로 신경 네이버후드 생성

mm
Unite.AI를 Google의 선호 소스에 추가

신경 복사 필드(NeRF)는 여러 관점의 사진만을 입력으로 사용하여 객체를 재창조하고 신경 네트워크 내에서 탐색할 수 있도록 하는 기술입니다. 전통적인 CGI 방법의 복잡성과 비용 없이 객체를 재창조할 수 있습니다.

그러나 이 과정은 계산적으로 비용이 많이 들기 때문에 초기에 NeRF 환경은 테이블탑 모델 시나리오로 제한되었습니다. 그러나 NeRF는 헌신적인 연구 커뮤니티에 의해 채택되었으며, 지난 1년 동안 외부 재구성편집 가능한 신경 인간을 포함한 많은 혁신을 이루었습니다.

이제 새로운 연구 이니셔티브는 Google Research의 참여를 포함하며, NeRF의 최적화에 대한 가능한 하드 한계를 인식하고, 대신에 NeRF 환경을 연결하여 여러 개의 조정된 NeRF 인스턴스로 구성된 온디맨드 네이버후드를 생성합니다.

블록-NeRF 네트워크의 연결된 NeRF의 관점. 이 글의 끝에 포함된 비디오와 고해상도 전체 길이의 보충 비디오를 위한 소스 링크를 참조하십시오. 출처: https://waymo.com/research/block-nerf/

블록-NeRF 네트워크의 연결된 NeRF의 관점. 이 글의 끝에 포함된 비디오와 고해상도 전체 길이의 보충 비디오를 위한 소스 링크를 참조하십시오. 출처: https://waymo.com/research/block-nerf/

네트워크의 연결된 NeRF를 효과적으로 탐색하면 NeRF를 확장 가능하고 모듈화하여, 필요한 부분을 로드하는 방식으로 환경을 제공합니다. 이것은 비디오 게임의 리소스 최적화 방법과 유사합니다.

블록-NeRF는 또한 ‘외관 코드’를 도입하여 동적으로 시간을 변경할 수 있습니다.

블록-NeRF로 시간 변경. 이 글의 끝에 포함된 비디오와 고해상도 전체 길이의 보충 비디오를 위한 소스 링크를 참조하십시오. 출처: https://waymo.com/research/block-nerf/

블록-NeRF로 시간 변경. 이 글의 끝에 포함된 비디오와 고해상도 전체 길이의 보충 비디오를 위한 소스 링크를 참조하십시오. 출처: https://waymo.com/research/block-nerf/

새로운 논문은 NeRF 최적화가 자신의 열한계에 접근하고 있음을 시사하며, 가상 현실, 상호작용 구, VFX 작업 등에서 신경 복사 환경의 미래 배포는 평행 작동, 캐싱 및 새로운 접근 방식에 의존할 가능성이 있습니다.

논문의 저자들은 2,800만 개의 이미지를 사용하여 가장 큰 신경 장면을 생성했습니다. 샌프란시스코의 일련의 이웃을 생성했습니다.

블록-NeRF가 샌프란시스코의 그레이스 대성당을 탐색합니다. 이 글의 끝에 포함된 비디오와 고해상도 전체 길이의 보충 비디오를 위한 소스 링크를 참조하십시오. 출처: https://waymo.com/research/block-nerf/

블록-NeRF가 샌프란시스코의 그레이스 대성당을 탐색합니다. 이 글의 끝에 포함된 비디오와 고해상도 전체 길이의 보충 비디오를 위한 소스 링크를 참조하십시오. 출처: https://waymo.com/research/block-nerf/

논문의 주요 저자는 UC 버클리의 매튜 탄칙(Matthew Tancik)이며, 그는 네이버 복사 필드의 공동 발명자입니다. 그는 이 작업을 웨이모에서 인턴으로 수행했습니다.

블록-NeRF는 주로 자율 주행 차량 시스템을 위한 가상 환경 연구로 개발되었습니다.

블록-NeRF의 180도 관점에서 바라본 엠바카데로 도로. 이 글의 끝에 포함된 비디오와 고해상도 전체 길이의 보충 비디오를 위한 소스 링크를 참조하십시오. 출처: https://waymo.com/research/block-nerf/

블록-NeRF의 180도 관점에서 바라본 엠바카데로 도로. 이 글의 끝에 포함된 비디오와 고해상도 전체 길이의 보충 비디오를 위한 소스 링크를 참조하십시오. 출처: https://waymo.com/research/block-nerf/

블록-NeRF에서 동적으로 변경할 수 있는 다른 요소로는 렌즈 개구, 날씨, 계절이 있습니다.

그러나 계절을 변경하면 환경에 관련된 변경이 발생할 수 있으며, 이는 더 광범위한 입력 데이터셋을 필요로 합니다.

世界末日 렌더링

이 글의 끝에 포함된 비디오를 보면, 블록-NeRF 네트워크가 연결된 NeRF 환경이 매우 희박한 것을 알 수 있습니다. 다양한 이유로, 로봇 시스템, 차량, 보행자 및 기타 일시적인 객체를 시뮬레이션된 시작 환경으로 제공하기 위해 원본 자료에서 의도적으로 제거되었습니다. 그러나 이것은 제거된 차량의 그림자와 같은 일부 아티팩트를 남겼습니다.

제거된 차량의 그림자. 출처: https://waymo.com/research/block-nerf/

제거된 차량의 그림자. 출처: https://waymo.com/research/block-nerf/

네트워크는 다양한 조명 환경을 포함하여 일일 또는 야간과 같은 각 원하는 조건에 대한 데이터를 포함하도록 훈련되었습니다.

블록-NeRF 렌더링의 요구되는 측면. 출처: https://waymo.com/research/block-nerf/

블록-NeRF 렌더링의 요구되는 측면. 출처: https://waymo.com/research/block-nerf/

환경 및 윤리적 고려

최근 몇 년 동안 연구 제출물에는 제안된 작업의 가능한 윤리적 및 환경적 결과에 대한 주의와 면책조항이 포함되었습니다. 블록-NeRF의 경우, 저자들은 에너지 요구 사항이 높으며, 단기 및 장기 일시적인 객체(예: 나무의 잎, 건설 작업)를 계산하는 것이 필요하며, 이는 도시 영역의 신경 모델을 최신 상태로 유지하기 위해 정기적으로 소스 데이터를 다시 스캔해야 하므로 감시를 증가시킬 수 있습니다.

저자들은 다음과 같이 말합니다:

‘이 작업이 적용되는 규모에 따라, 컴퓨팅 요구 사항은 환경 손상을 유발하거나 악화시킬 수 있습니다. 본 논문에서 언급한 바와 같이, 캐싱 방법과 같은 추가 작업을 통해 컴퓨팅 요구 사항을 줄여 환경 손상을 완화할 수 있습니다.’

감시와 관련하여, 다음과 같이 계속합니다:

‘이 작업의 미래 응용 프로그램은 더 큰 데이터 수집 노력을 필요로 할 수 있으며, 이는 추가적인 개인 정보 문제를 야기할 수 있습니다. 구글 스트리트 뷰와 같은 서비스에서 이미 공공 도로의詳細한 이미지를 찾을 수 있지만, 본 방법론은 환경에 대한 반복적인 스캔을 촉진할 수 있습니다. 자율 주행 차량 분야의 일부 회사에서는 이미 자신의 차량을 사용하여 정기적으로 지역을 스캔하고 있지만, 일부는 더 민감하지 않은 LiDAR 스캔만 사용합니다.’

방법 및 해결책

개별 NeRF 환경은 이론적으로任意의 크기로 축소될 수 있으며, 블록-NeRF 배열로 조립됩니다. 이것은 내용이 확실히 변경될 수 있는 내용(예: 나무)을 세부적으로 포함하고, 건설 작업과 같은 내용을 식별하고 관리하는 길을 열어줍니다.

그러나 이 초기 연구에서,離散적인 NeRF 블록은 실제 도시 블록으로 제한되며, 50%의 중복을 보장하여 사용자가 네트워크를 탐색할 때 일관된 전환을 제공합니다.

각 블록은 지리적 필터로 제한됩니다. 저자들은 이 프레임워크의 이 부분이 자동화될 수 있으며, 놀랍게도, 그들의 구현은 구글 맵스 대신 오픈스트리트맵을 사용한다고 언급합니다.

블록-NeRF '활성' 렌더링 공간의 교차점 반경. 출처: 웨이모

블록-NeRF ‘활성’ 렌더링 공간의 교차점 반경. 출처: 웨이모

블록은 병렬로 훈련되며, 필요한 블록은 요구에 따라 렌더링됩니다. 또한, 블록 세트 간에 조정되는 혁신적인 외관 코드가 있습니다.

블록-NeRF 세그먼트는 노출에 따라 조건화되며, 이는 사진 소스 자료의 고동적 범위(HDR)와 유사합니다. 출처: 웨이모

블록-NeRF 세그먼트는 노출에 따라 조건화되며, 이는 사진 소스 자료의 고동적 범위(HDR)와 유사합니다. 출처: 웨이모

조명 및 기타 환경 변수를 전환하는 기능은 NeRF-W에서 도입된 생성적 잠재 최적화를 통해 제공됩니다.

데이터

일반적인 도시 데이터셋인 CityScapes는 블록-NeRF에 필요한 세부 작업에 적합하지 않다는 것을 발견한 연구자들은 자신의 데이터셋을 생성했습니다. 12개의 카메라를 사용하여 360도 관점의 이미지를 캡처했습니다.

샌프란시스코의 알라모 광장과 미션 베이 지역을 커버했습니다. 알라모 광장의 경우, 약 960m x 570m의 영역을 커버하며, 35개의 블록-NeRF 인스턴스로 나누어져 있으며, 각 인스턴스는 38~48개의 다른 데이터 수집 실행에서 훈련되었습니다.

각 블록-NeRF의 기여 이미지 수는 64,575~108,216개였으며, 이 지역에서 표현된 총 운전 시간은 1,330개의 다른 데이터 수집 실행에서 13.4시간으로 계산되었습니다. 이는 알라모 광장만으로 2,818,745개의 훈련 이미지를 생성했습니다. 미션 베이의 데이터 수집에 대한 추가 세부 정보는 논문을 참조하십시오.

 

최초로 게시된 날짜: 2022년 2월 11일.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai