Anderson의 관점

뉴럴 서치 앤 레스큐 플라이쓰루 환경을 위한 Mega-NeRF 생성

mm
Unite.AI를 Google의 선호 소스에 추가

카네기 멜런 대학교와 자율 주행 기술 회사인 Argo AI 간의 새로운 연구 협력이 Neural Radiance Fields(NeRF)를 기반으로 동적 플라이쓰루 환경을 생성하기 위한 경제적인 방법을 개발했습니다. 이 방법은 드론으로 촬영한 영상을 사용합니다.

Mega-NeRF

새로운 접근 방식인 Mega-NeRF는 평균 NeRF 렌더링 표준에 비해 40배의 속도 향상을 얻으며, 표준적인 탱크와 사원과는 다르게 새로운 NeRF 논문에서 반복되는 것과는 다르게 구별됩니다.

새로운 논문은 Mega-NeRF: Scalable Construction of Large-Scale NeRFs for Virtual Fly-Throughs라는 제목으로, 카네기 멜런 대학교의 3명의 연구자에 의해 작성되었으며, 그 중 한 명은 Argo AI를 대표합니다.

서치 앤 레스큐를 위한 NeRF 랜드스케이프 모델링

저자들은 서치 앤 레스큐(SAR)가 उनक의 기술의 최적의 사용 사례일 것이라고 생각합니다. 서치 앤 레스큐 랜드스케이프를 평가할 때, 드론은 대역폭과 배터리 수명 제한으로 인해 자세한 또는 포괄적인 커버리지 얻을 수 없습니다. 따라서 데이터를 수집한 후에는 정적 2D 항공 사진으로 변환됩니다.

저자들은 다음과 같이 말합니다:

‘우리는 신경망 렌더링이 3D로 분석을 높여 응답 팀이 실시간으로 자세한 수준으로 현장의 지형을 조사할 수 있도록 하는 미래를 상상합니다.’

이 사용 사례와 관련하여, 저자들은 1일 내에 훈련할 수 있는 복잡한 NeRF 기반 모델을 생성하려고 시도했습니다. 서치 앤 레스큐 작전에서 생존자의 수명은 24시간 내에 최대 80%까지 감소할 수 있기 때문입니다.

저자들은 Mega-NeRF 모델을 훈련하는 데 필요한 드론 캡처 데이터셋이 표준 NeRF 데이터셋보다 훨씬 크다고 말합니다. 또한 모델 용량은 기본 포크 또는 NeRF의 파생물보다 훨씬 높아야 합니다. 또한, 탐색 가능성과 상호 작용성이 서치 앤 레스큐 지형도에서 필수적이지만, 표준 실시간 NeRF 렌더는 훨씬 제한된 범위의 사전 계산된 가능한 움직임을 예상합니다.

분할 및 정복

이러한 문제를 해결하기 위해 저자들은 작업을 서브모듈로 분할하는 기하 클러스터링 알고리즘을 만들었습니다. 이는 효과적으로 훈련 중에 동시에 훈련되는 서브-NeRF의 행렬을 생성합니다.

렌더링 시점에, 저자들은 또한 사용자와의 거리에 따라 세부 사항을 조정하는 비디오 게임과 유사한 방식으로, 과도한 사전 처리 없이 완전한 상호 작용을 제공할 수 있는 실시간 시각화 알고리즘을 구현했습니다.

이러한 경제성은 이전 방법보다 더 나은 세부 사항을 제공하며, 과도한 사전 처리를 피하고, 규모에 대한 내재된 제한을 극복하며, 상호 작용성을 희생하지 않고, 여러 일일 훈련을 필요로 하지 않는다고 저자들은 주장합니다.

프로젝트의 사용된 체인드 서브-NeRF는 KiloNeRF의 실시간 렌더링 기능을 기반으로 하지만, 훈련 중에 실제로 ‘샤딩’을 수행하여, 훈련 후에 씬을 변환하는 대신에, 씬을 탐색할 수 있는 공간으로 변환합니다.

서브모듈을 위한 이산적인 훈련 세트가 생성되며, 훈련 이미지 픽셀의 궤적이 해당 셀을 나타낼 수 있습니다. 따라서 각 모듈은 인접 셀과 완전히 별도로 훈련됩니다.

서브모듈을 위한 이산적인 훈련 세트가 생성되며, 훈련 이미지 픽셀의 궤적이 해당 셀을 나타낼 수 있습니다. 따라서 각 모듈은 인접 셀과 완전히 별도로 훈련됩니다.

저자들은 Mega-NeRF를 ‘공간적으로 인식되는 방식으로 레이어 연결을 희소화하는 NeRF 아키텍처의 재구성’이라고 설명합니다.

NeRF, NeRF++, Mega-NeRF의 훈련 및 데이터 이산화 비교

NeRF, NeRF++, Mega-NeRF의 훈련 및 데이터 이산화 비교

저자들은 또한 Mega-NeRF의 새로운 시간적 일관성 전략이 과도한 사전 처리의 필요를 피하고, 규모에 대한 내재된 제한을 극복하며, 이전 작품보다 더 높은 수준의 세부 사항을 제공한다고 주장합니다.

연구자들은 또한 100,000제곱미터의 산업 단지 주변에서 드론으로 촬영한 수천 개의 고해상도 이미지로 구성된 대규모 데이터셋을 공개하고 있습니다. 두 개의 사용 가능한 데이터셋은 ‘빌딩’‘러블’입니다.

이전 작품의 개선

논문은 이전의 유사한 시도,包括 SneRG, PlenOctree, 및 FastNeRF가 모두 캐싱이나 사전 처리를 사용하여 추가적인 컴퓨팅 및/또는 시간 오버헤드를 초래한다고 지적합니다.

이러한 오버헤드는 가상 서치 앤 레스큐 환경의 생성에 적합하지 않습니다.

KiloNeRF는 기존의 다층 퍼셉트론 컬렉션에서 서브-NeRF를 파생하지만, 내부 씬에 대한 제한된 확장성과 용량으로 인해 더 높은 규모의 환경을 다루는 데 제한됩니다.

FastNeRF는 ‘베이크된’, 사전 계산된 NeRF 모델을 전용 데이터 구조에 저장하고, 사용자가 전용 MLP 또는 구형 기저 컴퓨팅을 통해 이를 탐색할 수 있도록 허용합니다.

반면에, NeRF++는 기본적으로 제한되지 않은 외부 환경을 다룰 수 있으며, 포그라운드와 백그라운드 영역으로 потен적으로 탐색 가능한 공간을 구분하고, 각 영역에 대한 전용 MLP 모델을 사용합니다.

마지막으로, NeRF in the Wild는 무제한 공간을 직접 다루지 않지만, Phototourism 데이터셋에서 이미지 품질을 개선하며, Mega-NeRF 아키텍처에서 사용된 외관 임베딩을 따릅니다.

저자들은 또한 Mega-NeRF가 워싱턴 대학교의 Building Rome in a Day 프로젝트와 같은 구조에서 운동(SfM) 프로젝트에서 영감을 받았다고 인정합니다.

시간적 일관성

Mega-NeRF는 PlenOctree와 유사하게, 사용자焦点 근처의粗糙한 캐시를 사전 계산합니다. 그러나 PlenOctree와 달리, Mega-NeRF는 계산된 트리를 분할하여 재사용하며, NeRF의緊密하게 결합된 처리 규칙을 분리하는 추세를 따릅니다.

왼쪽: PlenOctree의 단일 사용 계산, 중간: Mega-NeRF의 동적 확장, 오른쪽: 재사용된 옥트리

왼쪽: PlenOctree의 단일 사용 계산, 중간: Mega-NeRF의 동적 확장, 오른쪽: 재사용된 옥트리

이 계산의 경제성은 처리 부담을 đáng kể하게 줄이며, 사전 계산된 모든 것을 예측하여 캐싱하는 대신에, 지역 캐시로서의 실시간 계산을 사용한다고 저자들은 주장합니다.

가이드 샘플링

초기 샘플링 후, Mega-NeRF는 옥트리 정련 후에 2차 가이드 레이 샘플링을 수행하여 이미지 품질을 개선합니다. 이를 위해 Mega-NeRF는 옥트리 데이터 구조의 기존 가중치를 사용하여 단일 패스를 사용합니다.

위의 이미지에서 볼 수 있듯이, 표준 샘플링은 과도한 계산을浪費하지만, Mega-NeRF는 기하학적 존재에 대한 지식을 사용하여 계산을 제한합니다.

데이터 및 훈련

연구자들은 Mega-NeRF를 여러 데이터셋에서 테스트했으며, 두 개의 수동으로 제작된 데이터셋은 산업 지대의 드론 영상을 사용했습니다. 첫 번째 데이터셋인 Mill 19 – Building은 500 x 250 제곱미터의 영역에서 촬영된 영상을 특징으로 합니다. 두 번째 데이터셋인 Mill 19 – Rubble는 인접한 건설 현장에서 촬영된 영상을 특징으로 합니다.

논문의 보충 자료에서: 왼쪽, Parrot Anafi 드론(중앙, 오른쪽遠景)에 의해 커버될 영역

논문의 보충 자료에서: 왼쪽, Parrot Anafi 드론(중앙, 오른쪽遠景)에 의해 커버될 영역

또한, 아키텍처는 중국 선전 대학의 Visual Computing Research Center에서 제공하는 UrbanScene3D의 여러 씬과, Indiana University의 IU Computer Vision Lab에서 제공하는 Quad 6k 데이터셋에 대해 테스트되었습니다.

훈련은 8개의 서브모듈에서 수행되었으며, 각 모듈에는 256개의 은닉 유닛이 있는 8개의 레이어와, 이후 128개의 채널 ReLU 레이어가 있습니다. NeRF와 달리, 동일한 MLP가 粗糙한 샘플과 정련된 샘플을 쿼리하는 데 사용되며, 이는 모델 크기를 줄이고, 이후 렌더링 단계에서 粗糙한 네트워크 출력을 재사용할 수 있도록 합니다. 저자들은 이를 통해 모델 쿼리당 25%의 모델 크기를 절약할 수 있다고 주장합니다.

1024개의 레이들은 Adam을 사용하여 배치당 샘플링되었으며, 초기 학습률은 5×104에서 5×10-5로 감소했습니다. 외관 임베딩은 이전에 언급된 NeRF in the Wild와 동일한 방식으로 처리되었습니다. 혼합 정밀도 샘플링(32비트 부동 소수점보다 낮은 정밀도로 훈련)가 사용되었으며, MLP 너비는 2048개의 은닉 유닛으로 고정되었습니다.

테스트 및 결과

연구자들의 테스트에서, Mega-NeRF는 500,000번의 반복 후에 NeRF, NeRF++, 및 DeepView를 능가했습니다. Mega-NeRF의 대상 시나리오는 시간 제한이 있으므로, 연구자들은 더 느린 이전 프레임워크에 24시간을 넘는 추가 시간을 허용했으며, Mega-NeRF가 여전히 이러한 이점을 가진 채로 이전 프레임워크를 능가한다고 보고했습니다.

사용된 지표는 피크 신호 대 노이즈 비율(PSNR), VGG 버전의 LPIPS, 및 SSIM이었습니다. 훈련은 8개의 V100 GPU가 장착된 단일 머신에서 수행되었으며, 효과적으로 256GB의 VRAM과 5120개의 텐서 코어를 사용했습니다.

Mega-NeRF 실험의 샘플 결과(더 많은 결과는 논문을 참조하십시오)

Mega-NeRF 실험의 샘플 결과(더 많은 결과는 논문을 참조하십시오)

프로젝트 페이지는 https://meganerf.cmusatyalab.org/에 있으며, 공개된 코드는 https://github.com/cmusatyalab/mega-nerf에 있습니다.

最初에 2021년 12월 21일에 게시되었습니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai