AI 모델 및 플랫폼
스플래터 이미지: 초고속 단일 뷰 3D 재구성 시도
단일 뷰 3D 객체 재구성에 대한 합성곱 네트워크는 놀라운 능력을 보여주었습니다. 단일 뷰 3D 재구성 모델은 단일 이미지로 참조하여 객체의 3D 모델을 생성하며, 이는 컴퓨터 비전에서 가장 인기 있는 연구 주제 중 하나입니다.

예를 들어, 위의 이미지에 있는 모터바이크를 고려해 보겠습니다. 그들의 3D 구조를 생성하려면 저수준 이미지에서 고수준 의미 정보와 객체의 구조적 구성에 대한 지식을 결합하는 복잡한 파이프라인이 필요합니다.
이 복잡한 과정으로 인해 단일 뷰 3D 재구성이 컴퓨터 비전에서 주요 도전이 되었습니다. 단일 뷰 3D 재구성의 효율성을 향상하기 위해 개발자들은 스플래터 이미지라는 방법을 작업했습니다. 이 방법은 객체의 초고속 단일 뷰 3D 형태와 3D 외관을 구성하는 것을 목표로 합니다. 핵심적으로, 스플래터 이미지 프레임워크는 3D 표현을 분석하기 위해 가우시안 스플래팅 방법을 사용하며, 이는 속도와 품질을 제공합니다.
최근에 가우시안 스플래팅 방법은 여러 다중 뷰 재구성 모델에서 실시간 렌더링, 향상된 확장 및 빠른 훈련을 위해 구현되었습니다. 그러나 스플래터 이미지는 단일 뷰 재구성 작업에 가우시안 스플래팅 방법을 구현하는 첫 번째 프레임워크입니다.
이 기사에서 우리는 스플래터 이미지 프레임워크가 가우시안 스플래팅을 사용하여 초고속 단일 뷰 3D 재구성을 달성하는 방법을 탐구할 것입니다. 따라서 시작해 보겠습니다.
스플래터 이미지: 초고속 단일 뷰 3D 재구성 시도
이전에도 언급했듯이, 스플래터 이미지는 가우시안 스플래팅 방법에 기반한 단일 뷰 3D 객체 재구성의 초고속 접근 방식입니다. 스플래터 이미지는 가우시안 스플래팅을 단일 3D 객체 생성에 구현하는 첫 번째 컴퓨터 비전 프레임워크입니다. 전통적으로 가우시안 스플래팅은 다중 뷰 3D 객체 재구성 프레임워크를 구동했습니다. 그러나 스플래터 이미지 프레임워크와 이전 방법을 구분하는 것은 학습 기반 접근 방식이며, 테스트에서 재구성은 신경망의 피드 포워드 평가만 필요로 합니다.
스플래터 이미지는 기본적으로 가우시안 스플래팅의 렌더링 품질과 높은 처리 속도에 의존하여 3D 재구성을 생성합니다. 스플래터 이미지 프레임워크는 간단한 디자인을 특징으로 합니다. 프레임워크는 2D 이미지에서 이미지로 신경망을 사용하여 입력 이미지의 각 픽셀에 대한 3D 가우시안을 예측하며, 입력 이미지를 하나의 3D 가우시안으로 매핑합니다. 결과 3D 가우시안은 이미지 형태를 가지며, 스플래터 이미지로 알려져 있으며, 또한 360도 이미지 표현을 제공합니다. 다음 이미지는 이过程를 보여줍니다.

이 과정은 간단하고 직접적이지만, 스플래터 이미지 프레임워크는 가우시안 스플래팅을 사용하여 단일 뷰 3D 표현을 생성할 때 몇 가지 주요 도전을 직면합니다. 첫 번째 주요 장애물은 객체의 모든 측면을 나타내는 가우시안 혼합을 출력으로 생성하는 신경망을 설계하는 것입니다. 이를 해결하기 위해 스플래터 이미지는 가우시안 혼합이 순서가 없는 항목의 집합임에도 불구하고 여전히 순서가 있는 데이터 구조에 저장될 수 있다는 사실을 활용합니다. 따라서 프레임워크는 3D 가우시안을 포함하는 2D 이미지 컨테이너를 사용하며, 컨테이너의 각 픽셀에는 하나의 가우시안의 매개변수가 포함됩니다.
3D 가우시안 집합을 이미지에 저장함으로써 스플래터 이미지 프레임워크는 이미지에서 이미지로 신경망을 학습할 때 발생하는 재구성 장애물을 줄일 수 있습니다. 이 접근 방식을 사용하면 재구성 프로세스를 효율적인 2D 연산자만 사용하여 구현할 수 있으며, 3D 연산자에 의존할 필요가 없습니다. 또한 스플래터 이미지 프레임워크에서 3D 표현은 3D 가우시안의 혼합으로, 가우시안 스플래팅이 제공하는 렌더링 속도와 메모리 효율성의 이점을 활용할 수 있습니다. 이는 훈련과 추론 모두에서 효율성을 향상시킵니다. 스플래터 이미지 프레임워크는 단일 뷰 3D 표현을 생성할 뿐만 아니라, 표준 3D 객체 벤치마크에서 단일 GPU로 훈련할 수 있는 놀라운 효율성을 보여줍니다. 또한 스플래터 이미지 프레임워크는 여러 이미지를 입력으로 사용할 수 있습니다. 이를 통해 개별 가우시안 혼합을 공통 참조로 등록한 다음 각 뷰에서 예측된 가우시안 혼합의 조합을 취할 수 있습니다. 프레임워크는 또한 예측 중에 서로 다른 뷰가 통신할 수 있도록 가벼운 크로스 어텐션 레이어를 아키텍처에 주입합니다.
경험적으로, 스플래터 이미지 프레임워크는 객체의 단일 측면만 보는 경우에도 객체의 360도 재구성을 생성할 수 있습니다. 프레임워크는 2D 이웃의 다양한 가우시안을 3D 객체의 다양한 부분에 할당하여 생성된 360도 정보를 2D 이미지에 인코딩합니다. 또한 프레임워크는 몇 가지 가우시안의 불투명도를 0으로 설정하여 포스트 프로세싱 중에 비활성화합니다.
요약하면, 스플래터 이미지 프레임워크는
- 가우시안 스플래팅 접근 방식을 사용하여 단일 뷰 3D 객체 재구성을 생성하는 새로운 접근 방식입니다.
- 다중 뷰 3D 객체 재구성을 위한 방법을 확장합니다.
- 표준 벤치마크에서 예외적인 속도와 품질로 3D 객체 재구성 성능을 달성합니다.
스플래터 이미지: 방법론 및 아키텍처
가우시안 스플래팅
스플래터 이미지 프레임워크는 단일 뷰 3D 객체 재구성을 생성하기 위해 가우시안 스플래팅 방법을 구현합니다. 간단히 말해, 가우시안 스플래팅은 3D 이미지를 재구성하고 실시간 렌더링하는 래스터화 방법입니다. 이미지의 3D 공간은 가우시안으로 참조되며, 기계 학습 기법은 각 가우시안의 매개변수를 학습합니다. 가우시안 스플래팅은 렌더링 중에 훈련이 필요하지 않습니다. 다음 이미지는 3D 가우시안 스플래팅의 아키텍처를 요약합니다.

3D 가우시안 스플래팅은 먼저 입력 이미지 집합을 사용하여 포인트 클라우드를 생성합니다. 가우시안 스플래팅은 입력 이미지를 사용하여 카메라의 외부 매개변수(기울기 및 위치)를 추정합니다. 이러한 매개변수는 포인트 클라우드를 계산하는 데 사용됩니다. 다양한 기계 학습 방법을 사용하여 가우시안 스플래팅은 각 가우시안에 대해 네 가지 매개변수를 최적화합니다. 위치(どこ에 위치하는지), 공분산(스케일링 또는 3×3 행렬의 확장), 색상(RGB 색상 구성), 알파(투명도). 최적화 프로세스는 각 카메라 위치에서 이미지를 렌더링하고 원래 이미지와 가장 유사한 매개변수를 결정합니다. 결과적으로, 3D 가우시안 스플래팅 출력은 원래 이미지와 가장 유사한 이미지를 생성합니다.

さらに, 가우시안 스플래팅의 불투명도 함수와 색상 함수는 3D 점의 방향에 대한 방사선 필드를 제공합니다. 프레임워크는 방사선 필드를 픽셀을 통과하는 레이로積分하여 이미지에 렌더링합니다. 가우시안 스플래팅은 이러한 함수를 색깔이 있는 가우시안의 조합으로 나타냅니다. 가우시안의 평균 또는 중심과 가우시안 공분산은 가우시안의 모양과 크기를 결정합니다. 각 가우시안에는 불투명도 속성과 뷰 종속 색상 속성이 있으며, 함께 방사선 필드를 정의합니다.
스플래터 이미지
렌더러 구성 요소는 3D 가우시안 집합을 이미지로 매핑합니다. 단일 뷰 3D 재구성을 수행하기 위해 프레임워크는 3D 가우시안의 혼합을 이미지에서 재구성하는 역함수를 찾습니다. 여기서의 주요 포함은 입력 이미지에 대한 역함수의 효과적인 디자인을 제안하는 것입니다. 특히, 입력 이미지에 대해 프레임워크는 이미지에서 이미지로 신경망 아키텍처를 사용하여 출력 이미지(스플래터 이미지)를 생성합니다. 네트워크는 또한 모양, 불투명도 및 색상을 예측합니다.
스플래터 이미지 프레임워크가 객체의 3D 표현을 재구성하는 방법은 어떻게 될까요? 실제로 스플래터 이미지 프레임워크는 일부 가우시안을 사용하여 보이는 부분을 재구성하고, 나머지 가우시안을 사용하여 보이지 않는 부분을 자동으로 재구성합니다. 효율성을 최대화하기 위해 프레임워크는 불투명도가 0인 경우 가우시안을 자동으로 끌 수 있습니다. 불투명도가 0인 경우 가우시안이 꺼지고, 프레임워크는 이러한 점을 렌더링하지 않으며, 포스트 프로세싱에서 컷됩니다.
이미지 수준 손실
가우시안 스플래팅 방법의 속도와 효율성을 활용하는 주요 이점은 프레임워크가 각 반복에서 모든 이미지를 렌더링할 수 있다는 것입니다. 이는 상대적으로 큰 배치 크기에서조차도 가능합니다. 또한 이는 프레임워크가 분해 가능한 손실뿐만 아니라 픽셀당 손실로 분해되지 않는 이미지 수준 손실을 사용할 수 있음을 의미합니다.
스케일 정규화
단일 뷰에서 객체의 크기를 추정하는 것은 어렵습니다. 또한 손실과 함께 훈련할 때 이 모호성을 해결하는 것은 어려운 작업입니다. 이 문제는 합성 데이터 세트에서 관찰되지 않습니다. 모든 객체는 동일한 카메라 내부 매개변수와 카메라에서 고정된 거리에 렌더링되므로 모호성이 해결됩니다. 그러나 실제 이미지 데이터 세트에서는 모호성이 명백하며, 스플래터 이미지 프레임워크는 모든 객체의 크기를 약간 고정하기 위해 몇 가지 전처리 방법을 사용합니다.
뷰 종속 색상
뷰 종속 색상을 나타내는 데 스플래터 이미지 프레임워크는 람버트 색상 모델을 넘어서 색상을 일반화하기 위해 구면 조화 함수를 사용합니다. 특정 가우시안에 대해 모델은 네트워크에 의해 예측되는 계수를 정의하며, 구면 조화 함수는 색상 변환 함수를 찾는 데 사용됩니다. 모델은 회전할 때 구면 조화 함수가 닫히고, 모든 순서가 닫히기 때문에 이를 수행할 수 있습니다.
신경망 아키텍처
입력 이미지를 가우시안 혼합으로 매핑하는 예측기의 아키텍처는 대부분 SongUNet 프레임워크에서 사용되는 프로세스와 동일합니다. 아키텍처의 마지막 레이어는 색상 모델이 출력 채널의 너비를 결정하는 1×1 컨볼루션 레이어로 대체됩니다. 입력 이미지가 주어지면 네트워크는 출력 채널 텐서를 출력으로 생성하며, 각 픽셀 채널은 오프셋, 불투명도, 회전, 깊이 및 색상을 코드로 변환합니다. 프레임워크는 비선형 함수를 사용하여 매개변수를 활성화하고 가우시안 매개변수를 얻습니다.
다중 뷰 3D 재구성을 위해 스플래터 이미지 프레임워크는 각 입력 뷰에 동일한 네트워크를 적용한 다음 뷰포인트 접근 방식을 사용하여 개별 재구성을 결합합니다. 또한 네트워크는 효율적인 조정 및 정보 교환을 위해 두 가지 수정을 수행합니다. 첫째, 프레임워크는 모델을 각 카메라 포즈에 조건화하고, 각 항목을 사인형 위치 임베딩을 사용하여 인코딩하여 다중 차원을 생성합니다. 둘째, 프레임워크는 서로 다른 뷰의 기능 간에 통신을 허용하는 크로스 어텐션 레이어를 추가합니다.
스플래터 이미지: 실험 및 결과
스플래터 이미지 프레임워크는 재구성의 품질을 평가하기 위해 새로운 뷰 합성 품질을 측정합니다. 프레임워크는 소스 뷰를 사용하여 3D 형태를 렌더링하고 대상 보이지 않는 뷰로 재구성을 수행합니다. 프레임워크는 SSIM 또는 구조적 유사성, PSNR 또는 피크 신호 대 노이즈 비율 및 지각적 품질 또는 LPIPS 점수를 측정하여 성능을 평가합니다.
단일 뷰 3D 재구성 성능
다음 표는 ShapeNet 벤치마크에서 단일 뷰 3D 재구성 작업에서 스플래터 이미지 모델의 성능을 보여줍니다.

관찰할 수 있듯이, 스플래터 이미지 프레임워크는 LPIPS 및 SSIM 점수에서 모든 결정적 재구성 방법을 능가합니다. 점수는 스플래터 이미지 모델이 더 날카로운 재구성을 생성함을 나타냅니다. 또한 스플래터 이미지 모델은 결정적 기준선보다 PSNR 점수도 능가하여 생성된 재구성이 더 정확함을 나타냅니다. 또한 모든 결정적 방법을 능가하는 것 외에도 스플래터 이미지 프레임워크는 효율성을 향상시키기 위해 상대적 카메라 포즈만 필요로 합니다.
다음 이미지는 스플래터 이미지 프레임워크의 질적 능력을 보여줍니다. 모델은 얇고 흥미로운 기하학을 갖는 재구성을 생성하며, 조건 뷰의 세부 사항을 캡처합니다.

다음 이미지는 스플래터 이미지 프레임워크가 생성한 재구성이 이전 모델보다 더 날카롭고 정확하다는 것을 보여줍니다. 특히 얇은 구조와 제한된 가시성과 같은 비정상적인 조건에서 그렇습니다.

다중 뷰 3D 재구성
다중 뷰 3D 재구성 능력을 평가하기 위해 스플래터 이미지 프레임워크는 두 개의 뷰 예측을 위해 SpaneNet-SRN Cars 데이터 세트에서 훈련됩니다. 기존 방법은 다중 뷰 3D 재구성 작업에서 절대 카메라 포즈 조건을 사용합니다. 즉, 모델은 주로 객체의 표준 방향에 의존합니다. 이는 작업을 수행하지만, 절대 카메라 포즈가 새로운 객체 이미지에 대해 종종 알려지지 않은 경우 모델의 적용 가능성을 제한합니다.

최종 생각
이 기사에서 우리는 스플래터 이미지를 소개했습니다. 이는 객체의 초고속 단일 뷰 3D 형태와 3D 외관을 구성하는 것을 목표로 하는 방법입니다. 핵심적으로, 스플래터 이미지 프레임워크는 3D 표현을 분석하기 위해 가우시안 스플래팅 방법을 사용하며, 이는 속도와 품질을 제공합니다. 스플래터 이미지 프레임워크는 2D CNN 아키텍처를 사용하여 입력 이미지에서 가우시안을 예측합니다. 가우시안 스플래팅 방법을 사용하면 빠른 렌더링과 빠른 추론이 가능하여 실제 및 합성 벤치마크에서 빠른 훈련과 더 빠른 평가를 가능하게 합니다.












