AI 모델 및 플랫폼
싱글뷰 3D 재구성의 작동 원리

전통적으로, 卷积 신경망을 기반으로 하는 싱글뷰 객체 재구성 모델은 재구성 작업에서 놀라운 성능을 보여주었습니다. 최근 몇 년 동안, 싱글뷰 3D 재구성은 AI 커뮤니티에서 인기 있는 연구 주제로 부상했습니다. 구체적인 방법론에 관계없이, 모든 싱글뷰 3D 재구성 모델은 인코더-디코더 네트워크를 자신의 프레임워크 내에 통합하는 공통 접근 방식을 공유합니다. 이 네트워크는 출력 공간의 3D 구조에 대한 복잡한 추론을 수행합니다.
이 기사에서, 우리는 싱글뷰 3D 재구성이 실제 시간에 어떻게 작동하는지 및 이러한 프레임워크가 재구성 작업에서 직면하는 현재의 도전 과제를 탐구할 것입니다. 우리는 싱글뷰 3D 재구성 모델에서 사용되는 다양한 핵심 구성 요소와 방법을 논의하고, 이러한 프레임워크의 성능을 향상시키기 위한 전략을 탐색할 것입니다. 또한, 인코더-디코더 방법을 사용하는 최신 프레임워크가 생성한 결과를 분석할 것입니다. 시작해 봅시다.
싱글뷰 3D 객체 재구성
싱글뷰 3D 객체 재구성은 단일 관점 또는 단일 이미지에서 객체의 3D 모델을 생성하는 것을涉及합니다. 예를 들어, 이미지에서 모터사이클의 3D 구조를 추론하는 것은 복잡한 과정입니다. 이는 부품의 구조적 배치, 저수준 이미지 신호, 고수준 의미 정보에 대한 지식을 결합합니다. 이 스펙트럼에는 두 가지 주요 측면이 포함됩니다: 재구성 및 인식. 재구성 과정은 음영, 텍스처, 시각적 효과와 같은 신호를 사용하여 입력 이미지의 3D 구조를 식별합니다. 반면, 인식 과정은 입력 이미지를 분류하고 데이터베이스에서 적합한 3D 모델을 검색합니다.
현재 싱글뷰 3D 객체 재구성 모델은 아키텍처에 따라 다를 수 있지만, 모두 자신의 프레임워크에 인코더-디코더 구조를 포함하는 것을 공유합니다. 이 구조에서, 인코더는 입력 이미지를 잠재적인 표현으로 매핑하고, 디코더는 출력 공간의 3D 구조에 대한 복잡한 추론을 수행합니다. 이 작업을 성공적으로 수행하기 위해, 네트워크는 고수준 및 저수준 정보를 모두 통합해야 합니다. 또한, 많은 최신 인코더-디코더 방법은 싱글뷰 3D 재구성 작업에서 인식에 의존합니다. 이는 재구성 능력을 제한합니다. 또한, 현대적인 卷积 신경망의 싱글뷰 3D 객체 재구성 성능은 명시적으로 3D 객체 구조를 추론하지 않아도 초과할 수 있습니다. 그러나, 싱글뷰 객체 재구성 작업에서 卷积 신경망의 지배는 다양한 실험 절차, 평가 프로토콜 및 데이터셋 구성에 의해 영향을 받습니다. 이러한 요인으로 인해 프레임워크는捷径 해결책, 즉 이미지 인식을 찾을 수 있습니다.
전통적으로, 싱글뷰 3D 객체 재구성 프레임워크는 재구성 작업에 대해 형태에서 음영 접근 방식을 사용합니다. 이는 텍스처 및 초점이 재구성 작업을 위한 이국적인 관점으로 작용합니다. 이러한 기술은 단일 깊이 신호를 사용하므로, 표면의 가시적인 부분에 대해 이유를 제공할 수 있습니다. 또한, 많은 싱글뷰 3D 재구성 프레임워크는 구조적 지식과 함께 여러 신호를 사용하여 단일 모노큘러 이미지에서 깊이를 추정합니다. 이는 이러한 프레임워크가 가시적인 표면의 깊이를 예측할 수 있도록 합니다.
그러나, 효과적인 싱글뷰 3D 재구성을 위해서, 모델은 이미지의 가시적인 객체의 3D 구조에 대해 추론할 뿐만 아니라, 데이터에서 학습된 특정 사전 지식을 사용하여 이미지의 보이지 않는 부분을 추측해야 합니다. 이를 달성하기 위해, 대부분의 모델은 2D 이미지를 3D 형상으로 매핑하는 데 훈련된 卷积 신경망 구조를 사용합니다. 일부 프레임워크는 3D 형상의 보クセ르 기반 표현을 사용하고, 잠재적인 표현을 사용하여 3D 업-컨볼루션을 생성합니다. 일부 프레임워크는 또한 출력 공간을 계층적으로 분할하여 계산 및 메모리 효율성을 향상시킵니다. 이는 모델이 더 높은 해상도의 3D 형상을 예측할 수 있도록 합니다. 최근 연구는 卷积 신경망을 사용하여 약한 형태의 giám sát을 사용하여 3D 형상 예측을 수행하는 데 중점을 두고 있습니다. 이는 예측된 형상과 그에 해당하는 실제 예측을 비교하여 형상 회귀자를 훈련하거나, 평균 형상을 훈련하는 데 여러 학습 신호를 사용합니다. 싱글뷰 3D 재구성의 제한된 발전에 대한 또 다른 이유는 이 작업을 위한 훈련 데이터의 제한된 양입니다.
계속해서, 싱글뷰 3D 재구성은 기하학적으로 및 의미론적으로 시각적 데이터를 해석하는 복잡한 작업입니다. 이러한 두 가지 측면은 완전히 다르지는 않지만, 기하학적 재구성에서 의미론적 인식까지 다른 스펙트럼을 차지합니다. 재구성 작업은 이미지의 3D 구조에 대한 픽셀 단위의 추론을 포함합니다. 재구성 작업은 이미지의 내용에 대한 의미론적 이해를 필요로 하지 않으며, 텍스처, 색상, 음영, 그림자, 관점 및 초점과 같은 저수준 이미지 신호를 사용하여 달성할 수 있습니다. 반면, 인식은 이미지의 의미론적 이해를 사용하여 객체를 분류하고 데이터베이스에서 해당하는 3D 모델을 검색합니다. 인식 작업은 이미지에 없는 객체의 부분에 대해 강력한 추론을 제공할 수 있지만, 의미론적 해결책은 데이터베이스에 있는 객체로 설명할 수 있는 경우에만 가능합니다.
인식 및 재구성 작업은 서로 다를 수 있지만, 둘 다 입력 이미지에 포함된 귀중한 정보를 무시하는 경향이 있습니다. 이러한 두 가지 작업을 함께 사용하여 가능한 한 가장 정확한 3D 형상을 얻는 것이 좋습니다. 즉, 싱글뷰 3D 재구성 작업을 최적화하기 위해서, 모델은 구조적 지식, 저수준 이미지 신호 및 객체에 대한 고수준 이해를 모두 사용해야 합니다.
싱글뷰 3D 재구성: 전통적인 설정
싱글뷰 3D 재구성 프레임워크의 전통적인 설정을 설명하고 설정을 분석하기 위해, 우리는 객체의 3D 형상을 추정하는 데 사용되는 표준 설정을 사용할 것입니다. 훈련 목적으로 사용되는 데이터셋은 ShapeNet 데이터셋이며, 13개의 클래스에서 성능을 평가하여 모델이 데이터셋의 클래스 수에 따라 형상 추정 성능을 이해할 수 있도록 합니다.
대부분의 현대적인 卷积 신경망은 단일 이미지를 사용하여 높은 해상도의 3D 모델을 예측할 수 있으며, 이러한 프레임워크는 출력의 표현에 따라 분류할 수 있습니다: 깊이 맵, 점 클라우드 및 보クセ르 그리드. 모델은 OGN 또는 옥트리 생성 네트워크를 사용하여 대표적인 방법으로 역사적으로 보クセ르 그리드 접근 방식을 능가했습니다. 옥트리 생성 네트워크 접근 방식은 모델이 높은 해상도의 형상을 예측할 수 있도록 하며, 옥트리를 사용하여 차지하는 공간을 효율적으로 표현합니다.
기준선
결과를 평가하기 위해, 모델은 두 가지 기준선을 사용하여 문제를 순수한 인식 작업으로 간주합니다. 첫 번째 기준선은 클러스터링을 기반으로 하며, 두 번째 기준선은 데이터베이스 검색을 수행합니다.
클러스터링
클러스터링 기준선에서, 모델은 K-평균 알고리즘을 사용하여 훈련 형상을 K개의 하위 카테고리로 클러스터링합니다. 알고리즘은 32*32*32 보クセ르화된 형상을 벡터로 평탄화하여 실행됩니다. 클러스터 할당이 결정된 후, 모델은 더 높은 해상도의 모델로 돌아가고, 각 클러스터 내에서 평균 형상을 계산합니다. 평균 형상은 IoU 또는 교차 합집합의 평균을 최대화하여 최적 값을 계산하여 임계값으로 설정됩니다. 모델은 훈련 데이터 내에서 3D 형상과 이미지 간의 관계를 알고 있으므로, 모델은 이미지를 해당 클러스터와 쉽게 일치시킬 수 있습니다.
검색
검색 기준선은 3D 행렬 형상 간의 쌍별 유사성을 사용하여 임베딩 공간을 구성합니다. 모델은 Sammon 매핑 접근 방식을 사용하여 행렬의 각 행을 저차원 설명자로 압축합니다. 또한, 두 개의 임의 형상 간의 유사성을 계산하기 위해, 모델은 라이트 필드 설명자를 사용합니다. 또한, 모델은 이미지에 대한 설명자를 임베딩 공간에 매핑하는 데 사용되는 卷积 신경망을 훈련합니다.
분석
싱글뷰 3D 재구성 모델은 서로 다른 전략을 따르므로, 일부 영역에서는 다른 모델을 능가하지만, 다른 영역에서는 부족합니다. 다른 프레임워크를 비교하고 성능을 평가하기 위해, 우리는 평균 IoU 점수를 포함하여 다양한 지표를 사용합니다.

위의 이미지에서 볼 수 있듯이, 다양한 아키텍처에도 불구하고, 현재의 최신 3D 재구성 모델은 거의 유사한 성능을 제공합니다. 그러나, 순수한 인식 방법임에도 불구하고, 검색 프레임워크가 평균 및 중위 IoU 점수에서 다른 모델을 능가하는 것은 흥미롭습니다. 클러스터링 프레임워크는 AtlasNet, OGN 및 Matryoshka 프레임워크를 능가하는 견고한 결과를 제공합니다. 그러나, 가장 예상치 못한 결과는 완벽한 검색 아키텍처를 사용하는 Oracle (ORCL ) NN이 다른 모든 방법을 능가하는 것입니다. 평균 IoU 점수를 계산하면 비교에 도움이 되지만, 결과의 분산이 높기 때문에 전체 그림을 제공하지는 않습니다.
공통 평가 지표
싱글뷰 3D 재구성 모델은 다양한 작업에서 성능을 분석하기 위해 다양한 평가 지표를 사용합니다. 다음은 일반적으로 사용되는 평가 지표입니다.
교차 합집합
교차 합집합의 평균은 싱글뷰 3D 재구성 모델의 성능을 평가하기 위한 일반적인 지표입니다. 교차 합집합은 모델이 예측한 형상의 품질을 제공합니다. 그러나, 교차 합집합은 단일 지표로 모델을 평가하기에는 충분하지 않습니다.
샴퍼 거리
샴퍼 거리는 점 클라우드에서 정의되며, 다양한 3D 표현에 만족할 만한 방식으로 적용할 수 있도록 설계되었습니다. 그러나, 샴퍼 거리는 아웃라이어에 매우 민감하여, 모델의 성능을 평가하기 위한 문제가 있는 지표입니다.
F-점수
F-점수는 다중뷰 3D 재구성 모델에서 일반적으로 사용되는 평가 지표입니다. F-점수는 재현율과 정밀도의 조화 평균입니다. 정밀도는 재구성된 점수의 비율을 측정하여 재구성의 정확성을 평가합니다. 재현율은 실제 점수의 비율을 측정하여 재구성의 완전성을 평가합니다. 또한, 거리 임계값을 변경하여 F-점수의 엄격성을 제어할 수 있습니다.
클래스별 분석
위의 프레임워크가 제공하는 성능의 유사성은 클래스의 하위 집합에서 실행되는 방법의 결과가 아닙니다. 다음 그림은 다양한 클래스에서 일관된 상대적 성능을 보여줍니다. 오라클 NN 검색 기준선이 최고의 결과를 달성합니다. 모든 방법은 높은 분산을 보입니다.

또한, 클래스에 사용된 훈련 샘플의 수는 클래스별 성능에 영향을 미칠 수 있습니다. 그러나, 다음 그림에서 보여주듯이, 클래스별 성능은 클래스의 샘플 수와 상관관계가 없습니다.

질적 분석
위에서 논의된 정량적 결과는 다음 이미지에 보여진 질적 결과를 뒷받침합니다.

대부분의 클래스에서, 클러스터링 기준선과 디코더 기반 방법이 생성한 예측 사이에显著한 차이가 없습니다. 클러스터링 접근 방식은 샘플과 평균 클러스터 형상 간의 거리가 높거나, 평균 형상이 클러스터를 충분히 설명할 수 없는 경우에 결과를 제공하지 못합니다. 반면, 디코더 기반 방법과 검색 아키텍처를 사용하는 프레임워크는 가장 정확하고 매력적인 결과를 제공합니다. 이는 이러한 프레임워크가 생성된 3D 모델에 미세한 세부 사항을 포함할 수 있기 때문입니다.
싱글뷰 3D 재구성: 최종 생각
이 기사에서, 우리는 싱글뷰 3D 객체 재구성에 대해 논의했습니다. 또한, 두 가지 기준선, 즉 검색 및 클러스터링에 대해 논의했습니다. 검색 기준선 접근 방식이 현재의 최신 모델을 능가하는 것으로 나타났습니다. 마지막으로, 싱글뷰 3D 객체 재구성이 AI 커뮤니티에서 가장 인기 있는 주제 중 하나이며, 최근 몇 년 동안 많은 발전을 이루었음에도 불구하고, 싱글뷰 3D 객체 재구성은 완벽하지 않으며, 향후 몇 년 동안 극복해야 할重大한 장애물이 있습니다.










