AI 모델 및 플랫폼
제로123++: 단일 이미지에서 일관된 다중뷰 확산 베이스 모델로

최근 몇 년 동안 새로운 AI 생성 모델의 성능, 효율성, 생성 능력이 급격히 발전했습니다. 이러한 모델은 광범위한 데이터셋과 2D 확산 생성 기술을 활용하여 텍스트, 이미지, 비디오, GIF 등 다양한 형태의 2D 및 3D 미디어 콘텐츠를 생성할 수 있습니다.
이번 글에서는 제로123++ 프레임워크에 대해 논의하겠습니다. 제로123++는 단일 이미지 입력을 사용하여 3D 일관된 다중뷰 이미지를 생성하는 이미지 조건부 확산 생성 AI 모델입니다. 제로123++ 프레임워크는 이전에 학습된 생성 모델의 이점을 최대한 활용하기 위해 다양한 훈련 및 조건화 기법을 구현하여 오프-더-셸프 확산 이미지 모델에서 미세 조정을 하는데 필요한 노력을 최소화합니다. 우리는 제로123++ 프레임워크의 아키텍처, 작동 방식, 결과 및 성능 비교를 더 깊이 분석하고, 단일 이미지에서 높은 품질의 일관된 다중뷰 이미지를 생성하는其 능력을 분석하겠습니다. 시작해 보겠습니다.
제로123 및 제로123++: 소개
제로123++ 프레임워크는 단일 이미지 입력을 사용하여 3D 일관된 다중뷰 이미지를 생성하는 이미지 조건부 확산 생성 AI 모델입니다. 제로123++는 제로123 또는 제로-1-투-3 프레임워크의 연장선상에 있으며, 오픈소스 단일 이미지-3D 변환을 위한 제로샷 신경 이미지 합성 기술을 활용합니다. 제로123++ 프레임워크는 약속된 성능을 제공하지만, 생성된 이미지에는 기하학적 불일치가 존재하며, 이는 3D 장면과 다중뷰 이미지 간의 간격을 유지하는 주요 이유입니다.
제로-1-투-3 프레임워크는 여러 다른 프레임워크의 기반이며, 이러한 프레임워크는 제로123 프레임워크에 추가적인 계층을 더하여 3D 이미지 생성 시 더 일관된 결과를 얻습니다. 다른 프레임워크는 3D 이미지를 얻기 위해 최적화 기반 접근 방식을 사용합니다. 이러한 기술은 효과적이지만, 다중뷰 이미지 생성을 일관되게 생성할 수 있는 확산 베이스 모델을 구현하면 결과를 개선할 수 있습니다. 따라서 제로123++ 프레임워크는 제로-1-투-3와 함께 새로운 다중뷰 베이스 확산 모델을 스테이블 확산에서 미세 조정합니다.
제로-1-투-3 프레임워크에서 각 새로운 뷰는 독립적으로 생성되며, 이는 확산 모델의 샘플링 특성으로 인해 일관성이 없는 뷰를 생성하는 문제를 초래합니다. 이를 해결하기 위해 제로123++ 프레임워크는 6개의 뷰를 단일 이미지로 결합하여 다중뷰 생성을 위한 올바른 모델링을 제공하는 타일 레이아웃 접근 방식을 채택합니다.
조건화 및 일관성 개선
이미지 조건화 및 다중뷰 이미지 일관성을 개선하기 위해 제로123++ 프레임워크는 다양한 기법을 구현했습니다. 이러한 기법의 주요 목표는 이전에 학습된 스테이블 확산 모델의 기술을 재사용하는 것입니다.
다중뷰 생성
일관된 다중뷰 이미지를 생성하는 데 필요한 중요한 특성은 다중 이미지를 올바르게 결합하여 다중 이미지를 모델링하는 것입니다. 제로-1-투-3 프레임워크에서는 다중뷰 이미지 간의 상관관계를 무시합니다. 각 이미지는 독립적으로 모델링되며, 제로123++ 프레임워크에서는 6개의 이미지를 단일 프레임으로 결합하여 일관된 다중뷰 생성을 제공합니다.

또한, 객체의 방향이 카메라 포즈를 훈련할 때 모호해질 수 있다는 사실이 발견되었습니다. 이를 방지하기 위해 제로-1-투-3 프레임워크는 카메라 포즈를 높이각과 상대적인 방향으로 훈련합니다. 이러한 접근 방식을 구현하려면 입력 뷰의 높이각을 알아야 합니다. 이를 위해 프레임워크는 추가적인 오류를 유발할 수 있는 높이 추정 모듈을 추가합니다.
노이즈 스케줄
스케일-선형 스케줄, 스테이블 확산의 원래 노이즈 스케줄은 주로 지역 세부 사항에 중점을 두고 있습니다. 그러나 다음 이미지를 보면, 낮은 SNR(신호 대 노이즈 비율)을 갖는 단계가 매우 적다는 것을 알 수 있습니다.

이러한 낮은 SNR 단계는 디노이즈링 단계 초기에 발생하며, 이는 전역적인 저주파수 구조를 결정하는 데 중요한 단계입니다. 디노이즈링 단계 또는 훈련 중에 이러한 단계의 수를 줄이면 구조적 변동이 커질 수 있습니다. 이러한 설정은 단일 이미지 생성에 적합하지만, 다른 뷰 간의 전역 일관성을 보장하는 프레임워크의 능력을 제한합니다. 이를 극복하기 위해 제로123++ 프레임워크는 스테이블 확산 2 v-예측 프레임워크에서 LoRA 모델을 미세 조정하여 새로운 작업을 수행합니다.

스케일-선형 노이즈 스케줄을 사용하면 LoRA 모델이 과적합되지 않으며, 이미지를 약간 밝게 만듭니다. 반면에 선형 노이즈 스케줄을 사용하면 LoRA 프레임워크가 입력 프롬프트에 관계없이 빈 이미지를 성공적으로 생성합니다. 이는 노이즈 스케줄이 프레임워크가 새로운 요구 사항에 적응하는 능력에 미치는 영향을 나타냅니다.
로컬 조건에 대한 스케일 참조 어텐션
제로-1-투-3 프레임워크에서 단일 뷰 입력 또는 조건 이미지는 피처 차원에서 노이즈 입력과 결합되어 이미지 조건화를 위해 노이즈됩니다.
이 결합은 대상 이미지와 입력 간에 픽셀 단위의 공간적 상관관계가 올바르지 않게 만듭니다. 제로123++ 프레임워크는 참조 어텐션 접근 방식을 사용하여 올바른 로컬 조건 입력을 제공합니다. 이 접근 방식에서는 디노이즈링 UNet 모델을 참조 이미지에서 실행한 다음, 참조 이미지에서 값 행렬과 셀프 어텐션 키를 모델 입력의 디노이즈링 시에 해당 어텐션 레이어에追加합니다.

참조 어텐션 접근 방식은 미세 조정 없이 참조 이미지와 유사한 텍스처를 갖는 이미지와 의미적 콘텐츠를 생성하는 데 도움이 됩니다. 미세 조정하면 결과가 더 좋아집니다.

전역 조건: 플렉스 디퓨즈
원래 스테이블 확산 접근 방식에서는 텍스트 임베딩이 전역 임베딩의 유일한 출처이며, CLIP 프레임워크를 사용하여 텍스트 임베딩과 모델 잠재 변수 간의 교차 검사를 수행합니다. 따라서 개발자는 텍스트 공간과 CLIP 이미지 간의 정렬을 사용하여 전역 이미지 조건화를 수행할 수 있습니다.
제로123++ 프레임워크는 전역 이미지 조건화를 프레임워크에 통합하기 위해 최소한의 미세 조정이 필요한 훈련 가능한 선형 가이드 메커니즘을 제안합니다. 다음 이미지는 이를 보여줍니다. 전역 이미지 조건화가 없는 경우, 프레임워크가 생성하는 콘텐츠의 품질은 입력 이미지에 해당하는 가시적 영역에서 만족스럽지만, 보이지 않는 영역의 품질은 전역적 의미를 추론하지 못하는 모델의 능력으로 인해 크게 저하됩니다.

모델 아키텍처
제로123++ 프레임워크는 스테이블 확산 2v-모델을 기반으로 다양한 접근 방식과 기술을 사용하여 훈련됩니다. 제로123++ 프레임워크는 랜덤 HDRI 조명을 사용하여 렌더링된 Objaverse 데이터셋에서 미세 조정됩니다. 또한 스테이블 확산 이미지 변형 프레임워크에서 사용되는 훈련 일정 접근 방식을 채택하여 미세 조정을 최소화하고 이전 스테이블 확산에서 가능한 많은 것을 보존합니다.
제로123++ 프레임워크의 작동 또는 아키텍처는 순차적인 단계 또는 훈련 일정으로 나눌 수 있습니다. 첫 번째 단계에서는 제로123++ 프레임워크가 스테이블 확산의 크로스 어텐션 레이어와 셀프 어텐션 레이어의 KV 행렬을 미세 조정합니다. 두 번째 단계에서는 보존적인 학습률을 사용하여 효율성을 최대화합니다.
제로123++: 결과 및 성능 비교
질적 성능
제로123++ 프레임워크의 성능을 평가하기 위해, 우리는 SyncDreamer와 제로-1-투-3-XL과 같은 최고의 상태 오토 프레임워크와 비교합니다. 프레임워크는 다른 범위의 네 개의 입력 이미지와 비교됩니다. 첫 번째 이미지는 Objaverse 데이터셋에서 가져온 전기 장난감 고양이이며, 객체의 뒤쪽에 큰 불확실성이 있습니다. 두 번째 이미지는 소화기 이미지이고, 세 번째 이미지는 SDXL 모델로 생성된 개가 로켓 위에 앉아 있는 이미지입니다. 마지막 이미지는 애니메이션 일러스트레이션입니다.


양적 분석
제로123++ 프레임워크를 양적으로 평가하기 위해, 우리는 Objaverse 데이터셋의 검증 분할 데이터에서 Zero-1-투-3 및 Zero-1-투-3 XL 프레임워크와 비교합니다. 다중뷰 이미지 생성 성능을 평가하기 위해, 우리는 지면 참조 이미지와 6개의 생성된 이미지를 각각 타일링하고, LPIPS 점수를 계산합니다. 결과는 다음과 같습니다.

텍스트-다중뷰 평가
제로123++ 프레임워크의 텍스트-다중뷰 콘텐츠 생성 능력을 평가하기 위해, 우리는 먼저 SDXL 프레임워크를 사용하여 텍스트 프롬프트로 이미지를 생성한 다음, 제로123++ 프레임워크를 생성된 이미지에 적용합니다. 결과는 다음과 같습니다.

제로123++ 깊이 컨트롤넷
제로123++ 프레임워크 외에도, 개발자들은 제로123++ 깊이 컨트롤넷을 출시했습니다. 이는 제로123++의 깊이 제어 버전으로, 컨트롤넷 아키텍처를 사용하여 구축되었습니다. 정규화된 선형 이미지는 후속 RGB 이미지와 함께 렌더링되며, 컨트롤넷 프레임워크는 제로123++ 프레임워크의 기하학을 제어하기 위해 깊이 인식을 사용하여 훈련됩니다.

결론
이번 글에서는 제로123++, 즉 단일 이미지 입력을 사용하여 3D 일관된 다중뷰 이미지를 생성하는 이미지 조건부 확산 생성 AI 모델에 대해 논의했습니다. 이전에 학습된 생성 모델의 이점을 최대한 활용하기 위해, 제로123++ 프레임워크는 다양한 훈련 및 조건화 기법을 구현하여 오프-더-셸프 확산 이미지 모델에서 미세 조정을 하는데 필요한 노력을 최소화합니다. 우리는 제로123++ 프레임워크의 아키텍처, 작동 방식, 결과 및 성능 비교를 분석하고, 단일 이미지에서 높은 품질의 일관된 다중뷰 이미지를 생성하는 능력을 분석했습니다.
그러나, 제로123++ 프레임워크는 효율성과 높은 품질의 다중뷰 이미지를 생성하는 능력에도 불구하고, 여전히 개선할 수 있는 여지가 있습니다. 이러한 개선의 잠재적인 영역에는 제로123++의 일관성 요구 사항을 충족하지 못하는 문제를 해결할 수 있는 2단계 리파인 모델이 포함될 수 있습니다. 또한, 제로123++의 이미지 생성 품질을 더욱 향상시키기 위한 추가적인 확장도 포함될 수 있습니다.
- 2단계 리파인 모델은 제로123++의 일관성 요구 사항을 충족하지 못하는 문제를 해결할 수 있습니다.
- 추가적인 확장은 제로123++의 이미지 생성 품질을 더욱 향상시킬 수 있습니다.












