AI 모델 및 플랫폼
LucidDreamer3D: 간격 점수 매칭을 사용한 3D 생성 소개

最近의 텍스트에서 3D 생성으로의 발전은 생성 모델에서 중요한 이정표를 나타냅니다. 이것은 다양한 실제 시나리오에서 3D 자산을 생성하는 새로운 가능성을 열어줍니다. 디지털 3D 자산은 이제 우리의 디지털 존재에서 필수적인 위치를 차지하며, 복잡한 환경과 객체를 미러링하는 경험을 가능하게 합니다. 이러한 3D 생성 프레임워크는 애니메이션, 건축, 게임, 증강 및 가상 현실 등 다양한 분야에서 적용되고 있습니다. 또한 온라인 회의, 소매, 교육, 마케팅 등에서 광범위하게 사용되고 있습니다.
그러나 이러한 텍스트에서 3D 생성 프레임워크의 발전에도 불구하고, 3D 기술의 광범위한 사용은 주요 문제를 가지고 있습니다. 높은 품질의 3D 이미지와 미디어 콘텐츠를 생성하는 데에는 여전히 상당한 시간, 노력, 자원, 그리고 숙련된 전문 지식이 필요합니다. 이러한 요구 사항을 충족한다고 해도, 텍스트에서 3D 생성은 종종 자세한이고 높은 품질의 3D 모델을 렌더링하지 못합니다. 이 문제는 Score Distillation Sampling(SDS) 방법을 사용하는 프레임워크에서 더 흔하게 발생합니다. 이 기사에서는 SDS 방법을 사용하는 모델에서 관찰되는 주된 결함에 대해 논의하고, LucidDreamer 프레임워크를 소개합니다. LucidDreamer는 Interval Score Matching(ISM) 방법을 사용하여 과도한 스무딩 문제를 극복하는 새로운 접근 방식입니다. 우리는 모델의 아키텍처와 상태 오토메이션 텍스트에서 3D 생성 프레임워크와의 성능을 탐구할 것입니다. 따라서 시작해 보겠습니다.
LucidDreamer3D: 간격 점수 매칭을 사용한 3D 생성 소개
3D 생성 모델이 생성 가능한 인공지능 산업의 화두가 된 주요 이유는 다양한 분야와 산업에서 광범위한 적용 가능성과 실시간 3D 콘텐츠 생성 능력 때문입니다. 이러한 실제 적용 가능성으로 인해 개발자는 3D 콘텐츠 생성 접근 방식의 다양한 제안을 했습니다. 그 중 텍스트에서 3D 생성 프레임워크가 다른 모든 것보다 두드러집니다. 텍스트에서 3D 생성 프레임워크는 텍스트 설명만을 사용하여 상상력 있는 3D 모델을 생성하는 능력으로 인해 그렇습니다. 텍스트에서 3D 생성 프레임워크는 사전 훈련된 텍스트에서 이미지 확산 모델을 사용하여 강력한 이미지를 생성하고, 훈련된 신경 매개변수 3D 모델의 훈련을 감독하여 일관된 3D 이미지를 렌더링하는 것을 가능하게 합니다. 이 일관된 3D 이미지를 렌더링하는 능력은 Score Distillation Sampling의 사용에 기반합니다. 이것은 2D 결과를 3D 대응물로 가져오는 핵심 메커니즘으로서, 훈련 이미지 없이 3D 모델을 훈련하는 것을 가능하게 합니다. 그럼에도 불구하고, SDS 방법을 사용하는 3D 생성 가능한 인공지능 프레임워크는 종종 왜곡과 과도한 스무딩 문제에 시달리며, 이는 높은 신뢰도 3D 생성의 실제 구현을 방해합니다.
과도한 스무딩 문제를 해결하기 위해 LucidDreamer 프레임워크는 ISM 또는 간격 점수 매칭 접근 방식을 구현합니다. 이는 두 가지 효과적인 메커니즘을 사용하는 새로운 접근 방식입니다. 첫째, ISM 접근 방식은 DDIM 반전 방법을 사용하여 가짜 그라운드 트루스 불일치로 인한 평균화 효과를 완화하여 반전 가능한 확산 경로를 생성합니다. 둘째, 3D 모델에 의해 렌더링된 이미지를 가짜 그라운드 트루스와 일치시키는 대신, 확산 경로의 두 간격 단계 사이에서 일치시킵니다. 이것은 높은 재구성 오류를 피하여 한 단계 재구성을 피하는 것을 도와줍니다. ISM을 SDS보다 사용하면 일관된 높은 성능과 매우 현실적이고 자세한 출력이 생성됩니다.
전반적으로 LucidDreamer 프레임워크는 3D 생성 가능한 인공지능에서 다음과 같은 기여를 하려 합니다.
- 텍스트에서 3D 생성 프레임워크의 기본 개념인 SDS에 대한 심층 분석을 제공하고, 저품질 가짜 그라운드 트루스와 과도한 스무딩 효과를 가진 주요 제한점을 식별하며, 이러한 3D 생성 가능한 프레임워크에서 과도한 스무딩 효과가 발생하는 이유에 대한 설명을 제공합니다.
- SDS 접근 방식의 제한을 극복하기 위해 LucidDreamer 프레임워크는 간격 기반 매칭과 반전 가능한 확산 경로를 사용하여 SDS를 능가하는 새로운 접근 방식인 간격 점수 매칭을 도입합니다. 이는 매우 현실적이고 자세한 출력을 생성합니다.
- ISM 방법을 3D 가우시안 스플래팅과 통합하여 기존 방법을 능가하는 3D 콘텐츠 생성을 위한 상태 오토메이션 성능을 달성합니다.
SDS 제한
이전에도 언급했듯이, SDS는 텍스트에서 3D 생성 모델에서 가장 인기 있는 접근 방식 중 하나이며, 잠재 공간에서 조건부 사전 분포를 위한 모드를 찾는 것을 목표로 합니다. SDS 접근 방식은 또한 사전 훈련된 DDPM을 조건부 사전 분포를 모델링하는 데 사용하며, 조건부 사전 분포를 위한 3D 표현을蒸発시키는 것을 목표로 합니다. 이는 KL 발산을 최소화함으로써 달성됩니다. 또한, SDS 접근 방식은 DDP 훈련을 위한 가중 노이즈 점수 매칭 목표를 재사용합니다. SDS 접근 방식의 주요 목표는 3D 모델의 뷰를 DDPM에 의해 추정된 가짜 그라운드 트루스와 일치시키는 것으로 볼 수 있습니다. 그러나 개발자는 蒸発 과정에서 DDPM의 중요한 측면을 종종 무시한다는 것을 관찰했습니다. 다음 그림은 사전 훈련된 DDPM이 일관된 특징을 가진 가짜 그라운드 트루스를 예측하는 경향이 있음을 보여줍니다.

그러나, 바람직하지 않은 상황에서 업데이트되는 방향은 3D 표현으로 업데이트되어 과도한 스무딩 결과를 초래합니다. 또한, DDPM 구성 요소는 입력에 민감하며, 입력의 약간의 변경에도 가짜 그라운드 트루스의 특징이 크게 변경됩니다. 또한, 카메라 포즈와 입력의 노이즈 구성 요소에서 발생하는 무작위성은 蒸発 과정 중에 불가피한 변동성을 추가합니다. 일관된 가짜 그라운드 트루스를 최적화하는 것은 평균화된 결과를 초래합니다. 더군다나, SDS 접근 방식은 모든 시간 간격에 대해 단일 단계 예측을 사용하여 가짜 그라운드 트루스를 얻으며, 단일 단계 DDPM 구성 요소의 한계를 고려하지 않습니다. 이는 가짜 그라운드 트루스를蒸發하는 것이 가장 이상적인 접근 방식이 아닐 수 있음을 나타냅니다.
LucidDreamer: 방법론 및 작동
LucidDreamer 프레임워크는 ISM 접근 방식을 도입하지만, 텍스트에서 3D 생성 모델, 확산 모델, 및 차별 가능한 3D 표현 프레임워크를 포함한 다른 프레임워크에서 학습한 내용을 기반으로 합니다. 그렇다면, LucidDreamer 프레임워크의 아키텍처와 방법론에 대해 자세히 살펴보겠습니다.
간격 점수 매칭 또는 ISM
대부분의 텍스트에서 3D 생성 프레임워크에서 발생하는 과도한 스무딩 및 저품질 출력 문제는 가짜 그라운드 트루스와 3D 표현이 일치하지 않기 때문입니다. SDS의 문제를 해결하기 위해, LucidDreamer 프레임워크는 ISM 또는 간격 점수 매칭을 도입합니다. 이는 두 가지 작동 단계가 있습니다. 첫째, ISM 구성 요소는 카메라 포즈와 노이즈의 무작위성에 관계없이蒸発 과정 중에 더 일관된 가짜 그라운드 트루스를 얻습니다. 둘째, 프레임워크는 더 높은 품질의 가짜 그라운드 트루스를 생성합니다.
SDS의 또 다른 주요 제한은 모든 시간 간격에 대해 단일 단계 예측을 사용하여 가짜 그라운드 트루스를 생성하는 것입니다. 이는 가짜 그라운드 트루스의 시각적 품질을 보장하기 어렵게 만듭니다. 유사하게, SDS 목표는 단일 단계에서 DDPM에 의해 추정된 가짜 그라운드 트루스와 3D 모델의 뷰를 일치시키는 것으로 볼 수 있습니다. 그러나,蒸発 과정은 DDPM 구성 요소의 중요한 측면을 무시합니다. 즉, 가짜 그라운드 트루스를 생성하는 과정에서 일관된 특징을 가진 저품질 출력을 생성합니다.
전반적으로, ISM 구성 요소는 이전 방법에 몇 가지 이점을 제공합니다. 첫째, ISM은 일관된 가짜 그라운드 트루스를 제공하여, 더 높은 신뢰도의蒸發 출력과 더 자세한 구조를 생성합니다. 이는 대규모 가이드 스케일의 필요성을 제거하고, 3D 콘텐츠 생성의 유연성을 향상시킵니다. 둘째, SDS 접근 방식에서 ISM 접근 방식으로 전환하는 것은 계산 오버헤드가 약간 증가하지만, ISM 접근 방식은 효율성에妥協하지 않습니다.

위의 그림은 ISM 접근 방식의 작동을 보여주며, LucidDreamer 프레임워크의 아키텍처를 개요합니다. 프레임워크는 먼저 3D 가우시안 스플래팅, 즉 3D 표현을 사전 훈련된 텍스트에서 3D 생성기를 사용하여 초기화합니다. 그런 다음, 2D DDPM 구성 요소를 사용하여 무작위한 뷰를 노이즈 조건부 잠재 경로로 DDIM 반전을 사용하여 업데이트합니다. 그런 다음, 간격 점수 매칭을 사용하여 업데이트합니다. 이러한 아키텍처 덕분에, ISM 구성 요소의 핵심은 가짜 그라운드 트루스와 일치하는 3D 표현을 업데이트하는 데 있습니다. 이는 SDS 접근 방식의 기본 목표와 일치하지만, 기존 방법을 개선합니다.
DDIM 반전
LucidDreamer 프레임워크는 3D 표현과 일관된 가짜 그라운드 트루스를 생성하는 것을 목표로 합니다. 따라서, LucidDreamer 프레임워크는 3D 표현을 생성하는 대신, DDIM 반전을 사용하여 노이즈 잠재 3D 표현을 예측하고, 반전 가능한 노이즈 잠재 경로를 반복적으로 예측합니다. 또한, DDIM 반전의 반전 가능성으로 인해, LucidDreamer 프레임워크는 모든 시간 간격에 대해 가짜 그라운드 트루스의 일관성을 크게 향상시킬 수 있습니다.
고급 생성 파이프라인
LucidDreamer 프레임워크는 또한 ISM에 추가하여, 텍스트에서 3D 생성의 시각적 품질에 영향을 미치는 요인을 탐색하기 위한 고급 파이프라인을 도입합니다. 3D 가우시안 스플래팅 또는 3DGS를 3D 생성 및 3D 점 클라우드 생성 모델로 초기화를 위해 사용합니다.
3D 가우시안 스플래팅
既存의 연구는 배치 크기와 렌더링 해상도를 증가시키면 시각적 품질을 크게 향상시킬 수 있음을 나타냅니다. 그러나, 텍스트에서 3D 생성을 위한 대부분의 학습 가능한 3D 표현은 시간과 메모리 소비가 크습니다. 반면에, 3D 가우시안 스플래팅 접근 방식은 최적화와 렌더링에서 효율적인 결과를 제공하여, LucidDreamer 프레임워크의 고급 생성 파이프라인이 제한된 계산 자원으로도 대규모 배치 크기와 높은 해상도 렌더링을 달성할 수 있습니다.
초기화
대부분의 상태 오토메이션 텍스트에서 3D 생성 프레임워크는 3D 표현을 초기화하기 위해 제한된 기하학적 형태, 즉 원, 박스 또는 실린더를 사용합니다. 이는 비축 방향 대칭 객체에 대한 원치 않는 출력을 초래합니다. 반면에, LucidDreamer 프레임워크는 3D 가우시안 스플래팅을 3D 표현으로 도입하여, 인간의 입력과 함께 여러 텍스트에서 점 생성 프레임워크를 자연스럽게 채택하여, 조잡한 초기화를 생성할 수 있습니다. 초기화 전략은 수렴 속도를 크게 향상시킵니다.
LucidDreamer: 실험 및 결과
텍스트에서 3D 생성

위의 그림은 원래 안정적인 확산 접근 방식을 사용하여 생성된 LucidDreamer 모델의 결과를 보여줍니다. 다음 그림은 다양한 미세 조정된 체크포인트에서 생성된 결과에 대해 이야기합니다.

그것은 LucidDreamer 프레임워크가 입력 텍스트와 의미적 단서를 사용하여 매우 일관된 3D 콘텐츠를 생성할 수 있음을 보여줍니다. 또한, ISM을 사용하여, LucidDreamer 프레임워크는 정교하고 더 현실적인 이미지를 생성하며, 과도한 채도 또는 과도한 스무딩과 같은 일반적인 문제를 피하며, 일반 객체뿐만 아니라 창의적인 생성도 지원합니다.
ISM 일반화
ISM의 일반화를 평가하기 위해, 명시적 및 암시적 표현 모두에서 ISM과 SDS 방법 사이의 비교가 수행되며, 결과는 다음 그림에示されて 있습니다.

질적 비교
LucidDreamer 프레임워크의 질적 효율성을 분석하기 위해, 현재의 SoTA 기준 모델과 비교하며, 공정한 비교를 위해,蒸発을 위한 안정적인 확산 2.1 프레임워크를 사용하며, 결과는 다음 그림에示されて 있습니다. 그것은 프레임워크가 높은 신뢰도와 기하학적으로 정확한 결과를 제공하며, 동시에 더 적은 자원과 시간을 소비한다는 것을 보여줍니다.

さらに, 더 포괄적인 평가를 제공하기 위해, 개발자는 사용자 연구도 수행합니다. 평가에서는 28개의 프롬프트를 선택하고, 각 프롬프트에서 다양한 텍스트에서 3D 생성 접근 방식을 사용하여 객체를 생성합니다. 그런 다음, 결과는 입력 프롬프트와의 일치 度 및 신뢰도에 따라 사용자에 의해 랭크됩니다.

LucidDreamer: 응용
wide 범위의 텍스트에서 3D 생성 작업에서 예외적인 성능으로 인해, LucidDreamer 프레임워크는 제로샷 아바타 생성, 개인화된 텍스트에서 3D 생성, 및 제로샷 2D 및 3D 편집과 같은 여러 잠재적인 응용 프로그램을 가지고 있습니다.

위쪽 왼쪽 그림은 LucidDreamer의 제로샷 2D 및 3D 편집 작업에서의 잠재력을 보여줍니다. 아래쪽 왼쪽 그림은 프레임워크가 LoRA를 사용하여 개인화된 텍스트에서 3D 출력을 생성하는 능력을 보여줍니다. 오른쪽 그림은 프레임워크가 3D 아바타를 생성하는 능력을 보여줍니다.
최종 생각
이 기사에서, 우리는 LucidDreamer, 즉 간격 점수 매칭 방법을 사용하여 과도한 스무딩 문제를 극복하는 새로운 접근 방식에 대해 이야기했습니다. 우리는 모델의 아키텍처와 상태 오토메이션 텍스트에서 3D 생성 프레임워크와의 성능을 논의했습니다. 우리는 또한 SDS 또는 점수 蒸発 샘플링, 대부분의 상태 오토메이션 텍스트에서 3D 생성 모델에서 구현되는 일반적인 접근 방식이, 생성된 이미지의 과도한 스무딩으로 인해 종종 저품질 출력을 생성한다는 것을 논의했습니다. LucidDreamer 프레임워크는 새로운 접근 방식, 즉 간격 점수 매칭을 도입하여, 높은 신뢰도와 더 현실적인 3D 이미지를 생성합니다. 결과와 평가는 wide 범위의 3D 생성 작업에서 LucidDreamer 프레임워크의 효율성을 나타내며, 현재의 상태 오토메이션 3D 생성 모델보다 이미 더 나은 성능을 제공합니다. 프레임워크의 예외적인 성능은 이미 논의한 바와 같이 wide 범위의 실제 응용 프로그램을 가능하게 합니다.












