AI 모델 및 플랫폼
안정적인 비디오 확산 모델: 잠재적인 비디오 확산 모델과 대규모 데이터셋
생성적 인공지능은 오랜 시간 동안 AI 커뮤니티에서 중요한 역할을 해왔으며, 확산 모델을 사용한 생성적 이미지 모델링 분야에서 이루어진 발전은 생성적 비디오 모델의 발전에 큰 영향을 미쳤습니다. 전통적으로, 생성적 비디오 모델은_scratch에서 훈련되거나, 부분적으로 또는 완전히 사전 훈련된 이미지 모델에서 추가된 시간적 레이어와 함께 이미지 및 비디오 데이터셋의 혼합으로 훈련됩니다.
생성적 비디오 모델의 발전을 앞으로 밀어가는 데 이어, 본 문서에서는 안정적인 비디오 확산 모델에 대해 논의할 것입니다. 안정적인 비디오 확산 모델은 고해상도, 최첨단의 이미지에서 비디오 및 텍스트에서 비디오 콘텐츠를 생성할 수 있는 잠재적인 비디오 확산 모델입니다. 우리는 어떻게 2D 이미지 합성을 위해 훈련된 잠재적인 확산 모델이 시간적 레이어를 추가하고 작은 고품질 비디오 데이터셋에서 모델을 미세 조정함으로써 생성적 비디오 모델의 능력과 효율성을 향상시켰는지에 대해 논의할 것입니다. 우리는 안정적인 비디오 확산 모델의 아키텍처와 작동 방식에 대해 더 깊이 있는 분석을 수행하고, 다양한 지표에서 모델의 성능을 평가하고, 현재 상태에서 최첨단 비디오 생성 프레임워크와 비교할 것입니다. 그래서 시작해 봅시다.
안정적인 비디오 확산 모델과 생성적 비디오 모델: 소개
거의 무한한 잠재력을 가지고 있는 생성적 인공지능은 오랜 시간 동안 AI 및 ML 실무자들의 주요 연구 주제였으며, 최근 몇 년 동안 생성적 이미지 모델의 효율성과 성능에서 빠른 발전이 이루어졌습니다. 생성적 이미지 모델에서 얻은 지식은 연구자와 개발자들이 생성적 비디오 모델의 실용성과 실제 적용 분야에서 발전을 이루도록 해왔습니다. 그러나 생성적 비디오 모델의 능력을 향상시키려는 대부분의 연구는 시간적 및 공간적 레이어의 정확한 배열에 주로 초점을 맞추고 있으며, 이러한 생성적 모델의 결과에 데이터 선택의 영향에 대한 연구에는 거의 관심이 없습니다.
생성적 이미지 모델의 발전 덕분에, 연구자들은 생성적 모델의 성능에 대한 훈련 데이터 분포의 영향이 실제로重大하다는 것을 관찰했습니다. 또한, 연구자들은 사전 훈련된 이미지 모델을 큰 다양성의 데이터셋에서 훈련하고, 더 작은 데이터셋에서 미세 조정하면 성능이 크게 향상된다는 것을 관찰했습니다. 전통적으로, 생성적 비디오 모델은 성공적인 생성적 이미지 모델에서 얻은 지식을 구현하며, 연구자들은 데이터와 훈련 전략의 효과를 아직 연구하지 않았습니다. 안정적인 비디오 확산 모델은 데이터 선택에 중점을 둔 새로운 영역으로 나아가며, 생성적 비디오 모델의 능력을 향상시키는 시도입니다.

최근의 생성적 비디오 모델은 확산 모델과 텍스트 조건 또는 이미지 조건 접근 방식을 사용하여 여러 일관된 비디오 또는 이미지 프레임을 합성합니다. 확산 모델은 노이즈 샘플에서 점진적으로 정화하는 반복적인 개선 과정을 구현하여 높은 해상도 비디오 및 텍스트에서 이미지 합성에서 원하는 결과를 제공합니다. 동일한 원리를 핵심으로, 안정적인 비디오 확산 모델은 비디오 데이터셋에서 잠재적인 비디오 확산 모델을 훈련하고, 생성적 적대적 네트워크(GAN) 또는 자기 회귀 모델을 사용하여 훈련합니다.
안정적인 비디오 확산 모델은 이전에 생성적 비디오 모델에서 구현된 적 없는 고유한 전략을 따릅니다. 즉, 고정된 아키텍처와 고정된 훈련 전략을 사용하여 데이터의 영향력을 평가합니다. 안정적인 비디오 확산 모델은 생성적 비디오 모델링 분야에서 다음과 같은 기여를 하려 합니다.
- 고품질 비디오 합성을 위해 큰 비디오 샘플의 수집을 체계적이고 효과적으로 데이터 큐레이션 워크플로우를 구현하는 것입니다.
- 기존 프레임워크를 능가하는 이미지에서 비디오 및 텍스트에서 비디오 모델을 훈련하는 것입니다.
- 모델의 3D 이해와 강한 동작 先验에 대한 도메인 특정 실험을 수행하는 것입니다.
이제, 안정적인 비디오 확산 모델은 잠재적인 비디오 확산 모델과 데이터 큐레이션 기술을 핵심으로 구현합니다.
잠재적인 비디오 확산 모델
잠재적인 비디오 확산 모델 또는 Video-LDM은 주된 생성적 모델을 낮은 계산 복잡도로 잠재 공간에서 훈련하는 접근 방식을 따릅니다. 대부분의 Video-LDM은 사전 훈련된 텍스트에서 이미지 모델과 시간적 혼합 레이어를 추가하여 사전 훈련 아키텍처를 구현합니다. 결과적으로, 대부분의 비디오 잠재 확산 모델은 시간적 레이어만 훈련하거나 훈련 과정을 건너뛰는 반면, 안정적인 비디오 확산 모델은 전체 프레임워크를 미세 조정합니다. 또한, 텍스트에서 비디오 데이터를 합성하기 위해 안정적인 비디오 확산 모델은 직접 텍스트 프롬프트에 조건을 부여하며, 결과는 프레임워크가 쉽게 다중 보기 합성 또는 이미지에서 비디오 모델로 미세 조정될 수 있음을 나타냅니다.
데이터 큐레이션
데이터 큐레이션은 안정적인 비디오 확산 모델뿐만 아니라 생성적 모델 전체에서 중요한 구성 요소입니다. 큰 모델을 대규모 데이터셋에서 사전 훈련하여 성능을 향상시키는 것이 중요합니다. 데이터 큐레이션은 생성적 이미지 모델에서 효율적인 언어-이미지 표현의 능력을 활용하여 성공적으로 구현되었습니다. 그러나 이러한 논의는 생성적 비디오 모델의 개발에 초점을 맞추지 않았습니다. 생성적 비디오 모델을 위한 데이터 큐레이션에는 여러 가지 장애물이 있습니다. 이러한 도전을 해결하기 위해 안정적인 비디오 확산 모델은 3단계 훈련 전략을 구현하여 향상된 결과와 성능을 크게 향상시킵니다.
고품질 비디오 합성을 위한 데이터 큐레이션
이전 섹션에서 논의한 대로, 안정적인 비디오 확산 모델은 3단계 훈련 전략을 구현하여 향상된 결과와 성능을 크게 향상시킵니다. 1단계는 2D 텍스트에서 이미지 확산 모델을 사용하는 이미지 사전 훈련 단계입니다. 2단계는 비디오 사전 훈련 단계로, 프레임워크가大量의 비디오 데이터에서 훈련됩니다. 마지막으로, 3단계는 비디오 미세 조정 단계로, 모델이 작은 고품질 및 고해상도 비디오의 하위 집합에서 정제됩니다.
그러나 안정적인 비디오 확산 모델이 이러한 3단계를 구현하기 전에, 데이터를 처리하고 주석을 달아야 합니다. 이는 2단계 또는 비디오 사전 훈련 단계의 기초로 작용하며, 최적의 출력을 보장하는 데 중요한 역할을 합니다. 효율성을 최대화하기 위해, 프레임워크는 3개의 서로 다른 FPS(초당 프레임 수) 수준에서 캐스케이드 컷 감지 파이프라인을 구현하며, 이 파이프라인의 필요성은 다음 이미지에 설명되어 있습니다.

다음으로, 안정적인 비디오 확산 모델은 3개의 서로 다른 합성 캡션 방법을 사용하여 각 비디오 클립에 주석을 달습니다. 다음 표는 안정적인 확산 프레임워크에서 필터링 과정 전후의 데이터셋을 비교합니다.

1단계: 이미지 사전 훈련
안정적인 비디오 확산 모델에서 1단계는 이미지 사전 훈련입니다. 이를 달성하기 위해, 초기 안정적인 비디오 확산 모델 프레임워크는 사전 훈련된 이미지 확산 모델인 안정적인 확산 2.1 모델에 기반하여 더 강력한 시각적 표현을 제공합니다.

2단계: 비디오 사전 훈련
2단계는 비디오 사전 훈련 단계입니다. 이는 다중 모달 생성적 이미지 모델에서 데이터 큐레이션이 더好的 결과와 효율성을 제공한다는 사실에 기반합니다. 그러나 생성적 비디오 모델을 위한 강력한 오프-더-쉘프 표현이 부족하여, 안정적인 비디오 확산 모델은 인간의 선호도를 입력 신호로 사용하여 적절한 데이터셋을 생성합니다. 다음 그림은 데이터셋을 큐레이션하여 작은 데이터셋에서 비디오 사전 훈련을 수행할 때 전체 성능을 향상시키는 긍정적인 영향을示합니다.

보다 구체적으로, 프레임워크는 다양한 방법을 사용하여 잠재적인 비디오 확산의 하위 집합을 큐레이션하고, 이러한 데이터셋에서 훈련된 LVD 모델의 순위를 고려합니다. 또한, 안정적인 비디오 확산 프레임워크는 큐레이션된 데이터셋을 사용하여 프레임워크를 훈련하면 성능을 향상시킬 수 있으며, 확산 모델 전체에서 데이터 큐레이션 전략이 작동한다는 것을 발견합니다. 또한, 데이터 큐레이션 전략은 더 큰, 관련성이 높은, 실제적인 데이터셋에서도 작동합니다. 다음 그림은 작은 데이터셋에서 비디오 사전 훈련을 수행할 때 큐레이션된 데이터셋을 사용하여 전체 성능을 향상시키는 긍정적인 영향을示합니다.

3단계: 고품질 미세 조정
2단계까지, 안정적인 비디오 확산 프레임워크는 비디오 사전 훈련 이전의 성능을 향상시키는 데 중점을 두었습니다. 3단계에서는 프레임워크가 비디오 미세 조정 이후의 성능을 최적화하는 데 중점을 둡니다. 3단계에서, 프레임워크는 잠재적인 이미지 확산 모델에서借用한 훈련 기술을 사용하여 훈련 예제의 해상도를 증가시킵니다. 이 접근법의 효과를 분석하기 위해, 프레임워크는 초기화 방식이 다른 세 가지 동일한 모델과 비교합니다. 첫 번째 동일한 모델은 초기화된 가중치를 사용하며, 비디오 훈련 과정을 건너뛴 반면, 나머지 두 동일한 모델은 다른 잠재적인 비디오 모델에서借用한 가중치를 초기화합니다.
결과 및 발견
안정적인 비디오 확산 프레임워크가 실제 작업에서 어떻게 수행되고, 현재 상태에서 최첨단 프레임워크와 비교하는지 살펴보겠습니다. 안정적인 비디오 확산 프레임워크는 먼저 최적의 데이터 접근 방식을 사용하여 기본 모델을 훈련하고, 이후 미세 조정을 수행하여 여러 최첨단 모델을 생성합니다. 각 모델은 특정 작업을 수행합니다.

위의 그림은 프레임워크가 생성한 고해상도 이미지에서 비디오 샘플을 나타냅니다. 다음 그림은 프레임워크가 고품질의 텍스트에서 비디오 샘플을 생성하는 능력을示합니다.

사전 훈련된 기본 모델
이전 섹션에서 논의한 대로, 안정적인 비디오 확산 모델은 안정적인 확산 2.1 프레임워크를 기반으로 구축되었습니다. 최근의 발견에 따르면, 이미지 확산 모델을 훈련할 때 노이즈 스케줄을 채택하고 노이즈를 증가시키면 더好的 해상도의 이미지를 얻을 수 있습니다. 이러한 접근 방식을 사용하여, 안정적인 비디오 확산 기본 모델은 강력한 동작 표현을 학습하며, 결과는 제로 샷 설정에서 텍스트에서 비디오 생성에서 기준 모델을 능가하는 것으로 나타났습니다. 결과는 다음 표에示되어 있습니다.

프레임 보간 및 다중 보기 생성
안정적인 비디오 확산 프레임워크는 다중 보기 데이터셋에서 이미지에서 비디오 모델을 미세 조정하여 객체의 여러 새로운 보기를 얻습니다. 이 모델은 SVD-MV 또는 안정적인 비디오 확산-다중 보기 모델로 알려져 있습니다. 원래 SVD 모델은 두 개의 데이터셋에서 단일 이미지 입력과 다중 보기 이미지 시퀀스를 출력으로 반환하도록 미세 조정됩니다.
다음 이미지에서 볼 수 있듯이, 안정적인 비디오 확산 다중 보기 프레임워크는Scratch 다중 보기 프레임워크와 비교하여 높은 성능을 제공하며, 결과는 SVD-MV의 다중 보기 이미지 생성을 위한 원래 SVD 프레임워크의 학습을 활용하는 능력을 보여줍니다. 또한, 결과는 SVD 프레임워크에서 미세 조정된 모델이 상대적으로 적은 수의 반복으로 최적의 결과를 제공하는 것을示합니다.


위의 그림에서, 왼쪽에 지표가 표시되어 있으며, 안정적인 비디오 확산 다중 보기 프레임워크가 Scratch-MV 및 SD2.1 다중 보기 프레임워크를 능가하는 것을 볼 수 있습니다. 두 번째 그림은 반복 횟수의 증가에 따른 프레임워크의 성능을示합니다. SVD-MV 프레임워크는 지속적인 결과를 제공합니다.
최종 생각
본 문서에서, 우리는 안정적인 비디오 확산 모델에 대해 논의했습니다. 안정적인 비디오 확산 모델은 고해상도, 최첨단의 이미지에서 비디오 및 텍스트에서 비디오 콘텐츠를 생성할 수 있는 잠재적인 비디오 확산 모델입니다. 안정적인 비디오 확산 모델은 이전에 생성적 비디오 모델에서 구현된 적 없는 고유한 전략을 따릅니다. 즉, 고정된 아키텍처와 고정된 훈련 전략을 사용하여 데이터의 영향력을 평가합니다.
우리는 어떻게 2D 이미지 합성을 위해 훈련된 잠재적인 확산 모델이 시간적 레이어를 추가하고 작은 고품질 비디오 데이터셋에서 모델을 미세 조정함으로써 생성적 비디오 모델의 능력과 효율성을 향상시켰는지에 대해 논의했습니다. 또한, 안정적인 비디오 확산 모델이 데이터를 수집하고 주석을 달기 위해 체계적인 접근 방식을 사용하며, 이는 2단계 또는 비디오 사전 훈련 단계의 기초로 작용한다는 것을 논의했습니다.
さらに, 안정적인 비디오 확산 프레임워크는 세 가지 서로 다른 비디오 모델 훈련 단계를 분석하여 프레임워크의 성능에 미치는 영향을 평가합니다. 프레임워크는 최종적으로 비디오 합성을 최적화하기에 충분히 강력한 비디오 표현을 출력하며, 결과는 현재 사용 중인 최첨단 비디오 생성 모델과 비교할 수 있습니다.












