AI 모델 및 플랫폼
CameraCtrl: T2V 세대에 대한 카메라 제어 활성화
최근의 텍스트에서 비디오 또는 T2V 생성을 시도하는 프레임워크는 안정성을 제공하기 위해 확산 모델을 사용하여 훈련 프로세스를 진행하고, 비디오 확산 모델은 2D 이미지 확산 아키텍처를 확장하여 비디오 데이터를 수용하고, 비디오와 이미지에서_scratch에서 모델을 함께 훈련시킵니다. 이를 기반으로하고, 강력한 사전 훈련된 이미지 생성기인 Stable Diffusion을 구현하기 위해 최근의 연구에서는 2D 아키텍처를 확장하여 시간적 계층을 사전 훈련된 2D 계층 사이에 삽입하고, 새로운 모델을 보지 않은 대규모 데이터셋에서 미세 조정합니다. 이러한 접근 방식에도 불구하고, 텍스트에서 비디오 확산 모델은 텍스트 설명만을 사용하여 비디오 샘플을 생성할 때 모호성으로 인해 생성에 대한 제어가 약화되는重大한課題에 직면합니다. 이러한 제한을 극복하기 위해 일부 모델은 강화된 지침을 제공하는 반면 다른 모델은 생성된 비디오에서 장면 또는 인간의 동작을 精密하게 제어하기 위해 정확한 신호를 사용합니다.另一方面, 몇몇 텍스트에서 비디오 프레임워크는 비디오 생성기에 대한 제어 신호로 이미지를 사용하여 정확한 시간적 관계 모델링 또는 높은 비디오 품질을 달성합니다.
제어 가능성이 이미지 및 비디오 생성 작업에서 중요한 역할을 하며, 사용자가 원하는 콘텐츠를 생성할 수 있도록 허용하기 때문입니다. 그러나 기존 프레임워크는 일반적으로 더 깊은 내러티브를 모델에 전달하는 시네마틱 언어로 작용하는 카메라 포즈의 정밀한 제어를 간과합니다. 현재의 제어 가능성 제한을 극복하기 위해, 본 문서에서는 T2V 모델에 대한 정확한 카메라 포즈 제어를 가능하게 하는 새로운 아이디어인 CameraCtrl에 대해 논의합니다. 카메라의 궤적을 정밀하게 매개변수화한 후, 모델은 텍스트에서 비디오 모델에 플러그 앤 플레이 카메라 모듈을 훈련시키고, 다른 구성 요소를 변경하지 않습니다. 또한, CameraCtrl 모델은 다양한 데이터셋의 효과에 대한 포괄적인 연구를 수행하며, 비슷한 외관과 다양한 카메라 분포를 가진 비디오는 모델의 전체 제어 가능성과 일반화 능력을 향상시킬 수 있다고 제안합니다. CameraCtrl 모델의 성능을 분석하기 위한 실험은 실제 작업에서 모델의 효율성을 입증하며, 카메라 포즈와 텍스트 입력에서 맞춤형 및 동적인 비디오 생성을 위한 길을 열어줍니다.
본 문서는 CameraCtrl 프레임워크를 깊이 다루고, 메커니즘, 방법론, 아키텍처 및 최신 프레임워크와의 비교를 탐구합니다. 따라서 시작해 봅시다.
CameraCtrl: T2V 세대에 대한 카메라 제어
최근 몇 년 동안 확산 모델의 발전과 진보는 텍스트로 안내되는 비디오 생성을 크게 발전시켰으며, 콘텐츠 디자인 워크플로를 혁신적으로 변화시켰습니다. 제어 가능성은 실제 비디오 생성 응용 프로그램에서 중요한 역할을 하며, 사용자가 생성된 결과를 사용자의需求과 요구 사항에 따라 맞춤화할 수 있도록 허용합니다. 높은 제어 가능성을 가진 모델은 생성된 비디오의 현실성, 품질 및 사용성을 향상시킬 수 있습니다. 텍스트와 이미지 입력은 일반적으로 모델에 의해 사용되며, 전체 제어 가능성을 향상시키지만, 종종 내용과 동작에 대한 정밀한 제어를 缺하고 있습니다. 이러한 제한을 극복하기 위해 일부 프레임워크는 비디오 생성을 안내하기 위해 포즈 스켈레톤, 광학 흐름 및 기타 멀티모달 신호와 같은 제어 신호를 사용합니다. 기존 프레임워크의 또 다른 제한은 비디오 생성에서 카메라 포인트를 자극하거나 조정하는 정밀한 제어가 부족합니다. 카메라를 제어하는 능력은 생성된 비디오의 현실성을 향상시키는 것뿐만 아니라, 사용자 참여를 높이고, 영화 및 광고 산업에서 중요합니다.
이러한 제한을 극복하기 위해 CameraCtrl 프레임워크는 비디오 생성을 위한 카메라의 시점을 제어할 수 있는 학습 가능하고 정밀한 플러그 앤 플레이 카메라 모듈입니다. 그러나 기존 텍스트에서 비디오 모델 파이프라인에 맞춤형 카메라를 통합하는 것은 쉽지 않으며, CameraCtrl 프레임워크는 모델 아키텍처에서 카메라를 효과적으로 표현하고 삽입하는 방법을 찾도록 강요받습니다. 동일한 맥락에서, CameraCtrl 프레임워크는 카메라 매개변수의 주요 형태로 플루커 임베딩을 채택하며, 플루커 임베딩이 기하학적 카메라 포즈 정보를 인코딩할 수 있기 때문입니다. 또한, CameraCtrl 모델은 플루커 임베딩만을 입력으로 받아들이는 카메라 제어 모델을 도입하여 훈련 후 모델의 일반화 가능성과適用性을 보장합니다.

AnimateDiff 프레임워크는 효율적인 LoRA 미세 조정 접근 방식을 사용하여 다양한 샷 유형에 대한 모델의 가중치를 얻습니다. Direct-a-video 프레임워크는 비디오 생성 과정에서 카메라의 포즈를 제어하기 위해 카메라 임베더를 구현하는 것을 제안하지만, 기본적으로 세 가지 카메라 매개변수만을 조건으로 하며, 카메라의 제어 능력을 가장 기본적인 유형으로 제한합니다.另一方面, MotionCtrl 프레임워크는 세 가지 이상의 입력 매개변수를 받아들이는 모션 컨트롤러를 설계하여 더 복잡한 카메라 포즈를 가진 비디오를 생성할 수 있습니다. 그러나, 생성된 비디오의 일부를 미세 조정하는 필요는 모델의 일반화 가능성을 방해합니다. 또한, 일부 프레임워크는 이미지 및 텍스트 생성을 위한 제어 가능성을 향상시키기 위해 추가적인 구조적 제어 신호를 통합합니다.
CameraCtrl: 모델 아키텍처
카메라 인코더 구성 요소를 CameraCtrl 프레임워크에서 비디오 생성기에 훈련시키기 전에, 카메라 표현에 대한 다양한 이해가 필요합니다. 일반적으로, 카메라 포즈는 내부 및 외부 매개변수를 참조하며, 비디오 생성기에 카메라 포즈를 조건으로 하는 가장 직접적인 선택은 원시 카메라 매개변수 값을 생성기에 제공하는 것입니다. 그러나, 이러한 접근 방식은 몇 가지 이유로 인해 정확한 카메라 제어를 향상시키지 않을 수 있습니다. 첫째, 회전 행렬은 직교성에 의해 제한되지만, 번역 벡터는 일반적으로 크기에서 제한되지 않으며, 일관성에 영향을 미칠 수 있는 학습 과정의 불일치로 이어질 수 있습니다. 둘째, 원시 카메라 매개변수를 직접 사용하면 모델이 이러한 값을 이미지 픽셀과 상관시킬 수 있도록 하여 시각적 세부 사항에 대한 제어가 감소할 수 있습니다. 이러한 제한을 피하기 위해 CameraCtrl 프레임워크는 기하학적 카메라 포즈 정보를 인코딩할 수 있기 때문에 플루커 임베딩을 카메라 포즈의 표현으로 선택합니다.
비디오 생성기에서의 카메라 제어 가능성
모델이 카메라의 궤적을 플루커 임베딩 시퀸스 즉, 공간적 맵으로 매개변수화하면, 모델은 인코더 모델을 사용하여 카메라 특징을 추출한 후, 카메라 특징을 비디오 생성기에 융합할 수 있습니다. 텍스트에서 이미지 어댑터와 유사하게, CameraCtrl 모델은 비디오를 위한 카메라 인코더를 도입합니다. 카메라 인코더는 각畳층 후에 시간적 주의 모델을 포함하여 비디오 클립 전체의 카메라 포즈의 시간적 관계를 캡처할 수 있습니다. 다음 이미지를 참조하면, 카메라 인코더는 플루커 임베딩 입력만을 받으며, 다중 스케일 특징을 제공합니다. 다중 스케일 카메라 특징을 얻은 후, CameraCtrl 모델은 이러한 특징을 텍스트에서 비디오 모델의 U-Net 아키텍처에無шов하게 통합하고, 카메라 정보를 효과적으로 통합하기 위한 레이어를 결정합니다.

카메라 분포 학습
CameraCtrl 프레임워크에서 비디오 생성기에 대한 카메라 인코더 구성 요소를 훈련시키기 위해, 잘 레이블링되고 주석이 달린 대규모 비디오 데이터셋이 필요하며, 모델은 구조에서 운동 또는 SfM 접근 방식을 사용하여 카메라 궤적을 얻을 수 있습니다. CameraCtrl 프레임워크는 기본 텍스트에서 비디오 모델의 훈련 데이터와 외관이 일치하는 데이터셋을 선택하려고 하며, 가능한 한 넓은 카메라 분포를 갖습니다. 가상 엔진을 사용하여 생성된 데이터셋의 샘플은 렌더링 단계에서 카메라 매개변수를 제어할 수 있기 때문에 다양한 카메라 분포를 나타냅니다. 그러나, 실제 샘플을 포함하는 데이터셋의 경우, 카메라의 분포는 일반적으로 狭く, 프레임워크는 개별 카메라 궤적의 복잡성과 다른 카메라 궤적 간의 다양성 사이에서 균형을 찾는 데 도전해야 합니다. 개별 카메라 궤적의 복잡성은 모델이 훈련 과정에서 복잡한 궤적을 제어하도록 학습하도록 합니다. 다른 카메라 궤적 간의 다양성은 모델이 특정 패턴에 과적합되지 않도록 합니다. 또한, 카메라 인코더의 훈련 과정을 모니터링하기 위해, CameraCtrl 프레임워크는 카메라 정렬 메트릭을 제안하여 생성된 샘플의 카메라 궤적과 입력 카메라 조건 사이의 오차를量化하여 카메라의 제어 품질을 측정합니다.
CameraCtrl: 실험 및 결과
CameraCtrl 프레임워크는 AnimateDiff 모델을 기본 텍스트에서 비디오 모델로 구현하며, 주요 이유는 AnimateDiff 모델의 훈련 전략이 텍스트에서 이미지 모델 또는 텍스트에서 이미지 LoRA와 함께 동작 모듈을 통합하여 다양한 장르와 도메인에서 비디오 생성을 수용할 수 있기 때문입니다. 모델은 Adam 옵티마이저를 사용하여 모델을 훈련시키며, 학습률은 1e-4로 고정됩니다. 또한, 모델이 원래 텍스트에서 비디오 모델의 비디오 생성 능력에 부정적인 영향을 미치지 않도록 하기 위해, CameraCtrl 프레임워크는 FID 또는 Frechet Inception Distance 메트릭을 사용하여 비디오의 외관 품질을 평가하며, 카메라 모듈을 포함하기 전과 후의 생성된 비디오의 품질을 비교합니다.
성능을 평가하기 위해, CameraCtrl 프레임워크는 기존의 두 가지 카메라 제어 프레임워크, 즉 MotionCtrl과 AnimateDiff와 비교됩니다. 그러나, AnimateDiff 프레임워크는 기본적으로 8개의 기본 카메라 궤적만을 지원하므로, CameraCtrl과 AnimateDiff의 비교는 3개의 기본 궤적으로 제한됩니다.另一方面, MotionCtrl과 비교하기 위해, 프레임워크는 기존 데이터셋에서 1,000개 이상의 랜덤 카메라 궤적을 선택하며, 이러한 궤적을 사용하여 비디오를 생성하고, TransErr 및 RotErr 메트릭을 사용하여 평가합니다.

관찰 결과, CameraCtrl 프레임워크는 기본 궤적에서 AnimateDiff 프레임워크를 초과하며, 복잡한 궤적 메트릭에서 MotionCtrl 프레임워크와 비교하여 더 나은 결과를 제공합니다.
또한, 다음 그림은 카메라 인코더 아키텍처가 생성된 샘플의 전체 품질에 미치는 영향을 보여줍니다. 행 a에서 행 d는 각각 ControlNet, ControlNet with temporal attention, T2I Adaptor, 및 T2I adaptor with temporal attention을 구현하여 생성된 결과를 나타냅니다.

다음 그림은 SparseCtrl 프레임워크의 RGB 인코더와 CameraCtrl 프레임워크에서 사용된 방법을 결합하여 생성된 비디오를 보여줍니다.

최종 생각
본 문서에서, 우리는 T2V 모델에 대한 정확한 카메라 포즈 제어를 가능하게 하는 새로운 아이디어인 CameraCtrl에 대해 논의했습니다. 카메라의 궤적을 정밀하게 매개변수화한 후, 모델은 텍스트에서 비디오 모델에 플러그 앤 플레이 카메라 모듈을 훈련시키고, 다른 구성 요소를 변경하지 않습니다. 또한, CameraCtrl 모델은 다양한 데이터셋의 효과에 대한 포괄적인 연구를 수행하며, 비슷한 외관과 다양한 카메라 분포를 가진 비디오는 모델의 전체 제어 가능성과 일반화 능력을 향상시킬 수 있다고 제안합니다. CameraCtrl 모델의 성능을 분석하기 위한 실험은 실제 작업에서 모델의 효율성을 입증하며, 카메라 포즈와 텍스트 입력에서 맞춤형 및 동적인 비디오 생성을 위한 길을 열어줍니다.












