Anderson의 관점
AI 비디오 생성에서 완전한 제어로

비디오 기초 모델인 Hunyuan과 Wan 2.1은 강력하지만 사용자에게 필름 및 TV 프로덕션(특히 VFX 프로덕션)에서 요구하는 그랬듯의 세부적인 제어를 제공하지 않는다.
전문 비주얼 이펙트 스튜디오에서 이러한 오픈소스 모델은 이전 이미지 기반 모델과 함께 사용되며, 이러한 모델에는 Stable Diffusion, Kandinsky 및 Flux가 포함된다. 이러한 모델은 사용자의 특정 창의적 요구에 맞게 원시 출력을 적응시키는 일련의 지원 도구와 함께 사용된다. 감독이 “그것은 좋지만 조금 더 [n]으로 만들 수 있나요?”라고 말할 때, 모델이 그렇게 정밀하지 않아 요청을 처리할 수 없다고 응답할 수 없다.
대신 AI VFX 팀은 비디오 합성의 한계를 조금 더 밀어붙이기 위해 시간이 지남에 따라 개발된 사용자 정의 프로세스와 워크플로우와 함께 전통적인 CGI 및 구성 기술을 사용할 것이다.
따라서 비디오 기초 모델은 기본적으로 웹 브라우저와 같은 Chrome의 기본 설치와 같다. 즉, 기본적으로 많은 기능을 제공하지만 사용자의需求에 맞게 모델을 조정하고 싶다면 플러그인이 필요하다.
제어狂
확산 기반 이미지 합성의 세계에서 가장 중요한 제3자 시스템은 ControlNet이다.
ControlNet은 확산 기반 생성 모델에 구조화된 제어를 추가하는 기술로, 사용자가 추가 입력을 통해 이미지 또는 비디오 생성을 안내할 수 있다. 이러한 입력에는 엣지 맵, 깊이 맵 또는 포즈 정보가 포함된다.

이미지(상단 행), 의미적 분할>이미지(하단 왼쪽) 및 인간과 동물의 포즈 가이드 이미지 생성을 허용한다.” width=”779″ height=”422″ /> ControlNet의 다양한 방법은 깊이>이미지(상단 행), 의미적 분할>이미지(하단 왼쪽) 및 인간과 동물의 포즈 가이드 이미지 생성을 허용한다.
텍스트 프롬프트에만 의존하지 않고 ControlNet은 이러한 조건 신호를 처리하는 별도의 신경망 분기 또는 어댑터를 도입한다. 이는 사용자 사양에 더 잘 부합하는 출력을 생성할 수 있도록 하며, 특히 정밀한 구성, 구조 또는 동작 제어가 필요한 응용 프로그램에서 유용하다.
그러나 이러한 프레임워크는 내부적으로 매우 집중된 신경 프로세스 세트에서 외부적으로 작동한다. 이러한 접근 방식에는 몇 가지 단점이 있다.
첫째, 어댑터는 독립적으로 훈련되므로 브랜치 충돌이 발생할 수 있으며, 이는 생성 품질이 저하될 수 있다.
둘째, 추가 계산 및 각 어댑터에 대한 메모리가 필요하므로 확장성이 불충분하다.
셋째, 어댑터는 종종 최적이 아닌 결과를 생성한다. 이는 완전히 미세 조정된 모델에 비해 다중 조건 생성이 필요한 작업에 어댑터 기반 방법을 사용하는 경우 효과가 떨어진다.
이상적으로 ControlNet의 능력은 모델에 원生적으로 훈련되어야 한다. 이는 나중에 예상되는 명백한 혁신을 수용할 수 있는 모듈식 방식이어야 한다.
FullDiT
이러한 상황에서 중국의 새로운 제안이 등장했다. 이 시스템은 ControlNet 스타일의 조치를 비디오 생성 모델에 훈련 시간에 직접 통합하는 방식을 제안한다.

새로운 논문에서: FullDiT 접근 방식은 원生 생성에 아이덴티티 강제, 깊이 및 카메라 이동을 통합할 수 있으며, 한 번에 이러한 조합 중 하나를 호출할 수 있다.
이 새로운 접근 방식은 FullDiT로 명명되며, 여러 작업 조건을 하나의 통합된 비디오 생성 모델에 융합한다. 이러한 조건에는 아이덴티티 전송, 깊이 매핑 및 카메라 이동이 포함된다.
예를 들어, 아래에서 우리는 카메라 이동, 아이덴티티 정보 및 텍스트 정보(즉, 사용자 텍스트 프롬프트)를 통합하는 생성을 볼 수 있다.
재생 ControlNet 스타일의 사용자 강제와 원生 훈련된 기초 모델의 예. 출처: https://fulldit.github.io/
저자는 실험적으로 훈련된 모델을 기능적인 기초 모델로 제안하지 않는다. 대신, 사용자에게 더 많은 제어를 제공하는 원生 텍스트-비디오(T2V) 및 이미지-비디오(I2V) 모델에 대한 개념 증명을 제안한다.
이러한 종류의 모델이 아직 없기 때문에 연구자들은 FullBench라는 새로운 벤치마크를 만들었다. 이는 다중 작업 비디오의 평가를 위한 것으로, 이전 접근 방식에 대한 동등한 테스트에서 최첨단 성능을 주장한다. 그러나 FullBench는 저자 자신에 의해 설계되었으며, 그 객관성은 테스트되지 않았고, 1,400개의 사례로 구성된 데이터 세트는 더 광범위한 결론을 내리기에는 너무 제한적일 수 있다.
방법
저자는 FullDiT의 통일된 주의 메커니즘이 공간적 및 시간적 관계를 모두 캡처하여 강한 교차 모달 표현 학습을 가능하게 함으로써 이러한 기능을 달성한다고 주장한다.

새로운 논문에 따르면 FullDiT는 모든 입력 조건을 통합하여 하나의 시퀀스로 변환한다. 반면, 어댑터 기반 모델(가장 왼쪽)은 각 입력에 대해 별도의 모듈을 사용하여 불필요한 계산 및 약한 성능을 초래한다.
어댑터 기반 설정과 달리 각 입력 스트림을 별도로 처리하는 반면, 이 공유된 주의 구조는 브랜치 충돌을 피하고 매개 변수 오버헤드를 줄인다. 또한 저자는 이 아키텍처가 새로운 입력 유형으로 확장될 수 있으며, 훈련 중에 보지 못한 조건 조합에 일반화하는 표시를 보인다고 주장한다.
3つの 힘
FullDiT는 각 제어 신호를 표준화된 토큰 형식으로 변환하여 모든 조건을 함께 처리할 수 있도록 한다.
카메라 이동은 각 프레임에 대한 외적 매개변수를 포함하는 시퀀스를 모델이 인코딩한다. 이러한 매개변수는 타임스탬프가 지정되고 임베딩 벡터로 투영되어 시그널의 시간적 특성을 반영한다.
아이덴티티 정보는 본질적으로 시간적이 아닌 공간적이므로 다르게 처리된다. 모델은 각 프레임의 특정 부분에 존재하는 캐릭터를 나타내는 아이덴티티 맵을 사용한다. 이러한 맵은 패치로 분할되며, 각 패치는 공간적 아이덴티티 큐를 캡처하는 임베딩으로 투영된다.
깊이는 공간적 및 시간적 신호이므로 모델은 깊이 비디오를 3D 패치로 분할하여 공간과 시간을 모두 포함한다. 이러한 패치는 프레임 간에 구조를 보존하는 방식으로 임베딩된다.
임베딩된 후, 이러한 모든 조건 토큰(카메라, 아이덴티티 및 깊이)은 하나의 긴 시퀀스로 연결되어 FullDiT에서 함께 처리될 수 있다.
데이터 및 테스트
FullDiT의 훈련 접근 방식은 각 조건 유형에 맞게 선택적으로 주석이 달린 데이터 세트에 의존했다.
텍스트 조건의 경우, 이니셔티브는 MiraData 프로젝트에서 설명된 구조화된 캡션 접근 방식을 따랐다.

비디오 수집 및 주석 처리 파이프라인에서 MiraData 프로젝트. 출처: https://arxiv.org/pdf/2407.06358
카메라 이동의 경우, RealEstate10K 데이터 세트가 주요 데이터 소스로 사용되었다. 높은 품질의 지상จริง 카메라 매개변수 주석이 때문이다.
그러나 저자는 정적 장면 카메라 데이터 세트(예: RealEstate10K)만으로 훈련하면 생성된 비디오에서 동적 객체 및 인간의 움직임이 줄어든다는 것을 관찰했다. 이를 대처하기 위해, 저자는 내부 데이터 세트를 사용하여 추가적인 미세 조정을 수행했으며, 내부 데이터 세트에는 더 많은 동적 카메라 움직임이 포함되어 있었다.
아이덴티티 주석은 ConceptMaster 프로젝트에서 개발된 파이프라인을 사용하여 생성되었다. 이는 미세한 아이덴티티 정보를 효율적으로 필터링하고 추출할 수 있었다.

ConceptMaster 프레임워크는 사용자 정의 비디오에서 개념 충실성을 유지하면서 아이덴티티 분리 문제를 해결하기 위한 것이다. 출처: https://arxiv.org/pdf/2501.04698
깊이 주석은 Panda-70M 데이터 세트에서 Depth Anything를 사용하여 얻었다.
데이터 순서를 통한 최적화
저자는 또한 더 어려운 조건을 훈련의 초기에 도입하여 모델이 더 쉬운 작업을 추가하기 전에 강력한 표현을 획득하는 진행적인 훈련 일정표를 구현했다. 훈련 순서는 텍스트 조건에서 시작하여 카메라 조건, затем 아이덴티티, 그리고 마지막으로 깊이로 진행되었다. 일반적으로 더 쉬운 작업은 나중에 도입되었으며, 더 적은 예제가 있었다.
저자는 이러한 방식으로 작업량을 주문하는 가치에 대해 강조한다.
‘사전 훈련 단계에서, 우리는 더 어려운 작업이 더 긴 훈련 시간을 필요로 하며 훈련의 초기에 도입되어야 한다는 것을 관찰했다. 이러한 어려운 작업은 모델이 정확하게 캡처하고 표현할 수 있도록 충분한 능력을 갖추어야 하는 복잡한 데이터 분포를 포함한다.’
‘반대로, 더 쉬운 작업을 너무 일찍 도입하면 모델이 더 쉬운 작업을 먼저 학습하도록 유도할 수 있으며, 이는 더 어려운 작업의 수렴을 방해할 수 있다.’

연구자들이 채택한 데이터 훈련 순서의 일러스트레이션. 빨간색은 더 많은 데이터 볼륨을 나타낸다.
초기 사전 훈련 이후, 최종 미세 조정 단계에서 모델을 추가적으로 세부적으로 조정하여 시각적 품질과 동작 역학을 개선했다. 그 후 훈련은 표준 확산 프레임워크*를 따랐다. 즉, 비디오 잠재 변수에 노이즈를 추가하고 모델이 이를 예측하고 제거하도록 했다. 이는 임베딩된 조건 토큰을 가이드로 사용했다.
FullDiT와 기존 방법을 효과적으로 평가하고 공정한 비교를 제공하기 위해, 그리고 적절한 벤치마크가 없는 경우, 저자는 FullBench라는 새로우면서도 잘 짜여진 벤치마크를 도입했다. 이는 1,400개의 고유한 테스트 케이스로 구성된다.

새로운 FullBench 벤치마크의 데이터 탐색기 인스턴스. 출처: https://huggingface.co/datasets/KwaiVGI/FullBench
메트릭
저자는 10개의 메트릭을 사용하여 FullDiT를 평가했다. 이는 텍스트 정렬, 카메라 제어, 아이덴티티 유사성, 깊이 정확성 및 일반 비디오 품질을 포함하는 5개의 주요 측면을 다루었다.
텍스트 정렬은 CLIP 유사성을 사용하여 측정되었으며, 카메라 제어는 회전 오차(RotErr), 변환 오차(TransErr) 및 카메라 모션 일관성(CamMC)을 평가했다. 이는 CamI2V 프로젝트에서 사용된 접근 방식을 따랐다.
아이덴티티 유사성은 DINO-I 및 CLIP-I를 사용하여 평가되었으며, 깊이 제어 정확성은 평균 절대 오차(MAE)를 사용하여 측정되었다.
비디오 품질은 MiraData에서 유래한 세 가지 메트릭을 사용하여 평가되었다. 프레임 수준의 CLIP 유사성을 사용하여 부드러움을 평가하고, 광학 흐름 기반의 모션 거리를 사용하여 역학을 평가하며, LAION-Aesthetic 점수를 사용하여 시각적 매력을 평가했다.
훈련
저자는 약 10억 매개변수를 포함하는 내부(비공개) 텍스트-비디오 확산 모델을 사용하여 FullDiT를 훈련했다. 저자는 이전 방법과 비교를 공정하게 유지하고 재현성을 보장하기 위해 소규모 매개변수 크기를 의도적으로 선택했다.
비디오 길이와 해상도가 다르기 때문에, 저자는 각 배치를 표준화하기 위해 비디오를 공통 해상도로 리사이즈하고 패딩했으며, 각 시퀀스에서 77개의 프레임을 샘플링하고, 적용된 주의와 손실 마스크를 사용하여 훈련의 효율성을 최적화했다.
Adam 옵티마이저를 사용하여 64개의 NVIDIA H800 GPU 클러스터에서 1×10−5의 학습률로 훈련을 수행했다. 총 5,120GB의 VRAM을 사용했다(엔투지너스 합성 커뮤니티에서 24GB는 여전히 RTX 3090에서豪華한 표준으로 간주된다).
모델은 약 32,000 스텝 동안 훈련되었으며, 각 비디오당 최대 3개의 아이덴티티, 20개의 카메라 조건 프레임 및 21개의 깊이 조건 프레임을 포함했다. 이러한 조건은 총 77개의 프레임에서 균일하게 샘플링되었다.
추론을 위해 모델은 384×672 픽셀(15프레임당 약 5초)의 해상도로 비디오를 생성했으며, 50개의 확산 추론 단계와 5의 분류기 없는 가이드 스케일을 사용했다.
이전 방법
카메라-비디오 평가를 위해 저자는 FullDiT를 MotionCtrl, CameraCtrl 및 CamI2V와 비교했으며, 모든 모델은 RealEstate10K 데이터 세트를 사용하여 훈련하여 일관성과 공정성을 보장했다.
아이덴티티 조건 생성에서 비교 가능한 오픈 소스 다중 아이덴티티 모델이 없기 때문에, 모델은 1B 매개변수 버전의 ConceptMaster 모델과 비교되었다. 동일한 훈련 데이터와 아키텍처를 사용했다.
깊이-비디오 작업에서 Ctrl-Adapter 및 ControlVideo와 비교가 이루어졌다.

단일 작업 비디오 생성을 위한 양적 결과. FullDiT는 카메라-비디오 생성을 위해 MotionCtrl, CameraCtrl 및 CamI2V와 비교되었으며, 아이덴티티-비디오 생성을 위해 ConceptMaster(1B 매개변수 버전)와 비교되었으며, 깊이-비디오 생성을 위해 Ctrl-Adapter 및 ControlVideo와 비교되었다. 모든 모델은 기본 설정을 사용하여 평가되었다. 일관성을 위해, 각 방법에서 16개의 프레임을 균일하게 샘플링하여 이전 모델의 출력 길이와 일치시켰다.
결과는 FullDiT가 여러 조건 신호를 동시에 처리하는 동안 텍스트, 카메라 모션, 아이덴티티 및 깊이 제어와 관련된 메트릭에서 최첨단 성능을 달성했음을 나타낸다.
결론
FullDiT는 더 기능이 풍부한 비디오 기초 모델의 흥미로운 시도이지만, ControlNet 스타일의 기능을 대규모로 구현하는需求이 있는지疑問이다. FOSS 프로젝트는 이러한 모델을 개발하기 위해 필요한 막대한 양의 GPU 처리 능력을 얻기 위해 상업적 지원 없이 어려움을 겪을 수 있다.
주된 도전은 Depth 및 Pose와 같은 시스템을 사용하는 것이 일반적으로 ComfyUI와 같은 비교적 복잡한 사용자 인터페이스에 대한 상당한 지식을 필요로 하기 때문이다. 따라서 이러한 종류의 기능적인 FOSS 모델은 VFX 회사와 같은 작은 그룹에 의해 개발될 가능성이 더 높다.
반면에, API 기반의 ‘렌탈 AI’ 시스템은 모델에 직접 훈련된 보조 제어 시스템에 대한 더 간단하고 사용자 친화적인 해석 방법을 개발할 동기를 부여받을 수 있다.
재생 FullDiT를 사용한 비디오 생성에 Depth+Text 제어가 적용됨.
* 저자는 알려진 기초 모델(예: SDXL 등)을 지정하지 않는다.
2025년 3월 27일 처음 게시됨.












