Anderson의 관점
AI 비디오가 고양이 셀카를 완벽하게 만드는 방법

AI 비디오 생성기는 종종 원하는 텍스트 프롬프트를 정확하게 구현하지 못하는 경우가 많습니다. 그러나 새로운 고급 수정이 모든 차이를 만들어냅니다.
생성 비디오 시스템은 종종 매우 창의적이거나 와일드한 비디오를 생성하는 데 어려움을 겪으며, 사용자의 텍스트 프롬프트에 대한 기대를 충족하지 못하는 경우가 많습니다.
이러한 이유 중 하나는 엔트윈먼트 입니다. 즉, 비전/언어 모델이 소스 데이터에 대한 훈련 시간을 타협해야 합니다. 훈련 시간이 너무 짧으면 개념은 유연하지만 완전히 형성되지 않으며, 훈련 시간이 너무 길면 개념은 정확하지만 더 이상 새로운 조합에 통합될 수 없습니다.
아래에 첨부된 비디오에서 이 아이디어를 얻을 수 있습니다. 왼쪽은 많은 AI 시스템이 요구하는 프롬프트에 대한 반대급부로 제공하는 종류의妥協입니다(프롬프트는 모든 네 가지 예제에서 비디오 상단에 있습니다). 오른쪽은 프롬프트에 더 잘 맞는 AI 출력입니다:
재생 (오디오 없음). 오른쪽에 표시된 ‘팩터화된’ WAN 2.2는 왼쪽의 ‘바닐라’ Wan 2.2와 비교하여 프롬프트에 더 잘 맞는 것을 볼 수 있습니다. 프로젝트 사이트에서 더 나은 해상도와 더 많은 예제를 찾을 수 있지만, 여기서 볼 수 있는 큐레이션된 버전은 프로젝트 사이트에 존재하지 않으며 이 기사용으로 조립되었습니다. 소스
잘록의 인간 손(!)을 용서해야 하지만, 오른쪽의 예제가 왼쪽의 예제보다 원래 텍스트 프롬프트에 더 잘 맞는다는 것은 명백합니다.
흥미롭게도 두 가지 아키텍처는 본질적으로 同じ 아키텍처입니다. 즉, 매우 유능한 Wan 2.2입니다. 이는 중국에서 출시되어 오픈 소스 및 취미 커뮤니티에서 큰 인기를 얻었습니다.
차이점은 두 번째 생성 파이프라인이 팩터화되었습니다. 즉, 대규모 언어 모델(LLM)이 첫 번째(시드) 프레임의 비디오를 재해석하여 시스템이 사용자가 원하는 것을 제공하기 더 쉽게 만듭니다.
이 ‘시각적 앵커링’은 LLM을 통해 향상된 프롬프트에서 제작된 이미지를 생성 파이프라인에 ‘시작 프레임’으로 주입하고, LoRA 해석 모델을 사용하여 ‘침입자’ 프레임을 비디오 생성 프로세스에 통합하는 것을 포함합니다.
프롬프트 충실도 측면에서 결과는 khá 놀랍습니다. 특히, 우아한 해결책으로 보입니다:
재생 (오디오 없음). ‘팩터화된’ 비디오 생성의 더 많은 예제입니다. 프로젝트 사이트에서 더 나은 해상도와 더 많은 예제를 찾을 수 있지만, 여기서 볼 수 있는 큐레이션된 버전은 프로젝트 사이트에 존재하지 않으며 이 기사용으로 조립되었습니다.
이 해결책은 새로운 논문 팩터화된 비디오 생성: 텍스트-비디오 확산 모델에서 장면 구성과 시간적 합성을 분리의 형태로 제공되며, 비디오가 포함된 프로젝트 웹사이트도 있습니다.
현재 시스템은 언어 모델을 사용하여 모호하거나 미지정된 텍스트를 다시 작성하여 프롬프트 정확도를 높이려고 시도하지만, 새로운 연구는 이러한 전략이 모델의 내부 장면 표현이 결함이 있는 경우에도 실패로 이어진다고 주장합니다.
세부적인 다시 작성된 프롬프트와 함께, 텍스트-비디오 모델은 종종 주요 요소를 잘못 구성하거나 애니메이션의 논리를 깨는 호환되지 않는 초기 상태를 생성합니다. 첫 번째 프레임이 프롬프트를 설명하지 않는 한, 결과 비디오는 회복할 수 없습니다. 모션 모델이 얼마나 좋은지에 관계없이 말입니다.
이 논문은*:
‘[텍스트-비디오] 모델은 종종 분포적으로 이동된 프레임을 생성하지만, I2V 모델과 비교하여 평가 점수가 비슷합니다. 이는 모션 모델링이 상대적으로 자연스럽게 유지되지만 장면 충실도가 상대적으로 나쁨을 나타냅니다.
‘[이미지-비디오] 모델은補足적인 행동을 나타냅니다. 정확한 초기 장면에서 강한 평가 점수와 더 약한 시간적 일관성을 나타내며, I2V+텍스트는 두 가지 측면을 모두 균형있게 합니다.
‘이 대조는 현재 T2V 모델에 구조적 불일치가 있음을 시사합니다. 장면 고정과 시간적 합성은 별개의 귀납적 편향에서 이익을 얻지만, 기존 아키텍처는 두 가지를 모두 동시에 하나의 모델 내에서 학습하려고 시도합니다.’
생성 모드의 진단 비교는 모델이 명시적인 장면 앵커링 없이 점수를 잘 받지만 종종 장면 레이아웃을妥協하는 반면, 이미지 조건 접근 방식은 반대 패턴을 나타냅니다:

두 데이터셋에서 비디오 생성 모드의 비교, I2V+텍스트가 최고의 프레임 품질(FID)과 시간적 일관성(FVD)을 달성하여 장면 구성과 모션을 분리하는 이점을 강조합니다. 출처
이러한 발견은 현재 모델이 장면 레이아웃과 애니메이션을 모두 한 번에 학습하려고 시도하지만, 두 가지 작업은 서로 다른 귀납적 편향을 필요로 하며 별도로 처리하는 것이 더 좋다는 것을 시사합니다.
가장 흥미로운 점은 bahwa 이 ‘트릭’을 Wan 2.1 및 2.2와 같은 모델의 로컬 설치 및 Hunyuan Video와 같은 비디오 확산 모델에 적용할 수 있다는 것입니다. 이러한 접근 방식은 개방형 소스 오퍼링에 대한 대체로 작용할 수 있습니다.
테스트에서 이 방법은 T2V-CompBench 벤치마크에서 새로운 최적의 성능을 제공하며, 모든 테스트된 모델에서 성능을 크게 향상시킵니다. 저자들은 시스템이 충실도를 크게 향상시킵니다. 그러나 아이덴티티 드리프트를 해결하도록 설계되지 않았으며, 현재 생성적 AI 연구의 최대 과제입니다.
이 새로운 논문은 스위스 에코르 폴리테크니크 페데랄 드 로잔(EPFL)의 네 명의 연구자로부터 나왔습니다.
방법 및 데이터
새로운 기술의 핵심 제안은 텍스트-비디오(T2V) 확산 모델이 원하는 텍스트 프롬프트에 실제로 맞는 시작 프레임에 ‘앵커’되어야 한다는 것입니다.
모델이 시작 프레임을 존중하도록 하기 위해, 새로운 방법은 표준 확산 프로세스를 깨뜨リ며, 클린 잠재 변수를 앵커 이미지에서 timestep zero에 주입하여, 시스템이 사용자가 원하는 것을 제공하기 더 쉽게 만듭니다.

시각적 앵커를 사용하여 텍스트-비디오 생성을 위한 두 단계 방법: 왼쪽, 모델은 가벼운 LoRA를 사용하여 주입된 깨끗한 잠재 변수를 고정된 장면 제약으로 처리합니다. 오른쪽, 프롬프트는 첫 번째 프레임 캡션으로 분할되어, 비디오를 안내하는 앵커 이미지를 생성합니다.
추론에서, 방법은 프롬프트를 다시 작성하여 오직 첫 번째 프레임을 설명하며, LLM을 사용하여 레이아웃과 외관에 초점을 맞춘 초기 장면 상태를 추출합니다.
이 다시 작성된 프롬프트는 이미지 생성기에 전달되어, 후보 앵커 프레임(사용자가 선택적으로 수정할 수 있음)을 생성합니다. 선택된 프레임은 잠재 변수로 인코딩되어 확산 프로세스에 주입되어, 모델이 초기 장면에 ‘앵커’된 채로 나머지 비디오를 생성할 수 있습니다.
이 프로세스는 Wan2.2-14B, Wan2.1-1B 및 CogVideo1.5-5B를 위한 LoRA를 생성하여 테스트되었습니다. LoRA 훈련은 256의 랭크에서 5000개의 임의로 샘플링된 클립에서 수행되었습니다.
훈련은 6000 단계로 진행되었으며, Wan-1B 및 CogVideo-5B의 경우 48개의 GPU 시간이 필요했습니다. 저자들은 Wan-5B가 원래 모델보다 성능이 좋으며, 이는 시각적 앵커링이 장면 및 액션 이해를 크게 향상시킵니다.
테스트
실험에서 각 텍스트 프롬프트는 Qwen2.5-7B-Instruct를 사용하여 다시 작성되었습니다. 이는 ‘시드 이미지’ 캡션을 생성하여, 전체 장면을 설명했습니다.
벤치마크는 T2V-CompBench를 포함하여, 모델이 객체, 속성 및 액션을 하나의 일관된 장면에서 얼마나 잘 보존하는지 평가했습니다. 또한 VBench 2.0를 사용하여, 18개의 지표를 평가했습니다.

모든 7개의 평가 카테고리에서 팩터화된 T2V 방법이 표준 및 업샘플링된 T2V 기준선보다 모든 테스트된 모델에서 성능을 verbess했습니다. 최고의 변형은 종종 PixVerse-V3 벤치마크와 일치하거나超过했습니다.
저자들은 다음과 같이 말합니다*:
‘모든 모델에서 앵커 이미지를 추가하면 구성 성능이 일관적으로 향상됩니다. 모든 작은 팩터화된 모델(CogVideo 5B, Wan 5B 및 Wan 1B)은 더 큰 Wan 14B T2V 모델을超過합니다.
‘팩터화된 Wan 5B는 또한 상업적인 PixVerse-V3 기준선보다 성능이 좋습니다. 이는 시각적 앵커링이 작은 모델에서도 장면 및 액션 이해를 크게 향상시킵니다.
‘모델 패밀리 내에서 팩터화된 버전이 원래 모델을超過합니다. 특히, 우리의 경량 앵커-기반 LoRA는 WAN 14B에서 원래 I2V 14B 버전과 비교할 수 있는 성능을 나타냅니다(0.661 vs. 0.666). 이는 전체 재훈련이 필요하지 않습니다.’
다음은 VBench2.0 라운드입니다:

팩터화된 T2V 접근법이 구성, 常識적 推論, 제어 및 물리학에서 VBench 2.0 성능을 일관적으로 향상시킵니다. 일부 이익은 60%를超過합니다. 그러나 인간 충실도는 Veo 3 기준선보다 낮습니다.
모든 아키텍처에서 팩터화된 접근법은 인간 충실도以外 모든 VBench 카테고리에서 점수를 향상시킵니다. WAN 5B는 더 큰 WAN 14B를超過하여, 시각적 앵커링이 규모보다 더 중요하다는 이전 T2V-CompBench 결과를 강화합니다.
VBench에서 얻은 이익은 T2V-CompBench에서보다 작았으며, 저자들은 이것이 VBench의 더 엄격한 이진 평가 체계 때문이라고 주장합니다.
질적 테스트에서 논문은 정적 이미지를 제공하지만, 우리는 이 기사에 포함된 컴포지트 비디오를 참조하여, 더 나은 이해를 얻을 수 있습니다. 소스 비디오는 더 많고 다양하며, 더 높은 해상도와 세부를 가지고 있습니다. 이를 여기에서 찾을 수 있습니다. 질적 결과에 대해 논문은 다음과 같이 말합니다:
‘앵커된 비디오는 일관적으로 더 정확한 장면 구성, 더 강한 객체-속성 결합 및 더 명확한 시간적 진행을 나타냅니다.’
팩터화된 방법은 확산 단계를 50에서 15로 줄였을 때도 안정적이었으며, T2V-CompBench에서 거의 성능 손실이 없었습니다. 반면에, 텍스트 전용 및 업샘플링된 기준선은 동일한 조건에서 크게恶化되었습니다.
단계를 줄이는 것은 이론적으로 속도를 3배로 증가시킬 수 있지만, 전체 생성 파이프라인은 앵커 이미지 생성의 고정 비용으로 인해 실제로 2.1배 더 빠르기만 했습니다. 그러나 결과는 앵커링이 샘플 품질을 향상시키는 것뿐만 아니라 확산 프로세스를 안정화하여, 정확도 손실 없이 더 빠르고 효율적인 생성을 지원한다는 것을 나타냅니다.
프로젝트 웹사이트는 업샘플링된 생성과 새로운 방법의 생성을 비교하는 예제를 제공합니다. 우리는 몇 가지 편집된 예제를 제공합니다:
재생 (오디오 없음). 업샘플링된 시작 소스와 저자의 팩터화된 접근법.
저자들은 다음과 같이 결론을 내립니다:
‘우리의 결과는 향상된 앵커링이 모델 크기 증가만큼 중요할 수 있음을 시사합니다. 최근의 T2V 확산 모델의 발전은 모델 크기와 훈련 데이터의 증가에 크게 의존했습니다. 그러나 큰 모델은 종종 텍스트로부터 일관된 초기 장면을 추론하는 데 어려움을 겪습니다.
‘이것은 이미지 확산과 다르며, 확산은 상대적으로 간단합니다. 비디오 모델에서는 각 아키텍처 개선이 추가 시간적 차원을 통해 작동해야 하므로, 확장은 훨씬 더 많은 자원을 필요로 합니다.
‘우리의 발견은 향상된 앵커링이 규모를 보완하여 다른 병목 현상을 해결할 수 있음을 나타냅니다. 즉, 모션 합성이 시작되기 전에 올바른 장면을 설정하는 것입니다.
‘비디오 생성을 장면 구성과 시간적 모델링으로 분리함으로써, 우리는 몇 가지 일반적인 실패 모드를 없애지 않고, 모델 크기를 크게 증가시키지 않습니다. 우리는 이것을 보완적인 설계 원칙으로 간주하며, 이는 향후 아키텍처를 더 신뢰할 수 있고 구조화된 비디오 합성으로 안내할 수 있습니다.’
결론
엔트윈먼트의 문제는 매우 실제적이며, 전용 솔루션이 필요할 수 있지만(예: 개선된 큐레이션 및 분산 평가), 팩터화가 몇 가지 고착된 개념 프롬프트를 더 정확한 렌더링으로 ‘풀어줌’을 볼 수 있었습니다. 이는 중간 정도의 LoRA 조건부와 개선된 시작/시드 이미지를 통해 가능했습니다.
로컬 하비스트 추론과 상업적 솔루션 사이의 자원 격차는 생각보다 크지 않을 수 있습니다. 대부분의 제공자는 소비자에게 큰 GPU 자원 비용을 합리화하려고 노력하고 있습니다.
대부분의 현재 생성 비디오 제공업체는 중국의 오픈 소스 모델의 브랜드화된 버전을 사용하는 것으로 보입니다. 이러한 ‘중간자’ 시스템의 주요 차이점은 LoRA를 훈련하거나 모델 가중치를 전체적으로 미세 조정한 것입니다.
이러한 통찰력은 개방형 소스 오퍼링과 상업적 솔루션 사이의 격차를 더 좁히는 데 도움이 될 수 있습니다. 중국은 생성적 AI를 민주화하려고 하는 반면, 서양의 비즈니스 관심은 모델 크기를 증가시키고, 규제를 통해 좋은 모델을 API 뒤에 숨기고, 여러 계층의 콘텐츠 필터를 두려고 할 수 있습니다.
* 저자의 강조, 나의 것이 아닙니다.
† 논문은 사용된 GPU 또는 사용된 수를 지정하지 않습니다.
†† LoRA 경로는 더 경제적이고 사용하기 쉬우며, 모델의 전체 가중치가 항상 제공되지 않는 경우에 더 적합합니다.
2025년 12월 19일 처음 게시되었습니다.












