AI 모델 및 플랫폼

장기 비디오 생성을 위한 내러티브 일관성 조리법

mm
Unite.AI를 Google의 선호 소스에 추가
ChatGPt 4o: 'an image with a width of 1792px and a height of 1024px. It should depict an orthographic view of an AI factory where rows of white-coated computer analysts are seated in front of PCs, and on the other side of their section is a conveyer belt with multiple stages of a recipe for a cake. Three video cameras are situated equidistant across the conveyer belt, aimed at the food items.'

최근에 공개된 Hunyuan Video 생성적 AI 모델은 대규모 다중 모달 비전-언어 모델이 언젠가 전체 영화를 생성할 수 있는 잠재력을 둘러싼 논의를 강화시켰다.

그러나, 우리는 현재로서는 이러한 시나리오가 매우 먼 미래의 전망이라는 것을 관찰했다. 그 이유 중 하나는 대부분의 AI 비디오 생성기가 짧은 단일 샷에서조차 일관성을 유지하는 데 어려움을 겪기 때문이다.

또 다른 이유는 비디오 콘텐츠에 대한 일관된 참조(예: 탐색 가능한 환경)는 확산 모델에서 저랭크 적응(Low-Rank Adaptation, LoRA)와 같은 사용자 정의 기술을 통해만 달성할 수 있으며, 이는 기초 모델의 즉시 사용 가능성을 제한한다.

따라서 생성적 비디오의 발전은 새로운 내러티브 연속성 접근 방식이 개발되지 않는 한停滯할 것으로 보인다.

내러티브 연속성의 조리법

이 점을 염두에 두고, 미국과 중국의 새로운 협력은 미래의 내러티브 연속성 시스템의 가능한 템플릿으로 교본 비디오의 사용을 제안했다.

재생을 클릭하세요.비디오 오트르(VidéoAuteur) 프로젝트는 조리 과정을 분석하여 새 데이터셋과 비디오 생성을 위한 오케스트레이션 방법을 생성한다. 출처 사이트에서 더 나은 해상도를 참조하십시오. 출처: https://videoauteur.github.io/

비디오 오트르(VidéoAuteur)라는 이름의 이 연구는 교본 비디오를 생성하기 위해 일관된 상태를 결합하여 키프레임과 캡션을 사용하는 2단계 파이프라인을 제안한다. 이는 확실히 부족한 분야에서 최첨단 결과를 달성한다.

비디오 오트르 프로젝트 페이지에는 같은 기술을 사용하여 생성된 몇 가지 더 주목할 만한 비디오가 포함되어 있다. 예를 들어, 비디오 오트르 프로젝트 페이지에는 마블/DC 크로스오버를 위한 제안된 트레일러가 포함되어 있다.

재생을 클릭하세요. 두 개의 대체 우주에서 온 두 개의 슈퍼히ーロ스가 가짜 트레일러에서 서로를 마주한다. 출처 사이트에서 더 나은 해상도를 참조하십시오.

페이지에는 비슷한 스타일의 프로모션 비디오도 포함되어 있다. 예를 들어, 비슷한 스타일의 프로모션 비디오는 존재하지 않는 넷플릭스 동물 시리즈와 테슬라 자동차 광고를 위한 프로모션 비디오이다.

비디오 오트르를 개발하면서, 저자들은 다양한 손실 함수와 다른 새로운 접근 방식을 실험했다. 또한, 조리 방법 생성 워크플로우를 개발하기 위해, 저자들은 조리 도메인에 중점을 둔 가장 큰 데이터셋인 쿡젠(CookGen)을 구축했다. 쿡젠에는 평균 길이가 9.5초인 200,000개의 비디오 클립이 포함되어 있다.

(TSLA )

쿡젠은 평균 768.3개의 단어가 포함된 비디오로, 이는 같은 종류의 데이터셋 중에서 가장 광범위하게 주석이 달린 데이터셋이다. 다양한 비전/언어 모델을 사용하여, 가능한 한 자세하고 관련성이 있으며 정확한 설명을 보장하기 위해 다른 접근 방식도 사용되었다.

조리 비디오는 선택된 이유 중 하나는 조리 지침 워크스루가 구조화되고 모호하지 않은 내러티브를 가지고 있기 때문이다. 이는 주석과 평가를 더 쉽게 만든다. 예를 들어, 음란 비디오(이 분야에 곧 들어올 가능성이 있음)를 제외하고, 시각적 및 내러티브적으로 이렇게 ‘정형화’된 장르는 거의 없다.

저자들은 다음과 같이 말한다:

‘우리가 제안한 2단계 자동 회귀 파이프라인은 장기 내러티브 디렉터와 시각 조건 비디오 생성을 포함하며, 생성된 장기 내러티브 비디오에서 의미적 일관성과 시각적 충실도를 향상시키는 것을 보여준다.

‘우리는 또한 실험을 통해 비디오 시퀀스에서 공간적 및 시간적 일관성이 향상되는 것을 관찰한다.

‘우리는 장기 내러티브 비디오 생성에 대한 추가 연구를 촉진하기를 희망한다.’

새로운 연구는 비디오 오트르: 장기 내러티브 비디오 생성을 향한이라는 제목으로, 존스 홉킨스 대학교, 바이트댄스, 바이트댄스 시드의 8명의 저자에 의해 수행되었다.

데이터셋 구축

쿡젠(CookGen)을 개발하기 위해, 저자들은 YouCook과 HowTo100M 컬렉션의 자료를 사용했다. 저자들은 쿡젠의 규모를 이전의 내러티브 개발에 중점을 둔 생성적 비디오의 다른 데이터셋과 비교했다.

예를 들어, 플린트스톤(Flintstones) 데이터셋, 포로로(Pororo) 만화 데이터셋, 스토리젠(StoryGen), 텐센트의 스토리스트림(StoryStream), 비주얼 스토리텔링(VIST) 등이 있다.

쿡젠과 가장 가까운 유사한 데이터셋 사이의 이미지와 텍스트 길이 비교

쿡젠과 가장 가까운 유사한 데이터셋 사이의 이미지와 텍스트 길이 비교 출처: https://arxiv.org/pdf/2501.06173

쿡젠은 실제 세계의 내러티브에 중점을 둔 것으로, 특히 조리와 같은 절차적 활동을 다루고 있다. 이는 다른 데이터셋과 비교했을 때 더 명확하고 주석을 달기 쉽다.

연구자들은 LLaVA-NeXT의 방법론을 사용하여 캡션 모델을 미세 조정했다. HowTo100M에서 얻은 자동 음성 인식(ASR) 유사 레이블을 각 비디오의 ‘액션’으로 사용했다. 그리고 이후 대규모 언어 모델(LLM)을 사용하여 추가로 정제했다.

예를 들어, ChatGPT-4o를 사용하여 캡션 데이터셋을 생성하고, 주제-객체 상호작용(예: 손과 도구 및 음식의 상호작용), 객체 속성, 시간적 역학에 초점을 맞춘 캡션을 생성하도록 요청했다.

ASR 스크립트는 부정확하고 일반적으로 ‘잡음’이 있으므로, 캡션이 주석을 달고 있는 비디오 부분과 얼마나 일치하는지 측정하기 위해 IoU(Intersection-over-Union)를 사용했다. 저자들은 이것이 내러티브 일관성을 생성하는 데 중요하다고 주장한다.

수집된 클립은 Fréchet Video Distance(FVD)를 사용하여 평가되었다. 이는 실제 세계 예제와 생성된 예제 사이의 차이를 측정한다. 또한, 실제 키프레임을 사용하여 평가했다.

새 캡션을 사용하여 생성된 비디오와 실제 키프레임을 사용하여 평가

새 캡션을 사용하여 생성된 비디오와 실제 키프레임을 사용하여 평가

또한, 클립은 GPT-4o와 6명의 인간 주석자에 의해 평가되었다. LLaVA-Hound의 ‘환상’ 정의(즉, 모델이 가짜 콘텐츠를 발명할 수 있는 능력)를 따랐다.

연구자들은 캡션의 품질을 Qwen2-VL-72B 컬렉션과 비교했다. 약간 개선된 점수를 얻었다.

Qwen2-VL-72B와 저자 컬렉션 사이의 FVD 및 인간 평가 점수 비교

Qwen2-VL-72B와 저자 컬렉션 사이의 FVD 및 인간 평가 점수 비교

방법

비디오 오트르의 생성 단계는 장기 내러티브 디렉터(LND)와 시각 조건 비디오 생성 모델(VCVGM)으로 나뉜다.

LND는 내러티브 흐름을 특징으로 하는 시각적 임베딩 또는 키프레임의 시퀀스를 생성한다. VCVGM은 이러한 선택에 따라 비디오 클립을 생성한다.

비디오 오트르 처리 파이프라인의 스키마

비디오 오트르 처리 파이프라인의 스키마

저자들은 인터리브된 이미지-텍스트 디렉터와 언어 중심 키프레임 디렉터의 차이점에 대해 광범위하게 논의하고, 전자가 더 효과적인 접근 방식이라고 결론지었다.

인터리브된 이미지-텍스트 디렉터는 텍스트 토큰과 시각적 임베딩을 인터리브하여 자동 회귀 모델을 사용하여 다음 토큰을 예측한다. 이는 텍스트와 이미지의 결합된 컨텍스트를 기반으로 한다. 이는 시각적과 텍스트 간의 긴밀한 일치를 보장한다.

반면에, 언어 중심 키프레임 디렉터는 캡션만을 기반으로 시각적 임베딩을 통합하지 않고 텍스트 조건부 확산 모델을 사용하여 키프레임을 합성한다.

연구자들은 언어 중심 방법이 시각적으로 매력적인 키프레임을 생성하지만 프레임 간 일관성이 부족하다고 주장한다. 인터리브된 방법은 현실성과 시각적 일관성에서 더 높은 점수를 얻었다고 주장한다.

비정상적으로, 연구 주류가 안정성 확산과 플럭스를 워크플로우에 편입하는 것을 주도하는 가운데, 저자들은 텐센트의 SEED-X 7B-파라미터 다중 모달 언어 모델을 생성 파이프라인의 기초 모델로 사용했다.

저자들은 다음과 같이 말한다:

‘클래식 이미지-비디오(I2V) 파이프라인과 달리, 우리의 접근 방식은 연속적인 조건으로서 회귀된 시각적 잠재 변수를 활용한다.

‘さらに, 우리는 생성된 비디오의 강건성과 품질을 향상시키기 위해 모델을 노이즈가 있는 시각적 임베딩을 처리하도록 적응시켰다. 회귀 오류로 인해 회귀된 시각적 잠재 변수가 완벽하지 않을 수 있기 때문이다.’

일반적인 시각 조건 비디오 생성 파이프라인과 달리, 비디오 오트르는 초기 키프레임을 시작점으로 사용하는 대신, 의미적으로 일관된 잠재 공간에서 다중 부분 시각적 상태를 생성한다. 이는 초기 ‘시작 프레임’에만 기반한 추가 생성의 잠재적인 편향을 피한다.

시각적 상태 임베딩을 사용한 우수한 조건 방법의 스키마

시각적 상태 임베딩을 사용한 우수한 조건 방법의 스키마

테스트

연구자들은 시드 스토리(SeedStory)의 방법을 따라 SEED-X를 사용하여 내러티브 데이터셋에 LoRA 미세 조정을 적용했다. 그 결과를 ‘소라와 같은 모델’이라고 묘사했는데, 이는 대규모 비디오-텍스트 쌍에 미리 학습되어 시각적 및 텍스트 프롬프트와 조건을 모두 수용할 수 있다.

32,000개의 내러티브 비디오를 모델 개발에 사용했고, 1,000개를 검증 샘플로 留置했다. 비디오는 짧은 쪽으로 448픽셀으로 자르고 중심을 448x448px로 자르했다.

훈련을 위해, 내러티브 생성은 주로 YouCook2 검증 세트에서 평가되었다. Howto100M 세트는 데이터 품질 평가와 이미지-비디오 생성에 사용되었다.

시각적 조건 손실을 위해, 저자들은 DiT의 확산 손실과 Stable Diffusion를 기반으로 한 2024년 연구를 사용했다.

인터리브된 접근 방식이 우수하다는 주장을 입증하기 위해, 저자들은 비디오 오트르를 텍스트 기반 입력만을 사용하는 여러 방법과 대조했다. 예를 들어, EMU-2, SEED-X, SDXL, FLUX.1-s 등이 있다.

전역 프롬프트 '마포 두부 조리 가이드'가 주어졌을 때, 인터리브된 디렉터는 액션, 캡션, 이미지 임베딩을 순차적으로 생성하여 과정을 설명한다. 첫 두 행은 EMU-2와 SEED-X의 잠재 공간에서 디코딩된 키프레임을 보여준다. 이러한 이미지들은 현실적이고 일관성이 있지만, SDXL이나 FLUX와 같은 고급 모델의 이미지보다 다소 다듬지 못하다.

전역 프롬프트 ‘마포 두부 조리 가이드’가 주어졌을 때, 인터리브된 디렉터는 액션, 캡션, 이미지 임베딩을 순차적으로 생성하여 과정을 설명한다. 첫 두 행은 EMU-2와 SEED-X의 잠재 공간에서 디코딩된 키프레임을 보여준다. 이러한 이미지들은 현실적이고 일관성이 있지만, SDXL이나 FLUX와 같은 고급 모델의 이미지보다 다소 다듬지 못하다.

저자들은 다음과 같이 말한다:

‘언어 중심 접근 방식은 텍스트-이미지 모델을 사용하여 시각적으로 매력적인 키프레임을 생성하지만, 제한된 상호 정보로 인해 프레임 간 일관성이 부족하다. 반면에, 인터리브된 생성 방법은 언어와 일치하는 시각적 잠재 변수를 활용하여 현실적인 시각적 스타일을 달성한다.

‘그러나, 자동 회귀 모델은 정확한 임베딩을 단일 패스에서 생성하는 데 어려움을 겪기 때문에, 때때로 반복적이거나 노이즈가 있는 이미지를 생성할 수 있다.’

인간 평가도 저자들의 주장을 추가로 확인한다. 인터리브된 방법은 조사에서最高 점수를 얻었다.

논문에서 수행된 인간 연구의 접근 방식 비교

논문에서 수행된 인간 연구의 접근 방식 비교

그러나, 언어 중심 접근 방식은 가장 높은 ‘미적’ 점수를 얻었다. 저자들은 이것이 장기 내러티브 비디오 생성의 중심 문제가 아니라고 주장한다.

재생을 클릭하세요.비디오 오트르에 의해 생성된 피자 빌딩 비디오의 세그먼트.

결론

장기 형식 비디오 생성의 내러티브 일관성에 관한 가장 인기 있는 연구 주류는 단일 이미지에 관한 것이다. 이러한 종류의 프로젝트에는 DreamStory, StoryDiffusion, TheaterGen, NVIDIA의 ConsiStory 등이 있다.

어떤 의미에서, 비디오 오트르도 이 ‘정적’ 범주에 속한다. 왜냐하면, 그것은 클립 섹션을 생성하기 위한 시드 이미지의 사용을 포함하기 때문이다. 그러나, 비디오와 의미적 콘텐츠의 인터리빙은 프로세스를 실제 파이프라인에 한 단계 더 가까이 가져온다.

최초로 게시된 날: 2025년 1월 16일 목요일

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai