Anderson의 관점

생성적 비디오 시스템이 완전한 영화를 만들 수 없는 이유

mm
Unite.AI를 Google의 선호 소스에 추가
'a gorgeous illustration of a robot operating a professional movie camera' - ChatGPT Plus, Sept 2024

생성적 AI 비디오의 출현과 발전으로 많은 사람들이 기계 학습이 현재 우리가 알고 있는 영화 산업의 종말을 가져올 것이라고 예측했습니다. 즉, 단일 창작자가 현지 또는 클라우드 기반 GPU 시스템에서 할리우드 스타일의 블록버스터를 집에서 만들 수 있을 것입니다.

이 가능할까요? 가능하다면, 많은 사람들이 믿는 것처럼 임박한 것이 될까요?

개인이 현재 우리가 알고 있는 형태의 영화를 만들 수 있을 것이라는 것은 가능합니다. 그리고 아마도 필연적일 수도 있습니다.

그러나 생성적 비디오 시스템이 완전한 영화를 만들 수 없는 몇 가지 근본적인 이유가 있습니다.

이 마지막 사실은 중요합니다. 왜냐하면 현재 모든 인기 있는 텍스트-비디오(T2) 및 이미지-비디오(I2V) 시스템이 포함된 카테고리는 잠재 확산 모델(Latent Diffusion Models)을 기반으로 하기 때문입니다.

여기서 우리는 verdadeiro auteur 풀 길이의 생성적 AI 영화를 만들 수 있는 가능성을 고려하고 있습니다. 이러한 영화는 일관된 등장인물, 촬영, 시각 효과를 갖추고 있으며 할리우드의 현재 기술 수준과 비교할 수 있습니다.

가장 큰 장벽은 내러티브 불일치입니다. 현재 사용 가능한 모든 비디오 생성 시스템은真正한 ‘추적’ 촬영을 만들 수 없습니다.

이것은 이러한 시스템의 핵심인 확산 모델이 무작위 노이즈에 의존하기 때문입니다. 이 핵심 원리는 동일한 내용을 두 번 다시 해석하는 데 적합하지 않습니다.

텍스트 프롬프트가 사용될 때, 업로드된 ‘시드’ 이미지와 함께, 토큰은 의미적으로 적절한 콘텐츠를 모델의 잠재 공간에서 생성합니다.

그러나 ‘무작위 노이즈’ 요인으로 인해 동일한 방식으로 다시 수행할 수 없습니다.

이것은 비디오의 등장인물이 변경되고, 객체와 환경이 초기 촬영과 일치하지 않는다는 것을 의미합니다.

이것은 왜 바이럴 클립이 할리우드 수준의 출력과 비범한 시각을 보여주는 단일 촬영 또는 ‘쇼케이스 몬타주’로 구성되어 있는지 설명합니다.

이러한 컬렉션의 임시 비디오 생성은 기본 시스템이 연속적이고 일관된 내러티브를 생성할 수 있다고 암시합니다.

이것은 영화 예고편과 유사한 아나로지입니다. 영화 예고편은 영화에서 1-2분의 영상만을 보여주지만, 전체 영화가 존재한다는 이유를 관객에게 제공합니다.

현재 시스템 중에서 내러티브 일관성을 제공하는 시스템은 정지 이미지를 생성하는 시스템뿐입니다. 이것은 NVIDIA의 ConsiStory와 과학 문헌의 다양한 프로젝트를 포함합니다.

이론적으로, 이러한 시스템의 더 나은 버전을 사용하여 일련의 이미지-비디오 촬영을 생성할 수 있습니다. 그러나 현재 기술 수준에서는 이러한 접근 방식이 현실적인 결과를 생성하지 못합니다.

또한 Low Rank Adaptation(LoRA) 모델을 사용하여 일관성을 유지할 수 있습니다. 그러나 이러한 모델은 캐릭터, 사물 또는 환경을 위한 별도의 모델을 필요로 하며, 캐릭터가 새로운 의상을 입는 경우에는 새로운 LoRA를 훈련해야 합니다.

이러한 접근 방식은 복잡성을 추가하며, 영화의 오프닝 장면에서조차도 많은 작업과 후처리가 필요합니다.

또 다른 접근 방식은 비디오-비디오를 사용하는 것입니다. 그러나 이 경우에도 핵심 영상을 생성해야 하므로 이미 영화를 두 번 만드는 것입니다.

또한 비디오 확산 모델은 큰 그림을 볼 수 없으며, 이전 프레임이나 미래 프레임을 고려하지 않습니다. 이것은 일관된 외모를 유지하는 것을 어렵게 만듭니다.

두 번째 문제는 편집의 어려움입니다. 기존의 CGI 방법을 사용하여 촬영을 편집하는 것은 비교적 쉽습니다. 그러나 생성적 AI 비디오를 편집하는 것은 매우 어렵습니다.

이러한 시스템은 텍스트 프롬프트의 작은 변경으로도 여러 가지 결과를 생성할 수 있습니다. 이것은 편집을 매우 어려운 작업으로 만듭니다.

세 번째 문제는 물리 법칙의 적용입니다. 기존의 CGI 방법은 유체 동력학, 가스 운동, 역학, 의류 동작, 폭발 등과 같은 물리 법칙을 시뮬레이션할 수 있습니다.

그러나 확산 기반 방법은 이러한 물리 법칙을 시뮬레이션하는 데 어려움을 겪습니다. 이것은 이러한 시스템이 현실적인 물리 법칙을 따르지 않는 결과를 생성할 수 있음을 의미합니다.

OpenAI의 Sora 시스템은 이러한 제한을 인정했습니다. 그러나 이러한 제한은 현재의 기술 수준에서 해결될 수 있는 문제는 아닙니다.

또한 생성적 비디오 시스템은 빠른 움직임을 시뮬레이션하는 데 어려움을 겪습니다. 또한 시간적 일관성을 얻는 데 어려움을 겪습니다.

특정한 얼굴 표정이나 대화의 입술 동기화를 얻는 것도 어렵습니다. 이러한 문제를 해결하기 위해 LivePortrait와 AnimateDiff와 같은 보조 시스템을 사용할 수 있습니다.

이러한 시스템을 사용하면 생성적 비디오의 얼굴 표정과 입술 동기화를 편집할 수 있습니다. 그러나 이러한 시스템은 여전히 제한적이며, 생성적 비디오의 품질을 향상시키는 데 사용될 수 있습니다.

결론적으로, 생성적 비디오 시스템이 완전한 영화를 만들 수 있는 것은 아닙니다. 이러한 시스템은 내러티브 일관성, 편집, 물리 법칙의 적용 등에서 어려움을 겪습니다.

이러한 문제는 현재의 기술 수준에서 해결될 수 있는 문제는 아닙니다. 생성적 비디오 시스템이 완전한 영화를 만들 수 있도록 하려면 새로운 접근 방식이 필요할 수 있습니다.

또한 Gaussian Splatting과 같은 다른 기술이 생성적 비디오의 품질을 향상시키는 데 사용될 수 있습니다. 그러나 이러한 기술은 여전히 초기 단계에 있으며, 생성적 비디오의 품질을 향상시키는 데 사용될 수 있는지 여부는尚不明합니다.

마지막으로, 생성적 비디오 시스템이 완전한 영화를 만들 수 있는지 여부는尚不明합니다. 그러나 이러한 시스템이 완전한 영화를 만들 수 있도록 하려면 많은 기술적인 문제가 해결되어야 합니다.

1: 정확한 추적 촬영을 얻을 수 없음

내러티브 불일치는 가장 큰 장벽입니다. 현재 사용 가능한 모든 비디오 생성 시스템은真正한 ‘추적’ 촬영을 만들 수 없습니다.

이것은 이러한 시스템의 핵심인 확산 모델이 무작위 노이즈에 의존하기 때문입니다. 이 핵심 원리는 동일한 내용을 두 번 다시 해석하는 데 적합하지 않습니다.

2: 촬영을 쉽게 편집할 수 없음

기존의 CGI 방법을 사용하여 촬영을 편집하는 것은 비교적 쉽습니다. 그러나 생성적 AI 비디오를 편집하는 것은 매우 어렵습니다.

이러한 시스템은 텍스트 프롬프트의 작은 변경으로도 여러 가지 결과를 생성할 수 있습니다. 이것은 편집을 매우 어려운 작업으로 만듭니다.

3: 물리 법칙을 신뢰할 수 없음

기존의 CGI 방법은 유체 동력학, 가스 운동, 역학, 의류 동작, 폭발 등과 같은 물리 법칙을 시뮬레이션할 수 있습니다.

그러나 확산 기반 방법은 이러한 물리 법칙을 시뮬레이션하는 데 어려움을 겪습니다. 이것은 이러한 시스템이 현실적인 물리 법칙을 따르지 않는 결과를 생성할 수 있음을 의미합니다.

후처리에서 고치기

생성적 비디오 시스템은 빠른 움직임을 시뮬레이션하는 데 어려움을 겪습니다. 또한 시간적 일관성을 얻는 데 어려움을 겪습니다.

특정한 얼굴 표정이나 대화의 입술 동기화를 얻는 것도 어렵습니다. 이러한 문제를 해결하기 위해 LivePortrait와 AnimateDiff와 같은 보조 시스템을 사용할 수 있습니다.

결론

생성적 비디오 시스템이 완전한 영화를 만들 수 있는 것은 아닙니다. 이러한 시스템은 내러티브 일관성, 편집, 물리 법칙의 적용 등에서 어려움을 겪습니다.

이러한 문제는 현재의 기술 수준에서 해결될 수 있는 문제는 아닙니다. 생성적 비디오 시스템이 완전한 영화를 만들 수 있도록 하려면 새로운 접근 방식이 필요할 수 있습니다.

또한 Gaussian Splatting과 같은 다른 기술이 생성적 비디오의 품질을 향상시키는 데 사용될 수 있습니다. 그러나 이러한 기술은 여전히 초기 단계에 있으며, 생성적 비디오의 품질을 향상시키는 데 사용될 수 있는지 여부는尚不明합니다.

마지막으로, 생성적 비디오 시스템이 완전한 영화를 만들 수 있는지 여부는尚不明합니다. 그러나 이러한 시스템이 완전한 영화를 만들 수 있도록 하려면 많은 기술적인 문제가 해결되어야 합니다.

* Kaiber의 AI Storyboard 기능은 이러한 기능을 제공합니다. 그러나 제가 본 결과는 생산 품질이 아닙니다.

마틴 앤더슨은 메타피직스.ai의 과학 연구 콘텐츠 전임 책임자입니다. 2024년 9월 23일 처음 게시되었습니다.

기계 학습 분야 작가이자 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: [email protected]