Anderson의 관점
2개의 이미지에서 더 나은 AI 비디오 생성

비디오 프레임 보간(VFI)은 생성형 비디오 연구에서 여전히 해결되지 않은 문제입니다. 두 개의 기존 프레임 사이에 중간 프레임을 생성하는 것이 목표입니다.
재생을 클릭하세요. 구글과 워싱턴 대학교의 협력으로 개발된 FILM 프레임워크는 효과적인 프레임 보간 방법을 제안했으며, 현재에도 아마추어와 전문가 모두에서 인기 있는 방법입니다. 왼쪽에는 두 개의 별개이고 구별되는 프레임이 겹쳐져 있으며, 중간에는 ‘최종 프레임’이 있고, 오른쪽에는 프레임 사이의 최종 합성이 나타납니다. 출처: https://film-net.github.io/ 및 https://arxiv.org/pdf/2202.04901
광범위하게 말하자면, 이 기술은 이미 100년 이상 전부터 사용되어 왔으며, 전통적인 애니메이션에서 사용되어 왔습니다. 이 경우, 주요 애니메이션 아티스트에 의해 ‘키 프레임’이 생성되며, 중간 프레임의 작업은 다른 스태프에 의해 수행됩니다.
생성형 AI의 등장 이전에, 프레임 보간은 Real-Time Intermediate Flow Estimation(RIFE), Depth-Aware Video Frame Interpolation(DAIN), 구글의 Frame Interpolation for Large Motion(FILM – 위 참조)과 같은 프로젝트에서 기존 비디오의 프레임 속도를 높이거나 인공적으로 생성된 슬로우 모션 효과를 가능하게 하기 위해 사용되었습니다. 이것은 클립의 기존 프레임을 분리하고 추정된 중간 프레임을 생성하여 수행됩니다.
VFI는 또한 더 나은 비디오 코덱의 개발과, 더 일반적으로, 광학 흐름 기반 시스템(생성형 시스템 포함)의 개발에서 사용됩니다. 이러한 시스템은 미래의 키 프레임에 대한 사전 지식을 활용하여 그 이전의 내용을 최적화하고塑造합니다.
생성형 비디오 시스템의 종료 프레임
최신 생성형 시스템인 Luma와 Kling은 사용자가 시작 프레임과 종료 프레임을 지정할 수 있으며, 두 이미지 사이의 궤적을 추정하여 이 작업을 수행할 수 있습니다.
아래 예시에서 볼 수 있듯이, ‘종료’ 키 프레임을 제공하면 생성형 비디오 시스템(이 경우 Kling)이 동일성과 같은 측면을 유지할 수 있습니다. 그러나 결과는 완벽하지 않을 수 있습니다(특히 큰 동작의 경우).
재생을 클릭하세요. Kling은 사용자가 종료 프레임을 지정할 수 있는 비디오 생성기 중 하나입니다. 대부분의 경우, 최소한의 동작으로 가장 현실적이고 결함이 없는 결과를 얻을 수 있습니다. 출처: https://www.youtube.com/watch?v=8oylqODAaH8
위 예시에서, 사람의 동일성은 두 개의 사용자 제공 키 프레임 사이에서 일관됩니다. 이는 상대적으로 일관된 비디오 생성으로 이어집니다.
시작 프레임만 제공되는 경우, 생성형 시스템의 주의 창은 일반적으로 시작 비디오의 사람이 어떻게 보였는지 ‘기억’하기에 충분하지 않습니다. 그 대신, 동일성은 각 프레임마다 조금씩 변경되어, 결국 모든 유사성이 사라집니다. 아래 예시에서는 시작 이미지를 업로드하고, 사람의 동작을 텍스트 프롬프트로 안내했습니다.
재생을 클릭하세요. 종료 프레임이 없는 경우, Kling은 다음 프레임을 생성하기 위해 이전 프레임의 작은 그룹만 사용할 수 있습니다. 큰 동작이 필요한 경우, 동일성의 저하가 심각해집니다.
우리는 배우의 유사성이 지시와 탄력적으로 반응하지 않는다는 것을 알 수 있습니다. 생성형 시스템은 시드 이미지(사용 가능한 유일한 참조)에 미소 짓지 않은 배우의 모습을 알지 못하기 때문입니다.
대부분의 바이럴 생성형 클립은 이러한 단점을淡化하기 위해 신중하게 큐레이션됩니다. 그러나 시간적으로 일관된 생성형 비디오 시스템의 진행은 프레임 보간에 대한 새로운 연구 개발에 의존할 수 있습니다. 현재의 대안은 전통적인 CGI에 의존하는 것입니다.
또한, 작은 프레임 그룹에서 새로운 프레임을 도출하는 반복적인 성질은 큰 동작을 달성하기 어렵게 만듭니다. 이는 빠르게 이동하는 객체가 단일 프레임에서 한쪽에서 다른쪽으로 이동할 수 있기 때문입니다. 이는 시스템이 훈련된보다 더 급격한 동작입니다.
또한, 큰 동작이나 姿勢의 변경은 동일성의 변경뿐만 아니라 생생한 불일치로 이어질 수 있습니다.
재생을 클릭하세요. 이 예시에서, 요청된 동작이 훈련 데이터에 잘 표현되지 않는 것 같습니다.
Framer
이것은 중국에서 최근 발표된 새로운 논문으로, 진정한 프레임 보간을 달성했다고 주장합니다. 이것은 사용자와의 상호작용을 제공하는 최초의 시도입니다.
Framer는 사용자가 직관적인 드래그 기반 인터페이스를 사용하여 동작을 지정할 수 있습니다. 그러나 자동 모드도 있습니다.. 출처: https://www.youtube.com/watch?v=4MPGKgn7jRc
드래그 중심의 응용 프로그램은 최근에 연구 분야에서 빈번하게 등장하고 있습니다. 생성형 시스템에 대한 더 정교한 결과를 얻기 위해 텍스트 프롬프트의 гру한 결과를 제공하는 연구가 진행 중입니다.
새로운 시스템인 Framer는 사용자 지향적인 드래그뿐만 아니라 더 전통적인 ‘자동’ 모드를 제공합니다. 일반적인 트위닝 외에도, 시스템은 시간 경과 시뮬레이션, مور핑 및 입력 이미지의 새로운 뷰를 생성할 수 있습니다.

Framer의 시간 경과 시뮬레이션을 위한 중간 프레임.
새로운 뷰의 생성에 대해서는, Framer는 Neural Radiance Fields(NeRF) 영역과 조금 겹칩니다. 그러나 NeRF는 일반적으로 6개 이상의 이미지 뷰를 필요로 하는 반면, Framer는 2개의 이미지만 필요로 합니다.
테스트에서, Framer는 Stability.ai의 Stable Video Diffusion 잠재 확산 생성형 비디오 모델을 기반으로 하며, 사용자 연구에서 경쟁적인 접근 방식을 능가했습니다.
현재, 코드는 깃허브에서 공개될 예정입니다. 비디오 샘플은 프로젝트 사이트에서 사용할 수 있으며, 연구자들은 또한 유튜브 비디오를 공개했습니다.
새로운 논문은 Framer: Interactive Frame Interpolation이라고 제목이 붙여졌으며, 浙江大学와 알리바바 hậu援의 앤트 그룹의 9명의 연구자들에 의해 발표되었습니다.
방법
Framer는 두 가지 모드에서 모두 키 포인트 기반 보간을 사용합니다. 여기서 입력 이미지는 기본적인 위상으로 평가되고, 필요한 경우 ‘이동 가능한’ 포인트가 할당됩니다. 실제로, 이러한 포인트는 ID 기반 시스템의 얼굴 랜드마크와 동일하지만, 모든 표면에 일반화됩니다.
연구자들은 Stable Video Diffusion(SVD)을 OpenVid-1M 데이터셋에서 미세 조정했으며, 추가적인 마지막 프레임 합성 능력을 추가했습니다. 이것은 궤적 제어 메커니즘을 가능하게 하며, 이는 종료 프레임(또는 그 반대 방향)으로의 경로를 평가할 수 있습니다.

Framer의 스키마.
마지막 프레임 조건 추가에 대해, 저자는 다음과 같이 말합니다:
‘사전 훈련된 SVD의 시각적 이전을 가능한 한 보존하기 위해, 우리는 SVD의 조건 패러다임을 따르고, 잠재 공간과 의미 공간에서 각각 종료 프레임 조건을 삽입합니다.
‘구체적으로, 우리는 첫 번째 프레임의 VAE 인코딩된 잠재 특성을 첫 번째 프레임의 노이즈 잠재 특성과 연결합니다. 또한, 우리는 마지막 프레임의 잠재 특성을 마지막 프레임의 노이즈 잠재 특성과 연결하며, 조건과 해당 노이즈 잠재 특성이 공간적으로 정렬되어 있다고 가정합니다.
‘추가로, 우리는 첫 번째 프레임과 마지막 프레임의 CLIP 이미지 임베딩을 각각 추출하고, 크로스 어텐션 특성 삽입을 위해 연결합니다.’
드래그 기반 기능을 위해, 궤적 모듈은 메타 AI가 주도하는 CoTracker 프레임워크를 활용하여, 앞으로 가능한 경로를 평가합니다. 이러한 경로는 1~10개의 가능한 궤적으로 축소됩니다.
얻은 점 좌표는 DragNUWA와 DragAnything 아키텍처에 영감을 받은 방법으로 변환됩니다. 이것은 개별 대상 영역을 식별하는 가우시안 히트맵을 얻습니다.
뒤이어, 데이터는 원래 Stable Diffusion을 위해 설계되었지만 이후 다른 아키텍처에 적응된 보조 일관성 시스템인 ControlNet의 조건 메커니즘에 공급됩니다.
자동 모드에서는, 특징 매칭은 초기에 SIFT를 통해 수행되며, 궤적을 해석하여 자동 업데이트를 위한 메커니즘을 DragGAN과 DragDiffusion에 의해 영감을 받은 메커니즘에 전달할 수 있습니다.

Framer의 점 궤적 추정 스키마.
데이터 및 테스트
Framer의 미세 조정을 위해, 공간적 주의와 잔차 블록은 동결되었으며, hanya 시간적 주의 계층과 잔차 블록만 영향을 받았습니다.
모델은 10,000번의 반복에서 AdamW를 사용하여 학습되었으며, 학습 속도는 1e-4, 배치 크기는 16이었습니다. 16개의 NVIDIA A100 GPU에서 학습이 수행되었습니다.
이전 접근 방식이 드래그 기반 편집을 제공하지 않기 때문에, 연구자들은 Framer의 자동 모드를 이전 접근 방식의 표준 기능과 비교했습니다.
테스트된 프레임워크는 현재의 확산 기반 비디오 생성 시스템을 위한 LDMVFI, Dynamic Crafter, SVDKFI였습니다. 전통적인 비디오 시스템을 위한 경우, AMT, RIFE, FLAVR, 및 앞서 언급한 FILM이었습니다.
사용자 연구 외에도, DAVIS 및 UCF101 데이터셋에서 테스트가 수행되었습니다.
질적 테스트는 오직 연구 팀의 객관적인 능력과 사용자 연구에 의해 평가될 수 있습니다. 그러나 논문은 전통적인 정량적 지표가 주어진 문제에 적합하지 않다고 주장합니다:
‘재구성 지표와 같은 PSNR, SSIM, LPIPS는 보간된 프레임의 품질을 정확하게 포착하지 못합니다. 왜냐하면 원래 비디오와 픽셀 단위로 일치하지 않는 다른 가능한 보간 결과를 벌칙으로 적용하기 때문입니다.
‘생성 지표와 같은 FID는 약간의 개선을 제공하지만, 여전히 부족합니다. 왜냐하면 시간적 일관성을 고려하지 않고, 프레임을 분리하여 평가하기 때문입니다.’
이에도 불구하고, 연구자들은 몇 가지 인기 있는 지표에 대한 질적 테스트를 수행했습니다:

Framer와 경쟁 시스템의 정량적 결과.
저자는尽管 불리한 조건에도 불구하고, Framer가 테스트된 방법 중에서 최고의 FVD 점수를 달성했다고 주장합니다.
아래는 논문의 샘플 결과입니다:

전임 접근 방식에 대한 질적 비교. 더 나은 해상도와 비디오 결과를 위해 논문과 https://www.youtube.com/watch?v=4MPGKgn7jRc를 참조하세요.
저자는 다음과 같이 말합니다:
‘我们的 방법은 기존 보간 기술에 비해 훨씬 더 명확한 텍스처와 자연스러운 동작을 생성합니다. 특히 입력 프레임 사이에 큰 차이가 있는 경우, 전통적인 방법이 내용을 정확하게 보간하지 못하는 경우에 특히 잘 작동합니다.
‘다른 확산 기반 방법과 비교했을 때, Framer는 어려운 경우에 더 나은 적응성과 제어를 제공합니다.’
사용자 연구에서, 연구자들은 20명의 참가자를 모집했으며, 각 참가자는 다양한 방법으로 생성된 100개의 비디오 결과를 평가했습니다. 따라서 1000개의 평가가 수행되었습니다:

사용자 연구 결과.
위 그래프에서 볼 수 있듯이, 사용자들은 압도적으로 Framer의 결과를 선호했습니다.
프로젝트의 동반 유튜브 비디오는 Framer의 잠재적인 다른 용도를 설명합니다. 여기에는 모핑과 카툰 인베트윈닝이 포함됩니다.
결론
현재 AI 기반 비디오 생성을 위한 이 도전이 얼마나 중요한지 강조하기 어렵습니다. 지금까지, 이전의 솔루션인 FILM과 EbSynth는 아마추어와 전문가 모두에서 사용되어 왔습니다. 그러나 이러한 솔루션은 주목할만한 제한이 있습니다.
공식 예시 비디오의 불성실한 큐레이션으로 인해, 기계 학습 시스템이 3D 모ーフ블 모델이나 다른 보조 접근 방식과 같은 가이드 메커니즘 없이 정확하게 기하학을 추론할 수 있다는 일반적인 오해가 있습니다.
트위닝 자체는, 완벽하게 수행할 수 있다면, 이 문제에 대한 ‘해킹’ 또는 치트입니다. 그러나 두 개의 잘 맞는 프레임 이미지를 생성하는 것이 텍스트 프롬프트 또는 현재의 대안을 통해 가이드를 제공하는 것보다 쉽기 때문에, 이 오래된 방법의 AI 기반 버전에 대한 반복적인 진행을 보는 것이 좋습니다.
최초로 게시된 날짜: 2024년 10월 29일 화요일












