AI 모델 및 플랫폼
다이나믹 크래프터: 비디오 확산 사전 지식을 사용한 오픈 도메인 이미지 애니메이션
컴퓨터 비전은 현재 AI 커뮤니티에서 가장 흥미롭고 잘 연구된 분야 중 하나이며, 컴퓨터 비전 모델의 빠른 향상에도 불구하고, 개발자들이 masih 어려움을 겪는 오랜 도전은 이미지 애니메이션입니다. 오늘날에도 이미지 애니메이션 프레임워크는 자연스러운 동작을 보여주는 동영상으로静적인 이미지를 변환하는 데 어려움을 겪고 있습니다. 전통적으로, 이미지 애니메이션 프레임워크는 자연스러운 장면을 애니메이션화하는 데 중점을 두며, 도메인 특정 동작이나 스토캐스틱 동작과 같은 인간의 머리카락이나 몸의 동작, 또는 유체 또는 구름과 같은 도메인 특정 동작을 애니메이션화합니다. 이러한 접근 방식은 어느 정도 효과가 있지만, 이러한 애니메이션 프레임워크의 적용 범위를 더 일반적인 시각적 콘텐츠로 확장하는 데 제한됩니다.
さらに, 기존의 이미지 애니메이션 접근 방식은 주로 동작을 합성하거나 특정 객체 범주에 맞게 맞춤형으로 설계하는 데 중점을 두고 있습니다. 그러나 이러한 접근 방식의 주목할만한 결함은 이러한 방법에 강한 가정들이 부과되어 궁극적으로 일반 시나리오에서 특히 오픈 도메인 이미지 애니메이션과 같은 시나리오에서 이러한 방법의 적용 범위를 제한합니다. 지난 몇 년 동안, T2V 또는 텍스트에서 비디오 모델은 텍스트 프롬프트를 사용하여 생생하고 다양한 비디오를 생성하는 데 탁월한 성과를 보여왔으며, 이는 다이나믹 크래프터 프레임워크의 기초를 형성합니다.
다이나믹 크래프터 프레임워크는 현재 이미지 애니메이션 모델의 제한을 극복하고 오픈 월드 이미지와 같은 일반적인 시나리오에 대한 적용 범위를 확장하기 위한 시도입니다. 다이나믹 크래프터 프레임워크는 오픈 도메인 이미지에 대한 동적 콘텐츠를 합성하여 애니메이션 비디오로 변환하는 것을 목표로 합니다. 다이나믹 크래프터의 핵심 아이디어는 이미지를 가이드로 통합하여 이미 존재하는 텍스트에서 비디오 확산 모델의 동작 사전 지식을 활용하는 것입니다. 주어진 이미지에 대해, 다이나믹 크래프터 모델은 먼저 쿼리 트랜스포머를 구현하여 이미지를 텍스트와 일치하는 풍부한 컨텍스트 표현 공간으로 투영하여 비디오 모델이 이미지 콘텐츠를 호환되는 방식으로 처리할 수 있도록 합니다. 그러나 다이나믹 크래프터 모델은 아직 결과 비디오에서 일부 시각적 세부 사항을 보존하는 데 어려움을 겪고 있습니다. 이는 다이나믹 크래프터 모델이 확산 모델에 초기 노이즈와 함께 이미지를 연결하여 더 정밀한 이미지 정보로 모델을 보충함으로써 해결됩니다.
이 기사는 다이나믹 크래프터 프레임워크를 깊이 있게 다루고, 메커니즘, 방법론, 아키텍처 및 최신 이미지 및 비디오 생성 프레임워크와의 비교를 탐구합니다. 따라서 시작해 보겠습니다.
다이나믹 크래프터: 오픈 도메인 이미지 애니메이션
정적인 이미지를 애니메이션화하면 관객에게 매력적인 시각적 경험을 제공할 수 있습니다. 여러 해 동안 많은 프레임워크가 정적인 이미지를 애니메이션화하는 다양한 방법을 탐구했습니다. 초기 애니메이션 프레임워크는 물리적 시뮬레이션 기반 접근 방식을 구현하여 특정 객체의 동작을 시뮬레이션했습니다. 그러나 각 객체 범주를 독립적으로 모델링하여 이러한 접근 방식은 효과적이지 않았으며 일반화되지 않았습니다. 더 실제적인 동작을 복제하기 위해 참조 기반 방법이 등장하여 동작 또는 외관 정보를 참조 신호에서 합성 프로세스로 전달했습니다. 참조 기반 접근 방식은 시뮬레이션 기반 접근 방식보다 더 나은 시간적 일관성을 제공했지만 추가 가이드가 필요하여 실제 적용이 제한되었습니다.
최근 몇 년 동안 대부분의 애니메이션 프레임워크는 자연스러운 장면을 애니메이션화하는 데 중점을 두며, 도메인 특정 동작이나 스토캐스틱 동작과 같은 인간의 머리카락이나 몸의 동작, 또는 유체 또는 구름과 같은 도메인 특정 동작을 애니메이션화합니다. 이러한 접근 방식은 어느 정도 효과가 있지만, 이러한 프레임워크가 생성하는 결과는 만족스럽지 않으며, 개선의 여지가 많습니다. 텍스트에서 비디오 생성 모델이 최근 몇 년 동안 보여준 탁월한 성과는 다이나믹 크래프터 프레임워크 개발자들에게 이미지 애니메이션을 위해 텍스트에서 비디오 모델의 강력한 생성 능력을 활용하도록 영감을 주었습니다.
다이나믹 크래프터 프레임워크의 핵심은 조건부 이미지를 통합하여 텍스트에서 비디오 확산 모델의 비디오 생성 프로세스를 제어하는 것입니다. 그러나 이미지 애니메이션의 궁극적인 목표는 여전히 비중입니다. 이미지 애니메이션에는 세부 사항을 보존하고 시각적 컨텍스트를 이해하는 것이 필수적입니다. 다이나믹 크래프터 프레임워크는 비디오 확산 모델에 대한 시각적 가이드를 제공하여 이미지와 비슷한 비디오를 생성합니다. 다이나믹 크래프터 프레임워크는 두 가지 보완적인 스트림을 제안하여 시각적 세부 사항을 제공하고 컨텍스트를 제어합니다. 이 두 가지 스트림은 비디오 확산 모델이 세부 사항을 보존한 동적 콘텐츠를 생성하도록 허용합니다.

주어진 이미지에 대해, 다이나믹 크래프터 프레임워크는 먼저 컨텍스트 학습 네트워크를 사용하여 이미지를 텍스트와 일치하는 컨텍스트 표현 공간으로 투영합니다. 컨텍스트 표현 공간은 학습 가능한 쿼리 트랜스포머와 사전 훈련된 CLIP 이미지 인코더로 구성됩니다. 모델은 크로스 어텐션 레이어를 사용하여 풍부한 컨텍스트 특징을 사용하며, 게이트드 퓨전을 사용하여 텍스트 특징과 크로스 어텐션 레이어를 결합합니다. 그러나 이 접근 방식은 학습된 컨텍스트 표현과 텍스트와 일치하는 시각적 세부 사항을 교환하며, 이는 이미지 컨텍스트의 의미적 이해를 허용하여 합리적이고 생생한 동작을 생성합니다. 또한, 프레임워크는 확산 모델에 초기 노이즈와 함께 전체 이미지를 연결하여 추가 시각적 세부 사항을 제공합니다. 결과적으로, 다이나믹 크래프터 프레임워크의 두 가지 스트림 접근 방식은 시각적 일관성과 실제적인 동적 콘텐츠를 보장합니다.
다음으로, 확산 모델 또는 DM은 텍스트에서 이미지 생성에서 탁월한 성능과 생성 능력을 보여주었습니다. 텍스트에서 이미지 생성의 성공을 비디오 생성으로 복제하기 위해, 비디오 확산 모델 또는 VDM이 제안되었습니다. 비디오 확산 모델은 픽셀 공간에서 공간-시간 분할 U-Net 아키텍처를 사용하여 저해상도 비디오를 모델링합니다. 텍스트에서 이미지 프레임워크의 지식을 비디오 생성으로 전환하면 훈련 비용을 줄일 수 있습니다. 비디오 확산 모델은 높은 품질의 비디오를 생성할 수 있지만, 텍스트 프롬프트만을 유일한 의미 있는 가이드로 사용하므로 사용자의 실제 의도를 반영하지 않을 수 있으며, 모호할 수 있습니다. 그러나 대부분의 비디오 확산 모델의 결과는 입력 이미지와 일치하지 않으며, 비현실적인 시간적 변화를 겪습니다. 다이나믹 크래프터 접근 방식은 텍스트 조건부 비디오 확산 모델을 기반으로 하며, 이미지를 애니메이션화하기 위해 이미 존재하는 텍스트에서 비디오 확산 모델의 풍부한 동적 사전 지식을 활용합니다.
다이나믹 크래프터: 방법과 아키텍처
주어진 정적인 이미지에 대해, 다이나믹 크래프터 프레임워크는 이미지에서 비디오로 변환하여 자연스러운 동작을 보여주는 짧은 비디오 클립을 생성하려고 합니다. 비디오 클립은 이미지의 시각적 콘텐츠를 상속받으며, 자연스러운 동작을 보여줍니다. 그러나 이미지의 위치가 결과 프레임 시퀀스의 임의 위치에 나타날 수 있습니다. 이미지의 위치가 임의의 위치에 나타나는 것은 이미지 조건부 비디오 생성 작업에서 높은 시각적 일관성 요구 사항이 있는 특별한 도전입니다. 다이나믹 크래프터 프레임워크는 사전 훈련된 비디오 확산 모델의 생성 사전 지식을 사용하여 이 도전을 극복합니다.
비디오 확산 사전 지식에서 이미지 동역학
일반적으로, 오픈 도메인 텍스트에서 비디오 확산 모델은 텍스트 설명을 조건으로 동적 시각적 콘텐츠를 보여줍니다. 정적인 이미지를 애니메이션화하기 위해 텍스트에서 비디오 생성 사전 지기를 사용하려면, 프레임워크는 먼저 비디오 생성 프로세스에 시각적 정보를 포괄적으로 주입해야 합니다. 또한, 동적 합성의 경우, T2V 모델은 이미지 컨텍스트를 이해해야 하며, 생성된 비디오에서 시각적 세부 사항을 보존할 수 있어야 합니다.

텍스트와 일치하는 컨텍스트 표현
이미지 컨텍스트로 비디오 생성을 가이드하기 위해, 다이나믹 크래프터 프레임워크는 이미지를 호환되는 방식으로 비디오 모델이 사용할 수 있는 일치된 임베딩 공간으로 투영하려고 합니다. 이를 위해, 다이나믹 크래프터 프레임워크는 이미지 인코더를 사용하여 입력 이미지에서 이미지 특징을 추출합니다. 이미지 인코더는 사전 훈련된 CLIP 이미지 인코더입니다. 이미지 특징은 크로스 어텐션 레이어를 사용하여 추출되며, 모델은 컨텍스트와 텍스트 임베딩을 상호 작용시키기 위해 크로스 어텐션 레이어를 사용합니다. 또한, 다이나믹 크래프터 프레임워크는 컨텍스트와 텍스트 임베딩을 사용하여 U-Net 중간 특징과 상호 작용하는 데 게이트드 퓨전을 사용합니다. 이 디자인은 모델이 이미지 조건을 계층별로 흡수할 수 있도록 합니다.
시각적 세부 사항 가이드
다이나믹 크래프터 프레임워크는 정보가 풍부한 컨텍스트 표현을 사용하여 비디오 확산 모델이 입력 이미지와 비슷한 비디오를 생성하도록 합니다. 그러나, 다음과 같은 이미지에서 보여지듯이, 생성된 콘텐츠는 입력 정보를 완전히 보존하지 못하는 사전 훈련된 CLIP 인코더의 제한된 능력으로 인해 약간의 불일치를 보여줄 수 있습니다.

시각적 일관성을 향상시키기 위해, 다이나믹 크래프터 프레임워크는 비디오 확산 모델에 추가적인 시각적 세부 사항을 제공하려고 합니다. 이를 위해, 다이나믹 크래프터 모델은 조건부 이미지를 초기 노이즈와 함께 연결하여 확산 모델에 가이드로 제공합니다.
훈련 패러다임
다이나믹 크래프터 프레임워크는 조건부 이미지를 두 가지 보완적인 스트림을 통해 통합하여 세부 사항 가이드와 컨텍스트 제어를 제공합니다. 이를 위해, 다이나믹 크래프터 모델은 세 단계 훈련 프로세스를 사용합니다
- 첫 번째 단계에서, 모델은 이미지 컨텍스트 표현 네트워크를 훈련합니다.
- 두 번째 단계에서, 모델은 이미지 컨텍스트 표현 네트워크를 텍스트에서 비디오 모델에 적응시킵니다.
- 세 번째 단계에서, 모델은 이미지 컨텍스트 표현 네트워크와 시각적 세부 사항 가이드 컴포넌트를 함께 미세 조정합니다.
이미지 정보를 텍스트에서 비디오 모델과 호환되도록 적응시키기 위해, 다이나믹 크래프터 프레임워크는 컨텍스트 표현 네트워크를 개발하여 주어진 이미지에서 텍스트와 일치하는 시각적 세부 사항을 캡처하도록 설계합니다. 컨텍스트 표현 네트워크는 텍스트에서 이미지 모델과 함께 공동으로 훈련됩니다. 이를 위해, 다이나믹 크래프터 프레임워크는 컨텍스트 표현 네트워크를 먼저 텍스트에서 이미지 모델과 함께 훈련하고, 그 다음에 비디오 확산 모델의 공간적 레이어와 함께 미세 조정합니다.
다이나믹 크래프터 프레임워크는 이미지 정보를 비디오 확산 모델과 호환되도록 적응시키기 위해, 컨텍스트 표현 네트워크와 비디오 확산 모델의 공간적 레이어를 함께 미세 조정합니다. 이를 위해, 프레임워크는 입력 이미지를 초기 노이즈와 함께 연결하여 확산 모델에 가이드로 제공합니다. 이 접근 방식은 다이나믹 크래프터 모델이 이미지를 애니메이션화하는 데 사용되는 비디오 확산 모델의 기존 시간적 인사이트를 유지하면서, 이미지 정보를 모델에 통합하는 데 도움이 됩니다.
다이나믹 크래프터: 실험 및 결과
다이나믹 크래프터 프레임워크는 컨텍스트 표현 네트워크와 이미지 크로스 어텐션 레이어를 스테이블 확산에 훈련합니다. 그런 다음, 스테이블 확산 컴포넌트를 비디오 크래프터로 대체하고, 컨텍스트 표현 네트워크와 공간적 레이어를 이미지 연결과 함께 미세 조정합니다. 추론 시, 프레임워크는 다중 조건 분류기 자유 가이드와 함께 DDIM 샘플러를 사용합니다. 또한, 프레임워크는 생성된 비디오의 시간적 일관성과 품질을 평가하기 위해, FVD 또는 프레체 비디오 거리와 KVD 또는 커널 비디오 거리를 보고합니다. 입력 이미지와 생성된 비디오 사이의 지각적 일관성을 조사하기 위해, 프레임워크는 PIC 또는 지각적 입력 일관성을 도입하고, 지각적 거리 측정인 DreamSim을 거리 함수로 사용합니다.
다음 그림은 다양한 스타일과 콘텐츠의 생성된 애니메이션 콘텐츠를 시각적으로 비교합니다.

그림에서 볼 수 있듯이, 다이나믹 크래프터 프레임워크는 입력 이미지 조건을 잘 따르며, 시간적으로 일관된 비디오를 생성합니다. 다음 표는 49명의 참가자가 시간적 일관성, 동작 품질 및 입력 이미지에 대한 시각적 일관성에 대한 선호도를 보여줍니다. 그림에서 볼 수 있듯이, 다이나믹 크래프터 프레임워크는 기존 방법을 상당한 차이로 능가합니다.

다음 그림은 두 가지 스트림 주입 방법과 훈련 패러다임을 사용한 결과를 보여줍니다.

최종 생각
이 기사에서, 우리는 다이나믹 크래프터에 대해 논의했으며, 이는 현재 이미지 애니메이션 모델의 제한을 극복하고 오픈 월드 이미지와 같은 일반적인 시나리오에 대한 적용 범위를 확장하기 위한 시도입니다. 다이나믹 크래프터 프레임워크는 오픈 도메인 이미지에 대한 동적 콘텐츠를 합성하여 애니메이션 비디오로 변환하는 것을 목표로 합니다. 다이나믹 크래프터의 핵심 아이디어는 이미지를 가이드로 통합하여 이미 존재하는 텍스트에서 비디오 확산 모델의 동작 사전 지식을 활용하는 것입니다. 주어진 이미지에 대해, 다이나믹 크래프터 모델은 먼저 쿼리 트랜스포머를 구현하여 이미지를 텍스트와 일치하는 풍부한 컨텍스트 표현 공간으로 투영하여 비디오 모델이 이미지 콘텐츠를 호환되는 방식으로 처리할 수 있도록 합니다. 그러나 다이나믹 크래프터 모델은 아직 결과 비디오에서 일부 시각적 세부 사항을 보존하는 데 어려움을 겪고 있습니다. 이는 다이나믹 크래프터 모델이 확산 모델에 초기 노이즈와 함께 이미지를 연결하여 더 정밀한 이미지 정보로 모델을 보충함으로써 해결됩니다.












