AI 모델 및 플랫폼

AnimateLCM: 개인화된 확산 모델의 애니메이션 가속

mm
Unite.AI를 Google의 선호 소스에 추가

過去 몇 년 동안, 확산 모델은 이미지 및 비디오 생성 작업에서 큰 성공과 인정을 받았습니다. 특히 비디오 확산 모델은 높은 일관성 및 충실도를 갖는 비디오를 생성할 수 있는 능력으로 인해 많은 주목을 받았습니다. 이러한 모델은 고차원 가우시안 노이즈를 실제 데이터로渐進的に変換하는 반복적인 노이즈 제거 프로세스를 사용하여 높은 품질의 비디오를 생성합니다.

Stable Diffusion은 이미지 생성 작업을 위한 가장 대표적인 모델 중 하나로, 실제 이미지와 다운샘플링된 잠재 특징 사이의 매핑을 위한 VAE(Variational AutoEncoder)를 사용합니다. 이는 모델이 생성 비용을 줄이고, 아키텍처의 크로스 어텐션 메커니즘을 통해 텍스트 조건부 이미지 생성을 용이하게 합니다. 최근에, Stable Diffusion 프레임워크는 더 혁신적이고 효과적인 이미지 또는 비디오 생성을 달성하기 위한 플러그 앤 플레이 어댑터를 위한 기초를 마련했습니다. 그러나 대부분의 비디오 확산 모델에서 사용되는 반복적인 생성 프로세스는 이미지 생성 프로세스를 시간이 걸리고 비용이 많이 드는 것으로 만들며, 이는 그들의 응용 프로그램을 제한합니다.

이 기사에서, 우리는 AnimateLCM이라는 개인화된 확산 모델에 대해 이야기할 것입니다. 이 모델은 어댑터를 사용하여 최소한의 단계와 계산 비용으로 높은 충실도의 비디오를 생성하는 것을 목표로 합니다. AnimateLCM 프레임워크는 일관성 모델에서 영감을 받았으며, 이는 미리 학습된 이미지 확산 모델을 증류하여 샘플링을 최소한의 단계로 가속화합니다. 또한, 일관성 모델의 성공적인 확장인 잠재 일관성 모델(Latent Consistency Model, LCM)은 조건부 이미지 생성을 용이하게 합니다. 원시 비디오 데이터セット에 직접 일관성 학습을 수행하는 대신, AnimateLCM 프레임워크는 분리된 일관성 학습 전략을 제안합니다. 이 전략은 운동 생성 및 이미지 생성 우선순위를 분리하여 모델이 생성된 콘텐츠의 시각적 품질을 향상시키고 동시에 훈련 효율성을 개선할 수 있습니다. 또한, AnimateLCM 모델은_scratch에서 어댑터를 훈련하거나 기존 어댑터를 자신의 증류된 비디오 일관성 모델에 적응시키는 것을 제안합니다. 이는 안정적인 확산 모델家族의 플러그 앤 플레이 어댑터를 결합하여 다른 기능을 수행할 수 있게 합니다.

이 기사는 AnimateLCM 프레임워크를 깊이 있게 다룰 것입니다. 우리는 메커니즘, 방법론, 아키텍처 및 기타 최첨단 이미지 및 비디오 생성 프레임워크와의 비교를 탐구할 것입니다. 따라서, 시작해 봅시다.

AnimateLCM: 개인화된 확산 모델의 애니메이션

확산 모델은 이미지 생성 및 비디오 생성 작업을 위해 효율성과 능력으로 인해 가장 많이 사용되는 프레임워크 중 하나입니다. 대부분의 확산 모델은 이미지 생성을 위해 반복적인 노이즈 제거 프로세스를 사용합니다. 이 프로세스는 고차원 가우시안 노이즈를 실제 데이터로渐進적으로変換합니다. 이러한 방법은 어느 정도 만족스러운 결과를 제공하지만, 반복 프로세스와 샘플링 횟수가 생성 프로세스를 느리게 만들며, 확산 모델의 계산 요구를 증가시킵니다. 이는 다른 생성 프레임워크인 GAN(Generative Adversarial Network)보다 느립니다.

최근 몇 년 동안, 일관성 모델 또는 CM은 반복적인 확산 모델의 대안으로 제안되었습니다. 이는 생성 프로세스를 가속화하고 계산 요구를 일정하게 유지하기 위한 것입니다. 일관성 모델의 주요 특징은 미리 학습된 확산 모델에 의해 도입된 궤적의 자기 일관성을 유지하는 일관성 매핑을 학습하는 것입니다. 일관성 모델의 학습 프로세스는 최소한의 단계로 높은 품질의 이미지를 생성할 수 있으며, 계산 집약적인 반복을 제거합니다.

또한, 안정적인 확산 프레임워크를 기반으로 구축된 잠재 일관성 모델(Latent Consistency Model, LCM)은 웹 사용자 인터페이스에 기존 어댑터와 통합되어 추가 기능을 수행할 수 있습니다. 예를 들어, 실시간 이미지에서 이미지로의 번역과 같은 기능을 수행할 수 있습니다. 반면에, 기존의 비디오 확산 모델은 수용할 만한 결과를 제공하지만, 비디오 샘플 가속 분야에서는 여전히 진행이 필요하며, 이는 높은 비디오 생성 계산 비용으로 인해 중요합니다.

이로 인해, 우리는 AnimateLCM이라는 최소한의 단계가 필요한 고충실도 비디오 생성 프레임워크에 대해 이야기하게 됩니다. 잠재 일관성 모델을 따라, AnimateLCM 프레임워크는 역방향 확산 프로세스를 CFG 또는 Classifier Free Guidance aumented 확률 흐름을 해결하는 것으로 간주하며, 이러한 확률 흐름의 직접적인 해결을 예측하기 위해 모델을 훈련시킵니다. 그러나, 원시 비디오 데이터에 직접 일관성 학습을 수행하는 대신, AnimateLCM 프레임워크는 분리된 일관성 학습 전략을 제안합니다. 이는 운동 생성 및 이미지 생성 우선순위를 분리하여 모델이 생성된 콘텐츠의 시각적 품질을 향상시키고 동시에 훈련 효율성을 개선할 수 있습니다.

AnimateLCM 프레임워크는 먼저 이미지 기반 확산 모델을 이미지 일관성 모델로 적응시키기 위해 일관성 증류를 수행합니다. 그런 다음, 2D畳み込み 커널을 3D畳み込み 커널로 확장하여 비디오 생성을 위한 일관성 모델을 훈련시킵니다. 또한, 초기화 전략을 사용하여 확산 프로세스에서 발생할 수 있는 특징 훼손을 완화합니다. AnimateLCM 프레임워크는 안정적인 확산 프레임워크를 기반으로 하므로, 자신의 증류된 비디오 일관성 모델의 공간 가중치를 공개적으로 사용 가능한 개인화된 이미지 확산 가중치로 대체하여 혁신적인 생성 결과를 달성할 수 있습니다.

또한, 특정 어댑터를_scratch에서 훈련하거나 공개적으로 사용 가능한 어댑터를 더 잘 적응시키기 위해, AnimateLCM 프레임워크는 어댑터에 대한 효과적인 가속 전략을 제안합니다. 이는 특정 교사 모델을 훈련할 필요가 없습니다.

AnimateLCM 프레임워크의 기여는 다음과 같이 요약할 수 있습니다: AnimateLCM 프레임워크는 고충실도, 빠르며, 높은 충실도의 비디오 생성을 달성하기 위한 목표를 가지고 있습니다. 이를 위해, AnimateLCM 프레임워크는 운동 및 이미지 생성 우선순위를 분리하는 분리된 증류 전략을 제안하여 생성 품질을 향상시키고 훈련 효율성을 개선합니다.

InstantID: 방법론 및 아키텍처

InstantID 프레임워크는 확산 모델과 샘플링 속도 전략에서 많은 영감을 받았습니다. 확산 모델, 즉 점수 기반 생성 모델은 이미지 생성 능력에서 놀라운 결과를 보여주었습니다. 점수 방향의 지시에 따라, 확산 모델에서 구현된 반복적인 샘플링 전략은 노이즈가 있는 데이터를渐進적으로 정화합니다. 확산 모델의 효율성은 대부분의 비디오 확산 모델에서 사용되는 주요 이유 중 하나입니다.

InstantID 프레임워크는 안정적인 확산 모델을 기반으로 하며, 이는 InstantID가 관련 개념을 적용할 수 있게 합니다. 모델은 이산형 전방 확산 프로세스를 연속 시간 분산 보존 SDE로 간주합니다. 또한, 안정적인 확산 모델은 DDPM(Denoising Diffusion Probabilistic Model)의 확장입니다. 여기서 훈련 데이터 포인트는 이산 마르코프 체인에 의해渐進적으로 노이즈가 추가되며, 이는 노이즈가 있는 데이터의 분포가 시간 단계에 따라 변합니다.

최소한의 단계로 고충실도 비디오 생성을 달성하기 위해, AnimateLCM 프레임워크는 안정적인 확산 기반 비디오 모델을 자기 일관성 속성을 따르도록 훈련시킵니다. AnimateLCM 프레임워크의 전체 훈련 구조는 교사 없는 적응을 위한 분리된 일관성 학습 전략과 효과적인 일관성 학습으로 구성됩니다.

확산 모델에서 일관성 모델로의 전환

AnimateLCM 프레임워크는 안정적인 확산 모델 또는 DM을 잠재 일관성 모델 또는 LCM의 설계에 따라 일관성 모델 또는 CM으로 자신의 적응을 도입합니다. 안정적인 확산 모델은 일반적으로 노이즈가 추가된 샘플을 예측하지만, 이는 본질적으로 시그마-확산 모델입니다. 이는 일관성 모델과 대조되며, 일관성 모델은 직접적으로 PF-ODE 궤적의 해결을 예측하도록 설계되었습니다. 또한, 안정적인 확산 모델에서 특정 매개변수는 고품질 이미지를 생성하기 위해 분류자 없는 지시 전략을 사용하는 것이 필수적입니다. 그러나 AnimateLCM 프레임워크는 분류자 없는 지시 aumented ODE 솔버를 사용하여 동일한 궤적의 인접한 쌍을 샘플링하여 더 나은 효율성과 향상된 품질을 달성합니다.

분리된 일관성 학습

일관성 증류 프로세스에서, 개발자들은 훈련에 사용되는 데이터가 일관성 모델의 최종 생성 품질에 큰 영향을 미친다는 것을 관찰했습니다. 그러나 현재 공개적으로 사용 가능한 데이터셋은 종종 워터마크가 있는 데이터나 품질이 낮으며, 너무 짧거나 모호한 캡션을 포함할 수 있습니다. 또한, 대형 해상도 비디오에 직접 모델을 훈련하는 것은 계산적으로 비용이 많이 들고 시간이 많이 걸리므로, 대부분의 연구자에게 비현실적인 옵션입니다.

AnimateLCM 프레임워크는 필터링된 고품질 데이터셋의 가용성을 고려하여 운동 우선순위와 이미지 생성 우선순위를 분리하는 것을 제안합니다. 구체적으로, AnimateLCM 프레임워크는 먼저 안정적인 확산 모델을 이미지 일관성 모델로 적응시키기 위해 필터링된 고품질 이미지-텍스트 데이터셋을 사용하여 일관성 증류를 수행합니다. 그런 다음, AnimateLCM 프레임워크는 안정적인 확산 모델의 레이어에서 경량 LoRA 가중치를 훈련시킵니다. 이는 안정적인 확산 모델의 가중치를 동결합니다. 일단 모델이 LoRA 가중치를 조정하면, 이는 유연한 가속 모듈로 작동하며, 안정적인 확산 커뮤니티의 다른 개인화된 모델과 호환성을 демонстри했습니다. 추론을 위해, AnimateLCM 프레임워크는 LoRA 가중치를 원래 가중치와 결합하여 추론 속도를 훼손하지 않습니다. 이미지 생성 수준에서 일관성 모델을 얻은 후, AnimateLCM 프레임워크는 안정적인 확산 모델과 LoRA 가중치의 가중치를 동결합니다. 또한, 모델은 2D畳み込み 커널을 3D畳み込み 커널로 확장하여 비디오 생성을 위한 일관성 모델을 훈련시킵니다.

중요한 것은, 공간 LoRA 가중치는 샘플링 프로세스를 가속화하기 위해 설계되었지만, 시간적 모델링을 고려하지 않으며, 시간적 모듈은 표준 확산 기술을 통해 개발됩니다. 그들의 직접적인 통합은 훈련의 시작에서 표현을 훼손하는 것으로 나타납니다. 이는 효과적으로 그리고 효율적으로 그들을 결합하는 데에 큰 도전을 제기합니다. 경험적 연구를 통해, AnimateLCM 프레임워크는 공간 LoRA 가중치의 일관성 우선순위를 사용하는 초기화 접근 방식을 성공적으로 식별했습니다.

일관성 훈련의 시작에서, 사전 훈련된 공간 LoRA 가중치는 온라인 일관성 모델에 독점적으로 통합됩니다. 이는 대상 일관성 모델이 온라인 모델의 학습 프로세스에 해로운 예측을 생성하지 않도록 합니다. 훈련 기간 동안, LoRA 가중치는 지수 이동 평균(EMA) 프로세스를 통해 대상 일관성 모델에渐進적으로 통합되어 여러 반복 후에 최적의 가중치 균형을 달성합니다.

교사 없는 적응

안정적인 확산 모델과 플러그 앤 플레이 어댑터는 종종 함께 사용됩니다. 그러나, 플러그 앤 플레이 어댑터가 어느 정도 효과가 있지만, 세부 사항을 제어하는 데 실패하는 경향이 있다는 것이 관찰되었습니다. 이는 대부분의 어댑터가 이미지 확산 모델로 훈련되기 때문입니다. 이를 해결하기 위해, AnimateLCM 프레임워크는 교사 없는 적응을 선택합니다. 이는 기존 어댑터를 더 잘 호환하거나_scratch에서 어댑터를 훈련하는 간단하지만 효과적인 전략입니다. 이 접근 방식은 AnimateLCM 프레임워크가 교사 모델을 필요로하지 않고 최소한의 단계로 컨트롤 가능한 비디오 생성 및 이미지에서 비디오 생성을 달성할 수 있게 합니다.

AnimateLCM: 실험 및 결과

AnimateLCM 프레임워크는 안정적인 확산 v1-5를 기본 모델로 사용하며, DDIM ODE 솔버를 훈련 목적으로 사용합니다. 또한, AnimateLCM 프레임워크는 공개적으로 사용 가능한 모션 가중치를 사용하여 Stable Diffusion v1-5와 함께 교사 비디오 확산 모델로 실험을 수행합니다. 이는 WebVid2M 데이터셋에서 추가 데이터나 증강 없이 수행됩니다. 또한, AnimateLCM 프레임워크는 BLIP-캡션된 짧은 텍스트 프롬프트를 사용하여 컨트롤 가능한 비디오 생성을 위한 TikTok 데이터셋을 사용합니다.

질적 결과

다음 그림은 AnimateLCM 프레임워크에서 텍스트에서 비디오로의 생성, 이미지에서 비디오로의 생성, 컨트롤 가능한 비디오 생성을 위한 4단계 생성 방법의 결과를 보여줍니다.

그것은 각 생성 결과가 만족스러운 것을 관찰할 수 있으며, AnimateLCM 프레임워크가 다양한 추론 단계에서 일관성 속성을 따르는 것을 유지하는 것을 보여줍니다.

양적 결과

다음 그림은 AnimateLCM 프레임워크와 최첨단 DDIM 및 DPM++ 방법의 비교를 보여주는 양적 결과를示します.

그것은 AnimateLCM 프레임워크가 낮은 단계 영역(1~4단계)에서 기존 방법을 크게 능가하는 것을 관찰할 수 있습니다. 또한, AnimateLCM 메트릭은 CFG 또는 분류자 없는 지시를 사용하지 않고 평가되며, 이는 프레임워크가 추론 시간과 추론 피크 메모리 비용을 거의 50% 절약할 수 있음을 의미합니다. 또한, 성능을进一步 검증하기 위해, AnimateLCM 프레임워크 내의 공간 가중치는 공개적으로 사용 가능한 개인화된 현실 모델로 대체되어 충실도와 다양성 사이의 좋은 균형을 달성하여 성능을 더욱 향상시킵니다.

최종 생각

이 기사에서, 우리는 AnimateLCM이라는 개인화된 확산 모델에 대해 이야기했습니다. 이 모델은 어댑터를 사용하여 최소한의 단계와 계산 비용으로 높은 충실도의 비디오를 생성하는 것을 목표로 합니다. AnimateLCM 프레임워크는 일관성 모델에서 영감을 받았으며, 이는 미리 학습된 이미지 확산 모델을 증류하여 샘플링을 최소한의 단계로 가속화합니다. 또한, 일관성 모델의 성공적인 확장인 잠재 일관성 모델(Latent Consistency Model, LCM)은 조건부 이미지 생성을 용이하게 합니다. 원시 비디오 데이터セット에 직접 일관성 학습을 수행하는 대신, AnimateLCM 프레임워크는 분리된 일관성 학습 전략을 제안합니다. 이는 운동 생성 및 이미지 생성 우선순위를 분리하여 모델이 생성된 콘텐츠의 시각적 품질을 향상시키고 동시에 훈련 효율성을 개선할 수 있습니다.

전문직으로서의 엔지니어, 마음으로서의 작가입니다. Kunal은 AI와 ML에 대한 깊은 사랑과 이해를 가진 기술 작가로, 이러한 분야의 복잡한 개념을 흥미롭고 정보적인 문서를 통해 단순화하는데 헌신하고 있습니다.