AI 모델 및 플랫폼
MagicDance: 현실적인 인간 모션 전송
컴퓨터 비전은 AI 산업에서 가장 많이 논의되는 분야 중 하나로, 다양한 실시간 작업에 걸쳐서 잠재적인 응용 프로그램을 가지고 있습니다. 최근 몇 년 동안 컴퓨터 비전 프레임워크는 급격히 발전했으며, 현대적인 모델은 실시간 시나리오에서 얼굴 특징, 객체 및 더 많은 것을 분석할 수 있습니다. 이러한 기능에도 불구하고, 인간 모션 전송은 컴퓨터 비전 모델에 대한 형편없는 도전입니다. 이 작업은 소스 이미지 또는 비디오에서 타겟 이미지 또는 비디오로 얼굴 및 신체 모션을 재표적화하는 것을 포함합니다. 인간 모션 전송은 컴퓨터 비전 모델에서 이미지 또는 비디오를 스타일링하기 위해, 멀티미디어 콘텐츠를 편집하기 위해, 디지털 인간 합성을 위해, 심지어 지각 기반 프레임워크를 위해 데이터를 생성하기 위해 널리 사용됩니다.
이 기사에서는 MagicDance에 초점을 맞추고 있습니다. MagicDance는 인간 모션 전송을 혁신하기 위해 설계된 확산 기반 모델입니다. MagicDance 프레임워크는 특히 도전적인 인간 댄스 비디오에 2D 인간 얼굴 표현과 모션을 전송하도록 설계되었습니다. 그 목표는 원래의 정체성을 유지하면서 특정 타겟 정체성을 위해 새로운 포즈 시퀸스 구동 댄스 비디오를 생성하는 것입니다. MagicDance 프레임워크는 인간 모션 분리와 외모 요인과 같은 피부 톤, 얼굴 표현, 의류에 중점을 둔 2단계 훈련 전략을 사용합니다. 우리는 MagicDance 프레임워크, 그 아키텍처, 기능 및 다른 최첨단 인간 모션 전송 프레임워크와 비교한 성능을 탐구할 것입니다.,让我們開始吧.
MagicDance: 현실적인 인간 모션 전송
이전에도 언급했듯이, 인간 모션 전송은 컴퓨터 비전 작업 중 가장 복잡한 작업 중 하나입니다. 그것은 소스 이미지 또는 비디오에서 타겟 이미지 또는 비디오로 인간 모션과 표현을 전송하는 데涉及된 복잡성 때문입니다. 전통적으로, 컴퓨터 비전 프레임워크는 얼굴 표현과 신체 포즈를 위한 타겟 데이터셋에서 특정 작업을 위한 생성 모델을 훈련함으로써 인간 모션 전송을 달성했습니다. 이러한 모델은 일부 경우에 만족스러운 결과를 제공하지만, 일반적으로 두 가지 주요 제한 사항이 있습니다.
- 그들은 이미지 왜곡 구성 요소를 크게 의존하며, 이는 종종 소스 이미지에서 보이지 않는 신체 부위를 보간하는 데 어려움을 겪습니다.
- 그들은 외부에서 소스된 다른 이미지에 일반화할 수 없습니다. 이것은 특히 야외의 실시간 시나리오에서 그들의 응용 프로그램을 제한합니다.

최근의 확산 모델은 다양한 조건에서 이미지를 생성하는 데 예외적인 능력을 보여주었습니다. 확산 모델은 이제 웹 규모의 이미지 데이터셋에서 학습함으로써 비디오 생성 및 이미지 인페인팅과 같은 다운스트림 작업에서 강력한 시각적 효과를 제공할 수 있습니다. 그들의 능력으로 인해, 확산 모델은 인간 모션 전송 작업에 이상적인 선택일 수 있습니다. 그러나 확산 모델은 인간 모션 전송에 구현될 수 있지만, 생성된 콘텐츠의 품질이나 정체성 보존 또는 모델 설계 및 훈련 전략의 제한으로 인해 시간적 불일치와 같은 일부 제한 사항이 있습니다. 또한, 확산 기반 모델은 GAN 프레임워크와 비교하여 일반화 가능성에서 큰 이점을 보여주지 못합니다.
인간 모션 전송 작업에서 확산 및 GAN 기반 프레임워크가 직면한 장애를 극복하기 위해, 개발자들은 MagicDance라는 새로운 프레임워크를 도입했습니다. MagicDance 프레임워크는 인간 모션 전송을 위한 확산 프레임워크의 잠재력을 khai thác하여 전례 없는 정체성 보존, 우수한 시각적 품질 및 도메인 일반화 가능성을 보여줍니다. MagicDance 프레임워크의 핵심 개념은 문제를 두 단계로 나누는 것입니다. 외모 제어와 모션 제어는 이미지 확산 프레임워크가 정확한 모션 전송 출력을 제공하기 위해 필요한 두 가지 능력입니다.

위의 그림은 MagicDance 프레임워크의 개요를 제공하며, 프레임워크가 Stable Diffusion 모델을 사용하고 두 가지 추가 구성 요소를 deploy한다는 것을 보여줍니다. Appearance Control Model과 Pose ControlNet는 각각 참조 이미지에서 외모를 위한 지침과 조건된 이미지 또는 비디오에서 확산 모델을 위한 표현/포즈 지침을 제공합니다. 프레임워크는 또한 이러한 하위 모듈을 효과적으로 학습하기 위해 다단계 훈련 전략을 사용합니다.
요약하면, MagicDance 프레임워크는
- 외모 분리된 포즈 제어와 외모 제어 사전 훈련을 포함하는 새로운이자 효과적인 프레임워크입니다.
- MagicDance 프레임워크는 포즈 조건 입력과 참조 이미지 또는 비디오의 제어하에 현실적인 인간 얼굴 표현과 인간 모션을 생성할 수 있습니다.
- MagicDance 프레임워크는 외모 일관성 있는 인간 콘텐츠를 생성하기 위해 다중 소스 주의 모듈을 도입하여 Stable Diffusion UNet 프레임워크에 대한 정확한 지침을 제공합니다.
- MagicDance 프레임워크는 Stable Diffusion 프레임워크의 편리한 확장 또는 플러그인으로 사용할 수 있으며, 기존 모델 가중치를 호환하므로 추가적인 파라미터 미세 조정이 필요하지 않습니다.
또한, MagicDance 프레임워크는 외모와 모션 일반화 모두에서 예외적인 일반화 능력을 보여줍니다.
- 외모 일반화: MagicDance 프레임워크는 다양한 외모를 생성하는 데 뛰어난 능력을 보여줍니다.
- 모션 일반화: MagicDance 프레임워크는 또한 다양한 모션을 생성할 수 있습니다.
MagicDance: 목표와 아키텍처
참조 이미지(실제 인간 또는 스타일화된 이미지)가 주어졌을 때, MagicDance 프레임워크의 주요 목표는 입력과 포즈 입력 {P, F}에 조건화된 출력 이미지 또는 비디오를 생성하는 것입니다. 여기서 P는 인간 포즈 스켈레톤을 나타내고, F는 얼굴 랜드마크를 나타냅니다. 생성된 출력 이미지 또는 비디오는 참조 이미지의 외모와 정체성을 유지해야 하며, 참조 이미지의 배경 콘텐츠와 포즈 입력에서 정의된 포즈와 표현을 유지해야 합니다.
아키텍처
훈련 중에, MagicDance 프레임워크는 동일한 참조 비디오에서 참조 이미지와 포즈 입력을 사용하여 프레임 재구성 작업으로 훈련됩니다. 테스트 중에, 모션 전송을 달성하기 위해 포즈 입력과 참조 이미지는 다른 소스에서 가져옵니다.
MagicDance 프레임워크의 전체 아키텍처는 네 가지 범주로 나눌 수 있습니다. 예비 단계, 외모 제어 사전 훈련, 외모 분리된 포즈 제어, 및 모션 모듈입니다.
예비 단계
잠재 확산 모델 또는 LDM은 고유하게 설계된 확산 모델로, 오토인코더의 사용으로 잠재 공간에서 작동하며, Stable Diffusion 프레임워크는 이러한 LDM의 대표적인 예입니다. Stable Diffusion 모델은 Vector Quantized-Variational 오토인코더와 시간적 U-Net 아키텍처를 사용합니다. Stable Diffusion 모델은 텍스트 인코더로 CLIP 기반 트랜스포머를 사용하여 텍스트 입력을 처리합니다.
외모 제어 사전 훈련
원래 ControlNet 프레임워크의 주요 문제는 공간적으로 변하는 모션에서 일관된 외모를 제어할 수 없는 것입니다. ControlNet 프레임워크는 입력 이미지와 유사한 포즈를 가진 이미지를 생성하지만, 전체적인 외모는 주로 텍스트 입력에 의해 영향을 받습니다. 이 방법은 작동하지만, 외모 정보의 주요 소스가 텍스트 입력이 아닌 참조 이미지인 모션 전송 작업에는 적합하지 않습니다.
MagicDance 프레임워크의 외모 제어 사전 훈련 모듈은 외모 제어를 위한 지침을 제공하기 위해 보조 분기として 설계되었습니다. 텍스트 입력에 의존하는 대신, 전체 모듈은 참조 이미지에서 외모 속성을 활용하여 복잡한 모션 동작을 포함하는 시나리오에서 외모 특성을 정확하게 생성하는 프레임워크의 능력을 향상시키는 것을 목표로 합니다. 또한, 외모 제어 사전 훈련 중에만 외모 제어 모델이 훈련 가능합니다.
외모 분리된 포즈 제어
출력 이미지의 포즈를 제어하는 간단한 해결책은 사전 훈련된 ControlNet 모델을 사전 훈련된 외모 제어 모델과 직접 통합하는 것입니다. 그러나 이 통합은 외모 독립적 포즈 제어가 어려울 수 있으며, 입력 포즈와 생성된 포즈 사이에 불일치가 발생할 수 있습니다. 이 불일치를 해결하기 위해, MagicDance 프레임워크는 Pose ControlNet 모델을 사전 훈련된 외모 제어 모델과 함께 공동으로 미세 조정합니다.
모션 모듈
외모 분리된 포즈 제어넷과 외모 제어 모델이 함께 작동할 때, 정확하고 효과적인 이미지에서 모션으로의 전송을 달성할 수 있습니다. 그러나 이것은 시간적 불일치를 초래할 수 있습니다. 시간적 일관성을 보장하기 위해, 프레임워크는 기본 Stable Diffusion UNet 아키텍처에 추가 모션 모듈을 통합합니다.
MagicDance: 사전 훈련 및 데이터셋
사전 훈련을 위해, MagicDance 프레임워크는 350개 이상의 댄스 비디오로 구성된 TikTok 데이터셋을 사용합니다. 이 비디오는 10초에서 15초 사이의 길이로, 단일 사람이 춤추는 것을 캡처하며, 대부분의 비디오는 얼굴과 상반신을 포함합니다. MagicDance 프레임워크는 각 비디오를 30 FPS로 추출하고, 개별 프레임에 OpenPose를 실행하여 포즈 스켈레톤, 손 모션 및 얼굴 랜드마크를 추론합니다.
사전 훈련을 위해, 외모 제어 모델은 64의 배치 크기로 8개의 NVIDIA A100 GPU에서 10,000 스텝으로 사전 훈련되며, 이미지 크기는 512 x 512입니다. 그 후, 포즈 제어와 외모 제어 모델은 16의 배치 크기로 20,000 스텝으로 공동으로 미세 조정됩니다. 훈련 중에, MagicDance 프레임워크는 두 개의 프레임을 임의로 샘플링하여 타겟과 참조로 사용합니다. 평가 중에, 모델은 이미지 중앙에 자르기보다는 동일한 위치와 높이에서 이미지 자르기를 수행합니다.
MagicDance: 결과
MagicDance 프레임워크에 대한 실험 결과는 다음 이미지에示されて 있으며, MagicDance 프레임워크가 Disco 및 DreamPose와 같은 기존 프레임워크를超越하는 것을 보여줍니다. “*” 기호가 있는 프레임워크는 타겟 이미지를 직접 입력으로 사용하며, 다른 프레임워크보다 더 많은 정보를 포함합니다.

MagicDance 프레임워크는 Face-Cos 점수 0.426를 달성하며, Disco 프레임워크보다 156.62% 향상되었으며, DreamPose 프레임워크보다 거의 400% 증가했습니다. 이러한 결과는 MagicDance 프레임워크가 정체성 정보를 보존하는 데 강력한 능력을 가지고 있으며, 성능의 명백한 향상은 MagicDance 프레임워크가 기존의 최첨단 방법보다 우수함을 나타냅니다.
다음 그림은 MagicDance, Disco 및 TPS 프레임워크 간의 인간 비디오 생성 품질을 비교합니다. 결과는 GT, Disco 및 TPS 프레임워크에서 일관되지 않은 인간 포즈 정체성과 얼굴 표현을 보여줍니다.

또한, 다음 이미지에서는 TikTok 데이터셋에서 얼굴 표현 및 인간 포즈 전송의 시각화를 보여줍니다. MagicDance 프레임워크는 다양한 얼굴 랜드마크 및 포즈 스켈레톤 입력에서 현실적이고 생생한 표현 및 모션을 생성할 수 있으며, 참조 입력 이미지의 정체성 정보를 정확하게 보존합니다.

MagicDance 프레임워크는 또한 미세 조정이 없는 타겟 도메인의 외부 참조 이미지에 대한 예외적인 일반화 능력을 보여줍니다. 결과는 다음 이미지에示されて 있습니다.

다음 이미지에서는 MagicDance 프레임워크의 얼굴 표현 전송 및 제로샷 인간 모션의 시각화 능력을 보여줍니다. MagicDance 프레임워크는 야외의 인간 모션에 완벽하게 일반화됩니다.

MagicDance: 제한 사항
OpenPose는 MagicDance 프레임워크의 필수적인 구성 요소로, 포즈 제어에 영향을 미치며, 생성된 이미지의 품질과 시간적 일관성을 크게影响합니다. 그러나 MagicDance 프레임워크는 여전히 부분적으로 가려진 객체 또는 빠른 움직임이 있는 이미지에서 얼굴 랜드마크 및 포즈 스켈레톤을 정확하게 감지하는 데 어려움을 겪을 수 있습니다. 이러한 문제는 생성된 이미지에 아티팩트를 초래할 수 있습니다.
결론
이 기사에서, 우리는 MagicDance에 대해 논의했습니다. MagicDance는 인간 모션 전송을 혁신하기 위해 설계된 확산 기반 모델입니다. MagicDance 프레임워크는 도전적인 인간 댄스 비디오에 2D 인간 얼굴 표현과 모션을 전송하도록 설계되었습니다. 그 목표는 원래의 정체성을 유지하면서 특정 타겟 정체성을 위해 새로운 포즈 시퀸스 구동 댄스 비디오를 생성하는 것입니다. MagicDance 프레임워크는 인간 모션 분리와 외모 요인과 같은 피부 톤, 얼굴 표현, 의류에 중점을 둔 2단계 훈련 전략을 사용합니다.
MagicDance는 인간 비디오 생성을 위한 새로운 접근 방식으로, 얼굴 및 모션 표현 전송을 포함하고 일관된 야외 애니메이션 생성을 가능하게 합니다. MagicDance 프레임워크는 기존 방법보다显著한 발전을 보여주며, 복잡한 모션 시퀸스와 다양한 인간 정체성에 걸쳐서 예외적인 일반화 능력을 보여줍니다. MagicDance 프레임워크는 AI 지원 모션 전송 및 비디오 생성 분야의 선두 주자로 자리 잡았습니다.












