Anderson의 관점

새로운 시스템: 안정적인 확산 비디오 캐릭터를 위한 시간 일관성

mm
Unite.AI를 Google의 선호 소스에 추가
A capture from the project page of MIMO (https://menyifang.github.io/projects/MIMO/index.html), depicting a motion-driven wolf creature.

알리바바 그룹의 새로운 이니셔티브는 안정적인 확산 기반의 기초 모델에서 전체 몸인간 아바타를 생성하는 데 있어 내가 본 가장好的 방법 중 하나를 제공합니다.

제목은 MIMO (MIMicking with Object Interactions)로, 이 시스템은 CGI 기반의 인간 모델과 AnimateDiff를 포함한 인기 있는 기술과 모듈을 사용하여 비디오에서 시간 일관성 있는 캐릭터 대체 또는 사용자 정의의 골격 姿勢를 구동하는 것을 가능하게 합니다.

여기서 우리는 단일 이미지 소스에서 보간된 캐릭터와 미리 정의된 모션에 의해 구동되는 것을 볼 수 있습니다:

[아래 비디오를 클릭하여 재생]

단일 소스 이미지에서 3개의 다양한 캐릭터가 3D 포즈 시퀀스(가장 왼쪽)에 의해 구동됩니다. 프로젝트 웹사이트와 이 문서의 끝에 포함된 유튜브 비디오에서 더 많은 예시와 더 높은 해상도를 확인하십시오. 출처: https://menyifang.github.io/projects/MIMO/index.html

생성된 캐릭터는 비디오 프레임과 다양한 다른 방법으로도 소스할 수 있으며 실제 촬영된 영상을 통합할 수 있습니다.

MIMO는 캐릭터, 장면 및 오คล루전(즉, 매트링, 어떤 객체나 사람이 표시되는 캐릭터 앞을 통과할 때)에 대한 3개의 별도 인코딩을 생성하는 새로운 시스템을 제공합니다. 이러한 인코딩은 추론 시간에 통합됩니다.

[아래 비디오를 클릭하여 재생]

MIMO는 원래 캐릭터를 사진실적 또는 스타일라이즈된 캐릭터로 대체할 수 있으며 대상 비디오의 모션을 따릅니다. 프로젝트 웹사이트와 이 문서의 끝에 포함된 유튜브 비디오에서 더 많은 예시와 더 높은 해상도를 확인하십시오.

이 시스템은 안정적인 확산 V1.5 모델을 통해 훈련되며, 연구자들이 수집한 사용자 정의 데이터셋을 사용하여 훈련되며, 실제 세계 비디오와 시뮬레이션 비디오의 비율이 동일합니다.

확산 기반 비디오의 큰 문제는 시간 안정성입니다. 여기서 비디오의 내용이 깜박이거나 원치 않는 방식으로 ‘진화’합니다.

MIMO는 대신에 일관된 지침을 위한 단일 이미지를 효과적으로 사용하며, 이는 SMPL CGI 모델에 의해 조정되고 제한될 수 있습니다.

소스 참조가 일관성이 있고, 기초 모델이 충분한 대표 모션 예제로 향상된 경우, 시스템의 시간 일관성 있는 출력 능력은 일반적인 확산 기반 아바타의 표준보다 훨씬 높습니다.

[아래 비디오를 클릭하여 재생]

さらに MIMO 캐릭터의 예시입니다. 프로젝트 웹사이트와 이 문서의 끝에 포함된 유튜브 비디오에서 더 많은 예시와 더 높은 해상도를 확인하십시오.

단일 이미지를 효과적인 신경망 표현을 위한 소스로 사용하는 것이 더 일반적으로 되고 있습니다. 이는 텍스트 프롬프트와 결합하여 다중 모드 방식으로 사용할 수 있습니다. 예를 들어, 인기 있는 LivePortrait 얼굴 전송 시스템도 단일 얼굴 이미지에서 매우 현실적인 깊은 가짜 얼굴을 생성할 수 있습니다.

연구자들은 MIMO 시스템에서 사용된 원칙이 다른 유형의 생성 시스템과 프레임워크로 확장될 수 있다고 믿습니다.

새로운 논문은 MIMO: 공간 분리 모델링을 사용한 제어 가능한 캐릭터 비디오 합성으로, 알리바바 그룹의 인텔리전트 컴퓨팅 연구소의 4명의 연구자로부터 나왔습니다. 이 연구에는 비디오가 많은 프로젝트 페이지와 이 문서의 끝에 포함된 유튜브 비디오가 있습니다.

방법

MIMO는 자동 및 무감독 학습을 통해 앞서 언급한 3개의 공간 성분을 종단 간 아키텍처에서 분리합니다(즉, 모든 하위 프로세스는 시스템에 통합되며, 사용자는 입력 자료만 제공하면 됩니다).

MIMO의 개념적 스키마

MIMO의 개념적 스키마 출처: https://arxiv.org/pdf/2409.16160

소스 비디오의 객체는 2D에서 3D로 번역되며, 초기에는 Depth Anything 모노큘ラー 깊이 추정기를 사용합니다. 프레임의 인간 요소는 Tune-A-Video 프로젝트에서 적응된 방법을 사용하여 추출됩니다.

이러한 특징은 페이스북 연구소의 Segment Anything 2 아키텍처를 통해 비디오 기반의 볼륨형 요소로 번역됩니다.

장면 레이어 자체는 다른 두 레이어에서 감지된 객체를 제거하여 효과적으로 자동으로 로토스코프 스타일의 마스크를 제공합니다.

모션의 경우, 추출된 잠재 코드 세트는 인간 요소에 대한 기본 인간 CGI 기반 SMPL 모델에 고정됩니다. 여기서 렌더링된 인간 콘텐츠에 대한 컨텍스트를 제공하는 움직임이 제공됩니다.

인간 콘텐츠에 대한 2D 특징 맵다양한 렌더링에서 파생된 2020년 이니셔티브에서 NVIDIA 방법을 사용하여 얻어집니다. SMPL에서 얻은 3D 데이터와 NVIDIA 방법으로 얻은 2D 데이터를 결합하여 ‘신경망 사람’을 나타내는 잠재 코드는 궁극적으로 컨텍스트와 견고한 대응 관계를 갖습니다.

이 시점에서, SMPL을 사용하는 아키텍처에서 일반적으로 필요한 참조를 설정하는 것이 필요합니다. 즉, 캐논 포즈입니다. 이것은 다빈치의 ‘비트루비안 사람’과 유사합니다. 즉, 0-포즈 템플릿을 나타내며 콘텐츠를 수신하고 변형할 수 있으며 효과적으로 텍스처 맵핑된 콘텐츠를 함께 데려옵니다.

이러한 변형 또는 ‘표준에서 벗어난 것’은 인간의 움직임을 나타내며, SMPL 모델은 추출된 인간 정체성을 구성하는 잠재 코드를 보존하여 결과 아바타를 포즈와 텍스처 측면에서 올바르게 나타냅니다.

SMPL 피규어의 캐논 포즈 예시

SMPL 피규어의 캐논 포즈 예시 출처: https://www.researchgate.net/figure/Layout-of-23-joints-in-the-SMPL-models_fig2_351179264

인터리빙(훈련된 데이터가 훈련된 영역과 연관성 밖으로 확장될 때의 유연성 정도) 문제에 관해 저자들은 다음과 같이 말합니다*:

‘시간 일관성 있는 비디오 프레임에서 외모를 완전히 분리하기 위한 이상적인 해결책은 단일 모노큘ラー 비디오에서 동적 인간 표현을 학습하고 포즈 공간에서 표준 캐논 공간으로 변환하는 것입니다.

‘효율성을 고려하여, 우리는 미리 훈련된 인간 재구성 모델을 사용하여 표준 A-포즈를 사용하여 포즈된 인간 이미지를 직접 캐논 결과로 변환하는 단순화된 방법을 사용합니다. 합성된 캐논 외모 이미지는 ID 인코더에 의해 식별 코드를 얻기 위해 제공됩니다.

‘이 간단한 설계는 정체성과 모션 속성의 완전한 분리를 가능하게 합니다. Animate Anyone에 따라, ID 인코더에는 CLIP 이미지 인코더와 전역 및 지역 특징을 위한 참조 네트워크 아키텍처가 포함됩니다.

장면과 오คล루전 측면에서 공유되고 고정된 변분 오토인코더(VAE – 이 경우 2013년 게시물에서 파생됨)를 사용하여 장면과 오คล루전 요소를 잠재 공간에 포함합니다. 불일치는 2023년 ProPainter 프로젝트에서 가져온 인페인팅 방법으로 처리됩니다.

이러한 분리된 속성은 Stable Diffusion V1.5 아키텍처를 기반으로 하는 U-Net 백본에 제공됩니다. 완전한 장면 코드는 호스트 시스템의 네이티브 잠재 노이즈와 연결됩니다. 인간 구성 요소는 각각 자기 주의와 교차 주의 레이어를 통해 통합됩니다.

그런 다음, 노이즈 제거된 결과는 VAE 디코더를 통해 출력됩니다.

데이터 및 테스트

훈련을 위해 연구자들은 HUD-7K라는 인간 비디오 데이터셋을 만들었습니다. 이는 5,000개의 실제 캐릭터 비디오와 En3D 시스템으로 생성된 2,000개의 합성 애니메이션으로 구성되었습니다. 실제 비디오는 비-语义적 인물 추출 절차의 비-语义적 특성으로 인해 주석이 필요하지 않았습니다. 합성 데이터는 완전히 주석이 달렸습니다.

모델은 8개의 NVIDIA A100 GPU(논문에서는 40GB 또는 80GB VRAM 모델 중 어떤 것을 사용했는지 명시하지 않음)에서 50번의 반복으로 훈련되었으며, 24개의 비디오 프레임과 배치 크기 4를 사용하여 수렴할 때까지 훈련되었습니다.

시스템의 모션 모듈은 AnimateDiff의 가중치를 사용하여 훈련되었습니다. 훈련 과정에서 VAE 인코더/디코더 및 CLIP 이미지 인코더의 가중치는 동결되었습니다(대조적으로, 기초 모델에 더 넓은 영향을 미치는 완전한 미세 조정).

MIMO는 유사한 시스템과 비교되지 않았지만, 연구자들은 어려운 아웃-오브-분포 모션 시퀀스(AMASS 및 Mixamo에서 가져옴)를 테스트했습니다. 이러한 움직임에는 등반, 놀이 및 춤이 포함되었습니다.

그들은 또한 시스템을 야생 인간 비디오에서 테스트했습니다. 두 경우 모두, 논문은 다양한 관점에서 볼 수 있는 3D 모션에 대한 ‘높은 강건성’을 보고합니다.

논문은 시스템의 효과를 보여주는 여러 정적 이미지 결과를 제공하지만, MIMO의 실제 성능은 프로젝트 페이지와 이 문서의 끝에 포함된 유튜브 비디오에서 제공되는 광범위한 비디오 결과로 가장 잘 평가됩니다.

저자들은 다음과 같이 결론을 내립니다:

‘실험 결과는 우리의 방법이 유연한 캐릭터, 모션 및 장면 제어뿐만 아니라 임의의 캐릭터에 대한 고급 확장성, 새로운 3D 모션에 대한 일반성 및 상호작용 장면에 대한 적용 가능성을 제공한다는 것을 보여줍니다.

‘우리는 또한 우리의 솔루션이 내재된 3D 특성과 자동으로 2D 비디오를 계층적 공간 구성 요소로 인코딩하는 것을 고려할 수 있으므로, 3D 인식 비디오 합성을 위한 미래 연구에 영감을 줄 수 있다고 믿습니다.

‘さらに, 우리의 프레임워크는 캐릭터 비디오를 생성하는 데만 적합하지 않으며, 제어 가능한 비디오 합성 작업에도 잠재적으로 적용될 수 있습니다.’

결론

안정적인 확산에 기반한 아바타 시스템이 시간 안정성에 대한 그러한 능력을 갖춘 것을 보는 것은 신선합니다. 특히 가우시안 아바타가 이 연구 분야에서 높은 지위를 얻고 있는 것으로 보이기 때문입니다.

결과에서 나타난 스타일라이즈된 아바타는 효과적이며, MIMO가 생성할 수 있는 사진적 현실성의 수준은 현재 가우시안 스플래팅이 가능하게 하는 것과 같지 않지만, 의미 기반의 잠재 확산 네트워크(LDM)에서 시간 일관성 있는 인간을 생성하는 것의 다양한 장점은 상당합니다.

 

* 저자의 인라인 인용을 하이퍼링크와 필요한 경우 외부 설명 하이퍼링크로 변환한 것입니다.

2024년 9월 25일 처음 게시되었습니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: [email protected]