Anderson의 관점

주목할만한 인간 주도 AI 비디오의 발전

mm
Unite.AI를 Google의 선호 소스에 추가
Examples from the DreamActor project page.

참고: 이 연구의 프로젝트 페이지에는 33개의 자동 재생 고해상도 비디오가 포함되어 있으며, 총 용량은 0.5GB로 시스템을 불안정하게 만듭니다. 따라서 직접 링크하지 않습니다. 독자들은 논문의 초록 또는 PDF에서 URL을 찾을 수 있습니다.

현재 비디오 합성 연구의 주요 목표 중 하나는 단일 이미지에서 완전한 AI 주도 비디오 성능을 생성하는 것입니다. 이번 주에 Bytedance Intelligent Creation에서 발표한 새로운 논문은 이러한 종류의 가장 포괄적인 시스템을 제시했으며, 표현적인 얼굴 세부와 정확한 대규모 동작을 결합한 전체 및 반신 애니메이션을 생성할 수 있으며, 또한 동일성 일관성을 개선했는데, 이는甚至 최고의 상업용 시스템에서도 자주 부족한 영역입니다.

아래 예에서 우리는 배우(상단 왼쪽)와 단일 이미지(상단 오른쪽)에서 파생된 성능을 볼 수 있으며, 이는 놀라울 정도로 유연하고 민첩한 렌더링을 제공하며, 대규모 동작이나 가려진 영역(즉, 단일 소스 사진에 표시되지 않는 의류 및 얼굴 각도와 같은 부분)에 대한 일반적인 문제가 없습니다.

오디오 콘텐츠. 재생을 클릭합니다. 일반적으로 전용 보조 시스템의 영역인 립싱크도 포함된 성능이 생성됩니다. 이는 원본 사이트(본 문서 시작 부분의 참고 사항 참조)의 축소된 버전입니다.

클립이 진행됨에 따라 동일성을 유지하는 데 일부 잔여적인 도전이 남아 있지만, 이는 LoRAs를 사용하지 않고 일반적으로(그러나 항상은 아닙니다) 지속적인 기간 동안 동일성을 유지하는 데 우수한 첫 번째 시스템입니다.

오디오 콘텐츠. 재생을 클릭합니다. DreamActor 프로젝트의 추가 예시입니다.

새로운 시스템인 DreamActor는 얼굴 표현, 머리 회전 및 핵심 골격 설계에 대한専用적인 주의를 제공하는 3부분 하이브리드 제어 시스템을 사용하여, AI 주도 성능에서 얼굴이나 신체 어느 쪽도 다른 쪽의 비용으로 고통받지 않도록 합니다. 이는 이러한 시스템 중에서 드문 것으로, 아마도 알려지지 않은 기능입니다.

아래에서 우리는 이러한 측면 중 하나인 머리 회전을 볼 수 있습니다. 각 썸네일 오른쪽 모서리에 있는 색상 구슬은 가상 지밸이로, 얼굴 운동 및 표현과 독립적으로 머리 방향을 정의합니다. 이는 여기서 배우(하단 왼쪽)에 의해 구동됩니다.

재생을 클릭합니다. 여기서 다중색 구슬은 아바타의 머리 회전축을 나타내며, 표현은 별도의 모듈에 의해 구동되며 배우의 성능(여기서 하단 왼쪽에 표시됨)에 의해 정보를 제공받습니다.

이 프로젝트의 가장 흥미로운 기능 중 하나는 논문에서 제대로 포함되지 않은 오디오에서 직접 립싱크 동작을 파생하는 능력입니다. 이는 일반적으로 놀라울 정도로 잘 작동하며, 구동 배우 비디오가 필요하지 않습니다.

연구자들은 이 분야의 최고의 기존 시스템과 경쟁했으며, Runway Act-One 및 LivePortrait을 포함한 시스템과 비교했으며, DreamActor가 양적 결과에서 우수함을 달성했다고 보고했습니다.

양적 결과는 연구자가 자신의 기준을 설정할 수 있으므로 필수적으로 경험적 표준은 아닙니다. 그러나隨行하는 질적 테스트는 저자의 결론을 뒷받침하는 것으로 보입니다.

불행히도 이 시스템은 공개 릴리스를 위해 설계되지 않았으며, 커뮤니티가 이 작업에서 유용하게 사용할 수 있는 유일한 가치는 논문에 설명된 방법론을 재현하는 것입니다(이는 2022년에 동등한 폐쇄형 Google Dreambooth와 같은 효과를 낼 수 있습니다).

이 논문은*:

‘인간 이미지 애니메이션에는 가짜 비디오를 만드는 것과 같은 사회적 위험이 있습니다. 제안된 기술은 사람들의 가짜 비디오를 만들 수 있지만, 기존의 탐지 도구[Demamba, Dormant]는 이러한 가짜를 감지할 수 있습니다.

‘이러한 위험을 줄이기 위해, 명확한 윤리 규칙과 책임 있는 사용 지침이 필요합니다. 우리는 우리의 핵심 모델과 코드에 대한 접근을 엄격히 제한하여 악용을 방지할 것입니다.’

자연스럽게도, 이러한 종류의 윤리적 고려는 상업적인 관점에서 편리합니다. 왜냐하면 모델에 대한 API 전용 액세스를 정당화할 수 있으며, 이를 통해 수익을 창출할 수 있기 때문입니다. ByteDance는 이미 2025년에 OmniHuman을 Dreamina 웹사이트에서 유료 크레딧으로 제공함으로써 이를 한 번 수행했습니다. 따라서 DreamActor가 가능하면 훨씬 더 강력한 제품인 것으로 보이므로, 이는 아마도 그럴 것입니다. 남은 것은 이 논문에서 설명된 원칙이 오픈 소스 커뮤니티를 지원하는 데 어떻게 도움이 될 수 있는지입니다.

새로운 논문DreamActor-M1: Holistic, Expressive and Robust Human Image Animation with Hybrid Guidance라는 제목으로, Bytedance의 6명의 연구자에 의해 작성되었습니다.

방법

이 논문에서 제안된 DreamActor 시스템은 참조 이미지와 구동 비디오에서 인간 애니메이션을 생성하도록 설계되었습니다. 확산 트랜스포머(DiT) 프레임워크를 사용하여 잠재 공간에 적응시킵니다(이는 Stable Diffusion의 일부 버전으로 보입니다. 그러나 논문에서는 2022년 랜드마크 릴리스 논문만을 인용합니다).

외부 모듈에 의존하지 않고 참조 조건을 처리하기 위해, 저자들은 외모 및 동작 특징을 DiT 백본 내에서 직접 병합하여, 주의를 통해 공간과 시간을 가로지르는 상호 작용을 허용합니다.

새로운 시스템의 스키마: DreamActor는 포즈, 얼굴 운동 및 외모를 별도의 잠재 변수로 인코딩하고, 3D VAE에 의해 생성된 노이즈된 비디오 잠재 변수와 결합합니다. 이러한 신호는 공유 가중치를 사용하는 Diffusion Transformer 내에서 자체 및 크로스 주의를 통해 결합됩니다. 모델은 디노이즈된 출력과 깨끗한 비디오 잠재 변수를 비교하여 감독합니다. 출처: https://arxiv.org/pdf/2504.01724

새로운 시스템의 스키마: DreamActor는 포즈, 얼굴 운동 및 외모를 별도의 잠재 변수로 인코딩하고, 3D VAE에 의해 생성된 노이즈된 비디오 잠재 변수와 결합합니다. 이러한 신호는 공유 가중치를 사용하는 Diffusion Transformer 내에서 자체 및 크로스 주의를 통해 결합됩니다. 모델은 디노이즈된 출력과 깨끗한 비디오 잠재 변수를 비교하여 감독합니다. 출처: https://arxiv.org/pdf/2504.01724

이를 위해 모델은 입력 비디오와 참조 이미지를 모두 인코딩하기 위해 사전 훈련된 3D 변분 오토인코더를 사용합니다. 이러한 잠재 변수는 패치화되며, 연결되고, DiT에 공급됩니다. 여기서 모델은 이를 공동으로 처리합니다.

이 아키텍처는 참조 주입을 위한 보조 네트워크를 연결하는 일반적인 관행에서 벗어납니다. 이는 Animate AnyoneAnimate Anyone 2 프로젝트에서 사용된 접근 방식이었습니다.

대신 DreamActor는 융합을 주요 모델 자체에 구축하여, 디자인을 단순화하면서 외모 및 동작 힌트 사이의 정보 흐름을 강화합니다. 모델은 흐름 일치를 사용하여 훈련되며, 이는 확산 모델을 데이터와 노이즈 사이의 속도 필드를 직접 예측함으로써 훈련하는 것입니다.

하이브리드 동작 가이드

DreamActor에 대한 하이브리드 동작 가이드 방법은 3D 신체 골격에서 파생된 포즈 토큰, 3D 머리 구에서 파생된 묵시적 얼굴 표현, 및 참조 외모 토큰을 결합합니다.

이 요소들은 별개의 주의 메커니즘을 사용하여 Diffusion Transformer 내에서 통합되므로, 시스템은 전반적인 생성 과정에서 전역 동작, 얼굴 표현 및 시각적 동일성을 조정할 수 있습니다.

첫 번째 요소인 경우, 얼굴 랜드마크에 의존하지 않고, DreamActor는 묵시적 얼굴 표현을 사용하여 표현 생성을 안내하며, 이는 얼굴 역학에 대한 더 세부적인 제어를 가능하게 하며, 동일성 및 머리 방향과 분리하여 표현을 분리합니다.

이러한 표현을 생성하기 위해, 파이프라인은 구동 비디오의 각 프레임에서 얼굴 영역을 감지하고 자르며, 224×224 크기로 크기를 조정합니다. 자른 얼굴은 PD-FGC 데이터셋에서 사전 훈련된 얼굴 모션 인코더에 의해 처리되며, 이후 MLP 계층에 의해 조건화됩니다.

DreamActor에서 사용되는 PD-FGC는 참조 이미지에서 오디오, 머리 방향, 눈 운동 및 표현에서 분리된 립싱크, 머리 방향, 눈 운동 및 표현 제어를 갖춘 대화하는 머리를 생성합니다. 출처: https://arxiv.org/pdf/2211.14506

PD-FGC는 참조 이미지에서 오디오, 머리 방향, 눈 운동 및 표현에서 분리된 립싱크, 머리 방향, 눈 운동 및 표현 제어를 갖춘 대화하는 머리를 생성합니다. 출처: https://arxiv.org/pdf/2211.14506

결과는 얼굴 모션 토큰의 시퀀스로, 이는 크로스 주의 계층을 통해 Diffusion Transformer에 주입됩니다.

同じ 프레임워크는 또한 음성 입력을 직접 얼굴 모션 토큰으로 매핑하는 별도의 인코더를 훈련하는 음성 주도 변형을 지원하므로, 구동 비디오 없이도 동기화된 얼굴 애니메이션(립 동작 포함)을 생성할 수 있습니다.

오디오 콘텐츠. 재생을 클릭합니다. 오디오에서 직접 파생된 립싱크, 구동 배우 참조 없이. 유일한 입력은 정적 사진입니다.

두 번째로, 얼굴 표현과 독립적으로 머리 방향을 제어하기 위해, 시스템은 3D 머리 구를 도입하여, 얼굴 역학을 글로벌 머리 운동에서 분리하여, 애니메이션 중에 정밀도와 유연성을 개선합니다.

머리 구는 구동 비디오에서 3D 얼굴 매개변수(회전 및 카메라 포즈와 같은)를 추출하여 생성되며, FaceVerse 추적 방법을 사용합니다.

FaceVerse 프로젝트의 스키마. 출처: https://www.liuyebin.com/faceverse/faceverse.html

FaceVerse 프로젝트의 스키마. 출처: https://www.liuyebin.com/faceverse/faceverse.html

이 매개변수는 참조 머리와 공간적으로 일치하는 2D 이미지 평면에 투영된 색상 구를 렌더링하는 데 사용됩니다. 구의 크기는 참조 머리의 크기와 일치하며, 색상은 머리의 방향을 반영합니다. 이 추상화는 3D 머리 운동을 학습하는 복잡성을 줄여주며, 애니메이션에서 스타일화된 또는 과장된 머리 모양을 유지하는 데 도움이 됩니다.

머리 방향에 영향을 미치는 제어 구의 시각화.

머리 방향에 영향을 미치는 제어 구의 시각화.

마지막으로, 전신 동작을 안내하기 위해, 시스템은 적응형 뼈 길이 정규화를 사용하는 3D 신체 골격을 사용합니다. 신체 및 손 매개변수는 4DHumans 및 HaMeR를 사용하여 추정되며, 두 가지 모두 SMPL-X 신체 모델에서 작동합니다.

SMPL-X는 이미지의 전체 신체에 매개변수 메시를 적용하여 추정된 포즈 및 표현과 일치하도록 하며, 메시를 볼륨 가이드로 사용하여 포즈 인식 조작을 가능하게 합니다. 출처: https://arxiv.org/pdf/1904.05866

SMPL-X는 이미지의 전체 신체에 매개변수 메시를 적용하여 추정된 포즈 및 표현과 일치하도록 하며, 메시를 볼륨 가이드로 사용하여 포즈 인식 조작을 가능하게 합니다. 출처: https://arxiv.org/pdf/1904.05866

이 출력에서 키 조인트를 선택하고 2D로 투영한 후, 라인 기반 골격 지도로 연결합니다. Champ과 같은 방법은 전체 신체 메시를 렌더링하는 반면, 이 접근 방식은 사전 정의된 형태 先验을 강제하지 않으며, 골격 구조만을 사용하여 모델이 참조 이미지에서 직접 신체 모양과 외모를 추론하도록鼓励하여, 신체 유형에 대한 편향을 줄이고, 다양한 포즈 및 체형에 대한 일반화를 개선합니다.

훈련 중에 3D 신체 골격은 머리 구와 결합되어 포즈 인코더를 통과하여, 이후 노이즈된 비디오 잠재 변수와 결합하여 Diffusion Transformer에 사용되는 노이즈 토큰을 생성하는 특징을 출력합니다.

추론 시간에, 시스템은 뼈 길이의 차이를 고려하여 골격을 정규화합니다. SeedEdit 사전 훈련된 이미지 편집 모델은 참조 이미지와 구동 이미지를 표준 캐논 구성으로 변환합니다. RTMPose는 이후 골격 비율을 추출하여, 구동 골격을 참조 주체의 해부학에 일치하도록 조정합니다.

추론 파이프라인 개요. 의사 참조는 외모 힌트를 풍부하게 하기 위해 생성될 수 있으며, 하이브리드 제어 신호(묵시적 얼굴 운동 및 머리 구 및 신체 골격에서 파생된 명시적 포즈)는 구동 비디오에서 추출되어 DiT 모델에 공급되어, 얼굴 운동이 몸 자세와 분리된 애니메이션 출력을 생성하며, 오디오를 구동으로 사용할 수 있습니다.

추론 파이프라인 개요. 의사 참조는 외모 힌트를 풍부하게 하기 위해 생성될 수 있으며, 하이브리드 제어 신호(묵시적 얼굴 운동 및 머리 구 및 신체 골격에서 파생된 명시적 포즈)는 구동 비디오에서 추출되어 DiT 모델에 공급되어, 얼굴 운동이 몸 자세와 분리된 애니메이션 출력을 생성하며, 오디오를 구동으로 사용할 수 있습니다.

외모 가이드

외모 일관성을 높이기 위해, 특히 가려진 또는 드물게 표시되는 영역에서, 시스템은 주요 참조 이미지에 추가적인 의사 참조를 제공합니다.

재생을 클릭합니다. 시스템은 가려진 영역을 정확하게 일관되게 렌더링하는 필요성을 예측합니다. 이는 CGI와 같은 비트맵 텍스처 접근 방식과 가장 가까운 것으로 보입니다.

이 추가 프레임은 RTMPose를 사용하여 포즈 다양성을 위해 선택되며, CLIP 기반 유사성을 사용하여 주체의 동일성과 일치하는지 확인합니다.

모든 참조 프레임(주 및 의사 참조)은 동일한 시각적 인코더에 의해 인코딩되고, 자체 주의 메커니즘을 통해 융합되어, 모델이 보완적인 외모 힌트에 접근할 수 있도록 합니다. 이 설정은 프로필 뷰 또는 사물 텍스처와 같은 세부 사항의 커버리지가 향상됩니다. 의사 참조는 항상 훈련 중에 사용되며, 선택적으로 추론 중에 사용됩니다.

훈련

DreamActor는 안정성과 복잡성을 점진적으로 도입하기 위해 3단계로 훈련되었습니다.

첫 번째 단계에서는 3D 신체 골격과 3D 머리 구만 제어 신호로 사용되었습니다. 이는 MMDiT에서 초기화된 기본 비디오 생성 모델이 인간 애니메이션에 적응할 수 있도록 하였으며, 세부적인 제어 없이 복잡성을 피할 수 있었습니다.

두 번째 단계에서는 묵시적 얼굴 표현이 추가되었지만, 다른 모든 매개변수는 동결되었습니다. 이 시점에서 훈련된 것은 얼굴 모션 인코더와 얼굴 주의 계층뿐이었습니다. 이는 모델이 분리된 세부 사항을 학습할 수 있도록 했습니다.

마지막 단계에서는 모든 매개변수가 공동 최적화를 위해 해동되었습니다.

데이터 및 테스트

테스트 단계에서, 모델은 사전 훈련된 이미지-비디오 DiT 체크포인트에서 초기화되고, 3단계로 훈련됩니다. 첫 두 단계는 각각 20,000 스텝, 세 번째 단계는 30,000 스텝입니다.

다양한 길이와 해상도에 대한 일반화를 개선하기 위해, 비디오 클립은 25~121 프레임의 길이로 임의로 샘플링되었습니다. 이는 960x640px로 크기가 조정되었으며, 종횡비는 유지되었습니다.

훈련은 8개의(중국용) NVIDIA H20 GPU에서 수행되었습니다. 각 GPU에는 96GB의 VRAM이 있었으며, AdamW 옵티마이저와 5e−6의(용인할 수 있는) 높은 학습률을 사용했습니다.

추론에서 각 비디오 세그먼트는 73 프레임을 포함했습니다. 일관성을 유지하기 위해, 이전 세그먼트의 최종 잠재 변수는 다음 세그먼트의 초기 잠재 변수로 재사용되었습니다. 이는 순차적인 이미지-비디오 생성 작업을 문맥화합니다.

분류기 없는 가이드는 참조 이미지와 동작 제어 신호 모두에 대해 2.5의 가중치를 사용했습니다.

저자들은 다양한 도메인에서 500시간의 비디오로 구성된 데이터셋을 구축했습니다. 이는 다양한 인간 동작과 표현을 캡처하기 위해 설계되었습니다. 데이터셋은 전신 및 반신 샷이 均等하게 분포하도록 설계되었습니다.

얼굴 합성 품질을 향상시키기 위해, Nersemble이 데이터 준비 과정에 통합되었습니다.

DreamActor를 위한 Nersemble 데이터셋의 예시. 출처: https://www.youtube.com/watch?v=a-OAWqBzldU

DreamActor를 위한 Nersemble 데이터셋의 예시. 출처: https://www.youtube.com/watch?v=a-OAWqBzldU

평가를 위해, 연구자들은 자신의 데이터셋을 벤치마크로 사용하여 다양한 시나리오에 대한 일반화를 평가했습니다.

모델의 성능은 이전 연구에서 사용된 표준 지표를 사용하여 측정되었습니다. Fréchet Inception Distance(FID); Structural Similarity Index(SSIM); Learned Perceptual Image Patch Similarity(LPIPS); 및 Peak Signal-to-Noise Ratio(PSNR)가 프레임 수준의 품질을 위해 사용되었습니다. Fréchet Video Distance(FVD)가 시간적 일관성 및 전체 비디오 충실도 평가를 위해 사용되었습니다.

저자들은 단일 참조 이미지(대상 이미지)를 사용하여 신체 애니메이션 및 초상화 애니메이션 작업에 대한 실험을 수행했습니다.

신체 애니메이션의 경우, DreamActor-M1은 Animate Anyone, Champ, MimicMotion, 및 DisPose와 비교되었습니다.

라이벌 프레임워크와의 양적 비교.

라이벌 프레임워크와의 양적 비교.

PDF에는 정적 이미지가 제공되지만, 프로젝트 사이트의 비디오 중 하나가 차이를 더 명확하게 보여줄 수 있습니다.

오디오 콘텐츠. 재생을 클릭합니다. 라이벌 프레임워크의 시각적 비교. 구동 비디오는 상단 왼쪽에 표시되며, 저자의 결론은 DreamActor가 최고의 결과를 생성한다는 것으로 보입니다.

초상화 애니메이션 테스트의 경우, 모델은 LivePortrait, X-Portrait, SkyReels-A1, 및 Act-One과 비교되었습니다.

초상화 애니메이션의 양적 비교.

초상화 애니메이션의 양적 비교.

저자들은 자신의 방법이 양적 테스트에서 우수하며, 또한 질적으로 우수하다고 주장합니다.

오디오 콘텐츠. 재생을 클릭합니다. 초상화 애니메이션 비교의 예시입니다.

아마도 위의 비디오에서 표시된 세 번째이자 마지막 클립은 라이벌 프레임워크 중 일부보다 덜 설득력 있는 립싱크를 나타낼 수 있지만, 일반적인 품질은 매우 높습니다.

결론

DreamActor는 단일 대상 이미지에서 영감을 받은 텍스처가 실제로 표시되지 않는 경우에도 이러한 텍스처를 예측하는 필요성을 예측함으로써, 확산 기반 비디오 생성을 앞두고 있는 가장 큰 도전 중 하나인 일관된 지속적인 텍스처를 해결했습니다. 이러한 접근 방식을 완벽하게 만드는 다음 논리적인 단계는 초기 생성된 클립에서 참조 아틀라스를 생성하여 이후 다른 생성에 적용할 수 있도록 하는 것입니다. 이는 전통적인 CGI 기술에서 텍스처 매핑과 다를 바 없으며, 현실성과 설득력의 품질은 훨씬 더 높습니다.

그러나 DreamActor의 가장 인상적인 측면은 전통적인 얼굴 중심 및 신체 중심 인간 합성의 간격을 연결하는 지능적인 3부분 가이드 시스템입니다.

이제 남은 것은 이러한 핵심 원칙 중 일부가 더 접근하기 쉬운 제품에 활용될 수 있는지 여부입니다. 현재로서는 DreamActor는 또 다른 합성-서비스-제공으로 전락할 것으로 보이며, 사용 제한과 상업적 아키텍처와의 광범위한 실험의 비실용성에 의해 심각하게 제한됩니다.

 

* 저자의 부분적인 대체 및 인용.

이 프로젝트에서 사용된 Stable Diffusion의 버전은 명확하지 않습니다.

2025년 4월 4일 처음 게시됨

기계 학습 분야 작가이자 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: [email protected]