Anderson의 관점
완전한 전신 딥페이크 비디오 생성으로

인내가 필요한 분야에서 새로운 시스템은 라이브 스트리밍된 인간 시뮬레이션을 위한 실시간 렌더링 라운드를 기다리지 않고 우리를 조금 더 가까이 가져옵니다.
전체 몸길이 인간 시뮬레이션의 최신 기술은 2022년에 전체 몸길이 딥페이크의 가능성이 처음 등장한 이후로 오래 전부터 많이 발전했습니다. 지금까지 우리는 강력하고 종종 논란이 되는 오픈 소스 시스템인 Wan-Animate와 클로즈드 소스 시스템인 Grok가 단일 또는 여러 이미지를 일관된 비디오 성능으로 변환하는 능력에 익숙해졌습니다.
[비디오 너비=”1198″ 높이=”364″ mp4=”https://web.archive.org/web/20241224183553/https:/blog.metaphysic.ai/the-road-to-realistic-full-body-deepfakes/” 루프=”true” 자동 재생=”true”][/비디오]
재생을 위해 클릭하세요.. WanAnimate-2.2의 사람 대체 예시입니다. 더 나은 해상도를 위해 원본을 참조하십시오. 원본
또한 이전의 자동 인코더 기반 실시간 얼굴 딥페이크 프레임워크인 DeepFaceLive는 더 복잡한 프레임워크인 Deep-Live-Cam으로 대체되었습니다. Deep-Live-Cam은 LivePortrait 반복과 기존 GAN 및 InsightFace 모듈의 오케스트레이션을 사용하여 실시간으로 효과적인 후속 프레임워크를 생성합니다.
[비디오 너비=”998″ 높이=”484″ mp4=”https://www.youtube.com/watch?v=tSaJuj0yQkI”][/비디오]
재생을 위해 클릭하세요. Deep-Live-Cam을 통해 라이브 비디오 세션에서 엘론 머스크의 딥페이크입니다. 더 나은 해상도를 위해 원본을 참조하십시오. 원본
그러나 이러한 프레임워크는 해상도와 기능면에서 제한적입니다. 예를 들어, 특정 얼굴이나 정체성을 얻을 수 있지만, 그것은 본질적으로 한 가지 특수한 기능만을 수행하는 것입니다.
잠시만요…
현재의 AI 인간 모방 시스템 대부분도 제한적이거나 특수화되어 있습니다. 이러한 시스템의 일반적인 제약 중 하나는 최고의 인간 시뮬레이션/모방 시스템이 오프라인입니다. 즉, 실시간으로 작동할 수 없으며 대신 사용자에게 결과를 제공하기 전에 계산을 수행해야 합니다.
이러한 시스템은 라이브 AI 변형에 적합하지 않습니다. 예를 들어, 전체 몸의 동작을 라이브 스트림에서 변환하는 경우가 있습니다.
최근의 예는 오픈 소스 시스템인 Wan2.2 Animate입니다. 이는 취미 커뮤니티와 전문 리셀러에게 인기를 끌었습니다. 그러나 이것은 또한 “생성하고 기다리기” 시나리오입니다.
[비디오 너비=”1100″ 높이=”598″ mp4=”https://www.unite.ai/wp-content/uploads/2026/08/wan-animate-examples-AE.mp4″][/비디오]
재생을 위해 클릭하세요. 2025년부터 Wan2.2-Animate의 인상적인 기능 예시입니다. 조금만 기다려주십시오. 더 나은 해상도를 위해 원본을 참조하십시오. 원본
현재 상황은 이렇게 요약할 수 있습니다. 훌륭한 것을 원한다면, 다재다능한 것을 원한다면, 지금 당장 원한다면 두 가지 중 하나를 선택해야 합니다.
라이브 애니메이트
중국에서 나온 새로운 시스템은 Wan2.2 Animate를 라이브 애니메이션 프레임워크로 변환하여 현재 약 20프레임으로 작동하며, 다양한 시나리오에서 인상적인 결과를 보여줍니다.
[비디오 너비=”1208″ 높이=”348″ mp4=”https://archive.ph/wIcTy” 루프=”true” 자동 재생=”true”][/비디오]
재생을 위해 클릭하세요: 프로젝트 사이트에서 라이브 애니메이트는 무대 춤, 야외 전신 및 클로즈업 초상화 시나리오에서 드라이빙 포즈를 전달하며, 전체 몸, 손 및 얼굴 동작을 재현합니다.. 더 나은 해상도를 위해 원본을 참조하십시오. 원본
새로운 시스템은 비디오를 생성하는 방식을 변경하여 원래 시스템을 연속적으로 생성하고 빠르게 생성할 수 있도록 합니다. 각 새로운 비디오 세그먼트를 생성할 때, 시스템은 이전에 생성된 몇 가지 포즈를 선택된 이전 포즈로 유지하여 주체의 외모를 일관되게 유지합니다.
이 시스템은 전체 몸의 드라이빙 시나리오뿐만 아니라 상반신 동작과 같은 인터뷰 시나리오에서도 작동합니다.
[비디오 너비=”1352″ 높이=”392″ mp4=”https://github.com/hacksider/deep-live-cam”][/비디오]
재생을 위해 클릭하세요. ‘정적 오피스 장면에서 미묘한 머리와 손 동작’.
새로운 논문은 라이브 애니메이트가 두 가지 라이벌 프레임워크와 비교하여 특정 상황에서 정체성을 약간 더 잘 유지할 수 있다는 것을 인정합니다. 그러나 라이브 애니메이트는 오프라인 시스템이 아니며, 라이브 애니메이션을 생성하는 데 있어 중요한 발전입니다.
추가적으로, 추론을 위해 두 개의 H100 NVIDIA GPU가 필요하다는 점을 주목할 필요가 있습니다.
논문은 다음과 같이 말합니다:
‘라이브 애니메이트는 첫 30초부터 마지막까지 거의 일정한 인식 품질과 정체성을 유지하는 반면, 이전 시스템은 크게 저하되거나 동일한 롤아웃을 위해 수 시간의 오프라인 계산을 필요로 합니다. ‘
‘이 결과는 상호작용형 전신 애니메이션을 위한 품질, 지연, 기간의 새로운 작동점을 설정합니다.’
새로운 논문은 라이브 애니메이트: 실시간에稳定的 장기형 인간 애니메이션으로 제목이 붙여졌으며, 홍콩 중국 대학, 알리바바의 Qwen Applications Business Group, 및 Liblib AI의 9명의 저자에 의해 작성되었습니다. 프로젝트 사이트는 이 기사에 포함된 비디오도 포함되어 있으며, 코드는 ‘ 곧 출시 ‘입니다.
방법
라이브 애니메이트는 원래 시스템을 연속적으로 생성하고 빠르게 생성할 수 있도록 설계된 2단계 훈련 프로세스입니다. 훈련 프로세스 후에, 시스템은 새로운 비디오 세그먼트를 생성할 때, 이전에 생성된 몇 가지 포즈를 선택된 이전 포즈로 유지하여 주체의 외모를 일관되게 유지합니다.
라이브 애니메이트 파이프라인 개요, 왼쪽에 2단계 훈련 프로세스와 오른쪽에 라이브 생성이 표시됨, 여기서 들어오는 포즈는 저장된 이전 포즈와 일치시키고 최근 프레임과 결합하여 각 새로운 비디오 블록을 3단계로 생성합니다. 출처
원래의 Wan2.2 Animate는 한정된 시퀀스를 고려하도록 설계되었으며, 연속적으로 확장되는 비디오를 생성하도록 설계되지 않았습니다. 따라서 시스템을 적응시키기 위해, 저자들은 훈련 비디오를 연속적인 블록으로 나누었으며, 각 블록은 이전 블록을 컨텍스트/그라운드 트루스로 사용하여 생성되었습니다.
잊지 마세요
이 프로세스 전체에서, 원래 참조 이미지는 ‘Ref Sink’를 통해 영구적으로 사용할 수 있습니다. 이는 주체의 정체성과 외모에 대한 고정된 참조를 제공합니다. 한 블록이 완료되면, ‘Clean KV Update’는 정보를 역사적인 컨텍스트로 변환하여 이후 블록에서 사용할 수 있도록 합니다.
이 첫 번째 훈련 단계는 여전히 각 블록당 50개의 디노이즈 단계를 필요로 하므로, 실시간 작동이 불가능합니다. 두 번째 단계에서는 프로세스를 3단계로 축소하며, 모델이 자신의 생성된 역사와 상호작용하도록 합니다.
라이브 애니메이트를 배포하기 위한 두 가지 훈련 단계, 먼저 깨끗한 이전 비디오 블록에서 학습한 다음, 모델이 자신의 불완전한 출력과 상호작용하도록 3단계로 축소합니다.
이 훈련은 각 블록을 별도로 업데이트할 수 있도록 하나의 완전한 연습을 수행한 다음, 하나의 블록씩 재방문합니다. 각 블록은 전체 시퀀스를 계산적으로 ‘라이브’로 유지하지 않고 업데이트를 받을 수 있습니다.
중단하지 마세요
무한한 생성을 위해, 라이브 애니메이트는 무엇을 기억할 가치가 있는지 결정해야 합니다. 모든 것을 기억하는 것은 처리 요구사항을 비현실적으로 만듭니다. 그러나, 최근 프레임만 유지하는 것은 유용한 이전 뷰를 폐기할 수 있습니다.
따라서 포즈 검색 싱크 어텐션은 첫 번째 생성된 블록을 영구적인 ‘정적 싱크’로 유지하고, 대체 가능한 ‘다이나믹 싱크’와 현재 및 두 개의 이전 블록을 포함하는 롤링 창을 유지합니다. 참조 이미지는 별도로 ‘Ref Sink’를 통해 사용할 수 있습니다. 고정된 저장 크기는 비디오 길이가 증가함에 따라 비용이 증가하지 않도록 합니다.
블록 전쟁
이 제한된 메모리에 이전 포즈를 선택하기 위해, ViTPose는 세 개의 프레임에서 신체와 손의 위치를.compact한 표현으로 줄입니다. 메모리 뱅크는 이러한 대표적인 5개의 포즈를 보유하며, 첫 20개의 블록 동안 다양성을 중복보다 우선하여 채워집니다.
생성 중에 들어오는 포즈는 이러한 대표자들과 비교되고 가장 가까운 일치가 검색되어 이전에 주체가 유사한 위치에 있었던 증거를 제공합니다. 그러나, 바로 이전 블록은 이미 롤링 창에 있으므로, 다이나믹 싱크는 더 이전의 정보를 검색하도록 자유롭습니다.
마지막으로, 런타임은 두 개의 H100 GPU에서 어텐션 처리를 분산하고, 통신과 계산을 중첩하고, 가능한 경우 캐시된 정보를 재사용하여 최적화됩니다.
데이터 및 테스트
라이브 애니메이트는 AVSpeech에서 40,000개의 대화 비디오와 TikTok 데이터셋 및 HumanVid에서 20,000개의 인간 동작 비디오로 훈련되었습니다. 훈련과 추론은 480×480, 384×672 및 672×384 픽셀의 해상도를 지원합니다.
훈련은 Wan2.2-Animate-14B 베이스 체크포인트에서 시작하여, 8개의 NVIDIA H100 GPU에서 10,000 스텝으로 첫 번째 단계와 20,000 스텝으로 두 번째 단계를 진행했습니다.
비디오는 3개의 잠재 프레임(모델의 압축된 내부 표현)으로 생성되었으며, 이는 12개의 RGB 프레임에 해당합니다. 추론은 두 개의 H100에서 수행되었습니다.
평가는 라이브 애니메이트를 기존의 포즈 기반 인간 애니메이션 방법과 비교했으며, 일관된 설정에서 참조 이미지와 드라이빙 포즈를 사용했습니다. 장기 테스트에서는 생성을 3분까지 확장하여 품질과 정체성이 시간에 따라 안정적으로 유지되는지 여부를 조사했습니다.
테스트된 프레임워크에는 EverAnimate, One-to-All, SCAIL, UniAnimate-DiT 및 Wan2.2-Animate가 포함되었습니다.
사용된 지표에는 시각적 품질, 정체성 일관성, 분포 품질 및 시간적 표현 오류가 포함되었습니다. 미학 점수 (ASE)와 참조 없는 이미지 품질 평가 (IQA)는 프레임 수준의 시각적 품질을 측정했습니다. DINO, 유사성 (DINO-S), 참조 정체성과 일관성; 프레첼 인셉션 거리 (FID), 분포 품질; 및 비디오 MAE 특징 거리 (V-MAE), 생성된 비디오가 시간이 지남에 따라 운동을 얼마나 잘 유지하는지 측정했습니다.
3분 동안 연속적으로 생성된 품질과 정체성에 대한 테스트 결과, 라이브 애니메이트는 모든 5개 지표에서 비교적 안정적으로 유지되며, 몇몇 경쟁 방법은 시간이 지남에 따라 더 큰 저하를 나타냅니다. 더 높은 읽기 값은 IQA, ASE 및 DINO-S에 대해 더 좋으며, FID 및 V-MAE에 대해서는 더 낮은 읽기 값이 더 좋습니다.
초기 결과 그래프에 표시된 대로, 라이브 애니메이트는 첫 30초 동안最高의 ASE(2.823)와 IQA(4.047)를 달성했습니다. 저자들은 이것이 3단계 증류가 감소된 추론 예산에도 불구하고 인식 품질을 유지한다는 것을 나타낸다고 주장합니다.
더욱 중요한 것은, 라이브 애니메이트는 3분 동안의 생성 중에 품질과 정체성이 거의 변하지 않는다는 것입니다.
반면에, One-to-All은 시간이 지남에 따라 크게 저하되며, 더 낮은 시각적 품질과 정체성 일관성이 나타납니다. 또한, 기본 Wan2.2-Animate는 정체성 일관성에서 약간의 손실을 나타냅니다.
저자는 다음과 같이 말합니다:
‘이러한 경향은 장기 컨텍스트를 명시적으로 관리하는 것이 스트리밍 애니메이션에 중요하다는 우리의 주요 주장을 지지합니다.’
라이브 애니메이트의 확장 효율성은 또한 GPU에 대해 테스트되었습니다. 아래에 표시된 대로, 1개의 H100에서 12.41 FPS, 2개의 H100에서 19.63 FPS, 4개의 H100에서 22.13 FPS를 달성했습니다. 이익은 점점 더 통신 오버헤드에 의해 제한되므로, 2개의 H100이 선호되는 구성으로 선택되었습니다.
480×480 해상도에서 1개, 2개 및 4개의 H100 GPU에 대한 확장 효율성, 지연, 프레임 속도, 속도 향상 및 효율성을 보여줍니다. 2개의 GPU에서 19.63 FPS를 달성했습니다. 추가적인 확장은 22.13 FPS로 약간 증가했습니다.
19.63 FPS에서, 각 12프레임 블록은 0.611초 만에 생성되었습니다. 반면에, 경쟁 시스템은 동일한 3분 시퀀스를 생성하기 위해 약 2~5시간이 필요했습니다.
적정 테스트는 유사한 차이를 보여주었습니다. 전체 몸 테스트에서, One-to-All은 심각한 저하를 보였으며, UniAnimate-DiT와 SCAIL은 깜박임을 생성했습니다. 또한, Wan-Animate와 EverAnimate는 나중에 색상 또는 배경이드릴을 나타냈습니다.
3분 동안의 전체 몸 애니메이션에 대한 테스트 결과, 프레임은 20초마다 샘플링되었으며, 적색 주석은 경쟁 방법의 장기적인 저하를 강조합니다. 라이브 애니메이트는 시퀀스를 생성하기 위해 약 4분이 소요되었습니다.
라이브 애니메이트는 주체의 외모와 주변 장면을 3분 동안의 시퀀스 전체에 걸쳐 유지했습니다. 상반신 테스트에서, EverAnimate와 라이브 애니메이트는 유사한 장기적인 안정성을 달성했습니다.
3분 동안의 상반신 애니메이션에 대한 테스트 결과, 20초마다 샘플링된 프레임은 라이브 애니메이트가 주체의 정체성, 의복 및 어두운 배경을 더 일관되게 유지한다는 것을 보여줍니다.
저자는 다음과 같이 말합니다:
‘3분 벤치마크에서, 라이브 애니메이트는 거의 일정한 인식 품질과 정체성을 19.63 FPS에서 유지하며, 메모리와 지연은 스트림 기간에 따라 달라지지 않습니다. 반면에, 오프라인 베이스라인은 시각적으로 저하되거나 수 시간의 계산을 필요로 합니다. ‘
‘이 결과는 대규모 비디오 확산 모델이 라이브 스트리밍, 텔레프레즌스 및 가상 아바타와 같은 상호작용형 애플리케이션에 도달할 수 있음을 보여줍니다.’
결론
라이브 애니메이트는 지속적인 기억의 영역에서 지속적인 발전을 보여주는 드라이븐 생성 프레임워크의 좋은 예입니다. 현재 많은 생성 프레임워크가 사용자 제공의 고정 이미지를 참조할 수 있습니다.
그러나, 단일 비디오 클립을 생성하는 문제만을 해결하는 것입니다. 예를 들어, 주체의 정체성(의복 및 헤어 스타일 포함)을 유지하는 문제가 있습니다. 현재까지, 임시적인 LoRA 접근 방식만이 이러한 문제에บาง 정도의 진전을 이루었습니다.
비디오 및 현재의 AI 혁신을 위해, 효과적인 지속적인 기억의 개발은 결정적인 문제입니다. 이것은 아마도 AGI의 출현과 차이점을 결정할 것입니다.
* 이것은 여전히 ‘갇혔는가’인가? 현재의 생각은 더 작은 특수 모델이ในที่สุด 로컬에서 무료로 실행될 수 있으며, 더 높은 수준의 요구는 경쟁적이고 희망적으로 분산된 GPU 임대 시장에 의해 충족될 것이라는 것입니다. 이것은 최전선 회사들이 경쟁을 EEE하지 않을 것이라는 가정하에 이루어집니다. 또한, 상당한 GPU 컴퓨팅 파워가 계속해서 이용 가능하다는 가정하에 이루어집니다. 이러한 가정에 근거하여, 나는 더 이상 과도한 GPU 요구를 단점으로 간주하지 않습니다. 대신, 접근성이 점점 더 민주화되고, 이후 최적화가 초기 자원 요구를 줄일 수 있기를 바랍니다.
† AI에 의해 생성되고 확인되었습니다.
†† 장기 비디오 테스트를 위해, SCAIL과 UniAnimate-DiT는 두 시스템 모두 장기 형식 생성을 네이티브로 지원하지 않기 때문에 동일한 무훈련 슬라이딩 윈도우 절차로 확장되었습니다. EverAnimate와 One-to-All은 자신의 장기 비디오 생성 방법을 사용하여 평가되었습니다.
2026년 8월 13일 처음 게시되었습니다.












