Anderson’un Açısı
Sürekli Tam Vücut Derin Sahte Video Oluşturma Doğruyu

Sabır gerektiren bir alanda, yeni bir sistem bizi canlı insan simülasyonu akışına biraz daha yaklaştırıyor ve.rendering turu frustrasyonundan kurtulmamızı sağlıyor.
Tam uzunlukta insan simülasyonu alanındaki son durum, 2022’de tam vücut derin sahteleri oluşturma olasılığının ortaya çıkmasından bu yana önemli bir yol kat etti. Şimdi, açık kaynaklı sistemler gibi Wan-Animate ve kapalı kaynaklı sistemler gibi Grok’un, tek veya birden fazla görüntüyü tutarlı ve souvent dönüştürebilme yeteneklerine alıştık. Bu, bir video performansı oluşturmak için:
Oynatmak için tıklayın. WanAnimate-2.2 ile kişi değiştirme örnekleri. Daha iyi çözünürlük için kaynağa başvurun. Kaynak
Ayrıca, eski otoencoder tabanlı canlı yüz derin sahte çerçevesi DeepFaceLive, Deep-Live-Cam gibi daha gelişmiş çerçeveler tarafından aşıldı. Bu, LivePortrait iterasyonlarının bir orkestrasyonunu, miras GAN ve InsightFace modüllerini kullanarak, gerçek zamanlı bir DFLive projesi yaratıyor:
Oynatmak için tıklayın: Elon Musk, Deep-Live-Cam aracılığıyla canlı video oturumunda derin sahte. Daha iyi çözünürlük için kaynağa başvurun. Kaynak
Ancak, Deep-Live-Cam gibi çerçeveler sonsuza kadar çalışabilir ve sahte oluşturabilir, ve zor açılarda daha iyiler, ancak sonuçlar çözünürlük ve yetenek açısından sınırlıdır: belirli bir yüz/y kimliği elde edilebilir ve çok şey yapabilir, ancak temelde bir numara doingidir.
BRB…
Mevcut AI insan taklit sistemlerinin çoğu benzer şekilde sınırlı ve/veya ‘özel’. Birincil, tekrar eden kısıtlama, en iyi insan simülasyonu/ taklit sistemlerinin çevrimdışı olmasıdır – yani, gerçek zamanlı olarak çalışmak için fazla kaynak yoğundurlar ve yerine hesaplamak ve sonra sonucu kullanıcıya sunmak için uzaklaşmaları gerekir.
Elbette, bu tür sistemler canlı AI dönüşümü için uygun değildir, örneğin bir dans gibi tüm vücut hareketini bir akışta dönüştürmek.
Geçtiğimiz yıllardaki bir örnek, açık ağırlıklı Wan2.2. Animate idi. Bu, hobi topluluğu ve profesyonel satıcılar arasında popülerdi, ancak yine de ‘üret ve bekle’ senaryosuydu:
Oynatmak için tıklayın. 2025’ten Wan2.2-Animate’in etkileyici yetenekleri – biraz sabırınız varsa. Daha iyi çözünürlük için kaynağa başvurun. Kaynak
Bu nedenle, şu an itibariyle, mükemmel, çok yönlü veya şimdi olabilir – ikisini seçin.
LiveAnimate
Bu Meksika çıkmazına, Çin’den yeni bir teklif geliyor. Bu, temelde Wan2.2 Animate’i, yaklaşık 20 kare/saniye hızında çalışan canlı bir animasyon çerçevesine dönüştürüyor:
Oynatmak için tıklayın: LiveAnimate, sahne dansı, açık hava tam vücut ve yakın portre senaryolarında sürüş pozlarını aktarır ve tüm vücut, el ve yüz hareketini yeniden üretir
Yeni çalışma, video oluşturma şeklini değiştirerek orijinal sistemi canlı bir versiyona dönüştürür: geçmiş ve gelecek kareleri birlikte işlemeden, LiveAnimate her yeni segmenti eylemin gelişimi sırasında oluşturur, sadece birkaç adımda, seçilen önceki pozları korur ve böylece uzun oturumlar boyunca konunun görünümünü tutarlı tutar.
Esasen, sistem önceki kareleri bir tür kalıcı bellek olarak kullanır ve video geliştikçe buna başvurur, böylece kimlik tutarlı kalır – eski CGI sistemlerinin metin haritalarına başvurmasına benzer.
LoRA adaptasyonu ile birlikte, bu, 14 milyar parametrelik modelin tek bir düğümde, sekiz 80GB H100 GPU ile damıtılmasına olanak tanır.
Yeni sistem, yukarıdaki örneklerde görüldüğü gibi tam vücut sürüş senaryolarıyla başa çıkmanın yanı sıra, üst vücut hareketleriyle de başa çıkabilir, örneğin röportaj senaryolarında:
Oynatmak için tıklayın. ‘Ofis sahnesinde baş ve el hareketi’.
Adil olmak gerekirse, yeni makale, test edilen iki rakip çerçeveden birinin belirli durumlarda kimliği biraz daha iyi koruduğunu kabul ediyor; ancak, bu rakip çerçevelerin hiçbiri canlı değil, çevrimdışı sistemler ve yeni çalışmanın yazarları, makul ve iyimser bir yönde sınırları zorluyor.
Ayrıca, çıkarım için iki H100 NVIDIA GPU’su gerektiği de unutulmamalıdır, yani toplam 160GB VRAM*.
Makalede şöyle denir:
‘LiveAnimate, ilk 30 saniyeden son dakika’ya kadar neredeyse sabit algısal kalite ve kimlik korurken, önceki sistemler önemli ölçüde bozulur veya aynı geri dönüş için saatlerce offline hesaplama gerektirir.
‘Bu sonuçlar, gerçek zamanlı etkileşimli tam vücut animasyonu için yeni bir işletim noktası oluşturur.’
Yeni makale, LiveAnimate: Gerçek Zamanlı Stable Long-Form İnsan Animasyonu olarak adlandırılmıştır ve Çin’deki Hong Kong Çin Üniversitesi, Alibaba’nın Qwen Uygulamaları İş Birimi ve Liblib AI’den dokuz yazar tarafından yazılmıştır. Proje sitesi, bu makaledeki videolarla birlikte mevcuttur ve kod ‘yakında‘ gelecektir.
Yöntem
LiveAnimate, Wan2.2-Animate’in sürekli ve hızlı bir şekilde üretmesini sağlayan iki aşamalı bir eğitim sürecinden oluşur ve ardından, her yeni video bloğu üretildiğinde yararlı önceki pozları geri çağıran bir bellek sistemi gelir:
LiveAnimate pipeline’inin bir görünümü, solda iki aşamalı eğitim sürecini ve sağda canlı üretim sürecini gösteren, giren pozların depolanan önceki pozlarla eşleştirildiği ve recent karelerle birleştirilerek her yeni video bloğunun üç adımda oluşturulduğu
Orijinal Wan2.2-Animate, sonsuza kadar uzayan bir video oluşturmak yerine bir dizi düşünülmüştür. Bu nedenle, yazarlar eğitim videolarını ardışık bloklara böldü, her biri önceki bloklardan gelen bağlam/gerçek olarak kullanıldı. Bu, modelin önce güvenilir materyallerden devam etmesini, daha sonra kendi çıkışındaki hatalarla başa çıkmasını öğretir.
Unutma
Bu süreç boyunca, orijinal référence görüntüsü, ‘Ref Sink’ aracılığıyla sürekli olarak kullanılabilir durumda kalır ve kişinin kimliği ve görünümünün sabit bir hatırlatıcısı olarak kalır. Bir bloğun tamamlanmasının ardından, ‘Clean KV Update’, bloktan elde edilen bilgileri, sonraki bloklar için historical bağlam olarak dönüştürür (ancak bu, mevcut hataları düzeltmez).
Bu ilk eğitim aşaması hala her bloğa 50 gürültü azaltma adımına ihtiyaç duyar, bu da canlı operasyonu pratik kılmaz. İkinci aşama, işlemi üç adıma indirgeyerek, modelin kendi ürettiği geçmişine maruz kalmasını sağlar, çünkü dağıtımda her yeni segment, kusurlu önceki çıkışa bağlı olmalıdır:
LiveAnimate’i dağıtıma hazırlamak için kullanılan iki eğitim aşaması†, ilk olarak temiz önceki video bloklarından öğrenme ve ardından modelin kendi ürettiği geçmişine karşı üç adımda eğitim
Eğitim, kendi üretilen dizileri karşıtı sunarken başka bir sorun ortaya koyar, çünkü tüm bir videonun hesaplamalı geçmişini tutmak aşırı pahalı olurdu. Bunun yerine, bir tane tam uygulama yapılır, sonra bloklar halinde geri dönülerek her biri ayrı ayrı eğitilir. Her blok, böylece tüm diziyi canlı tutmadan güncellenir.
LoRA adaptasyonu ile birlikte, bu, 14 milyar parametrelik modelin sekiz H100 GPU’su ve 128’lik bir rank ile eğitilmesini sağlar.
Durma
Sonsuz üretim için, LiveAnimate ayrıca hatırlanmaya değer şeyi belirlemelidir. Her şeyi tutmak işleme gereksinimlerini kontrol edilemez bir şekilde artırardı, ancak yalnızca recent kareleri tutmak da yararlı önceki görüntüleri atabilir.
Bu nedenle, Pose-Retrieval Sink Attention (PR-Sink), ilk üretilen bloğu kalıcı bir ‘Static Sink’ olarak tutar, değiştirilebilir bir ‘Dynamic Sink’ olarak çalışır ve geçerli ve önceki iki bloğu içeren bir rolling pencereyi korur. Referans görüntüsü, Ref Sink aracılığıyla ayrı olarak kullanılabilirken, sabit depolama boyutları, videonun süresi arttıkça maliyetlerin artmasını engeller.
Blok Savaşları
Daha eski pozları bu sınırlı bellek için seçmek için, ViTPose, vücut ve el konumlarını üç karede bir compact temsile indirger. Bellek bankası, beş böyle temsil içerir ve ilk 20 blok sırasında, benzer olmayan pozları near-duplicates’e tercih ederek doldurulur.
Üretim sırasında, gelen poz, bu temsilcilerle ve Dynamic Sink ile karşılaştırılır ve en yakın eşleşme geri çağrılır, benzer bir pozda kişinin nasıl göründüğüne dair önceki kanıtlar sağlar. Ancak, hemen önceki blok, zaten rolling pencerede olduğu için hariç tutulur, böylece Dynamic Sink, daha geriden bilgi alabilir.
Son olarak, çalışma zamanı, iki H100 GPU’su arasında dikkat işlemini dağıtarak, iletişimi hesaplamayla örtüştürerek ve her yerde mümkün olduğunda önbelleğe alınmış bilgileri yeniden kullanarak hız için optimize edilir.
Veri ve Testler
LiveAnimate, AVSpeech konuşma videolarından 40.000 ve TikTok veri seti ve HumanVid insan hareketi videolarından 20.000 ile eğitilmiştir. Eğitim ve çıkarım, 480×480, 384×672 ve 672×384 piksel çözünürlüklerini desteklemektedir.
Eğitim, Wan2.2-Animate-14B temel noktasından başladı, 128’lik bir rank ile LoRA kullanıldı ve ilk aşama için sekiz NVIDIA H100 GPU’su üzerinde 10.000 adımda, ikinci aşama için 20.000 adımda gerçekleştirildi.
Video, her biri 12 RGB kareye karşılık gelen üç latent kare bloklarında oluşturuldu ve çıkarım, iki H100 üzerinde gerçekleştirildi.
Değerlendirme, LiveAnimate’i, hem kısa hem de uzun dizilerde, tutarlı ayarlamalar ve référence görüntüleri ve sürüş pozları ile mevcut poz sürücülü insan animasyon yöntemleriyle karşılaştırdı. Uzun-form testleri, üç dakikaya kadar üretim uzatilerek, kalite ve kimlik zaman içinde stabil kalıp kalmadığını incelemek için gerçekleştirildi.
Test edilen çerçeveler, EverAnimate; One-to-All; SCAIL††; UniAnimate-DiT; ve Wan2.2-Animate idi.
Kullanılan metrikler, görsel kalite, kimlik tutarlılığı, dağıtımsal kalite ve zamanlı temsil hatasını kapsıyordu. Estetik Skor (ASE) ve referanssız Görüntü Kalitesi Değerlendirmesi (IQA), kare düzeyinde görsel kaliteyi ölçtü; DINO, benzerlik (DINO-S), ve référence kimliği ile görünüm tutarlılığı; Fréchet Inception Distance (FID), dağıtımsal kalite; ve VideoMAE özellik mesafesi (V-MAE), üretimin zaman içinde hareketi ne kadar iyi koruduğunu ölçtü:
Üç dakika boyunca sürekli üretim boyunca kalite ve kimlik için test sonuçları, LiveAnimate’in tüm beş metrikte durağan kaldığını, diğer bazı yöntemlerin zaman içinde daha büyük bozulma gösterdiğini gösterir. IQA, ASE ve DINO-S için daha yüksek okumalar daha iyidir, FID ve V-MAE için daha düşük okumalar daha iyidir.
Yukarıdaki ilk sonuç grafiğinde gösterildiği gibi, LiveAnimate ilk 30 saniye için en yüksek ASE’yi (2.823) ve IQA’yı (4.047) elde etti. Yazarlar, bu durumun, üç adımlı damıtmanın algısal kaliteyi koruduğunu, azaltılmış çıkarım bütçesine rağmen, gösterdiğini iddia ediyor.
Daha da önemli olarak, LiveAnimate, üç dakika boyunca sürekli üretim boyunca, görsel kalite ve kimlik tutarlılığı puanlarını neredeyse değişmeden tuttu.
Öte yandan, One-to-All, zaman içinde önemli ölçüde bozuldu, görsel kalite ve kimlik tutarlılığı daha düşük ve dağıtımsal hata daha yüksekti; ve temel Wan2.2-Animate de kimlik tutarlılığında bir miktar kaybı gösterdi.
Yazarlar şöyle diyor:
‘Bu eğilimler, uzun vadeli bağlamı açıkça yönetmenin akış animasyonu için önemli olduğunu gösteren ana iddiamızı desteklemektedir.’
LiveAnimate’in ölçeklenebilirliği de GPU’lar boyunca test edildi. Aşağıdaki gibi, bir H100 ile 12.41 kare/saniye, iki H100 ile 19.63 kare/saniye ve dört H100 ile 22.13 kare/saniye elde edildi, ve kazanımlar giderek iletişimle sınırlı hale geldi. Bu nedenle, iki H100, tercih edilen yapılandırma olarak seçildi:
480×480 çözünürlükte bir, iki ve dört H100 GPU’su boyunca ölçeklenebilirlik, gecikme, kare hızı, hızlanma ve verimlilik gösteren
19.63 kare/saniye’de, her 12 karelik blok 0.611 saniyede üretildi. Karşılaştırıldığında, rakip sistemler aynı üç dakikalık diziyi üretmek için yaklaşık 2-5 saat gerektirdi.
Niteliksel testler benzer farklılıkları ortaya çıkardı: tam vücut testinde, One-to-All’de ciddi bir bozulma görüldü; UniAnimate-DiT ve SCAIL’de titreşim oluştu ve Wan-Animate ve EverAnimate’de daha sonra renk veya arka plan kayması meydana geldi.
Üç dakika boyunca tam vücut animasyonu için test sonuçları, LiveAnimate’in konunun görünümünü ve окружan sahneyi tüm dizi boyunca korurken, diğer yöntemlerin daha büyük bozulma gösterdiğini gösterir. Kaynak makale için daha iyi çözünürlük.
LiveAnimate, üç dakikalık dizinin tamamında konunun görünümünü ve окружan sahneyi korudu. Daha az zorlu üst vücut testinde, EverAnimate ve LiveAnimate benzer uzun vadeli stabilite gösterdi (ancak yalnızca LiveAnimate gerçek zamanlı üretim sağladı):
Üç dakika boyunca üst vücut animasyonu için test sonuçları, LiveAnimate’in konunun kimliğini, kıyafetlerini ve koyu arka planını diğer yöntemlerden daha tutarlı bir şekilde korurken gösterir.
Yazarlar şöyle diyor:
‘Üç dakikalık benchmark’te, LiveAnimate, iki H100 GPU’su üzerinde 19.63 kare/saniyede neredeyse sabit algısal kalite ve kimlik korurken, çevrimdışı temel sistemler ya görünür şekilde bozulur ya da saatlerce hesaplama gerektirir.
‘Bu sonuçlar, milyarlarca ölçekli video difüzyon modellerini, canlı akış, telepresence ve sanal avatarlar gibi etkileşimli uygulamalara ulaşılabilir kılar.’
Sonuç
Sürekli bellek ve kimlik sorunlarıyla mücadele eden bir üretim çerçevesinin yeni bir yaklaşım benimsemesi cesaret verici. Kullanıcı tarafından sağlanan sabit görüntülere başvurmadan generatif video oluşturabilen birçok çerçeve zaten var.
Ancak, bu, yalnızca tek bir video klip oluştururken bazı sorunları çözer, örneğin, bir kişinin kimliğini (giyim ve saç stili dahil) korurken, bir kareye yeniden girdiğinde veya geçici olarak engellenip sonra tekrar görünür. Bugüne kadar, yalnızca ağır ve geçici LoRA yaklaşımı bu sorunlarla başa çıkma konusunda sınırlı ve geçici ilerleme kaydetmiştir.
Video ve aslında tüm güncel AI devrimi için, etkin kalıcı bellek geliştirilmesi, kritik ve varoluşsal bir meseledir – bu, AGI’nin ortaya çıkması ile üçüncü bir AI kışının farkını belirleyecek bir meseledir.
* Bu hala bir ‘gotcha’ mı? Şu anki düşünce, daha küçük, özel modellerin sonunda yerel olarak, kirasız çalışabileceği ve daha yüksek düzeydeki gereksinimlerin rekabetçi ve umarım parçalanmış bir GPU kiralama pazarı tarafından karşılanacağı yönündedir. Bu, sınır şirketlerinin rekabeti EEE etmediğini ve önemli GPU hesaplama kaynaklarının her zaman mevcut kalacağını varsayar. Bu nedenle, artık aşırı GPU gereksinimlerini bir eksiklik olarak görmedim, ancak erişimın giderek daha demokratik hale gelmesini ve sonraki optimizasyonların ilk kaynak gereksinimlerini azaltmasını umuyorum.
† Kendim tarafından oluşturuldu ve kontrol edildi.
†† Uzun video testi için, SCAIL ve UniAnimate-DiT, hiçbirisi yerli olarak uzun-form üretimini desteklemediği için aynı eğitim-ücretsiz slayt-pencere prosedürü ile genişletildi. EverAnimate ve One-to-All, kendi uzun-video üretim yöntemleri ile değerlendirildi.
İlk olarak 13 Ağustos 2026 Perşembe günü yayımlandı.












