Andersonin kulma
Kohti jatkuvaan täyskehon Deepfake-videon tuotantoa

Tälle alalle, jossa vaaditaan kärsivällisyyttä, uusi järjestelmä vie meidät hieman lähemmäs livenä toistettua ihmisen simulaatiota ilman turhia renderöintikierroksia.
Täysipainoisen ihmisen simulaation nykytila on edennyt pitkälle siitä, kun täyskehon deepfake-mahdollisuus ilmoitettiin ensimmäisen kerran vuonna 2022. Nykyään olemme tottuneet avoimen lähdekoodin järjestelmien, kuten Wan-Animate, ja suljetun lähdekoodin järjestelmien, kuten Grokin, vaikuttavaan ja usein kiistanalaiseen kykyyn muuttaa yhtä tai useampaa kuvaa yhdenmukaiseksi ja usein muodonmuutosvideoksi:
Paina toistamaan, jos tarpeen. WanAnimate-2.2:n henkilön korvaamisen esimerkkejä. Viittaa alkuperäislähteeseen paremman resoluution vuoksi. Lähde
Lisäksi vanhempi autoencoder-pohjainen live- kasvoface deepfake-kehykselle DeepFaceLive on jo ohittanut uudemmilla kehyksillä, kuten Deep-Live-Cam, joka hyödyntää LivePortrait-iteraatioita, sekä perinteisiä GAN ja InsightFace-moduuleja, luodakseen tehokkaan reaaliaikaisen seuraajan (nykyään hylättyyn) DFLive-projektiin:
Paina toistamaan: Elon Musk deepfaked livenä videossaan Deep-Live-Cam:in avulla. Viittaa alkuperäislähteeseen paremman resoluution vuoksi. Lähde
Kuitenkin, vaikka kehykset, kuten Deep-Live-Cam, voivat toimia loputtomasti ja väärentää loputtomasti, ja vaikka ne ovat parempia tuottamaan haastavia kasvonkulmia kuin ennen, tulokset ovat silti rajoitettuja resoluution ja kyvyn suhteen: voit saada tietyn kasvon/identiteetin, ja se voi tehdä paljon asioita, kuten vakuuttavia kasvojen ilmeitä ja huulien synkronointia – mutta se on periaatteessa yhden illan ilmiö.
Odota hetki…
Useimmat nykyiset tekoälyihmisen mimesisysteemit ovat samoin rajoitettuja ja/tai “erikoistuneita”. Yksi tietty, toistuva rajoitus on, että parhaat ihmisen simulaatio/mimesisysteemit ovat offline – eli ne ovat liian resursseja vaativia toimimaan reaaliajassa, ja niiden on mentävä pois, laskettava ratkaisu ja esitettävä tulos käyttäjälle myöhemmin.
Ilmeisesti tällaiset järjestelmät eivät sovellu livenä tekoälymuodonmuutokselle, kuten koko kehon liikkeen muuttamiselle, kuten tanssissa, livenä.
Esimerkki tästä on avoimen lähdekoodin Wan2.2. Animate, josta harrastajayhteisö ja ammattimaiset jälleenmyyjät pitivät – mutta jälleen kerran, se on “luo ja odota” -tilanne:
Paina toistamaan. Vuodesta 2025, esimerkkejä Wan2.2-Animate:n vaikuttavista ominaisuuksista – jos voit odottaa vähän aikaa. Viittaa alkuperäislähteeseen paremman resoluution vuoksi. Lähde
Joten, mitä meillä on, voit valita kahden välillä: voit saada sen hyvän, voit saada sen monipuolisen, tai voit saada sen nyt – valitse kaksi.
LiveAnimate
Tähän meksikolaiseen pattitilanteeseen tulee Kiinasta uusi tarjous, joka muuttaa Wan2.2 Animate:n live-ohjatun animaatiokehykseksi, joka toimii tällä hetkellä kunnioitettavalla lähes 20 fps:n nopeudella, vaikuttavilla tuloksilla eri tilanteissa:
Paina toistamaan: Projekti-sivustolta, LiveAnimate siirtää ohjausasennot ylängölle, ulkoisille täyskehon ja lähikuvien asetuksille, jäljitellen koko kehon, käden ja kasvon liikkeitä. Viittaa alkuperäislähteeseen paremman resoluution vuoksi. Lähde
Uusi työ laajentaa alkuperäistä järjestelmää live-käyttökykyiseksi muuttamalla miten video tuotetaan: sen sijaan, että se käsittelee menneitä ja tulevia kehysia yhdessä, LiveAnimate tuottaa jokaisen uuden segmentin, kun toiminta etenee, käyttäen vain muutamia askelia, säilyttäen valitut aiemmat asennot pysyäkseen kohteen ulkonäön yhdenmukaisena pitkin pitkien istuntojen.
Periaatteessa järjestelmä säilyttää aiemmat kehykset menetetyksi muistina, josta se voi piirtää, kun video kehittyy, jotta identiteetti säilyy – ei aivan erilainen vanhojen CGI-järjestelmien tapaan, jotka viittaavat tekstuurikarttoihin.
Vaikka LoRA on mukana prosessointivaiheessa, LiveAnimate ei ole vain toinen LoRA-järjestelmä – sen suoratoistogenerointi, asentoa-muisti/välimuistijärjestelmä, kolmen askelen inference ja GPU-optimoitukset edustavat lisämekanismeja, joita käytetään yhdessä muiden teknologioiden kanssa (joista jotkut ovat yllättäen vanhoja).
Uusi järjestelmä pystyy selviytymään paitsi täyskehon ohjausskenaarioiden kanssa, kuten yllä olevissa esimerkeissä, myös ylävartaloliikkeiden kanssa, kuten haastattelutilanteissa:
Paina toistamaan. ‘Hienovarainen pään ja käden liike staattisessa toimistotilanteessa’.
Reilusti rajoituksia koskien, uusi tutkimus myöntää, että kaksi kilpailevaa kehyksistä, joita testattiin LiveAnimatea vastaan, pystyi säilyttämään identiteetin hieman paremmin tietyissä tiettyjen olosuhteiden mukaan; sanottakoon, että mikään kilpailijoista ei ollut online-järjestelmä, vaan offline-järjestelmä, ja uuden työn tekijät pyrkivät selvästi työntämään kehyksen uskottavassa ja optimistisessa suunnassa.
Lisäksi on mainittava, että inference vaatii kaksi H100 NVIDIA:n GPU:ta, yhteensä 160 GB VRAM:ia*.
Tutkimus toteaa:
‘LiveAnimate säilyttää lähes vakaan havaintokyvyn ja identiteetin ensimmäisten 30 sekunnin ajan loppuun asti, kun taas aiemmat järjestelmät heikkenevät huomattavasti tai vaativat useita tunteja offline-laskentaa saman tuloksen saavuttamiseksi.
‘Nämä tulokset asettavat uuden toimintapisteen laadussa, viiveessä ja kestossa interaktiivisille täyskehon animaatioille.’
Uusi tutkimus on nimeltään LiveAnimate: Stabiloitu pitkäaikainen reaaliaikainen ihmisen animaatio, ja se tulee yhdeksältä tekijältä Kiinan Hongkongin yliopistosta, Alibaban Qwen Applications Business Groupista ja Liblib AI:sta. Projekti-sivusto, jossa on myös videot, jotka ovat esillä tässä artikkelissa, on myös saatavilla, kun taas koodi on ‘tulossa pian’, ja painot… kuka tietää?
Menetelmä
LiveAnimate koostuu kahdesta vaiheesta, joiden tarkoituksena on tehdä Wan2.2-Animate:sta jatkuva ja nopea, ja sen jälkeen muistiin, joka noutaa hyödyllisiä aiempia asentoja, kun jokainen uusi videoblokkeri tuotetaan:
LiveAnimate-pipeline yleiskatsaus, jossa on kaksi vaihetta koulutuksessa vasemmalla ja live-generoinnissa oikealla, jossa saapuvat asennot verrataan aiempiin asentoihin ja yhdistetään viimeisiin kehyksiin, jotta jokainen uusi videoblokkeri voidaan tuottaa kolmessa vaiheessa. Lähde
Alkuperäinen Wan2.2-Animate on suunniteltu katsomaan koko sekvenssiä, eikä tuottamaan rajattomasti laajenevaa videota. Sen vuoksi tekijät jakauttivat koulutusvideot peräkkäisiin blokkeihin, joista jokainen tuotettiin aiempien blokkien avulla. Tämä opettaa mallille jatkumaan luotettavasta aiemmasta materiaalista, ennen kuin se joutuu selviytymään virheistä, jotka se on kertynyt omasta tuloksestaan.
Unohda minut ei
Koko prosessin ajan alkuperäinen viitekuva pidetään pysyvästi saatavilla “Ref Sink” -kautta, joka tarjoaa kiinteän muistutuksen henkilön identiteetistä ja ulkonäöstä. Kun blokkeri on valmis, “Clean KV Update” muuttaa tiedot, jotka on saatu siitä, historialliseksi kontekstiksi seuraaville blokeille (vaikka se ei korjaa olemassa olevia virheitä).
Tämä ensimmäinen koulutusvaihe edellyttää edelleen 50 denoising-vaihetta blokkeria kohden, mikä tekee live-toiminnan käytännössä mahdottomaksi. Toisessa vaiheessa prosessi tiivistyy kolmeen vaiheeseen, ja samalla malli altistetaan omalle generoimalleen historialle, koska käyttöönotossa jokaisen uuden segmentin on riippuvainen epätäydellisestä aiemmasta tuloksesta:
Kaksi koulutusvaihetta, joita käytetään LiveAnimate:n valmisteluun käyttöönottoa varten, ensin oppimalla puhdistetuista aiemmista videoblokeista – sitten vähentämällä generointiin kolmeen vaiheeseen, samalla kun malli koulutetaan omalle epätäydelliselle tulokselleen.
Koulutus näiden itsegeneroimien sekvenssien kanssa esittää toisen ongelman, koska koko videon laskennallisen historian säilyttäminen olisi kohtuuttoman kallista. Sen sijaan tehdään yksi täysi harjoitusajo, ja sitten se toistetaan, yksi blokkeri kerrallaan, koulutusta varten. Jokainen blokkeri voi siten saada päivityksen ilman pitämistä koko sekvenssiä laskennallisesti “elävänä”.
Yhdistettynä LoRA-sopeutumisen kanssa, tämä mahdollistaa 14-miljardin parametrin mallin tiivistämisen yhdelle solmulle, joka sisältää kahdeksan 80 GB H100 GPU:ta (huomautus: tämä klusteri on koulutusta varten, ei ajonaikaiselle inference:lle).
Älä lopeta nyt
Jatkuvaan generointiin LiveAnimate on myös määriteltävä, mitä on arvoa muistaa. Kaiken säilyttäminen kaikkea tekee laskennan vaatimukset kasvamaan hallitsemattomasti; mutta säilyttäminen vain viimeisimpiä kehyksiä saattaa myös hylätä hyödyllisiä aiempia näkymiä.
Sen vuoksi Pose-Retrieval Sink Attention (PR-Sink) ratkaisee tämän, säilyttämällä ensimmäisen generoidun blokin pysyvänä “Staattisen Sinkinä” – aiemman relevantin asennon, joka toimii korvattavana “Dynaamisen Sinkinä”, ja rullava ikkuna, joka sisältää nykyisen ja kaksi edellistä blokkia. Viitekuva pysyy erillään saatavilla Ref Sinkin kautta, kun taas kiinteät tallennustilakoot estävät kustannusten kasvamisen videon pituuden kasvaessa.
Blokkisota
Valitsemaan vanhempiin asentoihin tähän rajoitettuun muistiin, ViTPose vähentää kehon ja käden asennot kolmessa kehyksessä tiiviiksi edustukseksi. Muistipankki sisältää viisi tällaista edustusta, ja se täytetään ensimmäisten 20 blokin aikana, suosien monipuolisia asentoja lähikopioita vastaan.
Generoinnin aikana saapuva asento verrataan näihin edustajiin, ja lähin vastine haetaan, tarjoten aiemman todisteen siitä, miten henkilö näytti samanlaisessa asennossa. Kuitenkin, välittömästi edeltävä blokkeri on poissuljettu, koska se on jo rullavassa ikkunassa, jättäen Dynaamisen Sinkin vapaaksi noutamaan tietoa kauempaa.
Lopulta, itse ajonaikainen toiminta on optimoitu nopeutta varten jakamalla huomion käsittelyä kahden H100 GPU:n välillä, yhdistämällä viestinnän laskentaan ja uudelleenkäyttämällä välimuistitietoja, missä tahansa mahdollisessa.
Tiedot ja testit
LiveAnimate koulutettiin 40 000 puhuvasta videosta AVSpeech ja 20 000 ihmisen liikkeen videosta TikTok-aineistosta ja HumanVid, ja koulutus ja inference tukivat resoluutioita 480×480; 384×672; ja 672×384 pikseliä.
Koulutus aloitettiin Wan2.2-Animate-14B-pohjakohdasta, käyttäen LoRA:ta sijalla 128, ja se eteni kahdeksalla NVIDIA H100 GPU:lla 10 000 askelta ensimmäisessä vaiheessa ja 20 000 toisessa.
Video tuotettiin blokkeina, joissa oli kolme latenttia kehystä (mallin pakattu sisäinen edustus), jotka vastaavat 12 RGB-kehystä, kun taas inference suoritettiin kahdella H100:lla.
Arviointi vertasi LiveAnimatea olemassa oleviin pose-ohjattuihin ihmisen animaatiomenetelmiin sekä lyhyissä että pitkissä sekvensseissä, käyttäen viitekuvia ja ohjausasentoja yhdenmukaisissa asetuksissa. Pitkän aikavälin testit laajensivat generointia kolmeen minuuttiin tutkimaan, säilyykö laatu ja identiteetti vakaana ajan myötä.
Testatut kehykset olivat EverAnimate; One-to-All; SCAIL††; UniAnimate-DiT; ja Wan2.2-Animate.
Mittareina käytettiin visuaalista laatua, identiteetin jatkuvuutta, jakautumisen laatua ja aikasuhteellista edustusvirhettä. Esteettinen arvosana (ASE) ja viitearvon imagenlaatu (IQA) mitattiin kehykohtaisen visuaalisen laadun; DINO, samankaltaisuus (DINO-S), ja ulkonäön jatkuvuus viite-identiteetin kanssa; Fréchet Inception Distance (FID), jakautumisen laatu; ja VideoMAE-ominaisuus-etäisyys (V-MAE), miten hyvin generoitu video säilytti liikkeen ajan myötä:
Testitulokset, jotka liittyvät laatuun ja identiteettiin kolmen minuutin jatkuvassa generoinnissa, LiveAnimate säilyttää vertailukelpoisen vakaan kaikissa viidessä mittarissa, kun taas joitakin kilpailijoita havaitaan suurempi heikkeneminen ajan myötä. Korkeammat lukemat ovat parempia IQA:lle, ASE:lle ja DINO-S:lle, kun taas alhaisemmat lukemat ovat parempia FID:lle ja V-MAE:lle.
Kuten yllä olevasta alkuperäisestä tuloksista graafissa näkyy, LiveAnimate saavutti korkeimman alkuperäisen ASE-arvon 2,823 ja IQA-arvon 4,047 30 sekunnin aikana. Tekijät väittävät, että tämä osoittaa, että kolmen askelen tiivistäminen säilyttää havaintokyvyn, vaikka inference-budjetti on vähennetty.
Merkitsevämpää on, että LiveAnimate näytti vähän heikkenemistä kolmen minuutin jatkuvassa generoinnissa, ja sen visuaalisen laadun ja identiteetin jatkuvuuden arvosanat säilyivät lähes muuttumattomina.
Toisaalta, One-to-All heikkeni merkittävästi ajan myötä, ja sen visuaalinen laatu ja identiteetin jatkuvuus olivat alempia, ja jakautumisen virhe oli suurempi; ja alkuperäinen Wan2.2-Animate myös näytti jonkin verran identiteetin jatkuvuuden heikkenemistä.
Tekijät toteavat:
‘Nämä trendit tukevat väitettä, että pitkän aikavälin kontekstin hallitseminen on tärkeää suoratoistoa varten.’
LiveAnimate:n skaalautuvuus testattiin myös GPU:iden suhteen. Kuten alla osoitetaan, 12,41 fps saavutettiin yhdellä H100:lla; 19,63 fps kahdella; ja 22,13 fps neljällä, ja edut olivat yhä enemmän rajoitettuja viiveen vuoksi. Kaksi H100:aa valittiin siten suositelluksi konfiguraatioksi:
Skaalautuvuus yhdellä, kahdella ja neljällä H100 GPU:lla 480×480 resoluutiolla, jossa on viive, kehysnopeus, nopeus ja tehokkuus. Kaksi GPU:ta saavutti 19,63 fps, kun taas neljän GPU:n skaalautuminen tuotti vain kohtuullisen lisäyksen 22,13 fps:ään.
19,63 fps:n nopeudella jokainen 12-kehyksen blokkeri tuotettiin 0,611 sekunnissa. Vertailun vuoksi noin 2–5 tuntia vaadittiin kilpailevista järjestelmistä saman kolmen minuutin sekvenssin generointiin.
Laadukkaat testit osoittivat samanlaisia eroja: täyskehon testissä, joka on alla, havaittiin vakava heikkeneminen One-to-All:issa; UniAnimate-DiT ja SCAIL tuottivat vilkkuvaa; ja myöhemmin väri- tai taustan siirtymä tuli näkyviin Wan-Animate:lla ja EverAnimate:lla.
Testitulokset, jotka vertaavat täyskehon animaatiota kolmen minuutin ajan. Kehyksiä otettiin näyte joka 20 sekunnin välein, ja punaiset annotaatiot korostavat pitkän aikavälin heikkenemistä kilpailijoissa. Viittaa alkuperäiseen tutkimukseen paremman resoluution vuoksi.
LiveAnimate säilytti kohteen ulkonäön ja ympäröivän tilanteen koko kolmen minuutin sekvenssin ajan. Ylempänä olevassa vähemmän vaativassa ylävartalotestissä verrattavissa pitkän aikavälin vakaata tulosta saavutettiin EverAnimate:lla ja LiveAnimate:lla (vaikka reaaliaikainen generointi oli tarjolla vain LiveAnimate:lla):

Testitulokset, jotka vertaavat ylävartaloon animaatiota kolmen minuutin ajan. Kehyksiä otettiin näyte joka 20 sekunnin välein, ja LiveAnimate säilytti kohteen identiteetin, vaatetus ja tumman taustan yhdenmukaisemmin kuin kilpailijat.
Tekijät toteavat:
‘Kolmen minuutin mittapuulla LiveAnimate ylläpitää lähes vakaata havaintokykyä ja identiteettiä 19,63 fps:n nopeudella kahdella H100 GPU:lla, ja muisti ja viive eivät riipu suoratoiston kestosta, kun taas offline-vertailukohtina heikkenevät näkyvästi tai vaativat useita tunteja laskentaa.
‘Nämä tulokset tuovat miljardiluokan videon difuusiomallit interaktiivisten sovellusten, kuten live-streamingin, telepresence:n ja virtuaalihahmojen, ulottuvilla.’
Johtopäätös
On rohkaisevaa nähdä, kuinka ohjattu generointijärjestelmä lähestyy jatkuvasti ongelmia, jotka vaivaavat generoivaa videota. On jo monia generoivaa kehyksiä, jotka voivat viitata kiinteään kuvamateriaaliin, jonka käyttäjä on toimittanut, ilman tarvetta “liimata” viitekuvaa olennaiseen kuvasta-videoksi.
Kuitenkin tämä ratkaisee vain osan yhden videoklipin generoimiseen liittyvistä ongelmista, kuten identiteetin (mukaan lukien vaatetus ja hiusten tyyli) säilyttämistä, kun henkilö poistuu ruudusta, ja sitten tulee näkyviin uudelleen. Tähän asti vain raskas ja tilapäinen LoRA-lähestymistapa on tehnyt edistystä näissä asioissa, vaikka se on rajoitettua ja väliaikaista.
Videoa ja, tosiasiassa, koko nykyistä tekoälyvallankumousta, tehokkaan pysyvän muistin kehittäminen on kriittinen, olemassaoleva kysymys – yksi, joka todennäköisesti määrittää eroa tekoälyn yleisen älymystön saavuttamisen ja kolmannen tekoälytalven välillä.
* Onko tämä enää “huijaus”? Nykyinen ajattelu on, että pienemmät erikoistuneet mallit voivat lopulta toimia paikallisesti, ilman vuokraa, kun taas korkeammat tarpeet palvelevat kilpailukykyistä ja toivottavasti hajanaisesta GPU-vuokramarkkinasta. Tämä olettaa, että eturintamayritykset eivät EEE kilpailua, ja että merkittävää GPU-laskentaa on edelleen saatavilla riippumatta siitä. Tällä perusteella en enää pidä äärimmäisiä GPU-vaatimuksia moitteen aiheena, vaan toivon, että pääsy muodostuu yhä demokraattisemmaksi, ja myöhemmät optimoinnit vähentävät alkuperäisiä resursseja.
† AI-generoitu ja tarkistettu itse.
†† Pitkän videon testaamiseksi SCAIL ja UniAnimate-DiT laajennettiin samalla koulutusvapaalla liukuvalla ikkunamenetelmällä, koska kumpikaan ei tukenut alun perin pitkän aikavälin generointia. EverAnimate ja One-to-All arvioitiin omilla pitkän videon generointimenetelmillään.
Julkaistu ensimmäisen kerran torstaina, 13. elokuuta 2026












