Andersonin kulma
Parempi generatiivinen tekoälyvideo kehysjen sekoittamalla koulutuksen aikana

Uusi tutkimusjulkaisu tuli ulos tällä viikolla Arxivissa, ja se käsittelee ongelmaa, johon kuka tahansa, joka on omaksunut Hunyuan Video tai Wan 2.1 -tekoälyvideojen generoijat, on jo nyt törmännyt: temporaaliset aberrationit, joissa generatiivinen prosessi taipuu äkkiä nopeutumaan, yhdistämään, jättämään pois tai muutenkaan sekostamaan tärkeitä hetkiä generoidussa videossa:
Klikkaa toistamaan. Jotkut temporaaliset viat, jotka ovat tulleet tutuksi uusien generatiivisten videosystemien käyttäjille, korostettuina uudessa tutkimusjulkaisussa. Oikealla on uuden FluxFlow-lähestymistavan parantava vaikutus. Lähde: https://haroldchen19.github.io/FluxFlow/
Yllä oleva video sisältää otteita esimerkkitestivideoista (varoitus: melko kaoottinen) tutkimusjulkaisun sivustolta. Voimme nähdä useita yhä tutumpia ongelmia, joita tutkijoiden menetelmä (kuvattu oikealla videossa) parantaa, ja joka on käytännössä datasetin esikäsittelytekniikka, jota voidaan soveltaa mihin tahansa generatiiviseen videoarkkitehtuuriin.
Ensimmäisessä esimerkissä, jossa on “kaksi lasta leikkimässä pallolla”, generoitu CogVideoX:llä, näemme (vasemmalla yhdistetyssä videossa ja erityisesti alla olevassa esimerkissä), että alkuperäinen generointi hyppää nopeasti useiden olennaisen mikroliikkeiden läpi, nopeuttaen lasten toimintaa “piirroselokuva”-tahtiin. Sen sijaan sama tietojoukko ja menetelmä tuottavat parempia tuloksia uuden esikäsittelytekniikan, jota kutsutaan FluxFlow:ksi (oikealla alla olevassa kuvassa):
Klikkaa toistamaan
Toisessa esimerkissä (jossa käytetään NOVA-0.6B:a) näemme, että keskeinen liike, jossa kissa on, on jollain tavoin vioittunut tai merkittävästi alikäytetty koulutusvaiheessa, jolloin generatiivinen järjestelmä “jäätää” ja ei pysty liikuttamaan kohteena olevaa eläintä:
Klikkaa toistamaan
Tämä oireyhtymä, jossa liike tai kohde “jäätää”, on yksi yleisimmin ilmoitettu ongelmista HV:lle ja Wan 2.1:lle erilaisissa kuvan- ja videosynteesiryhmissä.
Jotkut näistä ongelmista liittyvät videojen kuvaukseen aiheutuvista ongelmista alkuperäisessä tietojoukossa, joihin tutustumme tällä viikolla; mutta tutkimuksen tekijät keskittyvät pyrkimyksissään koulutusdatan temporaalisiin laatuun ja esittävät vakuuttavan argumentin, jonka mukaan haasteiden ratkaiseminen tältä osin voi tuottaa hyödyllisiä tuloksia.
Kuten mainittiin aiemmassa artikkelissa videoiden kuvauksesta, tietyt urheilulajit ovat erityisen hankalia tiivistettäväksi avainhetkiin, jolloin kriittiset tapahtumat (kuten dunk) eivät saa tarvitsemaansa huomiota koulutusvaiheessa:
Klikkaa toistamaan
Yllä olevassa esimerkissä generatiivinen järjestelmä ei tiedä, miten siirtyä seuraavaan liikkeen vaiheeseen, ja siirtyy epäloogisesti yhdestä asennosta toiseen, muuttaen pelaajan asennetta ja geometriaa prosessissa.
Nämä ovat suuria liikkeitä, jotka hävisivät koulutuksessa – mutta yhtä haavoittuvia ovat paljon pienemmät, mutta ratkaisevat liikkeet, kuten perhosen siipien flapatus:
Klikkaa toistamaan.
Ero dunkiin, joka ei ole “harvinainen” vaan pikemminkin pysyvä ja yksitoikkoinen tapahtuma, sen johdonmukaisuus häviää näytteenottoprosessissa, koska liike on niin nopea, että on erittäin vaikea vakiinnuttaa temporaalisesti.
Nämä eivät ole erityisen uusia ongelmia, mutta ne saavat enemmän huomiota nyt, kun voimakkaita generatiivisia videoalueita on saatavilla harrastajille paikalliseen asennukseen ja ilmaiseen generointiin.
Reddit- ja Discord-yhteisöt ovat aluksi kohdelleet näitä ongelmia “käyttäjien ongelmina”. Tämä on ymmärrettävä oletus, koska kyseessä olevat järjestelmät ovat erittäin uusia ja vähän dokumentoituja. Siksi erilaiset asiantuntijat ovat ehdottaneet erilaisia (ja ei aina tehokkaita) korjauskeinoja joillekin näistä viroista, kuten muuttamalla eri komponenttien asetuksia erilaisissa ComfyUI-työvirroissa Hunyuan Video (HV) ja Wan 2.1:lle.
Joissakin tapauksissa HV ja Wan eivät tuota nopeaa liikettä, vaan “hitautta”. Ehdotuksia Redditistä ja ChatGPT:stä (joka hyödyntää pääasiassa Redditin tietoja) ovat mm. muuttaminen pyydetyssä generoinnissa olevien kehysjen määrää tai radikaalisti laskemalla kehysnopeutta*.
Tämä on kaikki epätoivottua; nouseva totuus on, että emme vielä tiedä täsmällistä syytä tai täsmällistä parannuskeinoa näihin ongelmiin; ilmiselvästi, kiusaaminen generointiasetuksilla työskentelemällä niiden ympärillä (erityisesti kun se heikentää tulosteen laatua, esim. liian alhaisella fps-luvulla) on vain väliaikainen ratkaisu, ja on hyvä nähdä, että tutkimusala on ottamassa nopeasti käsiteltäväkseen nousevia ongelmia.
Joten, tämän viikon katselun lisäksi videoiden kuvauksesta, otetaanpa tarkastelukohteeksi uusi tutkimusjulkaisu temporaalisen säännöllistämisen parantamisesta, ja mitä parannuksia se voi tarjota nykyiselle generatiiviselle videoalueelle.
Keskeinen idea on yksinkertainen ja hieman, ja se ei ole huonompi siitä; kuitenkin tutkimusjulkaisu on jonkin verran täytelty saavuttaakseen määrätyn kahdeksan sivun, ja me ohitamme tämän täytteilyn tarpeen mukaan.

Kala alkuperäisessä VideoCrafter-kehyksessä on staattinen, kun taas FluxFlow-muokattu versio havaitsee vaaditut muutokset. Lähde: https://arxiv.org/pdf/2503.15417
Uusi tutkimusjulkaisu on nimeltään Temporaalinen säännöllistäminen tekee videogeneraattoristasi vahvemman, ja se on peräisin kahdeksalta tutkijalta Everlyn AI:sta, Hong Kongin tiede- ja teknologiayliopistosta (HKUST), Floridan keskisyliopistosta (UCF) ja Hong Kongin yliopistosta (HKU).
(julkaisun sivustolla on tällä hetkellä joitakin ongelmia)
FluxFlow
FluxFlow:n keskeinen idea, tutkijoiden uusi esikoulutuskaava, on voittaa yleiset ongelmat vilkkuvuus ja temporaalinen epäjohdonmukaisuus sekoittamalla kehyksiä ja kehysryhmiä temporaalisen kehysjärjestyksen aikana, kun lähdeaineisto altistetaan koulutusprosessille:

FluxFlow:n keskeinen idea on siirtää kehyksiä ja kehysryhmiä odottamattomiin ja epätemporaalisiin asemiin, tietojen täydentämisen muodossa.
Tutkimusjulkaisu selittää:
‘(Virheet) johtuvat perustavanlaatuisesta rajoituksesta: vaikka hyödyntäen laajamittaisia tietoja, nykyiset mallit usein nojaavat yksinkertaisiin temporaalisiin malleihin koulutusaineistossa (esim. kiinteät kävelyohjeet tai toistuvat kehyssiirtymät) eivätkä opi moninaisia ja uskottavia temporaalisia dynaamikoita.
‘Tämä ongelma on edelleen pahentunut puuttuvasta eksplisiittisestä temporaalisesta täydentämisestä koulutuksen aikana, jolloin mallit ovat alttiita ylilukuun epäilyttäville temporaalisiin korrelaatioille (esim. “kehys #5 on seurattava #4:lle”) eivätkä yleisty moninaisiin liiketilanteisiin. ‘
Useimmat videogeneraattorit, tutkijat selittävät, ovat edelleen liian voimakkaasti riippuvaisia kuvansynteesistä, keskittyen paikkatarkkuuteen ja lähes laiminlyöden temporaalisen akselin. Vaikka tekniikat, kuten rajaus, kääntäminen ja värijäykä, ovat parantaneet staattisen kuvan laatua, ne eivät ole riittäviä ratkaisuja, kun sovelletaan videoihin, joissa liikkeen illusio riippuu johdonmukaisista siirtymistä kehyksistä.
Klikkaa toistamaan.
Tutkimusjulkaisu väittää, että vaikka jotkut mallit – kuten Stable Video Diffusion ja LlamaGen – korvaavat yhä monimutkaisemmilla arkkitehtuureilla tai suunnitelluilla rajoituksilla, nämä tulevat kustannuksella laskentakapasiteetissa ja joustavuudessa.
Koska temporaalinen datatäydentäminen on jo osoittanut olevan hyödyllistä videoiden ymmärtämisessä (esim. FineCliper, SeFAR ja SVFormer), on yllättävää, että tätä taktiikkaa sovelletaan harvoin generatiivisessa kontekstissa.
Häiritsevä käyttäytyminen
Tutkijat väittävät, että yksinkertaiset, rakenteelliset häiriöt temporaalisessa järjestyksessä koulutuksen aikana auttavat malleja yleistymään paremmin realistisiin, moninaisiin liikkeisiin:
‘Koulutusjärjestyksen häiriintymisen avulla generoija oppii palauttamaan uskottavia trajektoreita, jolloin temporaalinen entropia säännöllistyy. FLUXFLOW siltaa kuilun diskriinisen ja generatiivisen temporaalisen täydentämisen välillä, tarjoten helpon parannusratkaisun temporaalisesti uskottavalle videogeneroinnille ja parantaen yleistä laatua.
‘Eroaessaan olemassa olevista menetelmistä, jotka esittävät arkkitehtonisia muutoksia tai turvautuvat jälkikäsittelyyn, FLUXFLOW toimii suoraan datatasolla, jolloin koulutuksessa voidaan esittää ohjattuja temporaalisia häiriöitä.’
Klikkaa toistamaan.
Kehyskohtaiset häiriöt, tutkijat toteavat, esittävät hienojakoisia häiriöitä jonon sisällä. Tämä häiriintyminen ei ole juuri erilainen kuin maski-täydentäminen, jossa tietojen osia estetään satunnaisesti, jotta järjestelmä ei ylitoteutu tietopisteisiin ja jotta se kannustaa yleistymistä.
Testit
Vaikka keskeinen idea ei olekaan täysimittainen tutkimusjulkaisu, sen yksinkertaisuudesta huolimatta, on kokeiden osio, jota voimme tarkastella.
Tutkijat testasivat neljää kysymystä, jotka liittyvät parantuneeseen temporaaliseen laatuun säilyttäen paikkatarkkuuden; kykyyn oppia liikkeen/optisen virtauksen dynamiikkaa; ylläpitämään temporaalista laatua ekstratemporaalisessa generoinnissa; ja herkkyyteen avainhyperparametrejä kohtaan.
Tutkijat sovelsivat FluxFlow:ia kolmeen generatiiviseen arkkitehtuuriin: U-Net-pohjaiseen, VideoCrafter2:ssa; DiT-pohjaiseen, CogVideoX-2B:ssa; ja AR-pohjaiseen, NOVA-0.6B:ssa.
Reilun vertailun vuoksi he hienosäätivät arkkitehtuurien perusmalleja FluxFlow:lla yhden epokin ajan, OpenVidHD-0.4M-tietojoukossa.
Malleja arvioitiin kahden suosittujen vertailujen perusteella: UCF-101; ja VBench.
UCF:lle Fréchet Video Distance (FVD) ja Inception Score (IS) -mittareita käytettiin. VBench:lle tutkijat keskittyivät temporaaliseen laatuun, kehyskohtaiseen laatuun ja yleiseen laatuun.

FluxFlow-kehyksen alustava kvantitatiivinen arviointi. "+ Alkuperäinen" osoittaa koulutusta ilman FLUXFLOW:ia, kun taas "+ Num × 1" osoittaa eri FluxFlow-kehyksen konfiguraatioita. Parhaat tulokset on varjostettu; toiseksi parhaat on alleviivattu kunkin mallin kohdalla.
Tutkijat kommentoivat näistä tuloksista:
‘Molemmat FLUXFLOW-FRAME ja FLUXFLOW-BLOCK parantavat merkittävästi temporaalista laatua, kuten mitattu Tab. 1, 2 (ts. FVD, Aihe, Vilkkuvuus, Liike, Dynaaminen) ja laadulliset tulokset [kuva alla].
‘Esimerkiksi liike, jossa autoa ajavaa miestä VC2:ssa, kissa, joka jahtaa häntäänsä NOVAssa, ja surffaaja, joka ajelee aalloilla CVX:ssa, tulevat selvästi sulavammiksi FLUXFLOW:n avulla. Tärkeää on, että nämä temporaaliset parannukset saavutetaan ilman paikkatarkkuuden uhraamista, kuten veden loiskeiden, savujen ja aaltojen terävät yksityiskohdat sekä paikkatarkkuuden ja yleisen tarkkuuden mittareiden osoittavat.’
Alla näemme valikoiman laadullisista tuloksista, joista tutkijat puhuvat (katso alkuperäinen tutkimusjulkaisu täydellisille tuloksille ja paremmalle resoluutiolle):

Valikoima laadullisista tuloksista.
Tutkimusjulkaisu ehdottaa, että vaikka sekä kehys- että lohko-tason häiriöt parantavat temporaalista laatua, kehys-kohtaiset menetelmät suorittavat yleensä paremmin. Tämä johtuu niiden hienojakoisemmasta granulaarisuudesta, joka mahdollistaa tarkemmat temporaaliset säätötoimenpiteet. Lohko-kohtaiset häiriöt, toisaalta, voivat esittää melua johtuen tiiviisti kytketyistä paikallisista ja temporaalisista malleista lohkojen sisällä, mikä vähentää niiden tehokkuutta.
Johtopäätös
Tämä tutkimusjulkaisu, yhdessä Bytedance-Tsinghuan kuvauksen yhteistyön kanssa, joka julkaistiin tällä viikolla, on osoittanut minulle, että uusimpien generatiivisten videomallien ilmeiset puutteet eivät välttämättä johtuisi käyttäjän virheestä, institutionaalisten epäonnistumisten tai rahoitusrajoitusten vuoksi, vaan tutkimuksen painopisteen priorisoinnista, joka on ymmärrettävästi priorisoinut kiireellisempiä haasteita, kuten temporaalista koherenttia ja johdonmukaisuutta, näiden vähäisempien huolenaiheiden sijaan.
Kun uusimmat generatiiviset videomallit ovat vielä niin lähellä todella fotorealistista videotuotantoa, on ilmeistä, että sekä tutkimus- että harrastajayhteisöt ovat kiinnostuneita ratkaisemaan jäljellä olevat ongelmat; toivottavasti nämä eivät ole ratkaisemattomia esteitä.
* Wanin alkuperäinen kehysnopeus on vaatimaton 16fps, ja vastauksena omiin ongelmiini, huomautan, että foorumit ovat ehdottaneet kehysnopeuden laskemista jopa 12fps:ään, ja sitten käyttämistä FlowFrames:ia tai muita tekoälypohjaisia uudelleenvirtausjärjestelmiä aukkojen interpolointiin niin niukasti kehyksiä.
Julkaistu ensimmäisen kerran perjantaina, 21. maaliskuuta 2025












