Andersonin kulma
Parempi generatiivinen tekoÃĪlyvideo kehysjen sekoittamalla koulutuksen aikana

Uusi tutkimusjulkaisu tuli ulos tÃĪllÃĪ viikolla Arxivissa, ja se kÃĪsittelee ongelmaa, johon kuka tahansa, joka on omaksunut Hunyuan Video tai Wan 2.1 -tekoÃĪlyvideojen generoijat, on jo nyt tÃķrmÃĪnnyt: temporaaliset aberrationit, joissa generatiivinen prosessi taipuu ÃĪkkiÃĪ nopeutumaan, yhdistÃĪmÃĪÃĪn, jÃĪttÃĪmÃĪÃĪn pois tai muutenkaan sekostamaan tÃĪrkeitÃĪ hetkiÃĪ generoidussa videossa:
Klikkaa toistamaan. Jotkut temporaaliset viat, jotka ovat tulleet tutuksi uusien generatiivisten videosystemien kÃĪyttÃĪjille, korostettuina uudessa tutkimusjulkaisussa. Oikealla on uuden FluxFlow-lÃĪhestymistavan parantava vaikutus. LÃĪhde: https://haroldchen19.github.io/FluxFlow/
YllÃĪ oleva video sisÃĪltÃĪÃĪ otteita esimerkkitestivideoista (varoitus: melko kaoottinen) tutkimusjulkaisun sivustolta. Voimme nÃĪhdÃĪ useita yhÃĪ tutumpia ongelmia, joita tutkijoiden menetelmÃĪ (kuvattu oikealla videossa) parantaa, ja joka on kÃĪytÃĪnnÃķssÃĪ datasetin esikÃĪsittelytekniikka, jota voidaan soveltaa mihin tahansa generatiiviseen videoarkkitehtuuriin.
EnsimmÃĪisessÃĪ esimerkissÃĪ, jossa on âkaksi lasta leikkimÃĪssÃĪ pallollaâ, generoitu CogVideoX:llÃĪ, nÃĪemme (vasemmalla yhdistetyssÃĪ videossa ja erityisesti alla olevassa esimerkissÃĪ), ettÃĪ alkuperÃĪinen generointi hyppÃĪÃĪ nopeasti useiden olennaisen mikroliikkeiden lÃĪpi, nopeuttaen lasten toimintaa âpiirroselokuvaâ-tahtiin. Sen sijaan sama tietojoukko ja menetelmÃĪ tuottavat parempia tuloksia uuden esikÃĪsittelytekniikan, jota kutsutaan FluxFlow:ksi (oikealla alla olevassa kuvassa):
Klikkaa toistamaan
Toisessa esimerkissÃĪ (jossa kÃĪytetÃĪÃĪn NOVA-0.6B:a) nÃĪemme, ettÃĪ keskeinen liike, jossa kissa on, on jollain tavoin vioittunut tai merkittÃĪvÃĪsti alikÃĪytetty koulutusvaiheessa, jolloin generatiivinen jÃĪrjestelmÃĪ âjÃĪÃĪtÃĪÃĪâ ja ei pysty liikuttamaan kohteena olevaa elÃĪintÃĪ:
Klikkaa toistamaan
TÃĪmÃĪ oireyhtymÃĪ, jossa liike tai kohde âjÃĪÃĪtÃĪÃĪâ, on yksi yleisimmin ilmoitettu ongelmista HV:lle ja Wan 2.1:lle erilaisissa kuvan- ja videosynteesiryhmissÃĪ.
Jotkut nÃĪistÃĪ ongelmista liittyvÃĪt videojen kuvaukseen aiheutuvista ongelmista alkuperÃĪisessÃĪ tietojoukossa, joihin tutustumme tÃĪllÃĪ viikolla; mutta tutkimuksen tekijÃĪt keskittyvÃĪt pyrkimyksissÃĪÃĪn koulutusdatan temporaalisiin laatuun ja esittÃĪvÃĪt vakuuttavan argumentin, jonka mukaan haasteiden ratkaiseminen tÃĪltÃĪ osin voi tuottaa hyÃķdyllisiÃĪ tuloksia.
Kuten mainittiin aiemmassa artikkelissa videoiden kuvauksesta, tietyt urheilulajit ovat erityisen hankalia tiivistettÃĪvÃĪksi avainhetkiin, jolloin kriittiset tapahtumat (kuten dunk) eivÃĪt saa tarvitsemaansa huomiota koulutusvaiheessa:
Klikkaa toistamaan
YllÃĪ olevassa esimerkissÃĪ generatiivinen jÃĪrjestelmÃĪ ei tiedÃĪ, miten siirtyÃĪ seuraavaan liikkeen vaiheeseen, ja siirtyy epÃĪloogisesti yhdestÃĪ asennosta toiseen, muuttaen pelaajan asennetta ja geometriaa prosessissa.
NÃĪmÃĪ ovat suuria liikkeitÃĪ, jotka hÃĪvisivÃĪt koulutuksessa â mutta yhtÃĪ haavoittuvia ovat paljon pienemmÃĪt, mutta ratkaisevat liikkeet, kuten perhosen siipien flapatus:
Klikkaa toistamaan.
Ero dunkiin, joka ei ole âharvinainenâ vaan pikemminkin pysyvÃĪ ja yksitoikkoinen tapahtuma, sen johdonmukaisuus hÃĪviÃĪÃĪ nÃĪytteenottoprosessissa, koska liike on niin nopea, ettÃĪ on erittÃĪin vaikea vakiinnuttaa temporaalisesti.
NÃĪmÃĪ eivÃĪt ole erityisen uusia ongelmia, mutta ne saavat enemmÃĪn huomiota nyt, kun voimakkaita generatiivisia videoalueita on saatavilla harrastajille paikalliseen asennukseen ja ilmaiseen generointiin.
Reddit- ja Discord-yhteisÃķt ovat aluksi kohdelleet nÃĪitÃĪ ongelmia âkÃĪyttÃĪjien ongelminaâ. TÃĪmÃĪ on ymmÃĪrrettÃĪvÃĪ oletus, koska kyseessÃĪ olevat jÃĪrjestelmÃĪt ovat erittÃĪin uusia ja vÃĪhÃĪn dokumentoituja. Siksi erilaiset asiantuntijat ovat ehdottaneet erilaisia (ja ei aina tehokkaita) korjauskeinoja joillekin nÃĪistÃĪ viroista, kuten muuttamalla eri komponenttien asetuksia erilaisissa ComfyUI-tyÃķvirroissa Hunyuan Video (HV) ja Wan 2.1:lle.
Joissakin tapauksissa HV ja Wan eivÃĪt tuota nopeaa liikettÃĪ, vaan âhitauttaâ. Ehdotuksia RedditistÃĪ ja ChatGPT:stÃĪ (joka hyÃķdyntÃĪÃĪ pÃĪÃĪasiassa Redditin tietoja) ovat mm. muuttaminen pyydetyssÃĪ generoinnissa olevien kehysjen mÃĪÃĪrÃĪÃĪ tai radikaalisti laskemalla kehysnopeutta*.
TÃĪmÃĪ on kaikki epÃĪtoivottua; nouseva totuus on, ettÃĪ emme vielÃĪ tiedÃĪ tÃĪsmÃĪllistÃĪ syytÃĪ tai tÃĪsmÃĪllistÃĪ parannuskeinoa nÃĪihin ongelmiin; ilmiselvÃĪsti, kiusaaminen generointiasetuksilla tyÃķskentelemÃĪllÃĪ niiden ympÃĪrillÃĪ (erityisesti kun se heikentÃĪÃĪ tulosteen laatua, esim. liian alhaisella fps-luvulla) on vain vÃĪliaikainen ratkaisu, ja on hyvÃĪ nÃĪhdÃĪ, ettÃĪ tutkimusala on ottamassa nopeasti kÃĪsiteltÃĪvÃĪkseen nousevia ongelmia.
Joten, tÃĪmÃĪn viikon katselun lisÃĪksi videoiden kuvauksesta, otetaanpa tarkastelukohteeksi uusi tutkimusjulkaisu temporaalisen sÃĪÃĪnnÃķllistÃĪmisen parantamisesta, ja mitÃĪ parannuksia se voi tarjota nykyiselle generatiiviselle videoalueelle.
Keskeinen idea on yksinkertainen ja hieman, ja se ei ole huonompi siitÃĪ; kuitenkin tutkimusjulkaisu on jonkin verran tÃĪytelty saavuttaakseen mÃĪÃĪrÃĪtyn kahdeksan sivun, ja me ohitamme tÃĪmÃĪn tÃĪytteilyn tarpeen mukaan.

Kala alkuperÃĪisessÃĪ VideoCrafter-kehyksessÃĪ on staattinen, kun taas FluxFlow-muokattu versio havaitsee vaaditut muutokset. LÃĪhde: https://arxiv.org/pdf/2503.15417
Uusi tutkimusjulkaisu on nimeltÃĪÃĪn Temporaalinen sÃĪÃĪnnÃķllistÃĪminen tekee videogeneraattoristasi vahvemman, ja se on perÃĪisin kahdeksalta tutkijalta Everlyn AI:sta, Hong Kongin tiede- ja teknologiayliopistosta (HKUST), Floridan keskisyliopistosta (UCF) ja Hong Kongin yliopistosta (HKU).
(julkaisun sivustolla on tÃĪllÃĪ hetkellÃĪ joitakin ongelmia)
FluxFlow
FluxFlow:n keskeinen idea, tutkijoiden uusi esikoulutuskaava, on voittaa yleiset ongelmat vilkkuvuus ja temporaalinen epÃĪjohdonmukaisuus sekoittamalla kehyksiÃĪ ja kehysryhmiÃĪ temporaalisen kehysjÃĪrjestyksen aikana, kun lÃĪhdeaineisto altistetaan koulutusprosessille:

FluxFlow:n keskeinen idea on siirtÃĪÃĪ kehyksiÃĪ ja kehysryhmiÃĪ odottamattomiin ja epÃĪtemporaalisiin asemiin, tietojen tÃĪydentÃĪmisen muodossa.
Tutkimusjulkaisu selittÃĪÃĪ:
â(Virheet) johtuvat perustavanlaatuisesta rajoituksesta: vaikka hyÃķdyntÃĪen laajamittaisia tietoja, nykyiset mallit usein nojaavat yksinkertaisiin temporaalisiin malleihin koulutusaineistossa (esim. kiinteÃĪt kÃĪvelyohjeet tai toistuvat kehyssiirtymÃĪt) eivÃĪtkÃĪ opi moninaisia ja uskottavia temporaalisia dynaamikoita.
âTÃĪmÃĪ ongelma on edelleen pahentunut puuttuvasta eksplisiittisestÃĪ temporaalisesta tÃĪydentÃĪmisestÃĪ koulutuksen aikana, jolloin mallit ovat alttiita ylilukuun epÃĪilyttÃĪville temporaalisiin korrelaatioille (esim. âkehys #5 on seurattava #4:lleâ) eivÃĪtkÃĪ yleisty moninaisiin liiketilanteisiin. â
Useimmat videogeneraattorit, tutkijat selittÃĪvÃĪt, ovat edelleen liian voimakkaasti riippuvaisia kuvansynteesistÃĪ, keskittyen paikkatarkkuuteen ja lÃĪhes laiminlyÃķden temporaalisen akselin. Vaikka tekniikat, kuten rajaus, kÃĪÃĪntÃĪminen ja vÃĪrijÃĪykÃĪ, ovat parantaneet staattisen kuvan laatua, ne eivÃĪt ole riittÃĪviÃĪ ratkaisuja, kun sovelletaan videoihin, joissa liikkeen illusio riippuu johdonmukaisista siirtymistÃĪ kehyksistÃĪ.
Klikkaa toistamaan.
Tutkimusjulkaisu vÃĪittÃĪÃĪ, ettÃĪ vaikka jotkut mallit â kuten Stable Video Diffusion ja LlamaGen â korvaavat yhÃĪ monimutkaisemmilla arkkitehtuureilla tai suunnitelluilla rajoituksilla, nÃĪmÃĪ tulevat kustannuksella laskentakapasiteetissa ja joustavuudessa.
Koska temporaalinen datatÃĪydentÃĪminen on jo osoittanut olevan hyÃķdyllistÃĪ videoiden ymmÃĪrtÃĪmisessÃĪ (esim. FineCliper, SeFAR ja SVFormer), on yllÃĪttÃĪvÃĪÃĪ, ettÃĪ tÃĪtÃĪ taktiikkaa sovelletaan harvoin generatiivisessa kontekstissa.
HÃĪiritsevÃĪ kÃĪyttÃĪytyminen
Tutkijat vÃĪittÃĪvÃĪt, ettÃĪ yksinkertaiset, rakenteelliset hÃĪiriÃķt temporaalisessa jÃĪrjestyksessÃĪ koulutuksen aikana auttavat malleja yleistymÃĪÃĪn paremmin realistisiin, moninaisiin liikkeisiin:
âKoulutusjÃĪrjestyksen hÃĪiriintymisen avulla generoija oppii palauttamaan uskottavia trajektoreita, jolloin temporaalinen entropia sÃĪÃĪnnÃķllistyy. FLUXFLOW siltaa kuilun diskriinisen ja generatiivisen temporaalisen tÃĪydentÃĪmisen vÃĪlillÃĪ, tarjoten helpon parannusratkaisun temporaalisesti uskottavalle videogeneroinnille ja parantaen yleistÃĪ laatua.
âEroaessaan olemassa olevista menetelmistÃĪ, jotka esittÃĪvÃĪt arkkitehtonisia muutoksia tai turvautuvat jÃĪlkikÃĪsittelyyn, FLUXFLOW toimii suoraan datatasolla, jolloin koulutuksessa voidaan esittÃĪÃĪ ohjattuja temporaalisia hÃĪiriÃķitÃĪ.â
Klikkaa toistamaan.
Kehyskohtaiset hÃĪiriÃķt, tutkijat toteavat, esittÃĪvÃĪt hienojakoisia hÃĪiriÃķitÃĪ jonon sisÃĪllÃĪ. TÃĪmÃĪ hÃĪiriintyminen ei ole juuri erilainen kuin maski-tÃĪydentÃĪminen, jossa tietojen osia estetÃĪÃĪn satunnaisesti, jotta jÃĪrjestelmÃĪ ei ylitoteutu tietopisteisiin ja jotta se kannustaa yleistymistÃĪ.
Testit
Vaikka keskeinen idea ei olekaan tÃĪysimittainen tutkimusjulkaisu, sen yksinkertaisuudesta huolimatta, on kokeiden osio, jota voimme tarkastella.
Tutkijat testasivat neljÃĪÃĪ kysymystÃĪ, jotka liittyvÃĪt parantuneeseen temporaaliseen laatuun sÃĪilyttÃĪen paikkatarkkuuden; kykyyn oppia liikkeen/optisen virtauksen dynamiikkaa; yllÃĪpitÃĪmÃĪÃĪn temporaalista laatua ekstratemporaalisessa generoinnissa; ja herkkyyteen avainhyperparametrejÃĪ kohtaan.
Tutkijat sovelsivat FluxFlow:ia kolmeen generatiiviseen arkkitehtuuriin: U-Net-pohjaiseen, VideoCrafter2:ssa; DiT-pohjaiseen, CogVideoX-2B:ssa; ja AR-pohjaiseen, NOVA-0.6B:ssa.
Reilun vertailun vuoksi he hienosÃĪÃĪtivÃĪt arkkitehtuurien perusmalleja FluxFlow:lla yhden epokin ajan, OpenVidHD-0.4M-tietojoukossa.
Malleja arvioitiin kahden suosittujen vertailujen perusteella: UCF-101; ja VBench.
UCF:lle FrÃĐchet Video Distance (FVD) ja Inception Score (IS) -mittareita kÃĪytettiin. VBench:lle tutkijat keskittyivÃĪt temporaaliseen laatuun, kehyskohtaiseen laatuun ja yleiseen laatuun.

FluxFlow-kehyksen alustava kvantitatiivinen arviointi. "+ AlkuperÃĪinen" osoittaa koulutusta ilman FLUXFLOW:ia, kun taas "+ Num à 1" osoittaa eri FluxFlow-kehyksen konfiguraatioita. Parhaat tulokset on varjostettu; toiseksi parhaat on alleviivattu kunkin mallin kohdalla.
Tutkijat kommentoivat nÃĪistÃĪ tuloksista:
âMolemmat FLUXFLOW-FRAME ja FLUXFLOW-BLOCK parantavat merkittÃĪvÃĪsti temporaalista laatua, kuten mitattu Tab. 1, 2 (ts. FVD, Aihe, Vilkkuvuus, Liike, Dynaaminen) ja laadulliset tulokset [kuva alla].
âEsimerkiksi liike, jossa autoa ajavaa miestÃĪ VC2:ssa, kissa, joka jahtaa hÃĪntÃĪÃĪnsÃĪ NOVAssa, ja surffaaja, joka ajelee aalloilla CVX:ssa, tulevat selvÃĪsti sulavammiksi FLUXFLOW:n avulla. TÃĪrkeÃĪÃĪ on, ettÃĪ nÃĪmÃĪ temporaaliset parannukset saavutetaan ilman paikkatarkkuuden uhraamista, kuten veden loiskeiden, savujen ja aaltojen terÃĪvÃĪt yksityiskohdat sekÃĪ paikkatarkkuuden ja yleisen tarkkuuden mittareiden osoittavat.â
Alla nÃĪemme valikoiman laadullisista tuloksista, joista tutkijat puhuvat (katso alkuperÃĪinen tutkimusjulkaisu tÃĪydellisille tuloksille ja paremmalle resoluutiolle):

Valikoima laadullisista tuloksista.
Tutkimusjulkaisu ehdottaa, ettÃĪ vaikka sekÃĪ kehys- ettÃĪ lohko-tason hÃĪiriÃķt parantavat temporaalista laatua, kehys-kohtaiset menetelmÃĪt suorittavat yleensÃĪ paremmin. TÃĪmÃĪ johtuu niiden hienojakoisemmasta granulaarisuudesta, joka mahdollistaa tarkemmat temporaaliset sÃĪÃĪtÃķtoimenpiteet. Lohko-kohtaiset hÃĪiriÃķt, toisaalta, voivat esittÃĪÃĪ melua johtuen tiiviisti kytketyistÃĪ paikallisista ja temporaalisista malleista lohkojen sisÃĪllÃĪ, mikÃĪ vÃĪhentÃĪÃĪ niiden tehokkuutta.
JohtopÃĪÃĪtÃķs
TÃĪmÃĪ tutkimusjulkaisu, yhdessÃĪ Bytedance-Tsinghuan kuvauksen yhteistyÃķn kanssa, joka julkaistiin tÃĪllÃĪ viikolla, on osoittanut minulle, ettÃĪ uusimpien generatiivisten videomallien ilmeiset puutteet eivÃĪt vÃĪlttÃĪmÃĪttÃĪ johtuisi kÃĪyttÃĪjÃĪn virheestÃĪ, institutionaalisten epÃĪonnistumisten tai rahoitusrajoitusten vuoksi, vaan tutkimuksen painopisteen priorisoinnista, joka on ymmÃĪrrettÃĪvÃĪsti priorisoinut kiireellisempiÃĪ haasteita, kuten temporaalista koherenttia ja johdonmukaisuutta, nÃĪiden vÃĪhÃĪisempien huolenaiheiden sijaan.
Kun uusimmat generatiiviset videomallit ovat vielÃĪ niin lÃĪhellÃĪ todella fotorealistista videotuotantoa, on ilmeistÃĪ, ettÃĪ sekÃĪ tutkimus- ettÃĪ harrastajayhteisÃķt ovat kiinnostuneita ratkaisemaan jÃĪljellÃĪ olevat ongelmat; toivottavasti nÃĪmÃĪ eivÃĪt ole ratkaisemattomia esteitÃĪ.
* Wanin alkuperÃĪinen kehysnopeus on vaatimaton 16fps, ja vastauksena omiin ongelmiini, huomautan, ettÃĪ foorumit ovat ehdottaneet kehysnopeuden laskemista jopa 12fps:ÃĪÃĪn, ja sitten kÃĪyttÃĪmistÃĪ FlowFrames:ia tai muita tekoÃĪlypohjaisia uudelleenvirtausjÃĪrjestelmiÃĪ aukkojen interpolointiin niin niukasti kehyksiÃĪ.
Julkaistu ensimmÃĪisen kerran perjantaina, 21. maaliskuuta 2025












