Andersonin kulma

Parannettu AI-videotuotanto vain kahdesta kuvasta

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
Images from the accompanying YouTube video for the paper 'Framer: Interactive Frame Interpolation'. Source: https://www.youtube.com/watch?v=4MPGKgn7jRc

Videokehyksen interpolointi (VFI) on avoin ongelma generatiivisessa videotutkimuksessa. Haaste on luoda välkehykset kahden olemassa olevan kehyksen välille videosekvenssissä.

Klikkaa toistamaan. FILM-kehys, joka on yhteistyössä Googleen ja Washingtonin yliopiston kanssa, ehdotti tehokasta kehyksen interpolointimenetelmää, joka on edelleen suosittu sekä harrastelijoiden että ammattilaisten piirissä. Vasemmalla puolella voidaan nähdä kaksi erillistä ja erottuvaa kehyksen yhdistelmää; keskellä “loppukehykset”; ja oikealla puolella lopullinen synteesi kehykset. Lähteet: https://film-net.github.io/ ja https://arxiv.org/pdf/2202.04901

Laajasti ottaen, tämä tekniikka on peräisin yli sadan vuoden takaa, ja sitä on käytetty perinteisessä animaatiossa siitä lähtien. Tässä yhteydessä pääkehykset luotiin pääasiallisesti animaatioartistin toimesta, kun taas välkehykset luotiin muiden työntekijöiden toimesta, jotka suorittivat tämän tehtävän.

Ennen generatiivisen AI:n nousua kehyksen interpolointi käytettiin projekteissa, kuten Real-Time Intermediate Flow Estimation (RIFE), Depth-Aware Video Frame Interpolation (DAIN) ja Googleen Frame Interpolation for Large Motion (FILM – ks. yllä) tarkoituksena lisätä olemassa olevan videon kehysnopeutta tai mahdollistaa keinotekoisia hidastusvaikutuksia. Tämä saavutetaan jakamalla olemassa olevat kehykset ja luomalla arvioituja välkehyksiä.

VFI käytetään myös parempien videokoodekkien kehittämisessä ja yleisemmin optisen virtauksen perusteella (mukaan lukien generatiiviset järjestelmät), jotka hyödyntävät etukäteen tulevien avainkehyksien tietoa interstitiaalisen sisällön optimointiin ja muotoiluun.

Generatiivisten videojärjestelmien loppukehykset

Nykyiset generatiiviset järjestelmät, kuten Luma ja Kling, sallivat käyttäjän määritellä aloitus- ja loppukehyksen, ja ne voivat suorittaa tämän tehtävän analysoimalla avainkohtia kahdessa kuvassa ja arvioimalla trajektorian kahden kuvan välillä.

Kuten voidaan nähdä alla olevista esimerkeistä, loppukehyksen tarjoaminen mahdollistaa generatiiviselle videojärjestelmälle (tässä tapauksessa Kling) säilyttää ominaisuuksia, kuten identiteetti, vaikka tulokset eivät ole täydellisiä (erityisesti suurilla liikkeillä).

Klikkaa toistamaan. Kling on yksi kasvavasta joukosta videogeneraattoreita, mukaan lukien Runway ja Luma, jotka sallivat käyttäjän määritellä loppukehyksen. Useimmissa tapauksissa vähäinen liike johtaa realistisimpiin ja vähiten virheellisiin tuloksiin. Lähde: https://www.youtube.com/watch?v=8oylqODAaH8

Yllä olevassa esimerkissä henkilön identiteetti on yhdenmukainen kahden käyttäjän antaman avainkehyksen välillä, mikä johtaa suhteellisen yhdenmukaiseen videogeneraatioon.

Jos vain aloituskehykset on annettu, generatiivisen järjestelmän huomion ikkuna ei yleensä ole tarpeeksi suuri “muistamaan”, miltä henkilö näytti videon alussa. Sen sijaan identiteetti on todennäköisesti siirtynyt hieman jokaisen kehyksen kanssa, kunnes kaikki muistutus on menetetty. Alla olevassa esimerkissä aloituskuva ladattiin, ja henkilön liike ohjattiin tekstipromptin avulla:

Klikkaa toistamaan. Kun ei ole loppukehykset, Klingillä on vain pieni ryhmä välittömiä edeltäviä kehyksiä, joiden avulla seuraavien kehykset voidaan luoda. Tapauksissa, joissa tarvitaan merkittävää liikettä, identiteetin atrofia tulee vakavaksi.

Nähdään, että näyttelijän muistutus ei ole kestävä ohjeiden suhteen, koska generatiivinen järjestelmä ei tiedä, miltä hän näyttäisi, jos hän olisi hymyilevä, ja hän ei ole hymyilevä siemenkuvassa (ainoa saatavilla oleva viite).

Suurin osa virallisista generatiivisista klippeistä on huolellisesti valikoitu vähentämään näitä puutteita. Kuitenkin generatiivisten videoiden kehittymisen edetessä voi riippua uusista tutkimussektorin kehityksistä kehyksen interpoloinnissa, koska ainoa mahdollinen vaihtoehto on perinteisen CGI:n käyttäminen “ohjaavana” videona (ja jopa tässä tapauksessa tekstuuri- ja valaistusjohdonmukaisuus ovat edelleen haasteellisia).

Lisäksi hitaasti iteratiivinen uuden kehyksen johtaminen pienestä ryhmästä edeltäviä kehyksiä tekee siitä erittäin vaikeaksi saavuttaa suuria ja rohkeita liikkeitä. Tämä johtuu siitä, että nopeasti liikkuva objekti voi siirtyä yhden kehyksen laidasta toiselle vastaavassa ajassa, vastoin hitaampia liikkeitä, joihin järjestelmä on todennäköisesti koulutettu.

Vastavuoroinen ja rohkea asennon muutos voi johtaa identiteetin siirtymiseen ja selkeisiin epäjohdonmukaisuuksiin:

Klikkaa toistamaan. Tässä esimerkissä Lumasta pyydettiin liikettä, jota ei näytä olevan hyvin edustettuna koulutusaineistossa.

Framer

Tämä johtaa meidät mielenkiintoiseen viimeaikaiseen tutkimukseen Kiinasta, joka väittää saavuttaneen uuden tilan generatiivisessa videotuotannossa – ja se on ensimmäinen, joka tarjoaa vetämispohjaisen käyttäjäkokemuksen.

Framer sallii käyttäjän ohjata liikettä intuitiivisella vetämispohjaisella käyttöliittymällä, vaikka se tarjoaa myös “automaattisen” tilan. Lähde: https://www.youtube.com/watch?v=4MPGKgn7jRc

Vetämispohjaiset sovellukset ovat yleistyneet viimeaikaisissa tutkimuksissa viimeaikaisissa tutkimuksissa, koska tutkimussektori kamppailee tarjoamaan generatiivisille järjestelmille välineitä, jotka eivät perustu tekstiprompttien karkeisiin tuloksiin.

Uusi järjestelmä, joka on nimeltään Framer, voi seurata käyttäjän ohjausta vetämällä, ja se tarjoaa myös perinteisen “autopilot”-tilan. Perinteisen tweeningin lisäksi järjestelmä pystyy tuottamaan time-lapse-simulaatioita, sekä muokkaamaan ja luomaan uusia näkymiä syötekuvasta.

Välkehykset, jotka on luotu time-lapse-simulaatiota varten Framerissa. Lähde: https://arxiv.org/pdf/2410.18978

Välkehykset, jotka on luotu time-lapse-simulaatiota varten Framerissa. Lähde: https://arxiv.org/pdf/2410.18978

Framer ylittää hieman Neural Radiance Fields (NeRF) -alueen – vaikka se vaatii vain kaksi kuvaa, kun taas NeRF yleensä vaatii kuusi tai useamman kuvan.

Kokeissa Framer, joka perustuu Stability.ai:n Stable Video Diffusion -latenssiin, pystyi ylittämään muita lähestymistapoja käyttäjätutkimuksessa.

Koodi on tarkoitus julkaista GitHubissa. Videonäytteet (joista yllä olevat kuvat on johdettu) ovat saatavilla projektisivustolla, ja tutkijat ovat julkaisseet myös YouTube-videon.

Uusi tutkimus on nimeltään Framer: Interaktiivinen kehyksen interpolointi, ja se on tehty yhdeksän tutkijan toimesta Zhejiangin yliopistosta ja Alibaba-tukiryhmästä.

Menetelmä

Framer käyttää avainpistekohtaisia interpolointeja molemmissa tiloissaan, joissa syötekuvaa arvioidaan perustopologiaa varten, ja “liikkuva” pisteet määritetään tarvittaessa. Nämä pisteet ovat vastaavia kuin kasvojen ominaispiirteet tunnistamisjärjestelmissä, mutta ne yleistyvät mihin tahansa pintaan.

Tutkijat säätivät Stable Video Diffusion (SVD) -mallia OpenVid-1M -aineistolla, ja lisäsivät siihen viimeisen kehyksen synteesi -ominaisuuden. Tämä mahdollistaa trajektorian ohjausmekanismin (yläoikea schema-kuvassa alla), joka voi arvioida polun loppukehykseen (tai siitä eteenpäin).

Framerin schema.

Framerin schema.

Loppukehyksen ehtojen lisäämisestä tutkijat toteavat:

‘Ylläpidämme mahdollisimman paljon esikoulutetun SVD:n visuaalista etuoikeutta ja injektoidaan loppukehyksen ehdot latenttiavaruuteen ja semanttiseen avaruuteen.

‘Erityisesti yhdistämme ensimmäisen kehyksen VAE-koodatun latentin ominaisuuden ensimmäisen kehyksen meluisaan latenttiin, kuten SVD:ssä tehtiin. Lisäksi yhdistämme viimeisen kehyksen latentin ominaisuuden viimeisen kehyksen meluisaan latenttiin, ottaen huomioon, että ehdot ja vastaavat meluisat latentit ovat tilallisesti samansuuntaisia.

‘Lisäksi poistamme ensimmäisen ja viimeisen kehyksen CLIP-kuva- upotukset erikseen ja yhdistämme ne ristiriitaisen huomion ominaisuuden injektioon.’

Vetämispohjaisessa toiminnassa trajektoriamoduuli hyödyntää Meta Ai -johtamaa CoTracker -kehystä, joka arvioi runsaasti mahdollisia polkuja eteenpäin. Nämä polut supistetaan 1-10 mahdolliseen trajektoriaan.

Saadut pisteiden koordinaatit muunnetaan menetelmällä, joka on inspiroitu DragNUWA – ja DragAnything -arkkitehtuureista. Tämä tuottaa Gaussian lämmityskartan, joka erottaa liikkeen kohdealueet.

Tämän jälkeen data syötetään ControlNet -järjestelmän ehtojen mekanismeihin, joka on apujärjestelmä, joka on alun perin suunniteltu Stable Diffusion -mallille, ja sittemmin sovellettu muihin arkkitehtuureihin.

Autopilot-tilassa ominaisuusyhdistäminen suoritetaan aluksi SIFT -menetelmällä, joka tulkkaa trajektorian, joka voidaan sitten antaa itsestään päivittyvään mekanismiin, joka on inspiroitu DragGAN – ja DragDiffusion -menetelmistä.

Pistetrajektorian arviointi Framerissa.

Pistetrajektorian arviointi Framerissa.

Data ja testit

Framerin hienosäätöä varten avaruusavain ja jäännösrakenteet jäätivät paikalleen, ja vain aikajännitekerrokset ja jäännösrakenteet vaikuttivat.

Malli koulutettiin 10 000 iteroinnilla AdamW -algoritmillä, jossa oppimisnopeus oli 1e-4, ja eräkoko oli 16. Koulutus suoritettiin 16 NVIDIA A100 -näytönohjaimella.

Koska aiemmat lähestymistavat eivät tarjoa vetämispohjaista editointia, tutkijat päättivät vertailla Framerin autopilot-tilaa vanhempien lähestymistapojen perustoiminnallisuuteen.

Testatuista kehyksien interpolointijärjestelmistä olivat LDMVFI; Dynamic Crafter; ja SVDKFI. Perinteisten videojärjestelmien osalta vertailtavat kehykset olivat AMT; RIFE; FLAVR; ja edellä mainittu FILM.

Lisäksi käyttäjätutkimuksen toteutettiin DAVIS – ja UCF101 -aineistojen yli.

Laadulliset testit voidaan arvioida vain tutkimusryhmän objektiivisilla kyvyillä ja käyttäjätutkimuksella. Kuitenkin tutkimus toteaa, että perinteiset määrälliset mittarit eivät sovellu tämänkaltaiseen ongelmaan:

‘[Rekonstruktio] mittarit kuten PSNR, SSIM ja LPIPS eivät pysty havainnoimaan interpoloiden kehyksten laatua tarkasti, koska ne rangaistavat muita uskottavia interpolointituloksia, jotka eivät ole pikselikohtaisesti yhdenmukaisia alkuperäisen videon kanssa.

‘Vaikka generointimittarit kuten FID tarjoavat jonkinlaista parannusta, ne eivät vieläkään riitä, koska ne eivät ottaa huomioon aikajatkuvuutta ja arvioivat kehyksiä erillään.’

Huolimatta tästä tutkijat suorittivat laadullisia testejä useilla suosituilla mittareilla:

Määrälliset tulokset Framerista ja kilpailijoista.

Määrälliset tulokset Framerista ja kilpailijoista.

Tutkijat toteavat, että huolimatta siitä, että heillä oli epäedullinen asema, Framer saavutti silti parhaan FVD-pistemäärän testatuista menetelmistä.

Alla ovat tutkimuksen esimerkit laadullisesta vertailusta:

Laadullinen vertailu aiemmista lähestymistavoista.

Laadullinen vertailu aiemmista lähestymistavoista. Katso tutkimus paremman resoluution ja videotuloksia osoitteesta https://www.youtube.com/watch?v=4MPGKgn7jRc.

Tutkijat toteavat:

‘[Meidän] menetelmä tuottaa merkittävästi selkeämpiä tekstuureja ja luonnollisempaa liikettä verrattuna olemassa oleviin interpolointimenetelmiin. Se suoriutuu erityisen hyvin tilanteissa, joissa on merkittäviä eroja syötekehyksissä, joissa perinteiset menetelmät usein epäonnistuvat interpoloimasta sisältöä tarkasti.

‘Vertailtaessa muihin diffuusiopohjaisiin menetelmiin kuten LDMVFI ja SVDKFI, Framer osoittaa parempaa sopeutumista haastaviin tapauksiin ja tarjoaa paremman ohjauksen.’

Käyttäjätutkimuksessa tutkijat keräsivät 20 osanottajaa, jotka arvioivat 100 satunnaiseen järjestykseen asetettua videotulosta eri menetelmistä. Näin ollen saatiin 1000 arviota, jotka arvioivat “realistisimmat” tarjontaa:

Käyttäjätutkimuksen tulokset.

Käyttäjätutkimuksen tulokset.

Kuten yllä olevasta kaaviossa voidaan nähdä, käyttäjät suosivat ylivoimaisesti Framerin tuloksia.

Projektin YouTube- video esittelee joitain muita mahdollisia käyttökohteita Framerille, kuten muokkaamista ja piirrosanimaatiota – missä koko konsepti alkoi.

Johtopäätös

On vaikea yliarvioida tällä hetkellä tämän haasteen merkitystä AI-pohjaisen videotuotannon tehtävälle. Tähän asti vanhemmat ratkaisut, kuten FILM ja (ei-AI) EbSynth, ovat olleet käytössä sekä amatööri- että ammattilaisten piirissä kehyksen interpoloinnissa; mutta nämä ratkaisut tulevat merkittävillä rajoituksilla.

Koska virallisten esimerkki videoiden epärehellinen kuraattori uusille T2V-kehyksille, on laaja julkisen virheellinen käsitys, että koneoppimisjärjestelmät voivat tarkasti johtaa geometriaa liikkeessä ilman ohjausmekanismeja, kuten 3D-muokkauksellisia malleja (3DMM) tai muita apumenetelmiä, kuten LoRAs.

Rehellisesti sanoen, tweening itsessään, vaikka se voisi suorittaa täydellisesti, muodostaa vain “hakun” tai huijauksen tähän ongelmaan. Kuitenkin, koska on usein helpompaa tuottaa kaksi hyvin suunniteltua kehyksen kuvaa kuin ohjata tekstipromptteja tai nykyisten vaihtoehtojen valikoimaa, on hyvä nähdä iteratiivista edistystä AI-pohjaisessa versiossa tästä vanhemmasta menetelmästä.

Ensimmäisen kerran julkaistu tiistaina, 29. lokakuuta 2024

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai