AI-mallit ja alustat
DynamiCrafter: Animaatio avoimissa kuvissa Video Diffusion Priorsin avulla
Tietokoneen näkö on yksi kaikkein mielenkiintoisimmista ja parhaiten tutkituista aloista tekoäly-yhteisössä tänään, ja huolimatta tietokoneen näön mallien nopeasta parantumisesta, yksi vanha haaste, joka edelleen vaivaa kehittäjiä, on kuvan animaatio. Jopa tänään, kuvan animaatiokehykset kamppailevat edelleen muuttamalla paikallaan olevia kuvia vastaaviksi videoiksi, jotka näyttävät luonnollisia dynaamisia ja säilyttävät alkuperäisen kuvan ulkonäön. Perinteisesti, kuvan animaatiokehykset keskittyvät pääasiassa animoimaan luonnollisia kohtauksia, joissa on domeenikohtaisia liikkeitä, kuten ihmisen hiukset tai kehon liikkeet, tai stokastisia dynaamisia, kuten nesteet ja pilvet. Vaikka tämä lähestymistapa toimii tietyssä määrin, se rajoittaa näiden animaatiokehysten soveltamista laajempiin visuaalisiin sisältöihin.
Lisäksi, perinteiset kuvan animaatiomenetelmät keskittyvät pääasiassa synteettisiin振動liikkeisiin tai stokastisiin liikkeisiin tai mukauttamiseen tiettyihin objektiin. Kuitenkin, merkittävä virhe tässä lähestymistavassa on vahvat oletukset, jotka asetetaan näille menetelmille, mikä lopulta rajoittaa niiden soveltamista etenkin yleisissä tilanteissa, kuten avoimissa kuvan animaatioissa. Viime vuosina, T2V tai Teksti-Videomallit ovat osoittaneet merkittävää menestystä luomalla eläviä ja monipuolisia videoita tekstipromptein, ja tämä T2V-mallien osoitus on se, mikä muodostaa DynamiCrafter-kehyksen perustan.
DynamiCrafter-kehyksen tavoitteena on ylittää nykyisten kuvan animaatiomallien rajoitukset ja laajentaa niiden soveltamista yleisempiin tilanteisiin, jotka liittyvät avoimiin maailman kuvien animaatioon. DynamiCrafter-kehyksen tavoitteena on synteettinen dynaaminen sisältö avoimille kuville, muuttaen ne animaatiovideoiksi. DynamiCrafterin avainidea on sisällyttää kuva ohjaamiseksi generatiiviseen prosessiin pyrkien hyödyntämään jo olemassa olevan tekstin ja videon diffuusiomallien liikemäärää. Annettuun kuvaan, DynamiCrafter-malli toteuttaa ensin kyselytransformaattorin, joka projisioi kuvan tekstiin sopivaan rikkaaseen kontekstiedustusavaruuteen, mahdollistaen videomallin sulattaa kuvan sisällön yhdenmukaisella tavalla. Kuitenkin, DynamiCrafter-malli kamppailee edelleen joidenkin visuaalisten yksityiskohtien säilyttämisessä tuloksena olevissa videoissa, ongelma, jonka DynamiCrafter-malli ratkaisee syöttämällä koko kuvan diffuusiomalliin yhdistämällä kuvan alkuperäiseen meluun, täydentämällä mallia tarkemmalla kuvatiedolla.
Tämä artikkeli pyrkii kattamaan DynamiCrafter-kehyksen syvällisemmin, ja tutkimme kehyksen mekanismin, metodologian, arkkitehtuurin sekä sen vertailun nykyisten kuvan ja videon generointikehyksten kanssa. Joten aloitetaan.
DynamiCrafter: Avoimien kuvien animaatio
Kuvan animaatio usein tarjoaa mielenkiintoisen visuaalisen kokemuksen yleisölle, koska se näyttää tuovan paikallaan olevan kuvan eloon. Vuosien varrella, useat kehykset ovat tutkineet erilaisia menetelmiä kuvan animaatioon. Alkuperäiset animaatiomallit toteuttivat fysikaalisen simulaation perusteella, joka keskittyi simuloimaan tietyn objektin liikettä. Kuitenkin, johtuen jokaisen objektin erillistä mallinnusta, nämä lähestymistavat eivät olleet tehokkaita eivätkä niillä ollut yleistettävyyttä. Jotta voidaan replikoida realistisempia liikkeitä, viitepohjaiset menetelmät kehittyivät, jotka siirsivät liikettä tai ulkonäön tietoa viite-signaaleista, kuten videoista, synteesiprosessiin. Vaikka viitepohjaiset lähestymistavat toimivat paremmin kuin simulaatiopohjaiset lähestymistavat, ne vaativat lisäohjausta, mikä rajoitti niiden käytännön soveltamista.
Viime vuosina, useimmat animaatiomallit keskittyvät pääasiassa animoimaan luonnollisia kohtauksia, joissa on stokastisia, domeenikohtaisia tai värähtelyliikkeitä. Vaikka näiden kehysten toteuttama lähestymistapa toimii tietyssä määrin, tulokset, jotka nämä kehykset tuottavat, eivät ole tyydyttäviä, ja niissä on merkittävästi parantamisen varaa. Tekstin ja videon generoivien mallien, kuten T2V-mallien, huomattavat tulokset viime vuosina ovat inspiroineet DynamiCrafter-kehyksen kehittäjiä hyödyntämään T2V-mallien voimakkaita generatiivisia kykyjä kuvan animaatioon.
DynamiCrafter-kehyksen avainperusta on sisällyttää ehdollinen kuva videon generoimisprosessiin pyrkien ohjaamaan videon generointia Teksti-Videon diffuusiomallien avulla. Kuitenkin, kuvan animaation lopullinen tavoite on edelleen haasteellinen, koska kuvan animaatio vaatii yksityiskohtien säilyttämistä ja visuaalisten kontekstien ymmärtämistä, jotka ovat välttämättömiä dynaamisen sisällön luomiseksi. Kuitenkin, monimodaaliset ohjattavat videon diffuusiomallit, kuten VideoComposer, ovat yrittäneet mahdollistaa videon generoimisen visuaalisen ohjauksen avulla kuvasta. Kuitenkin, nämä lähestymistavat eivät sovellu kuvan animaatioon, koska ne johtavat äkillisiin ajallisiin muutoksiin tai matalaan visuaaliseen yhdenmukaisuuteen syötteen kuvan kanssa, johtuen heikosta kuvan injektiojärjestelmästä. Tämän esteen voittamiseksi, DynamiCrafter-kehyksen toteuttaa kaksivirtaista injektio-lähestymistapaa, joka koostuu visuaalisesta yksityiskohtien ohjauksesta ja tekstiin sopivasta kontekstiedustuksesta. Kaksivirtaista injektio-lähestymistapaa mahdollistaa DynamiCrafter-kehyksen varmistaa, että videon diffuusiomalli synteettinen yksityiskohtien säilyttävä dynaaminen sisältö täydentävällä tavalla.

Annetaan kuva, DynamiCrafter-kehyksen toteuttaa ensin kuvan projektoimiseen tekstiin sopivaan kontekstiedustusavaruuteen erityisesti suunnitellun kontekstin oppimisen verkon avulla. Tarkemmin sanottuna, kontekstiedustusavaruus koostuu oppimisesta kyselytransformaattorista, jotta se edistää sopeutumista diffuusiomalleihin, ja esikoulutetusta CLIP-kuvaenkooderista, joka poistaa tekstiin sopivat kuvan ominaisuudet. Sitten malli käyttää rikkaita konteksti-ominaisuuksia ristiriitaisilla kerroksilla, ja malli käyttää portaiden yhdistämistä yhdistääkseen nämä teksti-ominaisuudet ristiriitaisilla kerroksilla. Kuitenkin, tämä lähestymistapa vaihtaa oppimansa kontekstiedustukset tekstiin sopivilla visuaalisilla yksityiskohtilla, mikä mahdollistaa semanttisen ymmärtämisen kuvan kontekstista, sallien järkevän ja elävän dynaamisen sisällön synteesin. Lisäksi, pyrkien täydentämään lisää visuaalista yksityiskohtia, kehyksen yhdistää koko kuvan alkuperäiseen meluun diffuusiomalliin. Tämän seurauksena, DynamiCrafter-kehyksen kaksivirtaista injektio-lähestymistapa takaa visuaalisen yhdenmukaisuuden sekä uskottavan dynaamisen sisällön syötteen kuvassa.
Jatkaen, diffuusiomallit tai DM:t ovat osoittaneet merkittävää suorituskykyä ja generatiivista voimaa Teksti-Kuva-generoinnissa. Jotta voidaan replikoida T2I-mallien menestystä video-generointiin, VDM tai Videon Diffuusiomallit on ehdotettu, joka käyttää aikaa ja tilaa tekijöitä U-Net-arkkitehtuuriin pikseliavaruudessa matalan resoluution videoiden mallintamiseksi. Siirtäminen T2I-kehyksistä T2V-kehyksiin auttaa vähentämään koulutuskustannuksia. Vaikka VDM tai Videon Diffuusiomallit pystyvät generoimaan laadukkaita videoita, ne hyväksyvät vain tekstipromptit yksinäisenä semanttisena ohjauksena, mikä ei välttämättä heijasta käyttäjän todellisia aikomuksia tai voi olla epämääräistä. Kuitenkin, useimpien VDM-mallien tulokset harvoin noudattavat syötteen kuvaa ja kärsivät epärealistisesta ajallisesta vaihtelusta. DynamiCrafter-lähestymistapa perustuu tekstin ohjattuihin Videon Diffuusiomalleihin, jotka hyödyntävät rikkaan dynaamisen edustajan avoimien kuvien animaatioon. Se tekee tämän sisällyttämällä mukautettuja suunnittelua paremman semanttisen ymmärtämisen ja yhdenmukaisuuden syötteen kuvassa.
DynamiCrafter: Menetelmä ja Arkkitehtuuri
Annetaan paikallaan oleva kuva, DynamiCrafter-kehyksen pyrkii animoimaan kuvan videoksi, eli tuottamaan lyhyen videopätkän. Videopätkä perii visuaalisen sisällön kuvasta ja näyttää luonnollista dynaamista. Kuitenkin, on mahdollista, että kuva voi ilmestyä mihin tahansa sijaintiin tuloksena olevassa kehysjärjestyksessä. Kuvan ilmestyminen mihin tahansa sijaintiin on erityinen haaste, jota havaitaan kuvan ehdollisessa videon generoinnissa, jossa on korkea visuaalinen yhdenmukaisuuden vaatimus. DynamiCrafter-kehyksen ylittää tämän haasteen hyödyntämällä esikoulutettujen videon diffuusiomallien generatiivisia etuoikeuksia.
Kuvan Dynaamiset Videon Diffuusiosta
Yleensä, avoimet teksti-videon diffuusiomallit ovat tunnettuja dynaamisesta visuaalisesta sisällöstä, joka on mallinnettu ehdollisesti tekstikuvauksilla. Jotta voidaan animoimaan paikallaan oleva kuva Teksti-Videon generatiivisilla etuoikeuksilla, kehykset on ensin injektio visuaalista tietoa videon generoimisprosessiin kattavalla tavalla. Lisäksi, dynaamisen synteesin vuoksi, T2V-malli on sulattava kuvaa kontekstin ymmärtämiseksi, ja se on myös kykenevä säilyttämään visuaaliset yksityiskohtia generoiduissa videoissa.

Tekstiin Sopiva Kontekstiedustus
Jotta voidaan ohjata videon generointia kuvan kontekstilla, DynamiCrafter-kehyksen pyrkii projisioimaan kuvan sopivaan upotusavaruuteen, jotta videomalli voi käyttää kuvan tietoa yhdenmukaisella tavalla. Tämän jälkeen, DynamiCrafter-kehyksen käyttää kuvan koodausta poistamaan kuvan ominaisuudet, koska teksti- upotukset on generoitu esikoulutetulla CLIP-teksti-koodaajalla. Vaikka globaalit semanttiset tokenit CLIP-kuvan koodaajasta ovat yhdenmukaisia kuvan kanssa, ne edustavat pääasiassa visuaalista sisältöä semanttisella tasolla, joten ne eivät kykene kaappaamaan koko kuvan sisältöä. DynamiCrafter-kehyksen toteuttaa täydellisiä visuaalisia tokenia viimeisen kerroksen CLIP-koodaajasta, jotta voidaan poistaa täydellisempi tieto, koska nämä visuaaliset tokenit osoittavat korkeaa uskottavuutta ehdollisissa kuvan generoinnin tehtävissä. Lisäksi, kehyksen käyttää konteksti- ja teksti-ominaisuuksia vuorovaikuttaakseen U-Net-välikerrosten kanssa kaksinkertaisilla ristiriitaisilla kerroksilla. Tämän komponentin suunnittelu mahdollistaa mallin imeä kuvan ehdot layer-riippuvaisella tavalla. Lisäksi, koska U-Net-arkkitehtuuriin liittyvät välikerrokset liittyvät enemmän objektien asentoihin tai muotoihin, on odotettavissa, että kuvan ominaisuudet vaikuttavat enemmän videon ulkonäköön, koska kaksi viimeistä kerrosta liittyvät enemmän ulkonäköön.
Visuaalinen Yksityiskohtien Ohjaus
DynamiCrafter-kehyksen käyttää rikkaita tietoisia kontekstiedustuksia, jotta videon diffuusiomalli voi tuottaa videoita, jotka muistuttavat syötteen kuvaa läheisesti. Kuitenkin, kuten seuraavasta kuvasta voidaan nähdä, generoitu sisältö voi näyttää joitakin epäjohdonmukaisuuksia johtuen esikoulutetun CLIP-koodaajan rajoitettua kykyä säilyttää syötteen tietoa täysin, koska se on suunniteltu yhdenmukaisuuden saavuttamiseksi kielen ja visuaalisten ominaisuuksien välillä.

Jotta voidaan parantaa visuaalista yhdenmukaisuutta, DynamiCrafter-kehyksen ehdottaa antamaan videon diffuusiomallille lisää visuaalista yksityiskohtia, jotka on poistettu syötteen kuvasta. Tämän saavuttamiseksi, DynamiCrafter-malli yhdistää ehdollisen kuvan per-kehykselle alkuperäiseen meluun ja syöttää ne denoising U-Net-komponenttiin ohjaamiseksi.
Koulutusparadigma
DynamiCrafter-kehyksen integroi ehdollisen kuvan kahteen täydentävään virtaan, jotka ovat visuaalisen yksityiskohtien ohjauksen ja kontekstin ohjauksen kannalta merkittäviä. Tämän mahdollistamiseksi, DynamiCrafter-malli käyttää kolmeaskeltaista koulutusprosessia
- Ensimmäisessä vaiheessa, malli kouluttaa kuvan kontekstiedustusverkkoa.
- Toisessa vaiheessa, malli sovittaa kuvan kontekstiedustusverkkoa Teksti-Videomalliin.
- Kolmannessa ja viimeisessä vaiheessa, malli hienosäätelee kuvan kontekstiedustusverkkoa yhdessä Visuaalisen Yksityiskohtien Ohjauskomponentin kanssa.
Jotta voidaan sovittaa kuvatietoa yhdenmukaisuuden vuoksi Teksti-Videon (T2V) mallin kanssa, DynamiCrafter-kehyksen ehdottaa kehittämistä kontekstiedustusverkkoa P, joka on suunniteltu kaappaamaan tekstiin sopivat visuaaliset yksityiskohtia annetusta kuvasta. Tunnistaen, että P vaatii useita optimointivaiheita konvergenssiin, kehyksen lähestymistapa sisältää aluksi kouluttamisen yksinkertaisemman Teksti-Kuva (T2I) mallin avulla. Tämä strategia mahdollistaa kontekstiedustusverkon keskittymisen kuvan kontekstin oppimiseen ennen integroimista T2V-malliin yhdessä koulutuksen P:n ja T2V-mallin avaruuskerrosten kanssa, toisin sanoen ei temporal kerrosten kanssa. T2V-mallin aikaisempien kerrosten liittäminen T2I-mallin kanssa mahdollistaa kontekstiedustusverkon oppimisen kuvan kontekstista ennen sen yhdistämistä T2V-malliin.
Jotta voidaan varmistaa T2V-yhteensopivuus, DynamiCrafter-kehyksen yhdistää syötteen kuvan per-kehykselle meluun ja hienosäätelee sekä P:tä että Visuaalisen Yksityiskohtien Ohjausmallin avaruuskerroksia. Tämä menetelmä valitaan säilyttämään T2V-mallin olemassa olevan temporalisen tietämyksen eheyttä ilman tiheän kuvan yhdistämisen haitallisia vaikutuksia, jotka voisivat heikentää suorituskykyä ja poiketa päämäärästämme. Lisäksi, kehyksen käyttää strategiaa, jossa videokehyksestä valitaan satunnaisesti kuva ehdoksi, jotta voidaan saavuttaa kaksi tavoitetta: (i) välttää verkon kehittäminen ennustettavaksi malliksi, joka suoraan liittää yhdistetyn kuvan tietyn kehyssijainnin kanssa, ja (ii) rohkaista sopeutuvampaa kontekstiedustusta estämällä liian jähmeän tiedon antamisen millekään tietylle kehykselle.
DynamiCrafter: Kokeet ja Tulokset
DynamiCrafter-kehyksen kouluttaa ensin kontekstiedustusverkon ja kuvan ristiriitaiset kerrokset Stabilisoidulla Diffuusiolla. Kehyksen korvaa sitten Stabilisoidun Diffuusion komponentin VideoCrafterilla ja hienosäätelee kontekstiedustusverkkoa ja avaruuskerroksia sopeutumiseksi ja kuvan yhdistämiseksi. Tulostusvaiheessa, kehyksen käyttää DDIM-otetta moniehtoista luokittamattomalla ohjauksella. Lisäksi, arvioidakseen temporalisen yhdenmukaisuuden ja videon laadun sekä temporalisissa että avaruuskerroksissa, kehyksen raportoi FVD (Frechet Videon Etäisyys) ja KVD (Kernel Videon Etäisyys), ja arvioi nollan shotin suorituskykyä MSR-VTT- ja UCF-101-benchmarkkeissa. Tutkiakseen havainnollista yhdenmukaisuutta generoiden tuloksien ja syötteen kuvan välillä, kehyksen esittää PIC (Havainnollisen Syötteen Yhdenmukaisuus) ja ottaa käyttöön havainnollisen etäisyyden mittarin DreamSim etäisyyden funktiona.
Seuraava kuva osoittaa visuaalisen vertailun eri tyylisistä ja sisällöistä animoiduista sisällöistä.

Kuten voidaan havaita, kaikista eri menetelmistä, DynamiCrafter-kehyksen noudattaa syötteen kuvaa hyvin ja tuottaa temporalisesti yhdenmukaisia videoita. Seuraava taulukko sisältää tilastot 49 osallistujan käyttäjätutkimuksesta, jossa vertaillaan mieltymyksen määrää Temporaalisen Yhdenmukaisuuden (T.C), Liikkeen Laadun (M.C) ja visuaalisen yhdenmukaisuuden valintamäärää syötteen kuvan kanssa (I.C). Kuten voidaan havaita, DynamiCrafter-kehyksen pystyy ylittämään olemassa olevat menetelmät merkittävällä marginaalilla.

Seuraava kuva osoittaa tulokset, jotka saavutetaan kaksivirtaista injektio-menetelmällä ja koulutusparadigmalla.

Lopputulet
Tässä artikkelissa, olemme puhuneet DynamiCrafterista, joka on yritys ylittää nykyisten kuvan animaatiomallien rajoitukset ja laajentaa niiden soveltamista yleisempiin tilanteisiin, jotka liittyvät avoimiin maailman kuvien animaatioon. DynamiCrafter-kehyksen pyrkii synteettiseen dynaamiseen sisällölle avoimille kuville, muuttaen ne animaatiovideoiksi. DynamiCrafterin avainidea on sisällyttää kuva ohjaamiseksi generatiiviseen prosessiin pyrkien hyödyntämään jo olemassa olevan tekstin ja videon diffuusiomallien liikemäärää. Annetaan kuva, DynamiCrafter-malli toteuttaa ensin kyselytransformaattorin, joka projisioi kuvan tekstiin sopivaan rikkaaseen kontekstiedustusavaruuteen, mahdollistaen videomallin sulattaa kuvan sisällön yhdenmukaisella tavalla. Kuitenkin, DynamiCrafter-malli kamppailee edelleen joidenkin visuaalisten yksityiskohtien säilyttämisessä tuloksena olevissa videoissa, ongelma, jonka DynamiCrafter-malli ratkaisee syöttämällä koko kuvan diffuusiomalliin yhdistämällä kuvan alkuperäiseen meluun, täydentämällä mallia tarkemmalla kuvatiedolla.












