AI-mallit ja alustat
CameraCtrl: Kameran ohjaus T2V-sukupolven videoiden luomisessa
Viimeaikaiset kehykset, jotka pyrkivät tekstistä videoon tai T2V-sukupolven luomiseen, hyödyntävät diffuusiomalleja lisätäkseen vakautta koulutusprosessissaan, ja Video Diffusion Model, yksi tekstistä videoon luomisen kehyksistä, laajentaa 2D-kuva diffuusioiden arkkitehtuuriin videodatan sisältämiseksi ja kouluttaa mallin videosta ja kuvasta yhdessä alusta lähtien. Rakentamalla tästä ja toteuttaakseen voimakkaan esikoulutetun kuvan generoijan, kuten Stable Diffusion, viimeaikaiset työt laajentavat 2D-arkkitehtuuriinsa vuorovaikutteisia kerroksia esikoulutettujen 2D-kerrosten välissä ja hienosäätävät uuden mallin näkemättömillä suurilla tietoaineistoilla. Vaikka heidän lähestymistapansa, tekstistä videoon diffuusiomallit kohtaavat merkittävän haasteen, koska ainoastaan käytetyn tekstin kuvausten epäselvyys videonäytteen luomisessa usein johtaa siihen, että tekstistä videoon malli on heikompi ohjaus luomisessa. Ratkaistakseen tämän rajoituksen, jotkut mallit tarjoavat parannettua ohjausta, kun taas toiset työskentelevät tarkoilla signaaleilla ohjatakseen tarkasti kohtauksen tai ihmisten liikkeitä syntetisoiduissa videoissa. Toisaalta on joitakin tekstistä videoon kehyksiä, jotka käyttävät kuvia ohjaussignaaleina videon generoijalle, mikä johtaa joko tarkkaan ajalliseen suhteeseen mallinnukseen tai korkealaatuiseen videoon.
On turvallista sanoa, että ohjattavuus on tärkeä rooli kuvan ja videon generoivissa tehtävissä, koska se sallii käyttäjien luoda haluamansa sisältö. Kuitenkin olemassa olevat kehykset usein jättävät huomiotta tarkan kameran asennon ohjauksen, joka toimii elokuvallisen kielen ilmaisemiseen syvemmän tarinan nyansseja mallille paremmin. Ratkaistakseen nykyisten ohjattavuuden rajoitukset, tässä artikkelissa puhumme CameraCtrl: stä, uudesta ideasta, joka pyrkii mahdollistamaan tarkan kameran asennon ohjauksen tekstistä videoon malleille. Kameran polun parametrin jälkeen tarkasti, malli kouluttaa plug and play -kameramoduulin tekstistä videoon malliin ja jättää muut komponentit koskemattomiksi. Lisäksi CameraCtrl-malli suorittaa kattavan tutkimuksen eri tietoaineistojen vaikutuksesta ja ehdottaa, että videot, joilla on samanlaiset ulkonäkö ja monipuolinen kamerajakauma, voivat parantaa mallin ohjattavuutta ja yleistettävyyttä. Kokeet, jotka suoritetaan CameraCtrl-mallin suorituskyvyn analysointiin reaaliavusteisissa tehtävissä, osoittavat kehyksen tehokkuuden tarkassa ja aluekohtaisessa kameran ohjauksessa, joka mahdollistaa mukautettujen ja dynaamisten videoiden luomisen kameran asennon ja tekstisyötteiden perusteella.
Tämä artikkeli pyrkii kattamaan CameraCtrl-kehyksen syvällisesti, ja tutkimme mekanismin, metodologian, kehyksen arkkitehtuuriin ja sen vertailun valmiiden kehysten kanssa. Joten aloitetaan.
CameraCtrl: Kameran ohjaus T2V-sukupolven luomisessa
Viimeaikaisen diffuusiomallien kehitys ja edistys ovat edistäneet tekstiohjattua videon luomista merkittävästi viime vuosina ja vallankumouksellisesti sisällön suunnitteluprosesseja. Ohjattavuus on tärkeä rooli käytännön videon luomissovelluksissa, koska se sallii käyttäjien mukauttaa luotuja tuloksia tarpeidensa ja vaatimustensa mukaan. Korkealla ohjattavuudella malli pystyy parantamaan luotujen videoiden realismin, laadun ja käytettävyyden, ja vaikka teksti- ja kuvasyötteet ovat yleisesti käytettyjä malleissa parantamaan ohjattavuutta, ne usein puuttuvat tarkasta liikkeen ja sisällön ohjauksesta. Ratkaistakseen tämän rajoituksen, jotkut kehykset ovat ehdottaneet ohjaussignaaleja, kuten asennonskelettia, optista virtausta ja muita monimutkaisia signaaleja, mahdollistaakseen tarkemman ohjauksen videon luomiseen. Toisaalta olemassa olevien kehyksien toinen rajoitus on, että ne puuttuvat tarkasta ohjauksesta kameran stimulointiin tai mukauttamiseen videon luomisessa, koska kameran ohjauksen kyky on tärkeä, koska se ei ainoastaan paranna luotujen videoiden realismin, vaan myös käyttäjien sitoutumista, joka on olennainen ominaisuus pelien kehittämisessä, lisätyn todellisuuden ja virtuaalitodellisuuden kehittämisessä. Lisäksi kameraliikkeiden taitava hallinta sallii luojien korostaa hahmojen suhteita, korostaa tunteita ja ohjata kohderyhmän huomion, mikä on tärkeää elokuva- ja mainosalalla.
Ratkaistakseen nämä rajoitukset, CameraCtrl-kehyksessä on oppiminen ja tarkka plug and play -kameramoduuli, jolla voidaan ohjata kameran näkökulmia videon luomisessa. Kuitenkin mukautetun kameran integrointi olemassa olevaan tekstistä videoon mallin putkistoon on tehtävä, joka on helpompi sanomaan kuin toteuttaa, mikä pakottaa CameraCtrl-kehyksen etsimään keinoja kameran esittämiseen ja injektointiin mallin arkkitehtuuriin tehokkaasti. Samalla tavalla CameraCtrl-kehyksessä käytetään plucker- upotusta kameraparametrien pääasiallisena muotona, ja syy plucker- upotusten valintaan voidaan kiittää niiden kyvystä koodata geometrisia kuvauksia kameran asennon tiedoista. Lisäksi varmistamaan CameraCtrl-mallin yleistettävyyttä ja soveltamista koulutuksen jälkeen, malli esittää kameran ohjausmallin, joka hyväksyy ainoastaan plucker- upotukset syötteenä. Varmistamaan kameran ohjausmallin koulutus on tehokas, kehyksessä ja sen kehittäjissä suoritetaan kattava tutkimus selvittämään, miten erilaiset koulutusaineistot vaikuttavat kehykseen syntetisistä aineistoista realistisiin aineistoihin. Kokeelliset tulokset osoittavat, että aineistojen toteuttaminen, joilla on monipuolinen kamerajakauma ja samanlainen ulkonäkö kuin alkuperäinen perusmalli, saavuttaa parhaan tasapainon ohjattavuuden ja yleistettävyyden välillä. CameraCtrl-kehyksen kehittäjät ovat toteuttaneet mallin AnimateDiff-kehyksen päällä, mahdollistaen tarkan ohjauksen videon luomisessa eri mukautettujen yhteyksissä, osoittaen sen monipuolisuutta ja hyödyllisyyttä laajassa videon luomisen yhteyksissä.

AnimateDiff-kehyksessä käytetään tehokasta LoRA- hienosäätölähestymistapaa saadakseen mallin painot eri kuvausten tyypeille. Direct-a-video-kehyksessä ehdotetaan kameran upottamista kameran asennon ohjaukseen videon luomisprosessissa, mutta se ehdottaa ainoastaan kolmea kameraparametria, rajoittaen kameran ohjauskykyä peruskuvaustyyppiin. Toisaalta kehykset, kuten MotionCtrl, suunnittelevat liikkeen ohjaajan, joka hyväksyy yli kolme syöteparametria ja pystyy tuottamaan videoita, joissa on monipuolisempia kamerakulmia. Kuitenkin tarve hienosäätää osia luodusta videosta haittaa mallin yleistettävyyttä. Lisäksi jotkut kehykset sisällyttävät rakenteellisia ohjaussignaaleja, kuten syvyyden karttoja, prosessiin parantamaan ohjattavuutta sekä kuvan ja tekstin luomisessa. Yleensä malli syöttää nämä ohjaussignaalit lisäksi kooderiin ja injektioi signaalit generoijaan eri operaatioiden avulla.
CameraCtrl: Mallin arkkitehtuuri
Ennen kuin voimme tarkastella kameran kooderin arkkitehtuuriin ja koulutusparadigmaa, on olennaista ymmärtää eri kamerarepresentaatioita. Yleensä kameran asento viittaa intrinsic- ja extrinsic- parametreihin, ja yksi suoraviivainen valinta antaa videon generoijalle ehdot kameran asennosta on syöttää kameraparametrien raakarvoja generoijaan. Kuitenkin tämän lähestymistavan toteuttaminen ei välttämättä paranna tarkkaa kameran ohjausta useista syistä. Ensinnäkin, vaikka rotaatiomatriisi on rajoitettu ortogonaalisuudella, käännösvektori on yleensä rajoittamaton suuruudessa, mikä johtaa oppimisprosessiin, joka voi vaikuttaa ohjauksen johdonmukaisuuteen. Toiseksi käyttämällä suoraan kameraparametreja voi olla vaikeaa mallille yhdistää nämä arvot kuvapikseleihin, mikä johtaa vähennetyksi ohjaukseksi visuaalisissa yksityiskohdissa. Välttääkseen nämä rajoitukset, CameraCtrl-kehyksessä valitaan plucker- upotukset kameran asennon edustajaksi, koska plucker- upotukset ovat geometrisia edustuksia jokaiselle videofraamin pikselille, ja voivat tarjota tarkemman kuvauksen kameran asennon tiedoista.
Kameran ohjattavuus videon generoijissa
Kun malli parametrin kameran polun tarkasti plucker- upotusjärjestykseen eli spatial- karttoihin, malli voi käyttää kooderimallia kameran ominaisuuksien poistamiseen ja sitten yhdistää kameran ominaisuudet videon generoijaan. Samoin kuin tekstistä kuvaan sovittimen, CameraCtrl-malli esittää kameran kooderin, joka on suunniteltu erityisesti videoille. Kameran kooderi sisältää aikapersoonallisen huomion jokaisen konvoluutiolohkon jälkeen, mikä mahdollistaa kameran asentojen ajallisten suhteiden kaappaamisen videoklipissä. Kuten seuraavassa kuvassa on osoitettu, kameran kooderi hyväksyy ainoastaan plucker- upotus syötteenä ja toimittaa moniasteisia ominaisuuksia. Saadakseen moniasteiset kameran ominaisuudet, CameraCtrl-malli pyrkii integroida nämä ominaisuudet tekstistä videoon mallin U-net- arkkitehtuuriin vaivattomasti ja määrittää kerrokset, jotka tulisi käyttää kameratiedon tehokkaaseen sisällyttämiseen. Lisäksi, koska useimmat olemassa olevat kehykset käyttävät U-net- kaltaista arkkitehtuuriin, joka sisältää sekä ajalliset että spatiaaliset huomio kerrokset, CameraCtrl-malli injektioi kameran edustukset ajalliseen huomio lohkoon, päätös, joka on perusteltu ajallisten huomiokerrosten kyvystä kaappaamaan ajalliset suhteet, jotka ovat linjassa kameran polun luontaisen kausaalisen ja järjestyksen mukaisen luonteen kanssa spatiaalisten huomio kerrosten kanssa, jotka kuvaavat yksittäisiä kehyskohtia.

Kameran jakautumisen oppiminen
Kameran kooderin komponentin koulutus CameraCtrl- kehyksessä videon generoijalla vaatii suuren määrän hyvin merkittyjä ja annotoituja videoita, joilla malli pystyy saamaan kameran polun käyttäen SfM- lähestymistapaa. CameraCtrl-kehyksessä pyrkii valita tietoaineisto, jolla on ulkonäkö, joka vastaa tekstistä videoon mallin koulutusaineistoa läheisesti, ja jolla on kameran asennon jakauma, joka on mahdollisimman laaja. Näytteet, jotka on luotu virtuaali- moottoreilla, osoittavat monipuolista kamerajakaumaa, koska kehittäjillä on joustavuutta kameran parametreja ohjata renderöintivaiheessa, vaikka se kärsii jakauman aukosta verrattuna aineistoihin, jotka sisältävät maailmanlaajuisia näytteitä. Kun työskentelet aineistoilla, jotka sisältävät maailmanlaajuisia näytteitä, kameran jakauma on yleensä kapea, ja tällaisissa tapauksissa kehyksessä on löydettävä tasapaino eri kamerapolkujen monipuolisuuden ja yksittäisen kameran polun monimutkaisuuden välillä. Yksittäisen kameran polun monimutkaisuus varmistaa, että malli oppii ohjata monimutkaisia polkuja koulutusprosessissa, kun taas eri kamerapolkujen monipuolisuus varmistaa, että malli ei ylikouluta tiettyihin kiinteisiin malleihin. Lisäksi kameran koulutusprosessin seuraamiseksi CameraCtrl-kehyksessä ehdotetaan kameran linjausmittaria ohjauslaadun mittaamiseksi kameran polun virheen määräämiseksi luodun näytteen ja syötteen kameran ehtojen välillä.
CameraCtrl: Kokeet ja tulokset
CameraCtrl-kehyksessä toteutetaan AnimateDiff-malli perustana tekstistä videoon mallina, ja yksi syy tähän on, että AnimateDiff-mallin koulutusstrategia sallii sen liikkeen moduulin integroida tekstistä kuvaan perusmalleihin tai tekstistä kuvaan LoRA- malleihin sovelluksissa eri tyypeissä ja aloissa. Malli käyttää Adam- optimoijaa kouluttaa mallia vakion oppimisnopeudella 1e-4. Lisäksi varmistamaan, että malli ei vaikuta videon luomiskykyyn alkuperäisessä tekstistä videoon mallissa negatiivisesti, CameraCtrl-kehyksessä käytetään FID- eli Frechet Inception Distance- mittaria arvioidaakseen videon ulkonäön laatua ja vertailee luodun videon laatua ennen ja jälkeen kameramoduulin sisällyttämistä.
Arvioidakseen sen suorituskyvyn, CameraCtrl-kehyksessä verrataan kahteen olemassa olevaan kameran ohjauskehykseen: MotionCtrl ja AnimateDiff. Kuitenkin, koska AnimateDiff-kehyksessä on tuki ainoastaan kahdeksalle perus kamerapolulle, vertailu CameraCtrl ja AnimateDiff on rajoitettu kolmeen peruspolkuun. Toisaalta MotionCtrl- kehyksen vertailussa kehyksessä valitaan yli tuhat satunnaista kamerapolkua olemassa olevasta tietoaineistosta lisäksi perus kamerapolkuja, luodaan videoita näillä poluilla ja arvioidaan niitä TransErr- ja RotErr- mittareilla.

Kuten voidaan havaita, CameraCtrl-kehyksessä ylittää AnimateDiff- kehyksen peruspolulla ja toimittaa parempia tuloksia verrattuna MotionCtrl- kehykseen monimutkaisen polun mittarilla.
Lisäksi seuraava kuva osoittaa kameran kooderin arkkitehtuurin vaikutuksen luodun näytteen laatuun. Rivi a – Rivi d edustavat tuloksia, jotka on luotu kameran kooderin toteuttamisella arkkitehtuuriin: ControlNet, ControlNet temporal- huomion kanssa, T2I- sovittimen ja T2I- sovittimen temporal- huomion kanssa.

Seuraavassa kuvassa ensimmäinen kaksi näyttää videoita, jotka on luotu yhdistämällä SparseCtrl- kehyksen RGB- kooderin ja menetelmää, jota käytetään CameraCtrl- kehyksessä.

Lopputulet
Tässä artikkelissa olemme puhuneet CameraCtrl: stä, uudesta ideasta, joka pyrkii mahdollistamaan tarkan kameran asennon ohjauksen tekstistä videoon malleille. Kameran polun parametrin jälkeen tarkasti, malli kouluttaa plug and play -kameramoduulin tekstistä videoon malliin ja jättää muut komponentit koskemattomiksi. Lisäksi CameraCtrl-malli suorittaa kattavan tutkimuksen eri tietoaineistojen vaikutuksesta ja ehdottaa, että videot, joilla on samanlaiset ulkonäkö ja monipuolinen kamerajakauma, voivat parantaa mallin ohjattavuutta ja yleistettävyyttä. Kokeet, jotka suoritetaan CameraCtrl-mallin suorituskyvyn analysointiin reaaliavusteisissa tehtävissä, osoittavat kehyksen tehokkuuden tarkassa ja aluekohtaisessa kameran ohjauksessa, joka mahdollistaa mukautettujen ja dynaamisten videoiden luomisen kameran asennon ja tekstisyötteiden perusteella.












