AI-modeller og plattformer
CameraCtrl: Enabling Camera Control for Text-to-Video Generation
De siste rammeverkene som prøver å generere tekst til video eller T2V, utnytter diffusjonsmodeller for å legge til stabilitet i treningsprosessen, og Video Diffusion Model, en av pionerene i tekst-til-video-rammeverk, utvider en 2D-bilde diffusjonsarkitektur i et forsøk på å tilpasse video-data, og trene modellen på video og bilde sammen fra scratch. Bygging på det samme, og for å implementere en kraftig forhånds-trent bildegenerator som Stable Diffusion, har nyere arbeid blåst opp deres 2D-arkitektur ved å interpolere tidslag mellom de forhånds-trente 2D-lagene, og finjustere den nye modellen på usette store datasett. Til tross for deres tilnærming, møter tekst-til-video-diffusjonsmodellene en betydelig utfordring siden usikkerheten ved å bruke kun tekstbeskrivelser til å generere videoeksemplet ofte resulterer i at tekst-til-video-modellen har svakere kontroll over genereringen. For å takle denne begrensningen, gir noen modeller forbedret veiledning, mens andre arbeider med presise signaler for å kontrollere scenen eller menneskelige bevegelser i de syntetiske videoene nøyaktig. På den andre siden, finnes det noen tekst-til-video-rammeverk som adopterer bilder som kontrollsignalet til video-generatoren, med resultat i enten en nøyaktig tidsmessig relasjonsmodellering eller høy video-kvalitet.
Det ville være trygt å si at kontrollerbarhet spiller en avgjørende rolle i bilde- og video-generative oppgaver, siden det tillater brukerne å lage innhold de ønsker. Men, eksisterende rammeverk ser ofte bort fra den nøyaktige kontrollen over kamera-posen som fungerer som et kinematisk språk for å uttrykke dyptere narrative nyanser til modellen bedre. For å takle de nåværende kontrollerbarhetsbegrensningene, vil vi i denne artikkelen diskutere CameraCtrl, en ny idé som forsøker å aktivere nøyaktig kamera-pose-kontroll for tekst-til-video-modeller. Etter å parameterisere kameraets trajektori nøyaktig, trener modellen en plug-and-play-kameramodul på en tekst-til-video-modell, og lar de andre komponentene være uberørt. Videre, gjennomfører CameraCtrl-modellen også en omfattende studie på effekten av ulike datasett, og foreslår at videoer med lignende utseende og divers kameradistribusjon kan forbedre den totale kontrollerbarheten og generaliserbarheten til modellen. Eksperimenter som er gjennomført for å analysere ytelsen til CameraCtrl-modellen på virkelige oppgaver, indikerer effektiviteten til rammeverket i å oppnå nøyaktig og domene-adaptiv kamera-kontroll, og åpner en vei fremover for å drive på tilpasset og dynamisk video-generering fra kamera-pose og tekstuelle inndata.
Denne artikkelen har som mål å dekke CameraCtrl-rammeverket i dybden, og vi utforsker mekanismen, metoden, arkitekturen til rammeverket sammen med dens sammenligning med state-of-the-art-rammeverk. Så la oss komme i gang.
CameraCtrl : Kamera-kontroll for T2V-generering
De siste års utvikling og fremgang i diffusjonsmodellene har fremmet tekst-styrt video-generering betydelig, og revolusjonert innhold-design-arbeidsflyten. Kontrollerbarhet spiller en betydelig rolle i praktiske video-genererings-applikasjoner, siden det tillater brukerne å tilpasse de genererte resultater etter deres behov og krav. Med høy kontrollerbarhet, kan modellen forbedre realisme, kvalitet og brukbarheten til videoene den genererer, og mens tekst- og bildeinndata ofte brukes av modeller for å forbedre den totale kontrollerbarheten, mangler de ofte nøyaktig kontroll over bevegelse og innhold. For å takle denne begrensningen, har noen rammeverk foreslått å utnytte kontrollsignaler som posisjons-skelett, optisk strøm og andre multi-modale signaler for å aktivere mer nøyaktig kontroll for å guide video-generering. En annen begrensning som eksisterende rammeverk møter, er at de mangler nøyaktig kontroll over å stimulere eller justere kamera-punkter i video-generering, siden evnen til å kontrollere kameraet er avgjørende, siden det ikke bare forbedrer realisme i de genererte videoene, men også tillater tilpassede visninger, og forbedrer bruker-engasjement, en funksjon som er essensiell i spill-utvikling, forbedret virkelighet og virtuell virkelighet. Videre, tillater dyktig håndtering av kamera-bevegelser skapere å fremheve karakter-relasjoner, betone emosjoner og guide fokus til mål-gruppen, noe som er av stor betydning i film- og reklame-industrien.
For å takle og overvinne disse begrensningene, har CameraCtrl-rammeverket en lærbart og nøyaktig plug-and-play-kameramodul med evnen til å kontrollere kameraets visninger for video-generering. Men, å integrere en tilpasset kamera i en eksisterende tekst-til-video-modell-pipeline er en oppgave som er lettere sagt enn gjort, og tvinger CameraCtrl-rammeverket til å finne måter å representere og injicere kameraet i modell-arkitekturen effektivt. På samme måte, adopterer CameraCtrl-rammeverket plucker-embeddings som primær form for kamera-parametre, og grunnen til å velge plucker-embeddings kan tilskrives deres evne til å kode geometriske beskrivelser av kamera-pose-informasjon. Videre, for å sikre generaliserbarheten og anvendeligheten til CameraCtrl-modellen etter trening, innfører modellen en kamera-kontroll-modell som bare aksepterer plucker-embeddings som inndata. For å sikre at kamera-kontroll-modellen er trenet effektivt, gjennomfører rammeverket og utviklerne en omfattende studie for å undersøke hvordan ulike trening-data påvirker rammeverket fra syntetiske til realistiske data. De eksperimentelle resultater indikerer at implementering av data med divers kamera-pose-distribusjon og lignende utseende til den opprinnelige basis-modellen oppnår den beste avveiingen mellom kontrollerbarhet og generaliserbarhet. Utviklerne av CameraCtrl-rammeverket har implementert modellen på toppen av AnimateDiff-rammeverket, og har dermed aktivert nøyaktig kontroll i video-generering over ulike tilpassede, og demonstrerer dens fleksibilitet og nytte i en rekke video-oppbyggings-kontekster.

AnimateDiff-rammeverket adopterer den effektive LoRA-finjusterings-tilnærmingen for å oppnå vektene til modellen for ulike typer skudd. Direct-a-video-rammeverket foreslår å implementere en kamera-embedder for å kontrollere posisjonen til kameraet under video-genererings-prosessen, men det konditionerer bare på tre kamera-parametre, og begrenser kontroll-evnen til kameraet til de mest grunnleggende typene. På den andre siden, har rammeverk som MotionCtrl designet en bevegelses-kontroller som aksepterer mer enn tre inndata-parametre og kan produsere videoer med mer komplekse kamera-pose. Men, behovet for å finjustere deler av de genererte videoene hemmer generaliserbarheten til modellen. Videre, har noen rammeverk inkorporert ekstra strukturelle kontrollsignaler som dybde-kart til prosessen for å forbedre kontrollerbarheten for både bilde- og tekst-generering. Typisk, matar modellen disse kontroll-signaler inn i en ekstra encoder, og injiserer signalene inn i en generator ved hjelp av ulike operasjoner.
CameraCtrl: Modell-arkitektur
Før vi kan se på arkitekturen og trenings-paradigmet for kamera-encoderen, er det viktig for oss å forstå ulike kamera-representasjoner. Typisk, refererer en kamera-pose til intrinsiske og ekstrinsiske parametre, og en av de rett fremre valgene for å la en video-generator konditionere på kamera-posen, er å mate inn rå-verdier relatert til kamera-parametrene inn i generatoren. Men, å implementere en slik tilnærming, kan kanskje ikke forbedre nøyaktig kamera-kontroll, av flere grunner. Først, mens rotasjons-matrisen er begrenset av ortogonalitet, er translasjons-vektoren vanligvis ubegrenset i størrelse, og fører til en mismatch i lære-prosessen som kan påvirke konsistensen til kontrollen. Andre, å bruke rå kamera-parametre direkte, kan gjøre det vanskelig for modellen å korrelere disse verdiene med bilde-piksler, og resultere i redusert kontroll over visuelle detaljer. For å unngå disse begrensningene, velger CameraCtrl-rammeverket plucker-embeddings som representasjon for kamera-posen, siden plucker-embeddings har geometriske representasjoner av hver piksel i video-rammen, og kan gi en mer omfattende beskrivelse av kamera-pose-informasjonen.
Kamera-kontrollerbarhet i video-generatorene
Ettersom modellen parameteriserer kameraets trajektori inn i en plucker-embeddings-sekvens, dvs. romlige kart, har modellen valget til å bruke en encoder-modell til å trekke ut kamera-egenskapene, og deretter fusjonere kamera-egenskapene inn i video-generatorene. Lignende til tekst-til-bilde-adapter, innfører CameraCtrl-modellen en kamera-encoder designet spesielt for videoer. Kamera-encoderen inkluderer en tids-oppmerksomhets-modell etter hver konvolusjons-blokk, og tillater den å fange tidsmessige relasjoner til kamera-pose gjennom hele video-klippet. Som demonstrert i følgende bilde, aksepterer kamera-encoderen bare plucker-embeddings-inndata, og leverer multi-skala-egenskaper. Etter å ha fått multi-skala kamera-egenskaper, har CameraCtrl-modellen som mål å integrere disse egenskapene inn i U-net-arkitekturen til tekst-til-video-modellen, og bestemmer lagene som skal brukes til å inkorporere kamera-informasjonen effektivt. Videre, siden de fleste eksisterende rammeverkene adopterer en U-Net-lignende arkitektur som inneholder både tids- og rom-oppmerksomhets-lag, injiserer CameraCtrl-modellen kamera-representasjonene inn i tids-oppmerksomhets-blokken, et valg som støttes av evnen til tids-oppmerksomhets-lagene til å fange tidsmessige relasjoner, og sammenfaller med den innebygde kausale og sekvensielle naturen til en kamera-trajektori med rom-oppmerksomhets-lagene som fremstiller de enkelte rammer.

Læring av kamera-distribusjoner
Trenings-kamera-encoder-komponenten innenfor CameraCtrl-rammeverket på en video-generator, krever en stor mengde godt merket og annotert videoer, og modellen kan oppnå kamera-trajektori ved hjelp av struktur fra bevegelse eller SfM-tilnærming. CameraCtrl-rammeverket forsøker å velge datasettet med utseende som matcher treningsdataene til basis-tekst-til-video-modellen nært, og har en kamera-pose-distribusjon så bred som mulig. Eksempler i datasettet generert ved hjelp av virtuelle motorer, viser divers kamera-distribusjon, siden utviklerne har fleksibiliteten til å kontrollere kamera-parametrene under rendering-fasen, selv om det lider under en distribusjons-gap når det sammenlignes med datasett som inneholder virkelige eksempler. Når det arbeides med datasett som inneholder virkelige eksempler, er distribusjonen av kameraet vanligvis smal, og i slike tilfeller, må rammeverket finne en balanse mellom diversitet blant ulike kamera-trajektorier og kompleksiteten til den enkelte kamera-trajektori. Kompleksiteten til den enkelte kamera-trajektori sikrer at modellen lærer å kontrollere komplekse trajektorier under treningsprosessen, mens diversiteten blant ulike kamera-trajektorier sikrer at modellen ikke over-fitter til bestemte faste mønster. Videre, for å overvåke treningsprosessen til kamera-encoderen, foreslår CameraCtrl-rammeverket kamera-justerings-målet til å måle kontroll-kvaliteten til kameraet ved å kvantifisere feilen mellom kamera-trajektori til de genererte eksemplene og inndata-kamera-betingelser.
CameraCtrl : Eksperimenter og resultater
CameraCtrl-rammeverket implementerer AnimateDiff-modellen som sin basis-tekst-til-video-modell, og en viktig grunn til dette er at trenings-strategien til AnimateDiff-modellen tillater dens bevegelses-modul til å integrere med tekst-til-bilde-basemodeller eller tekst-til-bilde-LoRAs for å tilpasse video-generering over ulike sjangere og domener. Modellen bruker Adam-optimizer til å trene modellen med en konstant lærings-rate på 1e-4. Videre, for å sikre at modellen ikke påvirker video-genererings-egenskapene til den opprinnelige tekst-til-video-modellen negativt, bruker CameraCtrl-rammeverket FID eller Frechet Inception Distance-målet til å vurdere utseende-kvaliteten til videoen, og sammenligner kvaliteten til den genererte videoen før og etter inkludering av kamera-modulen.
For å vurdere dens ytelse, blir CameraCtrl-rammeverket evaluert mot to eksisterende kamera-kontroll-rammeverk: MotionCtrl og AnimateDiff. Men, siden AnimateDiff-rammeverket har støtte for bare åtte grunnleggende kamera-trajektorier, er sammenligningen mellom CameraCtrl og AnimateDiff begrenset til tre grunnleggende trajektorier. På den andre siden, for sammenligning mot MotionCtrl, velger rammeverket over tusen tilfeldige kamera-trajektorier fra eksisterende datasett, i tillegg til basis-kamera-trajektorier, genererer videoer ved hjelp av disse trajektoriene, og vurderer dem ved hjelp av TransErr og RotErr-målene.

Som det kan observeres, overgår CameraCtrl-rammeverket AnimateDiff-rammeverket i grunnleggende trajektori, og leverer bedre resultater når sammenlignet med MotionCtrl-rammeverket på kompleks trajektori-målet.
Videre, demonstrerer følgende figur effekten av kamera-encoder-arkitekturen på den totale kvaliteten til de genererte eksemplene. Rad a til Rad d representerer resultatene generert med kamera-encoder implementert i arkitekturen: ControlNet, ControlNet med tids-oppmerksomhet, T2I-adapter, og T2I-adapter med tids-oppmerksomhet, henholdsvis.

I følgende figur, viser de første to eksemplene videoen generert ved hjelp av en kombinasjon av SparseCtrl-rammeverkets RGB-encoder, og metoden brukt i CameraCtrl-rammeverket.

Slutt-tanker
I denne artikkelen, har vi diskutert CameraCtrl, en ny idé som forsøker å aktivere nøyaktig kamera-pose-kontroll for tekst-til-video-modeller. Etter å parameterisere kameraets trajektori nøyaktig, trener modellen en plug-and-play-kameramodul på en tekst-til-video-modell, og lar de andre komponentene være uberørt. Videre, gjennomfører CameraCtrl-modellen også en omfattende studie på effekten av ulike datasett, og foreslår at videoer med lignende utseende og divers kamera-distribusjon kan forbedre den totale kontrollerbarheten og generaliserbarheten til modellen. Eksperimenter som er gjennomført for å analysere ytelsen til CameraCtrl-modellen på virkelige oppgaver, indikerer effektiviteten til rammeverket i å oppnå nøyaktig og domene-adaptiv kamera-kontroll, og åpner en vei fremover for å drive på tilpasset og dynamisk video-generering fra kamera-pose og tekstuelle inndata.












