AI-modeller og platforme
CameraCtrl: Aktivering af kamerakontrol til tekst-til-video-generering
De seneste rammer, der forsøger at generere tekst til video eller T2V-generering, udnytter diffusionsmodeller til at tilføje stabilitet i deres træningsproces, og Video Diffusion Model, en af pionererne i tekst til video-genereringsrammer, udvider en 2D-billeddiffusionsarkitektur i et forsøg på at tilpasse video-data og træne modellen på video og billeder sammen fra scratch. Bygning på dette, og for at implementere en kraftfuld forudtrænet billedgenerator som Stable Diffusion, har nyere arbejder udvidet deres 2D-arkitektur ved at interpolere tidslag mellem de forudtrænede 2D-lag og finjustere den nye model på usete store datasæt. Trods deres tilgang står tekst til video-diffusionsmodeller over for en betydelig udfordring, da tvivlsomheden ved kun at bruge tekstbeskrivelser til at generere videoeksemplet ofte resulterer i, at tekst til video-modellen har svagere kontrol over generationen. For at tackle denne begrænsning giver nogle modeller forbedret vejledning, mens andre arbejder med præcise signaler til at kontrollere scenen eller menneskelige bevægelser i de syntetiserede videoer præcist. På den anden side er der få tekst til video-rammer, der antager billeder som kontrollignaler til video-generatoren, hvilket resulterer i enten en præcis tidsmæssig relationsmodel eller høj video-kvalitet.
Det ville være sikkert at sige, at kontrollabilitet spiller en afgørende rolle i billed- og video-generative opgaver, da det tillader brugerne at oprette det indhold, de ønsker. Men eksisterende rammer overser ofte den præcise kontrol over kamerapositionen, der fungerer som et filmisk sprog til at udtrykke de dybere fortællingens nuancer bedre til modellen. For at tackle de nuværende kontrollabilitetsbegrænsninger vil vi i denne artikel tale om CameraCtrl, en ny idé, der forsøger at aktivere præcis kamera-pose-kontrol for tekst til video-modeller. Efter at have parameteriseret kameraets trajektorie præcist træner modellen en plug-and-play-kameramodul på en tekst til video-model og lader de andre komponenter være uberørte. Desuden gennemfører CameraCtrl-modellen også en omfattende undersøgelse af effekten af forskellige datasæt og foreslår, at videoer med lignende udseende og divers kameradistribution kan forbedre den samlede kontrollabilitet og generaliserings-evnerne hos modellen. Eksperimenter, der er gennemført for at analysere CameraCtrl-modellens præstation på virkelige opgaver, indikerer effektiviteten af rammen i opnåelse af præcis og domæne-tilpasningsbar kamera-kontrol, hvilket baner vej for forfølgelsen af tilpasset og dynamisk video-generering fra kamera-pose og tekst-input.
Denne artikel har til formål at dække CameraCtrl-rammen i dybden, og vi udforsker mekanismen, metoden, arkitekturen i rammen samt dens sammenligning med state-of-the-art-rammer. Så lad os komme i gang.
CameraCtrl: Kamera-kontrol til T2V-generering
Den seneste udvikling og fremgang af diffusionsmodeller har avanceret tekst-guidet video-generering betydeligt i de seneste år og revolutioneret indholdets design-workflows. Kontrollabilitet spiller en betydelig rolle i praktiske video-genererings-applikationer, da det tillader brugerne at tilpasse de genererede resultater efter deres behov og krav. Med høj kontrollabilitet kan modellen forbedre realismen, kvaliteten og brugbarheden af de videoer, den genererer, og mens tekst- og billed-input ofte bruges af modeller til at forbedre den samlede kontrollabilitet, mangler de ofte præcis kontrol over bevægelse og indhold. For at tackle denne begrænsning har nogle rammer foreslået at udnytte kontrollignaler som pose-skelet, optisk flow og andre multi-modale signaler til at aktivere mere præcis kontrol til at guide video-generering. En anden begrænsning, som eksisterende rammer står over for, er, at de mangler præcis kontrol over at stimulere eller justere kamera-punkter i video-generering, da evnen til at kontrollere kameraet er afgørende, da det ikke kun forbedrer realismen af de genererede videoer, men også tillader tilpassede synspunkter, hvilket også forbedrer brugerengagement, en funktion, der er afgørende i spiludvikling, forstærket virkelighed og virtuel virkelighed. Desuden tillader det at kontrollere kamera-bevægelser færdigt at skabere relationer mellem karakterer, fremhæve følelser og guide fokus af målgruppen, noget, der er af stor betydning i film- og reklame-industrien.
For at tackle og overvinde disse begrænsninger er CameraCtrl-rammen, en lærbare og præcis plug-and-play-kameramodul med evnen til at kontrollere kameraets synspunkter til video-generering. Men integration af en tilpasset kamera i en eksisterende tekst til video-model-pipeline er en opgave, der er lettere sagt end gjort, hvilket tvinger CameraCtrl-rammen til at søge efter måder at repræsentere og injicere kameraet i modellens arkitektur effektivt. På samme måde antager CameraCtrl-rammen plucker-embeddings som den primære form for kamera-parametre, og årsagen til at vælge plucker-embeddings kan tilskrives deres evne til at kodificere geometriske beskrivelser af kamera-pose-informationen. Desuden for at sikre generaliserbarheden og anvendeligheden af CameraCtrl-modellen efter træning introducerer modellen en kamera-kontrol-model, der kun accepterer plucker-embeddings som input. For at sikre, at kamera-kontrol-modellen er trænet effektivt, gennemfører rammen og dens udviklere en omfattende undersøgelse for at undersøge, hvordan forskellige træningsdata påvirker rammen fra syntetisk til realistisk data. De eksperimentelle resultater indikerer, at implementering af data med divers kamera-pose-distribution og lignende udseende til den oprindelige base-model opnår den bedste balance mellem kontrollabilitet og generaliserbarhed. Udviklerne af CameraCtrl-rammen har implementeret modellen oven på AnimateDiff-rammen, hvilket muliggør præcis kontrol i video-generering på tværs af forskellige personlige kontekster, hvilket demonstrerer dets fleksibilitet og nytte i en bred vifte af video-creations-kontekster.

AnimateDiff-rammen antager den effektive LoRA-fine-tuning-tilgang til at opnå modellens vægte for forskellige typer skud. Direct-a-video-rammen foreslår at implementere en kamera-embedder til at kontrollere kameraets pose under video-genereringsprocessen, men det betingelses kun på tre kamera-parametre, hvilket begrænser kameraets kontrol-evne til de mest grundlæggende typer. På den anden side designer MotionCtrl-rammen en bevægelses-kontroller, der accepterer mere end tre input-parametre og kan producere videoer med mere komplekse kamera-pose. Men behovet for at finjustere dele af de genererede videoer hæmmer modellens generaliserbarhed. Desuden inkorporerer nogle rammer yderligere struktur-kontrollignaler som dybde-kort i processen til at forbedre kontrollabiliteten for både billed- og tekst-generering. Typisk føder modellen disse kontrollignaler ind i en ekstra encoder og injicere derefter signalerne ind i en generator ved hjælp af forskellige operationer.
CameraCtrl: Model-arkitektur
Før vi kan se på arkitekturen og træningsparadigmet for kamera-encoderen, er det vigtigt for os at forstå forskellige kamera-repræsentationer. Typisk henviser en kamera-pose til intrinsiske og ekstrinsiske parametre, og en af de mest direkte valgmuligheder for at lade en video-generator betingelse på kamera-posen er at føde rå værdier om kamera-parametrene ind i generatoren. Men implementering af en sådan tilgang kan måske ikke forbedre præcis kamera-kontrol af flere årsager. Først er rotations-matrixen begrænset af ortogonalitet, mens translations-vektoren typisk er ubegrænset i størrelse og fører til en mismatch i læreprocessen, der kan påvirke konsistensen af kontrol. Anden er det, at brug af rå kamera-parametre direkte kan gøre det svært for modellen at korrelere disse værdier med billed-pixler, hvilket resulterer i reduceret kontrol over visuelle detaljer. For at undgå disse begrænsninger vælger CameraCtrl-rammen plucker-embeddings som repræsentation for kamera-posen, da plucker-embeddings har geometriske repræsentationer af hver pixel i video-rammen og kan give en mere detaljeret beskrivelse af kamera-pose-informationen.
Kamera-kontrollabilitet i video-generatore
Da modellen parameteriserer kameraets trajektorie i en plucker-embedding-sekvens, dvs. rumlige kort, har modellen mulighed for at bruge en encoder-model til at trække kamera-funktionerne ud og derefter fusere kamera-funktionerne ind i video-generatoren. Lignende til tekst til billed-adapter introducerer CameraCtrl-modellen en kamera-encoder, der er specialiseret til videoer. Kamera-encoderen inkluderer en tidsmæssig opmærksomheds-model efter hver convolutionel blok, hvilket tillader den at fange tidsmæssige relationer af kamera-pose gennem video-klippet. Som demonstreret i følgende billede accepterer kamera-encoderen kun plucker-embedding-input og leverer multi-skala-funktioner. Efter at have opnået multi-skala kamera-funktioner sigter CameraCtrl-modellen til at integrere disse funktioner i U-Net-arkitekturen af tekst til video-modellen sammenhængende og bestemmer, hvilke lag der skal bruges til at inkorporere kamera-informationen effektivt. Desuden, da de fleste eksisterende rammer antager en U-Net-lignende arkitektur, der indeholder både tidsmæssige og rumlige opmærksomheds-lag, injicere CameraCtrl-modellen kamera-repræsentationerne ind i den tidsmæssige opmærksomheds-blok, en beslutning, der støttes af evnen til at fange tidsmæssige relationer, der stemmer overens med den indre årsagssammenhæng og sekventielle natur af en kamera-trajektorie med rumlige opmærksomheds-lag, der billeder de enkelte billeder.

Lærings-kamera-distribution
Træning af kamera-encoder-komponenten inden for CameraCtrl-rammen på en video-generator kræver en stor mængde vel-labelede og annoterede videoer, hvor modellen kan opnå kamera-trajektorien ved hjælp af en struktur fra bevægelses-tilgang. CameraCtrl-rammen forsøger at vælge datasættet med udseende, der matcher træningsdata af base-tekst til video-modellen tæt, og har en kamera-pose-distribution så bred som muligt. Eksempler i datasættet, der er genereret ved hjælp af virtuelle motorer, viser divers kamera-distribution, da udviklerne har mulighed for at kontrollere kamera-parametrene under renderings-fasen, selvom det lider under en distributions-lucke i forhold til datasæt, der indeholder virkelige eksempler. Når man arbejder med datasæt, der indeholder virkelige eksempler, er kamera-distributionen typisk smal, og i sådanne tilfælde skal rammen finde en balance mellem diversitet mellem forskellige kamera-trajektorier og kompleksiteten af den enkelte kamera-trajektorie. Kompleksiteten af den enkelte kamera-trajektorie sikrer, at modellen lærer at kontrollere komplekse trajektorier under træningsprocessen, mens diversiteten mellem forskellige kamera-trajektorier sikrer, at modellen ikke over-fitting til bestemte faste mønstre. Desuden for at overvåge træningsprocessen for kamera-encoderen foreslår CameraCtrl-rammen kamera-justerings-målet til at måle kontrol-kvaliteten af kameraet ved at kvantificere fejlen mellem kamera-trajektorien af de genererede eksempler og input-kamera-betingelserne.
CameraCtrl: Eksperimenter og resultater
CameraCtrl-rammen implementerer AnimateDiff-modellen som dens base-tekst til video-model, og en af hovedårsagerne til dette er, at træningsstrategien for AnimateDiff-modellen tillader dens bevægelses-modul til at integrere med tekst til billed-base-modeller eller tekst til billed-LoRAs til at tilpasse video-generering på tværs af forskellige genrer og domæner. Modellen bruger Adam-optimizeren til at træne modellen med en konstant læringsrate på 1e-4. Desuden for at sikre, at modellen ikke påvirker video-genererings-evnerne af den oprindelige tekst til video-model negativt, bruger CameraCtrl-rammen FID eller Frechet Inception Distance-målet til at vurdere udseendet af videoen og sammenligner kvaliteten af den genererede video før og efter inklusion af kamera-modulen.
For at vurdere dens præstation evalueres CameraCtrl-rammen mod to eksisterende kamera-kontrol-rammer: MotionCtrl og AnimateDiff. Men da AnimateDiff-rammen kun har støtte til otte grundlæggende kamera-trajektorier, er sammenligningen mellem CameraCtrl og AnimateDiff begrænset til tre grundlæggende trajektorier. På den anden side vælger rammen mere end tusind tilfældige kamera-trajektorier fra eksisterende datasæt i tillæg til base-kamera-trajektorier, genererer videoer ved hjælp af disse trajektorier og vurderer dem ved hjælp af TransErr og RotErr-målene.

Som det kan observeres, overgår CameraCtrl-rammen AnimateDiff-rammen i grundlæggende trajektorie og leverer bedre resultater, når sammenlignet med MotionCtrl-rammen på kompleks trajektorie-målet.
Desuden demonstrerer følgende figur effekten af kamera-encoder-arkitekturen på den samlede kvalitet af de genererede eksempler. Række a til række d repræsenterer resultaterne, der er genereret med kamera-encoder implementeret i arkitekturen: ControlNet, ControlNet med tidsmæssig opmærksomhed, T2I-adapter og T2I-adapter med tidsmæssig opmærksomhed.

I følgende figur viser de første to billeder videoen, der er genereret ved hjælp af en kombination af SparseCtrl-rammens RGB-encoder og metoden, der er brugt i CameraCtrl-rammen.

Endelige tanker
I denne artikel har vi talt om CameraCtrl, en ny idé, der forsøger at aktivere præcis kamera-pose-kontrol for tekst til video-modeller. Efter at have parameteriseret kameraets trajektorie præcist træner modellen en plug-and-play-kameramodul på en tekst til video-model og lader de andre komponenter være uberørte. Desuden gennemfører CameraCtrl-modellen også en omfattende undersøgelse af effekten af forskellige datasæt og foreslår, at videoer med lignende udseende og divers kamera-distribution kan forbedre den samlede kontrollabilitet og generaliserbarhed hos modellen. Eksperimenter, der er gennemført for at analysere CameraCtrl-modellens præstation på virkelige opgaver, indikerer effektiviteten af rammen i opnåelse af præcis og domæne-tilpasningsbar kamera-kontrol, hvilket baner vej for forfølgelsen af tilpasset og dynamisk video-generering fra kamera-pose og tekst-input.












