AI-modeller och plattformar
CameraCtrl: Möjliggör kamerakontroll för text-till-video-generering
De senaste ramverken som försöker skapa text-till-video eller T2V-generering använder diffusionsmodeller för att lägga till stabilitet i sin utbildningsprocess, och Video Diffusion Model, en av pionjärerna inom text-till-video-genereringsramverk, utvidgar en 2D-bild diffusionsarkitektur i ett försök att anpassa sig till videodata, och utbildar modellen på video och bild gemensamt från scratch. Genom att bygga på detta och för att implementera en kraftfull förtränad bildgenerator som Stable Diffusion, har nyliga arbeten inflaterat sin 2D-arkitektur genom att växla temporal lager mellan de förtränade 2D-lagren, och finjusterar den nya modellen på osedda stora dataset. Trots deras tillvägagångssätt möter text-till-video-diffusionsmodeller en betydande utmaning eftersom tvetydigheten hos enbart använda textbeskrivningar för att generera videoprovet ofta resulterar i att text-till-video-modellen har svagare kontroll över genereringen. För att tackla denna begränsning tillhandahåller vissa modeller förbättrad vägledning medan andra arbetar med precisa signaler för att kontrollera scenen eller mänskliga rörelser i de syntetiserade videorna exakt. Å andra sidan finns det några text-till-video-ramverk som antar bilder som kontrollsignalen till videogenereringen, vilket resulterar i antingen en exakt temporal relationsmodellering eller hög videokvalitet.
Det vore säkert att säga att kontrollerbarhet spelar en avgörande roll i bild- och videogenereringsuppgifter eftersom det tillåter användare att skapa den innehåll de önskar. Men existerande ramverk försummar ofta den precisa kontrollen av kameraposition som fungerar som ett filmiskt språk för att uttrycka de djupare berättande nyanserna till modellen bättre. För att tackla de nuvarande kontrollerbarhetsbegränsningarna kommer vi i denna artikel att tala om CameraCtrl, en ny idé som försöker möjliggöra exakt kamerapositionskontroll för text-till-video-modeller. Efter att ha parameteriserat kamerans bana exakt, utbildar modellen en plug-and-play-kameramodul på en text-till-video-modell och lämnar de andra komponenterna orörda. Dessutom genomför CameraCtrl-modellen också en omfattande studie om effekten av olika dataset och föreslår att videor med liknande utseende och varierad kameradistribution kan förbättra den övergripande kontrollerbarheten och generaliserbarheten hos modellen. Experiment som genomförts för att analysera prestandan hos CameraCtrl-modellen på verkliga uppgifter indikerar effektiviteten hos ramverket i att uppnå exakt och domänanpassad kamerakontroll, vilket banar väg för att skapa anpassad och dynamisk videogenerering från kameraposition och textinmatningar.
Denna artikel syftar till att täcka CameraCtrl-ramverket i detalj, och vi utforskar mekanismen, metodiken, arkitekturen i ramverket samt dess jämförelse med state-of-the-art-ramverk. Så låt oss komma igång.
CameraCtrl: Kamerakontroll för T2V-generering
Den senaste utvecklingen och framstegen inom diffusionsmodeller har avsevärt förbättrat textstyrd videogenerering under de senaste åren och revolutionerat innehållsdesignflödena. Kontrollerbarhet spelar en betydande roll i praktiska videogenereringsapplikationer eftersom det tillåter användare att anpassa de genererade resultaten enligt deras behov och krav. Med hög kontrollerbarhet kan modellen förbättra realismen, kvaliteten och användbarheten hos de videor den genererar, och medan text- och bildinmatningar används vanligtvis av modeller för att förbättra den övergripande kontrollerbarheten, saknar de ofta exakt kontroll över rörelse och innehåll. För att tackla denna begränsning har vissa ramverk föreslagit att man ska utnyttja kontrollsignaler som poseringsskelett, optisk flöde och andra multimodala signaler för att möjliggöra mer exakt kontroll för att styra videogenerering. En annan begränsning som existerande ramverk står inför är att de saknar exakt kontroll över att stimulera eller justera kamerapunkter i videogenerering, eftersom förmågan att kontrollera kameran är avgörande, inte bara för att förbättra realismen hos de genererade videorna, utan också för att tillåta anpassade vypunkter, vilket förbättrar användarengagemanget, en funktion som är avgörande i spelutveckling, förstärkt verklighet och virtuell verklighet. Dessutom möjliggör skicklig hantering av kamerarörelser att skaparna kan betona karaktärsrelationer, betona känslor och styra fokus för målgruppen, något som är av stor vikt i film- och reklamindustrin.
För att tackla och övervinna dessa begränsningar är CameraCtrl-ramverket, en lärd och exakt plug-and-play-kameramodul med förmågan att kontrollera kameravyerna för videogenerering. Men att integrera en anpassad kamera i en befintlig text-till-video-modellpipeline är en uppgift som är lättare sagt än gjort, vilket tvingar CameraCtrl-ramverket att leta efter sätt att representera och injicera kameran i modellarkitekturen effektivt. På samma sätt antar CameraCtrl-ramverket plucker-embeddingar som den primära formen av kameraparametrar, och anledningen till att välja plucker-embeddingar kan tillskrivas deras förmåga att koda geometriska beskrivningar av kamerapositionsinformationen. Dessutom, för att säkerställa generaliserbarheten och tillämpligheten hos CameraCtrl-modellen efter utbildning, introducerar modellen en kamerakontrollmodell som endast accepterar plucker-embeddingar som inmatning. För att säkerställa att kamerakontrollmodellen utbildas effektivt, genomför ramverket och dess utvecklare en omfattande studie för att undersöka hur olika utbildningsdata påverkar ramverket från syntetiska till realistiska data. De experimentella resultaten indikerar att implementering av data med varierad kamerapositionsfördelning och liknande utseende till den ursprungliga basmodellen uppnår den bästa avvägningen mellan kontrollerbarhet och generaliserbarhet. Utvecklarna av CameraCtrl-ramverket har implementerat modellen ovanpå AnimateDiff-ramverket, vilket möjliggör exakt kontroll i videogenerering över olika personliga inställningar, vilket visar dess mångsidighet och nytta i en mängd olika videokontext.

AnimateDiff-ramverket antar den effektiva LoRA-finjusteringsmetoden för att erhålla modellens vikter för olika typer av skott. Direct-a-video-ramverket föreslår att man ska implementera en kamera-embedder för att kontrollera kamerapositionen under videogenereringsprocessen, men det villkorar endast på tre kameraparametrar, vilket begränsar kamerakontrollförmågan till de flesta grundläggande typerna. Å andra sidan utformar ramverk som MotionCtrl en rörelsekontroller som accepterar mer än tre inmatningsparametrar och kan producera videor med mer komplexa kamerapositioner. Men behovet av att finjustera delar av de genererade videorna hämmar modellens generaliserbarhet. Dessutom inkorporerar vissa ramverk ytterligare strukturerade kontrollsignaler som djupkartor i processen för att förbättra kontrollerbarheten för både bild- och textgenerering. Typiskt sett matar modellen in dessa kontrollsignaler i en extra encoder och injicerar sedan signalerna i en generator med hjälp av olika operationer.
CameraCtrl: Modellarkitektur
Innan vi kan titta på arkitekturen och utbildningsparadigmet för kamera-encodern, är det viktigt för oss att förstå olika kamerarepresentationer. Typiskt sett hänvisar en kameraposition till intrinsiska och extrinsiska parametrar, och en av de raka valen för att låta en videogenerator villkora kamerapositionen är att mata in råvärden avseende kameraparametrarna i genereringen. Men att implementera ett sådant tillvägagångssätt kan inte förbättra exakt kamerakontroll av flera skäl. Först, medan rotationsmatrisen är begränsad av ortogonalitet, är translationsvektorn vanligtvis obegränsad i storlek, vilket leder till en inkonsistens i inlärningsprocessen som kan påverka kontrollens konsekvens. För det andra kan användning av råa kameraparametrar direkt göra det svårt för modellen att korrelera dessa värden med bildpixlar, vilket resulterar i minskad kontroll över visuella detaljer. För att undvika dessa begränsningar väljer CameraCtrl-ramverket plucker-embeddingar som representationen för kamerapositionen, eftersom plucker-embeddingarna har geometriska representationer av varje pixel i videoframen och kan ge en mer detaljerad beskrivning av kamerapositionsinformationen.
Kamerakontrollerbarhet i videogenererare
När modellen parameteriserar kamerans bana till en plucker-embeddingssekvens, dvs. spatiala kartor, har modellen möjligheten att använda en encoder-modell för att extrahera kameragegenskaperna och sedan fusionera kameragegenskaperna i videogenererare. Liknande text-till-bild-adapter introducerar CameraCtrl-modellen en kamera-encoder som är speciellt utformad för videor. Kamera-encodern innehåller en temporal uppmärksamhetsmodell efter varje konvolutionsblock, vilket möjliggör att den fångar de temporala relationerna mellan kamerapositioner under hela videoklippet. Som visas i följande bild accepterar kamera-encodern endast plucker-embeddingsinmatning och levererar multi-skalegenskaper. Efter att ha erhållit multi-skalegenskaperna från kameran syftar CameraCtrl-modellen till att integrera dessa egenskaper i U-net-arkitekturen hos text-till-video-modellen smidigt och bestämmer vilka lager som ska användas för att inkorporera kamerainformationen effektivt. Dessutom, eftersom de flesta existerande ramverk antar en U-Net-liknande arkitektur som innehåller både temporala och spatiala uppmärksamhetslager, injicerar CameraCtrl-modellen kamerarepresentationerna i det temporala uppmärksamhetsblocket, ett beslut som backas upp av den temporala uppmärksamhetslagernas förmåga att fånga temporala relationer, i linje med den inneboende orsakssamband och sekventiella naturen hos en kamerabana, medan de spatiala uppmärksamhetslagren avbildar de enskilda ramarna.

Inlärning av kameradistributioner
Utbildning av kamera-encoder-komponenten inom CameraCtrl-ramverket på en videogenerator kräver en stor mängd väl etiketterad och annoterad video med modellen som kan erhålla kamerabanans med hjälp av struktur-från-rörelse eller SfM-tillvägagångssätt. CameraCtrl-ramverket försöker välja dataset med utseende som matchar utbildningsdata för den grundläggande text-till-video-modellen nära och har en kamerapositionsfördelning som är så bred som möjligt. Prover i dataset som genereras med hjälp av virtuella motorer uppvisar varierad kameradistribution eftersom utvecklare har flexibiliteten att kontrollera kameraparametrarna under renderingen, även om det lider av en distributionsgap när det jämförs med dataset som innehåller verkliga prover. När man arbetar med dataset som innehåller verkliga prover är kameradistributionen vanligtvis smal, och i sådana fall måste ramverket hitta en balans mellan diversitet bland olika kamerabanor och komplexitet hos enskilda kamerabanor. Komplexitet hos enskilda kamerabanor säkerställer att modellen lär sig att kontrollera komplexa banor under utbildningsprocessen, medan diversitet bland olika kamerabanor säkerställer att modellen inte överanpassar sig till vissa fasta mönster. Dessutom, för att övervaka utbildningsprocessen för kamera-encodern, föreslår CameraCtrl-ramverket kamera-justeringsmetriken för att mäta kontrollkvaliteten hos kameran genom att kvantifiera felet mellan kamerabanans för genererade prover och inmatade kameravillkor.
CameraCtrl: Experiment och resultat
CameraCtrl-ramverket implementerar AnimateDiff-modellen som sin grundläggande text-till-video-modell och en viktig anledning till detta är att utbildningsstrategin för AnimateDiff-modellen tillåter dess rörelsemodul att integreras med text-till-bild-basmodeller eller text-till-bild-LoRAs för att anpassa videogenerering över olika genrer och domäner. Modellen använder Adam-optimiseraren för att utbilda modellen med en konstant inlärningshastighet på 1e-4. Dessutom, för att säkerställa att modellen inte påverkar videogenereringsförmågan hos den ursprungliga text-till-video-modellen negativt, använder CameraCtrl-ramverket FID eller Frechet Inception Distance-metrik för att bedöma videons utseende och jämför kvaliteten på den genererade videon före och efter att kameramodulen inkluderats.
För att bedöma dess prestanda utvärderas CameraCtrl-ramverket mot två existerande kamerakontrollramverk: MotionCtrl och AnimateDiff. Men eftersom AnimateDiff-ramverket endast har stöd för åtta grundläggande kamerabanor, är jämförelsen mellan CameraCtrl och AnimateDiff begränsad till tre grundläggande banor. Å andra sidan, för jämförelse mot MotionCtrl, väljer ramverket ut över tusen slumpmässiga kamerabanor från befintliga dataset, utöver grundläggande kamerabanor, genererar videor med hjälp av dessa banor och utvärderar dem med hjälp av TransErr och RotErr-metriska värden.

Som det kan observeras, överträffar CameraCtrl-ramverket AnimateDiff-ramverket i grundläggande bana och levererar bättre resultat när det jämförs med MotionCtrl-ramverket på den komplexa banans metric.
Dessutom visar följande figur effekten av kamera-encoder-arkitekturen på den övergripande kvaliteten hos de genererade proverna. Rad a till Rad d representerar resultaten som genereras med kamera-encodern implementerad i arkitekturen: ControlNet, ControlNet med temporal uppmärksamhet, T2I-adapter och T2I-adapter med temporal uppmärksamhet.

I följande figur visas de två första videor som genereras med hjälp av en kombination av SparseCtrl-ramverkets RGB-encoder och metoden som används i CameraCtrl-ramverket.

Slutliga tankar
I denna artikel har vi talat om CameraCtrl, en ny idé som försöker möjliggöra exakt kamerapositionskontroll för text-till-video-modeller. Efter att ha parameteriserat kamerans bana exakt, utbildar modellen en plug-and-play-kameramodul på en text-till-video-modell och lämnar de andra komponenterna orörda. Dessutom genomför CameraCtrl-modellen också en omfattande studie om effekten av olika dataset och föreslår att videor med liknande utseende och varierad kameradistribution kan förbättra den övergripande kontrollerbarheten och generaliserbarheten hos modellen. Experiment som genomförts för att analysera prestandan hos CameraCtrl-modellen på verkliga uppgifter indikerar effektiviteten hos ramverket i att uppnå exakt och domänanpassad kamerakontroll, vilket banar väg för att skapa anpassad och dynamisk videogenerering från kameraposition och textinmatningar.












