AI-modeller och plattformar
DynamiCrafter: Animering av öppen-domänbilder med video-diffusionspriorer
Datorseende är ett av de mest spännande och välutforskade områdena inom AI-gemenskapen idag, och trots den snabba förbättringen av datorseendemodellerna, är en långvarig utmaning som fortfarande plågar utvecklare bildanimering. Även idag kämpar bildanimeringsramverk för att omvandla stillbilder till sina respektive videokopior som visar naturliga dynamiker samtidigt som de bevarar den ursprungliga utseendet på bilderna. Traditionellt fokuserar bildanimeringsramverk främst på att animerar naturliga scener med domänspecifika rörelser som människohår eller kroppsrörelser, eller stokastiska dynamiker som vätskor och moln. Även om denna approach fungerar till viss del, begränsar den tillämpbarheten av dessa animeringsramverk till mer generisk visuell innehåll.
Dessutom fokuserar konventionella bildanimeringsmetoder främst på att syntetisera oscillerande och stokastiska rörelser, eller på att anpassa sig för specifika objektkategorier. Men en anmärkningsvärd brist med denna approach är de starka antaganden som påförs dessa metoder, vilket i slutändan begränsar deras tillämpbarhet, särskilt i allmänna scenarier som öppen-domänbildanimering. Under de senaste åren har T2V eller Text-till-Video-modeller visat enastående framgång i att generera livfulla och varierade videor med hjälp av textprompt, och detta är grunden för DynamiCrafter-ramverket.
DynamiCrafter-ramverket är ett försök att övervinna de nuvarande begränsningarna för bildanimeringsmodeller och utöka deras tillämpbarhet till generiska scenarier som involverar öppen-världsbilder. DynamiCrafter-ramverket försöker syntetisera dynamiskt innehåll för öppen-domänbilder, omvandla dem till animerade videor. Den viktigaste idén bakom DynamiCrafter är att inkorporera bilden som vägledning i den generativa processen i ett försök att utnyttja rörelseprioriteten för de redan existerande text-till-video-diffusionsmodellerna. För en given bild, implementerar DynamiCrafter-modellen först en frågetransformator som projicerar bilden till en text-justerad rik kontextrepresentation, vilket möjliggör för videomodellen att smälta bildinnehållet på ett kompatibelt sätt. Men DynamiCrafter-modellen kämpar fortfarande för att bevara vissa visuella detaljer i de resulterande videorna, ett problem som DynamiCrafter-modellen övervinner genom att mata in hela bilden till diffusionsmodellen genom att konkatenera bilden med de initiala brusen, vilket därmed kompletterar modellen med mer exakt bildinformation.
Denna artikel syftar till att täcka DynamiCrafter-ramverket i djupet, och vi utforskar mekanismen, metodiken, arkitekturen för ramverket samt dess jämförelse med state-of-the-art-bild- och video-genereringsramverk. Så låt oss komma igång.
DynamiCrafter: Animering av öppen-domänbilder
Att animera en stillbild erbjuder ofta en engagerande visuell upplevelse för publiken, eftersom det verkar bringa den stilla bilden till liv. Under åren har många ramverk utforskat olika metoder för att animerar stillbilder. De första animeringsramverken implementerade fysiska simuleringsbaserade metoder som fokuserade på att simulera rörelsen av specifika objekt. Men på grund av den oberoende modelleringen av varje objektkategori, var dessa metoder varken effektiva eller hade generaliserbarhet. För att replikera mer realistiska rörelser, uppkom referensbaserade metoder som överförde rörelse- eller utseendefunktioner från referenssignaler som videor till syntesprocessen. Även om referensbaserade metoder levererade bättre resultat med bättre tidsmässig samstämmighet jämfört med simuleringsbaserade metoder, behövde de ytterligare vägledning som begränsade deras praktiska tillämpningar.
På senare tid fokuserar de flesta animeringsramverken främst på att animerar naturliga scener med stokastiska, domänspecifika eller oscillerande rörelser. Även om metoden som implementeras av dessa ramverk fungerar till viss del, är resultaten som dessa ramverk genererar inte tillfredsställande, med betydande utrymme för förbättring. De anmärkningsvärda resultaten som uppnåtts av Text-till-Video-generativa modeller under de senaste åren har inspirerat utvecklarna av DynamiCrafter-ramverket att utnyttja de kraftfulla generativa förmågorna hos Text-till-Video-modeller för bildanimering.
Den viktigaste grunden för DynamiCrafter-ramverket är att inkorporera en villkorlig bild i ett försök att styra video-genereringsprocessen för Text-till-Video-diffusionsmodeller. Men det slutliga målet med bildanimering är fortfarande inte trivialt, eftersom bildanimering kräver bevarande av detaljer samt förståelse av visuella sammanhang som är väsentliga för att skapa dynamik. Men multi-modala kontrollerbara video-diffusionsmodeller som VideoComposer har försökt att möjliggöra video-generering med visuell vägledning från en bild. Men dessa metoder är inte lämpliga för bildanimering, eftersom de antingen resulterar i abrupta tidsmässiga förändringar eller låg visuell överensstämmelse med ingångsbilden på grund av deras mindre omfattande bildinjektionsmekanismer. För att motverka denna utmaning, föreslår DynamiCrafter-ramverket en dubbel-strömsinjektionsmetod, bestående av visuell detaljvägledning och text-justerad kontextrepresentation. Dubbel-strömsinjektionsmetoden möjliggör för DynamiCrafter-ramverket att säkerställa att video-diffusionsmodellen syntetiserar detaljbevarande dynamiskt innehåll på ett kompletterande sätt.

För en given bild, projicerar DynamiCrafter-ramverket först bilden till den text-justerade kontextrepresentationen med hjälp av ett särskilt utformat kontextlärningsnätverk. För att vara mer specifik, består kontextrepresentationen av ett lärbart frågetransformator för att främja dess anpassning till diffusionsmodellerna, och en förtränad CLIP-bildencoder för att extrahera text-justerade bildfunktioner. Modellen använder sedan de rika kontextfunktionerna med hjälp av cross-attention-lager, och modellen använder gated-fusion för att kombinera dessa textfunktioner med cross-attention-lagren. Men denna approach handlar om de lärd kontextrepresentationerna med text-justerade visuella detaljer som möjliggör semantisk förståelse av bildkontext, vilket tillåter rimlig och livfull dynamik att syntetiseras. Dessutom, i ett försök att komplettera ytterligare visuella detaljer, konkatenerar ramverket den fullständiga bilden med den initiala bruset till diffusionsmodellen. Som ett resultat, garanterar dubbel-injektionsmetoden som implementeras av DynamiCrafter-ramverket visuell överensstämmelse samt plausibel dynamiskt innehåll till ingångsbilden.
Vidare, har diffusionsmodeller eller DM visat enastående prestanda och generativ kraft i T2I eller Text-till-Bild-generering. För att replikera framgången för T2I-modeller till video-generering, föreslås VDM eller Video-Diffusionsmodeller som använder en space-tidsfaktoriserad U-New-arkitektur i pixelrum för att modellera lågupplösta videor. Att överföra lärdomarna från T2I-ramverk till T2V-ramverk kommer att hjälpa till att minska träningskostnaderna. Även om VDM eller Video-Diffusionsmodeller kan generera högkvalitativa videor, accepterar de endast textprompt som den enda semantiska vägledningen, vilket kanske inte återspeglar en användares verkliga avsikter eller kan vara otydligt. Men resultaten från de flesta VDM-modeller följer sällan ingångsbilden och lider av den orealistiska tidsmässiga variationsproblemet. DynamiCrafter-approachen byggs på text-villkorliga Video-Diffusionsmodeller som utnyttjar deras rika dynamiska prior för att animerar öppen-domänbilder. Det gör så genom att inkorporera anpassade design för bättre semantisk förståelse och överensstämmelse med ingångsbilden.
DynamiCrafter: Metod och Arkitektur
För en given stillbild, försöker DynamiCrafter-ramverket att animerar bilden till video, d.v.s. producera en kort videoklipp. Videoklippet ärver de visuella innehållen från bilden och visar naturliga dynamiker. Men det finns en möjlighet att bilden kan visas i en godtycklig plats i den resulterande bildsekvensen. Utseendet på en bild i en godtycklig plats är en särskild typ av utmaning som observeras i bild-villkorlig video-generering med höga visuella överensstämmelsekrav. DynamiCrafter-ramverket övervinner denna utmaning genom att utnyttja de generativa prioriteringarna för förtränade video-diffusionsmodeller.
Bild-dynamik från Video-Diffusionsprior
Vanligtvis är öppen-domän Text-till-Video-diffusionsmodeller kända för att visa dynamiskt visuellt innehåll som modelleras villkorligt på textbeskrivningar. För att animerar en stillbild med Text-till-Video-generativa prioriteringar, måste ramverken först injicera den visuella informationen i video-genereringsprocessen på ett omfattande sätt. Dessutom, för dynamisk syntes, måste T2V-modellen smälta bilden för kontextförståelse, medan den också måste kunna bevara de visuella detaljerna i de genererade videorna.

Text-justerad Kontextrepresentation
För att styra video-generering med bildkontext, försöker DynamiCrafter-ramverket att projicera bilden till en justerad inbäddningsrymd som tillåter videomodellen att använda bildinformationen på ett kompatibelt sätt. Följande detta, använder DynamiCrafter-ramverket bildencodern för att extrahera bildfunktioner från ingångsbilden, eftersom textinbäddningarna genereras med hjälp av en förtränad CLIP-textencoder. Nu, även om de globala semantiska token från CLIP-bildencodern är justerade med bildrubriker, representerar de primärt det visuella innehållet på semantisk nivå, vilket gör att de inte kan fånga den fulla utsträckningen av bilden. DynamiCrafter-ramverket implementerar fullständiga visuella token från den sista lagret av CLIP-encodern för att extrahera mer komplett information, eftersom dessa visuella token demonstrerar hög trohet i villkorlig bildgenerering. Dessutom använder ramverket kontext- och textinbäddningar för att interagera med U-Net-mellanlagren med hjälp av dubbla cross-attention-lager. Designen av denna komponent möjliggör för modellen att absorbera bildvillkor på ett lagerberoende sätt. Dessutom, eftersom de mellanliggande lagren av U-Net-arkitekturen associerar mer med objektpositioner eller former, förväntas det att bildfunktionerna kommer att påverka utseendet på videorna främst, särskilt eftersom de två sista lagren är mer länkade till utseende.
Visuell Detaljvägledning
DynamiCrafter-ramverket använder en rik-informativ kontextrepresentation som tillåter video-diffusionsmodellen i dess arkitektur att producera videor som liknar ingångsbilden nära. Men, som visas i följande bild, kan det genererade innehållet visa vissa diskrepanser på grund av den begränsade förmågan hos den förtränade CLIP-encodern att bevara ingångsinformationen fullständigt, eftersom den har designats för att justera språk och visuella funktioner.

För att förbättra visuell överensstämmelse, föreslår DynamiCrafter-ramverket att ge video-diffusionsmodellen ytterligare visuella detaljer som extraheras från ingångsbilden. För att uppnå detta, konkatenerar DynamiCrafter-modellen den villkorliga bilden med per-ram initialt brus och matar in dem till denoiserings-U-Net-komponenten som vägledning.
Träningsparadigm
DynamiCrafter-ramverket integrerar den villkorliga bilden genom två kompletterande strömmar som spelar en betydande roll i detaljvägledning och kontextkontroll. För att underlätta detta, använder DynamiCrafter-modellen en tre-stegs träningsprocess
- I det första steget, tränar modellen bildkontextrepresentationen.
- I det andra steget, anpassar modellen bildkontextrepresentationen till Text-till-Video-modellen.
- I det tredje och sista steget, finjusterar modellen bildkontextrepresentationen tillsammans med den visuella detaljvägledningskomponenten.
För att anpassa bildinformationen för kompatibilitet med Text-till-Video-modellen, föreslår DynamiCrafter-ramverket att utveckla ett kontextrepresentationnätverk, P, som är utformat för att fånga text-justerade visuella detaljer från den givna bilden. Det erkänns att P kräver många optimeringssteg för konvergens, och ramverkets approach innebär att först träna det med hjälp av en enklare Text-till-Bild-modell. Denna strategi tillåter kontextrepresentationnätverket att fokusera på att lära sig om bildkontexten innan det integreras med T2V-modellen genom gemensam tränings med P och de spatiala lagren, snarare än de tidsmässiga lagren, av T2V-modellen.
För att säkerställa T2V-kompatibilitet, föreslår DynamiCrafter-ramverket att kombinera ingångsbilden med per-rambrus och finjustera både P och de spatiala lagren av VDM. Denna metod väljs för att upprätthålla integriteten hos T2V-modellens befintliga tidsmässiga insikter utan de negativa effekterna av tät bildkombination, som kunde kompromissa prestanda och avvika från vårt primära mål. Dessutom använder ramverket en strategi för att slumpmässigt välja en videoframe som bildvillkoret för att uppnå två mål: (i) för att undvika att nätverket utvecklar ett förutsägbart mönster som direkt associerar den kombinerade bilden med en specifik frame-plats, och (ii) för att uppmuntra en mer anpassningsbar kontextrepresentation genom att förhindra att alltför rigid information tillhandahålls för en specifik frame.
DynamiCrafter: Experiment och Resultat
DynamiCrafter-ramverket tränar först kontextrepresentationnätverket och bild-cross-attention-lagren på Stable Diffusion. Ramverket ersätter sedan Stable Diffusion-komponenten med VideoCrafter och finjusterar kontextrepresentationnätverket och de spatiala lagren för anpassning, och med bildkombination. Vid inferens, antar ramverket DDIM-samplern med multi-villkorsklassificeringsfri vägledning. Dessutom, för att utvärdera den tidsmässiga samstämmigheten och kvaliteten på de syntetiserade videorna i både tidsmässiga och spatiala domäner, rapporterar ramverket FVD eller Frechet Video Distance, samt KVD eller Kernel Video Distance, och utvärderar noll-skotsprestanda på alla metoder för MSR-VTT och UCF-101-benchmark. För att undersöka den perceptuella överensstämmelsen mellan de genererade resultaten och ingångsbilden, introducerar ramverket PIC eller Perceptual Input Conformity, och antar den perceptuella distansmetriken DreamSim som avstånds-funktionen.
Följande figur visar den visuella jämförelsen av de genererade animerade innehållen med olika stilar och innehåll.

Som det kan observeras, bland alla olika metoder, följer DynamiCrafter-ramverket ingångsbildvillkoret väl, och genererar tidsmässigt samstämmiga videor. Följande tabell innehåller statistik från en användarstudie med 49 deltagare av preferensfrekvensen för Tidsmässig Samstämmighet (T.C), och RörelseKvalitet (M.C) tillsammans med urvalsfrekvensen för visuell överensstämmelse med ingångsbilden. (I.C). Som det kan observeras, kan DynamiCrafter-ramverket överträffa befintliga metoder med en betydande marginal.

Följande figur visar resultaten som uppnåtts med hjälp av dubbel-strömsinjektionsmetoden och träningsparadigmen.

Slutliga Tankar
I denna artikel har vi talat om DynamiCrafter, ett försök att övervinna de nuvarande begränsningarna för bildanimeringsmodeller och utöka deras tillämpbarhet till generiska scenarier som involverar öppen-världsbilder. DynamiCrafter-ramverket försöker syntetisera dynamiskt innehåll för öppen-domänbilder, omvandla dem till animerade videor. Den viktigaste idén bakom DynamiCrafter är att inkorporera bilden som vägledning i den generativa processen i ett försök att utnyttja rörelseprioriteten för de redan existerande text-till-video-diffusionsmodellerna. För en given bild, implementerar DynamiCrafter-modellen först en frågetransformator som projicerar bilden till en text-justerad rik kontextrepresentation, vilket möjliggör för videomodellen att smälta bildinnehållet på ett kompatibelt sätt. Men DynamiCrafter-modellen kämpar fortfarande för att bevara vissa visuella detaljer i de resulterande videorna, ett problem som DynamiCrafter-modellen övervinner genom att mata in hela bilden till diffusionsmodellen genom att konkatenera bilden med de initiala brusen, vilket därmed kompletterar modellen med mer exakt bildinformation.












