AI-modeller och plattformar
Stabil Video Diffusion: Latent Video Diffusion Models till Stora Datasets
Generativ AI har varit en drivande kraft i AI-samhället under en tid nu, och framstegen inom generativ bildmodellering, särskilt med användning av diffusionsmodeller, har hjälpt generativa videomodeller att utvecklas avsevärt inte bara i forskning, utan också i termer av verkliga tillämpningar. Traditionellt sett tränas generativa videomodeller antingen från scratch eller delvis eller helt finjusterade från förtränade bildmodeller med extra tidsbundna lager, på en blandning av bild- och videodatasets.
Vi tar framstegen inom generativa videomodeller vidare, och i den här artikeln kommer vi att prata om Stable Video Diffusion Model, en latent videodiffusionsmodell som kan generera högupplösta, state-of-the-art-bilder till video och text till videoinnehåll. Vi kommer att prata om hur latent diffusionsmodeller som tränats för att syntetisera 2D-bilder har förbättrat förmågan och effektiviteten hos generativa videomodeller genom att lägga till tidsbundna lager och finjustera modellerna på små datasets som består av högkvalitativa videor. Vi kommer att dyka djupare in i arkitekturen och funktionssättet hos Stable Video Diffusion Model och utvärdera dess prestanda på olika metriker och jämföra den med nuvarande state-of-the-art-ramverk för videogenerering. Så låt oss komma igång.
Stable Video Diffusion Model och Generativa Videomodeller: En Introduktion
Tack vare dess nästan obegränsade potential har Generativ AI varit det primära forskningsämnet för AI- och ML-utövare under en tid nu, och de senaste åren har sett snabba framsteg både i termer av effektivitet och prestanda hos generativa bildmodeller. Lärandet från generativa bildmodeller har tillåtit forskare och utvecklare att göra framsteg på generativa videomodeller, vilket har resulterat i förbättrad praktiskhet och verkliga tillämpningar. Dock har de flesta forskningsförsök som försöker förbättra förmågan hos generativa videomodeller fokuserat främst på den exakta anordningen av tidsbundna och rumsliga lager, med liten uppmärksamhet åt att undersöka påverkan av att välja rätt data på resultaten av dessa generativa modeller.
Tack vare framstegen som gjorts av generativa bildmodeller har forskare observerat att påverkan av träningsdatafördelningen på prestandan hos generativa modeller är faktiskt betydande och obestridlig. Dessutom har forskare också observerat att förträning av en generativ bildmodell på en stor och varierad dataset följt av finjustering på en mindre dataset med bättre kvalitet ofta resulterar i förbättrad prestanda. Traditionellt sett implementerar generativa videomodeller lärandet som erhållits från framgångsrika generativa bildmodeller, och forskare har ännu inte studerat effekten av data och träningsstrategier. Stable Video Diffusion Model är ett försök att förbättra förmågan hos generativa videomodeller genom att gå in i tidigare outforskade områden med särskild fokus på dataval.

Senaste generativa videomodeller förlitar sig på diffusionsmodeller och textbetingade eller bildbetingade tillvägagångssätt för att syntetisera flera konsekventa videoframar eller bildramar. Diffusionsmodeller är kända för sin förmåga att lära sig att gradvis rensa en prov från normalfördelning genom att implementera en iterativ förfiningsprocess, och de har levererat önskvärda resultat på högupplösta videor och text-till-bild-syntes. Med hjälp av samma princip i sin kärna tränar Stable Video Diffusion Model en latent videodiffusionsmodell på sin videodataset tillsammans med användning av Generativa Adversarial Networks eller GANs, och även autoregressiva modeller till viss del.
Stable Video Diffusion Model följer en unik strategi som aldrig har implementerats av någon generativ videomodell, eftersom den förlitar sig på latent videodiffusionsbaslinjer med en fast arkitektur och en fast träningsstrategi följt av utvärdering av effekten av datakurering. Stable Video Diffusion Model syftar till att göra följande bidrag i området generativ videomodellering.
- Att presentera en systematisk och effektiv datakureringsarbetsflöde i ett försök att omvandla en stor samling o kuraterade videoprover till en högkvalitetsdataset som sedan används av generativa videomodeller.
- Att träna state-of-the-art-bilder till video- och text-till-video-modeller som överträffar befintliga ramverk.
- Att genomföra domänspecifika experiment för att undersöka 3D-förståelse och starka rörelsepriorer hos modellen.
Nu implementerar Stable Video Diffusion Model lärandet från Latent Video Diffusion Models och Data Curation-tekniker i sin grund.
Latent Video Diffusion Models
Latent Video Diffusion Models eller Video-LDMs följer tillvägagångssättet att träna den primära generativa modellen i ett latent utrymme med minskad beräkningskomplexitet, och de flesta Video-LDMs implementerar en förtränad text-till-bild-modell kombinerad med tillägg av tidsbundna blandningslager i förträningsarkitekturen. Som ett resultat tränar de flesta Video Latent Diffusion Models antingen endast tidsbundna lager eller hoppar över träningsprocessen helt, till skillnad från Stable Video Diffusion Model som finjusterar hela ramverket. Dessutom, för syntetisering av text-till-video-data, villkorar Stable Video Diffusion Model sig direkt på en textprompt, och resultaten indikerar att det resulterande ramverket kan finjusteras till en multi-view-syntes eller en bild-till-video-modell lätt.
Data Curation
Data Curation är en väsentlig komponent inte bara av Stable Video Diffusion Model, utan för generativa modeller som helhet, eftersom det är viktigt att förträna stora modeller på storskaliga datasets för att öka prestanda över olika uppgifter, inklusive språkmodellering eller diskriminativ text-till-bild-generering, och mycket mer. Data Curation har implementerats framgångsrikt på generativa bildmodeller genom att utnyttja förmågan hos effektiva språk-bild-representationer, även om sådana diskussioner aldrig har fokuserats på för utveckling av generativa videomodeller. Det finns flera hinder som utvecklare står inför när de kuraterar data för generativa videomodeller, och för att hantera dessa utmaningar implementerar Stable Video Diffusion Model en tre-stegs-träningsstrategi, vilket resulterar i förbättrade resultat och en betydande ökning av prestanda.
Data Curation för Högkvalitativ Video Syntes
Som diskuterats i den föregående sektionen implementerar Stable Video Diffusion Model en tre-stegs-träningsstrategi, vilket resulterar i förbättrade resultat och en betydande ökning av prestanda. Steg I är en bildförträning-steg som använder en 2D text-till-bild-diffusionsmodell. Steg II är för videoförträning, där ramverket tränar på en stor mängd videodata. Slutligen har vi Steg III för videofinjustering, där modellen finslipas på en liten undergrupp av högkvalitativa och högupplösta videor.
Men innan Stable Video Diffusion Model implementerar dessa tre steg är det viktigt att bearbeta och annotera datan, eftersom det utgör grunden för Steg II eller videoförträning, och spelar en avgörande roll för att säkerställa den optimala utgången. För att säkerställa maximal effektivitet implementerar ramverket först en kaskad cut-detektionspipeline på 3 varierande FPS- eller Frames Per Second-nivåer, och behovet av denna pipeline demonstreras i följande bild.

Sedan annoterar Stable Video Diffusion Model varje videoklipp med hjälp av tre varierande syntetiska kapitelmetoder. Följande tabell jämför datasets som används i Stable Diffusion-ramverket före och efter filtreringsprocessen.

Steg I: Bildförträning
Den första steget i den tre-stegs-pipeline som implementeras i Stable Video Diffusion Model är bildförträning, och för att uppnå detta grundas den initiala Stable Video Diffusion Model-ramen mot en förtränad bild-diffusionsmodell, nämligen Stable Diffusion 2.1-modellen, som utrustar den med starkare visuella representationer.

Steg II: Videoförträning
Det andra steget är videoförträning, och det bygger på de slutsatser som användningen av datakurering i multimodala generativa bildmodeller ofta resulterar i bättre resultat och förbättrad effektivitet, tillsammans med kraftfull diskriminativ bildgenerering. Men på grund av bristen på lika kraftfulla färdiga representationer för att filtrera bort oönskade prover för generativa videomodeller, förlitar sig Stable Video Diffusion Model på mänskliga preferenser som inmatningssignaler för skapandet av en lämplig dataset som används för förträning av ramverket. Följande figur demonstrerar den positiva effekten av att förträna ramverket på en kuraterad dataset som hjälper till att öka den totala prestandan för videoförträning på mindre datasets.

Mer specifikt använder ramverket olika metoder för att kurera undergrupper av Latent Video Diffusion, och överväger rangordningen av LVD-modeller som tränats på dessa datasets. Dessutom finner Stable Video Diffusion-ramverket också att användningen av kuraterade datasets för att träna ramverket hjälper till att öka prestandan hos ramverket och diffusionsmodeller i allmänhet. Dessutom fungerar datakureringsstrategin också på större, mer relevanta och praktiska datasets. Följande figur demonstrerar den positiva effekten av att förträna ramverket på en kuraterad dataset som hjälper till att öka den totala prestandan för videoförträning på mindre datasets.

Steg III: Högkvalitativ Finjustering
Tills Steg II fokuserar Stable Video Diffusion-ramverket på att förbättra prestandan före videoförträning, och i det tredje steget lägger ramverket sitt fokus på att optimera eller ytterligare förbättra prestandan hos ramverket efter högkvalitativ videofinjustering, och hur övergången från Steg II till Steg III uppnås i ramverket. I Steg III drar ramverket på träningsmetoder som lånats från latent bild-diffusionsmodeller, och ökar upplösningen på träningsexemplen. För att analysera effektiviteten hos detta tillvägagångssätt jämför ramverket det med tre identiska modeller som skiljer sig endast i termer av deras initiering. Den första identiska modellen har sina vikter initierade, och videoträningsprocessen hoppar över, medan de återstående två identiska modellerna initieras med vikter som lånats från andra latent videomodeller.
Resultat och Fynd
Det är dags att se hur Stable Video Diffusion-ramverket presterar på verkliga uppgifter och hur det jämför med nuvarande state-of-the-art-ramverk. Stable Video Diffusion-ramverket använder först den optimala dataansatsen för att träna en basmodell, och sedan utför finjustering för att generera flera state-of-the-art-modeller, där varje modell utför en specifik uppgift.

Ovanstående bild representerar högupplösta bild-till-video-exempel genererade av ramverket, medan följande figur demonstrerar ramverkets förmåga att generera högkvalitativa text-till-video-exempel.

Förtränad Basmodell
Som diskuterats tidigare är Stable Video Diffusion-modellen byggd på Stable Diffusion 2.1-ramverket, och baserat på nyliga fynd var det viktigt för utvecklare att anta brus schemat och öka bruset för att erhålla bilder med bättre upplösning när de tränar bild-diffusionsmodeller. Tack vare detta tillvägagångssätt lär sig Stable Video Diffusion-basmodellen kraftfulla rörelse-representationer, och i processen överträffar den baslinje-modeller för text-till-video-generering i en zero-shot-inställning, och resultaten visas i följande tabell.

Bildinterpolation och Multi-View-Generering
Stable Video Diffusion-ramverket finjusterar bild-till-video-modellen på multi-view-datasets för att erhålla flera nya vyer av ett föremål, och denna modell kallas SVD-MV eller Stable Video Diffusion-Multi View-modell. Den ursprungliga SVD-modellen finjusteras med hjälp av två datasets på ett sätt som ramverket matar in en enda bild och returnerar en sekvens av multi-view-bilder som utdata.
Som det kan ses i följande bilder levererar Stable Video Diffusion Multi View-ramverket hög prestanda som är jämförbar med state-of-the-art-Scratch Multi View-ramverket, och resultaten är en tydlig demonstration av SVD-MV:s förmåga att dra nytta av lärandet som erhållits från den ursprungliga SVD-ramverket för multi-view-bildgenerering. Dessutom indikerar resultaten också att att köra modellen under en relativt kort tid hjälper till att leverera optimala resultat, vilket är fallet med de flesta modeller som finjusteras från SVD-ramverket.


I ovanstående figur anges metricerna på vänster sida, och som det kan ses, överträffar Stable Video Diffusion Multi View-ramverket Scratch-MV och SD2.1 Multi-View-ramverket med en anständig marginal. Den andra bilden demonstrerar effekten av antalet träningsiterationer på den totala prestandan hos ramverket i termer av Clip Score, och SVD-MV-ramverken levererar hållbara resultat.
Slutliga Tankar
I den här artikeln har vi talat om Stable Video Diffusion, en latent videodiffusionsmodell som kan generera högupplösta, state-of-the-art-bilder till video och text-till-video-innehåll. Stable Video Diffusion Model följer en unik strategi som aldrig har implementerats av någon generativ videomodell, eftersom den förlitar sig på latent videodiffusionsbaslinjer med en fast arkitektur och en fast träningsstrategi följt av utvärdering av effekten av datakurering.
Vi har talat om hur latent diffusionsmodeller som tränats för att syntetisera 2D-bilder har förbättrat förmågan och effektiviteten hos generativa videomodeller genom att lägga till tidsbundna lager och finjustera modellerna på små datasets som består av högkvalitativa videor. För att samla in förträningsdata genomför ramverket en skalstudie och följer systematiska datainsamlingspraxis, och slutligen föreslår det en metod för att kurera en stor mängd videodata och omvandla bullriga videor till indata som är lämpliga för generativa videomodeller.
Dessutom använder Stable Video Diffusion-ramverket tre distinkta videomodellträningssteg som analyseras oberoende för att utvärdera deras påverkan på ramverkets prestanda. Ramverket genererar slutligen en videorepresentation som är tillräckligt kraftfull för att finjustera modellerna för optimal video-syntes, och resultaten är jämförbara med state-of-the-art-videogenereringsmodeller som redan används.












