AI-modeller og platforme
Stabil Video Diffusion: Latent Video Diffusion Modeller til Store Datasæt
Generativ AI har været en drivende kraft i AI-samfundet i nogen tid nu, og fremskridtene i feltet generativ billedmodelering, især med brug af diffusionsmodeller, har hjulpet generative video modeller til at fremme sig betydeligt, ikke kun i forskning, men også i virkelige anvendelser. Traditionelt trænes generative video modeller enten fra scratch eller de er delvist eller fuldt ud finjusteret fra fortrænede billedmodeller med ekstra tidsmæssige lag på en blanding af billed- og video datasæt.
Ved at bygge videre på fremskridtene i generative video modeller, vil vi i denne artikel tale om Stable Video Diffusion Model, en latent video diffusionsmodel, der kan generere højopløselige, state-of-the-art billed til video og tekst til video indhold. Vi vil tale om, hvordan latente diffusionsmodeller, der er trænet til at syntetisere 2D-billeder, har forbedret evnerne og effektiviteten af generative video modeller ved at tilføje tidsmæssige lag og finjustere modellerne på små datasæt, der består af højkvalitetsvideoer. Vi vil dykke dybere i arkitekturen og funktionen af Stable Video Diffusion Model og evaluere dens præstation på forskellige metrikker og sammenligne den med nuværende state-of-the-art-rammer for video generation. Så lad os komme i gang.
Stable Video Diffusion Model og Generative Video Modeller: En Introduktion
Takket være dens næsten ubegrænsede potentiale har Generativ AI været hovedemnet for forskning for AI- og ML-praktikere i en periode nu, og de seneste år har set hurtige fremskridt både i effektivitet og præstation af generative billedmodeller. Lærdommene fra generative billedmodeller har tilladt forskere og udviklere at fremme generative video modeller, hvilket har resulteret i forbedret praktisk anvendelse og virkelige anvendelser. Imidlertid har de fleste forsøg på at forbedre evnerne af generative video modeller fokuseret primært på den præcise arrangement af tidsmæssige og rumlige lag, med lidt opmærksomhed på at undersøge indflydelsen af at vælge det rigtige datasæt på resultatet af disse generative modeller.
Takket være fremskridtene i generative billedmodeller har forskere observeret, at indflydelsen af træningsdatafordeling på præstationen af generative modeller er betydelig og udiskutabel. Desuden har forskere også observeret, at fortræning af en generativ billedmodel på et stort og varieret datasæt efterfulgt af finjustering på et mindre datasæt med bedre kvalitet ofte resulterer i en betydelig forbedring af præstationen. Traditionelt implementerer generative video modeller lærdommene fra succesfulde generative billedmodeller, og forskere har endnu ikke studeret effekten af datasæt og træningsstrategier. Stable Video Diffusion Model er et forsøg på at forbedre evnerne af generative video modeller ved at gå ind i tidligere uudforskede områder med speciel fokus på datasætvalg.

Seneste generative video modeller afhænger af diffusionsmodeller og tekstbetingede eller billedbetingede tilgange til at syntetisere multiple konsistente video eller billedrammer. Diffusionsmodeller er kendt for deres evne til at lære, hvordan man gradvist kan reducere støj i en prøve fra normal distribution ved at implementere en iterativ forbedringsproces, og de har leveret ønskede resultater på højopløselige video og tekst til billedsynthese. Ved at bruge samme princip i dens kerne, træner Stable Video Diffusion Model en latent video diffusionsmodel på dens video datasæt sammen med brug af Generative Adversarial Networks eller GAN’er og selv autoregressive modeller til en vis udstrækning.
Stable Video Diffusion Model følger en unik strategi, der aldrig er implementeret af nogen generativ video model, da den afhænger af latente video diffusionsbasliner med en fast arkitektur og en fast træningsstrategi efterfulgt af en vurdering af effekten af datasætvalg. Stable Video Diffusion Model sigter mod at bidrage med følgende i feltet generativ video modeling.
- At præsentere en systematisk og effektiv datasætvalgsworkflow i et forsøg på at omdanne en stor samling af ukuratede videoeksempler til et højkvalitetsdatasæt, der derefter bruges af generative video modeller.
- At træne state-of-the-art billed til video og tekst til video modeller, der overgår eksisterende rammer.
- At udføre domænespecifikke eksperimenter for at undersøge 3D-forståelse og stærk prioritet af bevægelse i modellen.
Nu implementerer Stable Video Diffusion Model lærdommene fra Latent Video Diffusion Modeller og Data Curation-teknikker i dens kerne.
Latente Video Diffusionsmodeller
Latente Video Diffusionsmodeller eller Video-LDM’er følger tilgangen til at træne den primære generative model i et latent rum med reduceret beregningskompleksitet, og de fleste Video-LDM’er implementerer en fortrænet tekst til billedmodel kombineret med tilføjelsen af tidsmæssige blandingslag i fortræningsarkitekturen. Som resultat træner de fleste Video Latent Diffusionsmodeller enten kun tidsmæssige lag eller springer træningsprocessen over, til forskel fra Stable Video Diffusion Model, der finjusterer hele rammen.
Data Curation
Data Curation er en afgørende komponent ikke kun af Stable Video Diffusion Model, men af generative modeller som helhed, da det er afgørende at fortræne store modeller på store datasæt for at booste præstationen på tværs af forskellige opgaver, herunder sprogmodelering, diskriminativ tekst til billedgeneration og meget mere. Data Curation er blevet implementeret med succes på generative billedmodeller ved at udnytte evnerne i effektive sprog-billede-repræsentationer, selvom sådanne diskussioner aldrig er fokuseret på udvikling af generative video modeller.
Data Curation til Højkvalitets Video Synthese
Som diskuteret i den forrige sektion implementerer Stable Video Diffusion Model en tretrins træningsstrategi, der resulterer i forbedrede resultater og en betydelig boost i præstation. Trin I er et billedfortrænings trin, der udnytter en 2D tekst til billed diffusionsmodel. Trin II er for video fortræning, hvor rammen træner på en stor mængde video data. Endelig har vi Trin III for video finjustering, hvor modellen forfineres på et lille underdatasæt af højkvalitets- og højopløselige videoer.
Men før Stable Video Diffusion Model implementerer disse tre trin, er det afgørende at behandle og annotere data, da det fungerer som grundlag for Trin II eller video fortrænings trinet og spiller en kritisk rol i at sikre optimalt output.
Trin I: Billede Fortræning
Det første trin i den tretrins pipeline, der er implementeret i Stable Video Diffusion Model, er billedfortræning, og for at opnå dette er den oprindelige Stable Video Diffusion Model ramme grundet mod en fortrænet billed diffusionsmodel, nemlig Stable Diffusion 2.1 modellen, der udstyrer den med stærkere visuelle repræsentationer.
Trin II: Video Fortræning
Det andet trin er video fortrænings trinet, og det bygger på fundene, at brugen af datasætvalg i multimodale generative billedmodeller ofte resulterer i bedre resultater og forbedret effektivitet samt kraftfuld diskriminativ billedgeneration.
Trin III: Højkvalitets Finjustering
Indtil Trin II fokuserer Stable Video Diffusion rammen på at forbedre præstationen før video fortræning, og i det tredje trin lægger rammen vægt på at optimere eller yderligere forbedre præstationen af rammen efter højkvalitets video finjustering og hvordan overgangen fra Trin II til Trin III opnås i rammen.
Resultater og Fund
Det er tid til at se, hvordan Stable Video Diffusion rammen præsterer på virkelige opgaver og hvordan den sammenlignes med nuværende state-of-the-art rammer.
Fortrænet Basis Model
Som diskuteret tidligere er Stable Video Diffusion modellen bygget på Stable Diffusion 2.1 rammen, og på baggrund af seneste fund var det afgørende for udviklere at adoptere støjen og øge støjen for at opnå billeder med bedre opløsning, når de trænede billed diffusionsmodeller.
Ram Interpolation og Multi-View Generation
Stable Video Diffusion rammen finjusterer billed til video modellen på multi-view datasæt for at opnå multiple nye views af et objekt, og denne model er kendt som SVD-MV eller Stable Video Diffusion-Multi View model.
Endelige Tanker
I denne artikel har vi talt om Stable Video Diffusion, en latent video diffusionsmodel, der kan generere højopløselige, state-of-the-art billed til video og tekst til video indhold.
Vi har talt om, hvordan latente diffusionsmodeller, der er trænet til at syntetisere 2D-billeder, har forbedret evnerne og effektiviteten af generative video modeller ved at tilføje tidsmæssige lag og finjustere modellerne på små datasæt, der består af højkvalitetsvideoer.
Desuden anvender Stable Video Diffusion rammen tre distinkte video model trænings trin, der analyseres uafhængigt for at vurderer deres indflydelse på rammenes præstation. Rammen udgangs video repræsentation er kraftfuld nok til at finjustere modellerne for optimal video syntese, og resultaterne er sammenlignelige med state-of-the-art video generation modeller, der allerede er i brug.












