AI-modellen en platforms
Stabiele Video Diffusie: Latente Video Diffusie Modellen voor Grote Datasets
Generatieve AI is al een tijdje een drijvende kracht in de AI-gemeenschap, en de vooruitgang die is geboekt in het veld van generatieve beeldmodellering, met name met het gebruik van diffusiemodellen, heeft de generatieve videomodellen aanzienlijk doen vooruitgaan, niet alleen in onderzoek, maar ook in termen van praktische toepassingen. Traditioneel worden generatieve videomodellen ofwel van scratch getraind, ofwel gedeeltelijk of volledig gefinetuned vanuit voorgetrainde beeldmodellen met extra tijdelijke lagen, op een mengsel van beeld- en videodatasets.
De vooruitgang in generatieve videomodellen vooruit nemend, zullen we in dit artikel praten over het Stabiele Video Diffusie Model, een latent videodiffusiemodel dat in staat is om hoge-resolutie, state-of-the-art beeld-naar-video- en tekst-naar-video-inhoud te genereren. We zullen praten over hoe latente diffusiemodellen getraind voor het synthetiseren van 2D-beelden de mogelijkheden en efficiëntie van generatieve videomodellen hebben verbeterd door tijdelijke lagen toe te voegen en de modellen te finetunen op kleine datasets met hoge-kwaliteit video’s. We zullen een diepere duik nemen in de architectuur en werking van het Stabiele Video Diffusie Model en evalueren zijn prestaties op diverse metrieken en vergelijken deze met de huidige state-of-the-art kaders voor videogeneratie. Laten we beginnen.
Stabiele Video Diffusie Model en Generatieve Video Modellen: Een Inleiding
Dankzij zijn bijna onbeperkte potentie is Generatieve AI het primaire onderwerp van onderzoek voor AI- en ML-praktijnen geweest, en de afgelopen jaren hebben snelle vooruitgang gezien, zowel in termen van efficiëntie als prestaties van generatieve beeldmodellen. De kennis die is opgedaan uit generatieve beeldmodellen heeft onderzoekers en ontwikkelaars in staat gesteld om vooruitgang te boeken in generatieve videomodellen, wat heeft geresulteerd in verbeterde praktische toepassingen. Echter, de meeste onderzoeken die proberen de mogelijkheden van generatieve videomodellen te verbeteren, richten zich voornamelijk op de exacte rangschikking van tijdelijke en ruimtelijke lagen, met weinig aandacht voor het onderzoeken van de invloed van het selecteren van de juiste gegevens op de uitkomst van deze generatieve modellen.
Dankzij de vooruitgang die is geboekt door generatieve beeldmodellen, hebben onderzoekers waargenomen dat de invloed van de trainingsgegevensverdeling op de prestaties van generatieve modellen inderdaad aanzienlijk en onbetwist is. Bovendien hebben onderzoekers ook waargenomen dat het voortrainen van een generatief beeldmodel op een grote en diverse dataset, gevolgd door finetuning op een kleinere dataset met betere kwaliteit, vaak resulteert in een aanzienlijke verbetering van de prestaties. Traditioneel implementeren generatieve videomodellen de kennis die is opgedaan uit succesvolle generatieve beeldmodellen, en onderzoekers zijn nog niet begonnen met het bestuderen van de invloed van gegevens en trainingsstrategieën. Het Stabiele Video Diffusie Model is een poging om de mogelijkheden van generatieve videomodellen te verbeteren door het betreden van eerder onverkende gebieden, met speciale aandacht voor het selecteren van gegevens.

Recente generatieve videomodellen vertrouwen op diffusiemodellen en tekst- of beeldconditiebenaderingen om meerdere consistente video- of beeldframes te synthetiseren. Diffusiemodellen zijn bekend om hun vermogen om te leren hoe ze een monster uit een normale verdeling kunnen denoiseren door een iteratief verfijningsproces te implementeren, en ze hebben wenselijke resultaten geleverd op hoge-resolutie video’s en tekst-naar-beeldsynthese. Met hetzelfde principe als core, traint het Stabiele Video Diffusie Model een latent videodiffusiemodel op zijn videodataset, samen met het gebruik van Generatieve Adversarial Networks (GAN’s) en zelfs autoregressieve modellen tot op zekere hoogte.
Het Stabiele Video Diffusie Model volgt een unieke strategie die nooit eerder is geïmplementeerd door een generatief videomodel, aangezien het vertrouwt op latente videodiffusiebaselines met een vaste architectuur en een vaste trainingsstrategie, gevolgd door het beoordelen van de invloed van het cureren van de gegevens. Het Stabiele Video Diffusie Model heeft als doel de volgende bijdragen te leveren in het veld van generatieve videomodellering.
- Om een systematische en effectieve gegevenscuratie-workflow te presenteren in een poging om een grote verzameling van ongecurateerde videosamples om te zetten in een hoge-kwaliteit dataset die vervolgens wordt gebruikt door de generatieve videomodellen.
- Om state-of-the-art beeld-naar-video- en tekst-naar-video-modellen te trainen die de bestaande kaders overtreffen.
- Om domeinspecifieke experimenten uit te voeren om de 3D-begrip en de sterke prior van beweging van het model te onderzoeken.
Nu implementeert het Stabiele Video Diffusie Model de kennis die is opgedaan uit Latente Video Diffusie Modellen en Data Curation-technieken in het hart van zijn fundament.
Latente Video Diffusie Modellen
Latente Video Diffusie Modellen of Video-LDM’s volgen de aanpak van het trainen van het primaire generatieve model in een latente ruimte met verlaagde computationele complexiteit, en de meeste Video-LDM’s implementeren een voorgetraind tekst-naar-beeldmodel gekoppeld aan de toevoeging van tijdelijke menglagen in de voortrainingsarchitectuur. Als gevolg hiervan trainen de meeste Video Latente Diffusie Modellen alleen de tijdelijke lagen of slaan het trainingsproces helemaal over, in tegenstelling tot het Stabiele Video Diffusie Model dat de hele framework finetuned.
Data Curation
Data Curation is een essentieel onderdeel niet alleen van het Stabiele Video Diffusie Model, maar voor generatieve modellen in het algemeen, omdat het essentieel is om grote modellen voor te trainen op grote datasets om de prestaties te verbeteren over verschillende taken, waaronder taalmodellering, discriminatieve tekst-naar-beeldgeneratie en veel meer. Data Curation is met succes geïmplementeerd op generatieve beeldmodellen door het gebruik van efficiënte taal-beeldrepresentaties, hoewel dergelijke discussies nooit zijn gefocust op het ontwikkelen van generatieve videomodellen. Er zijn verschillende hindernissen die ontwikkelaars tegenkomen bij het cureren van gegevens voor generatieve videomodellen, en om deze uitdagingen aan te pakken, implementeert het Stabiele Video Diffusie Model een driedaagse trainingsstrategie, wat resulteert in verbeterde resultaten en een aanzienlijke boost in prestaties.
Data Curation voor Hoge Kwaliteit Video Synthese
Zoals eerder besproken, implementeert het Stabiele Video Diffusie Model een driedaagse trainingsstrategie, wat resulteert in verbeterde resultaten en een aanzienlijke boost in prestaties. Fase I is een beeldpretrainingsfase die gebruik maakt van een 2D tekst-naar-beeld diffusiemodel. Fase II is voor videopretraining waarin de framework traint op een grote hoeveelheid videodata. Ten slotte hebben we Fase III voor videofinetuning waarin het model wordt verfijnd op een kleine subset van hoge-kwaliteit en hoge-resolutie video’s.
Echter, voordat het Stabiele Video Diffusie Model deze drie fasen implementeert, is het essentieel om de gegevens te verwerken en te annoteren, aangezien dit dient als basis voor Fase II of de videopretrainingsfase, en speelt een kritieke rol bij het waarborgen van de optimale uitvoer. Om maximale efficiëntie te waarborgen, implementeert de framework eerst een cascaded cut detection pipeline op 3 verschillende FPS-niveaus, en de noodzaak voor deze pipeline wordt aangetoond in de volgende afbeelding.

Vervolgens annoteren we elke videoclip met behulp van drie verschillende synthetische captioningmethoden. De volgende tabel vergelijkt de datasets die worden gebruikt in het Stabiele Diffusie Framework voordat en na het filtratieproces.

Fase I: Beeldpretraining
De eerste fase in de driedaagse pipeline die wordt geïmplementeerd in het Stabiele Video Diffusie Model is beeldpretraining, en om dit te bereiken, wordt de initiële Stabiele Video Diffusie Model framework gestabiliseerd tegen een voorgetraind beeld diffusiemodel, namelijk het Stable Diffusion 2.1 model, dat het uitrust met sterkere visuele representaties.

Fase II: Videopretraining
De tweede fase is de Videopretrainingsfase, en deze bouwt voort op de bevindingen dat het gebruik van gegevenscuratie in multimodale generatieve beeldmodellen vaak resulteert in betere resultaten en verbeterde efficiëntie, evenals krachtige discriminatieve beeldgeneratie. Echter, vanwege het ontbreken van vergelijkbare krachtige off-the-shelf-representaties om ongewenste samples uit te filteren voor generatieve videomodellen, vertrouwt het Stabiele Video Diffusie Model op menselijke voorkeuren als invoersignalen voor het creëren van een geschikte dataset die wordt gebruikt voor het voortrainen van de framework.

Om specifieker te zijn, gebruikt de framework verschillende methoden om subsets van Latente Video Diffusie te cureren en overweegt de rangschikking van LVD-modellen getraind op deze datasets. Bovendien vindt de Stabiele Video Diffusie framework ook dat het gebruik van gecuurde datasets voor het trainen van de frameworks helpt bij het verbeteren van de prestaties van de framework, en diffusiemodellen in het algemeen. Bovendien werkt de gegevenscuratie-strategie ook op grotere, meer relevante en praktische datasets.

Fase III: Hoge Kwaliteit Finetuning
Tot fase II richt het Stabiele Video Diffusie framework zich op het verbeteren van de prestaties voordat de videopretraining plaatsvindt, en in de derde fase legt de framework de nadruk op het optimaliseren of verder verbeteren van de prestaties van de framework na hoge-kwaliteit videofinetuning, en hoe de overgang van Fase II naar Fase III wordt bereikt in de framework. In Fase III, gebruikt de framework trainingsmethoden die zijn ontleend aan latente beeld diffusiemodellen, en verhoogt de resolutie van de trainingsvoorbeelden.
Resultaten en Bevindingen
Het is tijd om te kijken hoe het Stabiele Video Diffusie framework presteert op echte taken, en hoe het zich verhoudt tot de huidige state-of-the-art kaders. Het Stabiele Video Diffusie framework gebruikt eerst de optimale gegevensaanpak om een basismodel te trainen, en voert vervolgens finetuning uit om meerdere state-of-the-art modellen te genereren, waarbij elk model een specifieke taak uitvoert.

De bovenstaande afbeelding vertegenwoordigt de hoge-resolutie beeld-naar-video samples die zijn gegenereerd door de framework, terwijl de volgende afbeelding de mogelijkheid van de framework demonstreert om hoge-kwaliteit tekst-naar-video samples te genereren.

Voorgefinetuned Basis Model
Zoals eerder besproken, is het Stabiele Video Diffusie model gebouwd op het Stable Diffusion 2.1 framework, en op basis van recente bevindingen, was het cruciaal voor ontwikkelaars om de ruisplanning en de ruis te verhogen om beelden met betere resolutie te verkrijgen bij het trainen van beeld diffusiemodellen. Dankzij deze aanpak leert het Stabiele Video Diffusie basismodel krachtige bewegingsrepresentaties, en overtreft het de basismodellen voor tekst-naar-video generatie in een zero-shot setting, en de resultaten worden weergegeven in de volgende tabel.

Frame Interpolatie en Multi-View Generatie
Het Stabiele Video Diffusie framework finetuned het beeld-naar-video model op multi-view datasets om meerdere nieuwe views van een object te verkrijgen, en dit model wordt genoemd SVD-MV of Stabiele Video Diffusie-Multi View model. Het oorspronkelijke SVD model wordt gefinetuned met behulp van twee datasets op een manier die de framework een enkel beeld invoert en een reeks van multi-view beelden als uitvoer retourneert.
Zoals te zien is in de volgende afbeeldingen, levert het Stabiele Video Diffusie Multi View framework hoge prestaties die vergelijkbaar zijn met de state-of-the-art Scratch Multi View framework, en de resultaten zijn een duidelijke demonstratie van SVD-MV’s vermogen om te profiteren van de kennis die is opgedaan uit het oorspronkelijke SVD framework voor multi-view beeldgeneratie. Bovendien geven de resultaten ook aan dat het uitvoeren van het model voor een relatief klein aantal iteraties helpt bij het verkrijgen van optimale resultaten, zoals het geval is met de meeste modellen die zijn gefinetuned vanuit het SVD framework.


In de bovenstaande afbeelding worden de metrieken aangegeven op de linkerkant en zoals te zien is, overtreft het Stabiele Video Diffusie Multi View framework het Scratch-MV en SD2.1 Multi-View framework met een aanzienlijke marge. De tweede afbeelding demonstreert het effect van het aantal trainingsiteraties op de algehele prestatie van de framework in termen van Clip Score, en de SVD-MV frameworks leveren duurzame resultaten.
Slotbeschouwing
In dit artikel hebben we gesproken over Stabiele Video Diffusie, een latent videodiffusiemodel dat in staat is om hoge-resolutie, state-of-the-art beeld-naar-video- en tekst-naar-video-inhoud te genereren. Het Stabiele Video Diffusie Model volgt een unieke strategie die nooit eerder is geïmplementeerd door een generatief videomodel, aangezien het vertrouwt op latente videodiffusiebaselines met een vaste architectuur en een vaste trainingsstrategie, gevolgd door het beoordelen van de invloed van het cureren van de gegevens.
We hebben gesproken over hoe latente diffusiemodellen getraind voor het synthetiseren van 2D-beelden de mogelijkheden en efficiëntie van generatieve videomodellen hebben verbeterd door tijdelijke lagen toe te voegen en de modellen te finetunen op kleine datasets met hoge-kwaliteit video’s. Om de pretrainingsgegevens te verzamelen, voert de framework een schaalstudie uit en volgt systematische gegevensverzamelingpraktijken, en uiteindelijk stelt het een methode voor om een grote hoeveelheid videodata te cureren en omgevingsvideo’s om te zetten in invoergegevens die geschikt zijn voor generatieve videomodellen.
Bovendien gebruikt het Stabiele Video Diffusie framework drie distincte videomodeltrainingsfasen die onafhankelijk worden geanalyseerd om hun invloed op de prestaties van de framework te beoordelen. Het framework levert uiteindelijk een videorepresentatie die krachtig genoeg is om de modellen te finetunen voor optimale videogenese, en de resultaten zijn vergelijkbaar met de state-of-the-art videogenatie-modellen die al in gebruik zijn.












