AI-modellen en platforms
DynamiCrafter: Animatie van Open-Domein Afbeeldingen met Video Diffusie Priors
Computer visie is een van de meest spannende en goed onderzochte gebieden binnen de AI-gemeenschap van vandaag, en ondanks de snelle verbetering van de computer visie modellen, is een langdurige uitdaging die ontwikkelaars nog steeds dwarszit, afbeeldingsanimatie. Zelfs vandaag de dag worstelen afbeeldingsanimatiekaders om stil afbeeldingen om te zetten in hun respectievelijke video-tegenhangers die natuurlijke dynamiek vertonen terwijl ze het oorspronkelijke uiterlijk van de afbeeldingen behouden. Traditioneel focussen afbeeldingsanimatiekaders zich voornamelijk op het animeren van natuurlijke scènes met domeinspecifieke bewegingen zoals menselijk haar of lichaamsbewegingen, of stochastische dynamiek zoals vloeistoffen en wolken. Hoewel deze aanpak tot op zekere hoogte werkt, beperkt het de toepasbaarheid van deze animatiekaders tot meer generieke visuele inhoud.
Bovendien richten conventionele afbeeldingsanimatiebenaderingen zich voornamelijk op het synthetiseren van oscillerende en stochastische bewegingen, of op het aanpassen voor specifieke objectcategorieën. Echter, een opvallende fout in deze benadering is de sterke aannamen die aan deze methoden worden opgelegd, die uiteindelijk de toepasbaarheid ervan beperken, vooral in algemene scenario’s zoals open-domein afbeeldingsanimatie. In de afgelopen jaren hebben T2V of Tekst-naar-Video modellen opmerkelijk succes aangetoond in het genereren van levendige en gevarieerde video’s met behulp van tekstuele prompts, en dit is de basis voor het DynamiCrafter-kader.
Het DynamiCrafter-kader is een poging om de huidige beperkingen van afbeeldingsanimatiemodellen te overwinnen en hun toepasbaarheid uit te breiden tot generieke scenario’s met open-wereld afbeeldingen. Het DynamiCrafter-kader probeert dynamische inhoud te synthetiseren voor open-domein afbeeldingen, waardoor ze worden omgezet in geanimeerde video’s. Het belangrijkste idee achter DynamiCrafter is om de afbeelding op te nemen als leidraad in het generatieve proces in een poging om de bewegingsprior van de reeds bestaande tekst-naar-video diffusiemodellen te gebruiken. Voor een gegeven afbeelding, voert het DynamiCrafter-model eerst een query-transformator uit die de afbeelding projecteert in een tekst-georiënteerde rijke contextweergavespace, waardoor de video-model de afbeeldingsinhoud op een compatibele manier kan verwerken. Echter, het DynamiCrafter-model worstelt nog steeds om sommige visuele details in de resulterende video’s te behouden, een probleem dat het DynamiCrafter-model overwint door de volledige afbeelding aan het diffusiemodel te voeden door de afbeelding te concatenen met de initiële ruis, waardoor het model wordt aangevuld met meer precieze afbeeldingsinformatie.
Dit artikel heeft als doel om het DynamiCrafter-kader in detail te behandelen, en we onderzoeken de mechanisme, de methodologie, de architectuur van het kader, evenals de vergelijking met state-of-the-art afbeeldings- en video-generatiekaders. Laten we beginnen.
DynamiCrafter: Animatie van Open-Domein Afbeeldingen
Het animeren van een stil afbeelding biedt vaak een boeiende visuele ervaring voor het publiek, omdat het lijkt alsof de stil afbeelding tot leven komt. In de loop der jaren hebben talloze kaders verschillende methoden onderzocht om stil afbeeldingen te animeren. De eerste animatiekaders hebben fysieke simulatie-gebaseerde benaderingen geïmplementeerd die zich richtten op het simuleren van de beweging van specifieke objecten. Echter, vanwege het onafhankelijke modelleren van elke objectcategorie, waren deze benaderingen noch effectief noch hadden ze generaliseerbaarheid. Om meer realistische bewegingen te repliceren, ontstonden referentie-gebaseerde methoden die bewegings- of verschijningsinformatie van referentiesignalen zoals video’s overdroegen naar het synthese-proces. Hoewel referentie-gebaseerde benaderingen betere resultaten leverden met betere temporale coherentie in vergelijking met simulatie-gebaseerde benaderingen, hadden ze aanvullende leiding nodig die hun praktische toepassingen beperkte.
In recente jaren richten de meeste animatiekaders zich voornamelijk op het animeren van natuurlijke scènes met stochastische, domeinspecifieke of oscillerende bewegingen. Hoewel de aanpak die door deze kaders wordt geïmplementeerd tot op zekere hoogte werkt, zijn de resultaten die door deze kaders worden gegenereerd niet bevredigend, met aanzienlijke ruimte voor verbetering. De opmerkelijke resultaten die door Tekst-naar-Video generatieve modellen in de afgelopen jaren zijn behaald, hebben de ontwikkelaars van het DynamiCrafter-kader geïnspireerd om de krachtige generatieve mogelijkheden van Tekst-naar-Video modellen te benutten voor afbeeldingsanimatie.
Het belangrijkste fundament van het DynamiCrafter-kader is om een voorwaardelijke afbeelding op te nemen in een poging om het video-generatieproces van Tekst-naar-Video diffusiemodellen te besturen. Echter, het uiteindelijke doel van afbeeldingsanimatie blijft niet-triviaal, omdat afbeeldingsanimatie zowel het behoud van details als het begrijpen van visuele contexten vereist die essentieel zijn voor het creëren van dynamiek. Echter, multi-modale controleerbare video-diffusiemodellen zoals VideoComposer hebben geprobeerd om video-generatie met visuele leiding van een afbeelding mogelijk te maken. Echter, deze benaderingen zijn niet geschikt voor afbeeldingsanimatie, omdat ze ofwel abrupte temporale veranderingen opleveren of lage visuele overeenstemming met de invoer-afbeelding vanwege hun minder omvattende afbeeldingsinjectiemechanismen. Om deze hindernis te overwinnen, stelt het DynamiCrafter-kader een dubbele injectiebenadering voor, bestaande uit visuele detailleiding en tekst-georiënteerde contextweergave. De dubbele injectiebenadering stelt het DynamiCrafter-kader in staat om ervoor te zorgen dat het video-diffusiemodel dynamische inhoud synthetiseert die detailbehoudend is op een complementaire manier.

Voor een gegeven afbeelding, projecteert het DynamiCrafter-kader de afbeelding eerst in de tekst-georiënteerde contextweergavespace met behulp van een speciaal ontworpen contextleernetwerk. Om specifieker te zijn, bestaat de contextweergavespace uit een leerbare query-transformator om het aan te passen aan de diffusiemodellen, en een vooraf getrainde CLIP-afbeeldingsencoder om tekst-georiënteerde afbeeldingskenmerken te extraheren. Het model gebruikt vervolgens de rijke contextkenmerken met behulp van cross-attention-lagen, en het model gebruikt gated-fusie om deze tekstkenmerken te combineren met de cross-attention-lagen. Echter, deze benadering ruilt de geleerde contextweergaven in voor tekst-georiënteerde visuele details die semantisch begrip van afbeeldingscontext mogelijk maken, waardoor redelijke en levendige dynamiek kan worden gesynthetiseerd. Bovendien, in een poging om aanvullende visuele details te bieden, voegt het kader de volledige afbeelding samen met de initiële ruis aan het diffusiemodel toe. Als gevolg hiervan garandeert de dubbele injectiebenadering die door het DynamiCrafter-kader wordt geïmplementeerd zowel visuele overeenstemming als plausibele dynamische inhoud voor de invoer-afbeelding.
Verdergaand, hebben diffusiemodellen of DM’s opmerkelijke prestaties en generatieve kracht aangetoond in T2I of Tekst-naar-Afbeelding generatie. Om het succes van T2I-modellen te repliceren naar video-generatie, worden VDM of Video-Diffusiemodellen voorgesteld die een ruimte-tijd-factorized U-New-architectuur in pixelruimte gebruiken om lage-resolutievideo’s te modelleren. Het overdragen van de kennis van T2I-kaders naar T2V-kaders zal helpen om de trainingskosten te verminderen. Hoewel VDM of Video-Diffusiemodellen de mogelijkheid hebben om hoge-kwaliteit video’s te genereren, accepteren ze alleen tekstprompts als enige semantische leiding, die mogelijk niet de ware bedoelingen van de gebruiker weerspiegelt of vaag kan zijn. Echter, de resultaten van de meeste VDM-modellen houden zelden overeen met de invoer-afbeelding en lijden aan het onrealistische temporale variatieprobleem. De DynamiCrafter-benadering is gebaseerd op tekst-geconditioneerde Video-Diffusiemodellen die hun rijke dynamische prioriteit gebruiken voor het animeren van open-domein afbeeldingen. Het doet dit door speciaal ontworpen ontwerpen te gebruiken voor beter semantisch begrip en overeenstemming met de invoer-afbeelding.
DynamiCrafter: Methode en Architectuur
Voor een gegeven stil afbeelding, probeert het DynamiCrafter-kader om de afbeelding naar video om te zetten, d.w.z. een korte video-clipte produceren. De video-clipte erft de visuele inhoud van de afbeelding en toont natuurlijke dynamiek. Echter, er is een mogelijkheid dat de afbeelding kan verschijnen in een willekeurige locatie van de resulterende frame-sequentie. Het verschijnen van een afbeelding in een willekeurige locatie is een speciaal soort uitdaging die wordt waargenomen in afbeeldings-geconditioneerde video-generatie taken met hoge visuele overeenstemmingsvereisten. Het DynamiCrafter-kader overwint deze uitdaging door de generatieve prioriteiten van vooraf getrainde video-diffusiemodellen te gebruiken.
Afbeeldingsdynamiek van Video-Diffusie Prior
Meestal zijn open-domein tekst-naar-video diffusiemodellen bekend om dynamische visuele inhoud te vertonen die wordt gemodelleerd onder voorwaarden van tekstbeschrijvingen. Om een stil afbeelding te animeren met Tekst-naar-Video generatieve prioriteiten, moeten de kaders eerst de visuele informatie in het video-generatieproces injecteren op een omvattende manier. Bovendien, voor dynamische synthese, moet het T2V-model de afbeelding verwerken voor contextbegrip, terwijl het ook in staat moet zijn om de visuele details in de gegenereerde video’s te behouden.

Tekst-Georiënteerde Contextweergave
Om video-generatie te leiden met afbeeldingscontext, probeert het DynamiCrafter-kader om de afbeelding te projecteren in een afgestemde insluitingsruimte, waardoor de video-model de afbeeldingsinformatie op een compatibele manier kan gebruiken. Vervolgens gebruikt het DynamiCrafter-kader de afbeeldingsencoder om afbeeldingskenmerken van de invoer-afbeelding te extraheren, aangezien de tekst-insluitingen worden gegenereerd met behulp van een vooraf getrainde CLIP-tekstencoder. Nu, hoewel de globale semantische tokens van de CLIP-afbeeldingsencoder zijn afgestemd op de afbeeldingsbijschriften, vertegenwoordigen ze voornamelijk de visuele inhoud op het semantische niveau, waardoor ze niet in staat zijn om de volledige omvang van de afbeelding te vangen. Het DynamiCrafter-kader implementeert volledige visuele tokens van de laatste laag van de CLIP-encoder om meer complete informatie te extraheren, aangezien deze visuele tokens hoge trouw hebben aangetoond in voorwaardelijke afbeeldingsgeneratie taken. Bovendien gebruikt het kader context- en tekst-insluitingen om te interacteren met de U-Net-intermediaire kenmerken met behulp van de dubbele cross-attention-lagen. Het ontwerp van deze component faciliteert de mogelijkheid van het model om afbeeldingscondities op een laag-afhankelijke manier te absorberen. Bovendien, aangezien de intermediaire lagen van de U-Net-architectuur meer geassocieerd zijn met objectposities of -vormen, wordt verwacht dat de afbeeldingskenmerken de verschijning van de video’s voornamelijk zullen beïnvloeden, aangezien de twee-eind-lagen meer gekoppeld zijn aan verschijning.
Visuele Detailleiding
Het DynamiCrafter-kader gebruikt een rijke-informatieve contextweergave die het video-diffusiemodel in staat stelt om video’s te produceren die sterk lijken op de invoer-afbeelding. Echter, zoals wordt aangetoond in de volgende afbeelding, kan de gegenereerde inhoud enkele discrepanties vertonen vanwege de beperkte mogelijkheid van de vooraf getrainde CLIP-encoder om de invoer-informatie volledig te behouden, aangezien het is ontworpen om taal- en visuele kenmerken af te stemmen.

Om visuele overeenstemming te verbeteren, stelt het DynamiCrafter-kader voor om het video-diffusiemodel aanvullende visuele details te bieden die zijn geëxtraheerd uit de invoer-afbeelding. Om dit te bereiken, voegt het DynamiCrafter-model de voorwaardelijke afbeelding samen met de per-frame initiële ruis en voert deze in als leiding aan de denoiserende U-Net-component.
Trainingsparadigma
Het DynamiCrafter-kader integreert de voorwaardelijke afbeelding via twee complementaire stromen die een significante rol spelen in detailleiding en contextcontrole. Om dit te faciliteren, gebruikt het DynamiCrafter-model een driedelige trainingsproces
- In de eerste stap, traint het model het afbeeldingscontextweergavenetwerk.
- In de tweede stap, past het model het afbeeldingscontextweergavenetwerk aan aan het Tekst-naar-Video model.
- In de derde en laatste stap, fine-tuned het model het afbeeldingscontextweergavenetwerk gezamenlijk met de Visuele Detailleiding-component.
Om afbeeldingsinformatie aan te passen voor compatibiliteit met het Tekst-naar-Video (T2V) model, stelt het DynamiCrafter-kader voor om een contextweergavenetwerk, P, te ontwikkelen dat is ontworpen om tekst-georiënteerde visuele details van de gegeven afbeelding te leren. Het erkennen dat P veel optimalisatiestappen nodig heeft voor convergentie, omvat de aanpak van het kader het initiële trainen van P met behulp van een eenvoudiger Tekst-naar-Afbeelding (T2I) model. Deze strategie stelt het contextweergavenetwerk in staat om zich te concentreren op het leren over de afbeeldingscontext voordat het wordt geïntegreerd met het T2V-model via gezamenlijke training met P en de spatiale lagen, in plaats van de temporale lagen, van het T2V-model.
Om T2V-compatibiliteit te garanderen, voegt het DynamiCrafter-kader de invoer-afbeelding samen met de per-frame ruis toe aan het diffusiemodel en fine-tuned beide P en de spatiale lagen van de Visuele Discriminatie-Model (VDM). Deze methode is gekozen om de integriteit van de bestaande temporale inzichten van het T2V-model te behouden zonder de nadelige effecten van dichte afbeeldingsintegratie, die de prestaties kan schaden en af kan wijken van ons primaire doel. Bovendien gebruikt het kader een strategie van het willekeurig selecteren van een video-frame als de afbeeldingsconditie om twee doelen te bereiken: (i) om te voorkomen dat het netwerk een voorspelbaar patroon ontwikkelt dat de samengevoegde afbeelding rechtstreeks associeert met een specifieke frame-locatie, en (ii) om een meer aanpasbare contextweergave te stimuleren door het voorkomen van het bieden van te rigide informatie voor een specifiek frame.
DynamiCrafter: Experimenten en Resultaten
Het DynamiCrafter-kader traint eerst het contextweergavenetwerk en de afbeeldingscross-attention-lagen op Stable Diffusion. Het kader vervangt vervolgens de Stable Diffusion-component met VideoCrafter en fine-tuned het contextweergavenetwerk en de spatiale lagen voor aanpassing, en met afbeeldingsconcatenatie. Tijdens de inferentie, gebruikt het kader de DDIM-sampler met multi-condition-classifier-free-leiding. Bovendien, om de temporale coherentie en kwaliteit van de gegenereerde video’s in zowel de temporale als de spatiale domeinen te evalueren, rapporteert het kader FVD of Frechet Video Distance, evenals KVD of Kernel Video Distance, en evalueert de zero-shot-prestaties op alle methoden van de MSR-VTT- en UCF-101-benchmarks. Om de perceptuele overeenstemming tussen de gegenereerde resultaten en de invoer-afbeelding te onderzoeken, introduceert het kader PIC of Perceptual Input Conformity, en gebruikt het de perceptuele afstandsmetriek DreamSim als de functie van afstand.
De volgende figuur toont de visuele vergelijking van gegenereerde geanimeerde inhoud met verschillende stijlen en inhoud.

Zoals te zien is, houdt het DynamiCrafter-kader de invoer-afbeeldingsconditie goed vast en genereert het temporale coherente video’s. De volgende tabel bevat de statistieken van een gebruikersstudie met 49 deelnemers van de voorkeursgraad voor Temporale Coherentie (T.C), en Bewegingskwaliteit (M.C) samen met de selectiegraad voor visuele overeenstemming met de invoer-afbeelding (I.C). Zoals te zien is, kan het DynamiCrafter-kader bestaande methoden met een aanzienlijke marge overtreffen.

De volgende figuur toont de resultaten die zijn behaald met de dubbele injectie-methode en het trainingsparadigma.

Slotgedachten
In dit artikel hebben we het over DynamiCrafter, een poging om de huidige beperkingen van afbeeldingsanimatiemodellen te overwinnen en hun toepasbaarheid uit te breiden tot generieke scenario’s met open-wereld afbeeldingen. Het DynamiCrafter-kader probeert dynamische inhoud te synthetiseren voor open-domein afbeeldingen, waardoor ze worden omgezet in geanimeerde video’s. Het belangrijkste idee achter DynamiCrafter is om de afbeelding op te nemen als leidraad in het generatieve proces in een poging om de bewegingsprior van de reeds bestaande tekst-naar-video diffusiemodellen te gebruiken. Voor een gegeven afbeelding, voert het DynamiCrafter-model eerst een query-transformator uit die de afbeelding projecteert in een tekst-georiënteerde rijke contextweergavespace, waardoor de video-model de afbeeldingsinhoud op een compatibele manier kan verwerken. Echter, het DynamiCrafter-model worstelt nog steeds om sommige visuele details in de resulterende video’s te behouden, een probleem dat het DynamiCrafter-model overwint door de volledige afbeelding aan het diffusiemodel te voeden door de afbeelding te concatenen met de initiële ruis, waardoor het model wordt aangevuld met meer precieze afbeeldingsinformatie.












