AI-modeller og platforme

DynamiCrafter: Animationsafspilning af åbne domænebilleder med video-diffusionspriorer

mm
Føj Unite.AI til dine foretrukne kilder på Google

Computer vision er et af de mest spændende og velundersøgte områder inden for AI-samfundet i dag, og på trods af den hurtige forbedring af computer vision-modellerne, er der stadig en længevarende udfordring, der plager udviklere, nemlig billedanimation. Selv i dag kæmper billedanimationsrammer med at omdanne stille billeder til deres respektive video-ekskvivalenter, der viser naturlige dynamikker, samtidig med at de bevare det oprindelige udseende af billederne. Traditionelt fokuserer billedanimationsrammer primært på at animere naturlige scener med domænespecifikke bevægelser som menneskehår eller kropsbevægelser eller stokastiske dynamikker som væsker og skyer. Selvom denne tilgang virker til en vis udstrækning, begrænser den alligevel anvendeligheden af disse animationsrammer til mere generisk visuelt indhold.

Desuden koncentrerer konventionelle billedanimationsmetoder sig primært om at syntetisere oscillerende og stokastiske bevægelser eller om at tilpasse sig bestemte objekt-kategorier. Men en bemærkelsesværdig fejl ved denne metode er de stærke antagelser, der pålægges disse metoder, hvilket i sidste ende begrænser deres anvendelighed, især i generelle scenarier som åbent domænebilledanimation. I de seneste år har T2V eller Text til Video-modeller demonstreret bemærkelsesværdig succes i generering af levende og varierede videoer ved hjælp af tekstuelle prompter, og dette er det, der danner grundlaget for DynamiCrafter-rammen.

DynamiCrafter-rammen er et forsøg på at overvinde de nuværende begrænsninger i billedanimationsmodeller og udvide deres anvendelighed til generiske scenarier, der involverer åbne verden billeder. DynamiCrafter-rammen forsøger at syntetisere dynamisk indhold til åbent domæne billeder, og omdanner dem til animerede videoer. Den centrale idé bag DynamiCrafter er at inkorporere billedet som vejledning i den generative proces i et forsøg på at udnytte bevægelsesprioriteten af de allerede eksisterende tekst til video-diffusionsmodeller. For et givent billede implementerer DynamiCrafter-modellen først en forespørgselstransformer, der projicerer billedet ind i en tekst-tilpasset rig kontekstrepræsentationsspace, hvilket faciliterer, at videomodellen kan fordøje billedindholdet på en kompatibel måde. Men DynamiCrafter-modellen kæmper stadig med at bevare visse visuelle detaljer i de resulterende videoer, et problem, som DynamiCrafter-modellen overvinder ved at føde det fulde billede til diffusionsmodellen ved at konkatenerer billedet med de initielle støj, og dermed supplerer modellen med mere præcis billedinformation.

Denne artikel har til formål at dække DynamiCrafter-rammen i dybden, og vi udforsker mekanismen, metoden, arkitekturen i rammen samt sammenligningen med state of the art billed- og video-genereringsrammer. Så lad os komme i gang.

DynamiCrafter: Åbent domæne billedanimation

At animere et stille billede tilbyder ofte en engagerende visuel oplevelse for publikum, da det synes at bringe det stille billede til live. Gennem årene har mange rammer udforsket forskellige metoder til at animere stille billeder. De første animationsrammer implementerede fysisk simulationsbaserede tilgange, der fokuserede på at simulere bevægelsen af bestemte objekter. Men på grund af den uafhængige modellering af hver objekt-kategori, var disse tilgange hverken effektive eller havde de generaliserbarhed. For at replikere mere realistiske bevægelser opstod reference-baserede metoder, der overførte bevægelses- eller udseendesinformation fra referencesignaler som videoer til syntesen. Selvom reference-baserede tilgange leverede bedre resultater med bedre tidsmæssig kohærens i forhold til simulationsbaserede tilgange, havde de brug for yderligere vejledning, der begrænsede deres praktiske anvendelser.

I de seneste år fokuserer de fleste animationsrammer primært på at animere naturlige scener med stokastiske, domænespecifikke eller oscillerende bevægelser. Selvom tilgangen, der er implementeret af disse rammer, virker til en vis udstrækning, er resultaterne, som disse rammer genererer, ikke tilfredsstillende, med betydelig plads til forbedring. De bemærkelsesværdige resultater, der er opnået af Text til Video-genereringsmodeller i de seneste år, har inspireret udviklerne af DynamiCrafter-rammen til at udnytte de kraftfulde genereringsmuligheder i Text til Video-modeller til billedanimation.

Den centrale idé bag DynamiCrafter-rammen er at inkorporere et betinget billede i et forsøg på at styre video-genereringsprocessen i Text til Video-diffusionsmodeller. Men det ultimative mål med billedanimation er stadig ikke-trivielt, da billedanimation kræver bevarelse af detaljer samt forståelse af visuelle kontekster, der er essentielle for at skabe dynamik. Men multi-modale kontrollerbare video-diffusionsmodeller som VideoComposer har forsøgt at enable video-generering med visuel vejledning fra et billede. Men disse tilgange er ikke egnet til billedanimation, da de enten resulterer i pludselige tidsmæssige ændringer eller lav visuel overensstemmelse med input-billedet på grund af deres mindre omfattende billedinjektionsmekanismer. For at modvirke denne hindring foreslår DynamiCrafter-rammen en dual-stream-injektionsmetode, bestående af visuel detaljevejledning og tekst-tilpasset kontekstrepræsentation. Den dual-stream-injektionsmetode tillader DynamiCrafter-rammen at sikre, at video-diffusionsmodellen syntetiserer detaljebevarende dynamisk indhold på en komplementær måde.

For et givent billede projicerer DynamiCrafter-rammen først billedet ind i en tekst-tilpasset kontekstrepræsentationsspace ved hjælp af et særligt designede kontekstlæringsnetværk. For at være mere specifik består kontekstrepræsentationsspace af en lærbart forespørgselstransformer for at fremme dens tilpasning til diffusionsmodellerne, og en pre-trænet CLIP-billede-encoder til at trække tekst-tilpassede billede-funktioner. Modellen bruger derefter de rige kontekstfunktioner ved hjælp af cross-attention-lag, og modellen bruger gated-fusion til at kombinere disse tekstfunktioner med cross-attention-lagene. Men denne tilgang handler med de lærte kontekstrepræsentationer med tekst-tilpassede visuelle detaljer, der faciliterer semantisk forståelse af billedkontekst og tillader rimelige og levende dynamikker at blive syntetiseret. Desuden forsøger rammen at supplere yderligere visuelle detaljer ved at konkatenerer det fulde billede med den initielle støj til diffusionsmodellen. Som resultat garanterer den dual-injektionsmetode, der er implementeret af DynamiCrafter-rammen, visuel overensstemmelse samt plausibel dynamisk indhold til input-billedet.

Gående videre har diffusionsmodeller eller DM’er demonstreret bemærkelsesværdig præstation og genereringsmuligheder i T2I eller Text til Billede-generering. For at replikere succesen af T2I-modeller til video-generering er VDM eller Video-Diffusionsmodeller foreslået, der bruger en rum-tids-faktoreret U-Net-arkitektur i pixel-rum til at modellere lav-resolution-videoer. Overføring af lærdomme fra T2I-rammer til T2V-rammer vil hjælpe med at reducere træningsomkostningerne. Selvom VDM eller Video-Diffusionsmodeller har evnen til at generere høj-kvalitets-videoer, accepterer de kun tekstprompter som den eneste semantiske vejledning, der måske ikke reflekterer en brugers sande intentioner eller måske er vag. Men resultaterne af de fleste VDM-modeller holder sjældent overens med input-billedet og lider af det urimelige tidsmæssige variationsproblem. DynamiCrafter-tilgangen er bygget på tekst-betingede Video-Diffusionsmodeller, der udnytter deres rige dynamiske prior til at animere åbent domæne billeder. Det gør det ved at inkorporere tilpassede designs til bedre semantisk forståelse og overensstemmelse med input-billedet.

DynamiCrafter: Metode og Arkitektur

For et givent stille billede forsøger DynamiCrafter-rammen at animere billedet til video, dvs. producere en kort video-klip. Video-klippen arver de visuelle indhold fra billedet og viser naturlige dynamikker. Men der er en mulighed for, at billedet kan dukke op i en vilkårlig placering i den resulterende frame-sekvens. Opdukken af et billede i en vilkårlig placering er en særlig type udfordring, der observeres i billed-betinget video-generering med høje visuelle overensstemmelseskrav. DynamiCrafter-rammen overvinder denne udfordring ved at udnytte de generative priorer af forudtrænede video-diffusionsmodeller.

Billed-dynamik fra Video-Diffusionsprior

Som regel er åbent domæne tekst til video-diffusionsmodeller kendt for at vise dynamisk visuelt indhold, der er modelleret under betingelse af tekstbeskrivelser. For at animere et stille billede med Text til Video-genereringspriorer skal rammerne først injicere den visuelle information i video-genereringsprocessen på en omfattende måde. Desuden skal T2V-modellen fordøje billedet for kontekstforståelse, mens den også skal være i stand til at bevare de visuelle detaljer i de genererede videoer.

Tekst-tilpasset Kontekstrepræsentation

For at vejlede video-generering med billedkontekst forsøger DynamiCrafter-rammen at projicere billedet ind i en tilpasset indlejringsspace, der tillader videomodellen at bruge billedinformationen på en kompatibel måde. Efterfølgende bruger DynamiCrafter-rammen billed-encoderen til at trække billed-funktioner fra input-billedet, da tekst-embeddingerne genereres ved hjælp af en pre-trænet CLIP-tekst-encoder. Nu, selvom de globale semantiske token fra CLIP-billede-encoderen er tilpasset billed-overskrifterne, repræsenterer de primært det visuelle indhold på semantisk niveau, og det lykkes ikke for at fange hele omfanget af billedet. DynamiCrafter-rammen implementerer fulde visuelle token fra den sidste lag af CLIP-encoderen til at trække mere komplet information, da disse visuelle token demonstrerer høj-fidelitet i betinget billed-generering. Desuden bruger rammen kontekst- og tekst-embedding til at interagere med U-Net-mellem-lagene ved hjælp af dual cross-attention-lagene. Designet af denne komponent faciliterer evnen til, at modellen kan absorbere billed-betingelser på en lag-afhængig måde. Desuden, da de mellemste lag af U-Net-arkitekturen associerer mere med objekt-poser eller -former, forventes det, at billed-funktionerne vil påvirke udseendet af videoerne primært, da de to-endelag er mere forbundet med udseende.

Visuel Detaljevejledning

DynamiCrafter-rammen bruger en rig-informativ kontekstrepræsentation, der tillader video-diffusionsmodellen i dens arkitektur at producere videoer, der ligner input-billedet tæt. Men, som demonstreret i følgende billede, kan det genererede indhold vise nogle diskrepancer på grund af den begrænsede evne af den pre-trænede CLIP-encoder til at bevare input-informationen fuldt ud, da den er designet til at tilpasse sprog og visuelle funktioner.

For at forbedre visuel overensstemmelse foreslår DynamiCrafter-rammen at give video-diffusionsmodellen yderligere visuelle detaljer, der er trukket fra input-billedet. For at opnå dette konkatenerer DynamiCrafter-modellen det betingede billede med per-frame initial støj og føder dem til denoiserings U-Net-komponenten som vejledning.

Træningsparadigme

DynamiCrafter-rammen integrerer det betingede billede gennem to komplementære strømme, der spiller en betydelig rol i detaljevejledning og kontekstkontrol. For at facilitere dette bruger DynamiCrafter-modellen en tre-trins træningsproces

  1. I det første trin træner modellen billed-kontekstrepræsentationsnetværket.
  2. I det andet trin tilpasser modellen billed-kontekstrepræsentationsnetværket til Text til Video-modellen.
  3. I det tredje og sidste trin fin-justerer modellen billed-kontekstrepræsentationsnetværket sammen med Visuel Detaljevejledningskomponenten.

For at tilpasse billed-information til kompatibilitet med Text-to-Video (T2V)-modellen foreslår DynamiCrafter-rammen at udvikle et kontekstrepræsentationsnetværk, P, designet til at fange tekst-tilpassede visuelle detaljer fra det givne billede. Da P kræver mange optimerings-trin for konvergens, indebærer rammenes tilgang at træne det først ved hjælp af en simplere Text-til-Billede (T2I)-model. Denne strategi tillader kontekstrepræsentationsnetværket at koncentrere sig om at lære om billed-konteksten, før det integreres med T2V-modellen gennem fælles træning med P og de rumlige lag, i modsætning til de tidsmæssige lag, af T2V-modellen.

For at sikre T2V-kompatibilitet merger DynamiCrafter-rammen input-billedet med per-frame støj og fin-justerer både P og de rumlige lag af Video-Diskriminationsmodellens (VDM) spatial-lag. Denne metode er valgt for at bevare integriteten af T2V-modellens eksisterende tidsmæssige indsigt uden de negative effekter af tæt billed-merging, der kunne kompromittere præstationen og afvige fra vores primære mål. Desuden bruger rammen en strategi for at tilfældigt vælge en video-frame som billed-betingelse for at opnå to mål: (i) for at undgå, at netværket udvikler en forudsigelig mønster, der direkte associerer det mergede billede med en specifik frame-placering, og (ii) for at opmuntre en mere tilpasningsdygtig kontekstrepræsentation ved at forhindre, at der gives for rigid information for en bestemt frame.

DynamiCrafter: Eksperimenter og Resultater

DynamiCrafter-rammen træner først kontekstrepræsentationsnetværket og billed-cross-attention-lagene på Stable Diffusion. Rammen erstatter derefter Stable Diffusion-komponenten med VideoCrafter og fin-justerer kontekstrepræsentationsnetværket og de rumlige lag for tilpasning og billed-konkatenering. Ved inference bruger rammen DDIM-samleren med multi-betinget klassifikator-fri vejledning. Desuden for at evaluere den tidsmæssige kohærens og kvaliteten af de syntetiserede videoer i både tidsmæssige og rumlige domæner, rapporterer rammen FVD eller Frechet Video Distance, samt KVD eller Kernel Video Distance, og evaluerer zero-shot-præstationen på alle metoderne i MSR-VTT og UCF-101-benchmarks. For at undersøge den perceptuelle overensstemmelse mellem de genererede resultater og input-billedet introducerer rammen PIC eller Perceptual Input Conformity, og antager den perceptuelle afstands-metrik DreamSim som afstands-funktionen.

Følgende figur demonstrerer den visuelle sammenligning af genereret animeret indhold med forskellige stilarter og indhold.

Som det kan observeres, holder DynamiCrafter-rammen overens med input-billed-betingelsen godt og genererer tidsmæssigt kohærente videoer. Følgende tabel indeholder statistik fra en bruger-undersøgelse med 49 deltagere af præferens-raten for Tidsmæssig Kohærens (T.C), og Bevægelses-Kvalitet (M.C) samt valg-raten for visuel overensstemmelse med input-billedet (I.C). Som det kan observeres, overgår DynamiCrafter-rammen eksisterende metoder med en betydelig margin.

Følgende figur demonstrerer resultaterne, der er opnået ved hjælp af dual-stream-injektionsmetoden og træningsparadigmet.

Endelige Tanker

I denne artikel har vi talt om DynamiCrafter, et forsøg på at overvinde de nuværende begrænsninger i billedanimationsmodeller og udvide deres anvendelighed til generiske scenarier, der involverer åbne verden billeder. DynamiCrafter-rammen forsøger at syntetisere dynamisk indhold til åbent domæne billeder, og omdanner dem til animerede videoer. Den centrale idé bag DynamiCrafter er at inkorporere billedet som vejledning i den generative proces i et forsøg på at udnytte bevægelsesprioriteten af de allerede eksisterende tekst til video-diffusionsmodeller. For et givent billede implementerer DynamiCrafter-modellen først en forespørgselstransformer, der projicerer billedet ind i en tekst-tilpasset rig kontekstrepræsentationsspace, hvilket faciliterer, at videomodellen kan fordøje billedindholdet på en kompatibel måde. Men DynamiCrafter-modellen kæmper stadig med at bevare visse visuelle detaljer i de resulterende videoer, et problem, som DynamiCrafter-modellen overvinder ved at føde det fulde billede til diffusionsmodellen ved at konkatenerer billedet med de initielle støj, og dermed supplerer modellen med mere præcis billedinformation.

Kunal Kejriwal er en backend-ingeniør med speciale i Python, PostgreSQL, Redis og cloud-infrastruktur på GCP og AWS. Med tre års erfaring i at bygge og skalere produktionssystemer skriver han om AI-infrastruktur, distribuerede systemer og arkitekturen bag implementering af maskinlæringsarbejdsbelastninger.