AI-modeller og plattformer
DynamiCrafter: Animasjon av åpne domenebilder med video-diffusjonspriorer
Computervisjon er ett av de mest spennende og godt forskede feltene innen AI-samfunnet i dag, og til tross for den raske forbedringen av computervisjonsmodellene, er en langvarig utfordring som fortsatt plager utviklere bildeanimasjon. Selv i dag, sliter bildeanimasjonsrammeverk med å konvertere stille bilder til deres respektive videoekvivalenter som viser naturlig dynamikk samtidig som de bevare det opprinnelige utseendet til bildene. Tradisjonelt fokuserer bildeanimasjonsrammeverk primært på å animere naturlige scener med domenespesifikke bevegelser som menneskehår eller kroppbevegelser, eller stokastiske dynamikker som væsker og skyer. Selv om denne tilnærmingen fungerer til en viss grad, begrenser den anvendeligheten av disse animasjonsrammeverkene til mer generisk visuell innhold.
Videre, fokuserer konvensjonelle bildeanimasjonsmetoder primært på å syntetisere oscillerende og stokastiske bevegelser, eller på å tilpasse for bestemte objekt kategorier. Imidlertid er en merkbar feil med denne tilnærmingen de sterke antagelser som pålegges disse metodene, som til slutt begrenser deres anvendelighet, spesielt i generelle scenarier som åpne domene bildeanimasjon. Over de siste årene, har T2V eller Tekst-til-Video-modeller demonstrert bemerkelsesverdig suksess i å generere levende og varierte videoer ved hjelp av tekstprompt, og denne demonstrasjonen av T2V-modeller er hva som danner grunnlaget for DynamiCrafter-rammeverket.
DynamiCrafter-rammeverket er et forsøk på å overvinne de nåværende begrensningene til bildeanimasjonsmodellene og utvide deres anvendelighet til generiske scenarier som involverer åpne verden bilder. DynamiCrafter-rammeverket forsøker å syntetisere dynamisk innhold for åpne domene bilder, og konvertere dem til animerte videoer. Den viktigste ideen bak DynamiCrafter er å inkorporere bildet som veiledning i den generative prosessen i et forsøk på å utnytte bevegelsesprioritet til allerede eksisterende tekst-til-video-diffusjonsmodeller. For et gitt bilde, implementerer DynamiCrafter-modellen først en spørings-transformator som projiserer bildet inn i en tekst-justert rik kontekst-representasjon rom, som muliggjør video-modellen å fordøye bilde-innholdet på en kompatibel måte. Imidlertid sliter DynamiCrafter-modellen fortsatt med å bevare noen visuelle detaljer i de resulterende videoene, et problem som DynamiCrafter-modellen overvinner ved å mate det fullstendige bildet til diffusjonsmodellen ved å konkatenerer bildet med de initielle støyene, og dermed supplere modellen med mer presis bilde-informasjon.
Dette artikkel har som mål å dekke DynamiCrafter-rammeverket i dybden, og vi utforsker mekanismen, metodologien, arkitekturen til rammeverket sammen med dens sammenligning med state-of-the-art bilde- og video-genereringsrammeverk. Så la oss begynne.
DynamiCrafter: Åpne domene bilder animasjon
Å animere et stille bilde tilbyr ofte en engasjerende visuell opplevelse for publikum, siden det ser ut til å bringe det stille bildet til live. Over årene har mange rammeverk utforsket ulike metoder for å animere stille bilder. De første animasjonsrammeverkene implementerte fysisk simuleringsbaserte tilnærminger som fokuserte på å simulere bevegelsen til bestemte objekter. Imidlertid var disse tilnærmingene hverken effektive eller hadde de generaliserbarhet. For å replikere mer realistiske bevegelser, oppstod referanse-baserte metoder som overførte bevegelse eller utseende-informasjon fra referansesignaler som videoer til syntese-prosessen. Selv om referanse-baserte tilnærminger leverte bedre resultater med bedre tidsmessig kohens, trengte de ekstra veiledning som begrenset deres praktiske anvendelighet.
I de siste årene, fokuserer de fleste animasjonsrammeverk primært på å animere naturlige scener med stokastiske, domenespesifikke eller oscillerende bevegelser. Selv om tilnærmingen implementert av disse rammeverkene fungerer til en viss grad, er resultatene disse rammeverkene genererer ikke tilfredsstillende, med betydelig rom for forbedring. De bemerkelsesverdige resultater som er oppnådd av Tekst-til-Video-genereringsmodeller i de siste årene, har inspirert utviklerne av DynamiCrafter-rammeverket til å utnytte de kraftige genereringskapasitetene til Tekst-til-Video-modeller for bildeanimasjon.
Den viktigste grunnlaget for DynamiCrafter-rammeverket er å inkorporere et betinget bilde i et forsøk på å styre video-genereringsprosessen til Tekst-til-Video-diffusjonsmodeller. Imidlertid er det ultimate målet med bildeanimasjon fortsatt ikke-trivielt, siden bildeanimasjon krever bevarelse av detaljer samt forståelse av visuelle kontekster essensielle for å skape dynamikk. Imidlertid har multi-modale kontrollerbare video-diffusjonsmodeller som VideoComposer forsøkt å muliggjøre video-generering med visuell veiledning fra et bilde. Imidlertid er disse tilnærmingene ikke egnet for bildeanimasjon, siden de enten resulterer i abrupte tidsmessige endringer eller lav visuell overensstemmelse med inndata-bildet på grunn av deres mindre omfattende bilde-injeksjonsmekanismer. For å motvirke denne hindringen, foreslår DynamiCrafter-rammeverket en dual-strøm-injeksjonsmetode, bestående av visuell detalj-veiledning og tekst-justert kontekst-representasjon. Den dual-strøm-injeksjonsmetoden muliggjør at DynamiCrafter-rammeverket sikrer at video-diffusjonsmodellen syntetiserer detalj-bevarte dynamisk innhold på en komplementær måte.

For et gitt bilde, projiserer DynamiCrafter-rammeverket først bildet inn i en tekst-justert kontekst-representasjon rom ved hjelp av et spesielt designet kontekst-læringsnettverk. For å være mer spesifik, består kontekst-representasjon rommet av en lærbart spørings-transformator for å fremme dens tilpasning til diffusjonsmodellene, og en forhånds-trent CLIP-bilde-encoder for å trekke ut tekst-justert bilde-egenskaper. Modellen bruker deretter de rike kontekst-egenskapene ved hjelp av kryss-oppmerksomhetslag, og modellen bruker gated-fusjon for å kombinere disse tekst-egenskapene med kryss-oppmerksomhetslagene. Imidlertid bytte denne tilnærmingen de lærbare kontekst-representasjonene med tekst-justert visuelle detaljer som muliggjør semantisk forståelse av bilde-kontekst og tillater rimelige og levende dynamikk å bli syntetisert. Videre, i et forsøk på å supplere med ekstra visuelle detaljer, konkatenerer rammeverket det fullstendige bildet med de initielle støyene til diffusjonsmodellen. Som et resultat, garanterer den dual-injeksjonsmetoden implementert av DynamiCrafter-rammeverket visuell overensstemmelse samt plausibel dynamisk innhold til inndata-bildet.
Videre, har diffusjonsmodeller eller DM demonstrert bemerkelsesverdig ytelse og genereringskraft i T2I eller Tekst-til-Bilde-generering. For å replikere suksessen til T2I-modeller til video-generering, foreslås VDM eller Video-Diffusjonsmodeller som bruker en rom-tids-faktorisert U-New-arkitektur i piksel-rom for å modellere lav-oppløste videoer. Overføring av læringene fra T2I-rammeverk til T2V-rammeverk vil hjelpe med å redusere treningskostnadene. Selv om VDM eller Video-Diffusjonsmodeller har evnen til å generere høykvalitetsvideoer, aksepterer de bare tekstprompt som eneste semantisk veiledning som kanskje ikke reflekterer en brukers sanne intensjoner eller kan være vag. Imidlertid, resultatene av de fleste VDM-modeller er sjelden i overensstemmelse med inndata-bildet og lider av den urimelige tidsmessige variasjonsproblemet. DynamiCrafter-tilnærmingen er bygget på tekst-betingede Video-Diffusjonsmodeller som utnytter deres rike dynamiske prior for å animere åpne domene bilder. Den gjør dette ved å inkorporere tilpassede design for bedre semantisk forståelse og overensstemmelse med inndata-bildet.
DynamiCrafter: Metode og Arkitektur
For et gitt stille bilde, forsøker DynamiCrafter-rammeverket å animere bildet til video, dvs. produsere en kort video-klipp. Video-klippen arver de visuelle innholdene fra bildet og viser naturlig dynamikk. Imidlertid er det en mulighet for at bildet kan dukke opp i en vilkårlig lokasjon i den resulterende rammefølgen. Oppdukkingen av et bilde i en vilkårlig lokasjon er en spesiell type utfordring observert i bilde-betinget video-genereringsoppgaver med høye visuelle overensstemmelseskrav. DynamiCrafter-rammeverket overvinner denne utfordringen ved å utnytte de generative prioritetene til forhånds-trente video-diffusjonsmodeller.
Bilde-dynamikk fra Video-Diffusjons-prior
Vanligvis er åpne domene tekst-til-video-diffusjonsmodeller kjent for å vise dynamisk visuell innhold modellert betinget på tekst-beskrivelser. For å animere et stille bilde med Tekst-til-Video-genereringsprior, må rammeverkene først injisere de visuelle informasjonene i video-genereringsprosessen på en omfattende måte. Videre, for dynamisk syntese, må T2V-modellen fordøye bildet for kontekst-forståelse, samtidig som den også må være i stand til å bevare de visuelle detaljene i de genererte videoene.

Tekst-justert Kontekst-Representasjon
For å guide video-generering med bilde-kontekst, forsøker DynamiCrafter-rammeverket å projisere bildet inn i en justert innlejring-rom som tillater video-modellen å bruke bilde-informasjonen på en kompatibel måte. Etter dette, bruker DynamiCrafter-rammeverket bilde-encoderen for å trekke ut bilde-egenskaper fra inndata-bildet, siden tekst-embeddingsene er generert ved hjelp av en forhånds-trent CLIP-tekst-encoder. Nå, selv om de globale semantiske tokenene fra CLIP-bilde-encoderen er justert med bilde-overskriftene, representerer de primært de visuelle innholdene på semantisk nivå, og klarer ikke å fange det fullstendige omfanget av bildet. DynamiCrafter-rammeverket implementerer fullstendige visuelle token fra den siste laget av CLIP-encoderen for å trekke ut mer fullstendig informasjon, siden disse visuelle tokenene demonstrerer høy-trofasthet i betinget bilde-genereringsoppgaver. Videre, bruker rammeverket kontekst- og tekst-embeddings for å samhandle med U-Net-mellomlag-egenskapene ved hjelp av dual-kryss-oppmerksomhetslag. Designet av denne komponenten muliggjør evnen til modellen til å absorbere bilde-betingelser på en lag-avhengig måte. Videre, siden de mellomliggende lagene av U-Net-arkitekturen assosierer mer med objekt-pose eller -former, er det forventet at bilde-egenskapene vil påvirke utseendet til videoene overveiende, særlig siden de to-endelige lagene er mer koblet til utseende.
Visuell Detalj-veiledning
DynamiCrafter-rammeverket bruker rik-informativ kontekst-representasjon som tillater video-diffusjonsmodellen i dens arkitektur å produsere videoer som ligner inndata-bildet nært. Imidlertid, som demonstrert i følgende bilde, kan de genererte innholdene vise noen diskrepanser på grunn av den begrensede evnen til den forhånds-trente CLIP-encoderen til å bevare inndata-informasjonen fullstendig, siden den er designet for å justere språk- og visuelle egenskaper.

For å forbedre visuell overensstemmelse, foreslår DynamiCrafter-rammeverket å gi video-diffusjonsmodellen ekstra visuelle detaljer trekke fra inndata-bildet. For å oppnå dette, konkatenerer DynamiCrafter-modellen det betingede bildet med per-ramme-iniial støy og mater dem til denoising U-Net-komponenten som veiledning.
Trenings-paradigme
DynamiCrafter-rammeverket integrerer det betingede bildet gjennom to komplementære strømmer som spiller en betydelig rolle i detalj-veiledning og kontekst-kontroll. For å muliggjøre dette, bruker DynamiCrafter-modellen en tre-stegs treningsprosess
- I det første steget, trener modellen bilde-kontekst-representasjonsnettverket.
- I det andre steget, tilpasser modellen bilde-kontekst-representasjonsnettverket til Tekst-til-Video-modellen.
- I det tredje og siste steget, fin-justerer modellen bilde-kontekst-representasjonsnettverket sammen med Visuell Detalj-veilednings-komponenten.
For å tilpasse bilde-informasjon for kompatibilitet med Tekst-til-Video-modellen, foreslår DynamiCrafter-rammeverket å utvikle en kontekst-representasjonsnettverk, P, designet for å fange tekst-justert visuelle detaljer fra det gitt bildet. Ved å erkjenne at P krever mange optimerings-steg for konvergens, involverer rammeverkets tilnærming initialt å trene det ved hjelp av en enklere Tekst-til-Bilde-modell. Denne strategien tillater kontekst-representasjonsnettverket å konsentrere seg om å lære om bilde-konteksten før å integrere det med Tekst-til-Video-modellen gjennom felles treningsprosess med P og de romlige lagene, i motsetning til de tidsmessige lagene, av Tekst-til-Video-modellen.
For å sikre Tekst-til-Video-kompatibilitet, konkatenerer DynamiCrafter-rammeverket inndata-bildet med per-ramme-støy, og deretter fin-justerer både P og de romlige lagene av Video-Diskriminering-Modellen. Denne metoden er valgt for å bevare integriteten til Tekst-til-Video-modellens eksisterende tidsmessige innsikt uten de negative effektene av tett bilde-sammenslåing, som kunne kompromittere ytelsen og avvike fra vårt primære mål. Videre, bruker rammeverket en strategi for å tilfeldig velge en video-ramme som bilde-betingelse for å oppnå to mål: (i) for å unngå at nettverket utvikler en forutsigbar mønster som direkte assosierer det sammenslåtte bildet med en bestemt ramme-lokasjon, og (ii) for å fremme en mer tilpasningsdyktig kontekst-representasjon ved å forhindre å gi for rigid informasjon for en bestemt ramme.
DynamiCrafter: Eksperimenter og Resultater
DynamiCrafter-rammeverket trener først kontekst-representasjonsnettverket og bilde-kryss-oppmerksomhetslagene på Stabil Diffusjon. Rammeverket erstatter deretter Stabil Diffusjon-komponenten med VideoCrafter og fin-justerer kontekst-representasjonsnettverket og de romlige lagene for tilpasning, og med bilde-konkatenering. Ved inferens, bruker rammeverket DDIM-samleren med multi-betinget klassifikator-fri veiledning. Videre, for å evaluere den tidsmessige kohens og kvaliteten til de syntetiserte videoene i både tidsmessige og romlige domener, rapporterer rammeverket FVD eller Frechet Video-Distanse, samt KVD eller Kernel Video-Distanse, og evaluerer null-skudd-prestasjonen på alle metodene til MSR-VTT og UCF-101-benchmarkene. For å undersøke den perseptuelle overensstemmelsen mellom de genererte resultater og inndata-bildet, introducerer rammeverket PIC eller Perseptuell Inndata-Overensstemmelse, og bruker den perseptuelle distanse-metrikken DreamSim som funksjonen av distanse.
Følgende figur demonstrerer den visuelle sammenligningen av generert animert innhold med ulike stiler og innhold.

Som det kan observeres, blant alle de ulike metodene, holder DynamiCrafter-rammeverket godt overens med inndata-bildet, og genererer tidsmessig kohente videoer. Følgende tabell inneholder statistikk fra en bruker-undersøkelse med 49 deltakere av preferanse-raten for Tidsmessig Kohens (T.C), og Bevegelses-kvalitet (M.C) sammen med valg-raten for visuell overensstemmelse med inndata-bildet (I.C). Som det kan observeres, er DynamiCrafter-rammeverket i stand til å overgå eksisterende metoder med en betydelig margin.

Følgende figur demonstrerer resultater oppnådd ved hjelp av den dual-strøm-injeksjonsmetoden og trenings-paradigmet.

Slutt-tanker
I denne artikkelen har vi talt om DynamiCrafter, et forsøk på å overvinne de nåværende begrensningene til bildeanimasjonsmodellene og utvide deres anvendelighet til generiske scenarier som involverer åpne verden bilder. DynamiCrafter-rammeverket forsøker å syntetisere dynamisk innhold for åpne domene bilder, og konvertere dem til animerte videoer. Den viktigste ideen bak DynamiCrafter er å inkorporere bildet som veiledning i den generative prosessen i et forsøk på å utnytte bevegelsesprioritet til allerede eksisterende tekst-til-video-diffusjonsmodeller. For et gitt bilde, implementerer DynamiCrafter-modellen først en spørings-transformator som projiserer bildet inn i en tekst-justert rik kontekst-representasjon rom, som muliggjør video-modellen å fordøye bilde-innholdet på en kompatibel måte. Imidlertid sliter DynamiCrafter-modellen fortsatt med å bevare noen visuelle detaljer i de resulterende videoene, et problem som DynamiCrafter-modellen overvinner ved å mate det fullstendige bildet til diffusjonsmodellen ved å konkatenerer bildet med de initielle støyene, og dermed supplere modellen med mer presis bilde-informasjon.












