AI-modeller og platforme

AnimateLCM: Acceleration af Animation af Personlige Diffusionsmodeller

mm
Føj Unite.AI til dine foretrukne kilder på Google

Over de sidste få år har diffusionsmodeller opnået massiv succes og anerkendelse for billed- og video-generering. Video-diffusionsmodeller har i særdeleshed fået stor opmærksomhed på grund af deres evne til at producere videoer med høj koherens samt troværdighed. Disse modeller genererer højkvalitetsvideoer ved at anvende en iterativ støjreduceringsproces i deres arkitektur, der gradvist transformerer højdimensional støj til reel data.

Stable Diffusion er en af de mest repræsentative modeller for billed-generering, der afhænger af en Variational AutoEncoder (VAE) til at kortlægge mellem det virkelige billede og de nedsamplede latente funktioner. Dette tillader modellen at reducere generative omkostninger, mens cross-attention-mekanismen i dens arkitektur faciliterer tekst-betinget billed-generering. Mere nylig har Stable Diffusion-rammen bygget grundlaget for flere plug-and-play-adaptorer til at opnå mere innovative og effektive billed- eller video-generering. Imidlertid gør den iterative generative proces, der anvendes af de fleste video-diffusionsmodeller, billed-genereringsprocessen tidskrævende og relativt dyr, hvilket begrænser dens anvendelser.

I denne artikel vil vi tale om AnimateLCM, en personlig diffusionsmodel med adaptorer, der sigter mod at generere højtroværdighedsvideoer med minimalt antal trin og beregningsomkostninger. AnimateLCM-rammen er inspireret af Konsistensmodellen, der accelererer sampling med minimalt antal trin ved at destillere forudindlærte billed-diffusionsmodeller. Desuden faciliterer den succesfulde udvidelse af Konsistensmodellen, den Latente Konsistensmodel (LCM), betinget billed-generering. I stedet for at udføre konsistenslæring direkte på den rå video-datasæt, foreslår AnimateLCM-rammen at bruge en decoupled konsistenslæringsstrategi. Denne strategi decouplerer destillationen af bevægelses-genererings- og billed-genererings-priorer, hvilket tillader modellen at forbedre den visuelle kvalitet af den genererede indhold og forbedre trænings-effektiviteten samtidigt. Yderligere foreslår AnimateLCM-modellen at træne adaptorer fra scratch eller tilpasse eksisterende adaptorer til dens destillerede video-konsistensmodel. Dette faciliterer kombinationen af plug-and-play-adaptorer i familien af stabile diffusionsmodeller til at opnå forskellige funktioner uden at skade sample-hastigheden.

… (resten af artiklen følger)

AnimateLCM: Animation af Personlige Diffusionsmodeller

Diffusionsmodeller har været den foretrukne ramme for billed-generering og video-generering opgaver på grund af deres effektivitet og evner på generative opgaver. De fleste diffusionsmodeller afhænger af en iterativ støjreduceringsproces til billed-generering, der transformerer en højdimensional støj til reel data gradvist. Selvom metoden leverer nogenlunde tilfredsstillende resultater, så langsommere processen og det store antal itererende samples langsommere generationen og tilføjer til de beregningskrævende diffusionsmodeller, der er meget langsommere end andre generative rammer som GAN eller Generative Adversarial Networks. I de seneste år er Konsistensmodeller eller CM’er blevet foreslået som en alternativ til iterative diffusionsmodeller for at accelerere generationen, mens de fastholder de beregningskrævende krav konstant.

… (resten af artiklen følger)

En ingeniør af profession, en forfatter af hjerte. Kunal er en teknisk forfatter med en dyb kærlighed og forståelse af AI og ML, dedikeret til at forenkle komplekse koncepter inden for disse felter gennem sin engagerende og informative dokumentation.