AI-modeller och plattformar

AnimateLCM: Acceleration av animering av personliga diffusionsmodeller

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Under de senaste åren har diffusionsmodeller uppnått massiv framgång och erkännande för bild- och videogenerering. Videodiffusionsmodeller i synnerhet har fått betydande uppmärksamhet på grund av deras förmåga att producera videor med hög sammanhållning och trohet. Dessa modeller genererar högkvalitativa videor genom att använda en iterativ avbrusningsprocess i sin arkitektur som gradvis omvandlar högdimensionellt gaussiskt brus till riktiga data.

Stable Diffusion är en av de mest representativa modellerna för bildgenereringsuppgifter, som förlitar sig på en Variational AutoEncoder (VAE) för att kartlägga mellan den riktiga bilden och de nedsmäktade latenta funktionerna. Detta tillåter modellen att minska genereringskostnaderna, medan den tvärgående uppmärksamhetsmekanismen i dess arkitektur underlättar textbaserad bildgenerering. Mer nyligen har Stable Diffusion-ramverket byggt grunden för flera plug-and-play-adapter för att uppnå mer innovativa och effektiva bild- eller videogenerering. Men den iterativa genereringsprocessen som används av de flesta videodiffusionsmodeller gör bildgenereringsprocessen tidskrävande och relativt dyr, vilket begränsar dess tillämpningar.

I den här artikeln kommer vi att prata om AnimateLCM, en personlig diffusionsmodell med adapter som syftar till att generera högkvalitativa videor med minimala steg och beräkningskostnader. AnimateLCM-ramverket är inspirerat av Konsistensmodellen, som accelererar sampling med minimala steg genom att destillera förtränade bild-diffusionsmodeller. Dessutom underlättar den framgångsrika utvidgningen av Konsistensmodellen, den Latenta Konsistensmodellen (LCM), villkorsstyrd bildgenerering. Istället för att genomföra konsistenslärande direkt på den råa videodatasättet, föreslår AnimateLCM-ramverket att använda en decoupled konsistenslärandestrategi. Denna strategi decouplar destilleringen av rörelsegenereringsprioriter och bildgenereringsprioriter, vilket tillåter modellen att förbättra den visuella kvaliteten på den genererade innehållet och förbättra tränings-effektiviteten samtidigt. Dessutom föreslår AnimateLCM-modellen att träna adapter från scratch eller anpassa befintliga adapter till dess destillerade video-konsistensmodell. Detta underlättar kombinationen av plug-and-play-adapter i familjen med stabila diffusionsmodeller för att uppnå olika funktioner utan att skada sampelhastigheten.

Den här artikeln syftar till att täcka AnimateLCM-ramverket i djupet. Vi utforskar mekanismen, metodiken och arkitekturen i ramverket, tillsammans med dess jämförelse med state-of-the-art-bild- och videogenereringsramverk. Så, låt oss komma igång.

AnimateLCM: Animering av personliga diffusionsmodeller

Diffusionsmodeller har varit det gällande ramverket för bildgenerering och videogenerering på grund av deras effektivitet och förmåga på genereringsuppgifter. De flesta diffusionsmodeller förlitar sig på en iterativ avbrusningsprocess för bildgenerering som omvandlar ett högdimensionellt gaussiskt brus till riktiga data gradvis. Även om metoden levererar någorlunda tillfredsställande resultat, så bromsar den iterativa processen och antalet itererande prover ner genereringsprocessen och lägger också till beräkningskraven för diffusionsmodeller som är mycket långsammare än andra genereringsramverk som GAN eller Generative Adversarial Networks. Under de senaste åren har Konsistensmodeller eller CM föreslagits som ett alternativ till iterativa diffusionsmodeller för att påskynda genereringsprocessen samtidigt som de håller beräkningskraven konstanta.

Höjdpunkten i konsistensmodeller är att de lär sig konsistensmappningar som upprätthåller självkonsistens av banor introducerade av de förtränade diffusionsmodellerna. Lärandeprocessen i Konsistensmodeller tillåter den att generera högkvalitativa bilder med minimala steg och eliminerar också behovet av beräkningsintensiva iterationer. Dessutom kan den Latenta Konsistensmodellen eller LCM, som bygger på det stabila diffusionsramverket, integreras i webbgränssnittet med befintliga adapter för att uppnå en mängd ytterligare funktioner som realtidsbild-till-bild-översättning. I jämförelse, även om de befintliga videodiffusionsmodellerna levererar acceptabla resultat, så finns det fortfarande utrymme för förbättring inom videoprob-samplingsacceleration, och det är av stor betydelse på grund av de höga videogenereringsberäkningskostnaderna.

Det leder oss till AnimateLCM, ett högkvalitativt videogenereringsramverk som behöver ett minimalt antal steg för videogenereringsuppgifter. Följande den Latenta Konsistensmodellen, behandlar AnimateLCM-ramverket den omvända diffusionsprocessen som att lösa CFG eller Classifier Free Guidance-augmenterad sannolikhetsflöde, och tränar modellen för att förutsäga lösningen på sådana sannolikhetsflöden direkt i det latenta utrymmet. Men, istället för att genomföra konsistenslärande direkt på råa videodata som kräver höga tränings- och beräkningsresurser, och ofta leder till dålig kvalitet, föreslår AnimateLCM-ramverket en decoupled konsistenslärandestrategi. Denna strategi decouplar destilleringen av rörelsegenereringsprioriter och bildgenereringsprioriter.

AnimateLCM-ramverket genomför först konsistensdestillering för att anpassa den bildbaserade diffusionsmodellen till den bildkonsistensmodellen, och sedan genomför 3D-inflation till både den bildkonsistensmodellen och den bild-diffusionsmodellen för att tillgodose 3D-funktioner. Till slut får AnimateLCM-ramverket den videokonsistensmodellen genom att genomföra konsistensdestillering på videodata. Dessutom, för att lindra potentiell funktionsskada som ett resultat av diffusionsprocessen, föreslår AnimateLCM-ramverket att använda en initieringsstrategi. Eftersom AnimateLCM-ramverket bygger på det stabila diffusionsramverket, kan det ersätta de rumsliga vikterna i sin tränade videokonsistensmodell med offentligt tillgängliga personliga bild-diffusionsvikter för att uppnå innovativa genereringsresultat.

Dessutom, för att träna specifika adapter från scratch eller för att anpassa offentligt tillgängliga adapter bättre, föreslår AnimateLCM-ramverket en effektiv accelerationsstrategi för adapter som inte kräver träningslärar-modeller.

Bidragen från AnimateLCM-ramverket kan sammanfattas som följer: Det föreslagna AnimateLCM-ramverket syftar till att uppnå högkvalitativ, snabb och högkvalitativ videogenerering, och för att uppnå detta föreslår AnimateLCM-ramverket en decoupled destillationsstrategi som decouplar rörelse- och bildgenereringsprioriter, vilket resulterar i bättre genereringskvalitet och förbättrad tränings-effektivitet.

InstantID: Metodik och Arkitektur

I sin kärna drar InstantID-ramverket tung inspiration från diffusionsmodeller och sampelhastighetsstrategier. Diffusionsmodeller, också kända som poängbaserade genereringsmodeller, har demonstrerat anmärkningsvärda bildgenereringsförmågor. Under ledning av poängriktning, den iterativa sampelstrategin som implementeras av diffusionsmodeller avbrusar det brus-förorenade datat gradvis. Effektiviteten hos diffusionsmodeller är en av de stora anledningarna till varför de används av de flesta videodiffusionsmodeller genom att träna på tillagda tidslager.

Å andra sidan, sampelhastighet och sampelaccelerationsstrategier hjälper till att tackla de långsamma genereringshastigheterna i diffusionsmodeller. Destillationsbaserad accelerationsmetod finjusterar de ursprungliga diffusionsvikterna med en raffinerad arkitektur eller schemaläggare för att förbättra genereringshastigheten.

För att uppnå högkvalitativ videogenerering med ett minimalt antal steg, tuktas AnimateLCM-ramverket de stabila diffusionsbaserade videomodellerna för att följa den självkonsistens-egenskapen. Den övergripande träningsstrukturen i AnimateLCM-ramverket består av en decoupled konsistenslärandestrategi för lärar-fri anpassning och effektiv konsistenslärande.

Övergång från Diffusionsmodeller till Konsistensmodeller

AnimateLCM-ramverket introducerar sin egen anpassning av den Stabila Diffusionsmodellen eller DM till Konsistensmodellen eller CM, följande designen av den Latenta Konsistensmodellen eller LCM. Det är värt att notera att även om de stabila diffusionsmodellerna vanligtvis förutsäger bruset som läggs till proverna, är de essentiella sigma-diffusionsmodeller. Det är i kontrast med konsistensmodeller som syftar till att förutsäga lösningen till PF-ODE-banan direkt.

Decoupled Konsistenslärande

För processen med konsistensdestillering, har utvecklare observerat att datan som används för träningsprocessen påverkar starkt kvaliteten på den slutliga generationen av konsistensmodellerna. Men, det stora problemet med offentligt tillgängliga datasätt är att de ofta består av vattenmärkta data, eller är av låg kvalitet, och kan innehålla alltför korta eller tvetydiga rubriker. Dessutom är träningsmodellen direkt på stora upplösningsvideor beräkningsmässigt dyrt och tidskrävande, vilket gör det till en icke-hållbar lösning för de flesta forskare.

Givet tillgängligheten av filterade högkvalitativa datasätt, föreslår AnimateLCM-ramverket att decoupla destilleringen av rörelseprioriter och bildgenereringsprioriter. För att vara mer specifik, destillerar AnimateLCM-ramverket först de stabila diffusionsmodellerna till bildkonsistensmodeller med filterade högkvalitativa bild-text-datasätt med bättre upplösning. Ramverket tränar sedan de lätta LoRA-vikterna i lagren av den stabila diffusionsmodellen, och fryser vikterna av den stabila diffusionsmodellen. När modellen finjusterar LoRA-vikterna, fungerar den som en mångsidig accelerationsmodul, och den har demonstrerat sin kompatibilitet med andra personliga modeller i den stabila diffusionsgemenskapen.

Lärar-fri Anpassning

Stabila Diffusionsmodeller och plug-and-play-adapter fungerar ofta hand i hand. Men, det har observerats att även om plug-and-play-adapter fungerar till viss del, tenderar de att förlora kontrollen över detaljer även när de flesta av dessa adapter tränas med bild-diffusionsmodeller. För att motverka detta problem, väljer AnimateLCM-ramverket lärar-fri anpassning, en enkel men effektiv strategi som antingen anpassar befintliga adapter för bättre kompatibilitet eller tränar adapter från scratch.

AnimateLCM: Experiment och Resultat

AnimateLCM-ramverket använder en Stabil Diffusion v1-5 som basmodell, och implementerar DDIM ODE-solvern för träningsändamål. Ramverket använder också den stabila diffusionsmodellen v1-5 med öppet källkods-rörelsevikter som lärar-videodiffusionsmodell, med experiment som genomförs på WebVid2M-datasättet utan några ytterligare eller förstärkta data.

Kvalitativa Resultat

Följande figur visar resultaten från den fyra-stegs-genereringsmetoden som implementeras av AnimateLCM-ramverket i text-till-video-generering, bild-till-video-generering och kontrollerbar videogenerering.

Som det kan observeras, är resultaten som levereras av var och en av dem tillfredsställande, med de genererade resultaten som visar AnimateLCM-ramverkets förmåga att följa konsistens-egenskapen även med varierande inferens-steg, samtidigt som den upprätthåller liknande rörelse och stil.

Kvantitativa Resultat

Följande figur visar de kvantitativa resultaten och jämförelsen av AnimateLCM-ramverket med state-of-the-art DDIM och DPM++-metoder.

Som det kan observeras, överträffar AnimateLCM-ramverket de befintliga metoderna med en betydande marginal, särskilt i det låga steg-regimet som sträcker sig från 1 till 4 steg. Dessutom är AnimateLCM-metrerna som visas i denna jämförelse utvärderade utan att använda CFG eller klassificeringsfri vägledning, vilket tillåter ramverket att spara nästan 50% av inferenstiden och inferenstopp-minneskostnaden.

Slutliga Tankar

I den här artikeln har vi talat om AnimateLCM, en personlig diffusionsmodell med adapter som syftar till att generera högkvalitativa videor med minimala steg och beräkningskostnader. AnimateLCM-ramverket är inspirerat av Konsistensmodellen som accelererar sampling med minimala steg genom att destillera förtränade bild-diffusionsmodeller, och den framgångsrika utvidgningen av Konsistensmodellen, den Latenta Konsistensmodellen eller LCM som underlättar villkorsstyrd bildgenerering. Istället för att genomföra konsistenslärande direkt på den råa videodatasättet, föreslår AnimateLCM-ramverket att använda en decoupled konsistenslärandestrategi som decouplar destilleringen av rörelsegenereringsprioriter och bildgenereringsprioriter, vilket tillåter modellen att förbättra den visuella kvaliteten på den genererade innehållet och förbättra tränings-effektiviteten samtidigt.

En ingenjör till yrket, en författare av hjärtat. Kunal är en teknisk skribent med ett djupt kärlek och förståelse för AI och ML, dedikerad till att förenkla komplexa begrepp inom dessa områden genom sin engagerande och informativa dokumentation.