Andersons vinkel
Generering av bättre AI-video från bara två bilder

Video frame interpolation (VFI) är ett öppet problem inom generativ video forskning. Utmaningen är att generera mellanliggande ramar mellan två existerande ramar i en video sekvens.
Klicka för att spela. FILM-ramverket, ett samarbete mellan Google och University of Washington, föreslog en effektiv raminterpolationsmetod som fortfarande är populär i hobbyist- och professionella sfärer. Till vänster kan vi se de två separata och distinkta ramarna överlagrade; i mitten, “slutramen”; och till höger, den slutliga syntesen mellan ramarna. Källor: https://film-net.github.io/ och https://arxiv.org/pdf/2202.04901
I breda drag är denna teknik över ett århundrade gammal och har använts i traditionell animation sedan dess. I detta sammanhang skulle huvud-“nyckelramar” genereras av en huvudanimatör, medan arbetet med “tweening” mellanliggande ramar skulle utföras av andra anställda, som en mer underordnad uppgift.
Före uppkomsten av generativ AI användes raminterpolering i projekt som Real-Time Intermediate Flow Estimation (RIFE), Depth-Aware Video Frame Interpolation (DAIN), och Googles Frame Interpolation for Large Motion (FILM – se ovan) för att öka bildfrekvensen i en befintlig video, eller för att möjliggöra konstgjord slow-motion-effekt. Detta uppnås genom att dela ut de befintliga ramarna i en klipp och generera uppskattade mellanliggande ramar.
VFI används också i utvecklingen av bättre video-koder, och mer allmänt, i optisk flödes-baserade system (inklusive generativa system), som utnyttjar förkunskap om kommande nyckelramar för att optimera och forma det mellanliggande innehållet som föregår dem.
Slutramar i generativa videosystem
Moderna generativa system som Luma och Kling tillåter användare att ange en start- och en slutram, och kan utföra denna uppgift genom att analysera nyckelpunkter i de två bilderna och uppskatta en bana mellan de två bilderna.
Som vi kan se i exemplen nedan, ger en “stängande” nyckelram bättre möjlighet för det generativa videosystemet (i detta fall, Kling) att behålla aspekter som identitet, även om resultaten inte är perfekta (särskilt med stora rörelser).
Klicka för att spela. Kling är ett av ett växande antal video-genererare, inklusive Runway och Luma, som tillåter användaren att ange en slutram. I de flesta fallen leder minimal rörelse till de mest realistiska och minst felaktiga resultaten. Källa: https://www.youtube.com/watch?v=8oylqODAaH8
I ovanstående exempel är personens identitet konsekvent mellan de två användar-tillhandahållna nyckelramarna, vilket leder till en relativt konsekvent video-generering.
Där endast start-ramen tillhandahålls, är det generativa systemets fönster för uppmärksamhet vanligtvis inte tillräckligt stort för att “komma ihåg” hur personen såg ut i början av videon. Snarare är identiteten sannolikt att skifta en aning med varje ram, tills all likhet förloras. I exemplet nedan laddades en startbild upp, och personens rörelse styrdes av en text-prompt:
Klicka för att spela. Ututan slutram har Kling endast en liten grupp omedelbart föregående ramar att styra generationen av nästa ramar. I fall där någon betydande rörelse behövs, blir denna atrofi av identitet allvarlig.
Vi kan se att skådespelarens likhet är inte resilient mot instruktionerna, eftersom det generativa systemet inte vet hur han skulle se ut om han log, och han log inte i ursprungs-bilden (den enda tillgängliga referensen).
Majoriteten av virala generativa klipp är noggrant kuraterade för att tona ned dessa brister. Men, framstegen inom tidsmässigt konsekventa generativa videosystem kan bero på nya utvecklingar från forskningssektorn i fråga om raminterpolering, eftersom den enda möjliga alternativa är beroende av traditionell CGI som en drivande, “guide”-video (och även i detta fall är konsekvensen av textur och belysning för närvarande svår att uppnå).
Dessutom gör den långsamt iterativa naturen av att härleda en ny ram från en liten grupp nyligen ramar det mycket svårt att uppnå stora och djärva rörelser. Detta beror på att ett föremål som rör sig snabbt över en ram kan passera från ena sidan till den andra i samma ram, till skillnad från de mer gradvisa rörelser som systemet sannolikt har tränats på.
Likaså kan en betydande och djärv förändring av pose leda inte bara till identitetsskift, utan också till livliga inkongruenser:
Klicka för att spela. I detta exempel från Luma, verkar den begärda rörelsen inte vara väl representerad i träningdata.
Framer
Detta leder oss till en intressant nyligen publicerad artikel från Kina, som hävdar att de har uppnått en ny state-of-the-art i autentiskt utseende raminterpolering – och som är den första i sitt slag att erbjuda drag-baserad användarinteraktion.
Framer tillåter användaren att styra rörelse med en intuitiv drag-baserad gränssnitt, men den har också en “automatisk” läge. Källa: https://www.youtube.com/watch?v=4MPGKgn7jRc
Drag-centrerade applikationer har blivit vanliga i litteraturen nyligen, eftersom forskningssektorn kämpar för att tillhandahålla instrument för generativa system som inte är baserade på de ganska grova resultaten som erhålls av text-prompt.
Det nya systemet, med titeln Framer, kan inte bara följa användar-styrd drag, utan har också ett mer konventionellt “autopilot”-läge. Utöver konventionell tweening, kan systemet producera time-lapse-simulationer, samt morphing och nya vyer av ingångsbilden.

Mellanliggande ramar genererade för en time-lapse-simulering i Framer. Källa: https://arxiv.org/pdf/2410.18978
I fråga om produktionen av nya vyer, korsar Framer lite in i territoriet för Neural Radiance Fields (NeRF) – fast den kräver endast två bilder, medan NeRF vanligtvis kräver sex eller fler bildvyer.
I tester, kunde Framer, som bygger på Stability.ai’s Stable Video Diffusion latent diffusion generativt video-modell, utvisa att det kunde överträffa approximerade rivaliserande tillvägagångssätt, i en användar-studie.
Vid tidpunkten för skrivande, är koden planerad att släppas på GitHub. Video-exempel (från vilka ovanstående bilder är hämtade) finns tillgängliga på projekt-sidan, och forskarna har också släppt en YouTube-video.
Den nya artikeln heter Framer: Interaktiv raminterpolering, och kommer från nio forskare på Zhejiang University och Alibaba-backade Ant Group.
Metod
Framer använder nyckelpunkts-baserad interpolering i antingen av dess två modaliteter, där ingångsbilden utvärderas för grundläggande topologi, och “rörliga” punkter tilldelas där det behövs. I verkligheten är dessa punkter ekvivalenta med ansikts-landmärken i ID-baserade system, men generaliserar till alla ytor.
Forskarna finjusterade Stable Video Diffusion (SVD) på OpenVid-1M dataset, och lade till en extra sista-ram-syntes-funktion. Detta möjliggör en bana-kontroll-mekanism (överst till höger i schema-bilden nedan) som kan utvärdera en bana mot slut-ramen (eller tillbaka från den).

Schema för Framer.
Vad gäller tillägget av sista-ram-villkor, skriver författarna:
‘För att bevara den visuella prioriteringen av det förtränade SVD så mycket som möjligt, följer vi konditioneringsparadigmet för SVD och injicerar slut-ram-villkor i det latenta utrymmet och semantiska utrymmet, respektive.
‘Specifikt, vi konkatenerar VAE-kodad latenta funktion av den första [ramen] med den bullriga latenten av den första ramen, som i SVD. Dessutom konkatenerar vi den latenten av den sista ramen, zn, med den bullriga latenten av slut-ramen, med hänsyn till att villkoren och de motsvarande bullriga latenterna är rumsligt anpassade.
‘Dessutom extraherar vi CLIP-bild-inbäddningen av den första och sista ramarna separat och konkatenerar dem för kors-attention-injektion.’
För drag-baserad funktion, utnyttjar ban-modulen Meta Ai-ledda CoTracker ramverk, som utvärderar många möjliga banor framåt. Dessa slimmas ner till mellan 1-10 möjliga banor.
De erhållna punktkoordinaterna omvandlas sedan genom en metod som inspirerats av DragNUWA och DragAnything arkitekturer. Detta ger en Gaussian heatmap, som individuerar målområdena för rörelse.
Sedan matas data in i konditioneringsmekanismerna för ControlNet, ett hjälp-system som ursprungligen designades för Stable Diffusion, och som sedan anpassats till andra arkitekturer.
För autopilot-läge, utförs funktion-matching initialt via SIFT, som tolkar en bana som sedan kan passas till en auto-uppdaterings-mekanism inspirerad av DragGAN och DragDiffusion.

Schema för punkt-bana-estimering i Framer.
Data och tester
För finjusteringen av Framer, frystes den rumsliga uppmärksamheten och rest-blocken, och endast de temporala uppmärksamhetslagren och rest-blocken påverkades.
Modellen tränades i 10 000 iterationer under AdamW, med en inlärningshastighet på 1e-4, och en batch-storlek på 16. Träningen skedde på 16 NVIDIA A100 GPU:er.
Eftersom tidigare tillvägagångssätt för problemet inte erbjuder drag-baserad redigering, valde forskarna att jämföra Framers autopilot-läge med standardfunktionen i äldre system.
Ramverken som testades för kategorin nuvarande diffusion-baserade video-genereringssystem var LDMVFI; Dynamic Crafter; och SVDKFI. För “traditionella” video-system var de rivaliserande ramverken AMT; RIFE; FLAVR; och det ovannämnda FILM.
Utöver användar-studien, genomfördes tester på DAVIS och UCF101 dataset.
Kvalitativa tester kan endast utvärderas av forskargruppens objektivitet och av användar-studier. Men, artikeln noterar, traditionella kvantitativa mått är till stor del olämpliga för förslaget:
‘[Rekonstruktions] mått som PSNR, SSIM och LPIPS misslyckas med att fånga kvaliteten på interpolerade ramar korrekt, eftersom de bestraffar andra trovärdiga interpoleringsresultat som inte är pixel-anpassade med den ursprungliga videon.
‘Medan genererings-mått som FID erbjuder någon förbättring, är de fortfarande otillräckliga eftersom de inte tar hänsyn till tidsmässig konsekvens och utvärderar ramar i isolering.’
Trots detta, genomförde forskarna kvalitativa tester med flera populära mått:

Kvantitativa resultat för Framer vs. rival-system.
Författarna noterar att trots att de hade svårt, uppnår Framer fortfarande den bästa FVD-poängen bland de testade metoderna.
Nedan följer artiklens exempelresultat för en kvalitativ jämförelse:

Kvalitativ jämförelse mot tidigare tillvägagångssätt. Se artikeln för bättre upplösning, samt video-resultat på https://www.youtube.com/watch?v=4MPGKgn7jRc.
Författarna kommenterar:
‘[Vår] metod producerar betydligt tydligare texturer och naturlig rörelse jämfört med existerande interpolerings-tekniker. Den presterar särskilt bra i scenarier med betydande skillnader mellan ingångs-ramarna, där traditionella metoder ofta misslyckas med att interpolera innehåll korrekt.
‘Jämfört med andra diffusion-baserade metoder som LDMVFI och SVDKFI, visar Framer överlägsen anpassningsförmåga till utmanande fall och erbjuder bättre kontroll.’
För användar-studien, samlade forskarna in 20 deltagare, som bedömde 100 slumpmässigt ordnade video-resultat från de olika metoderna som testades. Således erhölls 1000 bedömningar, som utvärderade de mest “realistiska” erbjudandena:

Resultat från användar-studien.
Som kan ses från grafen ovan, föredrog användarna överväldigande resultat från Framer.
Projektets tillhörande YouTube video visar några av de potentiella andra användningarna för Framer, inklusive morphing och tecknad film-in-betweening – där hela konceptet började.
Slutsats
Det är svårt att överdriva hur viktigt denna utmaning för närvarande är för uppgiften att generera video med AI. Hittills har äldre lösningar som FILM och den icke-AI-baserade EbSynth använts av både amatör- och professionella samhällen för tweening mellan ramar; men dessa lösningar kommer med betydande begränsningar.
På grund av den oärliga kureringen av officiella exempel-videor för nya T2V-ramverk, finns det en stor allmän missuppfattning om att maskinlärningssystem kan korrekt härleda geometri i rörelse utan att använda guid-mekanismer som 3D-morfningsmodeller (3DMM) eller andra hjälp-metoder, som LoRAs.
För att vara ärlig, är tweening i sig, även om det kunde utföras perfekt, bara en “hake” eller fusk på detta problem. Men, eftersom det ofta är lättare att producera två väl-anpassade ram-bilder än att styra via text-prompt eller den nuvarande mängden alternativ, är det bra att se iterativt framsteg på en AI-baserad version av denna äldre metod.
Publicerad första gången tisdag, 29 oktober 2024












