Andersons vinkel
Generering af bedre AI-video fra kun to billeder

Video frame interpolation (VFI) er et åbent problem i generativ video forskning. Udfordringen er at generere mellemframes mellem to eksisterende frames i en video sekvens.
Klik for at afspille. FILM-rammeværket, et samarbejde mellem Google og University of Washington, foreslog en effektiv frame interpolation metode, der stadig er populær i hobbyist og professionelle kredse. Til venstre kan vi se de to separate og distinkte frames superimponeret; i midten, ‘end frame’; og til højre, den endelige syntese mellem frames. Kilder: https://film-net.github.io/ og https://arxiv.org/pdf/2202.04901
I bredere forstand har denne teknik rod tilbage over en århundrede, og er blevet brugt i traditionel animation siden da. I den sammenhæng ville master ‘keyframes’ blive genereret af en principal animationskunstner, mens arbejdet med ‘tweening’ af mellemframes ville blive udført af andre medarbejdere, som en mere underordnet opgave.
Før opkomsten af generativ AI, blev frame interpolation brugt i projekter som Real-Time Intermediate Flow Estimation (RIFE), Depth-Aware Video Frame Interpolation (DAIN), og Googles Frame Interpolation for Large Motion (FILM – se ovenfor) til formål at øge framehastigheden af en eksisterende video, eller enable kunstigt genererede slow-motion effekter. Dette opnås ved at splitte ud de eksisterende frames af en klip og generere estimerede mellemframes.
VFI bruges også i udviklingen af bedre video codecs, og mere generelt, i optical flow-baserede systemer (herunder generative systemer), der udnytter forhåndsviden om kommende keyframes til at optimere og forme den interstitielle indhold, der forløber dem.
End Frames i Generative Video Systemer
Moderne generative systemer som Luma og Kling tillader brugeren at specificere en start- og en end frame, og kan udføre denne opgave ved at analysere keypoints i de to billeder og estimere en trajektori mellem de to billeder.
Som vi kan se i eksemplerne nedenfor, giver en ‘lukkende’ keyframe bedre mulighed for det generative video system (i dette tilfælde, Kling) at fastholde aspekter som identitet, selv om resultaterne ikke er perfekte (især med store bevægelser).
Klik for at afspille. Kling er en af en voksende række af video genereringsværktøjer, der tillader brugeren at specificere en end frame. I de fleste tilfælde vil minimal bevægelse føre til de mest realistiske og mindst fejlbehæftede resultater. Kilde: https://www.youtube.com/watch?v=8oylqODAaH8
I ovenstående eksempel er personens identitet konsekvent mellem de to brugerdefinerede keyframes, hvilket fører til en relativt konsekvent video generation.
Hvor kun startframe er givet, er det generative systems vindue af opmærksomhed normalt ikke stor nok til at ‘huske’, hvordan personen så ud til at starte med videoen. I stedet er identiteten sandsynligvis skiftende lidt med hver frame, indtil alle ligheder er tabt. I eksemplet nedenfor blev et startbillede uploadet, og personens bevægelse guidet af en tekstprompt:
Klik for at afspille. Uden en end frame, har Kling kun en lille gruppe af umiddelbart forudgående frames til at guide generationen af de næste frames. I tilfælde, hvor nogen betydelig bevægelse er nødvendig, bliver denne atrofi af identitet alvorlig.
Vi kan se, at skuespillerens lighed er ikke resilient over for instruktionerne, da det generative system ikke ved, hvordan han ville se ud, hvis han smilede, og han ikke smiler i seed billedet (den eneste tilgængelige reference).
De fleste virale generative klip er omhyggeligt kurateret for at nedtone disse svagheder. Men fremgangen af temporalt konsistente generative video systemer kan afhænge af nye udviklinger fra forskningssektoren i forhold til frame interpolation, da den eneste mulige alternative er afhængighed af traditionel CGI som en drivende, ‘guide’ video (og selv i dette tilfælde er konsistens af tekstur og belysning stadig svær at opnå).
Dertil kommer, at den langsomt iterative natur af at udlede en ny frame fra en lille gruppe af nærliggende frames gør det meget svært at opnå store og dristige bevægelser. Dette skyldes, at et objekt, der bevæger sig hurtigt over en frame, kan transitere fra den ene side til den anden i løbet af en enkelt frame, modsat de mere gradvise bevægelser, som systemet sandsynligvis er blevet trænet på.
Ligeledes kan en betydelig og dristig ændring af holdning føre ikke kun til identitetsskift, men også til levende ikke-kongruenser:
Klik for at afspille. I dette eksempel fra Luma, ser den anmodede bevægelse ikke ud til at være godt repræsenteret i træningsdata.
Framer
Dette bringer os til en interessant ny artikel fra Kina, som hævder at have opnået en ny state-of-the-art i autentisk udseende frame interpolation – og som er den første af sin art til at tilbyde drag-baseret brugerinteraktion.
Framer tillader brugeren at dirigere bevægelse ved hjælp af en intuitiv drag-baseret interface, selv om det også har en ‘automatisk’ tilstand. Kilde: https://www.youtube.com/watch?v=4MPGKgn7jRc
Drag-centrisk applikationer er blevet hyppige i litteraturen for nylig, da forskningssektoren kæmper for at give instrumentaliteter for generative systemer, der ikke er baseret på de ret grove resultater, der opnås ved tekstprompts.
Det nye system, titlen Framer, kan ikke kun følge brugerstyret drag, men har også en mere konventionel ‘autopilot’ tilstand. Udover konventionel tweening, er systemet i stand til at producere time-lapse simulationer, samt morphing og nye visninger af input billedet.

Interstitial frames genereret for en time-lapse simulation i Framer. Kilde: https://arxiv.org/pdf/2410.18978
I forhold til produktionen af nye visninger, krydser Framer lidt ind i territoriet af Neural Radiance Fields (NeRF) – selv om det kun kræver to billeder, hvor NeRF generelt kræver seks eller flere billedindgangsvisninger.
I tests, var Framer, der er baseret på Stability.ai’s Stable Video Diffusion latent diffusion generative video model, i stand til at overgå approximative rivaliserende tilgange i en brugerundersøgelse.
På tidspunktet for skrivning, er koden sat til at blive frigivet på GitHub. Videoeksempler (fra hvilke de ovenstående billeder er afledt) er tilgængelige på projektets side, og forskerne har også udgivet en YouTube video.
Den nye artikel er titlen Framer: Interaktiv Frame Interpolation, og kommer fra ni forskere på tværs af Zhejiang University og Alibaba-backed Ant Group.
Metode
Framer bruger keypoint-baseret interpolation i enten af dens to modaliteter, hvor input billedet vurderes for grundlæggende topologi, og ‘flytbare’ punkter tildelt efter behov. I virkeligheden er disse punkter lig med facial landmarks i ID-baserede systemer, men generaliserer til enhver overflade.
Forskerne fine-tuned Stable Video Diffusion (SVD) på OpenVid-1M dataset, og tilføjede en ekstra sidste frame syntese kapacitet. Dette faciliterer en trajektori-kontrol mekanisme (øverst til højre i schema billedet nedenfor), der kan evaluere en vej mod end frame (eller tilbage fra den).

Schema for Framer.
Med hensyn til tilføjelsen af sidste frame betingelse, siger forfatterne:
‘For at bevare den visuelle prior af den forhåndstrænede SVD så meget som muligt, følger vi betingelsesparadigmet af SVD og injicerer end frame betingelser i latent rum og semantisk rum, respektivt.
‘Specifikt, konkatenerer vi VAE-kodet latent funktion af den første [frame] med den støjende latent af den første frame, som gjort i SVD. Derudover konkatenerer vi latent funktionen af den sidste frame, zn, med den støjende latent af end frame, under antagelse af, at betingelserne og de tilsvarende støjende latente er spatialt aligneret.
‘Desuden udtrækker vi CLIP billedindlejring af den første og sidste frames separat og konkatenerer dem for cross-attention feature injektion.’
For drag-baseret funktionalitet, udnytter trajektori-modulen Meta Ai-led CoTracker framework, der vurderer mange mulige veje fremad. Disse slimmes ned til mellem 1-10 mulige trajektorier.
De opnåede punktkoordinater transformeres derefter gennem en metode inspireret af DragNUWA og DragAnything arkitekturer. Dette opnår en Gaussian heatmap, der individuerer målområderne for bevægelse.
Herefter fødes dataene til betingelsesmekanismerne af ControlNet, et hjælpekonformitetssystem oprindeligt designet til Stable Diffusion, og siden tilpasset til andre arkitekturer.
For autopilot tilstand, udføres feature matching initialt via SIFT, der fortolker en trajektori, der derefter kan overføres til en selvopdatering mekanisme inspireret af DragGAN og DragDiffusion.

Schema for punkt-trajektør estimering i Framer.
Data og Tests
For finjusteringen af Framer, blev spatial attention og residual blokke frosset, og kun de temporale attention lag og residual blokke påvirkede.
Modellen blev trænet i 10.000 iterationer under AdamW, med en læringsrate på 1e-4, og en batch størrelse på 16. Træningen fandt sted på 16 NVIDIA A100 GPU’er.
Da tidligere tilgange til problemet ikke tilbyder drag-baseret redigering, valgte forskerne at sammenligne Framer’s autopilot tilstand med standardfunktionaliteten af ældre tilgange.
Rammeverkerne, der blev testet for kategorien af nuværende diffusion-baserede video generation systemer, var LDMVFI; Dynamic Crafter; og SVDKFI. For ‘traditionelle’ video systemer var rivaliserende rammeverk AMT; RIFE; FLAVR; og den ovenfor nævnte FILM.
Derudover blev tests udført på DAVIS og UCF101 datasets.
Kvalitative tests kan kun vurderes af forskningsteamets objektive evner og af brugerstudier. Men artiklen bemærker, at traditionelle kvantitative metrikker er stort set uegnede til forslaget:
‘[Rekonstruktion] metrikker som PSNR, SSIM og LPIPS fejler at fange kvaliteten af interpolerede frames nøjagtigt, da de straffer andre plausibler interpoleringsresultater, der ikke er pixel-aligneret med den originale video.
‘Selv om generation metrikker som FID tilbyder nogen forbedring, mangler de stadig, da de ikke tager hensyn til temporal konsistens og vurderer frames i isolation.’
Trods dette, udførte forskerne kvalitative tests med flere populære metrikker:

Kvantitative resultater for Framer vs. rival systemer.
Forfatterne bemærker, at på trods af at have oddsene imod dem, opnår Framer stadig den bedste FVD score blandt de testede metoder.
Nedenfor er artiklens eksempler på en kvalitativ sammenligning:

Kvalitativ sammenligning mod tidligere tilgange. Se venligst artiklen for bedre opløsning, såvel som videoresultater på https://www.youtube.com/watch?v=4MPGKgn7jRc.
Forfatterne kommenterer:
‘[Vores] metode producerer betydeligt klarere teksturer og naturligere bevægelse i forhold til eksisterende interpoleringsmetoder. Den udfører især godt i scenarier med betydelige forskelle mellem input frames, hvor traditionelle metoder ofte fejler at interpolere indhold nøjagtigt.
‘I sammenligning med andre diffusion-baserede metoder som LDMVFI og SVDKFI, demonstrerer Framer overlegen tilpasningsevne til udfordrende tilfælde og tilbyder bedre kontrol.’
For brugerstudiet, samlede forskerne 20 deltagere, der vurderede 100 tilfældigt ordnede videoresultater fra de forskellige metoder, der blev testet. Dermed blev 1000 vurderinger opnået, der vurderede de mest ‘realistiske’ tilbud:

Resultater fra brugerstudiet.
Som kan ses fra grafen ovenfor, foretrækker brugerne overvældende resultater fra Framer.
Projektets tilhørende YouTube video fremhæver nogle af de andre mulige anvendelser af Framer, herunder morphing og cartoon in-betweening – hvor hele konceptet begyndte.
Konklusion
Det er svært at overdrive, hvor vigtigt denne udfordring i øjeblikket er for opgaven med AI-baseret video generation. Indtil nu, har ældre løsninger som FILM og den (ikke-AI) EbSynth været brugt af både amatør- og professionelle samfund til tweening mellem frames; men disse løsninger kommer med betydelige begrænsninger.
Da de officielle eksempelvideoer for nye T2V-rammeverk er omhyggeligt kurateret, er der en bred offentlig misforståelse af, at maskinlærings systemer kan nøjagtigt slutte geometri i bevægelse uden at anvende vejledningsmekanismer som 3D-morfe modeller (3DMM) eller andre hjælpe tilgange, såsom LoRAs.
For at være ærlig, udgør tweening selv, selv om det kunne udføres perfekt, kun en ‘hack’ eller snyd over for dette problem. Alligevel, da det ofte er lettere at producere to velalignerede frame billeder end at anvende vejledning via tekstprompts eller den nuværende række af alternativer, er det godt at se iterative fremskridt på en AI-baseret version af denne ældre metode.
Først udgivet tirsdag, 29. oktober 2024












