Videogeneratorer
Hvorfor kan generative videosystemer ikke lave komplette film?

Opfindelsen og udviklingen af generative AI-video har fået mange tilfældige iagttagere til at forudsige, at maskinlæring vil vise sig at være døden for filmindustrien, som vi kender den – i stedet vil enkeltstående skabere kunne lave Hollywood-lignende blockbustere hjemme, enten på lokale eller cloud-baserede GPU-systemer.
Er dette muligt? Selv hvis det er muligt, er det forestående, som så mange tror?
At enkeltstående skabere vil kunne lave film, i den form vi kender dem, med konsistente karakterer, narrativ kontinuitet og total fotorealisme, er ganske muligt – og måske endda uundgåeligt.
Der er dog flere fundamentale årsager til, at dette ikke er sandsynligt at ske med videosystemer baseret på Latent Diffusion Models.
Dette sidste faktum er vigtigt, fordi det på nuværende tidspunkt omfatter hver populær tekst-til-video (T2) og billed-til-video (I2V) system, der er tilgængelige, herunder Minimax, Kling, Sora, Imagen, Luma, Amazon Video Generator, Runway ML, Kaiber (og, så vidt vi kan se, Adobe Fireflys forestående videofunktion); blandt mange andre.
Her overvejer vi muligheden for sande auteur fuldlængde gen-AI-produktioner, skabt af enkeltstående, med konsistente karakterer, fotografering og visuelle effekter på mindst samme niveau som den nuværende tilstand i Hollywood.
Lad os kaste et blik på nogle af de største praktiske hindringer for udfordringerne.
1: Du kan ikke få en præcis efterfølgende optagelse
Narrativ inkonsistens er den største af disse hindringer. Faktum er, at ingen af de nuværende videosystemer kan lave en sandt præcis ‘efterfølgende’ optagelse*.
Dette skyldes, at denoising diffusion model i hjertet af disse systemer afhænger af tilfældigt støj, og denne kerneprincip er ikke egnet til at fortolke nøjagtigt det samme indhold to gange (dvs. fra forskellige vinkler eller ved at udvikle den forrige optagelse til en efterfølgende optagelse, der opretholder konsistens med den forrige optagelse).
Der er mange andre begrænsninger i disse systemer, herunder…
2: Du kan ikke redigere en optagelse let
Hvis du afbilder en karakter, der går ned ad en gade ved hjælp af gamle CGI-metoder, og du beslutter, at du vil ændre et aspekt af optagelsen, kan du justere modellen og rendre den igen.
Hvis det er en rigtig optagelse, kan du bare nulstille og optage den igen med de rette ændringer.
Men hvis du producerer en gen-AI-videooptagelse, som du elsker, men ønsker at ændre et aspekt af den, kan du kun opnå dette ved smertefulde post-produktionsmetoder, der er udviklet over de sidste 30-40 år: CGI, rotoscoping, modeling og matting – alle arbejdskrævende og dyre, tidskrævende procedurer.
3: Du kan ikke stole på fysikkens love
Traditionelle CGI-metoder tilbyder en række algoritmer baseret på fysikkens love, der kan simulere ting som fluid dynamik, gassbevægelser, inverse kinematik (præcis modeling af menneskelige bevægelser), klædedynamik, eksplosioner og diverse andre virkelige fænomener.
Men diffusion-baserede metoder, som vi har set, har kort hukommelse og en begrænsset række bevægelsespræferencer (eksempler på sådanne handlinger, der er inkluderet i træningsdatasettet) at trække på.
Fixing It in Post
Der er andre mangler ved ren ‘single user’ AI-video generation, såsom svigt i at afbilde hurtige bevægelser og det generelle og langt mere presserende problem med at opnå temporal konsistens i outputvideoen.
Desuden er det svært at skabe specifikke ansigtsudtryk og lip-sync i generativ video, da dette ofte er et spørgsmål om held.
Konklusion
Ingenting af dette er lovende for udsigten til, at en enkelt bruger kan generere kohærent og fotorealistisk blockbuster-lignende fuldlængde film med realistisk dialog, lip-sync, præstationer, miljøer og kontinuitet.
Desuden er de hindringer, der er beskrevet her, i hvert fald i forhold til diffusion-baserede generative video-modeller, ikke nødvendigvis løselige ‘lige nu’, på trods af forumkommentarer og medieopmærksomhed, der gør dette tilfælde. Begrænsningerne synes at være intrinsic til arkitekturen.
I AI-synteseforskning, som i alle videnskabelige forskninger, kan strålende ideer periodisk forblænde os med deres potentiale, kun for at yderligere forskning skal afsløre deres fundamentale begrænsninger.
Det kan være, at vi har brug for en helt ny tilgang, eller det kan være, at Gaussian Splatting (GSplat), der blev udviklet i begyndelsen af 1990’erne og har taget fart i billedsynthesen, kan repræsentere en potentiel alternativ til diffusion-baseret video generation.
Siden GSplat tog 34 år at komme til fronten, er det muligt, at ældre konkurrenter som NeRF og GANs – og selv latent diffusion-modeller – endnu ikke har haft deres dag.
* Selv om Kaibers AI Storyboard-funktion tilbyder denne type funktionalitet, er resultaterne, jeg har set, ikke produktionskvalitet.
Martin Anderson er tidligere chef for videnskabelig forskningsindhold hos metaphysic.ai. Først udgivet mandag, 23. september 2024












