Unghiul lui Anderson
De ce sistemele video generative nu pot crea filme complete?

ApariČia Či progresul inteligenČei artificiale generative video a determinat mulČi observatori casuali sÄ previzioneze cÄ ÃŪnvÄČarea automatÄ va dovedi a fi moartea industriei cinematografice aČa cum o Čtim â ÃŪn schimb, creatorii individuali vor putea crea blockbustere ÃŪn stil Hollywood la domiciliu, fie pe sisteme locale, fie pe sisteme bazate pe cloud.
Este acest lucru posibil? Chiar dacÄ este posibil, este iminent, aČa cum cred mulČi?
CÄ indivizii vor putea, ÃŪn cele din urmÄ, sÄ creeze filme, ÃŪn forma pe care o Čtim, cu personaje consistente, continuitate narativÄ Či fotorealism total, este destul de posibil â Či, poate, chiar inevitabil.
Cu toate acestea, existÄ cÃĒteva motive fundamentale pentru care acest lucru nu este probabil sÄ se ÃŪntÃĒmple cu sistemele video bazate pe modele de difuziune latentÄ.
Acest ultim fapt este important, deoarece, ÃŪn acest moment, aceastÄ categorie include fiecare sistem popular de text-la-video (T2) Či imagine-la-video (I2V) disponibil, inclusiv Minimax, Kling, Sora, Imagen, Luma, Amazon Video Generator, Runway ML, Kaiber (Či, dupÄ cum putem discerne, funcČionalitatea video pending a Adobe Firefly); printre mulČi alČii.
Aici, luÄm ÃŪn considerare perspectiva unor producČii de film complet gen-AI, create de indivizi, cu personaje consistente, cinematografie Či efecte vizuale cel puČin la nivelul stadiului actual al artei ÃŪn Hollywood.
SÄ aruncÄm o privire asupra unora dintre cele mai mari obstacole practice pentru provocÄrile implicate.
1: Nu poČi obČine un cadru de urmÄrire precis
InconsistenČa narativÄ este cel mai mare dintre aceste obstacole. Faptul este cÄ niciun sistem de generare video disponibil ÃŪn prezent nu poate crea un cadru de urmÄrire âprecisâ.
Acest lucru se datoreazÄ faptului cÄ modelul de difuziune de denoising din inima acestor sisteme se bazeazÄ pe zgomot aleator, Či acest principiu de bazÄ nu este adaptat pentru a reinterpreta exact acelaČi conČinut de douÄ ori (adicÄ, din unghiuri diferite, sau prin dezvoltarea cadrelor anterioare ÃŪntr-un cadru de urmÄrire care menČine consistenČa cu cadrul anterior).
Ãn cazul ÃŪn care se utilizeazÄ prompturi de text, singure sau ÃŪmpreunÄ cu imagini âseedâ ÃŪncÄrcate (intrare multimodalÄ), tokenurile derivate din prompt vor solicita conČinut semantic adecvat din spaČiul latent antrenat al modelului.
Cu toate acestea, ÃŪmpiedicat ÃŪn plus de factorul âzgomot aleatorâ, niciodatÄ nu va face acelaČi lucru de douÄ ori.
Acest lucru ÃŪnseamnÄ cÄ identitÄČile persoanelor din videoclip vor tendenČa sÄ se schimbe, Či obiectele Či mediile nu vor corespunde cu cadrul iniČial.
Acesta este motivul pentru care clipurile virale care prezintÄ imagini extraordinare Či ieČiri la nivelul Hollywood tendenČa sÄ fie fie cadre simple, fie o âmontaj de prezentareâ a capacitÄČilor sistemului, unde fiecare cadru prezintÄ personaje Či medii diferite.
Excerpte dintr-un montaj generativ de inteligenČÄ artificialÄ de la Marco van Hylckama Vlieg â sursÄ: https://www.linkedin.com/posts/marcovhv_thanks-to-generative-ai-we-are-all-filmmakers-activity-7240024800906076160-nEXZ/
ImplicaČia ÃŪn aceste colecČii de generaČii video ad hoc (care pot fi ÃŪnČelÄtoare ÃŪn cazul sistemelor comerciale) este cÄ sistemul subiacent poate crea naraČiuni Či cadre contigue Či consistente.
Analogia exploatatÄ aici este o prezentare a filmului, care prezintÄ doar un minut sau douÄ de filmare din film, dar oferÄ publicului motiv sÄ creadÄ cÄ ÃŪntregul film existÄ.
Singurele sisteme care oferÄ ÃŪn prezent consistenČÄ narativÄ ÃŪntr-un model de difuziune sunt cele care produc imagini statice. Acestea includ ConsiStory de la NVIDIA Či diverse proiecte din literatura ČtiinČificÄ, cum ar fi TheaterGen, DreamStory Či StoryDiffusion.

DouÄ exemple de continuitate narativÄ âstaticÄâ, de la modele recente: Surse: https://research.nvidia.com/labs/par/consistory/ Či https://arxiv.org/pdf/2405.01434
Ãn teorie, puteČi utiliza o versiune mai bunÄ a unor astfel de sisteme (niciunul dintre cele de mai sus nu este cu adevÄrat consistent) pentru a crea o serie de cadre de imagine-la-videoclip, care pot fi conectate ÃŪntr-o secvenČÄ.
La stadiul actual al tehnologiei, aceastÄ abordare nu produce cadre de urmÄrire plauzibile; Či, ÃŪn orice caz, am abandonat deja visul auteur prin adÄugarea unei straturi de complexitate.
PuteČi, de asemenea, utiliza modele de adaptare de rang scÄzut (LoRA), special antrenate pe caractere, lucruri sau medii, pentru a menČine o mai bunÄ consistenČÄ ÃŪntre cadre.
Cu toate acestea, dacÄ un personaj doreČte sÄ aparÄ ÃŪntr-un costum nou, un LoRA complet nou va trebui sÄ fie antrenat, care sÄ ÃŪncorporeze personajul ÃŪmbrÄcat ÃŪn acel mod (deČi sub-concepte, cum ar fi ârochie roČieâ, pot fi antrenate ÃŪn LoRA individuale, ÃŪmpreunÄ cu imagini adecvate, nu sunt ÃŪntotdeauna uČor de lucrat).
Acest lucru adaugÄ o complexitate considerabilÄ, chiar Či pentru o scenÄ de deschidere a unui film, ÃŪn care o persoanÄ iese din pat, se ÃŪmbracÄ ÃŪntr-un halat de baie, cÄscÄ, se uitÄ pe fereastrÄ Či merge la baie pentru a-Či spÄla dinČii.
O astfel de scenÄ, care conČine aproximativ 4-8 cadre, poate fi filmatÄ ÃŪntr-o singurÄ dimineaČÄ prin proceduri de filmare convenČionalÄ; la stadiul actual al tehnologiei de inteligenČÄ artificialÄ generativÄ, reprezintÄ potenČial sÄptÄmÃĒni de muncÄ, multiple LoRA antrenate (sau alte sisteme auxiliare) Či o cantitate considerabilÄ de post-procesare.
Alternativ, se poate utiliza videoclip-la-videoclip, unde imagini sau CGI obiČnuite sunt transformate prin prompturi de text ÃŪn interpretÄri alternative. Runway oferÄ un astfel de sistem, de exemplu.
CGI (stÃĒnga) din Blender, interpretat ÃŪntr-un experiment de videoclip-la-videoclip asistat de text de cÄtre Mathieu Visnjevec â SursÄ: https://www.linkedin.com/feed/update/urn:li:activity:7240525965309726721/
ExistÄ douÄ probleme aici: sunteČi nevoit sÄ creaČi filmarea de bazÄ, aČa cÄ sunteČi deja ÃŪn curs de a face filmul de douÄ ori, chiar dacÄ utilizaČi un sistem sintetic, cum ar fi MetaHuman de la UnReal.
DacÄ creaČi modele CGI (cum ar fi clipul de mai sus) Či le utilizaČi ÃŪntr-o transformare de imagine-la-videoclip, consistenČa lor ÃŪntre cadre nu poate fi garantatÄ.
Acest lucru se datoreazÄ faptului cÄ modelele de difuziune video nu vÄd âimaginea de ansambluâ â mai degrabÄ, creeazÄ un cadru nou pe baza cadrului anterior, Či, ÃŪn unele cazuri, iau ÃŪn considerare un cadru viitor apropiat; dar, pentru a compara procesul cu o partidÄ de Čah, nu pot âgÃĒndi zece mutÄri ÃŪnainteâ Či nu pot âaminti zece mutÄri ÃŪn urmÄâ.
Ãn al doilea rÃĒnd, un model de difuziune va continua sÄ lupte pentru a menČine o aparenČÄ consistentÄ ÃŪntre cadre, chiar dacÄ includeČi multiple LoRA pentru caractere, medii Či stil de iluminare, din motivele menČionate la ÃŪnceputul acestei secČiuni.
2: Nu poČi edita un cadru uČor
DacÄ descrieČi un personaj care merge pe stradÄ utilizÃĒnd metode de CGI tradiČionale Či doriČi sÄ schimbaČi un aspect al cadrului, puteČi ajusta modelul Či sÄ-l refaceČi.
DacÄ este o filmare ÃŪn viaČa realÄ, pur Či simplu resetaČi Či refaceČi-o, cu modificÄrile adecvate.
Cu toate acestea, dacÄ produceČi un cadru de videoclip gen-AI pe care ÃŪl iubiČi, dar doriČi sÄ schimbaČi un aspect al acestuia, puteČi face acest lucru doar prin metode de post-procesare laborioase, dezvoltate ÃŪn ultimii 30-40 de ani: CGI, rotoscopie, modelare Či mascaj â toate proceduri consumatoare de timp Či scumpe.
Modul ÃŪn care funcČioneazÄ modelele de difuziune, simpla modificare a unui aspect al unui prompt de text (chiar Či ÃŪntr-un prompt multimodal, ÃŪn care furnizaČi o imagine âseedâ completÄ) va schimba mai multe aspecte ale ieČirii generate, ducÃĒnd la un joc de âwhack-a-moleâ de prompt.
3: Nu poČi conta pe legile fizicii
Metodele tradiČionale de CGI oferÄ o varietate de modele fizice algoritmice care pot simula lucruri cum ar fi dinamica fluidelor, miČcarea gazelor, cinematica inversÄ (modelarea precisÄ a miČcÄrii umane), dinamica pÃĒnzei, explozii Či diverse alte fenomene din lumea realÄ.
Cu toate acestea, metodele bazate pe difuziune, aČa cum am vÄzut, au o memorie scurtÄ Či o gamÄ limitatÄ de motoare priore (exemple de astfel de acČiuni, incluse ÃŪn setul de antrenament) de a atrage.
Ãntr-o versiune anterioarÄ a paginii de aterizare a OpenAI pentru sistemul generativ aclamat Sora, compania a recunoscut cÄ Sora are limitÄri ÃŪn aceastÄ privinČÄ (deČi acest text a fost ulterior eliminat):
â[Sora] poate lupta pentru a simula fizica unei scene complexe Či nu poate ÃŪnČelege instanČe specifice de cauzÄ Či efect (de exemplu: un biscuit nu va arÄta o urmÄ dupÄ ce un personaj ÃŪl muČcÄ).
âModelul poate confunda, de asemenea, detalii spaČiale incluse ÃŪntr-un prompt, cum ar fi discernerea stÃĒng de dreapta, sau lupta cu descrieri precise ale evenimentelor care se desfÄČoarÄ ÃŪn timp, cum ar fi traiectorii specifice ale camerei.â
Utilizarea practicÄ a diverselor sisteme de generare video bazate pe API reveleazÄ limitÄri similare ÃŪn reprezentarea fizicii exacte. Cu toate acestea, anumite fenomene fizice comune, cum ar fi exploziile, par sÄ fie reprezentate mai bine ÃŪn seturile lor de antrenament.
Unele ÃŪncorporÄri de motoare priore, antrenate ÃŪn modelul generativ sau alimentate dintr-un videoclip sursÄ, dureazÄ ceva timp pentru a fi finalizate (cum ar fi o persoanÄ care executÄ o secvenČÄ de dans complexÄ Či non-repetitivÄ, ÃŪntr-un costum elaborat) Či, din nou, ferestra de atenČie âmiopicÄâ a modelului de difuziune este probabil sÄ transforme conČinutul (identitatea facialÄ, detalii de costum, etc.) pÃĒnÄ la sfÃĒrČitul miČcÄrii. Cu toate acestea, LoRA pot atenua acest lucru, pÃĒnÄ la un anumit punct.
Rezolvarea ÃŪn post-procesare
ExistÄ Či alte limitÄri ale generÄrii video pure âsingle userâ AI, cum ar fi dificultatea de a reprezenta miČcÄri rapide Či problema generalÄ Či mai presantÄ de obČinere a consistenČei temporale ÃŪn videoclipul de ieČire.
Ãn plus, crearea unor performanČe faciale specifice este practic o chestiune de noroc ÃŪn videoclipul generativ, la fel ca Či sincronizarea buzelor pentru dialog.
Ãn ambele cazuri, utilizarea unor sisteme auxiliare, cum ar fi LivePortrait Či AnimateDiff, devine foarte popularÄ ÃŪn comunitatea VFX, deoarece aceasta permite transpunerea unei expresii faciale Či a sincronizÄrii buzelor asupra ieČirii generate existente.
Un exemplu de transfer de expresie (ÃŪn partea stÃĒngÄ inferioarÄ) impus pe un videoclip ČintÄ cu LivePortrait. Videoclipul este de la Generative Z TunisiaGenerative. VedeČi versiunea completÄ, ÃŪn calitate mai bunÄ, la https://www.linkedin.com/posts/genz-tunisia_digitalcreation-liveportrait-aianimation-activity-7240776811737972736-uxiB/?
Mai mult, o multitudine de soluČii complexe, care includ instrumente cum ar fi interfaČa graficÄ de utilizator ComfyUI pentru difuziune stabilÄ ComfyUI Či aplicaČia profesionalÄ de compunere Či manipulare Nuke, precum Či manipularea spaČiului latent, permit practicienilor de efecte vizuale AI sÄ obČinÄ un control mai mare asupra expresiei faciale Či a dispoziČiei.
DeČi el descrie procesul de animaČie facialÄ ÃŪn ComfyUI ca âtorturÄâ, profesionistul VFX Francisco Contreras a dezvoltat o astfel de procedurÄ, care permite impunerea fonemelor buzelor Či a altor aspecte ale reprezentÄrii capului.
Difuziunea stabilÄ, ajutatÄ de o flux de lucru ComfyUI alimentat de Nuke, a permis profesionistului VFX Francisco Contreras sÄ obČinÄ un control neobiČnuit asupra aspectelor faciale. Pentru videoclipul complet, ÃŪn rezoluČie mai bunÄ, mergeČi la https://www.linkedin.com/feed/update/urn:li:activity:7243056650012495872/
Concluzie
Niciunul dintre acestea nu este promiČÄtor pentru perspectiva unui utilizator care genereazÄ filme complete, coerente Či fotorealistice, cu dialog realist, sincronizare a buzelor, performanČe, medii Či continuitate.
Ãn plus, obstacolele descrise aici, cel puČin ÃŪn ceea ce priveČte modelele de difuziune video bazate pe generare, nu sunt neapÄrat solubile âÃŪn orice momentâ, ÃŪn ciuda comentariilor din forum Či a atenČiei mass-media care susČin acest lucru. ConstrÃĒngerile descrise par a fi intrinseci arhitecturii.
Ãn cercetarea sintezei AI, la fel ca Či ÃŪn orice cercetare ČtiinČificÄ, idei strÄlucite ne uimesc periodic cu potenČialul lor, doar pentru ca cercetÄrile ulterioare sÄ descopere limitÄrile lor fundamentale.
Ãn spaČiul de generare/sintezÄ, acest lucru s-a ÃŪntÃĒmplat deja cu ReČelele Adversative Generative (GAN) Či CÃĒmpurile de RadianČÄ Neuronale (NeRF), ambele dovedindu-se extrem de dificil de instrumentalizat ÃŪn sisteme comerciale performante, ÃŪn ciuda anilor de cercetare academicÄ ÃŪn acest scop. Aceste tehnologii apar cel mai frecvent ca componente auxiliare ÃŪn arhitecturi alternative.
Multe studiouri de film sperÄ cÄ antrenarea pe cataloage de filme licenČiate ÃŪn mod legitim ar putea elimina artiČtii de efecte vizuale, dar inteligenČa artificialÄ adÄugÄ roluri ÃŪn forČa de muncÄ ÃŪn acest moment.
Indiferent dacÄ sistemele video bazate pe difuziune pot fi transformatÄ cu adevÄrat ÃŪn generatoare de filme narativ-consistente Či fotorealistice, sau dacÄ ÃŪntreaga afacere este doar o urmÄrire alchimicÄ, ar trebui sÄ devinÄ evident ÃŪn urmÄtoarele 12 luni.
Este posibil ca noi sÄ avem nevoie de o abordare complet nouÄ; sau este posibil ca SpatÄri GaussianÄ (GSplat), care a fost dezvoltatÄ ÃŪn ÃŪnceputul anilor â90 Či a luat recent avÃĒnt ÃŪn spaČiul de sintezÄ a imaginilor, sÄ reprezinte o alternativÄ potenČialÄ la generarea video bazatÄ pe difuziune.
Deoarece GSplat a durat 34 de ani pentru a ajunge ÃŪn prim-plan, este posibil, de asemenea, ca vechile concurente, cum ar fi NeRF Či GAN, Či chiar modelele de difuziune latentÄ â sÄ nu-Či fi avut ÃŪncÄ ziua.
Â
* DeČi funcČionalitatea AI Storyboard a lui Kaiber oferÄ acest tip de funcČionalitate, rezultatele pe care le-am vÄzut nu sunt de calitate de producČie.
Martin Anderson este fostul Čef al conČinutului de cercetare ČtiinČificÄ de la metaphysic.ai
Publicat pentru prima datÄ luni, 23 septembrie 2024












