Andersonin kulma
Jatkuvasti AI-videomateriaalin editointi teksti-ohjatuilla syötteillä

Vaikka ammattimainen VFX-yhteisö on kiinnostunut – ja toisinaan tuntuu hieman uhatuksi – uusista innovaatioista kuvan ja videon synteesissä, useimpien AI-pohjaisen videon editoinnin puutteellinen aikajatkuvuus rajoittaa monia näistä pyrkimyksistä “psykedeeleiseen” sfääriin, jossa on hohtavia ja nopeasti muuttuvia tekstureja ja rakenteita, epäjohdonmukaisia efektejä ja sellaista karkeaa teknologiaa, joka muistuttaa valokuvauksen aikakautta visuaalisissa efekteissä.
Jos haluat muuttaa jotain erittäin tarkkaa videossa, joka ei kuulu syvien väärennösten (ts. asettamalla uusi identiteetti olemassa olevaan henkilön kuvamateriaaliin) alueeseen, useimmat nykyiset ratkaisut toimivat hyvin rajoitetuin ehdoin tuotannonlaadukkaiden visuaalisten efektien osalta.
Yksi poikkeus on Weizmannin tiede-instituutin akateemikkojen löyhän yhdistymisen jatkuva työ. Vuonna 2021 kolme tutkijaa, yhdessä Adoben kanssa, julkisti uuden menetelmän videon hajottamiseksi ja sisäisen kartan – kerroksellisen neuronaalisen kartan – yhdistämiseksi koostettuun tuotokseen, joka sisältää alfakanavat ja aikajatkuvan tuloksen.

Vuoden 2021 tutkimuksesta: tiellä olevan pyörän arvioitu kulkureitti on muokattu neurverkkorakenteella tavalla, joka perinteisesti vaatisi laajaa rotoskooppausta ja match-muokkausta. Koska tausta- ja etualueen osat käsitellään eri verkoilla, maskit ovat todella “automaattisia”. Lähde: https://layered-neural-atlases.github.io/
Vaikka se kuuluu optisen virran alueeseen VFX-piippureissa, kerroksellinen atlas ei ole suoraan verrattavissa perinteisiin CGI-työvirtoihin, koska se muodostaa “aikajatkuvan tekstuurikartan”, jota voidaan tuottaa ja muokata perinteisillä ohjelmistomenetelmillä. Edellä olevan kuvan toisessa kuvassa tien pinnan tausta on edustettu (kuvaannollisesti) koko videon ajan. Tämän peruskuvan muuttaminen (kolmas kuva vasemmalta kuvassa) tuottaa johdonmukaisen muutoksen taustassa.
Kuvat “avattusta” atlaksesta edustavat vain yksittäisiä tulkittuja kehyskohtia; johdonmukaiset muutokset kohdennetussa videokehyksessä kartoitetaan takaisin alkuperäiseen kehykseen, säilyttäen tarvittavat peittävät ja muut vaaditut kohtauksen vaikutukset, kuten varjot tai heijastukset.
Ydinarkkitehtuuri käyttää monikerroksista perkeliiniä (MLP) edustamaan avattuja atlaksia, alfakanavia ja kartoituksia, jotka kaikki optimoidaan yhdessä ja täysin 2D-avaruudessa, jolloin NeRF-tyyppisen edellytyksen 3D-geometrian pisteistä, syvyyden kartoista ja vastaavista CGI-tyyppisistä oletuksista voidaan välttää.
Yksittäisten objektien viiteatlas voidaan myös luotettavasti muuttaa:

Johdonmukainen muutos liikkuvaan objektiin vuoden 2021 kehyksessä. Lähde: https://www.youtube.com/watch?v=aQhakPFC4oQ
Perimmältään vuoden 2021 järjestelmä yhdistää geometrian suunnan, match-muokkauksen, kartoituksen, uudelleen teksturoidun ja rotoskooppauksen erilliseen neurverkkoprosessiin.
Text2Live
Vuoden 2021 alkuperäiset tutkijat, yhdessä NVIDIA -tutkimuksen kanssa, ovat mukana uudessa innovaatiossa, joka yhdistää kerroksellisten atlaksien voiman teksti-ohjatun CLIP-tekniikan kanssa, joka on palannut julkisuuteen tällä viikolla OpenAI:n julkaisemisen myötä DALL-E 2 -kehykselle.
Uusi arkkitehtuuri, joka on nimeltään Text2Live, sallii loppukäyttäjän luoda paikallisia muokkauksia todelliseen videomateriaaliin tekstipohjaisilla ohjauksilla:


Kaksi esimerkkiä etualueen editoinnista. Paremmassa resoluutiossa ja määrityksessä käy sivulla https://text2live.github.io/sm/pages/video_results_atlases.html
Text2Live tarjoaa semanttisen ja hyvin paikallisen editoinnin ilman esikoulutetun generoijan käyttämistä, käyttämällä sisäistä tietokantaa, joka on spesifinen videoleikkaukselle, jota vaikuttava.

Tausta- ja etualueen (objektin) muunnokset Text2Liven alla. Lähde: https://text2live.github.io/sm/pages/video_results_atlases.html
Tekniikka ei vaadi käyttäjän tarjoamaa maskia, kuten tyypillinen rotoskooppa- tai vihreätaustatyökalu, vaan arvioi merkityksellisyyden kartat käynnistämällä tekniikkaa vuoden 2021 tutkimuksesta Tel Avivin yliopiston tietojenkäsittelytieteen koulusta ja Facebook AI Research (FAIR):sta.

Muodostetut kartat transformer-pohjaisen yleisen huomion mallin kautta.
Uusi tutkimus on nimeltään Text2LIVE: Teksti-ohjattu kerroksellinen kuva- ja videon editointi. Alkuperäinen vuoden 2021 tiimi on liittynyt Weizmannin Omer Bar-Taliin ja Yoni Kasteniin NVIDIA Researchista.
Arkkitehtuuri
Text2Live koostuu generoijasta, joka on koulutettu yksittäiselle syötekuvalle ja kohde-tekstiohjauksille. Esikoulutettu CLIP-malli, joka on koulutettu 400 miljoonalla teksti- ja kuva-parilla, tarjoaa liittyvän visuaalisen materiaalin, josta käyttäjän syöte-muunnokset voidaan tulkita.

Generoija hyväksyy syötekuva-kehyksen (kehyksen) ja tuottaa kohde-RGBA-kerroksen, joka sisältää värin ja peittävyyden tiedon. Tämä kerros yhdistetään alkuperäiseen kuvamateriaaliin lisämuokkauksilla.

Generoidun RGBA-kerroksen alfakanava tarjoaa sisäisen yhdistämisen toiminnon ilman perinteisten putkien, kuten After Effects, käyttämistä.
Koulutus sisäisillä kuvilla, jotka ovat merkityksellisiä kohde-videolle tai -kuvalle, Text2Live välttää vaatimukset joko kääntää syötekuva Generative Adversarial Networkin (GAN) latenttiavaruuteen, joka on tällä hetkellä kaukana riittävän tarkin tuotannonlaadukkaiden videon editoinnin vaatimusten osalta, tai käyttää difuusiomallia, joka on tarkin ja mukautuvampi, mutta ei voi ylläpitää uskollisuutta kohde-videolle.

Sekalaiset teksti-ohjatut muokkausedit Text2Liven alla.
Aikaisemmat lähestymistavat ovat käyttäneet eteenpäin-vienti-menetelmiä tai optisen virran perusteisia lähestymistapoja. Koska nämä tekniikat ovat jossain määrin kehyspohjaisia, kumpikaan ei voi luoda johdonmukaisen aikajatkuvuuden muutoksia tulostevideossa. Neuronaalinen kerroksellinen atlas tarjoaa yksittäisen avaruuden, jossa muutokset voidaan kohdistaa, ja ne voidaan pitää uskollisina tehtyyn muutokseen videon edetessä.

Ei “siristystä” tai satunnaisia hallusinaatioita: Text2Live saa tulkinnan teksti-ohjauksesta “rusted jeep”, ja soveltaa sitä kerran neuronaaliseen kerrokselliseen atlas-objektiin videossa, sen sijaan, että aloittaisi muunnoksen uudelleen jokaiselle tulkittavalle kehykselle.
Text2Live on lähempänä läpimurtoa AI-pohjaisessa kompositiossa, eikä niinkään teksti-kuva-avaruudessa, joka on herättänyt paljon huomiota tällä viikolla OpenAI:n toisen sukupolven DALL-E-kehyksen julkaisemisen myötä (joka voi sisältää kohde-kuvia osana muunnosprosessia, mutta on edelleen rajoitettu suoraan väliintullessa kuvassa, lisäksi sensurointi lähdeaineistosta ja suodattimien asettaminen, jotka on suunniteltu estämään käyttäjien väärinkäyttöä).
Sen sijaan Text2Live sallii loppukäyttäjän extrahoida atlas-objektin ja muokata sitä yhdessä kertaa korkean hallinnan pikselipohjaisissa ympäristöissä, kuten Photoshop (ja ehkä vielä abstraktimmissa kuvansynteesirunkoissa, kuten NeRF), ennen kuin se syötetään takaisin oikein suunnattuun ympäristöön, joka ei kuitenkaan riipu 3D-estimaatiosta tai taaksepäin suunnatun CGI-pohjaisen lähestymistavan käytöstä.
Lisäksi Text2Live on, tutkijoiden mukaan, ensimmäinen vertailukelpoinen kehys, joka saavuttaa maskauksen ja kompositoinnin täysin automaattisella tavalla.
Julkaistu ensimmäisen kerran 7. huhtikuuta 2022.













