Andersonin kulma

ST-NeRF: Koostaminen ja editointi videon synteesiin

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
ST-NeRF

Kiinalainen tutkimuskonsortio on kehittänyt tekniikoita, joilla voidaan tuoda editointi- ja koostamisominaisuudet yhteen viime vuoden kuumimpiin kuuluvaan kuvansynteesitutkimuksen alaan – Neuraalisiin säteilykenttiin (NeRF). Järjestelmä on nimeltään ST-NeRF (Spatio-Temporaalinen Koherentti Neuraalinen Säteilykenttä).

Mikä näyttää fyysiseltä kameran panoraamalta kuvassa alla, on itse asiassa vain käyttäjän “selailu” eri näkökulmista videomateriaalissa, joka on olemassa 4D-avaruudessa. Kuvan näkökulma ei ole lukittu henkilöiden esitysten suorittamiseen, joiden liikkeet voidaan tarkastella miltä tahansa osalta 180 asteen säteeltä.

ST-NeRF

Jokainen kuvan osa on erillisesti kuvattu elementti, joka on koostettu yhtenäiseksi kohtaukseksi, jota voidaan dynaamisesti tutkia.

Näitä osia voidaan vapaasti monistaa kohtauksessa tai muuttaa kokoa:

ST-NeRF

Lisäksi jokaisen osan aikasuhteita voidaan helposti muuttaa, hidastaa, suorittaa taaksepäin tai muokata monin eri tavooin, mikä avaa polun suodatinarkkitehtuureille ja erittäin korkealle tulkittavuudelle.

Kaksi erillistä NeRF-osaa suoritetaan eri nopeuksilla samassa kohtauksessa. Lähde: https://www.youtube.com/watch?v=Wp4HfOwFGP4

Kaksi erillistä NeRF-osaa suoritetaan eri nopeuksilla samassa kohtauksessa. Lähde: https://www.youtube.com/watch?v=Wp4HfOwFGP4

Ei ole tarpeen rotoskooppia esiintyjille tai ympäristöille tai antaa esiintyjien suorittaa liikkeensä sokeasti ja kontekstista riippumatta. Sen sijaan kuvamateriaali on kuvattu luonnollisesti 16 videokameran avulla, jotka peittävät 180 astetta:

16 kameran ST-NeRF

Kolme yllä olevaa elementtiä, kaksi henkilöä ja ympäristö, ovat erillisiä ja rajattu vain havainnollistamistarkoituksessa. Jokainen voidaan vaihtaa ja jokainen voidaan lisätä kohtaukseen aiemmin tai myöhemmin heidän yksilöllisessä kuvauksensa aikajanan mukaisesti.

Kolme yllä olevaa elementtiä, kaksi henkilöä ja ympäristö, ovat erillisiä ja rajattu vain havainnollistamistarkoituksessa. Jokainen voidaan vaihtaa ja jokainen voidaan lisätä kohtaukseen aiemmin tai myöhemmin heidän yksilöllisessä kuvauksensa aikajanan mukaisesti.

ST-NeRF on innovaatio tutkimuksessa Neuraalisissa säteilykentissä (NeRF), joka on koneoppimisen viitekehyksessä, jossa useiden näkökulmien kuvat syntetisoidaan navigoituvaan virtuaalitilaan laajalla koulutuksella (vaikka yhden näkökulman kuvaus on myös NeRF-tutkimuksen alaryhmä).

Neuraaliset säteilykentät toimivat keräämällä useita näkökulmia yhtenäiseksi ja navigoituvaan 3D-avaruuteen, jossa aukot katetuksen välissä arvioidaan ja renderöidään neuroverkkotekniikalla. Kun video (eikä vain kuvia) käytetään, tarvittavat renderöintiresurssit ovat usein huomattavat. Lähde: https://www.matthewtancik.com/nerf

Neuraaliset säteilykentät toimivat keräämällä useita näkökulmia yhtenäiseksi ja navigoituvaan 3D-avaruuteen, jossa aukot katetuksen välissä arvioidaan ja renderöidään neuroverkkotekniikalla. Kun video (eikä vain kuvia) käytetään, tarvittavat renderöintiresurssit ovat usein huomattavat. Lähde: https://www.matthewtancik.com/nerf

NeRF:iin on tullut voimakas kiinnostus viimeisen yhdeksän kuukauden aikana, ja Redditin ylläpitämä lista johdannaisista tai tutkimusaiheista NeRF-tutkimuksista listaa tällä hetkellä 60 projektia.

 

Vain muutamia monista alkuperäisen NeRF-tutkimuksen haaroista. Lähde: https://crossminds.ai/graphlist/nerf-neural-radiance-fields-ai-research-graph-60708936c8663c4cfa875fc2/

Vain muutamia monista alkuperäisen NeRF-tutkimuksen haaroista. Lähde: https://crossminds.ai/graphlist/nerf-neural-radiance-fields-ai-research-graph-60708936c8663c4cfa875fc2/

Edullinen koulutus

Tutkimus on yhteistyö Shanghai Tech Universityn ja DGene Digital Technologyn välillä, ja se on hyväksytty jonkin verran Open Reviewssa.

ST-NeRF tarjoaa useita innovaatioita aiempiin aloitteisiin ML-pohjaisissa navigoituissa videoiden avaruuksissa. Ei vähäisimpänä se saavuttaa korkean realismin tason vain 16 kameralla. Vaikka Facebookin DyNeRF käyttää vain kaksi kameran enemmän, se tarjoaa paljon rajoitetumman navigoituva kaaren.

Esimerkki Facebookin DyNeRF-ympäristöstä, jossa on rajoitetumpi liikkumisalue ja enemmän kameran tarve jokaiselle neliöjalkalle kohtauksen rekonstruktioon. Lähde: https://neural-3d-video.github.io

Esimerkki Facebookin DyNeRF-ympäristöstä, jossa on rajoitetumpi liikkumisalue ja enemmän kameran tarve jokaiselle neliöjalkalle kohtauksen rekonstruktioon. Lähde: https://neural-3d-video.github.io

Poiketen siitä, ettei DyNeRF:llä ole mahdollisuutta editoida ja koostaa yksittäisiä osia, se on erittäin kallista laskennallisten resurssien suhteen. Sen sijaan kiinalaiset tutkijat ilmoittavat, että heidän aineistonsa koulutuskustannukset ovat jossain välillä 900-3 000 dollaria, verrattuna valtavirtaisten videoiden generointimallien, kuten DVDGAN, kustannuksiin, jotka ovat 30 000 dollaria, ja intensiivisiin järjestelmiin, kuten DyNeRF.

Arvostelijat ovat myös huomanneet, että ST-NeRF tekee suuren innovaation erottamalla liikkeen oppimisprosessin kuvansynteesiprosessista. Tämä erottelu mahdollistaa editoinnin ja koostamisen, kun taas aiemmat lähestymistavat ovat rajoittavia ja lineaarisia vertailussa.

Vaikka 16 kameran määrä on hyvin rajoitettu tällaisen täydellisen puolipallon näkökulman osalta, tutkijat toivovat pystyvänsä leikkaamaan tämän määrän edelleen myöhemmissä tutkimuksissa käyttämällä apuna ennalta skannattuja staattisia taustoja ja enemmän dataohjaista kohtauksen mallinnusta. He toivovat myös pystyvänsä sisällyttämään uudelleenvalaistusominaisuudet, jotka ovat viimeaikainen innovaatio NeRF-tutkimuksessa.

ST-NeRF:n rajoitusten käsittely

Akateemisissa tietojenkäsittelytutkimuksissa, joissa uuden järjestelmän käytännön käytettävyys usein heittää roskiin, ST-NeRF:n rajoitukset, joita tutkijat tunnustavat, ovat epätavallisia.

He huomaavat, että järjestelmä ei voi tällä hetkellä erottaa ja renderöidä erillisiä objekteja kohtauksessa, koska ihmiset kuvamateriaalissa jaetaan yksilöllisiksi entiteeteiksi järjestelmällä, joka on suunniteltu tunnistamaan ihmiset eikä objekteja – ongelma, joka näyttää helposti ratkaistavissa YOLO- ja vastaavilla kehyksillä, joissa ihmisten videon poisto on jo tehty.

Vaikka tutkijat mainitsevat, että hitaampaa liikettä ei voida tällä hetkellä generoida, näyttää siltä, ettei ole mitään esteitä estämässä tämän toteuttamista olemassa olevien kehitysten avulla, kuten DAIN ja RIFE.

Kuten kaikissa NeRF-toteutuksissa ja monissa muissa tietojenkäsittelytutkimuksen aloissa, ST-NeRF voi epäonnistua tapauksissa, joissa on vakavaa peittävyyttä, jossa aihe on tilapäisesti peitetty toisen henkilön tai esineen toimesta, ja se voi olla vaikea jatkuva seuranta tai tarkka uudelleen hankkiminen myöhemmin. Kuten muuallakin, tämä vaikeus saattaa joutua odottamaan ylempänä olevia ratkaisuja. Sillä aikaa tutkijat myöntävät, että manuaalinen väliintulo on välttämätöntä peittävissä kehyksissä.

Lopulta tutkijat huomaavat, että ihmisten segmentointimenetelmät perustuvat tällä hetkellä värieroihin, mikä voi johtaa tahattomaan yhdistämiseen kahteen henkilöön yhteen segmenttiin – este, joka ei ole rajoitettu ST-NeRF:iin, vaan on intrinsic libraryyn, jota käytetään, ja joka voidaan ratkaista optisen virtauksen analyysin ja muiden kehittyvien tekniikoiden avulla.

Julkaistu ensimmäisen kerran 7. toukokuuta 2021.

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai