Unghiul lui Anderson
ST-NeRF: Compozitie și editare pentru sinteză video

O echipă de cercetare chineză a dezvoltat tehnici pentru a aduce capacități de editare și compozitie într-unul dintre cele mai fierbinți sectoare de cercetare a sintezei de imagini din ultimul an – Neural Radiance Fields (NeRF). Sistemul se numește ST-NeRF (Spatio-Temporal Coerent Neural Radiance Field).
Ceea ce pare a fi o mișcare fizică a camerei în imaginea de mai jos este, de fapt, doar un utilizator care “derulează” prin puncte de vedere pe conținut video care există într-un spațiu 4D. Punctul de vedere nu este blocat la performanța persoanelor din videoclip, ale căror mișcări pot fi văzute din orice parte a unui radius de 180 de grade.

Fiecare fațetă din videoclip este un element capturat discret, compus într-o scenă coerentă care poate fi explorată dinamic.
Fațetele pot fi duplicate liber în scenă sau redimensionate:

În plus, comportamentul temporal al fiecărei fațete poate fi modificat ușor, încetinit, rulat înapoi sau manipulat în orice mod, deschizând calea către arhitecturi de filtre și un nivel extrem de ridicat de interpretare.

Două fațete NeRF separate rulează la viteze diferite în aceeași scenă. Sursă: https://www.youtube.com/watch?v=Wp4HfOwFGP4

Nu este nevoie să rotoscopei performerii sau mediul înconjurător, sau să aveți performerii care să execute mișcările lor orb și în afara contextului scenei intenționate. În schimb, filmarea este capturată natural prin intermediul a 16 camere video care acoperă 180 de grade:


Cele trei elemente de mai sus, cele două persoane și mediul înconjurător, sunt distincte și conturate doar pentru scopuri ilustrative. Fiecare poate fi înlocuit și poate fi introdus în scenă la un moment anterior sau ulterior în cronologia de captură individuală.
ST-NeRF este o inovație în cercetarea Neural Radiance Fields (NeRF), un cadru de învățare automată prin care capturile multiple de puncte de vedere sunt sintetizate într-un spațiu virtual navigabil prin antrenament extins (deși captura dintr-un singur punct de vedere este, de asemenea, un subsector al cercetării NeRF).

Câmpurile de radianță neurală funcționează prin colectarea capturilor multiple de puncte de vedere într-un spațiu 3D coerent și navigabil, cu lacunele dintre acoperire estimate și renderizate de o rețea neurală. În cazul în care se utilizează videoclipuri (în loc de imagini statice), resursele de rendering necesare sunt adesea considerabile. Sursă: https://www.matthewtancik.com/nerf
Interesul pentru NeRF a devenit intens în ultimele nouă luni, iar o listă întreținută de Reddit a lucrărilor derivate sau exploratorii NeRF listează în prezent 60 de proiecte.

Doar câteva dintre numeroasele ramificații ale lucrării originale NeRF. Sursă: https://crossminds.ai/graphlist/nerf-neural-radiance-fields-ai-research-graph-60708936c8663c4cfa875fc2/
Antrenament accesibil
Articolul este o colaborare între cercetători de la Universitatea Shanghai Tech și DGene Digital Technology și a fost acceptat cu entuziasm la Open Review.
ST-NeRF oferă o serie de inovații față de inițiativele anterioare în spațiile video navigabile derivate din ML. Nu în ultimul rând, el realizează un nivel ridicat de realism cu doar 16 camere. Deși DyNeRF de la Facebook utilizează doar două camere mai mult decât acesta, el oferă un arc de navigare mult mai restrictiv.

Un exemplu al mediului DyNeRF de la Facebook, cu un arc de mișcare mai limitat și mai multe camere pe metru pătrat necesare pentru a reconstrui scena. Sursă: https://neural-3d-video.github.io
Pe lângă lipsa capacității de editare și compozitare a facetelor individuale, DyNeRF este deosebit de scump în ceea ce privește resursele computaționale. În schimb, cercetătorii chinezi afirmă că costul de antrenament pentru datele lor se situează undeva între 900-3.000 de dolari, comparativ cu 30.000 de dolari pentru modelul de generare de videoclipuri de ultimă generație DVDGAN și sisteme intensive precum DyNeRF.
Recenzenții au remarcat, de asemenea, că ST-NeRF realizează o inovație majoră prin decuplarea procesului de învățare a mișcării de la procesul de sinteză a imaginii. Această separare este ceea ce permite editarea și compozitarea, cu abordări anterioare restrictive și liniare în comparație.
Deși 16 camere este un număr foarte limitat de camere pentru un astfel de cerc de vedere de jumătate, cercetătorii speră să reducă acest număr în lucrările ulterioare prin utilizarea fundalurilor statice pre-scanned și a unor abordări de modelare a scenei mai bazate pe date. Ei speră, de asemenea, să incorporeze capacități de re-iluminare, o inovație recentă în cercetarea NeRF.
Abordarea limitărilor ST-NeRF
În contextul articolelor științifice care tind să arunce usability-ul real al unui sistem nou într-un paragraf final de abandon, chiar și limitările pe care cercetătorii le recunosc pentru ST-NeRF sunt neobișnuite.
Ei observă că sistemul nu poate individua și renderiza separat obiecte individuale dintr-o scenă, deoarece oamenii din filmare sunt segmentați în entități individuale prin intermediul unui sistem proiectat pentru a recunoaște oamenii și nu obiectele – o problemă care pare ușor de rezolvat cu YOLO și cadre similare, cu munca mai grea de extragere a videoclipurilor umane deja realizată.
Deși cercetătorii notează că în prezent nu este posibilă generarea de mișcare încetinită, nu pare a fi nimic care să împiedice implementarea acesteia prin utilizarea inovațiilor existente în interpolarea cadrelor, cum ar fi DAIN și RIFE.
Ca și în cazul tuturor implementărilor NeRF și în multe alte sectoare de cercetare a viziunii computaționale, ST-NeRF poate eșua în cazuri de occluzie severă, în care subiectul este temporar ascuns de o altă persoană sau de un obiect și poate fi dificil de urmărit continuu sau de reacquisit ulterior. Așa cum se întâmplă și în alte cazuri, această dificultate poate trebui să aștepte soluții upstream. Între timp, cercetătorii recunosc că intervenția manuală este necesară în cadrul acestor cadre ocluzionate.
În final, cercetătorii observă că procedurile de segmentare a oamenilor se bazează în prezent pe diferențele de culoare, ceea ce ar putea duce la o coliziune neintenționată a două persoane într-un singur bloc de segmentare – o piedică care nu este limitată la ST-NeRF, dar este intrinsecă bibliotecii utilizate și care ar putea fi rezolvată, poate, prin analiza fluxului optic și alte tehnici emergente.
A fost publicat pentru prima dată pe 7 mai 2021.












