Andersons vinkel

ST-NeRF: Komposition og redigering til video-syntese

mm
Føj Unite.AI til dine foretrukne kilder på Google
ST-NeRF

Et kinesisk forskningskonsortium har udviklet teknikker til at bringe redigerings- og kompositions muligheder til en af de hotteste billedsyntese-forskningssektorer i sidste år – Neural Radiance Fields (NeRF). Systemet er kaldt ST-NeRF (Spatio-Temporal Coherent Neural Radiance Field).

Det, der ser ud som en fysisk kamerapan i billedet nedenfor, er faktisk bare en bruger, der ‘scroller’ gennem synspunkter på videoindhold, der eksisterer i en 4D-rum. POV er ikke låst til præstationen af de mennesker, der er afbildet i videoen, hvis bevægelser kan ses fra enhver del af en 180-graders radius.

ST-NeRF

Hver facet inden for videoen er et diskret fanget element, komponeret sammen til en samlet scene, der kan dynamisk udforskes.

Facetterne kan frit duplikeres inden for scenen eller ændres i størrelse:

ST-NeRF

Dertil kan den temporale adfærd af hver facet let ændres, langsommes, køres baglæns eller manipuleres på mange måder, hvilket åbner vejen for filterarkitekturer og en ekstremt høj grad af fortolkning.

To separate NeRF-facetter køres i forskellige hastigheder i samme scene. Kilde: https://www.youtube.com/watch?v=Wp4HfOwFGP4

To separate NeRF-facetter køres i forskellige hastigheder i samme scene. Kilde: https://www.youtube.com/watch?v=Wp4HfOwFGP4

Der er ingen behov for at rotoscope udøvere eller miljøer eller have udøvere udføre deres bevægelser blindt og uden for sammenhængen med den ønskede scene. I stedet indfanges optagelserne naturligt via en række af 16 video-kameraer, der dækker 180 grader:

16 kameraer ST-NeRF

De tre elementer, der er afbildet ovenfor, de to mennesker og miljøet, er separate og kun kontureret for illustrative formål. Hver kan udskiftes, og hver kan indsættes i scenen på et tidligere eller senere tidspunkt i deres individuelle optagelses-tidsplan.

De tre elementer, der er afbildet ovenfor, de to mennesker og miljøet, er separate og kun kontureret for illustrative formål. Hver kan udskiftes, og hver kan indsættes i scenen på et tidligere eller senere tidspunkt i deres individuelle optagelses-tidsplan.

ST-NeRF er en innovation på forskning i Neural Radiance Fields (NeRF), en maskinlæringsramme, hvor multiple synspunkts-optagelser syntetiseres til en navigerbar virtuel rum ved omfattende træning (selvom enkelt synspunkts-optagelse også er en undersektor af NeRF-forskning).

Neural Radiance Fields fungerer ved at samle multiple synspunkts-optagelser til en enkelt kohærent og navigerbar 3D-rum, med hullerne mellem dækningen estimeret og rendereret af et neuralt netværk. Hvor video (i stedet for stadig billeder) bruges, er renderingressourcerne ofte betydelige. Kilde: https://www.matthewtancik.com/nerf

Neural Radiance Fields fungerer ved at samle multiple synspunkts-optagelser til en enkelt kohærent og navigerbar 3D-rum, med hullerne mellem dækningen estimeret og rendereret af et neuralt netværk. Hvor video (i stedet for stadig billeder) bruges, er renderingressourcerne ofte betydelige. Kilde: https://www.matthewtancik.com/nerf

Interessen for NeRF er blevet intens i de sidste ni måneder, og en Reddit-vært liste over afledte eller eksploratoriske NeRF-papirer viser i øjeblikket 60 projekter.

 

Kun nogle af de mange udgaver af det originale NeRF-papir. Kilde: https://crossminds.ai/graphlist/nerf-neural-radiance-fields-ai-research-graph-60708936c8663c4cfa875fc2/

Kun nogle af de mange udgaver af det originale NeRF-papir. Kilde: https://crossminds.ai/graphlist/nerf-neural-radiance-fields-ai-research-graph-60708936c8663c4cfa875fc2/

Billig træning

Artiklen er et samarbejde mellem forskere ved Shanghai Tech University og DGene Digital Technology, og er blevet accepteret med nogen entusiasme på Open Review.

ST-NeRF tilbyder en række innovationer over tidligere initiativer i ML-afledte navigerbare video-rum. Ikke mindst opnår det en høj grad af realisme med kun 16 kameraer. Selvom Facebooks DyNeRF bruger kun to kameraer mere end dette, tilbyder det en langt mere begrænset navigerbar bue.

Et eksempel på Facebooks DyNeRF-miljø, med en mere begrænset bevægelsesfelt og flere kameraer per kvadratfod nødvendigt for at genskabe scenen. Kilde: https://neural-3d-video.github.io

Et eksempel på Facebooks DyNeRF-miljø, med en mere begrænset bevægelsesfelt og flere kameraer per kvadratfod nødvendigt for at genskabe scenen. Kilde: https://neural-3d-video.github.io

Foruden manglen på evnen til at redigere og komponere individuelle facetter, er DyNeRF særligt dyrt i forhold til beregningsressourcer. I modsætning hertil angiver de kinesiske forskere, at træningsomkostningerne for deres data kommer ud til at ligge mellem $900-$3.000, sammenlignet med $30.000 for den nyeste video-genereringsmodel DVDGAN og intensive systemer som DyNeRF.

Anmeldere har også bemærket, at ST-NeRF gør en stor innovation i at afkoble processen med at lære bevægelse fra processen med billedsyntese. Denne adskillelse er det, der muliggør redigering og komposition, med tidligere tilgange restriktive og lineære i sammenligning.

Selvom 16 kameraer er et meget begrænset array til en så fuld halvcirkel af udsigt, håber forskerne at reducere dette antal yderligere i senere arbejde gennem brugen af proxy-præ-scannede statiske baggrunde og mere data-drevne scene-modelleringstilgange. De håber også at inkorporere genbelysningsmuligheder, en seneste innovation i NeRF-forskning.

Behandling af ST-NeRF’s begrænsninger

I sammenhængen med akademiske CS-papirer, der tenderer til at smide den faktiske brugbarhed af et nyt system i en sidste paragraf, er selv de begrænsninger, som forskerne erkender for ST-NeRF, usædvanlige.

De observerer, at systemet ikke kan individuere og separat rendre udvalgte objekter i en scene, fordi menneskerne i optagelserne er segmenteret i separate enheder via et system designet til at genkende mennesker og ikke objekter – et problem, der synes let at løse med YOLO og lignende rammer, med den hårde arbejde med at udtrække menneskevideo allerede udført.

Selvom forskerne bemærker, at det i øjeblikket ikke er muligt at generere slow-motion, synes der at være lidt, der forhindrer implementeringen af dette ved hjælp af eksisterende innovationer i frame-interpolation såsom DAIN og RIFE.

Som med alle NeRF-implementeringer og i mange andre sektorer af computer-vision-forskning kan ST-NeRF fejle i tilfælde af alvorlig okklusion, hvor subjektet er midlertidigt skjult af en anden person eller et objekt, og kan være svært at kontinuerligt spore eller nøjagtigt genopkoble efterfølgende. Som andre steder kan denne svigt muligvis vente på løsninger ovenfra. I mellemtiden indrømmer forskerne, at manuel indgriben er nødvendig i disse okkluderede rammer.

Til sidst observerer forskerne, at de menneskelige segmenteringsprocedurer i øjeblikket afhænger af farveforskelle, hvilket kunne føre til utilsigtet samling af to mennesker i én segmentblok – en forhindring, der ikke er begrænset til ST-NeRF, men er intrinsic for den bibliotek, der bruges, og som muligvis kan løses ved hjælp af optisk flow-analyse og andre opkomende teknikker.

Først udgivet 7. maj 2021.

Forfatter til maskinlæringsartikler, domæneekspert i menneskeskabt billedsynthese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: [email protected]