Andersons vinkel

ST-NeRF: Composisjon og redigering for video-syntese

mm
Legg til Unite.AI blant dine foretrukne kilder pÃĨ Google
ST-NeRF

Et kinesisk forskningskonsortium har utviklet teknikk for ÃĨ bringe redigerings- og komposisjonsfunksjoner til ett av de heteste bildesyntese-forskningsomrÃĨdene i lÃļpet av det siste ÃĨret – Neural Radiance Fields (NeRF). Systemet kalles ST-NeRF (Spatio-Temporal Coherent Neural Radiance Field).

Det som ser ut som en fysisk kamera-panorama i bildet under er faktisk bare en bruker som ‘blar’ gjennom forskjellige perspektiver pÃĨ videoinnhold som eksisterer i et 4D-rom. POV er ikke lÃĨst til ytelsen til personene avbildet i videoen, hvis bevegelser kan sees fra hvilket som helst punkt i en 180-graders radius.

ST-NeRF

Hver fasett innenfor videoen er et diskret fanget element, komponert sammen til en sammenhengende scene som kan dynamisk utforskes.

Fasettene kan fritt dupliseres innenfor scenen, eller endres i stÃļrrelse:

ST-NeRF

I tillegg kan den temporale atferden til hver fasett lett endres, sakt ned, kjÃļrt baklengs eller manipulert pÃĨ en rekke mÃĨter, ÃĨpner veien for filter-arkitekturer og en ekstremt hÃļy grad av tolkbarhet.

To separate NeRF-fasetter kjÃļrer i forskjellige hastigheter i samme scene. Kilde: https://www.youtube.com/watch?v=Wp4HfOwFGP4

To separate NeRF-fasetter kjÃļrer i forskjellige hastigheter i samme scene. Kilde: https://www.youtube.com/watch?v=Wp4HfOwFGP4

Det er ingen behov for ÃĨ rotoscope utÃļvere eller miljÃļer, eller ÃĨ fÃĨ utÃļvere til ÃĨ utfÃļre bevegelser blindt og utenfor sammenhengen med den Ãļnskede scenen. I stedet blir opptakene tatt naturlig via en rekke pÃĨ 16 videokameraer som dekker 180 grader:

16 kameraer ST-NeRF

De tre elementene avbildet over, de to personene og miljÃļet, er distinkte og konturet bare for illustrasjonens skyld. Hver kan byttes ut, og hver kan settes inn i scenen pÃĨ et tidligere eller senere punkt i deres individuelle opptakstidslinje.

De tre elementene avbildet over, de to personene og miljÃļet, er distinkte og konturet bare for illustrasjonens skyld. Hver kan byttes ut, og hver kan settes inn i scenen pÃĨ et tidligere eller senere punkt i deres individuelle opptakstidslinje.

ST-NeRF er en innovasjon pÃĨ forskning i Neural Radiance Fields (NeRF), et maskinlÃĶrings-rammeverk hvor multiple perspektiver opptak syntetiseres til et navigerbart virtuelt rom ved omfattende trening (selv om enkelt perspektiv opptak ogsÃĨ er en undersektor av NeRF-forskning).

Neural Radiance Fields fungerer ved ÃĨ samle inn multiple perspektiver opptak til et enkelt kohorent og navigerbart 3D-rom, med hullene mellom dekning estimert og renderet av et neuralt nettverk. Der video (i stedet for stillbilder) brukes, er renderingressursene som oftest betydelige. Kilde: https://www.matthewtancik.com/nerf

Neural Radiance Fields fungerer ved ÃĨ samle inn multiple perspektiver opptak til et enkelt kohorent og navigerbart 3D-rom, med hullene mellom dekning estimert og renderet av et neuralt nettverk. Der video (i stedet for stillbilder) brukes, er renderingressursene som oftest betydelige. Kilde: https://www.matthewtancik.com/nerf

Interessen for NeRF har blitt intens i lÃļpet av de siste ni mÃĨnedene, og en Reddit-vedlikeholdt liste over deriverte eller utforskende NeRF-papirer listar for Ãļyeblikket seksti prosjekter.

 

Bare noen av de mange avleggerne av den opprinnelige NeRF-papiren. Kilde: https://crossminds.ai/graphlist/nerf-neural-radiance-fields-ai-research-graph-60708936c8663c4cfa875fc2/

Bare noen av de mange avleggerne av den opprinnelige NeRF-papiren. Kilde: https://crossminds.ai/graphlist/nerf-neural-radiance-fields-ai-research-graph-60708936c8663c4cfa875fc2/

Rimelig trening

Artikkelen er et samarbeid mellom forskere ved Shanghai Tech University og DGene Digital Technology, og har blitt akseptert med noe entusiasme pÃĨ Open Review.

ST-NeRF tilbyr en rekke innovasjoner over tidligere initiativer i ML-avledede navigerbare video-rom. Ikke minst, oppnÃĨr det en hÃļy grad av realisme med bare 16 kameraer. Selv om Facebooks DyNeRF bruker bare to kameraer mer enn dette, tilbyr det et mye mer begrenset navigerbart bue.

Et eksempel pÃĨ Facebooks DyNeRF-miljÃļ, med en mer begrenset bevegelsesfelt og flere kameraer per kvadratfot nÃļdvendig for ÃĨ rekonstruere scenen. Kilde: https://neural-3d-video.github.io

Et eksempel pÃĨ Facebooks DyNeRF-miljÃļ, med en mer begrenset bevegelsesfelt og flere kameraer per kvadratfot nÃļdvendig for ÃĨ rekonstruere scenen. Kilde: https://neural-3d-video.github.io

Foruten ÃĨ mangle evnen til ÃĨ redigere og komponere individuelle fasetter, er DyNeRF sÃĶrlig dyrt i forhold til beregningsressurser. I kontrast til dette sier de kinesiske forskerne at treningkostnadene for deres data kommer ut til ÃĨ ligge mellom $900-$3,000, sammenlignet med $30,000 for den state-of-the-art video-genereringsmodellen DVDGAN, og intensive systemer som DyNeRF.

Recensenter har ogsÃĨ notert at ST-NeRF gjÃļr en stor innovasjon i ÃĨ skille prosessen med ÃĨ lÃĶre bevegelse fra prosessen med bilde-syntese. Denne separasjonen er det som muliggjÃļr redigering og komposisjon, med tidligere tilnÃĶrminger begrensede og lineÃĶre i sammenligning.

Selv om 16 kameraer er et svÃĶrt begrenset antall for et sÃĨ fullt halvsirkel-utsyn, hÃĨper forskerne ÃĨ kutte dette tallet ned ytterligere i senere arbeid gjennom ÃĨ bruke proxy-pre-skannet statiske bakgrunner og mer data-drevne scenemodelleringstilnÃĶrminger. De hÃĨper ogsÃĨ ÃĨ inkorporere re-lysbare evner, en ny innovasjon i NeRF-forskning.

Behandling av begrensninger i ST-NeRF

I sammenheng med akademiske CS-papirer som tenderer til ÃĨ kaste bort den faktiske brukbarheten av et nytt system i en kast-til-slutt-paragraph, er selv begrensningene som forskerne anerkjenner for ST-NeRF usedvanlige.

De observerer at systemet ikke kan individuelt rendre ut bestemte objekter i en scene, fordi personene i opptakene er segmentert i individuelle enheter via et system designet for ÃĨ gjenkjenne mennesker og ikke objekter – et problem som ser ut til ÃĨ vÃĶre lett lÃļst med YOLO og lignende rammer, med det hardeste arbeidet med ÃĨ trekke ut menneskelig video allerede utfÃļrt.

Selv om forskerne noterer at det for Ãļyeblikket ikke er mulig ÃĨ generere slow-motion, ser det ut til ÃĨ vÃĶre lite som kan forhindre implementeringen av dette ved ÃĨ bruke eksisterende innovasjoner i ramme-interpolasjon som DAIN og RIFE.

Som med alle NeRF-implementasjoner, og i mange andre sektorer av datavisjonsforskning, kan ST-NeRF feile i tilfeller av alvorlig okklusjon, der subjektet er midlertidig skjult av en annen person eller et objekt, og kan vÃĶre vanskelig ÃĨ kontinuerlig spore eller ÃĨ gjenopprette etterpÃĨ. Som andre steder, kan denne vanskeligheten mÃĨtte vente pÃĨ oppstrÃļms lÃļsninger. I mellomtiden, innrÃļmmer forskerne at manuell inngripen er nÃļdvendig i disse okkluderte rammer.

Til slutt observerer forskerne at de menneskelige segmenteringsprosedyrene for Ãļyeblikket avhenger av fargeforskjeller, som kunne fÃļre til utilsiktet sammenslÃĨing av to personer i ÃĐn segmentblokk – en hindring som ikke er begrenset til ST-NeRF, men intrinsic til biblioteket som brukes, og som kunne muligens lÃļses ved optisk flytanalyse og andre fremvoksende tekniker.

FÃļrst publisert 7. mai 2021.

Forfatter innen maskinlÃĶring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble opplÃļst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: [email protected]