Andersons vinkel

NeRF: Utfordringen med å redigere innholdet i neurale lysfelt

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Tidligere i år tok NVIDIA NeRF-forskning (Neural Radiance Fields) betydelig fremsteg med InstantNeRF, som tilsynelatende kan generere utforskbare neurale scener på bare noen sekunder – fra en teknikk som, da den oppstod i 2020, ofte tok timer eller til og med dager å trene.

NVIDIA's InstantNeRF gir imponerende og raske resultater. Kilde: https://www.youtube.com/watch?v=DJ2hcC1orc4

NVIDIA’s InstantNeRF gir imponerende og raske resultater. Kilde: https://www.youtube.com/watch?v=DJ2hcC1orc4

Selv om denne typen interpolasjon produserer en statisk scene, er NeRF også i stand til å avbilde bevegelse, og grundleggende ‘kopier-og-lim’ redigering, hvor enkeltvis NeRF kan enten kombineres til sammensatte scener eller innsatt i eksisterende scener.

Nestede NeRF, presentert i 2021-forskning fra Shanghai Tech University og DGene Digital Technology. Kilde: https://www.youtube.com/watch?v=Wp4HfOwFGP4

Nestede NeRF, presentert i 2021-forskning fra Shanghai Tech University og DGene Digital Technology. Kilde: https://www.youtube.com/watch?v=Wp4HfOwFGP4

Men hvis du ønsker å gripe inn i en beregnet NeRF og faktisk endre noe som skjer inne i den (på samme måte som du kan endre elementer i en tradisjonell CGI-scene), har den raske takten i sektorens interesse ført til svært løsninger til nå, og ingen som tilnærmet matcher CGI-arbeidsflyts funksjonalitet.

Selv om geometriestimering er essensiell for å opprette en NeRF-scene, består det endelige resultatet av ganske “låste” verdier. Mens det er en del fremgang i å endre teksturverdier i NeRF, er de faktiske objekter i en NeRF-scene ikke parametriske mesh som kan redigeres og lekes med, men mer likt sprø og frosne punktskyer.

I denne scenariot er en renderet person i en NeRF i realiteten en statue (eller en rekke statuer, i video NeRF); skyggen de kaster på seg selv og andre objekter er teksturer, snarere enn fleksible beregninger basert på lyskilder; og redigerbarheten av NeRF-innhold er begrenset til valgene gjort av fotografen som tar de sparsomme kildebildene fra hvilket NeRF genereres. Parametere som skygge og posisjon forblir ikke-redigerbare, i noen kreativ forstand.

NeRF-Redigering

En ny akademisk forskningssamarbeid mellom Kina og Storbritannia tar tak i denne utfordringen med NeRF-Redigering, hvor proxy-CGI-liknende mesh blir trukket ut fra en NeRF, deformert etter ønske av brukeren, og deformasjonene overført tilbake til NeRFs neurale beregninger;

NeRF-dokk med NeRF-redigering, da deformasjonene beregnet fra film blir brukt på tilsvarende punkter i en NeRF-representasjon. Kilde: http://geometrylearning.com/NeRFEditing/

NeRF-dokk med NeRF-redigering, da deformasjonene beregnet fra film blir brukt på tilsvarende punkter i en NeRF-representasjon. Kilde: http://geometrylearning.com/NeRFEditing/

Metoden tilpasser NeuS-teknikken fra 2021, som trekker ut en Signert Avstandsfunksjon (SDF, en mye eldre metode for volumrekonstruksjon) som kan lære geometrien representert i NeRF.

Dette SDF-objektet blir brukerens skulpturbase, med krumning og formingsmuligheter levert av den kjente As-Rigid-As-Possible (ARAP)-teknikken.

ARAP lar brukerne deformere det trukne SDF-mesh, selv om andre metoder, som skjelettbasert og burbasert (dvs. NURBs), også ville fungert godt. Kilde: https://arxiv.org/pdf/2205.04978.pdf

ARAP lar brukerne deformere det trukne SDF-mesh, selv om andre metoder, som skjelettbasert og burbasert (dvs. NURBs), også ville fungert godt. Kilde: https://arxiv.org/pdf/2205.04978.pdf

Med deformasjonene anvendt, er det nødvendig å oversette denne informasjonen fra vektor til RGB/pikselnivået som er naturlig for NeRF, som er en litt lengre reise.

De triangulære hjørnene av meshen som brukeren har deformat, oversettes først til en tetraedrisk mesh, som danner en hud rundt bruker-meshen. En romlig diskret deformasjonsfelt trekkes ut fra denne ekstra meshen, og til slutt oppnås et NeRF-vennlig kontinuerlig deformasjonsfelt som kan overføres tilbake til det neurale lysmiljøet, reflekterer brukerens endringer og redigeringer, og direkte påvirker de tolkede strålene i mål-NeRF.

Objekter deformat og animert av den nye metoden.

Objekter deformat og animert av den nye metoden.

Artikkelen sier:

‘Etter å overføre overflatdeformasjonen til den tetraedriske meshen, kan vi oppnå det diskrete deformasjonsfeltet av “effektivt rom”. Vi bruker nå disse diskrete transformasjonene for å bøye strålene. For å generere et bilde av det deformede lysfeltet, kaster vi stråler til rommet som inneholder den deformede tetraedriske meshen.’

Den artikkelen heter NeRF-Redigering: Geometrisk Redigering av Neurale Lysfelt, og kommer fra forskere på tre kinesiske universiteter og institusjoner, sammen med en forsker fra School of Computer Science & Informatics ved Cardiff University, og to andre forskere fra Alibaba Group.

Begrensninger

Som nevnt tidligere, vil transformert geometri ikke “oppdatere” noen relaterte aspekter i NeRF som ikke er redigert, eller reflektere sekundære konsekvenser av den deformede elementet, som skygge. Forskerne gir et eksempel, hvor underskyggen på en menneskefigur i en NeRF forblir uendret, selv om deformasjonen burde endre lysningen:

Fra artikkelen: Vi ser at den horisontale skyggen på figurens arm forblir på plass, selv om armen flyttes oppover.

Fra artikkelen: Vi ser at den horisontale skyggen på figurens arm forblir på plass, selv om armen flyttes oppover.

Eksperimenter

Forfatterne observerer at det for øyeblikket ikke finnes sammenlignbare metoder for direkte inngripen i NeRF-geometri. Derfor var eksperimentene som ble utført for forskningen mer utforskende enn sammenlignende.

Forskerne demonstrerte NeRF-Redigering på en rekke offentlige datasett, inkludert figurer fra Mixamo, og den nå-ikonske Lego-bulldozer og stol fra den opprinnelige NeRF-implementeringen. De eksperimenterte også på en ekte fanget hestestatue fra FVS-datasettet, samt deres egne originale fangster.

En hestehode som er vridd.

En hestehode som er vridd.

For fremtidig arbeid planlegger forfatterne å utvikle sitt system i just-in-time (JIT)-kompilert maskinlæring-rammeverk Jittor.

 

Først publisert 16. mai 2022.

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai