Andersons vinkel

NeRF: Utmaningen med att redigera innehållet i Neurala Radiancefält

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Tidigare i år avancerade NVIDIA Neural Radiance Fields (NeRF) forskning betydligt med InstantNeRF, som tydligen kan generera utforskbara neuralscener på bara några sekunder – från en teknik som, när den uppstod 2020, ofta tog timmar eller till och med dagar att träna.

NVIDIA's InstantNeRF ger imponerande och snabba resultat. Källa: https://www.youtube.com/watch?v=DJ2hcC1orc4

NVIDIA’s InstantNeRF ger imponerande och snabba resultat. Källa: https://www.youtube.com/watch?v=DJ2hcC1orc4

Även om denna typ av interpolation producerar en statisk scen, kan NeRF också avbilda rörelse, och grundläggande ‘kopiera-och-klistra-in’ redigering, där enskilda NeRF kan antingen sammanfogas till sammansatta scener eller infogas i befintliga scener.

Inbäddade NeRF, som presenterades i 2021 års forskning från Shanghai Tech University och DGene Digital Technology. Källa: https://www.youtube.com/watch?v=Wp4HfOwFGP4

Inbäddade NeRF, som presenterades i 2021 års forskning från Shanghai Tech University och DGene Digital Technology. Källa: https://www.youtube.com/watch?v=Wp4HfOwFGP4

Men om du vill ingripa i en beräknad NeRF och faktiskt ändra något som händer inuti den (på samma sätt som du kan ändra element i en traditionell CGI-scen), har den snabba takten i sektorns intresse kommit med mycket lösningar hittills, och ingen som ens börjar matcha de funktioner som CGI-arbetsflöden har.

Även om geometriuppskattning är avgörande för att skapa en NeRF-scen, består det slutliga resultatet av ganska ‘låsta’ värden. Medan det görs vissa framsteg mot att ändra texturvärdet i NeRF, är de faktiska objekten i en NeRF-scen inte parametriska nät som kan redigeras och lekas med, utan mer liknar spröda och frusna punktmoln.

I detta scenario är en återgiven person i en NeRF i princip en staty (eller en serie statyer, i video NeRF); skuggorna de kastar på sig själva och andra objekt är texturer, snarare än flexibla beräkningar baserade på ljuskällor; och redigerbarheten av NeRF-innehåll är begränsad till de val som fotografen som tar de glesa källbilder från vilka NeRF genereras. Parametrar som skuggor och pose förblir icke-redigerbara, i någon kreativ mening.

NeRF-Redigering

Ett nytt akademiskt forskningssamarbete mellan Kina och Storbritannien möter denna utmaning med NeRF-Redigering, där proxy-CGI-liknande nät extraheras från en NeRF, deformerats efter behag av användaren, och deformationerna skickas tillbaka till NeRF:s neurala beräkningar;

NeRF-dukning med NeRF-redigering, när deformationerna beräknade från filmen appliceras på motsvarande punkter i en NeRF-representation. Källa: http://geometrylearning.com/NeRFEditing/

NeRF-dukning med NeRF-redigering, när deformationerna beräknade från filmen appliceras på motsvarande punkter i en NeRF-representation. Källa: http://geometrylearning.com/NeRFEditing/

Metoden anpassar NeuS 2021 års rekonstruktiva teknik från USA/Kina, som extraherar en Signerad AvståndsFunktion (SDF, en mycket äldre metod för volymrekonstruktion) som kan lära sig geometrin som representeras inuti NeRF.

Denna SDF-objekt blir användarens skulpteringsbas, med krökning och formningsförmåga som tillhandahålls av den ärevördiga As-Rigid-As-Possible (ARAP)-tekniken.

ARAP tillåter användare att deformera det extraherade SDF-nätet, även om andra metoder, som skelettbaserade och burbaserade tillvägagångssätt (t.ex. NURBs), också skulle fungera bra. Källa: https://arxiv.org/pdf/2205.04978.pdf

ARAP tillåter användare att deformera det extraherade SDF-nätet, även om andra metoder, som skelettbaserade och burbaserade tillvägagångssätt (t.ex. NURBs), också skulle fungera bra. Källa: https://arxiv.org/pdf/2205.04978.pdf

När deformationerna appliceras, är det nödvändigt att översätta denna information från vektor till RGB/pixelnivå som är native för NeRF, vilket är en något längre resa.

De triangulära vertexerna i nätet som användaren har deformerat översätts först till ett tetraedriskt nät, som bildar en hud runt användarnätet. Ett rumsligt diskret deformationfält extraheras från detta tilläggsnät, och slutligen erhålls ett NeRF-vänligt kontinuerligt deformationfält som kan skickas tillbaka till det neurala strålningsmiljön, vilket återger användarens ändringar och redigeringar, och direkt påverkar de tolkade strålarna i mål-NeRF.

Objekt deformerade och animerade med den nya metoden.

Objekt deformerade och animerade med den nya metoden.

Artikeln säger:

‘Efter att ha överfört ytan deformation till det tetraedriska nätet, kan vi erhålla det diskreta deformationfältet för “effektivt utrymme”. Vi använder nu dessa diskreta transformationer för att böja strålar. För att generera en bild av det deformerade strålningsfältet, kastar vi strålar till utrymmet som innehåller det deformerade tetraedriska nätet.’

Artikeln är titlad NeRF-Redigering: Geometrisk Redigering av Neurala Radiancefält, och kommer från forskare på tre kinesiska universitet och institutioner, tillsammans med en forskare från School of Computer Science & Informatics vid Cardiff University, och två andra forskare från Alibaba Group.

Begränsningar

Som nämnts tidigare, kommer den transformerade geometrin inte att ‘uppdatera’ några relaterade aspekter i NeRF som inte har redigerats, eller återspegla sekundära konsekvenser av den deformerade komponenten, som skuggor. Forskarna tillhandahåller ett exempel, där underskuggor på en människfigur i en NeRF förblir oförändrade, trots att deformationen borde förändra belysningen:

Från artikeln: vi ser att den horisontella skuggan på figurens arm förblir på plats, även när armen flyttas uppåt.

Från artikeln: vi ser att den horisontella skuggan på figurens arm förblir på plats, även när armen flyttas uppåt.

Experiment

Författarna observerar att det för närvarande inte finns några jämförbara metoder för direkt ingripande i NeRF-geometri. Därför var de experiment som utfördes för forskningen mer utforskande än jämförande.

Forskarna demonstrerade NeRF-Redigering på ett antal offentliga datamängder, inklusive karaktärer från Mixamo, och den nu ikoniska Lego-bulldozeren och stolen från den ursprungliga NeRF- implementeringen. De experimenterade också på en riktigt inspelad häststaty från FVS-datasetet, samt deras egna ursprungliga inspelningar.

En häst huvud vinklad.

En häst huvud vinklad.

För framtida arbete, avser författarna att utveckla sitt system i just-in-time (JIT) sammanställd maskinlärningsramverk Jittor.

 

Publicerad första gången den 16 maj 2022.

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai