Andersons vinkel

NeRF: Træning af drones i neurale lysmiljøer

mm
Føj Unite.AI til dine foretrukne kilder på Google

Forskere fra Stanford University har udviklet en ny metode til træning af drones til at navigere i fotorealistiske og meget præcise miljøer ved at udnytte den seneste bølge af interesse i Neural Radiance Fields (NeRF).

Drones kan trænes i virtuelle miljøer, der er direkte afbildet fra virkelige lokationer, uden behov for specialiseret 3D-scenerekonstruktion. I dette billede fra projektet er vindforstyrrelse tilføjet som en mulig hindring for dronen, og vi kan se, hvordan dronen midlertidigt afviger fra sin bane og kompenserer i sidste øjeblik for at undgå en mulig hindring. Kilde: https://mikh3x4.github.io/nerf-navigation/

Drones kan trænes i virtuelle miljøer, der er direkte afbildet fra virkelige lokationer, uden behov for specialiseret 3D-scenerekonstruktion. I dette billede fra projektet er vindforstyrrelse tilføjet som en mulig hindring for dronen, og vi kan se, hvordan dronen midlertidigt afviger fra sin bane og kompenserer i sidste øjeblik for at undgå en mulig hindring. Kilde: https://mikh3x4.github.io/nerf-navigation/

Metoden giver mulighed for interaktiv træning af drones (eller andre typer objekter) i virtuelle scenarier, der automatisk inkluderer volumeninformation (til beregning af kollision undgåelse), teksturering trukket direkte fra virkelige fotos (for at hjælpe med at træne drones’ billedgenkendelsesnetværk på en mere realistisk måde) og virkelige lysforhold (for at sikre, at der trænes en variation af lys-scenarier ind i netværket, og undgå over-tilpasning eller over-optimering til den oprindelige snapshot af scenariet).

En couch-objekt navigerer gennem et komplekst virtuelt miljø, der ville have været meget svært at kortlægge ved hjælp af geometrikapture og retteksturering i traditionelle AR/VR-workflows, men som blev genskabt automatisk i NeRF fra et begrænset antal fotos taget på stedet. Kilde: https://www.youtube.com/watch?v=5JjWpv9BaaE

En couch-objekt navigerer gennem et komplekst virtuelt miljø, der ville have været meget svært at kortlægge ved hjælp af geometrikapture og retteksturering i traditionelle AR/VR-workflows, men som blev genskabt automatisk i NeRF fra et begrænset antal fotos. Kilde: https://www.youtube.com/watch?v=5JjWpv9BaaE

Typiske NeRF-implementeringer har ikke medført trajektorimekanismer, da de fleste NeRF-projekter i de sidste 18 måneder har koncentreret sig om andre udfordringer, såsom scenelys, refleksrendering, komposition og adskillelse af fangete elementer. Derfor er den nye artikels primære innovation at implementere en NeRF-miljø som et navigerbart rum, uden den omfattende udstyr og omstændelige procedurer, der ville være nødvendige for at modelere det som et 3D-miljø baseret på sensorfangetagelse og CGI-rekonstruktion.

NeRF som VR/AR

Den nye artikel er titlen Vision-Only Robot Navigation in a Neural Radiance World, og er et samarbejde mellem tre Stanford-afdelinger: Aeronautics and Astronautics, Mechanical Engineering og Computer Science.

Arbejdet foreslår en navigationsramme, der giver en robot en forudtrænet NeRF-miljø, hvis volumendensitet afgrænser mulige baner for enheden. Den indeholder også en filter til at estimere, hvor robotten er inde i den virtuelle miljø, baseret på billedgenkendelse af robottens onboard RGB-kamera. På denne måde kan en drone eller robot “hallucinere” mere præcist, hvad den kan forvente at se i en given miljø.

Projektets trajektorioptimizer navigerer gennem en NeRF-model af Stonehenge, der blev genereret gennem fotogrammetri og billedfortolkning til en neural lysmiljø. Trajektorioptimizeren beregner en række mulige baner, før den fastlægger en optimal bane over buen.

Projektets trajektorioptimizer navigerer gennem en NeRF-model af Stonehenge, der blev genereret gennem fotogrammetri og billedfortolkning (i dette tilfælde af mesh-modeller) til en neural lysmiljø. Trajektorioptimizeren beregner en række mulige baner, før den fastlægger en optimal bane over buen.

Fordi en NeRF-miljø har fuldt modellerede okklusioner, kan dronen lære at beregne hindringer mere let, da neuralt netværk bag NeRF kan kortlægge forholdet mellem okklusioner og måden, hvorpå droneens onboard vision-baserede navigasjonssystemer opfatter miljøet. Den automatiserede NeRF-genereringspipeline tilbyder en relativt trivial metode til at oprette hyper-realistiske træningsrum med kun få fotos.

Den online omplanlægningsramme, der er udviklet til Stanford-projektet, faciliterer en robust og fuldt vision-baseret navigationspipeline.

Den online omplanlægningsramme, der er udviklet til Stanford-projektet, faciliterer en robust og fuldt vision-baseret navigationspipeline.

Stanford-initiativet er blandt de første, der overvejer mulighederne for at udforske et NeRF-rum i konteksten af et navigerbart og immersivt VR-lignende miljø. Neurale lysfelter er en opblomstrende teknologi, og er i øjeblikket genstand for multiple akademiske bestræbelser på at optimere deres høje krav til beregningsressourcer samt at adskille de fangete elementer.

Nerf er ikke (rigtigt) CGI

Fordi en NeRF-miljø er et navigerbart 3D-scenarie, er det blevet en misforstået teknologi, siden dets opdukken i 2020, ofte bredt opfattet som en metode til at automatisere oprettelsen af mesh og tekstur, snarere end at erstatte 3D-miljøer, der er kendte for seere fra Hollywood VFX-afdelinger og de fantastiske scener fra Augmented Reality og Virtual Reality-miljøer.

NeRF ekstraherer geometri- og teksturinformation fra et meget begrænset antal billedsynspunkter, beregner forskellen mellem billeder som volumeninformation. Kilde: https://www.matthewtancik.com/nerf

NeRF ekstraherer geometri- og teksturinformation fra et meget begrænset antal billedsynspunkter, beregner forskellen mellem billeder som volumeninformation. Kilde: https://www.matthewtancik.com/nerf

I virkeligheden er NeRF-miljøet mere som et “live”-render-rum, hvor en sammensmeltning af pixel- og lysinformation er bevaret og navigeret i et aktivt og kørende neuralt netværk.

Nøglen til NeRF’s potentiale er, at det kun kræver et begrænset antal billeder for at genskabe miljøer, og at de genererede miljøer indeholder alle nødvendige oplysninger til en høj-fidel rekonstruktion, uden behov for modellører, teksturkunstnere, lys-specialister og andre bidragydere til “traditionel” CGI.

Semantisk segmentering

Selv om NeRF effektivt udgør “Computer-Generated Imagery” (CGI), tilbyder det en helt anden metode og en højautomatiseret pipeline. Derudover kan NeRF isolere og “indkapsle” mobile dele af en scene, så de kan tilføjes, fjernes, accelereres og generelt fungere som separate aspekter i et virtuelt miljø – en kapacitet, der er langt ud over den nuværende tilstand af kunst i en “Hollywood”-fortolkning af, hvad CGI er.

ST-NeRF

Et samarbejde fra Shanghai Tech University, offentliggjort i sommeren 2021, tilbyder en metode til at individuere mobile NeRF-elementer til “indsatte” aspekter i en scene. Kilde: https://www.youtube.com/watch?v=Wp4HfOwFGP4

Negativt er NeRF’s arkitektur en slags “sort boks”; det er ikke muligt at ekstrahere et objekt fra en NeRF-miljø og direkte manipulere det med traditionelle mesh-baserede og billed-baserede værktøjer, selv om en række forskningsindsatser er begyndt at gøre gennembrud i at dekonstruere matrixen bag NeRF’s neurale netværks live-render-miljøer.

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai