Andersons vinkel

Undervisning af robotter om værktøjer med neurale lysfelt (NeRF)

mm
Føj Unite.AI til dine foretrukne kilder på Google

Nyt forskning fra University of Michigan tilbyder en måde for robotter at forstå mekanismerne bag værktøjer og andre virkelige, ledede objekter, ved at oprette Neural Radiance Fields (NeRF)-objekter, der demonstrerer, hvordan disse objekter bevæger sig, og hvordan robotter kan interagere med dem og bruge dem uden at skulle gennemgå en trættende dedikeret forkonfiguration.

Ved at anvende kendte kildehenvisninger for de interne bevægelser af værktøjer (eller enhver anden genstand med en passende reference), kan NARF22 syntetisere en fotorealistisk tilnærmelse af værktøjet og dets bevægelser og operationsmuligheder. Kilde: https://progress.eecs.umich.edu/projects/narf/

Ved at anvende kendte kildehenvisninger for de interne bevægelser af værktøjer (eller enhver anden genstand med en passende reference), kan NARF22 syntetisere en fotorealistisk tilnærmelse af værktøjet og dets bevægelser og operationsmuligheder. Kilde: https://progress.eecs.umich.edu/projects/narf/

Robotter, der skal udføre mere end blot undgå fodgængere eller udføre elaboreret forprogrammerede rutiner (for hvilke ikke-genbrugelige datasæt sandsynligvis er blevet mærket og trænet til en vis omkostning), har brug for denne type adaptiv kapacitet, hvis de skal arbejde med de samme materialer og genstande, som vi andre måtte kæmpe med.

Indtil nu har der været en række hindringer for at give robotiske systemer denne type fleksibilitet. Disse omfatter manglen på anvendelige datasæt, mange af hvilke kun indeholder et meget begrænset antal genstande; den store omkostning, der er forbundet med at generere fotorealistiske, mesh-baserede 3D-modeller, der kan hjælpe robotter med at lære instrumentlighed i virkelighedens kontekst; og den ikke-fotorealistiske kvalitet af sådanne datasæt, der kan være egnet til udfordringen, hvilket får genstandene til at fremstå som afbrudt fra, hvad robotten opfatter i verden omkring den, og træner den til at søge efter en tegneserie-lignende genstand, der aldrig vil optræde i virkeligheden.

For at imødekomme dette har Michigan-forskerne, hvis artikel er tituleret NARF22: Neural Articulated Radiance Fields for Configuration-Aware Rendering, udviklet en to-trins pipeline til at generere NeRF-baserede ledede objekter, der har et ‘virkeligt’ udseende og som inkorporerer bevægelsen og de efterfølgende begrænsninger af enhver specifik ledet genstand.

Selv om det ser mere komplekst ud, består de essentielle to trin i NARF22-pipeline af rendering af statiske dele af mobile værktøjer og derefter komposition af disse elementer i en anden datasæt, der er informeret om bevægelsesparametrene for disse dele i forhold til hinanden. Kilde: https://arxiv.org/pdf/2210.01166.pdf

Selv om det ser mere komplekst ud, består de essentielle to trin i NARF22-pipeline af rendering af statiske dele af mobile værktøjer og derefter komposition af disse elementer i en anden datasæt, der er informeret om bevægelsesparametrene for disse dele i forhold til hinanden. Kilde: https://arxiv.org/pdf/2210.01166.pdf

Systemet kaldes Neural Articulated Radiance Field – eller NARF22, for at skille det fra et andet lignende projekt.

NARF22

At bestemme, om en ukendt genstand er potentiel ledet, kræver en næsten utænkelig mængde menneske-lignende forudgående viden. For eksempel, hvis du aldrig havde set en lukket skuffe før, kunne det se ud som en anden type dekorativ panel, men det er først, når du har åbnet en, at du internaliserer ‘skuffe’ som en ledet genstand med en enkelt akse af bevægelse (for og bag).

Derfor er NARF22 ikke beregnet som et eksplorerende system til at samle ting op og se, om de har aktionable bevægelige dele – næsten abe-lignende adfærd, der ville medføre en række potentielt katastrofale scenarier. I stedet er rammeværket baseret på viden, der er tilgængelig i Universal Robot Description Format (URDF) – en åben kilde XML-baseret format, der er bredt anvendeligt og egnet til opgaven. En URDF-fil vil indeholde de anvendelige parametre for bevægelse i en genstand, samt beskrivelser og andre mærkede aspekter af genstandens dele.

I konventionelle pipelines er det nødvendigt at beskrive de ledede egenskaber af en genstand og at mærke de relevante ledværdier. Dette er ikke en billig eller let skalerbar opgave. I stedet renderer NaRF22-arbejdsgangen de enkelte komponenter af genstanden, før den “samler” hver statisk komponent i en ledet NeRF-baseret repræsentation, med viden om bevægelsesparametrene leveret af URDF.

I den anden fase af processen oprettes en helt ny renderer, der inkorporerer alle delene. Selv om det måske ville være nemmere at blot konkatenerer de enkelte dele på et tidligere stadium og springe over dette efterfølgende trin, observerer forskerne, at den endelige model – der blev trænet på en NVIDIA RTX 3080 GPU under en AMD 5600X CPU – har lavere beregningskrav under backpropagation end en sådan abrupt og for tidlig samling.

Derudover kører den anden-stages model med dobbelt så stor hastighed som en konkateneret, ‘brute-forced’ samling, og enhver sekundær applikation, der måske har brug for at anvende information om statiske dele af modellen, har ikke brug for deres egen adgang til URDF-information, fordi dette allerede er inkorporeret i den endelige renderer.

Data og eksperimenter

Forskerne har gennemført en række eksperimenter for at teste NARF22: en for at evaluere kvalitativ rendering for hver genstands konfiguration og pose; en kvantitativ test for at sammenligne de renderede resultater med lignende synspunkter set af virkelige robotter; og en demonstration af konfigurations-estimation og en 6 DOF (dybde af felt) finjustering udfordring, der anvendte NARF22 til at udføre gradient-baseret optimering.

Træningsdataene blev hentet fra Progress Tools-datasættet fra en tidligere artikel af flere af arbejdets nuværende forfattere. Progress Tools indeholder omkring seks tusinde RGB-D-billeder (dvs. inklusive dybdeinformation, der er essentiel for robotvision) i en opløsning på 640×480. Scenerne omfattede otte håndværktøjer, opdelt i deres respektive dele, komplet med mesh-modeller og information om objekternes kinematiske egenskaber (dvs. hvordan de er designet til at bevæge sig og parametrene for denne bevægelse).

Progress Tools-datasættet indeholder fire ledede værktøjer. Billederne ovenfor er NeRF-baserede renderinger fra NARF22.

Progress Tools-datasættet indeholder fire ledede værktøjer. Billederne ovenfor er NeRF-baserede renderinger fra NARF22.

Til dette eksperiment blev en endelig konfigurerbar model trænet ved hjælp af kun linesmandens tang, langnæse-tang og en klemme (se billedet ovenfor). Træningsdataen indeholdt en enkelt konfiguration af klemmen og en for hver af tangene.

Implementeringen af NARF22 er baseret på FastNeRF, med inputparametrene ændret for at koncentrere sig om konkateneret og rumligt-kodet pose af værktøjerne. FastNeRF anvender en faktoriseret multilayer perceptron (MLP) parret med en voxeliseret sampling-mekanisme (voxler er essentiellement pixels, men med fulde 3D-koordinater, så de kan operere i et tredimensionelt rum).

Til den kvalitative test observerer forskerne, at der er flere skjulte dele af klemmen (dvs. den centrale rygrad, der ikke kan kendes eller gættes ved at observere genstanden, men kun ved at interagere med den), og at systemet har svært ved at skabe denne ‘ukendte’ geometri.

Kvalitative renderinger af værktøjer.

Kvalitative renderinger af værktøjer.

I modsætning hertil kunne tangene generalisere godt til nye konfigurationer (dvs. til udvidelser og bevægelser af deres dele, der er inden for URDF-parametrene, men som ikke er eksplisit behandlet i træningsmaterialet for modellen.

Forskerne observerer dog, at mærkningsfejl for tangene førte til en formindskelse af renderingskvaliteten for de meget detaljerede spidser af værktøjerne, hvilket negativt påvirkede renderingerne – et problem, der er relateret til bredere bekymringer omkring mærkningslogistik, budgettering og nøjagtighed i computer vision-forskningen, snarere end nogen procedurfejl i NARF22-pipeline.

Resultater fra render-accurathestesten.

Resultater fra render-accurathestesten.

Til konfigurations-estimationstestene udførte forskerne pose-finedjustering og konfigurations-estimation fra en initial ‘stiv’ pose, undgående enhver form for caching eller andre accelererende workaround, der anvendes af FastNeRF selv.

De trænede derefter 17 velordnede scener fra test-sættet af Progress Tools (der var blevet sat til side under træning), og gennemførte 150 iterationer af gradient descent-optimering under Adam-optimeren. Denne procedure genskabte konfigurations-estimationen ‘ekstremt godt’, ifølge forskerne.

Resultater fra konfigurations-estimationstesten.

Resultater fra konfigurations-estimationstesten.

 

Offentliggjort første gang den 5. oktober 2022.

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai