Andersonův úhel

Učení robotů o nástrojích pomocí neuronových radiance polí (NeRF)

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Nový výzkum z Michiganské univerzity nabízí způsob, jak roboty mohou pochopit mechanismy nástrojů a dalších reálných objektů se skládacími částmi, vytvořením Neuronových radiance polí (NeRF), které demonstrují, jak se tyto objekty pohybují, a potentially umožňují robotovi interagovat s nimi a používat je bez zdlouhavé předchozí konfigurace.

Používáním známých referencí pro vnitřní pohyblivost nástrojů (nebo jakýchkoli objektů se vhodnou referencí) může NARF22 syntetizovat fotorealistickou aproximaci nástroje a jeho rozsahu pohybu a typu operace. Source: https://progress.eecs.umich.edu/projects/narf/

Používáním známých referencí pro vnitřní pohyblivost nástrojů (nebo jakýchkoli objektů se vhodnou referencí) může NARF22 syntetizovat fotorealistickou aproximaci nástroje a jeho rozsahu pohybu a typu operace. Source: https://progress.eecs.umich.edu/projects/narf/

Roboty, které musí dělat více než jen vyhýbat se chodcům nebo provádět složitě naprogramované rutiny (pro které byly pravděpodobně vytvořeny a označeny datasets za určitou cenu), potřebují tuto kind adaptivní kapacity, aby mohli pracovat s materiály a objekty, se kterými musí pracovat i lidé.

Dosud existovalo několik překážek, které bránily vštěpování robotickým systémům této kind versatility. Patří mezi ně nedostatek použitelných datasets, mnoho z nich obsahuje velmi omezený počet objektů; vysoké náklady spojené s generováním fotorealistických, mesh-based 3D modelů, které mohou pomoci robotům naučit se instrumentality v reálném světě; a ne-fotorealistická kvalita takových datasets, které mohou být vhodné pro tuto výzvu, způsobující, že objekty vypadají nesouvisle s tím, co robot vnímá ve svém okolí, a učí se hledat karikaturu objektu, který se nikdy neobjeví v realitě.

Na řešení této výzvy vyvinuli výzkumníci z Michiganské univerzity, jejichž článek se jmenuje NARF22: Neuronová Artikulovaná Radiance Pole pro Konfiguračně-Vědomé Rendering, dvoufázový pipeline pro generování NeRF-based artikulovaných objektů, které mají “reálný svět” vzhled a které zahrnují pohyb a následující omezení každého artikulovaného objektu.

Ačkoli vypadá složitěji, dvě základní fáze NARF22 pipeline zahrnují rendering statických částí pohyblivých nástrojů a poté kompozici těchto prvků do druhého datasetu, který je informován o parametrech pohybu, které tyto části mají, relativně k sobě. Source: https://arxiv.org/pdf/2210.01166.pdf

Ačkoli vypadá složitěji, dvě základní fáze NARF22 pipeline zahrnují rendering statických částí pohyblivých nástrojů a poté kompozici těchto prvků do druhého datasetu, který je informován o parametrech pohybu, které tyto části mají, relativně k sobě. Source: https://arxiv.org/pdf/2210.01166.pdf

Systém se jmenuje Neuronová Artikulovaná Radiance Pole – nebo NARF22, aby se odlišil od jiného podobně nazvaného projektu.

NARF22

Určení, zda neznámý objekt je potenciálně artikulovaný, vyžaduje téměř nepochopitelné množství lidského předchozího vědomí. Například, pokud jste nikdy neviděli zavřenou zásuvku, mohla by vypadat jako jakýkoli jiný dekorativní panel – není to až do té doby, než jste ji skutečně otevřeli, že internalizujete “zásuvku” jako artikulovaný objekt se single osou pohybu (dopředu a dozadu).

Tudíž NARF22 není určen jako exploratorní systém pro zvedání věcí a zjišťování, zda mají akční pohyblivé části – téměř simijské chování, které by vedlo k počtu potenciálně katastrofických scénářů. Spíše je framework založen na znalostech dostupných v Univerzálním Popisu Robotů (URDF) – otevřeném XML-založeném formátu, který je široce aplikovatelný a vhodný pro úkol. Soubor URDF bude obsahovat použitelné parametry pohybu v objektu, stejně jako popisy a další označené aspekty částí objektu.

V konvenčních pipelinech je nutné popsat artikulační schopnosti objektu a označit příslušné kloubové hodnoty. To není levný nebo snadno škálovatelný úkol. Místo toho renderuje workflow NARF22 jednotlivé komponenty objektu před “složením” každé statické komponenty do artikulovaného NeRF-based reprezentace, s vědomím pohybových parametrů poskytnutých URDF.

V druhé fázi procesu je vytvořen zcela nový renderer, který zahrnuje všechny části. Ačkoli by bylo snazší prostě spojit jednotlivé části v dřívější fázi a přeskočit tento následný krok, výzkumníci pozorují, že konečný model – který byl trénován na NVIDIA RTX 3080 GPU pod AMD 5600X CPU – má nižší výpočetní nároky během backpropagation než takový abruptní a předčasný assembly.

Navíc běží druhý-stage model na dvojnásobnou rychlost než spojený, “brutální” assembly, a jakékoli sekundární aplikace, které mohou potřebovat využívat informace o statických částech modelu, nebudou potřebovat přístup k informacím URDF, protože tyto již byly zahrnuty do konečného-stage renderu.

Data a Experimenty

Výzkumníci provedli několik experimentů pro testování NARF22: jeden pro hodnocení kvalitativního renderingu pro každou konfiguraci a polohu objektu; kvantitativní test pro srovnání renderovaných výsledků se skutečnými pohledy zobrazenými roboty; a demonstraci konfigurační estimace a 6 DOF (hloubka pole) úpravy výzvy, která používala NARF22 pro provedení gradient-based optimalizace.

Trénovací data byla přijata z Progress Tools datasetu z dřívějšího článku několika autorů současné práce. Progress Tools obsahuje kolem šesti tisíc RGB-D (tj. včetně hloubkových informací, které jsou nezbytné pro robotické vidění) obrázků o rozlišení 640×480. Scény zahrnovaly osm ručních nástrojů, rozdělených do svých konstitutivních částí, kompletních s mesh modely a informacemi o kinematických vlastnostech objektů (tj. jak jsou navrženy pro pohyb a parametry tohoto pohybu).

Progress Tools dataset obsahuje čtyři artikulované nástroje. Obrázky výše jsou NeRF-based renderovány z NARF22.

Progress Tools dataset obsahuje čtyři artikulované nástroje. Obrázky výše jsou NeRF-based renderovány z NARF22.

Pro tento experiment byl vytvořen konečný konfigurovatelný model pomocí pouze lineckých kleští, dlouhých nosů a svěráku (viz obrázek výše). Trénovací data obsahovala jednu konfiguraci svěráku a jednu pro každý z kleští.

Implementace NARF22 je založena na FastNeRF, s vstupními parametry upravenými pro soustředění se na spojené a prostorově-kódované polohy nástrojů. FastNeRF používá faktorizovaný multilayer perceptron (MLP) spojený s voxelizovaným vzorkováním mechanismem (voxely jsou vlastně pixely, ale s plnými 3D souřadnicemi, takže mohou fungovat v trojrozměrném prostoru).

Pro kvalitativní test pozorují výzkumníci, že existují beberapa zakryté části svěráku (tj. centrální páteř, která nemůže být známa nebo odhadnuta pozorováním objektu, ale pouze interakcí s ním, a že systém má potíže s vytvořením této “neznámé” geometrie.

Kvalitativní renderování nástrojů.

Kvalitativní renderování nástrojů.

Naproti tomu se kleště dobře generalizovaly na nové konfigurace (tj. na prodloužení a pohyby jejich částí, které jsou v rámci parametrů URDF, ale které nejsou explicitně řešeny v trénovacích materiálech pro model.

Výzkumníci pozorují, že chyby při označení kleští vedly ke snížení kvality renderingu pro velmi detailní části nástrojů, negativně ovlivňující renderování – problém související s mnohem širšími obavami kolem logistiky, rozpočtu a přesnosti označení v počítačovém vidění výzkumu, spíše než jakýmkoli procedurálním nedostatkem v NARF22 pipeline.

Výsledky z testu renderovací přesnosti.

Výsledky z testu renderovací přesnosti.

Pro testy konfigurační estimace provedli výzkumníci úpravy polohy a konfigurační estimaci z počáteční “tužší” polohy, vyhýbající se jakékoli cache nebo urychlovací práce, které FastNeRF sám používá.

Pak trénovali 17 dobře uspořádaných scén ze testovací sady Progress Tools (které byly drženy stranou během trénování), běžící přes 150 iterací gradient descent optimalizace pod Adam optimalizátorem. Tento postup obnovil konfigurační estimaci “extrémně dobře”, podle výzkumníků.

Výsledky z testu konfigurační estimace.

Výsledky z testu konfigurační estimace.

 

Poprvé publikováno 5. října 2022.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai