Anderson의 관점

로봇에게 도구에 대한 지식을 가르치는 방법: 뉴럴 라디언스 필드(NeRF)

mm
Unite.AI를 Google의 선호 소스에 추가

미시간 대학교의 새로운 연구는 로봇이 도구와 다른 실제 세계의 유연한 물체의 메커니즘을 이해하는 방법을 제공합니다. 이를 위해 뉴럴 라디언스 필드(NeRF) 객체를 생성하여 이러한 물체가 어떻게 움직이는지 보여주고, 로봇이 이를 상호작용하고 사용할 수 있도록 합니다.

도구의 내부 운동성에 대한 알려진 소스 참조를 사용하여 NARF22는 도구와 그 이동 범위 및 동작 유형의 포토리얼리스틱 근사치를 합성할 수 있습니다. 출처: https://progress.eecs.umich.edu/projects/narf/

도구의 내부 운동성에 대한 알려진 소스 참조를 사용하여 NARF22는 도구와 그 이동 범위 및 동작 유형의 포토리얼리스틱 근사치를 합성할 수 있습니다. 출처: https://progress.eecs.umich.edu/projects/narf/

로봇이 보행자 피하기 또는 미리 프로그래밍된 루틴을 수행하는 것 이상을 수행해야 하는 경우, 이러한 종류의 적응 능력이 필요합니다. 이러한 능력은 로봇이 우리가 다루는 동일한 재료와 물체를 작업할 수 있도록 합니다.

지금까지, 로봇 시스템에 이러한 유연성을 주입하는 데 몇 가지 장애물이 있었습니다. 이러한 장애물에는 적용 가능한 데이터셋이 부족하여 많은 물체가 제한적이며, 로봇이 실제 세계에서 도구를 사용하는 것을 배우는 데 도움이 되는 포토리얼리스틱, 메시 기반 3D 모델을 생성하는 비용이 많이 듭니다. 또한 이러한 데이터셋은 비포토리얼리스틱 품질로 인해 로봇이 실제 세계에서 인식하는 것과 다르게 나타날 수 있습니다.

이를 해결하기 위해 미시간 대학교의 연구자들은 논문에서 NARF22: Neural Articulated Radiance Fields for Configuration-Aware Rendering이라는 제목의 2단계 파이프라인을 개발했습니다. 이 파이프라인은 실제 세계의 모양을 가진 유연한 NeRF 기반 객체를 생성하며, 이러한 객체의 이동 및 제한을 포함합니다.

NARF22 파이프라인은 두 단계로 구성됩니다. 첫 번째 단계에서는 도구의 정적 부분을 렌더링하고, 두 번째 단계에서는 이러한 부분을 movement 매개변수를 포함하는 두 번째 데이터셋으로 결합합니다. 출처: https://arxiv.org/pdf/2210.01166.pdf

NARF22 파이프라인은 두 단계로 구성됩니다. 첫 번째 단계에서는 도구의 정적 부분을 렌더링하고, 두 번째 단계에서는 이러한 부분을 movement 매개변수를 포함하는 두 번째 데이터셋으로 결합합니다. 출처: https://arxiv.org/pdf/2210.01166.pdf

시스템은 Neural Articulated Radiance Field 또는 NARF22라고 합니다.

NARF22

未知의 물체가 유연한지 여부를 결정하는 것은 거의 불가능한 양의 인간 지식이 필요합니다. 예를 들어, 닫힌 서랍을 본 적이 없다면,それは 다른 종류의 장식 패널로 보일 수 있습니다. 서랍을 여는 순간에 ‘서랍’이라는 개념이 형성되며, 이는 유연한 물체로 단일 축의 이동(앞뒤)을 가집니다.

따라서 NARF22는 탐색 시스템이 아닙니다. 이는 물체를 집어서 이동하는 부분이 있는지 확인하는 거의 원숭이 같은 행동입니다. 이는 여러 가지 재앙적인 시나리오를 초래할 수 있습니다. 대신, 이 프레임워크는 Universal Robot Description Format(URDF)에서 사용할 수 있는 지식을 기반으로 합니다. URDF는 오픈 소스 XML 기반 형식으로, 이 작업에 적합합니다. URDF 파일에는 물체의 이동 매개변수 및 물체의 부분에 대한 설명과 레이블이 포함됩니다.

従来의 파이프라인에서는 물체의 유연성 능력을 설명하고, 관련된 관절 값을 레이블해야 합니다. 이는 비싼 작업이며 쉽게 확장할 수 없습니다. 대신, NaRF22 워크플로는 물체의 개별 구성 요소를 렌더링한 다음, URDF에서 제공되는 이동 매개변수를 사용하여 정적 구성 요소를 유연한 NeRF 기반 표현으로 결합합니다.

프로세스의 두 번째 단계에서는 모든 부분을 포함하는 새로운 렌더러가 생성됩니다. 개별 부분을 먼저 연결하여 이 후의 단계를 건너뛰는 것이 더 쉬울 수 있지만, 연구자들은 최종 모델이 NVIDIA RTX 3080 GPU에서 AMD 5600X CPU하에 훈련되었으며, 역전파 동안 계산 요구가 낮습니다.

추가로, 두 번째 단계 모델은 연결된 조립보다 두 배 빠르며, 두 번째 단계 모델을 사용하여 정보에 액세스할 필요가 있는 모든 두 번째 응용 프로그램은 URDF 정보에 별도로 액세스할 필요가 없습니다. 이는 이미 최종 렌더러에 포함되어 있습니다.

데이터 및 실험

연구자들은 NARF22를 테스트하기 위해 여러 실험을 수행했습니다. 하나는 각 객체의 구성 및 포즈에 대한 질적 렌더링을 평가하기 위한 것이었으며, 다른 하나는 렌더링된 결과를 실제 세계 로봇이 본 관점과 비교하기 위한 양적 테스트였습니다. 또한 구성 추정 및 6 DOF(깊이 필드) 정교화를 위한 도전을 수행했습니다. 이는 NARF22를 사용하여 기울기 기반 최적화를 수행했습니다.

훈련 데이터는 이전 논문에서 일부 저자가 작성한 Progress Tools 데이터셋에서 가져왔습니다. Progress Tools에는 약 6,000개의 RGB-D 이미지(로봇 비전을 위한 깊이 정보 포함)가 포함되어 있으며, 640×480 해상도로 구성되어 있습니다. 사용된 장면에는 8개의 수동 도구가 포함되어 있으며, 이를 구성 요소로 나누어 메시 모델과 물체의 운동학적 속성(즉, 이동 방식 및 이동 매개변수)을 포함합니다.

Progress Tools 데이터셋에는 4개의 유연한 도구가 포함되어 있습니다. 위의 이미지는 NARF22의 NeRF 기반 렌더링입니다.

Progress Tools 데이터셋에는 4개의 유연한 도구가 포함되어 있습니다. 위의 이미지는 NARF22의 NeRF 기반 렌더링입니다.

이 실험에서는 라인맨 플라이어, 롱노즈 플라이어 및 클램프(위의 이미지 참조)를 사용하여 최종 구성 가능한 모델을 훈련했습니다. 훈련 데이터에는 클램프의 단일 구성 및 플라이어의 각 구성이 포함되어 있습니다.

NARF22의 구현은 FastNeRF를 기반으로 하며, 입력 매개변수를 수정하여 도구의 연결 및 공간적으로 인코딩된 포즈에 중점을 둡니다. FastNeRF는 요인화된 다층 퍼셉트론(MLP)와 보셀화된 샘플링 메커니즘(보셀은 3D 좌표를 갖는 픽셀과 유사하여 3D 공간에서 작동할 수 있음)을 사용합니다.

질적 테스트에서 연구자들은 클램프의 일부가 가려져 있는 것을 관찰합니다(즉, 중앙 지지대는 물체와 상호작용하지 않고는 알 수 없으며, 시스템이 이 ‘未知’ 기하학을 생성하는 데 어려움을 겪습니다.

도구의 질적 렌더링.

도구의 질적 렌더링.

반면에, 플라이어는 새로운 구성에 잘 일반화되었습니다(즉, 플라이어의 부분이 이동하고, 훈련 자료에서 명시적으로 다루지 않은 구성이지만, URDF 매개변수 내에서 이동할 수 있음).

연구자들은 플라이어의 레이블링 오류로 인해 렌더링 품질이 저하된 것을 관찰합니다. 이는 컴퓨터 비전 연구 분야에서 레이블링 논리, 예산 및 정확성과 관련된 더广泛한 문제입니다.

렌더링 정확도 테스트 결과.

렌더링 정확도 테스트 결과.

구성 추정 테스트에서 연구자들은 초기 ‘刚性’ 포즈에서 포즈 정교화 및 구성 추정을 수행했습니다. 또한 캐싱이나 FastNeRF 자체에서 사용되는 가속화 작업을 피했습니다.

그런 다음 17개의 잘 정렬된 장면을 Progress Tools의 테스트 세트에서 훈련했습니다. 150회의 기울기 하강 최적화를 수행했으며, Adam 옵티마이저를 사용했습니다. 이 절차는 구성 추정치를 ‘극도로 잘’ 회복했습니다.

구성 추정 테스트 결과.

구성 추정 테스트 결과.

 

最初에 2022년 10월 5일에 게시되었습니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai