Andersonの視点
ロボットにツールについて教えるためのニューラル・ラディエンス・フィールド(NeRF)

ミシガン大学の新しい研究は、ロボットがツールやその他の実世界の可動物体のメカニズムを理解する方法を提供しています。NeRF(ニューラル・ラディエンス・フィールド)オブジェクトを作成することで、これらの物体の動き方を示し、ロボットがこれらの物体とやり取りし、使用できるようにします。

ツール(または適切な参照を持つ任意の物体)の内部動きに関する既知の参照元を使用して、NARF22はツールとその動き範囲および動作タイプの写実的な近似を合成できます。ソース:https://progress.eecs.umich.edu/projects/narf/
歩行者を避けたり、詳細にプログラムされたルーチンを実行したりする以外のタスクを実行する必要があるロボットは、これらの物体と同じ材料や物体を扱うために、このような適応能力が必要です。
これまで、ロボットシステムにこのような汎用性を与えるには、いくつかの障害がありました。適用可能なデータセットの少なさ、多くのデータセットが非常に限られた数の物体を特集していること、写真写実的な3Dモデルを生成するための費用の高さ、適切なデータセットがあっても、ロボットが世界で認識する物体から離れて見えることなどです。
これに対処するために、ミシガン大学の研究者は、論文で説明されているように、2段階のパイプラインを開発しました。このパイプラインでは、NeRFベースの可動物体を作成し、実世界の物体の動きと制限を組み込みます。

NARF22パイプラインの2つの段階は、動くツールの静的な部分をレンダリングし、次にこれらの要素を動きのパラメータを含む2番目のデータセットに組み合わせることです。ソース:https://arxiv.org/pdf/2210.01166.pdf
NARF22
未知の物体が可動物体であるかどうかを判断するには、ほぼ信じられないほど多くの人間の前提知識が必要です。例えば、閉じた引き出しを見たことがなければ、それは装飾パネルであるかもしれないと思われます。実際に開けたときに初めて、「引き出し」という可動物体が内部に軸を持っていることを理解します。
したがって、NARF22は、物体を掴んで可動部分があるかどうかを確認するための探索システムではありません。代わりに、Universal Robot Description Format(URDF)に基づいています。URDFは、オープンソースのXMLベースのフォーマットで、広く適用可能であり、タスクに適しています。URDFファイルには、物体の動きのパラメータと、物体の部分の説明やラベルが含まれます。
従来のパイプラインでは、物体の可動性を記述し、関連するジョイント値をラベル付けする必要があります。これは、安価でスケーラブルなタスクではありません。代わりに、NARF22のワークフローでは、物体の個々のコンポーネントをレンダリングし、URDFから提供された動きのパラメータを使用して、静的なコンポーネントを可動NeRFベースの表現に組み合わせます。

プロセスの2段階目では、すべてのパーツを組み込んだ新しいレンダラーが作成されます。個々のパーツを早期に連結してこのステップをスキップすることは簡単かもしれませんが、研究者は、NVIDIA RTX 3080 GPUとAMD 5600X CPUでトレーニングされた最終モデルの計算要求が、バックプロパゲーション中に低いことを観察しています。
さらに、2段階目のモデルは、連結された「無理矢理」の組み立ての2倍の速度で実行され、静的なモデルのパーツに関する情報を必要とする二次的なアプリケーションは、URDF情報にアクセスする必要はありません。なぜなら、URDF情報はすでに最終段階のレンダラーに組み込まれているからです。
データと実験
研究者は、NARF22をテストするためにいくつかの実験を実施しました。物体の構成と姿勢のための質的レンダリングを評価する実験、レンダリングされた結果を実世界のロボットが見る視点と比較するための量的テスト、NARF22を使用してグラデーションに基づく最適化を実行する構成推定と6自由度(深度)精製課題のデモンストレーションです。
トレーニングデータは、以前の論文の著者によって作成されたProgress Toolsデータセットから取得されました。Progress Toolsには、約6,000のRGB-D画像(640×480解像度)が含まれています。使用されたシーンには、8つのハンドツールが含まれており、それぞれがその部分に分割されており、メッシュモデルと物体の運動学的特性(動きのパラメータ)に関する情報が含まれています。

Progress Toolsデータセットには4つの可動ツールが含まれています。上の画像は、NARF22からのNeRFベースのレンダリングです。
この実験では、最終的な構成可能なモデルは、ラインマンのプライヤー、ロングノーズプライヤー、クランプ(上の画像参照)のみを使用してトレーニングされました。トレーニングデータには、クランプの1つの構成と、プライヤー各1つが含まれていました。
NARF22の実装は、FastNeRFに基づいています。入力パラメータは、ツールの連結されたおよび空間的に符号化された姿勢に集中するように変更されています。FastNeRFは、因子化された多層パーセプトロン(MLP)とボクセル化されたサンプリングメカニズム(ボクセルは、3D座標を持つピクセルであるため、3D空間で動作できます)を使用します。
質的テストでは、研究者は、クランプのいくつかの部分(中心のスパインなど)が隠れており、システムがこの「未知」の幾何学的形状を作成するのに苦労していることを観察しています。

ツールの質的レンダリング。
一方、プライヤーは、新しい構成(トレーニング資料に明示的に記載されていないが、URDFパラメータ内にあるもの)にうまく一般化しました。
研究者は、プライヤーのラベル付けエラーがレンダリングの品質を低下させ、特にツールの先端の詳細な部分に悪影響を与えたことを観察しています。これは、コンピュータビジョン研究分野におけるラベル付けの論理、予算、精度に関するより広範な懸念に関連しています。

レンダリング精度テストの結果。
構成推定テストでは、研究者は、初期の「剛体」姿勢からポーズの精製と構成推定を実行し、FastNeRF自体が使用するキャッシングや加速ワークアラウンドを使用しませんでした。
次に、研究者は、テストセットの17のシーンをトレーニング中に保持し、150回の勾配降下最適化をアダム最適化器で実行しました。この手順により、構成推定が「非常にうまく」回復したと研究者は述べています。

結果から構成推定テスト。
2022年10月5日に初めて公開されました。












