ロボティクスとフィジカルAI

「空間AI」への進歩により、ロボットが人間のように物理環境を認識できる

mm
Unite.AI を Google の優先ソースに追加

MITのエンジニアたちは、ロボットに高レベルのコマンドを実行させることを目指しており、そのためにはロボットが物理環境を人間のように認識できる能力が必要です。

MITの航空宇宙工学の助教授であるLuca Carloneは、「世界で何かを決定するには、周囲の環境についての精神的なモデルが必要です。これは人間にとって非常に簡単なことですが、ロボットにとっては痛みを伴う難しい問題です。ロボットはカメラで見たピクセル値を世界の理解に変換する必要があります。」

この課題に取り組むために、研究者たちは人間が物理環境を認識して移動する方法に基づいて、ロボットの空間認識の表現をモデル化しました。

3D Dynamic Scene Graphs

新しいモデルは3D Dynamic Scene Graphsと呼ばれ、ロボットが物理環境の3Dマップを生成し、物体やそのセマンティックラベルを含むことができます。ロボットはまた、人、部屋、壁、他の構造物を環境にマッピングすることができます。

このモデルにより、ロボットは3Dマップから情報を抽出して、物体、部屋、人の動きを特定することができます。

「この環境の圧縮表現は、ロボットが迅速に決定を下し、経路を計画できるようにするため、非常に役立ちます。これは私たちが人間として行うこととあまり変わらないことです。家からMITまでの経路を計画する必要がある場合、毎秒の位置を計画するのではなく、通りやランドマークのレベルで考えることで、より迅速に計画できます。」

カールーンによると、このモデルを使用するロボットは、家庭でのタスクだけでなく、高レベルのスキルや工場での作業、災害現場での救助活動など、さまざまな用途で使用できます。

https://www.youtube.com/watch?time_continue=39&v=SWbofjhyPzI&feature=emb_logo

Current Methods vs New Model

現在のロボットビジョンとナビゲーションの方法は、主に3Dマッピングに焦点を当てており、ロボットは環境を3Dでリアルタイムに再構築することができます。セマンティックセグメンテーションは、ロボットが環境の特徴をセマンティックオブジェクト(例:車と自転車)として分類するプロセスであり、通常は2D画像で実行されます。

新しく開発された空間認識のモデルは、最初のものであり、環境の3Dマップをリアルタイムに生成し、同時に3Dマップ内の物体、人、構造物にラベルを付けることができます。

この新しいモデルを実現するために、研究者たちはKimeraというオープンソースライブラリを使用しました。Kimeraは、以前同じチームによって開発され、環境の3D幾何学モデルを構築し、同時に物体が何であるか(例:椅子と机)をエンコードするために使用されました。

「私たちは、Kimeraを、3Dでマッピングとセマンティック理解のミックスにしたいと思いました。つまり、神話的な生物のように、異なる動物のミックスです。」

Kimeraは、ロボットのカメラ画像とセンサーからの慣性測定を使用して、シーンを3Dメッシュとしてリアルタイムに再構築しました。ロボットは、ミリオン枚の実世界画像で訓練されたニューラルネットワークを使用して、各ピクセルのラベルを予測し、レイキャスティングを使用して3Dに投影しました。

この技術を使用することで、ロボットの環境は、各面が色付けされて物体、構造物、または人を識別できる3Dメッシュとしてマッピングされます。

3D Mesh to 3D Dynamic “Scene Graphs”

3Dセマンティックメッシュモデルは、多くの計算能力と時間が必要であるため、研究者たちはKimeraを使用して、3Dダイナミック「シーングラフ」を生成するアルゴリズムを開発しました。

3Dセマンティックメッシュは、異なるセマンティックレイヤーに分割され、ロボットはシーンをレイヤーごとに表示できます。レイヤーは、物体や人から、開放的な空間や構造物、部屋、廊下、ホール、建物全体まで、さまざまなレベルで表現されます。

このレイヤー化方法により、ロボットは分析するポイントや面を絞り込むことができ、アルゴリズムは環境内の人の動きをリアルタイムで追跡できます。

新しいモデルは、写真のようにリアルなシミュレーターでテストされ、ロボットが動く人のいるオフィス環境をナビゲートすることができました。

「私たちは、ロボットに人間と同等の精神的なモデルを与えることを可能にしました。これは、自動運転車、救助活動、協調的な製造、家庭でのロボティクスなど、多くのアプリケーションに影響を与えるでしょう。」

カールーンは、MITの大学院生であるアントニ・ロシノールと共同で研究を行いました。

「私たちのアプローチは、ディープラーニングの最近の進歩と、同時ローカリゼーションとマッピングに関する数十年の研究のおかげで可能になりました。私たちは、ロボティクスと大規模な仮想現実と拡張現実における大きな潜在性を持つ、空間AIと呼ばれるロボット認識の新しい時代に向けての大きな一歩を踏み出しています。」

この研究は、ロボティクス:サイエンス・アンド・システムズ・バーチャル・カンファレンスで発表されました。

Alex McFarlandは、人工知能の最新の開発を探求するAIジャーナリスト兼ライターです。彼は、世界中の数多くのAIスタートアップや出版物と共同しています。