AIモデルとプラットフォーム

新しいテクニックでAIが3Dオブジェクトを識別する

mm
Unite.AI を Google の優先ソースに追加

ノースカロライナ州立大学の研究者が開発した新しいテクニックは、人工知能(AI)プログラムが3Dオブジェクトを識別する能力を向上させます。MonoConという名前のこのテクニックは、2D画像を使用して3Dオブジェクトが互いに空間でどのように関連しているかをAIに教えることもできます。

MonoConは、オンボードカメラから受信した2D画像を使用して自動運転車が他の車両を周囲でナビゲートするのを助けることができます。また、製造業やロボティクスでも役割を果たす可能性があります。

ティアンフー・ウーは、研究論文の対応著者であり、ノースカロライナ州立大学の電気電子工学の助教授です。

「私たちは3Dの世界に住んでいますが、写真を撮ると、その世界は2Dの画像として記録されます」とウーは述べています。

「AIプログラムはカメラからの視覚的な入力を受け取ります。したがって、AIが世界とやり取りするようにしたい場合は、2D画像が3D空間について何を伝えるかを解釈できるようにする必要があります。この研究では、その課題の1つの部分に焦点を当てています。つまり、2D画像内の3Dオブジェクト(例:人や車)をAIが正確に認識し、空間内に配置できるようにする方法を見つけることです」とウーは続けています。

自動運転車

自動運転車は、3D空間をナビゲートするためにLiDARを頻繁に使用します。LiDARは距離を測定するためにレーザーを使用するため、高価です。大量生産された運転手なし車に数十個のLiDARセンサーを搭載することは非常に高価です。

「しかし、自動運転車が視覚的な入力を使用して空間をナビゲートできる場合、冗長性を構築できます」とウーは述べています。「カメラはLiDARよりもはるかに安価なので、追加のカメラを搭載することは経済的に実行可能であり、システムをより安全で堅牢にすることができます。

「これは1つの実用的な応用例ですが、私たちが最も興奮しているのは、この研究の基本的な進歩です。2Dオブジェクトから3Dデータを取得できるということです」

AIのトレーニング

MonoConは、2D画像内の3Dオブジェクトを識別し、それを「バウンディングボックス」に配置することができます。バウンディングボックスは、AIにオブジェクトの外側の辺を示します。

「私たちの仕事が異なるのは、AIをトレーニングする方法です。これは、以前のトレーニング技術を基にしています。以前の努力と同様に、AIをトレーニングするときに、オブジェクトを3Dバウンディングボックスに配置します。ただし、カメラからオブジェクトまでの距離とバウンディングボックスの寸法を予測するだけでなく、ボックスの8つの点の位置と2次元での中心からの距離を予測するようにAIに求めます。これを「補助コンテキスト」と呼びます。これにより、AIは2D画像に基づいて3Dオブジェクトをより正確に識別および予測できるようになります。

「提案された方法は、測度論の定理であるCramér-Wold定理によって動機づけられています。また、コンピュータビジョンの他の構造化出力予測タスクにも適用可能です」

MonoConは、広く使用されているベンチマークデータセットであるKITTIでテストされました。

「当時私たちがこの論文を提出したとき、MonoConは2D画像から自動車の3Dデータを抽出することを目的とした数十の他のAIプログラムよりも優れておりました」とウーは述べています。

チームは今後、大規模なデータセットでこのプロセスを拡大することを計画しています。

「今後は、大規模なデータセットでこのプロセスを拡大し、自動運転でのMonoConの使用を評価および微調整することです。また、ロボティックアームの使用などのタスクのパフォーマンスを向上させるために、製造業での応用を探ることも計画しています」とウーは述べています。

Alex McFarlandは、人工知能の最新の開発を探求するAIジャーナリスト兼ライターです。彼は、世界中の数多くのAIスタートアップや出版物と共同しています。