ロボティクスとフィジカルAI
マシンラーニングモデルがオブジェクトの関係を理解する
マサチューセッツ工科大学(MIT)の研究者は、シーン内のオブジェクト間の根本的な関係を理解する新しいマシンラーニング(ML)モデルを開発しました。モデルは、個々の関係を1つずつ表現し、それらを組み合わせて全体のシーンを説明します。
この新しいアプローチにより、MLモデルはテキストの説明からより正確な画像を生成できます。さらに、シーンに複数のプロジェクトが異なる関係で配置されている場合でも、このモデルは画像を生成できます。
この新しい開発は重要です。なぜなら、多くのディープラーニングモデルは個々のオブジェクト間の複雑な関係を理解できないからです。
チームのモデルは、工業用ロボットが複数のステップを実行するタスク、たとえばアイテムの積み上げや家電製品の組み立てを行う場合に使用できます。また、機械が最終的に人間のように環境から学び、環境とやり取りすることができるようにもなります。
Yilun Duは、コンピュータサイエンスと人工知能研究所(CSAIL)の博士課程の学生であり、論文の共同リード著者です。Duは、CSAILの博士課程の学生であるShuang Liと、イリノイ大学アーバナ・シャンペーン校の大学院生であるNan Liuと共同で研究を主導しました。また、認知科学と計算のポール・E・ニュートン・キャリア・デベロップメント教授であるジョシュア・B・テネンバウムと、電気工学とコンピューターサイエンスのデルタ・エレクトロニクス教授であるアントニオ・トラルバも含まれていました。テネンバウムとトラルバは両方ともCSAILのメンバーです。
新しいフレームワーク
「私がテーブルを見たとき、XYZの位置にオブジェクトがあると言うことはできません。私たちの心はそういうふうに働きません。私たちがシーンを理解するとき、実際にはオブジェクト間の関係に基づいて理解しています。オブジェクト間の関係を理解できるシステムを構築することで、環境をより効果的に操作し、変更できるようになるのではないかと思います」とDuは述べました。
新しいフレームワークは、オブジェクトとその関係のテキストの説明に基づいてシーンの画像を生成できます。
システムはこれらの文を小さな部分に分割し、それぞれの個別の関係を記述します。各部分は個別にモデル化され、最適化プロセスを通じてシーンの画像が生成されます。
文を短い部分に分割することで、システムはそれらを別の方法で組み合わせることができ、以前には遭遇したことがないシーンの説明に適応できるようになります。
「他のシステムは、すべての関係を総合的に取り扱い、説明から画像を1回で生成します。しかし、这种アプローチは、より複雑な関係を含む説明に対しては機能しません。私たちのアプローチは、小さなモデルを組み合わせることで、より多くの関係をモデル化し、新しい組み合わせに適応できるようになります」とDuは述べました。
システムはこのプロセスを逆に実行することもできます。画像が入力された場合、シーン内のオブジェクト間の関係に一致するテキストの説明を見つけることができます。
モデルの評価
研究者は、人間に生成された画像が元のシーンの説明と一致するかどうかを評価するよう依頼しました。説明に3つの関係が含まれている場合、91%の参加者は、新しいモデルが他のディープラーニング方法よりも優れていると回答しました。
「私たちが発見した興味深いことは、私たちのモデルは、1つの関係の説明から2つ、3つ、または4つの関係の説明に増やしても、説明に正確に一致する画像を生成し続けることができるということです。他の方法は失敗します」とDuは述べました。
モデルは、以前には遭遇したことがない説明に対しても印象的な能力を示しました。
「これはとても約束のあることです。なぜなら、それは人間がどのように機能するかと近いからです。人間は数多くの例を見ただけで、有用な情報を抽出し、それらを組み合わせて無限の組み合わせを作ることができます。私たちのモデルには、より複雑なシーンや画像生成に一般化できるように、より少ないデータから学習するという特性があります」とLiは述べました。
チームは、より複雑な実世界の画像でモデルをテストし、最終的にロボティクスシステムにモデルを組み込む方法を探る予定です。












