Робототехника и физический ИИ

Прорыв в «Пространственно-ИИ» Позволяет Роботам Воспринимать Физические Окружения Как Люди

mm
Добавьте Unite.AI в избранные источники в Google

Инженеры в MIT работают над тем, чтобы дать роботам возможность выполнять высокоуровневые команды, такие как перемещение в другую комнату, чтобы получить предмет для человека. Для этого роботы должны иметь возможность воспринимать свои физические окружения подобно тому, как это делают люди.

Лука Карлоне – помощник профессора аэронавтики и астронавтики в MIT.

«Чтобы принять любое решение в мире, вам нужно иметь умственную модель окружающей среды», – говорит Карлоне. «Это что-то такое простое для людей. Но для роботов это очень трудная проблема, где речь идет о преобразовании пиксельных значений, которые они видят через камеру, в понимание мира».

Чтобы решить эту задачу, исследователи смоделировали представление пространственного восприятия для роботов на основе того, как люди воспринимают и ориентируются в своих физических окружениях.

3D Динамические Сценические Графы

Новая модель называется 3D Динамическими Сценическими Графами, и она позволяет роботу генерировать 3D-карту его физического окружения, включая объекты и их семантические метки. Робот также может картографировать людей, комнаты, стены и другие структуры в окружении.

Затем модель позволяет роботу извлекать информацию из 3D-карты, информацию, которая может быть использована для локализации объектов, комнат и движения людей.

«Это сжатое представление окружения полезно, потому что оно позволяет нашему роботу быстро принимать решения и планировать свой путь», – говорит Карлоне. «Это не слишком далеко от того, что мы делаем как люди. Если вам нужно спланировать путь от вашего дома до MIT, вы не планируете каждую отдельную позицию, которую вам нужно занять. Вы просто думаете на уровне улиц и ориентиров, что помогает вам планировать ваш маршрут быстрее».

По словам Карлоне, роботы, которые полагаются на эту модель, смогут делать гораздо больше, чем просто домашние задачи. Они также могут быть использованы для высокоуровневых навыков и работать вместе с людьми на фабриках или помогать находить выживших на месте катастрофы.

https://www.youtube.com/watch?time_continue=39&v=SWbofjhyPzI&feature=emb_logo

Текущие Методы vs Новая Модель

Текущие методы робототехнического зрения и навигации в основном фокусируются на 3D-картировании, которое позволяет роботам реконструировать свою окружение в трех измерениях в реальном времени, или семантической сегментации, которая происходит, когда роботы классифицируют особенности окружения как семантические объекты, такие как машина против велосипеда. Семантическая сегментация часто выполняется на 2D-изображениях.

Недавно разработанная модель пространственного восприятия является первой своей KIND, которая генерирует 3D-карту окружения в реальном времени и метки объектов, людей и структур внутри 3D-карты одновременно.

Чтобы достичь этой новой модели, исследователи полагались на Kimera, открытую библиотеку. Kimera была ранее разработана той же командой для построения 3D геометрической модели окружения, одновременно кодируя, что объект, вероятно, является, например, стулом против стола.

«Как мифическое существо, которое является смесью разных животных, мы хотели, чтобы Kimera была смесью картографирования и семантического понимания в 3D», – говорит Карлоне.

Kimera использовала изображения с камеры робота и инерционные измерения с бортовых датчиков для реконструкции сцены как 3D-сетки в реальном времени. Для этого Kimera использовала нейронную сеть, обученную на миллионах реальных изображений. Затем она могла предсказать метку каждого пикселя и использовать рей-кasting, чтобы проецировать их в 3D.

Благодаря использованию этого метода окружение робота может быть картографировано в трехмерной сетке, где каждая грань цветовая, идентифицирующая ее как часть объектов, структур или людей в окружении.

3D Сетка в 3D Динамические «Сценические Графы»

Поскольку 3D семантическая сеточная модель требует много вычислительной мощности и является трудоемкой, исследователи использовали Kimera для разработки алгоритмов, которые привели к 3D динамическим «сценическим графам».

3D семантическая сетка разбивается на отдельные семантические слои, и робот может затем просматривать сцену через слой. Слои варьируются от объектов и людей до открытых пространств и структур, до комнат, коридоров, залов и целых зданий.

Этот метод слоев позволяет роботу сузить фокус, а не анализировать миллиарды точек и граней. Этот метод слоев также позволяет алгоритмам отслеживать людей и их движение в окружении в реальном времени.

Новая модель была протестирована в фотореалистичном симуляторе, который имитирует робота, навигирующего в офисной среде с движущимися людьми.

«Мы по сути ermögаем роботам иметь умственные модели, подобные тем, которые используют люди», – говорит Карлоне. «Это может повлиять на многие приложения, включая самоходные автомобили, поиск и спасение, совместное производство и домашнюю робототехнику».

Карлоне был присоединен к ведущему автору и аспиранту MIT Антони Росинолу.

«Наш подход стал возможным благодаря недавним достижениям в глубоком обучении и десятилетиям исследований по одновременной локализации и картографированию», – говорит Росинол. «С этой работой мы делаем шаг к новой эре робототехнического восприятия, называемой пространственно-ИИ, которая находится в своем младенчестве, но имеет большой потенциал в робототехнике и крупномасштабной виртуальной и дополненной реальности».

Исследование было представлено на конференции «Робототехника: Наука и системы» в виртуальном формате.

Алекс Макфарленд - журналист и писатель в области искусственного интеллекта, исследующий последние разработки в этой области. Он сотрудничал с многочисленными стартапами и изданиями в области искусственного интеллекта во всем мире.