Модели и платформы ИИ

Новая Техника Помогает ИИ Определить 3D Объекты

mm
Добавьте Unite.AI в избранные источники в Google

Новая техника, разработанная исследователями Университета Северной Каролины, улучшает способность программ искусственного интеллекта (ИИ) определять 3D объекты. Называемая MonoCon, эта техника также помогает ИИ учиться, как 3D объекты соотносятся друг с другом в пространстве, используя 2D изображения.

MonoCon потенциально может иметь широкий спектр применения, включая помощь автономным транспортным средствам ориентироваться вокруг других транспортных средств, используя 2D изображения, полученные от бортовой камеры. Она также может сыграть роль в производстве и робототехнике.

Тяньфу У является основным автором исследовательской работы и помощником профессора электротехники и компьютерных наук в Университете Северной Каролины.

“Мы живем в 3D мире, но когда вы делаете фотографию, она записывает этот мир в 2D изображении”, – говорит У.

“Программы ИИ получают визуальную информацию от камер. Итак, если мы хотим, чтобы ИИ взаимодействовал с миром, мы должны обеспечить, чтобы он мог интерпретировать, что 2D изображения могут рассказать ему о 3D пространстве. В этом исследовании мы сосредоточены на одной части этой задачи: как мы можем получить ИИ, чтобы точно распознавать 3D объекты – такие как люди или машины – в 2D изображениях и размещать эти объекты в пространстве”, – продолжает У.

Автономные Транспортные Средства

Автономные транспортные средства часто полагаются на лидар для навигации в 3D пространстве. Лидар, который использует лазеры для измерения расстояния, является дорогим, что означает, что автономные системы не включают много резервных копий. Чтобы поставить десятки лидар-датчиков на массово производимую беспилотную машину, было бы невероятно дорого.

“Но если автономное транспортное средство могло бы использовать визуальные входные данные для навигации через пространство, вы могли бы построить резервные копии”, – говорит У. “Поскольку камеры значительно менее дорогие, чем лидар, было бы экономически целесообразно включить дополнительные камеры – построив резервные копии в систему и сделав ее более безопасной и более прочной.

“Это один из практических применений. Однако мы также взволнованы фундаментальным прогрессом этой работы: что возможно получить 3D данные из 2D объектов.”

Обучение ИИ

MonoCon может определить 3D объекты в 2D изображениях, прежде чем размещать их в “ограничивающей рамке”, которая говорит ИИ о внешних границах объекта.

“То, что отличает нашу работу, – это то, как мы обучаем ИИ, что строится на предыдущих методах обучения”, – говорит У. “Как и предыдущие усилия, мы размещаем объекты в 3D ограничивающих рамках во время обучения ИИ. Однако, кроме того, что мы просим ИИ предсказать расстояние от камеры до объекта и размеры ограничивающих рамок, мы также просим ИИ предсказать местоположение каждой из восьми точек рамки и ее расстояние от центра ограничивающей рамки в двух измерениях. Мы называем это “вспомогательным контекстом” и обнаружили, что это помогает ИИ более точно определять и предсказывать 3D объекты на основе 2D изображений.

“Предлагаемый метод мотивирован хорошо известным теоремой в теории мер, теоремой Крамера-Вольда. Он также потенциально применим к другим задачам предсказания структурированных выходов в компьютерном зрении.”

MonoCon была протестирована с помощью широко используемого эталонного набора данных под названием KITTI.

“В момент подачи этой статьи MonoCon показала лучшие результаты, чем десятки других программ ИИ, направленных на извлечение 3D данных об автомобилях из 2D изображений”, – говорит У.

Команда теперь будет работать над масштабированием процесса с более крупными наборами данных.

“Двигаясь вперед, мы масштабируем это и работаем с более крупными наборами данных, чтобы оценить и доработать MonoCon для использования в автономном вождении”, – говорит У. “Мы также хотим изучить применения в производстве, чтобы увидеть, сможем ли мы улучшить производительность задач, таких как использование роботизированных рук.”

Алекс Макфарленд - журналист и писатель в области искусственного интеллекта, исследующий последние разработки в этой области. Он сотрудничал с многочисленными стартапами и изданиями в области искусственного интеллекта во всем мире.