Лидеры мнений

Внутреннее определение местоположения пользователя с помощью визуального распознавания мест

mm
Добавьте Unite.AI в избранные источники в Google

Визуальное распознавание мест является одним из основополагающих элементов разработки компьютерного зрения и робототехники. Задача алгоритмов ВРЗ состоит в том, чтобы определить осмотренные места на основе изображений. Эта технология может поддерживать автономных роботов и человеческие рабочие силы, определяя окружающую среду и облегчая выполнение желаемых действий.

Исследователи в NeuroSYS используют алгоритмы компьютерного зрения в рамках разработанной платформы AR, Nsflow, позволяющей выполнять интерактивные инструкции и практическое обучение для определения позиций пользователей во время обучения на месте. В этом случае использование ВРЗ приводит к значительному ускорению процессов настройки и обучения из-за снижения потребности в предварительном обучении и надзоре.

Определение местоположения человека или поиск желаемого места с помощью GPS уже не является новостью. Но что делать, когда спутниковая система навигации не работает? Системы внутренней навигации (IPS) приходят на помощь.

Когда вы ищете иголку в стоге сена, вы можете использовать различные методы, включая маяки, магнитное позиционирование, блоки измерения инерции (IMU) с акселерометрами и гироскопами, измеряющие движение от последней известной точки, позиционирование на основе Wi-Fi или просто – использовать визуальные маркеры.

Все вышеуказанные методы имеют свои недостатки (например, необходимость установки маркеров или маяков, IMU увеличивает ошибку измерения со временем и требует повторного позиционирования), которые перевешивают их преимущества. Решение, отвечающее на эту важную проблему – общее местоположение пользователя с точностью до нескольких метров – оказывается в области алгоритмов.

Процесс распознавания мест основан на двухэтапной процедуре, создающей две базы данных. Первоначально целевое место фотографируется, и определенные элементы, ключевые точки, маркируются детектором особенностей для определения характерных элементов области. Затем помеченные точки сравниваются с эталонным изображением. Как только оцененные ключевые точки считаются достаточно похожими по сравнению с особенностью, изображение квалифицируется как показывающее одно и то же место.

База данных изображений объединяет изображения целевых мест, в данном случае рабочих пространств, и набор их свойств, включая уникальные идентификаторы, за которыми следуют локальные и глобальные дескрипторы. Другой набор, база данных комнат, сопоставляет отдельные ключевые точки с определенными областями в рассматриваемом пространстве.

Используя SuperPoint, SuperGlue и netVLAD нейронные сети из области визуального распознавания мест, исследователи использовали вышеуказанный процесс в локализации пользователей. Глубокие нейронные сети SuperPoint и SuperGlue сотрудничают в обнаружении особенностей и сопоставлении, извлекая информацию из баз данных.

Глобальные дескрипторы выходят на сцену

Процесс требует глобальных дескрипторов, которые служат векторами, различающими место, определяющими области таким образом, что не вызывает двусмысленностей. Чтобы выполнить свою роль, векторы должны быть независимыми от освещения и точки зрения – независимо от перспективы и условий освещения, глобальные дескрипторы не должны оставлять сомнений при различении мест на различных изображениях.

Кроме того, переменные объекты, присутствующие в области интереса, не должны быть связаны глобальными дескрипторами в качестве особенностей, определяющих места. Предметы, такие как мебель и оборудование, подвержены изменениям (перестановка, демонтаж), что означает, что они не могут определять области своим присутствием.

Компьютерное распознавание мест с помощью визуального распознавания мест основано на постоянных элементах осмотренных мест, таких как двери, окна, лестницы и другие характерные элементы долгосрочного характера. Во время исследования в вопросе использовалась глубокая нейронная сеть NetVLAD для расчетов, представляющая в результате векторы, удовлетворяющие заданным требованиям. В процессе сопоставления глобальных дескрипторов обрабатываются изображения наиболее похожих векторов, следующих за расчетом расстояния между каждой характерной точкой.

При обработке двух баз данных – базы данных комнат и другой, содержащей ключевые точки и глобальные дескрипторы – система работает с атрибутами изображений. После оценки сходства и наименьших расстояний вторая нейронная сеть, SuperGlue, определяет изображения мест. Система, использующая ВРЗ, позволяет локализовать пользователя на основе, кратко говоря, количества совпадающих ключевых точек.

Алгоритмы нашли применение в платформе AI и AR, помогающей пользователям выполнять обучение, оснащенное умными очками. ВРЗ позволяет локализовать обучающихся на рабочем месте, запуская соответствующие уроки и руководства, назначенные для определенных мест, улучшая безопасность и снижая потребность в прямом надзоре.

Проект финансируется из фондов Европейского Союза в рамках программы оперативного развития регионов “Умный рост”. Проект реализуется в рамках Национального центра исследований и развития: Быстрый путь.

Jowita Kessler - это энтузиаст технологий из Польши, работающий в качестве специалиста по контент-маркетингу в NeuroSYS. Задержанный читатель и писатель, посвященный стиранию барьера между гуманитарными науками и технологиями. Частно: мечтатель днем и ночью, поклонник кошек и летучих мышей.