Взгляд Anderson

Создание путей для слепых с помощью машинного обучения

mm
Добавьте Unite.AI в избранные источники в Google

Новое исследование из Германии предлагает новую, портативную систему на основе GPU, чтобы помочь людям с нарушением зрения ориентироваться в реальном мире. Система решает одну из основных проблем реальных компьютерных зрительных рамок – определение стекла и других прозрачных препятствий.

В статье из Института технологий Карлсруэ описывается конструкция носимой системы, называемой Trans4Trans, состоящей из пары умных очков, подключенных к портативному корпусу GPU, по сути, легкому ноутбуку, который захватывает RGB- и глубинные изображения размером 640×480 пикселей в непрерывном потоке, который затем проходит через семантическую сегментацию.

Мобильные датчики в системе Trans4Trans. Источник: https://arxiv.org/pdf/2107.03172.pdf

Мобильные датчики в системе Trans4Trans. Источник: https://arxiv.org/pdf/2107.03172.pdf

Возможности системы по обратной связи сенсоров усиливаются парой костных наушников, которые издают акустическую обратную связь в ответ на препятствия окружающей среды.

Система Trans4Trans также была протестирована на аугментированной реальности Microsoft HoloLens 2, достигнув полной и последовательной сегментации (т.е. распознавания) потенциально опасных препятствий, таких как стеклянные двери.

Trans4Trans на HoloLens 2.

Trans4Trans на HoloLens 2.

Архитектура

Trans4Trans использует двойной подход, используя как трансформер-энкодер, так и декодер, и использует проприетарный Модуль парной трансформации (TPM), способный объединять карты функций, сгенерированные вложениями плотных разделов, в то время как трансформер-декодер может последовательно анализировать карты функций из своего парного энкодера.

Архитектура Trans4Trans.

Архитектура Trans4Trans.

Каждый TPM состоит из одного трансформер-слоя, необходимого для низкого расхода ресурсов и портативности системы. Декодер содержит четыре симметричных стадии для энкодера, с модулем TPM, назначенным каждому. Система экономит ресурсы, интегрируя функциональность нескольких подходов в одну систему, вместо того, чтобы развертывать две отдельные модели в линейном рабочем процессе.

Аппаратное обеспечение

Очки, используемые в системе, включают сенсор RealSense R200 RGB-D, а хост-машина содержит Jetson AGX Xavier NVIDIA GPU, предназначенный для встроенных систем, и оснащенный 384 ядрами NVIDIA CUDA и 48 ядрами Tensor.

R200 предлагает проекционное распределение и пассивное стереосопоставление, что делает его подходящим для внутренних и внешних сред. Возможность спекл-распределения особенно полезна при оценке прозрачных поверхностей, поскольку она дополняет и уточняет входящие визуальные данные без ослепления от экстремальных источников света. Инфракрасные возможности датчика также помогают получить четкую геометрию и сформировать действенные карты глубины, которые имеют решающее значение для избежания препятствий в контексте целей проекта.

Предотвращение когнитивной перегрузки для пользователя

Система должна найти баланс между достаточной частотой данных и чрезмерной информацией, поскольку носителю необходимо иметь возможность различать окружающую среду последовательно через аудио- и вибрационную обратную связь.

Следовательно, Trans4Trans искусственно ограничивает объем данных обратной связи, с одним порогом по умолчанию, установленным на один метр, а не заставляет пользователя учиться множеству настроек вибрации, соответствующих разным расстояниям нависающих объектов и барьеров.

Тестирование Trans4Trans

Система Trans4Trans была протестирована на двух наборах данных, связанных с сегментацией прозрачных объектов: Trans10K-V2, из Университета Гонконга et al, который содержит 10 428 изображений прозрачных объектов для проверки, обучения и тестирования; и набор данных Stanford2D3D, который содержит 70 496 изображений объектов смешанной прозрачности, снятых с разрешением 1080×1080.

Изображения и соответствующие маски из набора данных Trans10k. Источник: https://arxiv.org/pdf/2101.08461.pdf

Изображения и соответствующие маски из набора данных Trans10k. Источник: https://arxiv.org/pdf/2101.08461.pdf

Система Stanford2D3D в действии. Источник: http://buildingparser.stanford.edu/dataset.html

Система Stanford2D3D в действии. Источник: http://buildingparser.stanford.edu/dataset.html

При тестировании Trans4Trans также смогла сегментировать прозрачные объекты, которые были неправильно классифицированы в Trans2Seg инициативе, выпущенной в начале 2021 года теми же исследователями, при этом требуя меньше операций для расчета и сегментации поверхностей.

В отличие от Trans2Seq, который использует энкодер на основе CNN и трансформер-декодер, Trans4Trans использует только архитектуру трансформер-энкодер-декодер, превосходящую предыдущий подход и значительно улучшающую PVT.

Алгоритм также достиг государственных результатов для определенного количества прозрачных классов, включая банку, окно, дверь, чашку, коробку и бутылку.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai