Погляд Anderson

Розробка шляхів для сліпих за допомогою машинного навчання

mm
Додайте Unite.AI до бажаних джерел у Google

Нові дослідження з Німеччини пропонують нову, портативну систему на основі GPU, щоб допомогти людям з порушеннями зору орієнтуватися у реальному світі. Система вирішує одну з основних проблем реальних комп’ютерних візуальних рамок – ідентифікацію скла та інших прозорих перешкод.

У статті з Карлсруського інституту технологій описується конструкція системи, яку носить користувач, під назвою Trans4Trans, що складається з пари розумних окулярів, підключених до портативного корпусу GPU, фактично легкого ноутбука, який захоплює RGB- та глибинні зображення розміром 640×480 пікселів у безперервному потоці, який потім проходить через семантичну сегментаційну рамку.

Мобільні сенсори у системі Trans4Trans. Джерело: https://arxiv.org/pdf/2107.03172.pdf

Мобільні сенсори у системі Trans4Trans. Джерело: https://arxiv.org/pdf/2107.03172.pdf

Здатність системи до сенсорної зворотної зв’язку посилюється парою окулярів, що проводять звук крізь кістки, які видають акустичну зворотню зв’язку у відповідь на перешкоди довкілля.

Система Trans4Trans також була протестована на апаратному забезпеченні Microsoft HoloLens 2, досягнувши повної та послідовної сегментації (тобто розпізнавання) потенційно небезпечних перешкод, таких як скляні двері.

Trans4Trans на HoloLens 2.

Trans4Trans на HoloLens 2.

Архітектура

Trans4Trans використовує подвійний підхід, використовуючи як трансформер-орієнтований кодувальник і декодувальник, і використовуючи власний Модуль парування трансформерів (TPM), здатний агрегувати карти функцій, згенерованих вкладеннями густих розділів, тоді як трансформер-орієнтований декодувальник здатний послідовно розбирати карти функцій від свого парного кодувальника.

Архітектура Trans4Trans.

Архітектура Trans4Trans.

Кожен TPM складається з одного трансформер-орієнтованого шару, необхідного для низької витрати ресурсів і портативності системи. Декодувальник містить чотири симетричні стадії для кодувальника, з модулем TPM, призначеним для кожної. Система економить ресурси, інтегруючи функціональність кількох підходів у єдину систему, замість розгортання двох окремих моделей у лінійному робочому процесі.

Апаратне забезпечення

Окуляри, використані у системі, включають сенсор RealSense R200 RGB-D, тоді як господарська машина містить Jetson AGX Xavier NVIDIA GPU, призначений для вбудованих систем, і оснащений 384 ядрами NVIDIA CUDA та 48 ядрами Tensor.

R200 пропонує спекл-проєкцію та пасивне стереозведення, що робить його придатним для внутрішнього та зовнішнього середовища. Спекл-обладнання особливо корисне при оцінці прозорих поверхонь, оскільки воно посилює та уточнює надходящі візуальні дані без засліплення від екстремальних джерел світла. Інфрачервоні можливості сенсора також допомагають отримувати чітку геометрію та формувати діючі карти глибини, які є критичними для уникнення перешкод у контексті цілей проекту.

Запобігання когнітивної перевантаженості користувача

Система повинна знайти баланс між адекватною частотою даних і надмірною інформацією, оскільки користувач повинен бути здатний відрізняти довкілля послідовно через аудіо-зворотню зв’язку та вібраційну зворотню зв’язку.

Отже, Trans4Trans штучно обмежує обсяг даних зворотної зв’язку, з одним стандартним порогом, встановленим на один метр, а не примушує користувача вивчати різноманітні налаштування вібрації, які відповідають різним відстаням наближаються об’єктів та перешкод.

Тестування Trans4Trans

Система Trans4Trans була протестована на двох наборах даних, пов’язаних із сегментацією прозорих об’єктів: Trans10K-V2, з Університету Гонконгу ет аль, який містить 10 428 зображень прозорих об’єктів для валідації, навчання та тестування; і набір даних Stanford2D3D, який містить 70 496 зображень об’єктів змішаної прозорості, захоплених у роздільній здатності 1080×1080.

Зображення та відповідні маски з набору даних Trans10k. Джерело: https://arxiv.org/pdf/2101.08461.pdf

Зображення та відповідні маски з набору даних Trans10k. Джерело: https://arxiv.org/pdf/2101.08461.pdf

Система Stanford2D3D у дії. Джерело: http://buildingparser.stanford.edu/dataset.html

Система Stanford2D3D у дії. Джерело: http://buildingparser.stanford.edu/dataset.html

Під час тестування Trans4Trans також змогла сегментувати прозорі об’єкти, які були неправильно класифіковані ініціативою Trans2Seg Trans2Seg, випущеної на початку 2021 року тими ж дослідниками, при цьому вимагаючи менше GFLOPS для розрахунку та сегментації поверхонь.

На відміну від Trans2Seq, який використовує кодувальник на основі CNN та трансформер-орієнтований декодувальник, Trans4Trans використовує лише архітектуру трансформер-орієнтованого кодувальника-декодувальника, що перевершує попередній підхід і також суттєво покращує результати PVT.

Алгоритм також досягнув результатів рівня стану мистецтва для певної кількості прозорих класів, включаючи банку, вітрину, двері, чашку, коробку та бутылку.

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai