Andersonův úhel

Mapování cest pro nevidomé s pomocí strojového učení

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Nový výzkum z Německa nabízí novou, GPU-poháněnou přenosnou systém, který pomáhá lidem se zrakovým postižením navigovat ve skutečném světě. Systém řeší jednu z hlavních výzev v reálném počítačovém vidění – identifikaci skla a dalších průhledných překážek.

Článek článku z Karlsruhe Institute of Technology popisuje konstrukci nositelného systému, nazvaného Trans4Trans, který se skládá z páru chytrých brýlí spojených s přenosným GPU pouzdrem, což je vlastně lehký laptop, který zachycuje RGB a hloubkové obrázky v nepřetržitém proudu, který je pak zpracován pomocí sémantického segmentačního rámce.

Mobilní senzory v systému Trans4Trans. Zdroj: https://arxiv.org/pdf/2107.03172.pdf

Mobilní senzory v systému Trans4Trans. Zdroj: https://arxiv.org/pdf/2107.03172.pdf

Systémové schopnosti senzorické zpětné vazby jsou zvýšeny pomocí páru kostěných sluchátek, která emitují akustickou zpětnou vazbu v reakci na environmentální překážky.

Systém Trans4Trans byl také testován na Microsoft HoloLens 2 augmentovaném realitě, dosáhl úplného a konzistentního segmentování (tj. rozpoznání) potenciálně nebezpečných překážek, jako jsou skleněné dveře.

Systém Trans4Trans běžící na HoloLens 2.

Systém Trans4Trans běžící na HoloLens 2.

Architektura

Systém Trans4Trans používá dvojí přístup, využívající jak transformer-založený encoder a decoder, a využívající proprietární Transformer Pairing Module (TPM) schopný sbírat feature mapy generované embeddings hustých partií, zatímco transformer-založený decoder je schopen konzistentně analyzovat feature mapy ze svého spárovaného encoderu.

Architektura systému Trans4Trans.

Architektura systému Trans4Trans.

Každý TPM se skládá z jediné transformer-založené vrstvy, která je nezbytná pro nízkou spotřebu zdrojů a přenositelnost systému. Decoder obsahuje čtyři symetrické fáze pro encoder, s TPM modulem přiřazeným ke každé. Systém šetří zdroje integrující funkčnost více přístupů do koherentního systému, místo nasazení dvou samostatných modelů v lineárním pracovním postupu.

Hardwarová část

Brýle používané v systému zahrnují RealSense R200 RGB-D senzor, zatímco hostitelská stroj obsahuje Jetson AGX Xavier NVIDIA GPU, navržen pro vestavěné systémy, a vybavený 384 NVIDIA CUDA jádry a 48 Tensor jádry.

R200 nabízí speckle projecting a pasivní stereo odpovídání, což z něj činí vhodný pro vnitřní a vnější prostředí. Speckle zařízení je zvláště výhodné při hodnocení průhledných povrchů, protože zvyšuje a zjasňuje přicházející vizuální data bez oslepení extrémními světelnými zdroji. Infrasoundové schopnosti senzoru také pomáhají získat odlišnou geometrii a vytvořit akční hloubkové mapy, které jsou kritické pro vyhýbání se překážkám, v kontextu cílů projektu.

Předcházení kognitivnímu přetížení uživatele

Systém musí najít rovnováhu mezi dostatečnou frekvencí dat a nadměrnou informací, protože uživatel musí být schopen rozlišit prostředí koherentně prostřednictvím akustické a vibrací zpětné vazby.

V důsledku toho systém Trans4Trans uměle omezuje objem zpětné vazby dat, s jednou výchozí prahovou hodnotou nastavenou na jeden metr, místo toho, aby uživatel musel naučit řadu vibrací, které odpovídají různým vzdálenostem se blížících objektů a překážek.

Testování Trans4Trans

Systém Trans4Trans byl testován na dvou datech týkajících se segmentace průhledných objektů: Trans10K-V2, z University of Hong Kong et al, který obsahuje 10 428 obrázků průhledných objektů pro validaci, trénování a testování; a Stanford2D3D dataset, který obsahuje 70 496 obrázků smíšených transparentních objektů, zachycených v rozlišení 1080×1080.

Obrázky a odpovídající masky z datasetu Trans10k. Zdroj: https://arxiv.org/pdf/2101.08461.pdf

Obrázky a odpovídající masky z datasetu Trans10k. Zdroj: https://arxiv.org/pdf/2101.08461.pdf

Systém Stanford2D3D v akci. Zdroj: http://buildingparser.stanford.edu/dataset.html

Systém Stanford2D3D v akci. Zdroj: http://buildingparser.stanford.edu/dataset.html

Při testování byl systém Trans4Trans také schopen segmentovat průhledné objekty, které byly špatně klasifikovány Trans2Seg iniciativou vydanou na začátku roku 2021 stejnými výzkumníky, zatímco vyžadoval méně GFLOPS pro výpočet a segmentaci povrchů.

Naproti tomu Trans2Seq, který využívá CNN-založený encoder a transformer-založený decoder, systém Trans4Trans používá pouze transformer-založenou encoder-decoder architekturu, která překonává předchozí přístup a také výrazně zlepšuje PVT.

Algoritmus také dosáhl nejlepších výsledků pro určitý počet transparentních tříd, včetně sklenice, okna, dveře, šálku, krabice a láhve.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai