Andersons vinkel
Kartlagning af veje for blinde med maskinlæring

Nyt forskning fra Tyskland tilbyder et nyt, GPU-drevet bærbart system til at hjælpe synshandicappede mennesker med at navigere i den virkelige verden. Systemet løser en af de centrale udfordringer i realtids-computer-vision-rammer – identifikation af glas og andre gennemsigtige hindringer.
Den artikel, fra Karlsruhe Institute of Technology, beskriver opbygningen af et bruger-båret system, kaldet Trans4Trans, bestående af et par smarte briller forbundet til en bærbar GPU-kasse, effektivt en letvægts-laptop, som optager RGB- og dybdebilleder i en kontinuerlig strøm på 640×480 pixel, som derefter køres gennem en semantisk segmenterings-ramme.

De mobile sensorer i Trans4Trans-riggen. Kilde: https://arxiv.org/pdf/2107.03172.pdf
Systemets sanselige feedback-funktioner er forbedret af et par knogle-ledende hovedtelefoner, som udsender akustisk feedback i respons til miljø-hindringer.
Trans4Trans-systemet er også blevet testet på Microsoft HoloLens 2-augmented reality-riggen, hvor det opnåede fuldstændig og konsekvent segmentering (dvs. genkendelse) af potentielt farlige hindringer som glasdøre.

Trans4Trans kører på HoloLens 2.
Arkitektur
Trans4Trans bruger en dobbelt tilgang, ved at bruge både en transformer-baseret encoder og en decoder, og udnytter en proprietær Transformer Pairing Module (TPM) i stand til at samle funktioner genereret af indlejring af tætte partitioner, mens den transformer-baserede decoder kan konsekvent parse funktioner fra dens parret encoder.
Hver TPM består af et enkelt transformer-baseret lag, essentiel for den lave ressource-forbrug og bærebarens portabilitet. Decoderen indeholder fire symmetriske stadier for encoderen, med en TPM-modul tilknyttet hvert. Systemet opnår ressourcesbesparelse ved at integrere funktionaliteten af flere tilgange i et samlet system, i stedet for at implementere to separate modeller i en lineær arbejdsgang.
Hardware
Brillene i systemet indeholder en RealSense R200 RGB-D-sensor, mens værten maskine huser en Jetson AGX Xavier NVIDIA GPU, designet til indlejrede systemer, og med 384 NVIDIA CUDA-kerner og 48 Tensor-kerner.
R200 tilbyder spekle-projicering og passiv stereo-matching, hvilket gør det egnet til indendørs- og udendørs-miljøer. Spekle-faciliteten er af særlig fordel ved evaluering af gennemsigtige overflader, da den supplerer og klargører den indgående visuelle data uden at blive blindet af ekstreme lyskilder. Sensorens infrarøde egenskaber hjælper også med at opnå distinkt geometri og formulerbar dybde-kort, som er kritiske for hindrings-undgåelse i sammenhæng med projektets formål.
Forebyggelse af kognitiv overbelastning for brugeren
Systemet skal opnå en balance mellem tilstrækkelig datafrekvens og overmæssig information, da brugeren skal kunne skelne miljøet sammenhængende gennem akustisk feedback og vibrations-feedback.
Derfor begrænser Trans4Trans kunstigt mængden af feedback-data, med en enkelt standard-threshold sat til en meter, i stedet for at tvinge brugeren til at lære en række vibrations-indstillinger, der svarer til varierende afstande af nært-forestående objekter og hindringer.
Test af Trans4Trans
Trans4Trans-systemet er blevet testet på to datasæt, der handler om segmentering af gennemsigtige objekter: Trans10K-V2, fra University of Hong Kong et al, som indeholder 10.428 billeder af gennemsigtige objekter til validering, træning og test; og Stanford2D3D-datasættet, som indeholder 70.496 billeder af blandede gennemsigtige objekter, optaget i 1080×1080 opløsning.

Billeder og tilhørende masker fra Trans10k-datasættet. Kilde: https://arxiv.org/pdf/2101.08461.pdf

Stanford2D3D-systemet i aktion. Kilde: http://buildingparser.stanford.edu/dataset.html
Ved test, var Trans4Trans også i stand til at segmentere gennemsigtige objekter, der var misclassificeret af Trans2Seg initiativet udgivet i starten af 2021 af samme forskere, mens det krævede færre GFLOPS til at beregne og segmentere overfladerne.
I modsætning til Trans2Seq, som anvender en CNN-baseret encoder og transformer-baseret decoder, anvender Trans4Trans kun transformer-baseret encoder-decoder-arkitektur, overgår den tidligere tilgang og forbedrer også væsentligt på PVT.
Algoritmen opnåede også state-of-the-art-resultater for et bestemt antal gennemsigtige klasser, herunder glas, vindue, dør, kop, kasse og flaske.













