Andersons vinkel

Kartlegging av stier for blinde med maskinlæring

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Ny forskning fra Tyskland tilbyr et nytt, GPU-drevet bærbart system for å hjelpe synshemmede mennesker å navigere i den virkelige verden. Systemet løser en av de kjerneproblemene i sanntids datavisjonsrammeverk – identifisering av glass og andre gjennomsiktige hindringer.

Artikkelen, fra Karlsruhe Institute of Technology, detaljerer konstruksjonen av et bruker-bårent system, kalt Trans4Trans, bestående av et par smarte briller koblet til en bærbar GPU-kasse, effektivt en lettvekt laptop, som fanger RGB- og dybdebilder på 640×480 piksler i en kontinuerlig strøm, som deretter kjøres gjennom et semantisk segmenteringsrammeverk.

De mobile sensorer i Trans4Trans-riggen. Kilde: https://arxiv.org/pdf/2107.03172.pdf

De mobile sensorer i Trans4Trans-riggen. Kilde: https://arxiv.org/pdf/2107.03172.pdf

Systemets sansefeedback-egenskaper er forbedret av et par knokkelsenderhørtøy, som sender akustisk feedback i respons til miljøhindringer.

Trans4Trans-systemet er også testet på Microsoft HoloLens 2 augmented reality-riggen, og har oppnådd fullstendig og konsekvent segmentering (dvs. gjenkjenning) av potensielt farlige hindringer som glassdører.

Trans4Trans kjører på HoloLens 2.

Trans4Trans kjører på HoloLens 2.

Arkitektur

Trans4Trans bruker en dobbel tilnærming, ved å bruke både en transformator-basert encoder og en decoder, og utnytter en proprietær Transformer Pairing Module (TPM) som kan samle funksjonskarter generert av innlegg av tette partisjoner, mens transformator-basert decoder kan konsekvent parse funksjonskarter fra dens parrede encoder.

Arkitekturen til Trans4Trans.

Arkitekturen til Trans4Trans.

Hver TPM består av ett enkelt transformator-basert lag, essensielt for lav ressursdrain og bærbart system. Dekoderen inneholder fire symmetriske stadier for encoderen, med en TPM-modul tilordnet hver. Systemet gjør ressursbesparelse ved å integrere funksjonaliteten til flere tilnærminger i et sammenhengende system, i stedet for å deployere to separate modeller i en lineær arbeidsflyt.

Maskinvare

Brillene som brukes i systemet inkorporerer en RealSense R200 RGB-D-sensor, mens vertsmaskinen huset en Jetson AGX Xavier NVIDIA GPU, designet for innbygde systemer, og med 384 NVIDIA CUDA-kjerner og 48 Tensor-kjerner.

R200 tilbyr spekkel-projeksjon og passiv stereo-matching, som gjør det egnet for indre og ytre miljøer. Spekkel-fasiliteten er av særlig nytte ved evaluering av gjennomsiktige overflater, siden den augmenterer og klargjør innkommende visuelle data uten å bli blindet av ekstreme lyskilder. Sensorens infrarøde egenskaper hjelper også til å oppnå distinkt geometri og form aktivt dybdekart, som er kritisk for hindringsunngåelse, i sammenheng med prosjektets mål.

Forebygging av kognitiv overbelastning for brukeren

Systemet må finne en balanse mellom adekvat datafrekvens og eksessiv informasjon, siden brukeren må kunne skille miljøet sammenhengende gjennom akustisk feedback og vibrasjonsfeedback.

Derfor begrenser Trans4Trans kunstig volumet av feedback-data, med en enkelt standard terskel satt til en meter, i stedet for å tvinge brukeren til å lære en rekke vibrasjonsinnstillinger som korresponderer med varierende avstander til hinder og barrierer.

Testing av Trans4Trans

Trans4Trans-systemet er testet på to datasett som omhandler segmentering av gjennomsiktige objekter: Trans10K-V2, fra University of Hong Kong et al, som inneholder 10 428 bilder av gjennomsiktige objekter for validering, trening og testing; og Stanford2D3D-datasettet, som inneholder 70 496 bilder av blandede gjennomsiktige objekter, fanget i 1080×1080-oppløsning.

Bilder og korresponderende masker fra Trans10k-datasettet. Kilde: https://arxiv.org/pdf/2101.08461.pdf

Bilder og korresponderende masker fra Trans10k-datasettet. Kilde: https://arxiv.org/pdf/2101.08461.pdf

Stanford2D3D-systemet i aksjon. Kilde: http://buildingparser.stanford.edu/dataset.html

Stanford2D3D-systemet i aksjon. Kilde: http://buildingparser.stanford.edu/dataset.html

I testing, var Trans4Trans også i stand til å segmentere gjennomsiktige objekter som ble feil klassifisert av Trans2Seg initiativet utgitt i begynnelsen av 2021 av samme forskere, mens det krever færre GFLOPS for å beregne og segmentere overflatene.

I motsetning til Trans2Seq, som bruker en CNN-basert encoder og transformator-basert decoder, bruker Trans4Trans kun transformator-basert encoder-decoder-arkitektur, og overgår den tidligere tilnærmingen og forbedrer også betydelig på PVT.

Algoritmen oppnådde også state-of-the-art resultater for et bestemt antall gjennomsiktige klasser, inkludert jar, vindu, dør, kopp, boks og flaske.

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai