Andersons vinkel

Kartläggning av vägar för blinda med maskinlärande

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Ny forskning från Tyskland erbjuder ett nytt, GPU-baserat portabelt system för att hjälpa synskadade personer att navigera i den verkliga världen. Systemet löser en av de kärnutmaningarna i realtidsdatorseende-ramverk – identifiering av glas och andra transparenta hinder.

Artikeln från Karlsruhe Institute of Technology beskriver konstruktionen av ett användarbar system, benämnt Trans4Trans, som består av ett par smarta glasögon anslutna till en bärbar GPU-enhet, i princip en lätt laptop, som fångar RGB- och djupbilder i en kontinuerlig ström på 640×480 pixlar, som sedan körs genom ett semantiskt segmenteringsramverk.

De mobila sensorerna i Trans4Trans-riggen. Källa: https://arxiv.org/pdf/2107.03172.pdf

De mobila sensorerna i Trans4Trans-riggen. Källa: https://arxiv.org/pdf/2107.03172.pdf

Systemets sensoriska återkopplingsförmåga förbättras av ett par benledningshörlurar, som ger akustisk återkoppling som svar på miljöhinder.

Trans4Trans-systemet har också testats på Microsoft HoloLens 2-augmenteringsverklighetsriggen, med fullständig och konsekvent segmentering (dvs. igenkänning) av potentiellt farliga hinder som glasdörrar.

Trans4Trans som körs på HoloLens 2.

Trans4Trans som körs på HoloLens 2.

Arkitektur

Trans4Trans använder en dubbel tillvägagångssätt, med både en transformatorbaserad encoder och en decoder, och utnyttjar en egen Transformer Pairing Module (TPM) som kan samla funktionella kartor genererade av inbäddningar av täta partitioner, medan den transformatorbaserade decodern kan konsekvent tolka funktionella kartor från dess parade encoder.

Arkitekturen för Trans4Trans.

Arkitekturen för Trans4Trans.

Varje TPM består av ett enda transformatorbaserat lager, vilket är avgörande för det låga resursuttaget och systemets bärbarhet. Decodern innehåller fyra symmetriska stadier för encodern, med en TPM-modul tilldelad var och en. Systemet gör resurssparande genom att integrera funktionerna från flera tillvägagångssätt i ett sammanhängande system, i stället för att distribuera två separata modeller i en linjär arbetsflöde.

Maskinvara

Glasögonen i systemet innehåller en RealSense R200 RGB-D-sensor, medan värdmaskinen innehåller en Jetson AGX Xavier NVIDIA -GPU, utformad för inbäddade system, och som har 384 NVIDIA CUDA-kärnor och 48 Tensor-kärnor.

R200 erbjuder speckle-projicering och passiv stereo-matching, vilket gör det lämpligt för både inomhus- och utomhusmiljöer. Speckle-faciliteten är särskilt fördelaktig vid utvärdering av transparenta ytor, eftersom den förbättrar och klargör den inkommande visuella datan utan att bli bländad av extrema ljuskällor. Sensorens infraröda förmågor hjälper också till att erhålla distinkt geometri och forma handlingsbara djupkartor, som är avgörande för hinderundvikande i projektets syfte.

Förebyggande av kognitiv överbelastning för användaren

Systemet måste hitta en balans mellan adekvat datafrekvens och överdriven information, eftersom användaren måste kunna urskilja miljön sammanhängande genom akustisk återkoppling och vibrationsåterkoppling.

Följaktligen begränsar Trans4Trans artificiellt mängden återkopplingsdata, med en enda standardtröskel inställd på en meter, snarare än att tvinga användaren att lära sig en mängd olika vibrationsinställningar som motsvarar varierande avstånd till hinder och barriärer.

Testning av Trans4Trans

Trans4Trans-systemet testades på två datamängder som handlade om segmentering av transparenta objekt: Trans10K-V2, från University of Hong Kong et al, som innehåller 10 428 bilder av transparenta objekt för validering, utbildning och testning; och Stanford2D3D-datamängden, som innehåller 70 496 bilder av blandade transparenta objekt, som fångats i en upplösning på 1080×1080.

Bilder och motsvarande masker från Trans10k-datamängden. Källa: https://arxiv.org/pdf/2101.08461.pdf

Bilder och motsvarande masker från Trans10k-datamängden. Källa: https://arxiv.org/pdf/2101.08461.pdf

Stanford2D3D-systemet i aktion. Källa: http://buildingparser.stanford.edu/dataset.html

Stanford2D3D-systemet i aktion. Källa: http://buildingparser.stanford.edu/dataset.html

Vid testning kunde Trans4Trans också segmentera transparenta objekt som felklassificerades av Trans2Seg initiativet släppt i början av 2021 av samma forskare, medan det krävde färre GFLOPS för att beräkna och segmentera ytor.

Till skillnad från Trans2Seq, som använder en CNN-baserad encoder och en transformatorbaserad decoder, använder Trans4Trans endast en transformatorbaserad encoder-decoder-arkitektur, som överträffar det tidigare tillvägagångssättet och också förbättrar avsevärt på PVT.

Algoritmen uppnådde också state-of-the-art-resultat för ett visst antal transparenta klasser, inklusive burk, fönster, dörr, kopp, låda och flaska.

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai