Unghiul lui Anderson

Cartografierea căilor pentru nevăzători cu Machine Learning

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Noi cercetări din Germania oferă un sistem portabil inovator, bazat pe GPU, pentru a ajuta persoanele cu deficiențe de vedere să navigheze în lumea reală. Sistemul abordează una dintre provocările principale ale cadrului de lucru de viziune computerizată în timp real – identificarea sticlei și a altor obstacole transparente.

Articolul publicat de Institutul de Tehnologie din Karlsruhe, detaliază construcția unui sistem purtat de utilizator, intitulat Trans4Trans, care constă dintr-o pereche de ochelari inteligenți conectați la o carcasă portabilă de GPU, efectiv un laptop ușor, care captează imagini RGB și adâncime la 640×480 de pixeli într-un flux continuu, care este apoi procesat printr-un cadru de segmentare semantică.

Senzorii mobili din sistemul Trans4Trans. Sursă: https://arxiv.org/pdf/2107.03172.pdf

Senzorii mobili din sistemul Trans4Trans. Sursă: https://arxiv.org/pdf/2107.03172.pdf

Capacitățile de feedback senzorial ale sistemului sunt îmbunătățite de o pereche de căști cu conducție osoasă, care emit feedback acustic în răspuns la obstacolele din mediu.

Sistemul Trans4Trans a fost testat și pe dispozitivul de realitate augmentată Microsoft HoloLens 2, obținând o segmentare completă și coerentă (adică recunoaștere) a obstacolelor potențial periculoase, cum ar fi ușile de sticlă.

Trans4Trans rulează pe HoloLens 2.

Trans4Trans rulează pe HoloLens 2.

Arhitectură

Trans4Trans utilizează o abordare duală, folosind atât un encoder bazat pe transformator și un decodator, și folosind un modul de cuplare de transformator proprietar (Transformer Pairing Module ) capabil să colecteze hărți de caracteristici generate de încorporările de partiții dense, în timp ce decodatorul bazat pe transformator este capabil să parseze consistent hărțile de caracteristici de la encoderul său pereche.

Arhitectura Trans4Trans.

Arhitectura Trans4Trans.

Fiecare TPM constă dintr-un singur strat bazat pe transformator, esențial pentru scurgerea redusă de resurse și portabilitatea sistemului. Decodatorul conține patru etape simetrice pentru encoder, cu un modul TPM atribuit fiecăruia. Sistemul realizează economii de resurse prin integrarea funcționalității mai multor abordări într-un sistem coerent, în loc de a utiliza două modele separate într-un flux de lucru liniar.

Hardware

Ochelarii utilizați în sistem incorporează un senzor RGB-D RealSense R200, în timp ce mașina gazdă conține un Jetson AGX Xavier NVIDIA GPU, proiectat pentru sisteme înglobate, și dotat cu 384 de nuclei CUDA NVIDIA și 48 de nuclei Tensor.

R200 oferă proiectare de puncte și împerechere stereo pasivă, făcându-l potrivit pentru medii interioare și exterioare. Facilitatea de proiectare a punctelor este deosebit de benefică în evaluarea suprafețelor transparente, deoarece îmbunătățește și clarifică datele vizuale intrate fără a fi orbit de surse de lumină extreme. Capabilitățile infrarosii ale senzorului ajută, de asemenea, la obținerea unei geometrii distincte și a unor hărți de adâncime care pot fi puse în aplicare, care sunt esențiale pentru evitarea obstacolelor, în contextul obiectivelor proiectului.

Prevenirea suprasarcinii cognitive pentru utilizator

Sistemul trebuie să găsească un echilibru între frecvența adecvată a datelor și informații excesive, deoarece purtătorul trebuie să poată distinge mediul coerent prin intermediul feedback-ului audio și al vibrațiilor.

Prin urmare, Trans4Trans limitează artificial volumul de date de feedback, cu un singur prag implicit setat la un metru, în loc de a forța utilizatorul să învețe o varietate de setări de vibrație care corespund cu distanțele diferite ale obiectelor și barierelor care se apropie.

Testarea Trans4Trans

Sistemul Trans4Trans a fost testat pe două seturi de date care se ocupă de segmentarea obiectelor transparente: Trans10K-V2, de la Universitatea din Hong Kong et al, care conține 10.428 de imagini cu obiecte transparente pentru validare, antrenament și testare; și setul de date Stanford2D3D, care conține 70.496 de imagini cu obiecte de transparență mixtă, capturate la o rezoluție de 1080×1080.

Imagini și măști corespunzătoare din setul de date Trans10k. Sursă: https://arxiv.org/pdf/2101.08461.pdf

Imagini și măști corespunzătoare din setul de date Trans10k. Sursă: https://arxiv.org/pdf/2101.08461.pdf

Sistemul Stanford2D3D în acțiune. Sursă: http://buildingparser.stanford.edu/dataset.html

Sistemul Stanford2D3D în acțiune. Sursă: http://buildingparser.stanford.edu/dataset.html

În testare, Trans4Trans a fost, de asemenea, capabil să segmenteze obiecte transparente care au fost clasificate greșit de Trans2Seg inițiativa lansată la începutul anului 2021 de aceiași cercetători, în timp ce necesită mai puține GFLOPS pentru a calcula și segmenta suprafețele.

În contrast cu Trans2Seq, care utilizează un encoder bazat pe CNN și un decodator bazat pe transformator, Trans4Trans utilizează doar o arhitectură de encoder-decodator bazată pe transformator, depășind abordarea anterioară și îmbunătățind semnificativ PVT.

Algoritmul a obținut, de asemenea, rezultate de ultimă generație pentru un anumit număr de clase transparente, incluzând borcan, geam, ușă, pahar, cutie și sticlă.

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai