Angle d’Anderson
Cartographier les chemins pour les aveugles avec l’apprentissage automatique

Des nouvelles recherches menées en Allemagne offrent un système portable novateur, alimenté par GPU, pour aider les personnes ayant une déficience visuelle à naviguer dans le monde réel. Le système répond à l’un des défis fondamentaux des cadres de vision par ordinateur en temps réel – l’identification des obstacles transparents tels que le verre et d’autres surfaces transparentes.
Le document, issu de l’Institut de technologie de Karlsruhe, décrit la construction d’un système porté par l’utilisateur, intitulé Trans4Trans, composé d’une paire de lunettes intelligentes connectées à un boîtier GPU portable, qui capture des images RGB et de profondeur à 640×480 pixels en continu, puis les fait passer par un cadre de segmentation sémantique.

Les capteurs mobiles du système Trans4Trans. Source: https://arxiv.org/pdf/2107.03172.pdf
Les capacités de rétroaction sensorielle du système sont renforcées par une paire de casques à conduction osseuse, qui émettent une rétroaction acoustique en réponse aux obstacles environnementaux.
Le système Trans4Trans a également été testé sur le casque de réalité augmentée Microsoft HoloLens 2, atteignant une segmentation complète et cohérente (c’est-à-dire la reconnaissance) des obstacles potentiellement dangereux tels que les portes en verre.

Trans4Trans fonctionnant sur le HoloLens 2.
Architecture
Trans4Trans utilise une approche double, utilisant à la fois un encodeur et un décodeur basés sur les transformateurs, et exploitant un module de couplage de transformateurs propriétaire (TPM) capable de rassembler les cartes de fonctionnalités générées par les embeddings de partitions denses, tandis que le décodeur basé sur les transformateurs est capable de parser de manière cohérente les cartes de fonctionnalités de son encodeur apparié.
Chaque TPM se compose d’une seule couche basée sur les transformateurs, essentielle pour la faible consommation de ressources et la portabilité du système. Le décodeur contient quatre étapes symétriques pour l’encodeur, avec un module TPM attribué à chacun. Le système réalise des économies de ressources en intégrant la fonctionnalité de plusieurs approches dans un système cohérent, au lieu de déployer deux modèles distincts dans un flux de travail linéaire.
Matériel
Les lunettes utilisées dans le système intègrent un capteur RGB-D RealSense R200, tandis que la machine hôte abrite un processeur graphique NVIDIA Jetson AGX Xavier, conçu pour les systèmes intégrés, et doté de 384 cœurs CUDA NVIDIA et 48 cœurs Tensor.
Le R200 offre une projection de speckle et un appariement stéréo passif, ce qui le rend adapté aux environnements intérieurs et extérieurs. La fonctionnalité de speckle est particulièrement bénéfique pour l’évaluation des surfaces transparentes, car elle augmente et clarifie les données visuelles entrantes sans être aveuglée par des sources de lumière extrêmes. Les capacités infrarouges du capteur aident également à obtenir une géométrie distincte et des cartes de profondeur actionnables, qui sont critiques pour l’évitement des obstacles, dans le contexte des objectifs du projet.
Prévention de la surcharge cognitive pour l’utilisateur
Le système doit trouver un équilibre entre la fréquence de données adéquate et les informations excessives, car le porteur doit être capable de distinguer l’environnement de manière cohérente grâce à la rétroaction audio et à la rétroaction vibrante.
Par conséquent, Trans4Trans limite artificiellement le volume de données de rétroaction, avec un seul seuil par défaut fixé à un mètre, plutôt que de forcer l’utilisateur à apprendre une variété de paramètres de vibration qui correspondent à des distances variables d’objets et de barrières environnants.
Test de Trans4Trans
Le système Trans4Trans a été testé sur deux jeux de données traitant de la segmentation d’objets transparents: Trans10K-V2, de l’Université de Hong Kong et al, qui contient 10 428 images d’objets transparents pour la validation, l’entraînement et les tests; et le jeu de données Stanford2D3D, qui contient 70 496 images d’objets de transparence mixte, capturées à une résolution de 1080×1080.

Images et masques correspondants du jeu de données Trans10k. Source: https://arxiv.org/pdf/2101.08461.pdf

Le système Stanford2D3D en action. Source: http://buildingparser.stanford.edu/dataset.html
Lors des tests, Trans4Trans a également pu segmenter des objets transparents qui avaient été mal classés par l’initiative Trans2Seg publiée au début de 2021 par les mêmes chercheurs, tout en nécessitant moins de GFLOPS pour calculer et segmenter les surfaces.
Contrairement à Trans2Seq, qui utilise un encodeur basé sur un CNN et un décodeur basé sur les transformateurs, Trans4Trans utilise uniquement une architecture d’encodeur-décodeur basée sur les transformateurs, surpassant l’approche précédente et améliorant considérablement les résultats de PVT.
L’algorithme a également obtenu des résultats à la pointe de la technologie pour un certain nombre de classes transparentes, notamment bouteille, porte, fenêtre, verre, boîte et bouteille.













