Anderson의 관점

시각 장애인을 위한 기계 학습 경로 매핑

mm
Unite.AI를 Google의 선호 소스에 추가

독일의 새로운 연구에서 GPU를 사용하는 휴대용 시스템을 제안하여 시각 장애인들이 현실 세계에서 탐색할 수 있도록 도와줍니다. 이 시스템은 실시간 컴퓨터 비전 프레임워크에서 하나의 핵심적인 도전 과제인 유리 및 기타 투명 장애물의 식별을 해결합니다.

카를스루에 공과大学의 논문에 따르면, Trans4Trans라는 사용자 착용 시스템이 개발되었으며, 스마트 안경과 휴대용 GPU 케이스가 연결되어 있습니다. 이 시스템은 640×480 픽셀의 RGB와 깊이 이미지의 연속적인 스트림을 캡처하고, 이를 의미론적 분할 프레임워크를 통해 실행합니다.

Trans4Trans 리그의 모바일 센서. 출처: https://arxiv.org/pdf/2107.03172.pdf

Trans4Trans 리그의 모바일 센서. 출처: https://arxiv.org/pdf/2107.03172.pdf

시스템의 감각 피드백 기능은 두 개의 골수 전도형 이어폰으로 강화되며, 환경 장애물에 대한 음향 피드백을 제공합니다.

Trans4Trans 시스템은 또한 Microsoft HoloLens 2 증강 현실 리그에서 테스트되었으며, 유리문과 같은 잠재적으로 위험한 장애물의 완전한 및 일관된 분할(즉, 인식)을 달성했습니다.

HoloLens 2에서 실행되는 Trans4Trans.

HoloLens 2에서 실행되는 Trans4Trans.

아키텍처

Trans4Trans는 두 가지 접근 방식을 사용합니다. 하나는 트랜스포머 기반 인코더와 디코더를 사용하며, 다른 하나는 특허받은 트랜스포머 페어링 모듈(TPM)을 사용합니다. TPM은 밀도 분할의 임베딩에 의해 생성된 피처 맵을 수집할 수 있으며, 트랜스포머 기반 디코더는 일관되게 피처 맵을 분석할 수 있습니다.

Trans4Trans의 아키텍처.

Trans4Trans의 아키텍처.

각 TPM은 하나의 트랜스포머 기반 레이어로 구성되어 있으며, 시스템의 낮은 자원 소모와 휴대성을 가능하게 합니다. 디코더에는 4개의 대칭 단계가 있으며, 각 단계에 TPM 모듈이 할당됩니다. 시스템은 여러 접근 방식의 기능을 하나의 일관된 시스템으로 통합하여 자원 소모를 줄입니다.

하드웨어

시스템에서 사용되는 안경에는 RealSense R200 RGB-D 센서가 내장되어 있으며, 호스트 머신에는 Jetson AGX Xavier NVIDIA GPU가 내장되어 있습니다. 이 GPU는 384개의 NVIDIA CUDA 코어와 48개의 텐서 코어를 갖추고 있으며, 임베디드 시스템을 위한 설계입니다.

R200은 스펙클 프로젝팅과 패시브 스테레오 매칭을 제공하며, 내부 및 외부 환경에서 사용할 수 있습니다. 스펙클 시설은 특히 투명한 표면을 평가할 때 유용하며, 극단적인 광원으로 인해 시야가 방해받지 않습니다. 센서의 적외선 기능은 또한 프로젝트의 목적을 위해 필수적인 깊이 맵과 형태를 얻는 데 도움이 됩니다.

사용자 인지 과부하 방지

시스템은 사용자가 음향 피드백과 진동 피드백을 통해 환경을 일관되게 식별할 수 있도록 데이터 빈도와 과도한 정보 사이의 균형을 유지해야 합니다.

따라서 Trans4Trans는 피드백 데이터의 볼륨을 인공적으로 제한하며, 기본 임계값을 1미터로 설정하여 사용자가 다양한 거리와 장애물에 대한 진동 설정을 학습할 필요가 없습니다.

Trans4Trans 테스트

Trans4Trans 시스템은 투명한 객체의 분할에 관한 두 개의 데이터셋에서 테스트되었습니다. 하나는 홍콩 대학의 Trans10K-V2이며, 10,428개의 투명한 객체 이미지로 구성되어 있으며, 검증, 훈련 및 테스트를 위해 사용됩니다. 다른 하나는 스탠퍼드 2D3D 데이터셋으로, 70,496개의混合 투명성 객체 이미지를 포함하며, 1080×1080 해상도로 캡처되었습니다.

Trans10k 데이터셋의 이미지와 해당 마스크. 출처: https://arxiv.org/pdf/2101.08461.pdf

Trans10k 데이터셋의 이미지와 해당 마스크. 출처: https://arxiv.org/pdf/2101.08461.pdf

Stanford2D3D 시스템 동작. 출처: http://buildingparser.stanford.edu/dataset.html

Stanford2D3D 시스템 동작. 출처: http://buildingparser.stanford.edu/dataset.html

테스트에서 Trans4Trans는 또한 2021년 초에 같은 연구자들에 의해 발표된 Trans2Seg 이니셔티브에서 잘못 분류된 투명한 객체를 분할할 수 있었습니다. 또한 Trans2Seq와 달리 트랜스포머 기반 인코더-디코더 아키텍처만을 사용하여 이전 접근 방식을 능가하고 PVT를 크게 개선했습니다.

알고리즘은 또한 특정 투명 클래스에 대한 최첨단 결과를 달성했으며, , , , , 박스을 포함합니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai