Andersonの視点

機械学習で盲導をサポートするパスのマッピング

mm
Unite.AI を Google の優先ソースに追加

ドイツの新しい研究では、GPUを搭載した携帯可能なシステムを開発し、視覚障害者の現実世界での移動をサポートしています。このシステムは、リアルタイムコンピュータビジョンフレームワークにおけるコアの課題である、ガラスやその他の透明な障害物の識別に対処しています。

カールスルーエ工科大学の論文では、Trans4Transと呼ばれるユーザーが着用するシステムの構築について説明しています。このシステムは、スマートグラスと携帯可能なGPUケース(実質的に軽量のラップトップ)で構成されており、640×480ピクセルで連続してRGBと深度画像をキャプチャし、セマンティックセグメンテーションフレームワークで処理します。

Trans4Transのモバイルセンサー。ソース:https://arxiv.org/pdf/2107.03172.pdf

Trans4Transのモバイルセンサー。 ソース:https://arxiv.org/pdf/2107.03172.pdf

システムの感覚フィードバック機能は、骨伝導式ヘッドフォンによって強化され、環境の障害物に対して音響フィードバックを出力します。

Trans4Transシステムはまた、Microsoft HoloLens 2の拡張現実リグでテストされ、危険な障害物であるガラスドアの完全かつ一貫したセグメンテーション(認識)を達成しました。

HoloLens 2で動作するTrans4Trans.

HoloLens 2で動作するTrans4Trans.

アーキテクチャ

Trans4Transは、トランスフォーマーをベースにしたエンコーダーとデコーダーの両方を使用し、特有のトランスフォーマーペアリングモジュール(TPM)を活用して、密なパーティションの埋め込みによって生成される特徴マップを結合し、トランスフォーマーベースのデコーダーは一貫してペアのエンコーダーからの特徴マップを解析します。

Trans4Transのアーキテクチャ

Trans4Transのアーキテクチャ

各TPMは、システムの低リソース消費と携帯性に不可欠な、トランスフォーマーベースの1層で構成されています。デコーダーには、エンコーダーに対して4つの対称ステージがあり、各ステージにTPMモジュールが割り当てられています。システムは、複数のアプローチの機能を1つの統一されたシステムに統合することでリソースを節約し、線形ワークフローで2つの個別のモデルを展開するのではなく、1つのモデルを使用します。

ハードウェア

システムで使用されるグラスには、RealSense R200 RGB-Dセンサーが組み込まれています。一方、ホストマシンには、Jetson AGX Xavier NVIDIA GPUが搭載されており、組み込みシステム用に設計されており、384個のNVIDIA CUDAコアと48個のTensorコアを備えています。

R200は、スパークル投影とパッシブステレオマッチングを提供し、屋内および屋外の環境に適しています。スパークル投影機能は、特に透明な表面の評価において、入力される視覚データを強化し、明るい光源によって目がくらむことを防ぐため、特に有益です。センサーの赤外線機能も、障害物回避の重要な要素である、明確な幾何学的形状と有効な深度マップを取得するのに役立ちます。

ユーザーの認知負荷を防ぐ

システムは、十分なデータ頻度と過剰な情報のバランスを取る必要があります。ユーザーは、環境を音響フィードバックと振動フィードバックを通じて一貫して認識できる必要があるためです。

したがって、Trans4Transは、デフォルトのしきい値を1メートルに設定し、ユーザーがさまざまな距離の近づく物体や障害物に対応するさまざまな振動設定を学習することを強制するのではなく、フィードバックデータの量を人為的に制限します。

Trans4Transのテスト

Trans4Transシステムは、透明な物体のセグメンテーションに関する2つのデータセットでテストされました:香港大学Trans10K-V2、およびスタンフォード大学のStanford2D3Dデータセットです。Trans10K-V2データセットには、10,428枚の透明な物体の画像が収録されており、検証、トレーニング、テストに使用されます。一方、Stanford2D3Dデータセットには、1080×1080の解像度で撮影された、混合透明度の物体の70,496枚の画像が収録されています。

Trans10kデータセットの画像と対応するマスク。ソース:https://arxiv.org/pdf/2101.08461.pdf

Trans10kデータセットの画像と対応するマスク。 ソース:https://arxiv.org/pdf/2101.08461.pdf

スタンフォード2D3Dシステムの動作。ソース:http://buildingparser.stanford.edu/dataset.html

スタンフォード2D3Dシステムの動作。 ソース:http://buildingparser.stanford.edu/dataset.html

テストでは、Trans4Transは、2021年初頭に同じ研究者によってリリースされたTrans2Segイニシアチブによって誤分類された透明な物体をセグメンテーションすることもできました。また、表面をセグメンテーションするために必要なGFLOPSも少なくしました。

Trans2Seqと異なり、Trans4Transは、CNNベースのエンコーダーとトランスフォーマーベースのデコーダーを使用しますが、Trans4Transはトランスフォーマーベースのエンコーダーとデコーダーのみを使用し、以前のアプローチを上回り、PVTも大幅に改善しました。

アルゴリズムは、ジャードアカップボトルなどの特定の透明クラスの数に対して、最先端の結果を達成しました。

トランスフォーマーベースのデコーダーを使用するTrans4Transは、以前のアプローチを上回り、PVTも大幅に改善しました。アルゴリズムは、特定の透明クラスの数に対して最先端の結果を達成し、ジャードアカップボトルなどの物体を識別しました。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai