Ângulo de Anderson

Mapeando Caminhos para Cegos com Aprendizado de Máquina

mm
Adicione Unite.AI às suas fontes preferidas no Google

Nova pesquisa da Alemanha oferece um sistema portátil inovador, alimentado por GPU, para ajudar pessoas com deficiência visual a navegar no mundo real. O sistema aborda um dos principais desafios dos quadros de visão computacional em tempo real – a identificação de obstáculos transparentes, como vidro.

O artigo, do Instituto de Tecnologia de Karlsruhe, detalha a construção de um sistema que o usuário pode usar, intitulado Trans4Trans, consistindo em um par de óculos inteligentes conectados a um invólucro portátil de GPU, efetivamente um laptop leve, que captura imagens RGB e de profundidade em 640×480 pixels em um fluxo contínuo, que é então processado por um quadro de segmentação semântica.

Os sensores móveis no conjunto Trans4Trans. Fonte: https://arxiv.org/pdf/2107.03172.pdf

Os sensores móveis no conjunto Trans4Trans. Fonte: https://arxiv.org/pdf/2107.03172.pdf

As capacidades de realimentação sensorial do sistema são reforçadas por um par de fones de ouvido de condução óssea, que emitem feedback acústico em resposta a obstáculos ambientais.

O sistema Trans4Trans também foi testado no conjunto de realidade aumentada Microsoft HoloLens 2, alcançando segmentação completa e consistente (ou seja, reconhecimento) de obstruções potencialmente perigosas, como portas de vidro.

Trans4Trans em execução no HoloLens 2.

Trans4Trans em execução no HoloLens 2.

Arquitetura

Trans4Trans usa uma abordagem dupla, utilizando tanto um codificador baseado em transformador e um decodificador, e aproveitando um módulo de emparelhamento de transformador (TPM) proprietário capaz de coletar mapas de recursos gerados pelas incorporações de partições densas, enquanto o decodificador baseado em transformador é capaz de analisar consistentemente mapas de recursos de seu codificador emparelhado.

A arquitetura do Trans4Trans.

A arquitetura do Trans4Trans.

Cada TPM consiste em uma camada baseada em transformador única, essencial para o baixo drenagem de recursos e portabilidade do sistema. O decodificador contém quatro estágios simétricos para o codificador, com um módulo TPM atribuído a cada. O sistema economiza recursos integrando a funcionalidade de várias abordagens em um sistema coerente, em vez de implantar dois modelos separados em um fluxo de trabalho linear.

Hardware

Os óculos usados no sistema incorporam um sensor RGB-D RealSense R200, enquanto a máquina hospedeira abriga um Jetson AGX Xavier NVIDIA GPU, projetado para sistemas embarcados, e apresentando 384 núcleos CUDA NVIDIA e 48 núcleos Tensor.

O R200 oferece projeção de speckle e correspondência estéreo passiva, tornando-o adequado para ambientes interiores e exteriores. A facilidade de speckle é de particular benefício na avaliação de superfícies transparentes, pois aumenta e esclarece os dados visuais de entrada sem ser cegado por fontes de luz extremas. As capacidades de infravermelho do sensor também ajudam a obter geometria distinta e formar mapas de profundidade ação, que são críticos para evitar obstáculos, no contexto dos objetivos do projeto.

Prevenindo Sobrecarga Cognitiva para o Usuário

O sistema precisa equilibrar a frequência de dados adequada e informações excessivas, pois o usuário precisa ser capaz de distinguir o ambiente coherentemente por meio de feedback acústico e vibração.

Consequentemente, Trans4Trans limita artificialmente o volume de dados de feedback, com um único limiar padrão definido para um metro, em vez de forçar o usuário a aprender uma variedade de configurações de vibração que correspondam a distâncias variadas de objetos e barreiras iminentes.

Testando Trans4Trans

O sistema Trans4Trans foi testado em dois conjuntos de dados que lidam com a segmentação de objetos transparentes: Trans10K-V2, da Universidade de Hong Kong et al, que contém 10.428 imagens de objetos transparentes para validação, treinamento e teste; e o conjunto de dados Stanford2D3D, que contém 70.496 imagens de objetos de transparência mista, capturados em resolução 1080×1080.

Imagens e máscaras correspondentes do conjunto de dados Trans10k. Fonte: https://arxiv.org/pdf/2101.08461.pdf

Imagens e máscaras correspondentes do conjunto de dados Trans10k. Fonte: https://arxiv.org/pdf/2101.08461.pdf

O sistema Stanford2D3D em ação. Fonte: http://buildingparser.stanford.edu/dataset.html

O sistema Stanford2D3D em ação. Fonte: http://buildingparser.stanford.edu/dataset.html

Em testes, Trans4Trans também foi capaz de segmentar objetos transparentes que foram mal classificados pela iniciativa Trans2Seg iniciativa lançada no início de 2021 pelos mesmos pesquisadores, enquanto exigia menos GFLOPS para calcular e segmentar as superfícies.

Ao contrário do Trans2Seq, que utiliza um codificador baseado em CNN e decodificador baseado em transformador, Trans4Trans usa apenas arquitetura codificador-decodificador baseada em transformador, superando a abordagem anterior e também melhorando significativamente o PVT.

O algoritmo também alcançou resultados de ponta para um número particular de classes transparentes, incluindo jarra, janela, porta, xícara, caixa e garrafa.

Escritor em aprendizado de máquina, especialista em síntese de imagem humana. Antigo chefe de conteúdo de pesquisa da Metaphysic.ai, até sua dissolução na Brahma.ai da DNEG.
Portfolio site: martinanderson.ai
Contato: martin@martinanderson.ai