Modelos e plataformas de IA

Nova Técnica Ajuda IA a Identificar Objetos 3D

mm
Adicione Unite.AI às suas fontes preferidas no Google

Uma nova técnica desenvolvida por pesquisadores da Universidade Estadual da Carolina do Norte melhora a capacidade dos programas de inteligência artificial (IA) de identificar objetos 3D. Chamada de MonoCon, a técnica também ajuda a IA a aprender como os objetos 3D se relacionam entre si no espaço usando imagens 2D. 

MonoCon pode ter uma ampla gama de aplicações, incluindo ajudar veículos autônomos a navegar em torno de outros veículos usando imagens 2D recebidas de uma câmera a bordo. Também pode desempenhar um papel na fabricação e robótica.

Tianfu Wu é o autor correspondente do artigo de pesquisa e um professor assistente de engenharia elétrica e computacional na Universidade Estadual da Carolina do Norte. 

“Vivemos em um mundo 3D, mas quando tiramos uma foto, ela registra esse mundo em uma imagem 2D”, diz Wu.

“Os programas de IA recebem entrada visual de câmeras. Então, se queremos que a IA interaja com o mundo, precisamos garantir que ela possa interpretar o que as imagens 2D podem dizer sobre o espaço 3D. Nesta pesquisa, estamos focados em uma parte desse desafio: como podemos fazer com que a IA reconheça objetos 3D – como pessoas ou carros – em imagens 2D e coloque esses objetos no espaço”, continua Wu. 

Veículos Autônomos

Os veículos autônomos frequentemente dependem de lidar para navegar no espaço 3D. O lidar, que usa lasers para medir a distância, é caro, o que significa que os sistemas autônomos não incluem muita redundância. Colocar dezenas de sensores lidar em um carro sem motorista produzido em massa seria incrivelmente caro. 

“Mas se um veículo autônomo pudesse usar entradas visuais para navegar pelo espaço, você poderia construir redundância”, diz Wu. “Porque as câmeras são significativamente menos caras do que o lidar, seria economicamente viável incluir câmeras adicionais – construindo redundância no sistema e tornando-o mais seguro e robusto.

“Essa é uma aplicação prática. No entanto, também estamos animados com o avanço fundamental deste trabalho: é possível obter dados 3D a partir de objetos 2D.”

Treinando a IA

MonoCon pode identificar objetos 3D em imagens 2D antes de colocá-los em uma “caixa delimitadora”, que informa à IA as bordas externas do objeto. 

“O que diferencia nosso trabalho é como treinamos a IA, que se baseia em técnicas de treinamento anteriores”, diz Wu. “Como os esforços anteriores, colocamos objetos em caixas delimitadoras 3D enquanto treinamos a IA. No entanto, além de pedir à IA que preveja a distância câmera-objeto e as dimensões das caixas delimitadoras, também pedimos à IA que preveja as localizações de cada um dos oito pontos da caixa e sua distância do centro da caixa delimitadora em duas dimensões. Chamamos isso de ‘contexto auxiliar’ e descobrimos que isso ajuda a IA a identificar e prever objetos 3D com base em imagens 2D de forma mais precisa.

“O método proposto é motivado por um teorema bem conhecido na teoria da medida, o teorema de Cramér-Wold. Também é potencialmente aplicável a outras tarefas de previsão de saída estruturada em visão computacional.”

MonoCon foi testado com um conjunto de dados de benchmark amplamente utilizado chamado KITTI.

“Na época em que enviamos este artigo, MonoCon performou melhor do que dezenas de outros programas de IA destinados a extrair dados 3D de automóveis de imagens 2D”, diz Wu.

A equipe agora irá escalar o processo com conjuntos de dados maiores.

“Em frente, estamos escalando isso e trabalhando com conjuntos de dados maiores para avaliar e ajustar MonoCon para uso em direção autônoma”, diz Wu. “Também queremos explorar aplicações na fabricação, para ver se podemos melhorar o desempenho de tarefas como o uso de braços robóticos.”

Alex McFarland é um jornalista e escritor de IA que explora os últimos desenvolvimentos em inteligência artificial. Ele colaborou com inúmeras startups de IA e publicações em todo o mundo.