Modelos e plataformas de IA

Intel Labs Avança no Desenvolvimento de Visão Computacional com Dois Novos Modelos de IA

mm
Adicione Unite.AI às suas fontes preferidas no Google

Os modelos de IA de código aberto VI-Depth 1.0 e MiDaS 3.1 melhoram a estimativa de profundidade para visão computacional.

A estimativa de profundidade é uma tarefa desafiadora de visão computacional necessária para criar uma ampla gama de aplicações em robótica, realidade aumentada (AR) e realidade virtual (VR). As soluções existentes frequentemente lutam para estimar corretamente as distâncias, o que é um aspecto crucial para ajudar a planejar o movimento e evitar obstáculos quando se trata de navegação visual. Pesquisadores do Intel (INTC ) Labs estão abordando esse problema lançando dois modelos de IA para estimativa de profundidade monocular: um para estimativa de profundidade visual-inercial e outro para estimativa de profundidade relativa robusta (RDE).

O modelo RDE mais recente, MiDaS versão 3.1, prevê a profundidade relativa robusta usando apenas uma imagem como entrada. Devido ao seu treinamento em um grande e diversificado conjunto de dados, ele pode realizar tarefas de forma eficiente em uma ampla gama de tarefas e ambientes. A versão mais recente do MiDaS melhora a precisão do modelo para RDE em cerca de 30% com seu conjunto de treinamento maior e backbones de codificador atualizados.

O MiDaS foi incorporado a muitos projetos, mais notavelmente o Stable Diffusion 2.0, onde ele habilita a funcionalidade de profundidade para imagem que infere a profundidade de uma imagem de entrada e, em seguida, gera novas imagens usando tanto a informação de texto quanto a de profundidade. Por exemplo, o criador digital Scottie Fox usou uma combinação de Stable Diffusion e MiDaS para criar um ambiente de realidade virtual de 360 graus. Essa tecnologia pode levar a novas aplicações virtuais, incluindo a reconstrução de cenas de crime para processos judiciais, ambientes terapêuticos para saúde e experiências de jogos imersivos.

Embora a RDE tenha boa generalização e seja útil, a falta de escala diminui sua utilidade para tarefas downstream que exigem profundidade métrica, como mapeamento, planejamento, navegação, reconhecimento de objetos, reconstrução 3D e edição de imagens. Pesquisadores do Intel Labs estão abordando esse problema lançando o VI-Depth, outro modelo de IA que fornece estimativa de profundidade precisa.

O VI-Depth é um pipeline de estimativa de profundidade visual-inercial que integra a estimativa de profundidade monocular e a odometria visual-inercial (VIO) para produzir estimativas de profundidade densas com escala métrica. Essa abordagem fornece estimativa de profundidade precisa, que pode ajudar na reconstrução de cenas, mapeamento e manipulação de objetos.

A incorporação de dados inerciais pode ajudar a resolver a ambiguidade de escala. A maioria dos dispositivos móveis já contém unidades de medida inercial (IMUs). O alinhamento global determina a escala global apropriada, enquanto o alinhamento de escala denso (SML) opera localmente e empurra ou puxa regiões em direção à profundidade métrica correta. A rede SML aproveita o MiDaS como backbone de codificador. No pipeline modular, o VI-Depth combina a estimativa de profundidade baseada em dados com o modelo de previsão de profundidade relativa do MiDaS, ao lado da unidade de medida do sensor IMU. A combinação de fontes de dados permite que o VI-Depth gere profundidade métrica densa mais confiável para cada pixel em uma imagem.

MiDaS 3.1 e VI-Depth 1.0 estão disponíveis sob uma licença MIT de código aberto no GitHub.

Para obter mais informações, consulte “Transformadores de Visão para Previsão Densa” e “Em Direção à Estimativa de Profundidade Monocular Robusta: Misturando Conjuntos de Dados para Transferência Cross-Data”.

Daniel é um grande defensor de como a IA eventualmente disruptará tudo. Ele respira tecnologia e vive para experimentar novos gadgets.