Robótica e IA física
Modelo de Aprendizado de Máquina Entende Relacionamentos entre Objetos
Pesquisadores do Instituto de Tecnologia de Massachusetts (MIT) desenvolveram um novo modelo de aprendizado de máquina (ML) que entende as relações subjacentes entre objetos em uma cena. O modelo representa individualmente as relações um a um antes de combinar as representações para descrever a cena geral.
Por meio dessa nova abordagem, o modelo de ML pode gerar imagens mais precisas a partir de descrições de texto, e pode fazer isso mesmo quando a cena tem vários projetos dispostos em diferentes relações entre si.
Esse novo desenvolvimento é importante, considerando que muitos modelos de aprendizado profundo não conseguem entender as relações entrelaçadas entre objetos individuais.
O modelo da equipe pode ser usado em casos em que robôs industriais devem realizar tarefas de manipulação em várias etapas, como empilhar itens ou montar aparelhos. Ele também ajuda a levar as máquinas a aprenderem e interagirem com seus ambientes, assim como os humanos.
Yilun Du é um estudante de doutorado no Laboratório de Ciência e Inteligência Artificial (CSAIL) e coautor principal do artigo. Du liderou a pesquisa com Shuang Li, um estudante de doutorado do CSAIL, e Nan Liu, um estudante de graduação da Universidade de Illinois em Urbana-Champaign. A equipe também incluiu Joshua B. Tenenbaum, professor de Ciência Cognitiva e Computação no Departamento de Ciência Cognitiva e Computação, e o autor sênior Antonio Torralba, professor de Engenharia Elétrica e Ciência da Computação. Tenenbaum e Torralba são membros do CSAIL.
A Nova Estrutura
“Quando olho para uma mesa, não posso dizer que há um objeto no local XYZ. Nossas mentes não funcionam assim. Em nossas mentes, quando entendemos uma cena, realmente a entendemos com base nas relações entre os objetos. Acreditamos que, construindo um sistema que possa entender as relações entre os objetos, poderíamos usar esse sistema para manipular e alterar nossos ambientes de forma mais eficaz”, diz Du.
A nova estrutura pode gerar uma imagem de uma cena com base em uma descrição de texto dos objetos e suas relações.
O sistema pode então quebrar essas frases em pedaços menores que descrevem cada relação individual. Cada parte é modelada separadamente, e as peças são combinadas por meio de um processo de otimização que gera uma imagem da cena.
Com as frases quebradas em pedaços menores, o sistema pode então recombiná-las de diferentes maneiras, permitindo que ele se adapte a descrições de cena que nunca encontrou.
“Outros sistemas considerariam todas as relações de forma holística e gerariam a imagem de uma vez, a partir da descrição. No entanto, essas abordagens falham quando temos descrições fora do padrão, como descrições com mais relações, pois esses modelos não podem se adaptar de uma vez para gerar imagens que contenham mais relações. No entanto, como estamos compondo esses modelos menores e separados juntos, podemos modelar um número maior de relações e nos adaptar a combinações novas”, diz Du.
O sistema também pode realizar esse processo de forma reversa. Se for alimentado com uma imagem, ele pode encontrar descrições de texto que correspondam às relações entre os objetos na cena.
Avaliando o Modelo
Os pesquisadores pediram que humanos avaliassem se as imagens geradas correspondiam à descrição original da cena. Quando as descrições continham três relações, o que era o tipo mais complexo, 91% dos participantes disseram que o novo modelo se saiu melhor do que outros métodos de aprendizado profundo.
“Uma coisa interessante que descobrimos é que, para o nosso modelo, podemos aumentar a nossa frase de ter uma descrição de relação para ter duas, ou três, ou até quatro descrições, e a nossa abordagem continua a ser capaz de gerar imagens que são corretamente descritas por essas descrições, enquanto outros métodos falham”, diz Du.
O modelo também demonstrou uma capacidade impressionante de trabalhar com descrições que não havia encontrado anteriormente.
“Isso é muito promissor, porque é mais parecido com o modo como os humanos funcionam. Os humanos podem ver apenas alguns exemplos, mas podemos extrair informações úteis apenas desses poucos exemplos e combiná-los para criar combinações infinitas. E o nosso modelo tem essa propriedade que permite que ele aprenda com menos dados, mas generalize para cenas ou gerações de imagens mais complexas”, diz Li.
A equipe agora pretende testar o modelo em imagens do mundo real que sejam mais complexas e explorar como incorporar o modelo em sistemas robóticos.












