Modelos e plataformas de IA
Pesquisadores Usam Aprendizado Profundo para Transformar Fotos de Pontos Turísticos em 4D

Pesquisadores da Universidade Cornell desenvolveram um novo método que utiliza aprendizado profundo para transformar fotos de pontos turísticos em 4D. A equipe se baseou em fotos de pontos turísticos como a Fonte da Trevi, em Roma, e os resultados são imagens 3D que podem ser manipuladas e mostrar mudanças de aparência ao longo do tempo.
O novo método desenvolvido processa e sintetiza dezenas de milhares de fotos não etiquetadas e não datadas, e é um grande passo adiante para a visão computacional.
O trabalho é intitulado “Crowdsampling the Plenoptic Function”, e foi apresentado na Conferência Virtual Europeia de Visão Computacional, que ocorreu entre 23 e 28 de agosto.
Noah Snavely é professor associado de ciência da computação na Cornell Tech e autor principal do artigo. Outros contribuintes incluem o estudante de doutorado da Cornell Zhengqi Li, autor principal do artigo, bem como Abe Davis, professor assistente de ciência da computação na Faculdade de Computação e Ciência da Informação, e o estudante de doutorado da Cornell Tech Wenqi Xian.
“É uma nova forma de modelar cenas que não apenas permite que você mova a cabeça e veja, digamos, a fonte de diferentes ângulos, mas também fornece controles para mudar o tempo”, disse Snavely.
“Se você realmente foi à Fonte da Trevi em sua viagem, a forma como ela pareceria dependeria do horário em que você foi – à noite, ela estaria iluminada por holofotes do fundo. À tarde, ela estaria iluminada pelo sol, a menos que você fosse em um dia nublado”, continuou. “Aprendemos toda a gama de aparências, com base no horário do dia e no clima, a partir dessas coleções de fotos desorganizadas, de modo que você pode explorar toda a gama e, ao mesmo tempo, mover-se pela cena.”
Limitações da Visão Computacional Tradicional
Como pode haver muitos texturas diferentes presentes que precisam ser reproduzidas, é difícil para a visão computacional tradicional representar lugares com precisão por meio de fotos.
“O mundo real é tão diverso em sua aparência e tem diferentes tipos de materiais – coisas brilhantes, água, estruturas finas”, disse Snavely.
Além dessas barreiras, a visão computacional tradicional também luta com dados inconsistentes. A função plenótica é como algo aparece de todos os pontos de vista possíveis no espaço e no tempo, mas para reproduzir isso, são necessárias centenas de câmeras web no local. Além disso, elas teriam que estar gravando o tempo todo, dia e noite. Isso poderia ser feito, mas é uma tarefa extremamente intensiva em recursos quando se considera o número de cenas em que esse método seria necessário.
Aprendendo com Outras Fotos
Para contornar isso, a equipe de pesquisadores desenvolveu o novo método.
“Pode não haver uma foto tirada às 16h deste exato ângulo no conjunto de dados. Então, temos que aprender com uma foto tirada às 21h em um local e uma foto tirada às 16h03 em outro local”, disse Snavely. “E não sabemos a granularidade de quando essas fotos foram tiradas. Mas, usando aprendizado profundo, podemos inferir como a cena teria parecido em qualquer momento e lugar.”
Um novo tipo de representação de cena chamado Imagens Multicamadas Profundas foi introduzido pelos pesquisadores para interpolarem a aparência em quatro dimensões, que são 3D e mudanças ao longo do tempo.
De acordo com Snavely, “Usamos a mesma ideia inventada para criar efeitos 3D em animação 2D para criar efeitos 3D em cenas do mundo real, para criar essa imagem multicamada profunda, ajustando-a a todas essas medições dispersas das fotos dos turistas. É interessante que isso venha de uma técnica clássica muito antiga usada na animação.”
O estudo demonstrou que o modelo treinado pode criar uma cena com 50.000 imagens públicas de vários sites. A equipe acredita que isso pode ter implicações em muitas áreas, incluindo pesquisa de visão computacional e turismo virtual.
“Você pode ter a sensação de realmente estar lá”, disse Snavely. “Isso funciona surpreendentemente bem para uma variedade de cenas.”
O projeto recebeu apoio do ex-CEO do Google (GOOGL ) e filantropo Eric Schmidt, bem como de Wendt Schmidt.
https://www.youtube.com/watch?v=MAVFKWX8LYo&feature=emb_title












