Modelos y plataformas de IA

Investigadores utilizan el aprendizaje profundo para convertir fotos de lugares emblemáticos en 4D

mm
Añade Unite.AI a tus fuentes preferidas en Google

Los investigadores de la Universidad de Cornell han desarrollado un nuevo método que utiliza el aprendizaje profundo para convertir fotos de lugares emblemáticos del mundo en 4D. El equipo se basó en fotos de turistas públicamente disponibles de puntos de interés importantes como la Fuente de Trevi en Roma, y los resultados finales son imágenes 3D que se pueden manipular y mostrar cambios en la apariencia con el tiempo.

El método recién desarrollado procesa y sintetiza decenas de miles de fotos sin etiquetar y sin fechar, y es un gran avance para la visión por computadora.

El trabajo se titula “Crowdsampling the Plenoptic Function“, y se presentó en la Conferencia Virtual Europea de Visión por Computadora, que tuvo lugar entre el 23 y el 28 de agosto.

Noah Snavely es profesor asociado de ciencias de la computación en Cornell Tech y autor principal del artículo. Otros contribuyentes incluyen al estudiante de doctorado de Cornell Zhengqi Li, autor principal del artículo, así como a Abe Davis, profesor asistente de ciencias de la computación en la Facultad de Computación e Informática, y al estudiante de doctorado de Cornell Tech Wenqi Xian.

“Es una nueva forma de modelar escenas que no solo te permite mover la cabeza y ver, por ejemplo, la fuente desde diferentes puntos de vista, sino que también te da controles para cambiar el tiempo”, dijo Snavely.

“Si realmente fuiste a la Fuente de Trevi en tus vacaciones, la forma en que luciría dependería de la hora a la que fuiste – por la noche, estaría iluminada por luces de fondo. En la tarde, estaría iluminada por el sol, a menos que fuera un día nublado”, continuó. “Aprendimos toda la gama de apariencias, basada en la hora del día y el clima, a partir de estas colecciones de fotos desorganizadas, de tal manera que puedes explorar toda la gama y al mismo tiempo moverte alrededor de la escena”.

Limitaciones de la visión por computadora tradicional

Dado que puede haber tantos texturas diferentes que deben ser reproducidas, es difícil para la visión por computadora tradicional representar lugares de manera precisa a través de fotos.

“El mundo real es tan diverso en su apariencia y tiene diferentes tipos de materiales – cosas brillantes, agua, estructuras delgadas”, dijo Snavely.

Además de esas barreras, la visión por computadora tradicional también lucha con datos inconsistentes. La función plenóptica es cómo algo se ve desde todos los puntos de vista posibles en el espacio y el tiempo, pero para reproducir esto, se necesitan cientos de cámaras web en la escena. No solo eso, sino que también tendrían que estar grabando todo el día y la noche. Esto podría hacerse, pero es una tarea extremadamente intensiva en recursos cuando se considera la cantidad de escenas donde se requiere este método.

Aprendiendo de otras fotos

Para sortear esto, el equipo de investigadores desarrolló el nuevo método.

“Es posible que no haya una foto tomada a las 4 p.m. desde este punto de vista exacto en el conjunto de datos. Así que tenemos que aprender de una foto tomada a las 9 p.m. en un lugar y una foto tomada a las 4:03 en otro lugar”, dijo Snavely. “Y no sabemos la granularidad de cuándo se tomaron estas fotos. Pero utilizando el aprendizaje profundo, podemos inferir cómo habría lucido la escena en cualquier momento y lugar dado”.

Los investigadores introdujeron una nueva representación de escena llamada Imágenes de multiplano profundas para interpolar la apariencia en cuatro dimensiones, que son 3D y cambios con el tiempo.

Según Snavely, “Utilizamos la misma idea inventada para crear efectos 3D en animación 2D para crear efectos 3D en escenas del mundo real, para crear esta imagen de multiplano profunda ajustándola a todas estas mediciones dispares de las fotos de los turistas. Es interesante que provenga de esta técnica clásica muy antigua utilizada en animación”.

El estudio demostró que el modelo entrenado podría crear una escena con 50.000 imágenes públicamente disponibles de varios sitios. El equipo cree que podría tener implicaciones en muchas áreas, incluyendo la investigación de visión por computadora y el turismo virtual.

“Puedes tener la sensación de realmente estar allí”, dijo Snavely. “Funciona sorprendentemente bien para una variedad de escenas”.

El proyecto recibió apoyo del ex director ejecutivo de Google (GOOGL ) y filántropo Eric Schmidt, así como de Wendt Schmidt.

https://www.youtube.com/watch?v=MAVFKWX8LYo&feature=emb_title

Alex dirige las operaciones de noticias impulsadas por IA de Unite.AI, combinando periodismo, investigación y automatización para respaldar una cobertura oportuna y escalable de la inteligencia artificial. Su trabajo ayuda a garantizar que los desarrollos emergentes de IA se presenten de manera eficiente, al tiempo que se mantienen los estándares editoriales de la publicación.