Modelos y plataformas de IA
Investigadores Desarrollan Nuevas Técnicas para Mejorar Imágenes Deterioradas

Un equipo de investigadores de Yale-NUS College ha desarrollado nuevos enfoques de visión por computadora y aprendizaje profundo para extraer datos más precisos de la visión de bajo nivel en videos causados por factores ambientales como la lluvia y las condiciones nocturnas. También mejoraron la precisión de la estimación de la pose humana 3D en videos.
La tecnología de visión por computadora, que se utiliza en aplicaciones como sistemas de vigilancia automática, vehículos autónomos y herramientas de salud y distanciamiento social, a menudo se ve afectada por factores ambientales, lo que puede causar problemas con los datos extraídos.
La nueva investigación se presentó en la Conferencia de 2021 sobre Visión por Computadora y Reconocimiento de Patrones (CVPR).
Impacto Ambiental en las Imágenes
Condiciones como la baja luz y los efectos de la luz artificial como el deslumbramiento, el resplandor y las luces de inundación afectan las imágenes nocturnas. Las imágenes de lluvia también se ven afectadas por las rayas de lluvia o la acumulación de lluvia.
El profesor asociado de Ciencias de Yale-NUS College, Robby Tan, lideró el equipo de investigación.
“Muchos sistemas de visión por computadora, como la vigilancia automática y los coches autónomos, dependen de la visibilidad clara de los videos de entrada para funcionar bien. Por ejemplo, los coches autónomos no pueden funcionar de manera robusta en lluvia intensa y los sistemas de vigilancia automática de CCTV a menudo fallan por la noche, especialmente si las escenas son oscuras o hay un deslumbramiento o luces de inundación significativos”, dijo el profesor Tan.
El equipo se basó en dos estudios separados que introdujeron algoritmos de aprendizaje profundo para mejorar la calidad de los videos nocturnos y de lluvia.
El primer estudio se centró en aumentar el brillo al mismo tiempo que suprimía el ruido y los efectos de la luz, como el deslumbramiento, el resplandor y las luces de inundación, para crear imágenes nocturnas claras. La nueva técnica tiene como objetivo mejorar la claridad en las imágenes y videos nocturnos cuando hay un deslumbramiento inevitable, lo que los métodos existentes no han logrado hacer.
En países donde la lluvia intensa es común, la acumulación de lluvia afecta negativamente la visibilidad en los videos. El segundo estudio se propuso abordar el problema al introducir un método que emplea un alineamiento de cuadros, lo que permite una mejor información visual sin verse afectada por las rayas de lluvia, que a menudo aparecen aleatoriamente en diferentes cuadros. El equipo utilizó una cámara en movimiento para emplear la estimación de profundidad, lo que ayudó a eliminar el efecto de velo de lluvia. Mientras que los métodos existentes se centran en eliminar las rayas de lluvia, los métodos recién desarrollados pueden eliminar tanto las rayas de lluvia como el efecto de velo de lluvia al mismo tiempo.

Imagen: Yale-NUS College
Estimación de la Pose Humana 3D
Junto con las nuevas técnicas, el equipo también presentó su investigación sobre la estimación de la pose humana 3D, que se puede utilizar en la vigilancia de video, los videojuegos y la transmisión de deportes.
La estimación de la pose humana 3D de un video monocular, o video tomado con una sola cámara, ha sido cada vez más investigada en los últimos años. A diferencia de los videos de múltiples cámaras, los videos monoculares son más flexibles y se pueden tomar con una sola cámara, como un teléfono móvil.
Sin embargo, la alta actividad como múltiples individuos en la misma escena afecta la precisión en la detección humana. Esto es especialmente cierto cuando los individuos interactúan estrechamente o se superponen entre sí en el video monocular.
El tercer estudio del equipo estimó la pose humana 3D de un video combinando dos métodos existentes, que fueron los enfoques de arriba hacia abajo y de abajo hacia arriba. El nuevo método produce una estimación de la pose más confiable en entornos de múltiples personas en comparación con los otros dos, y está mejor equipado para manejar la distancia entre los individuos.
“Como un próximo paso en nuestra investigación sobre la estimación de la pose humana 3D, que es apoyada por la Fundación Nacional de Investigación, estaremos examinando cómo proteger la información de privacidad de los videos. Para los métodos de mejora de la visibilidad, nos esforzamos por contribuir a los avances en el campo de la visión por computadora, ya que son fundamentales para muchas aplicaciones que pueden afectar nuestras vidas diarias, como permitir que los coches autónomos funcionen mejor en condiciones climáticas adversas”, dijo el profesor Tan.
(NRC )











