Modelos y plataformas de IA
InstructIR: Restauración de Imágenes de Alta Calidad Siguiendo Instrucciones Humanas
Una imagen puede transmitir mucha información, pero también puede estar dañada por varios problemas como el desenfoque de movimiento, la niebla, el ruido y el rango dinámico bajo. Estos problemas, comúnmente conocidos como degradaciones en la visión por computadora de bajo nivel, pueden surgir de condiciones ambientales difíciles como el calor o la lluvia, o de limitaciones de la cámara en sí. La restauración de imágenes representa un desafío fundamental en la visión por computadora, que busca recuperar una imagen de alta calidad y limpia a partir de una que muestra degradaciones. La restauración de imágenes es compleja porque puede haber múltiples soluciones para restaurar cualquier imagen. Algunos enfoques se centran en degradaciones específicas, como reducir el ruido o eliminar el desenfoque o la niebla.
Mientras que estos métodos pueden producir buenos resultados para problemas específicos, a menudo luchan por generalizar en diferentes tipos de degradación. Muchos marcos emplean una red neuronal genérica para una amplia gama de tareas de restauración de imágenes, pero estas redes se entrenan por separado. La necesidad de diferentes modelos para cada tipo de degradación hace que este enfoque sea computacionalmente costoso y consume mucho tiempo, lo que lleva a centrarse en modelos de restauración “Todo en Uno” en los desarrollos recientes. Estos modelos utilizan un modelo de restauración ciego profundo que aborda múltiples niveles y tipos de degradación, a menudo empleando instrucciones o vectores de orientación específicos de degradación para mejorar el rendimiento. Aunque los modelos “Todo en Uno” suelen mostrar resultados prometedores, todavía enfrentan desafíos con problemas inversos.
InstructIR representa un enfoque innovador en el campo, siendo el primer marco de restauración de imágenes diseñado para guiar el modelo de restauración a través de instrucciones escritas por humanos. Puede procesar instrucciones de lenguaje natural para recuperar imágenes de alta calidad a partir de imágenes degradadas, considerando varios tipos de degradación. InstructIR establece un nuevo estándar en rendimiento para una amplia gama de tareas de restauración de imágenes, incluyendo la eliminación de lluvia, la reducción de ruido, la eliminación de niebla, la eliminación de desenfoque y la mejora de imágenes de baja iluminación.
Este artículo tiene como objetivo cubrir el marco de InstructIR en profundidad, y exploramos el mecanismo, la metodología, la arquitectura del marco, junto con su comparación con marcos de generación de imágenes y video de última generación. Así que comencemos.
InstructIR: Restauración de Imágenes de Alta Calidad
La restauración de imágenes es un problema fundamental en la visión por computadora, ya que busca recuperar una imagen de alta calidad y limpia a partir de una imagen que muestra degradaciones. En la visión por computadora de bajo nivel, las degradaciones son un término utilizado para representar efectos desagradables observados dentro de una imagen, como el desenfoque de movimiento, la niebla, el ruido, el rango dinámico bajo, y más. La razón por la que la restauración de imágenes es un desafío inverso complejo es porque puede haber múltiples soluciones diferentes para restaurar cualquier imagen. Algunos marcos se centran en degradaciones específicas, como reducir el ruido o eliminar el desenfoque, mientras que otros pueden centrarse más en eliminar la niebla o desvanecer.
Los métodos de aprendizaje profundo recientes han demostrado un rendimiento más fuerte y consistente en comparación con los métodos tradicionales de restauración de imágenes. Estos modelos de restauración de imágenes basados en aprendizaje profundo proponen utilizar redes neuronales basadas en Transformadores y Redes Neuronales Convolucionales. Estos modelos se pueden entrenar de forma independiente para diversas tareas de restauración de imágenes, y también poseen la capacidad de capturar interacciones de características locales y globales, y mejorarlas, lo que resulta en un rendimiento satisfactorio y consistente. Aunque algunos de estos métodos pueden funcionar adecuadamente para tipos específicos de degradación, generalmente no se extrapolan bien a diferentes tipos de degradación. Además, mientras que muchos marcos existentes utilizan la misma red neuronal para una multitud de tareas de restauración de imágenes, cada formulación de la red neuronal se entrena por separado. Por lo tanto, es obvio que emplear un modelo de red neuronal separado para cada degradación concebible es impracticable y consume mucho tiempo, lo que es por qué los marcos de restauración de imágenes recientes se han centrado en proxies de restauración “Todo en Uno”.
Los modelos de restauración “Todo en Uno” o de degradación múltiple o de tarea múltiple están ganando popularidad en el campo de la visión por computadora, ya que pueden restaurar múltiples tipos y niveles de degradación en una imagen sin la necesidad de entrenar los modelos de forma independiente para cada degradación. Los modelos de restauración “Todo en Uno” utilizan un modelo de restauración ciego profundo para abordar diferentes tipos y niveles de degradación de la imagen. Diferentes modelos “Todo en Uno” implementan diferentes enfoques para guiar el modelo ciego para restaurar la imagen degradada, por ejemplo, un modelo auxiliar para clasificar la degradación o vectores de orientación multidimensionales o instrucciones para ayudar al modelo a restaurar diferentes tipos de degradación dentro de una imagen.
Con eso dicho, llegamos a la manipulación de imágenes basada en texto, ya que ha sido implementada por varios marcos en los últimos años para la generación de imágenes de texto y tareas de edición de imágenes basadas en texto. Estos modelos a menudo utilizan instrucciones de texto para describir acciones o imágenes, junto con modelos de difusión para generar las imágenes correspondientes. La principal inspiración para el marco de InstructIR es el marco de InstructPix2Pix, que permite al modelo editar la imagen utilizando instrucciones del usuario que indican al modelo qué acción realizar, en lugar de etiquetas de texto, descripciones o subtítulos de la imagen de entrada. Como resultado, los usuarios pueden utilizar textos escritos naturales para instruir al modelo sobre qué acción realizar sin la necesidad de proporcionar imágenes de ejemplo o descripciones de imagen adicionales.
Basándonos en estos conceptos básicos, el marco de InstructIR es el primer modelo de visión por computadora que emplea instrucciones escritas por humanos para lograr la restauración de imágenes y resolver problemas inversos. Para instrucciones de lenguaje natural, el modelo de InstructIR puede recuperar imágenes de alta calidad a partir de sus contrapartes degradadas y también tiene en cuenta múltiples tipos de degradación. El marco de InstructIR es capaz de ofrecer un rendimiento de última generación en una amplia gama de tareas de restauración de imágenes, incluyendo la eliminación de lluvia, la reducción de ruido, la eliminación de niebla, la eliminación de desenfoque y la mejora de imágenes de baja iluminación. En contraste con los trabajos existentes que logran la restauración de imágenes utilizando vectores de orientación aprendidos o incrustaciones de instrucciones, el marco de InstructIR emplea instrucciones de usuario en forma de texto. El marco de InstructIR es capaz de generalizar para restaurar imágenes utilizando instrucciones escritas por humanos, y el modelo “Todo en Uno” implementado por InstructIR cubre más tareas de restauración que los modelos anteriores. La siguiente figura muestra las diversas muestras de restauración del marco de InstructIR.

InstructIR: Método y Arquitectura
En su núcleo, el marco de InstructIR consiste en un codificador de texto y un modelo de imagen. El modelo utiliza el marco de NAFNet, un modelo de restauración de imágenes eficiente que sigue una arquitectura de U-Net como modelo de imagen. Además, el modelo implementa técnicas de enrutamiento de tareas para aprender múltiples tareas utilizando un solo modelo de forma exitosa. La siguiente figura ilustra el enfoque de entrenamiento y evaluación para el marco de InstructIR.

Inspirado en el modelo de InstructPix2Pix, el marco de InstructIR adopta instrucciones escritas por humanos como mecanismo de control, ya que no hay necesidad de que el usuario proporcione información adicional. Estas instrucciones ofrecen una forma clara y expresiva de interactuar, lo que permite a los usuarios señalar la ubicación exacta y el tipo de degradación en la imagen. Además, el uso de instrucciones de usuario en lugar de instrucciones fijas específicas de degradación mejora la usabilidad y las aplicaciones del modelo, ya que también puede ser utilizado por usuarios que carecen de la experiencia de dominio necesaria. Para equiparar al marco de InstructIR con la capacidad de comprender instrucciones diversas, el modelo utiliza GPT-4, un modelo de lenguaje grande para crear solicitudes diversas, con instrucciones ambiguas y poco claras eliminadas después de un proceso de filtrado.
Codificador de Texto
Un codificador de texto es utilizado por los modelos de lenguaje para mapear las instrucciones del usuario a una representación de texto o vector de tamaño fijo. Tradicionalmente, el codificador de texto de un modelo de CLIP es un componente vital para la generación de imágenes basadas en texto y los modelos de manipulación de imágenes basadas en texto para codificar instrucciones del usuario, ya que el marco de CLIP sobresale en los estímulos visuales. Sin embargo, la mayoría de las veces, las instrucciones del usuario para las características de degradación contienen poco o ningún contenido visual, lo que hace que los grandes codificadores de CLIP sean inútiles para tales tareas, ya que afectarían significativamente la eficiencia. Para abordar este problema, el marco de InstructIR opta por un codificador de oraciones basado en texto que se entrena para codificar oraciones en un espacio de incrustación significativo. Los codificadores de oraciones se entrenan en millones de ejemplos y, sin embargo, son compactos y eficientes en comparación con los codificadores de texto basados en CLIP tradicionales, y tienen la capacidad de codificar la semántica de instrucciones del usuario diversas.
Orientación de Texto
Un aspecto importante del marco de InstructIR es la implementación de la instrucción codificada como mecanismo de control para el modelo de imagen. Basándonos en esto, y inspirados en la enrutamiento de tareas para el aprendizaje de múltiples tareas, el marco de InstructIR propone un bloque de construcción de instrucciones o ICB para permitir transformaciones específicas de tarea dentro del modelo. La enrutamiento de tareas convencional aplica máscaras binarias específicas de tarea a las características del canal. Sin embargo, como el marco de InstructIR no conoce la degradación, esta técnica no se implementa directamente. Además, para las características de la imagen y las instrucciones codificadas, el marco de InstructIR aplica la enrutamiento de tareas y produce la máscara utilizando una capa lineal activada con la función sigmoide para producir un conjunto de pesos dependiendo de las incrustaciones de texto, lo que da como resultado una máscara binaria por canal de c-dimensiones. El modelo también mejora las características condicionadas utilizando un bloque de NAF, y utiliza el bloque de NAF y el bloque de condición de instrucción para condicionar las características en ambos bloques de codificador y decodificador.

Aunque el marco de InstructIR no condiciona los filtros de la red neuronal explícitamente, la máscara facilita que el modelo seleccione los canales más relevantes en función de la instrucción de la imagen y la información.
InstructIR: Implementación y Resultados
El modelo de InstructIR es entrenable de extremo a extremo, y el modelo de imagen no requiere pre-entrenamiento. Solo las proyecciones de incrustación de texto y la cabeza de clasificación necesitan ser entrenadas. El codificador de texto se inicializa utilizando un codificador de BGE, un codificador similar a BERT que se entrena en una gran cantidad de datos supervisados y no supervisados para la codificación de oraciones genérica. El marco de InstructIR utiliza el modelo de NAFNet como modelo de imagen, y la arquitectura de NAFNet consiste en un codificador-decodificador de 4 niveles con un número variable de bloques en cada nivel. El modelo también agrega 4 bloques intermedios entre el codificador y el decodificador para mejorar aún más las características. Además, en lugar de concatenar para las conexiones de salto, el decodificador implementa la adición, y el modelo de InstructIR solo implementa el bloque de condición de instrucción o ICB para la enrutamiento de tareas en el codificador y decodificador. A continuación, el modelo de InstructIR se optimiza utilizando la pérdida entre la imagen restaurada y la imagen limpia de referencia, y se utiliza la pérdida de entropía cruzada para la cabeza de clasificación de intención del codificador de texto. El modelo de InstructIR utiliza el optimizador AdamW con un tamaño de lote de 32 y una tasa de aprendizaje de 5e-4 durante casi 500 épocas, y también implementa la decadencia de la tasa de aprendizaje de annealing cósico. Dado que el modelo de imagen en el marco de InstructIR comprende solo 16 millones de parámetros, y solo hay 100 mil parámetros de proyección de texto aprendidos, el marco de InstructIR se puede entrenar fácilmente en GPU estándar, lo que reduce los costos computacionales y aumenta la aplicabilidad.
Resultados de Degradación Múltiple
Para la degradación múltiple y la restauración de tareas múltiples, el marco de InstructIR define dos configuraciones iniciales:
- 3D para modelos de tres degradaciones para abordar problemas de degradación como la desniebla, la reducción de ruido y la eliminación de lluvia.
- 5D para modelos de cinco degradaciones para abordar problemas de degradación como la reducción de ruido de imagen, la mejora de la iluminación baja, la desniebla, la reducción de ruido y la eliminación de lluvia.
El rendimiento de los modelos 5D se demuestra en la siguiente tabla, y se compara con los modelos de restauración de imágenes y “Todo en Uno” de última generación.

Como se puede observar, el marco de InstructIR con un modelo de imagen simple y solo 16 millones de parámetros puede manejar cinco tareas de restauración de imágenes diferentes con éxito gracias a la orientación basada en instrucciones, y ofrece resultados competitivos. La siguiente tabla demuestra el rendimiento del marco en los modelos 3D, y los resultados son comparables a los resultados anteriores.

El aspecto más destacado del marco de InstructIR es la restauración de imágenes basada en instrucciones, y la siguiente figura demuestra las increíbles capacidades del modelo de InstructIR para comprender una amplia gama de instrucciones para una tarea determinada. Además, para una instrucción adversaria, el modelo de InstructIR realiza una identidad que no es forzada.

Pensamientos Finales
La restauración de imágenes es un problema fundamental en la visión por computadora, ya que busca recuperar una imagen de alta calidad y limpia a partir de una imagen que muestra degradaciones. En la visión por computadora de bajo nivel, las degradaciones son un término utilizado para representar efectos desagradables observados dentro de una imagen, como el desenfoque de movimiento, la niebla, el ruido, el rango dinámico bajo, y más. En este artículo, hemos hablado sobre InstructIR, el primer marco de restauración de imágenes del mundo que busca guiar el modelo de restauración de imágenes utilizando instrucciones escritas por humanos. Para instrucciones de lenguaje natural, el modelo de InstructIR puede recuperar imágenes de alta calidad a partir de sus contrapartes degradadas y también tiene en cuenta múltiples tipos de degradación. El marco de InstructIR es capaz de ofrecer un rendimiento de última generación en una amplia gama de tareas de restauración de imágenes, incluyendo la eliminación de lluvia, la reducción de ruido, la eliminación de niebla, la eliminación de desenfoque y la mejora de imágenes de baja iluminación.












