Modelos y plataformas de IA
DiffSeg: Unsegmentación cero-shot no supervisada utilizando difusión estable
Uno de los desafíos fundamentales en los modelos basados en visión por computadora es la generación de máscaras de segmentación de alta calidad. Los avances recientes en el entrenamiento supervisado a gran escala han permitido la segmentación cero-shot en varios estilos de imagen. Además, el entrenamiento no supervisado ha simplificado la segmentación sin la necesidad de anotaciones extensas. A pesar de estos desarrollos, construir un marco de visión por computadora capaz de segmentar cualquier cosa en un entorno cero-shot sin anotaciones sigue siendo una tarea compleja. La segmentación semántica, un concepto fundamental en los modelos de visión por computadora, implica dividir una imagen en regiones más pequeñas con semántica uniforme. Esta técnica establece la base para numerosas tareas posteriores, como la imagen médica, la edición de imágenes, la conducción autónoma y más.
Para avanzar en el desarrollo de los modelos de visión por computadora, es crucial que la segmentación de imágenes no se limite a un conjunto de datos fijo con categorías limitadas. En su lugar, debería actuar como una tarea fundamental versátil para diversas aplicaciones. Sin embargo, el alto costo de recopilar etiquetas a nivel de píxel presenta un desafío significativo, lo que limita el progreso de los métodos de segmentación cero-shot y supervisada que requieren anotaciones y carecen de acceso previo al objetivo. Este artículo discutirá cómo las capas de autoatención en los modelos de difusión estable pueden facilitar la creación de un modelo capaz de segmentar cualquier entrada en un entorno cero-shot, incluso sin anotaciones adecuadas. Estas capas de autoatención entienden inherentemente los conceptos de objeto aprendidos por un modelo de difusión estable preentrenado.
DiffSeg: Un algoritmo de segmentación cero-shot mejorado
La segmentación semántica es un proceso que divide una imagen en varias secciones, con cada sección compartiendo semántica similar. Esta técnica forma la base para numerosas tareas posteriores. Tradicionalmente, las tareas de visión por computadora cero-shot han dependido de la segmentación semántica supervisada, utilizando grandes conjuntos de datos con categorías anotadas y etiquetadas. Sin embargo, implementar la segmentación semántica no supervisada en un entorno cero-shot sigue siendo un desafío. Mientras que los métodos supervisados tradicionales son efectivos, su costo de etiquetado a nivel de píxel es a menudo prohibitivo, lo que destaca la necesidad de desarrollar métodos de segmentación no supervisada en un entorno cero-shot menos restrictivo, donde el modelo no requiere datos anotados ni conocimiento previo de los datos.
Para abordar esta limitación, DiffSeg introduce una nueva estrategia de post-procesamiento, aprovechando las capacidades del marco de difusión estable para construir un modelo de segmentación genérico capaz de transferencia cero-shot en cualquier imagen. Los marcos de difusión estable han demostrado su eficacia en la generación de imágenes de alta resolución basadas en condiciones de prompt. Para imágenes generadas, estos marcos pueden producir máscaras de segmentación utilizando prompts de texto correspondientes, que generalmente incluyen solo objetos de primer plano dominantes.
En contraste, DiffSeg es un método de post-procesamiento innovador que crea máscaras de segmentación utilizando tensores de atención de las capas de autoatención en un modelo de difusión. El algoritmo DiffSeg se compone de tres componentes clave: fusión de atención iterativa, agregación de atención y supresión no máxima, como se ilustra en la siguiente imagen.

El algoritmo DiffSeg conserva la información visual en múltiples resoluciones al agrupar los tensores de atención 4D con coherencia espacial y al utilizar un proceso de fusión iterativo mediante la muestra de puntos ancla. Estos puntos ancla sirven como punto de lanzamiento para la fusión de las máscaras de atención con los mismos anclajes de objeto absorbidos eventualmente. El marco DiffSeg controla el proceso de fusión con la ayuda del método de divergencia de Kullback-Leibler para medir la similitud entre dos mapas de atención.
Cuando se compara con los métodos de segmentación no supervisada basados en clustering, los desarrolladores no necesitan especificar el número de clusters de antemano en el algoritmo DiffSeg, y incluso sin conocimiento previo, el algoritmo DiffSeg puede producir segmentación sin utilizar recursos adicionales. En general, el algoritmo DiffSeg es “un método de segmentación no supervisada y cero-shot novedoso que utiliza un modelo de difusión estable preentrenado, y puede segmentar imágenes sin recursos adicionales o conocimiento previo.”
DiffSeg: Conceptos fundamentales
DiffSeg es un algoritmo novedoso que se basa en los conocimientos de los modelos de difusión, la segmentación no supervisada y la segmentación cero-shot.
Modelos de difusión
El algoritmo DiffSeg se basa en los conocimientos de los modelos de difusión preentrenados. Los modelos de difusión son uno de los marcos generativos más populares para los modelos de visión por computadora, y aprenden el proceso de difusión directo e inverso a partir de una imagen de ruido gaussiano isotrópico muestreada para generar una imagen. La difusión estable es la variante más popular de los modelos de difusión, y se utiliza para realizar una amplia variedad de tareas, incluyendo la segmentación supervisada, la clasificación cero-shot, el emparejamiento de correspondencia semántica, la segmentación con etiquetas eficientes y la segmentación de vocabulario abierto. Sin embargo, el único problema con los modelos de difusión es que dependen de características visuales de alta dimensión para realizar estas tareas, y a menudo requieren capacitación adicional para aprovechar al máximo estas características.
Segmentación no supervisada
El algoritmo DiffSeg está estrechamente relacionado con la segmentación no supervisada, una práctica moderna de inteligencia artificial que tiene como objetivo generar máscaras de segmentación densas sin emplear anotaciones. Sin embargo, para ofrecer un buen rendimiento, los modelos de segmentación no supervisada necesitan algún entrenamiento no supervisado previo en el conjunto de datos objetivo. Los marcos de segmentación no supervisada basados en inteligencia artificial se pueden caracterizar en dos categorías: clustering utilizando modelos preentrenados y clustering basado en invarianza. En la primera categoría, los marcos utilizan las características discriminatorias aprendidas por los modelos preentrenados para generar máscaras de segmentación, mientras que los marcos que se encuentran en la segunda categoría utilizan un algoritmo de clustering genérico que optimiza la información mutua entre dos imágenes para segmentar imágenes en clusters semánticos y evitar la segmentación degenerada.
Segmentación cero-shot
El algoritmo DiffSeg está estrechamente relacionado con los marcos de segmentación cero-shot, un método con la capacidad de segmentar cualquier cosa sin entrenamiento previo ni conocimiento de los datos. Los modelos de segmentación cero-shot han demostrado capacidades de transferencia cero-shot excepcionales en tiempos recientes, aunque requieren alguna entrada de texto y prompts. En contraste, el algoritmo DiffSeg utiliza un modelo de difusión para generar segmentación sin consultar y sintetizar múltiples imágenes y sin conocer el contenido del objeto.
DiffSeg: Método y arquitectura
El algoritmo DiffSeg utiliza las capas de autoatención en un modelo de difusión estable preentrenado para generar tareas de segmentación de alta calidad.
Modelo de difusión estable
La difusión estable es uno de los conceptos fundamentales en el marco DiffSeg. La difusión estable es un marco generativo de inteligencia artificial, y uno de los modelos de difusión más populares. Una de las características principales de un modelo de difusión es un paso directo y un paso inverso. En el paso directo, se agrega un poco de ruido gaussiano a una imagen de manera iterativa en cada paso de tiempo hasta que la imagen se convierte en una imagen de ruido gaussiano isotrópico. Por otro lado, en el paso inverso, el modelo de difusión elimina iterativamente el ruido en la imagen de ruido gaussiano isotrópico para recuperar la imagen original sin ruido gaussiano.
El marco de difusión estable utiliza un codificador-decodificador y un diseño de U-Net con capa de atención, donde utiliza un codificador para comprimir primero una imagen en un espacio latente con dimensiones espaciales más pequeñas, y utiliza el decodificador para descomprimir la imagen. La arquitectura de U-Net consiste en una pila de bloques modulares, donde cada bloque está compuesto por uno de los siguientes dos componentes: una capa de transformador y una capa de ResNet.
Componentes y arquitectura
Las capas de autoatención en los modelos de difusión agrupan la información de los objetos inherentes en forma de mapas de atención espacial, y DiffSeg es un método de post-procesamiento novedoso para fusionar tensores de atención en una máscara de segmentación válida, con una canalización que consiste en tres componentes principales: agregación de atención, supresión no máxima y atención iterativa.
Agregación de atención
Para una imagen de entrada que pasa a través de las capas de U-Net y el codificador, el modelo de difusión estable genera un total de 16 tensores de atención, con 5 tensores para cada una de las dimensiones. El objetivo principal de generar 16 tensores es agrupar estos tensores de atención con diferentes resoluciones en un tensor con la resolución más alta posible. Para lograr esto, el algoritmo DiffSeg trata las cuatro dimensiones de manera diferente.
De las cuatro dimensiones, las dos últimas dimensiones en los sensores de atención tienen diferentes resoluciones, pero son consistentes espacialmente, ya que el mapa espacial 2D del marco DiffSeg corresponde a la correlación entre las ubicaciones y las ubicaciones espaciales. Como resultado, el marco DiffSeg muestrea estas dos dimensiones de todos los mapas de atención a la resolución más alta de todos, 64 x 64. Por otro lado, las dos primeras dimensiones indican la referencia de ubicación de los mapas de atención, como se demuestra en la siguiente imagen.

Como estas dimensiones se refieren a la ubicación de los mapas de atención, los mapas de atención deben agruparse en consecuencia. Además, para garantizar que el mapa de atención agrupado tenga una distribución válida, el marco normaliza la distribución después de la agrupación, con cada mapa de atención asignado un peso proporcional a su resolución.
Fusión de atención iterativa
Mientras que el objetivo principal de la agregación de atención era calcular un tensor de atención, el objetivo principal es fusionar los mapas de atención en el tensor en una pila de propuestas de objeto, donde cada propuesta individual contiene la categoría de “cosa” o la activación de un solo objeto. La solución propuesta para lograr esto es implementar un algoritmo K-Means en la distribución válida de los tensores para encontrar los clusters de los objetos. Sin embargo, utilizar K-Means no es la solución óptima, ya que el algoritmo de clustering K-Means requiere que los usuarios especifiquen el número de clusters de antemano. Además, implementar un algoritmo K-Means puede dar lugar a resultados diferentes para la misma imagen, ya que depende estocásticamente de la inicialización. Para superar este obstáculo, el marco DiffSeg propone generar una cuadrícula de muestreo para crear las propuestas fusionando los mapas de atención de manera iterativa.
Supresión no máxima
El paso anterior de fusión de atención iterativa produce una lista de propuestas de objeto en forma de mapas de atención de probabilidad, donde cada propuesta de objeto contiene la activación del objeto. El marco utiliza la supresión no máxima para convertir la lista de propuestas de objeto en una máscara de segmentación válida, y el proceso es un enfoque efectivo, ya que cada elemento en la lista es ya un mapa de la distribución de probabilidad. Para cada ubicación espacial en todos los mapas, el algoritmo toma el índice de la probabilidad más grande y asigna una membresía en función del índice del mapa correspondiente.
DiffSeg: Experimentos y resultados
Los marcos que trabajan en la segmentación no supervisada utilizan dos benchmarks de segmentación, a saber, Cityscapes y COCO-stuff-27. El benchmark Cityscapes es un conjunto de datos de conducción autónoma con 27 categorías de nivel medio, mientras que el benchmark COCO-stuff-27 es una versión curada del conjunto de datos original COCO-stuff que combina 80 “cosas” y 91 categorías en 27 categorías. Además, para analizar el rendimiento de la segmentación, el marco DiffSeg utiliza la intersección media sobre la unión o mIoU y la precisión de píxel o ACC, y como el algoritmo DiffSeg no puede proporcionar una etiqueta semántica, utiliza el algoritmo de emparejamiento húngaro para asignar una máscara de verdad terreno con cada máscara predicha. En caso de que el número de máscaras predichas supere el número de máscaras de verdad terreno, el marco considerará las tareas predichas no emparejadas como falsos negativos.
Además, el marco DiffSeg también enfatiza los siguientes tres trabajos para realizar interferencia: Dependencia del lenguaje o LD, Adaptación no supervisada o UA, y Imagen auxiliar o AX. La dependencia del lenguaje significa que el método necesita entradas de texto descriptivas para facilitar la segmentación de la imagen, la adaptación no supervisada se refiere a la necesidad del método de utilizar el entrenamiento no supervisado en el conjunto de datos objetivo, mientras que la imagen auxiliar se refiere a que el método necesita una entrada adicional, ya sea como imágenes sintéticas o como una piscina de imágenes de referencia.
Resultados
En el benchmark COCO, el marco DiffSeg incluye dos líneas base de K-Means, K-Means-S y K-Means-C. La línea base K-Means-C incluye 6 clusters que se calcularon promediando el número de objetos en las imágenes que se evalúan, mientras que la línea base K-Means-S utiliza un número específico de clusters para cada imagen en función del número de objetos presentes en la verdad terreno de la imagen, y los resultados en ambos benchmarks se demuestran en la siguiente imagen.

Como se puede ver, la línea base K-Means supera a los métodos existentes, lo que demuestra el beneficio de utilizar tensores de autoatención. Lo interesante es que la línea base K-Means-S supera a la línea base K-Means-C, lo que indica que el número de clusters es un hiperparámetro fundamental, y ajustarlo es importante para cada imagen. Además, incluso cuando se basa en los mismos tensores de atención, el marco DiffSeg supera a las líneas base K-Means, lo que demuestra la capacidad del marco DiffSeg para no solo proporcionar una mejor segmentación, sino también evitar las desventajas que plantean las líneas base K-Means.
En el conjunto de datos Cityscapes, el marco DiffSeg entrega resultados similares a los marcos que utilizan entradas con una resolución más baja de 320, mientras que supera a los marcos que toman entradas con una resolución más alta de 512 en precisión y mIoU.

Como se mencionó anteriormente, el marco DiffSeg emplea varios hiperparámetros, como se demuestra en la siguiente imagen.

La agregación de atención es uno de los conceptos fundamentales empleados en el marco DiffSeg, y los efectos de utilizar diferentes pesos de agregación se demuestran en la siguiente imagen, con la resolución de la imagen siendo constante.

Como se puede observar, los mapas de alta resolución en la figura (b) con mapas de 64 x 64 producen segmentaciones más detalladas, aunque las segmentaciones tienen algunas fracturas visibles, mientras que los mapas de resolución más baja de 32 x 32 tienden a sobre-segmentar los detalles, aunque resultan en segmentaciones más coherentes. En la figura (d), los mapas de baja resolución no logran generar ninguna segmentación, ya que toda la imagen se fusiona en un solo objeto con la configuración de hiperparámetros existente. Finalmente, la figura (a) que utiliza una estrategia de agregación proporcional produce detalles mejorados y coherencia equilibrada.
Pensamientos finales
La segmentación no supervisada cero-shot sigue siendo uno de los mayores obstáculos para los marcos de visión por computadora, y los modelos existentes dependen de la adaptación no supervisada no cero-shot o de recursos externos. Para superar este obstáculo, hemos hablado de cómo las capas de autoatención en los modelos de difusión estable pueden permitir la construcción de un modelo capaz de segmentar cualquier entrada en un entorno cero-shot sin anotaciones adecuadas, ya que estas capas de autoatención contienen los conceptos inherentes del objeto que un modelo de difusión estable preentrenado aprende. También hemos hablado sobre DiffSeg, una estrategia de post-procesamiento novedosa que tiene como objetivo aprovechar el potencial del marco de difusión estable para construir un modelo de segmentación genérico que pueda implementar la transferencia cero-shot en cualquier imagen. El algoritmo se basa en la similitud entre la atención y la similitud dentro de la atención para fusionar los mapas de atención de manera iterativa en máscaras de segmentación válidas para lograr un rendimiento de vanguardia en benchmarks populares.












