Ángulo de Anderson
Separar a los humanos ‘fusionados’ en la visión por computadora

Un nuevo artículo del Centro de Innovación del Grupo Hyundai Motor en Singapur ofrece un método para separar a los humanos ‘fusionados’ en la visión por computadora, es decir, aquellos casos en los que el marco de reconocimiento de objetos ha encontrado a un humano que está demasiado cerca de otro humano (como acciones de abrazo o poses de estar detrás), y no puede desenredar a las dos personas representadas, confundiéndolas con una sola persona o entidad.

Dos se convierten en uno, pero eso no es algo bueno en la segmentación semántica. Aquí vemos el nuevo sistema del artículo logrando resultados de vanguardia en la individuación de personas entretejidas en imágenes complejas y desafiantes. Fuente: https://arxiv.org/pdf/2210.03686.pdf
Este es un problema notable que ha recibido mucha atención en la comunidad de investigación en los últimos años. Resolverlo sin el gasto obvio pero generalmente poco asequible de la etiquetación personalizada a gran escala podría permitir mejoras en la individuación de humanos en sistemas de texto a imagen como Stable Diffusion, que a menudo ‘fusionan’ a las personas cuando una pose solicitada requiere que varias personas estén cerca unas de otras.

Abrace el horror, los modelos de texto a imagen como DALL-E 2 y Stable Diffusion (ambos presentados arriba) luchan por representar a las personas en proximidad muy cercana entre sí.
Aunque los modelos generativos como DALL-E 2 y Stable Diffusion no utilizan actualmente la segmentación semántica o el reconocimiento de objetos (al menos, no según el conocimiento público, en el caso del código cerrado DALL-E 2), estos portmanteaus humanos grotescos no podrían curarse actualmente aplicando métodos upstream, porque las bibliotecas y recursos de reconocimiento de objetos de vanguardia no son mucho mejores para desenredar a las personas que los flujos de trabajo basados en CLIP de los modelos de difusión latente.
Para abordar este problema, el nuevo artículo – titulado Los humanos no necesitan etiquetar más humanos: Copia y pega de occlusión para la segmentación de instancias de humanos ocultos– adapta y mejora un enfoque reciente de ‘cortar y pegar’ para datos semi-sintéticos para lograr una nueva ventaja en la tarea, incluso contra el material de origen más desafiante:

La nueva metodología de Copia y pega de occlusión actualmente lidera el campo, incluso contra los marcos y enfoques anteriores que abordan el desafío de maneras más elaboradas y dedicadas, como modelar específicamente la occlusión.
Cortar eso
El método modificado – titulado Copia y pega de occlusión – se deriva del artículo de 2021 Copia y pega simple, liderado por Google Research, que sugirió que superponer objetos y personas extraídos entre imágenes de entrenamiento diversas podría mejorar la capacidad de un sistema de reconocimiento de imágenes para discretizar cada instancia encontrada en una imagen:

Del artículo de 2021 liderado por Google Research ‘Copia y pega simple es un método fuerte de aumento de datos para la segmentación de instancias’, vemos elementos de una foto ‘migrando’ a otras fotos, con el objetivo de entrenar un modelo de reconocimiento de imágenes mejor y más agudo. Fuente: https://arxiv.org/pdf/2012.07177.pdf
La nueva versión agrega limitaciones y parámetros a esta ‘repasada’ automatizada y algorítmica, analogizando el proceso en un ‘cesto’ de imágenes lleno de candidatos potenciales para ‘transferir’ a otras imágenes, basado en varios factores clave.

El flujo de trabajo conceptual para OC&P.
Controlar los elementos
Esos factores limitantes incluyen probabilidad de que ocurra una copia y pega, lo que garantiza que el proceso no suceda todo el tiempo, lo que lograría un efecto ‘saturante’ que socavaría el aumento de datos; el número de imágenes que un ‘cesto’ tendrá en cualquier momento, donde un número mayor de ‘segmentos’ puede mejorar la variedad de instancias, pero aumentar el tiempo de preprocesamiento; y alcance, que determina el número de imágenes que se pegarán en una imagen ‘huésped’.
Con respecto a esto, el artículo señala ‘Necesitamos suficiente occlusión para que ocurra, pero no demasiada, ya que pueden sobrecargar la imagen, lo que puede ser perjudicial para el aprendizaje.’
Las otras dos innovaciones para OC&P son pegado dirigido y pegado de instancia aumentado.
El pegado dirigido garantiza que una imagen apropiada aterrice cerca de una instancia existente en la imagen objetivo. En el enfoque anterior, el nuevo elemento solo estaba limitado dentro de los límites de la imagen, sin consideración de contexto.

Aunque este ‘pegado’, con pegado dirigido, es obvio para el ojo humano, tanto OC&P como su predecesor han encontrado que la autenticidad visual aumentada no es necesariamente importante, y podría incluso ser una desventaja (ver ‘La realidad muerde’ a continuación).
El pegado de instancia aumentado, por otro lado, garantiza que las instancias pegadas no demuestren una ‘apariencia distintiva’ que pueda ser clasificada por el sistema de alguna manera, lo que podría llevar a exclusión o ‘tratamiento especial’ que podría obstaculizar la generalización y la aplicabilidad. El pegado aumentado modula factores visuales como brillo y nitidez, escalado y rotación, y saturación – entre otros factores.

Del material suplementario del nuevo artículo: agregar OC&P a los marcos de reconocimiento existentes es bastante trivial, y da como resultado una individuación superior de personas en confines muy cercanos. Fuente: https://arxiv.org/src/2210.03686v1/anc/OcclusionCopyPaste_Supplementary.pdf
Además, OC&P regula un tamaño mínimo para cualquier instancia pegada. Por ejemplo, es posible extraer una imagen de una persona de una escena de multitud masiva, que podría pegarse en otra imagen – pero en tal caso, el pequeño número de píxeles involucrados no ayudaría probablemente al reconocimiento. Por lo tanto, el sistema aplica una escala mínima basada en la proporción de longitud de lado igualizada para la imagen objetivo.
Además, OC&P instituye un pegado con conciencia de escala, donde, además de buscar sujetos similares al sujeto pegado, tiene en cuenta el tamaño de las cajas delimitadoras en la imagen objetivo. Sin embargo, esto no conduce a imágenes compuestas que las personas considerarían plausibles o realistas (ver imagen a continuación), sino que ensambla elementos semánticamente apropiados cerca unos de otros de maneras que son útiles durante el entrenamiento.
La realidad muerde
Tanto el trabajo anterior en el que se basa OC&P como la implementación actual otorgan un valor bajo a la autenticidad, o la ‘fotorealidad’ de cualquier imagen ‘montada’ final. Aunque es importante que la ensambladura final no descienda completamente en dadaísmo (de lo contrario, los despliegues en el mundo real de los sistemas entrenados nunca podrían esperar encontrar elementos en tales escenas como se entrenaron), ambos han encontrado que un aumento notable en ‘credibilidad visual’ no solo agrega tiempo de preprocesamiento, sino que tales ‘mejoras de realismo’ probablemente sean contraproducentes.

Del material suplementario del nuevo artículo: ejemplos de imágenes aumentadas con ‘mezcla aleatoria’. Aunque estas escenas pueden parecer alucinógenas para una persona, sin embargo, tienen sujetos similares juntos; aunque las occlusiones son fantasmagóricas para el ojo humano, la naturaleza de una posible occlusión no se puede conocer de antemano, y es imposible de entrenar – por lo tanto, tales ‘cortes’ extraños de forma son suficientes para forzar al sistema entrenado a buscar y reconocer sujetos objetivo parciales, sin necesidad de desarrollar metodologías elaboradas como Photoshop para hacer que las escenas sean más plausibles.
Datos y pruebas
Para la fase de pruebas, el sistema se entrenó en la clase de persona del conjunto de datos MS COCO, que cuenta con 262,465 ejemplos de humanos en 64,115 imágenes. Sin embargo, para obtener máscaras de mejor calidad que las de MS COCO, las imágenes también recibieron anotaciones de máscara LVIS.

Lanzado en 2019, LVIS, de Facebook Research, es un conjunto de datos voluminoso para la segmentación de instancias de vocabulario grande. Fuente: https://arxiv.org/pdf/1908.03195.pdf
Para evaluar cómo bien el sistema aumentado podría contender contra un gran número de imágenes de humanos ocultos, los investigadores enfrentaron a OC&P contra el benchmark OCHuman (Occluded Human).

Ejemplos del conjunto de datos OCHuman, introducido en apoyo del proyecto de detección Pose2Seg en 2018. Esta iniciativa buscaba derivar una mejor segmentación semántica de personas utilizando su postura y pose como delimitador semántico para los píxeles que representan sus cuerpos. Fuente: https://github.com/liruilong940607/OCHumanApi
Dado que el benchmark OCHuman no está anotado exhaustivamente, los investigadores del nuevo artículo crearon un subconjunto de solo aquellos ejemplos que estaban completamente etiquetados, titulado OCHumanFL. Esto redujo el número de instancias de persona a 2,240 en 1,113 imágenes para validación, y 1,923 instancias en 951 imágenes utilizadas para pruebas. Tanto el conjunto original como el recién creado se probaron, utilizando la precisión media promedio (mAP) como métrica principal.
Para la consistencia, la arquitectura se formó con Mask R-CNN con una columna vertebral ResNet-50 y una red de pirámide de características, esta última proporcionando un compromiso aceptable entre precisión y velocidad de entrenamiento.
Con los investigadores habiendo notado el efecto perjudicial de la influencia de ImageNet en situaciones similares, todo el sistema se entrenó desde cero en 4 GPUs NVIDIA V100, durante 75 épocas, siguiendo los parámetros de inicialización de la versión de Facebook de 2021 Detectron 2.
Resultados
Además de los resultados mencionados anteriormente, los resultados de referencia contra MMDetection (y sus tres modelos asociados) para las pruebas indicaron una ventaja clara para OC&P en su capacidad para identificar a los seres humanos de poses complicadas.

Además de superar a PoSeg y Pose2Seg, quizás uno de los logros más destacados del artículo es que el sistema puede aplicarse de manera genérica a los marcos existentes, incluidos aquellos contra los que se enfrentó en las pruebas (ver las comparaciones con/sin en el primer cuadro de resultados, cerca del inicio del artículo).
El artículo concluye:
‘Una de las ventajas clave de nuestro enfoque es que se puede aplicar fácilmente con cualquier modelo o mejora centrada en el modelo. Dado el ritmo al que se mueve el campo del aprendizaje profundo, es beneficioso para todos tener enfoques que sean altamente interoperables con todos los demás aspectos del entrenamiento. Dejamos como trabajo futuro integrar esto con mejoras centradas en el modelo para resolver efectivamente la segmentación de instancias de personas ocultas.’
Potencial para mejorar la síntesis de texto a imagen
El autor principal Evan Ling observó, en un correo electrónico a nosotros*, que el beneficio principal de OC&P es que puede retener las etiquetas de máscara originales y obtener un nuevo valor de ellas ‘de forma gratuita’ en un contexto nuevo – es decir, las imágenes en las que se han pegado.
Aunque la segmentación semántica de humanos parece estar estrechamente relacionada con la dificultad que los modelos como Stable Diffusion tienen para individuar a las personas (en lugar de ‘fusionarlas’, como sucede con frecuencia), cualquier influencia que la cultura de etiquetado semántico pueda tener en los renderizados de humanos pesadillesco que SD y DALL-E 2 a menudo producen es muy, muy upstream.
Los miles de millones de imágenes del subconjunto LAION 5B que habitan el poder generativo de Stable Diffusion no contienen etiquetas de objeto como cajas delimitadoras y máscaras de instancia, incluso si la arquitectura CLIP que compone los renderizados a partir de imágenes y contenido de la base de datos puede haberse beneficiado en algún momento de tal instanciación; más bien, las imágenes de LAION están etiquetadas ‘de forma gratuita’, ya que sus etiquetas se derivaron de metadatos y subtítulos ambientales, etc., que se asociaron con las imágenes cuando se extrajeron del conjunto de datos de la web.
‘Pero aparte de eso,’ Ling nos dijo. ‘algunos tipos de aumento similares a nuestro OC&P se pueden utilizar durante el entrenamiento de modelos generativos de texto a imagen. Pero creo que la realismo de la imagen de entrenamiento aumentada puede convertirse en un problema.
‘En nuestro trabajo, demostramos que no se requiere ‘realismo perfecto’ para la segmentación de instancias supervisada, pero no estoy seguro de que se pueda sacar la misma conclusión para el entrenamiento de modelos generativos de texto a imagen (especialmente cuando se espera que sus salidas sean muy realistas). En este caso, es posible que se necesite más trabajo para ‘perfeccionar’ el realismo de las imágenes aumentadas.’
CLIP ya se está utilizando como una herramienta multimodal posible para la segmentación semántica, lo que sugiere que los sistemas mejorados de reconocimiento y individuación de personas como OC&P podrían eventualmente desarrollarse en filtros o clasificadores internos que rechazarían arbitrariamente las representaciones humanas ‘fusionadas’ y distorsionadas – una tarea que es difícil de lograr actualmente con Stable Diffusion, porque tiene una capacidad limitada para comprender dónde se equivocó (si tuviera tal capacidad, probablemente no habría cometido el error en primer lugar).

Solo uno de los muchos proyectos que actualmente utilizan el marco CLIP de OpenAI – el corazón de DALL-E 2 y Stable Diffusion – para la segmentación semántica. Fuente: https://openaccess.thecvf.com/content/CVPR2022/papers/Wang_CRIS_CLIP-Driven_Referring_Image_Segmentation_CVPR_2022_paper.pdf
‘Otra pregunta sería,’ sugiere Ling. ‘¿funcionará simplemente alimentar a estos modelos generativos con imágenes de humanos ocultos durante el entrenamiento, sin un diseño complementario de la arquitectura del modelo para mitigar el problema de la ‘fusión de humanos’? Esa es probablemente una pregunta difícil de responder de antemano. Definitivamente será interesante ver cómo podemos infundir algún tipo de orientación a nivel de instancia (a través de etiquetas de instancia como la máscara de instancia) durante el entrenamiento de modelos generativos de texto a imagen.’
* 10 de octubre de 2022
Publicado por primera vez el 10 de octubre de 2022.












