Ángulo de Anderson
Cómo saber cuándo los sistemas de síntesis de imágenes producen material genuinamente “original”

Un nuevo estudio de Corea del Sur ha propuesto un método para determinar si los sistemas de síntesis de imágenes producen imágenes verdaderamente novedosas o solo variantes “menores” de los datos de entrenamiento, lo que podría frustrar el objetivo de tales arquitecturas (como la producción de imágenes novedosas y originales).
Muy a menudo, el artículo sugiere, lo último es cierto, porque las métricas existentes que tales sistemas utilizan para mejorar sus capacidades generativas a lo largo del entrenamiento están obligadas a favorecer imágenes que están relativamente cerca de las imágenes de origen (no falsas) en el conjunto de datos.
Después de todo, si una imagen generada es “visualmente cercana” a los datos de origen, es inevitable que obtenga una mejor puntuación para “autenticidad” que para “originalidad”, ya que es “fiel” – aunque no inspiradora.
En un sector demasiado incipiente y no probado para que sus ramificaciones legales sean aún conocidas, esto podría convertirse en un importante tema legal, si se descubre que el contenido de imágenes sintéticas comercializadas no se diferencia lo suficiente del material de origen (a menudo) con derechos de autor que actualmente se permite que perfunde el sector de investigación en forma de conjuntos de datos web raspados populares (la posibilidad de futuras reclamaciones de infracción de este tipo ha ganado prominencia fairly recientemente en relación con el AI Co-Pilot de Microsoft GitHub).
En términos de la salida cada vez más coherente y semánticamente robusta de sistemas como DALL-E 2 de OpenAI, Imagen de Google y CogView de China (así como la DALL-E mini de menor especificación), hay muy pocas formas post facto de probar de manera fiable la originalidad de una imagen generada.
De hecho, buscar algunas de las imágenes de DALL-E 2 más populares a menudo solo conduce a más instancias de esas mismas imágenes, dependiendo del motor de búsqueda.

Subir un grupo de salida completo de 9 imágenes DALL-E 2 solo conduce a más grupos de salida DALL-E 2, porque la estructura de la cuadrícula es la característica más fuerte. Separar y subir la primera imagen (de esta publicación de Twitter del 8 de junio de 2022, de la cuenta ‘Weird Dall-E Generations’) hace que Google se fije en el baloncesto de la imagen, llevando la búsqueda de imágenes por un callejón semántico sin salida. Para la misma búsqueda de imágenes, Yandex parece estar haciendo al menos algún tipo de descomposición y coincidencia de características basadas en píxeles.
Aunque Yandex es más probable que Google Search que utilice las características reales (es decir, las características derivadas/calculadas de una imagen, no necesariamente las características faciales de las personas) y las características visuales (en lugar de semánticas) de una imagen enviada para encontrar imágenes similares, todos los motores de búsqueda de imágenes tienen alguna clase de agenda o práctica que puede hacer que sea difícil identificar instancias de plagio fuente>generada a través de búsquedas web.
Además, los datos de entrenamiento para un modelo generativo pueden no estar disponibles públicamente en su totalidad, lo que obstaculiza aún más el examen forense de la originalidad de las imágenes generadas.
Interesantemente, realizar una búsqueda de imágenes en una de las imágenes sintéticas presentadas por Google en su sitio dedicado a Imagen no encuentra nada comparable al tema de la imagen, en términos de realmente mirar la imagen y buscar imágenes similares de manera imparcial. Más bien, fijado semánticamente como siempre, los resultados de la búsqueda de imágenes de Google para esta imagen de Imagen no permitirán una búsqueda de imágenes pura sin agregar los términos de búsqueda ‘imagen google’ como parámetro adicional (y limitante):
Yandex, por otro lado, encuentra una multitud de imágenes similares (o al menos visualmente relacionadas) de la comunidad artística amateur:
En general, sería mejor si la novedad u originalidad de la salida de los sistemas de síntesis de imágenes pudiera medirse de alguna manera, sin necesidad de extraer características de todas las imágenes web posibles en internet en el momento en que se entrenó el modelo, o en conjuntos de datos no públicos que pueden estar utilizando material con derechos de autor.
Relacionado con este problema, investigadores de la Escuela de Graduados de Inteligencia Artificial Kim Jaechul del Instituto de Ciencia y Tecnología Avanzada de Corea (KAIST AI) han colaborado con la empresa global de ICT y búsqueda NAVER Corp para desarrollar una Puntuación de Raridad que pueda ayudar a identificar las creaciones más originales de los sistemas de síntesis de imágenes.

Las imágenes aquí se generan a través de StyleGAN-FFHQ. De izquierda a derecha, las columnas indican los peores a los mejores resultados. Podemos ver que la métrica ‘Truncation trick’ (ver abajo) y la métrica de Realismo tienen sus propias agendas, mientras que la nueva ‘Puntuación de Raridad’ (fila superior) busca imágenes coherentes pero originales (en lugar de solo coherentes). Dado que hay límites de tamaño de imagen en este artículo, consulte el papel de origen para más detalles y resolución. Fuente: https://arxiv.org/pdf/2206.08549.pdf
El nuevo artículo se titula Puntuación de Raridad: una nueva métrica para evaluar la rareza de las imágenes sintetizadas, y proviene de tres investigadores de KAIST y tres de NAVER Corp.
Más allá del ‘Truco Barato’
Entre las métricas anteriores que el nuevo artículo busca mejorar se encuentran el ‘Truncation trick’ sugerido en 2019 en una colaboración entre la Universidad Heriot-Watt del Reino Unido y DeepMind de Google.
El Truncation Trick utiliza básicamente una distribución latente diferente para muestrear que la utilizada para entrenar el modelo generativo.
Los investigadores que desarrollaron este método se sorprendieron de que funcionara, pero admiten en el artículo original que reduce la variedad de la salida generada. Sin embargo, el Truncation Trick se ha vuelto efectivo y popular, en el contexto de lo que podría ser redefinido como un ‘truco barato’ para obtener resultados auténticos que no asimilan realmente todas las posibilidades inherentes a los datos, y pueden parecerse más a los datos de origen de lo que se desea.
En cuanto al Truncation Trick, los autores del nuevo artículo observan:
‘[Esto] no pretende generar muestras raras en los conjuntos de datos de entrenamiento, sino más bien sintetizar imágenes típicas de manera más estable. Hipotetizamos que los modelos generativos existentes podrán producir muestras más ricas en la distribución de datos reales si el generador puede ser inducido a producir efectivamente muestras raras.’
En general, la tendencia a confiar en métricas tradicionales como la Distancia de Inception de Frechet (FID, que fue objeto de críticas intensas en diciembre de 2021), la puntuación de Inception (IS) y la Distancia de Inception del Kernel (KID) como ‘indicadores de progreso’ durante el entrenamiento de un modelo generativo, los autores comentan además*:
‘Este esquema de aprendizaje lleva al generador a no sintetizar muchas muestras raras que son únicas y tienen características fuertes que no representan una gran proporción de la distribución de imágenes reales. Ejemplos de muestras raras de conjuntos de datos públicos incluyen personas con varios accesorios en FFHQ, animales blancos en AFHQ y estatuas poco comunes en Metfaces.
‘La capacidad de generar muestras raras es importante no solo porque está relacionada con la capacidad de borde de los modelos generativos, sino también porque la singularidad juega un papel importante en aplicaciones creativas como los humanos virtuales.
‘Sin embargo, los resultados cualitativos de varios estudios recientes rara vez contienen estos ejemplos raros. Conjeturamos que la naturaleza del esquema de aprendizaje adversativo fuerza la distribución de imágenes generadas a ser similar a la del conjunto de datos de entrenamiento. Por lo tanto, las imágenes con individualidad o rareza clara solo ocupan una pequeña parte de las imágenes sintetizadas por los modelos.’
Técnica
Los investigadores han adaptado una idea presentada en obras anteriores – el uso de K-Nearest Neighbors (KNNs) para representar los arrays de datos genuinos (de entrenamiento) y sintéticos (de salida) en un sistema de síntesis de imágenes.
En cuanto a este método de análisis, los autores afirman:
‘Hipotetizamos que las muestras ordinarias estarían más cerca entre sí, mientras que las muestras únicas y raras estarían dispersas en el espacio de características.’
La imagen de resultados anterior muestra las distancias de vecinos más cercanos (NND) más pequeñas a las más grandes, en una arquitectura StyleGAN entrenada en FFHQ.
‘Para todos los conjuntos de datos, las muestras con las NND más pequeñas muestran imágenes típicas y representativas. Por el contrario, las muestras con las NND más grandes tienen una fuerte individualidad y son significativamente diferentes de las imágenes típicas con las NND más pequeñas.’
En teoría, al utilizar esta nueva métrica como discriminador, o al menos incluyéndola en una arquitectura de discriminador más compleja, un sistema generativo podría ser dirigido lejos de la mera imitación hacia un algoritmo más inventivo, mientras mantiene la cohesión esencial de conceptos que pueden ser críticos para la producción de imágenes auténticas (es decir, ‘hombre’, ‘mujer’, ‘coche’, ‘iglesia’, etc.).
Comparaciones y Experimentos
En pruebas, los investigadores realizaron una comparación del rendimiento de la Puntuación de Raridad con el Truncation Trick y la Puntuación de Realismo de NVIDIA de 2019, y encontraron que en una variedad de marcos y conjuntos de datos, el enfoque es capaz de identificar resultados ‘únicos’.
Si bien los resultados presentados en el artículo son demasiado extensos para incluirlos aquí, los investigadores parecen haber demostrado la capacidad del nuevo método para identificar rareza en imágenes tanto de origen (reales) como generadas (falsas) en un procedimiento generativo:

Ejemplos seleccionados de los resultados visuales extensos reproducidos en el artículo (consulte la URL de origen anterior para más detalles). A la izquierda, ejemplos genuinos de FFHQ que tienen muy pocos vecinos cercanos (es decir, son novedosos y poco comunes) en el conjunto de datos original; a la derecha, imágenes falsas generadas por StyleGAN, que la nueva métrica ha identificado como verdaderamente novedosas. Dado que hay límites de tamaño de imagen en este artículo, consulte el papel de origen para más detalles y resolución.
La nueva métrica de Puntuación de Raridad no solo permite la posibilidad de identificar salida generativa ‘novedosa’ en una sola arquitectura, sino que también, según afirman los investigadores, permite comparaciones entre modelos generativos de diversas arquitecturas (es decir, autoencoder, VAE, GAN, etc.).
El artículo señala que la Puntuación de Raridad difiere de las métricas anteriores al centrarse en la capacidad de un marco generativo para crear imágenes únicas y raras, en oposición a las métricas ‘tradicionales’, que examinan (de manera más miope) la diversidad entre generaciones durante el entrenamiento del modelo.
Más allá de Tareas Limitadas
Aunque los investigadores del nuevo artículo han realizado pruebas en marcos de dominio limitado (como combinaciones de generador/conjunto de datos diseñadas específicamente para producir imágenes de personas o gatos, por ejemplo), la Puntuación de Raridad puede potencialmente aplicarse a cualquier procedimiento de síntesis de imágenes arbitrario donde se desee identificar ejemplos generados que utilicen las distribuciones derivadas de los datos entrenados, en lugar de aumentar la autenticidad (y reducir la diversidad) al interponer distribuciones latentes extranjeras o confiar en otros ‘atajos’ que comprometan la novedad en favor de la autenticidad.
En efecto, dicha métrica podría potencialmente distinguir instancias de salida verdaderamente novedosas en sistemas como la serie DALL-E, al utilizar la distancia identificada entre un resultado aparente ‘outlier’, los datos de entrenamiento y los resultados de prompts o entradas similares (es decir, prompts de imágenes).
En la práctica, y en ausencia de una comprensión clara de la medida en que el sistema ha asimilado realmente conceptos visuales y semánticos (a menudo obstaculizados por el conocimiento limitado sobre los datos de entrenamiento), esto podría ser un método viable para identificar un momento genuino de ‘inspiración’ en un sistema generativo – el punto en el que un número adecuado de conceptos y datos de entrada han resultado en algo verdaderamente inventivo, en lugar de algo excesivamente derivado o cercano a los datos de origen.
* Mis conversiones de las citas en línea de los autores a enlaces.
Publicado por primera vez el 20 de junio de 2022.














