Ángulo de Anderson
El sector de síntesis de imágenes ha adoptado una métrica defectuosa, según afirman investigadores

2021 ha sido un año de progreso sin precedentes y un ritmo frenético de publicaciones en el sector de síntesis de imágenes, ofreciendo una corriente de nuevas innovaciones y mejoras en tecnologías capaces de reproducir personalidades humanas a través de renderizado neural, deepfakes y una serie de enfoques novedosos.
Sin embargo, investigadores de Alemania ahora afirman que el estándar utilizado para juzgar automáticamente la realismo de las imágenes sintéticas está fatalmente defectuoso; y que los cientos, incluso miles de investigadores en todo el mundo que confían en él para reducir el costo de los resultados de evaluación basados en humanos pueden estar siguiendo un camino equivocado.
Para demostrar cómo el estándar, Fréchet Inception Distance (FID), no cumple con los estándares humanos para evaluar imágenes, los investigadores desplegaron sus propias GAN, optimizadas para FID (ahora una métrica común). Descubrieron que FID sigue sus propias obsesiones, basadas en un código subyacente con un propósito muy diferente al de la síntesis de imágenes, y que rutinariamente no logra alcanzar un estándar ‘humano’ de discernimiento:

Puntuaciones FID (menor es mejor) para imágenes generadas por varios modelos utilizando conjuntos de datos y arquitecturas estándar. Los investigadores del nuevo artículo plantean la pregunta ‘¿Estás de acuerdo con estas clasificaciones?’. Fuente: https://openreview.net/pdf?id=mLG96UpmbYz
Además de su afirmación de que FID no es apto para su tarea pretendida, el artículo sugiere que ‘remedios obvios’, como cambiar el motor interno por motores competidores, simplemente intercambiarán un conjunto de sesgos por otro. Los autores sugieren que ahora depende de nuevas iniciativas de investigación desarrollar mejores métricas para evaluar la ‘autenticidad’ en fotos generadas sintéticamente.
El artículo se titula Internalized Biases in Fréchet Inception Distance, y proviene de Steffen Jung en el Instituto Max Planck de Informática en Saarland, y Margret Keuper, profesora de Computación Visual en la Universidad de Siegen.
La búsqueda de un sistema de puntuación para la síntesis de imágenes
Como señala la nueva investigación, el progreso en los marcos de síntesis de imágenes, como GAN y arquitecturas codificador/decodificador, ha superado los métodos por los que se pueden juzgar los resultados de estos sistemas. Además de ser costosos y, por lo tanto, difíciles de escalar, la evaluación humana de la salida de estos sistemas no ofrece un método empírico y reproducible de evaluación.
Por lo tanto, han surgido varios marcos métricos, incluyendo Inception Score (IS), presentado en el artículo de 2016 Técnicas mejoradas para entrenar GAN, coautor por el inventor de GAN, Ian Goodfellow.
La desacreditación de la puntuación IS como una métrica ampliamente aplicable para múltiples redes GAN en 2018 llevó a la adopción generalizada de FID en la comunidad de síntesis de imágenes GAN. Sin embargo, al igual que Inception Score, FID se basa en la red de clasificación de imágenes Inception v3 de Google (IV3).
Los autores del nuevo artículo argumentan que Fréchet Inception Distance propaga sesgos perjudiciales en IV3, lo que lleva a una clasificación no confiable de la calidad de la imagen.
Dado que FID se puede incorporar en un marco de aprendizaje automático como un discriminador (un ‘juez’ incorporado que decide si el GAN está funcionando bien o debe ‘intentarlo de nuevo’), necesita representar con precisión los estándares que un humano aplicaría al evaluar las imágenes.
Fréchet Inception Distance
FID compara cómo se distribuyen las características en el conjunto de datos de entrenamiento utilizado para crear un modelo GAN (o funcionalidad similar) y los resultados de ese sistema.
Por lo tanto, si un marco GAN se entrena en 10.000 imágenes de (por ejemplo) celebridades, FID compara las imágenes originales (reales) con las imágenes falsas producidas por el GAN. La puntuación FID más baja indica que el GAN se ha acercado a las imágenes ‘fotorealistas’, según los criterios de FID.

Del artículo, resultados de un GAN entrenado en FFHQ64, un subconjunto del conjunto de datos FFHQ de NVIDIA. Aquí, aunque la puntuación FID es una baja de 5,38, los resultados no son agradables ni convincentes para el humano promedio.
El problema, según los autores, es que Inception v3, cuyas suposiciones alimentan a Fréchet Inception Distance, no está mirando en los lugares correctos – al menos, no cuando se considera la tarea en cuestión.
Inception V3 se entrena en el desafío de reconocimiento de objetos ImageNet, una tarea que es arguablemente incompatible con la forma en que los objetivos de la síntesis de imágenes han evolucionado en los últimos años. IV3 desafía la robustez de un modelo realizando una ampliación de datos: gira imágenes aleatoriamente, las recorta a una escala aleatoria entre 8-100%, cambia la relación de aspecto (en un rango de 3/4 a 4/3) y aleatoriamente inyecta distorsiones de color relacionadas con el brillo, la saturación y el contraste.
Los investigadores de Alemania han descubierto que IV3 tiene una tendencia a favorecer la extracción de bordes y texturas, en lugar de información de color e intensidad, que serían índices más significativos de autenticidad para imágenes sintéticas; y que su propósito original de detección de objetos ha sido inapropiadamente sequestrado para una tarea inadecuada. Los autores afirman*:
‘[Inception v3] tiene un sesgo hacia la extracción de características basadas en bordes y texturas en lugar de información de color e intensidad. Esto se alinea con su tubería de ampliación que introduce distorsiones de color, pero mantiene intacta la información de alta frecuencia (en contraste con, por ejemplo, la ampliación con desenfoque gaussiano).
‘En consecuencia, FID hereda este sesgo. Cuando se utiliza como métrica de clasificación, los modelos generativos que reproducen bien las texturas pueden ser preferidos sobre los modelos que reproducen bien las distribuciones de color.’
Datos y método
Para probar su hipótesis, los autores entrenaron dos arquitecturas GAN, DCGAN y SNGAN, en el conjunto de datos de caras humanas FFHQ de NVIDIA, muestreado a una resolución de imagen de 642, con el conjunto de datos derivado llamado FFHQ64.
Se realizaron tres procedimientos de entrenamiento GAN: GAN G+D, una red basada en discriminador estándar; GAN FID|G+D, donde FID actúa como un discriminador adicional; y GAN FID|G, donde el GAN está completamente impulsado por la puntuación FID en curso.
Técnicamente, los autores señalan, la pérdida FID debería estabilizar el entrenamiento y potencialmente incluso reemplazar completamente al discriminador (como lo hace en #3, GAN FID|G), mientras produce resultados agradables para los humanos.
En la práctica, los resultados son bastante diferentes, con – los autores hipotetizan – los modelos FID asistidos ‘sobreajustándose’ en las métricas incorrectas. Los investigadores señalan:
‘Hipotetizamos que el generador aprende a producir características inadecuadas para coincidir con la distribución de los datos de entrenamiento. Esta observación se vuelve más grave en el caso de [GAN FID|G]. Aquí, notamos que la falta de discriminador conduce a distribuciones de características espacialmente incoherentes. Por ejemplo [SNGAN FID|G] agrega principalmente ojos individuales y alinea las características faciales de una manera desalentadora.’
Los autores concluyen*:
‘Mientras que los anotadores humanos seguramente preferirían las imágenes producidas por SNGAN D+G sobre SNGAN FID|G (en casos donde se prefiere la fidelidad de los datos sobre el arte), vemos que esto no se refleja en FID. FID no está alineado con la percepción humana.
‘Argumentamos que las características discriminatorias proporcionadas por las redes de clasificación de imágenes no son suficientes para proporcionar la base de una métrica significativa.’
No hay alternativas fáciles
Los autores también descubrieron que intercambiar Inception V3 por un motor similar no alivió el problema. Al sustituir IV3 con ‘una amplia elección de diferentes redes de clasificación’, que se probaron contra ImageNet-C (un subconjunto de ImageNet diseñado para evaluar corrupciones y perturbaciones comúnmente generadas en la salida de las imágenes de los marcos de síntesis de imágenes), los investigadores no pudieron mejorar sustancialmente sus resultados:
‘[Sesgos] presentes en Inception v3 también están ampliamente presentes en otras redes de clasificación. Además, vemos que diferentes redes producirían diferentes clasificaciones entre los tipos de corrupción.’
Los autores concluyen el artículo con la esperanza de que las investigaciones en curso desarrollen una métrica ‘alineada con los humanos y sin sesgos’ capaz de permitir un rango más justo para las arquitecturas de generadores de imágenes.
* Énfasis de los autores.
Publicado por primera vez el 20 de diciembre de 2021, 1 pm GMT+2.













