Ángulo de Anderson
Un sistema de detección para marcos de síntesis de imágenes puros como DALL-E 2

Nueva investigación de la Universidad de California en Berkeley ofrece un método para determinar si la salida de la nueva generación de marcos de síntesis de imágenes – como DALL-E 2 de Open AI, y Imagen y Parti de Google – puede ser detectada como ‘no real’, estudiando la geometría, las sombras y las reflexiones que aparecen en las imágenes sintetizadas.
Al estudiar imágenes generadas por prompts de texto en DALL-E 2, los investigadores han encontrado que, a pesar de la impresionante realidad de la que es capaz la arquitectura, algunas inconsistencias persistentes ocurren relacionadas con la representación de la perspectiva global, la creación y disposición de sombras y, especialmente, con respecto a la representación de objetos reflejados.
El documento establece:
‘[Las] estructuras geométricas, las sombras proyectadas y las reflexiones en superficies reflectantes no son completamente consistentes con la geometría de perspectiva esperada de las escenas naturales. Las estructuras geométricas y las sombras son, en general, localmente consistentes, pero globalmente inconsistentes.
‘Las reflexiones, por otro lado, a menudo se representan de manera poco plausible, presumiblemente porque son menos comunes en el conjunto de datos de entrenamiento de imágenes.’

Una falta de intersecciones consistentes entre el objeto renderizado y la representación de su reflexión es actualmente una forma confiable de detectar una imagen de DALL-E 2, según el nuevo estudio. Fuente: https://arxiv.org/pdf/2206.14617.pdf
El documento representa una primera incursión en lo que puede convertirse eventualmente en una rama notable en la comunidad de investigación de visión por computadora – Detección de síntesis de imágenes.
Desde el surgimiento de los deepfakes en 2017, la detección de deepfakes (primariamente de la salida de autoencoder de paquetes como DeepFaceLab y FaceSwap) se ha convertido en una rama académica activa y competitiva, con varios documentos y metodologías que apuntan a los ‘indicios’ evolutivos de caras sintetizadas en metrajes de video reales.
No obstante, hasta la reciente emergencia de sistemas de generación de imágenes hiperscalables, la salida de sistemas de síntesis de texto como CLIP no suponía una amenaza para el status quo de la ‘realidad fotográfica’. Los autores del nuevo documento creen que esto está a punto de cambiar, y que incluso las inconsistencias que han descubierto en la salida de DALL-E 2 pueden no suponer mucha diferencia en la capacidad de las imágenes para engañar a los espectadores.
Los autores establecen*:
‘[Estos] fallos pueden no importar mucho al sistema visual humano, que se ha encontrado que es sorprendentemente inepto en ciertos juicios geométricos, incluyendo inconsistencias en iluminación, sombras, reflexiones, posición de vista y distorsión de perspectiva.’
Credibilidad desvanecida
La primera examinación forense de los autores sobre la salida de DALL-E 2 se relaciona con la proyección de perspectiva – la forma en que la posición de bordes rectos en objetos y texturas cercanos debe resolverse uniformemente en un ‘punto de fuga’.

Izquierda, líneas paralelas en el mismo plano resuelven en un punto de fuga común; derecha, múltiples puntos de fuga en el mismo y planos paralelos definen una línea de fuga (representada en rojo).
Para probar la consistencia de DALL-E 2 en este respecto, los autores utilizaron DALL-E 2 para generar 25 imágenes sintetizadas de cocinas – un espacio familiar que, incluso en viviendas bien amuebladas, suele ser lo suficientemente pequeño como para proporcionar múltiples puntos de fuga para una variedad de objetos y texturas.
Al examinar la salida del prompt ‘una foto de una cocina con suelo de baldosas’, los investigadores encontraron que, a pesar de una representación generalmente convincente en cada caso (excepto algunos artefactos extraños y más pequeños no relacionados con la perspectiva), los objetos representados nunca parecen converger correctamente.

Los autores observan que, aunque cada conjunto de líneas paralelas del patrón de baldosas es consistente y se cruza en un solo punto de fuga (azul en la imagen de abajo), el punto de fuga de la encimera (cian) no coincide con las líneas de fuga (rojo) y el punto de fuga derivado de las baldosas.

Los autores observan que, incluso si la encimera no es paralela a las baldosas, el punto de fuga cian debería resolverse en la línea de fuga (roja) definida por los puntos de fuga de las baldosas del suelo.
El documento establece:
‘Aunque la perspectiva en estas imágenes es – impresionantemente – localmente consistente, no es globalmente consistente. Este mismo patrón se encontró en cada una de las 25 imágenes de cocina sintetizadas.’
Forensics de sombras
Como cualquier persona que haya tratado con ray-tracing sabe, las sombras también tienen puntos de fuga potenciales, que indican iluminación de una sola fuente o múltiples fuentes. Para sombras exteriores en luz solar intensa, se esperaría que las sombras en todas las facetas de una imagen se resolvieran consistentemente en la fuente única de luz (el sol).
Al igual que en el experimento anterior, los investigadores crearon 25 imágenes de DALL-E 2 con el prompt ‘tres cubos en una acera fotografiados en un día soleado’, así como 25 más con el prompt ‘‘tres cubos en una acera fotografiados en un día nublado’.

En la fila superior, imágenes creadas a partir del prompt de los investigadores ‘tres cubos en una acera fotografiados en un día nublado’; en la fila inferior, imágenes creadas a partir del prompt ‘tres cubos en una acera fotografiados en un día soleado’.
Los investigadores observan que, al representar condiciones nubladas, DALL-E 2 es capaz de renderizar las sombras más difusas asociadas de manera convincente y plausible, quizás no en menor medida porque este tipo de sombra es probablemente más prevalente en el conjunto de datos de entrenamiento de imágenes en el que se entrenó el marco.
No obstante, algunas de las ‘fotografías’ soleadas, los autores encontraron, eran inconsistentes con una escena iluminada por una fuente de luz única.

Para la imagen de arriba, las generaciones se han convertido a escala de grises para mayor claridad, y muestran cada objeto con su propio ‘sol’ dedicado.
Aunque el espectador promedio puede no detectar tales anomalías, algunas de las imágenes generadas tenían ejemplos más manifiestos de ‘falla de sombra’:

Mientras que algunas de las sombras están simplemente en el lugar equivocado, muchas de ellas, interesantemente, corresponden al tipo de discrepancia visual producida en el modelado de CGI cuando la tasa de muestreo para una luz virtual es demasiado baja.
Reflexiones en DALL-E 2
Los resultados más condenatorios en términos de análisis forense vinieron cuando los autores probaron la capacidad de DALL-E 2 para crear superficies reflectantes altamente reflectantes, lo que es un cálculo oneroso también en el ray-tracing de CGI y otros algoritmos de renderizado tradicionales.
Para este experimento, los autores produjeron 25 imágenes de DALL-E 2 con el prompt ‘una foto de un dinosaurio de juguete y su reflexión en un espejo de vanidad’.
En todos los casos, los autores informan, la imagen del dinosaurio de juguete renderizado en el espejo estaba de alguna manera desconectada del aspecto y disposición del ‘dinosaurio real’.
Parece haber una lógica en algunos de los errores – el primer y tercer ejemplo en la fila superior parecen mostrar un dinosaurio que se duplica muy bien, pero no se refleja.
Los autores comentan:
‘A diferencia de las sombras proyectadas y las estructuras geométricas en las secciones anteriores, DALL·E-2 lucha por sintetizar reflexiones plausibles, presumiblemente porque tales reflexiones son menos comunes en su conjunto de datos de entrenamiento de imágenes.’
Glitches como estos pueden ser corregidos en futuros modelos de texto a imagen que puedan revisar más efectivamente la lógica semántica general de su salida, y que puedan imponer reglas físicas abstractas en escenas que han sido, en cierta medida, ensambladas a partir de características pertinentes de palabras en el espacio latente del sistema.
A la luz de una tendencia creciente hacia arquitecturas de síntesis cada vez más grandes, los autores concluyen:
‘[Puede] ser solo cuestión de tiempo antes de que los motores de síntesis de imágenes por texto aprendan a renderizar imágenes con consistencia de perspectiva completa. Hasta ese momento, sin embargo, los análisis forenses geométricos pueden ser útiles para analizar estas imágenes.’
* Mi conversión de las citas en línea de los autores a enlaces.
Publicado por primera vez el 30 de junio de 2022.













