Ángulo de Anderson

¿Es DALL-E 2 solo “pegar cosas juntas” sin entender sus relaciones?

mm
Añade Unite.AI a tus fuentes preferidas en Google

Un nuevo artículo de investigación de la Universidad de Harvard sugiere que el marco de texto a imagen de OpenAI, DALL-E 2, tiene dificultades notables para reproducir incluso relaciones entre elementos a nivel de infante, a pesar de la sofisticación deslumbrante de gran parte de su salida.

Los investigadores llevaron a cabo un estudio de usuarios que involucró a 169 participantes de crowdsourcing, quienes fueron presentados con imágenes de DALL-E 2 basadas en los principios básicos humanos de semántica de relaciones, junto con los textos-prompts que los crearon. Cuando se les preguntó si los prompts y las imágenes estaban relacionados, menos del 22% de las imágenes fueron percibidas como pertinentes a sus prompts asociados, en términos de las relaciones muy simples que DALL-E 2 se le pidió que visualizara.

Una captura de pantalla de los ensayos realizados para el nuevo artículo. Los participantes fueron asignados para seleccionar todas las imágenes que coincidían con el prompt. A pesar del aviso en la parte inferior de la interfaz, en todos los casos las imágenes, desconocidas para los participantes, fueron en realidad generadas a partir del prompt asociado mostrado.

Una captura de pantalla de los ensayos realizados para el nuevo artículo. Los participantes fueron asignados para seleccionar todas las imágenes que coincidían con el prompt. Source: https://arxiv.org/pdf/2208.00005.pdf

Los resultados también sugieren que la aparente capacidad de DALL-E para unir elementos dispares puede disminuir a medida que esos elementos se vuelven menos probables de haber ocurrido en los datos de entrenamiento del mundo real que alimentan el sistema.

Por ejemplo, las imágenes para el prompt ‘niño tocando un tazón’ obtuvieron una tasa de acuerdo del 87% (es decir, los participantes hicieron clic en la mayoría de las imágenes como relevantes para el prompt), mientras que renders fotorealistas similares de ‘un mono tocando un iguana’ lograron solo el 11% de acuerdo:

DALL-E lucha por representar el evento improbable de un 'mono tocando un iguana', probablemente porque es inusual, más probablemente inexistente, en el conjunto de entrenamiento.

DALL-E lucha por representar el evento improbable de un ‘mono tocando un iguana’, probablemente porque es inusual, más probablemente inexistente, en el conjunto de entrenamiento.

En el segundo ejemplo, DALL-E 2 frecuentemente obtiene la escala y incluso la especie incorrectas, probablemente debido a la falta de imágenes del mundo real que representen este evento. Por el contrario, es razonable esperar un gran número de fotos de entrenamiento relacionadas con niños y comida, y que este subdominio/clase esté bien desarrollado.

La dificultad de DALL-E para yuxtaponer elementos de imagen ampliamente contrastivos sugiere que el público está actualmente tan deslumbrado por las capacidades fotorealistas y ampliamente interpretativas del sistema que no ha desarrollado un ojo crítico para los casos en los que el sistema ha efectivamente “pegado” un elemento de manera abrupta sobre otro, como en estos ejemplos del sitio oficial de DALL-E 2:

Síntesis de corte y pegado, de los ejemplos oficiales para DALL-E 2. Source: https://openai.com/dall-e-2/

Síntesis de corte y pegado, de los ejemplos oficiales para DALL-E 2. Source: https://openai.com/dall-e-2/

El nuevo artículo establece*:

‘La comprensión relacional es un componente fundamental de la inteligencia humana, que se manifiesta temprano en el desarrollo, y se calcula rápidamente y de manera automática en la percepción.

‘La dificultad de DALL-E 2 con incluso las relaciones espaciales básicas (como en, en, debajo) sugiere que lo que ha aprendido, no ha aprendido aún los tipos de representaciones que permiten a los humanos estructurar el mundo de manera flexible y robusta.

‘Una interpretación directa de esta dificultad es que los sistemas como DALL-E 2 no tienen aún composicionalidad relacional.’

Los autores sugieren que los sistemas de generación de imágenes guiados por texto, como la serie DALL-E, podrían beneficiarse de aprovechar algoritmos comunes en la robótica, que modelan identidades y relaciones simultáneamente, debido a la necesidad del agente de interactuar con el entorno en lugar de simplemente fabricar una mezcla de elementos diversos.

Uno de estos enfoques, titulado CLIPort, utiliza el mismo mecanismo CLIP que sirve como un elemento de evaluación de la calidad en DALL-E 2:

CLIPort, una colaboración de 2021 entre la Universidad de Washington y NVIDIA, utiliza CLIP en un contexto tan práctico que los sistemas entrenados en él deben necesariamente desarrollar una comprensión de las relaciones físicas, un motivador que está ausente en DALL-E 2 y marcos de síntesis de imágenes 'fantásticos' similares. Source: https://arxiv.org/pdf/2109.12098.pdf

CLIPort, una colaboración de 2021 entre la Universidad de Washington y NVIDIA, utiliza CLIP en un contexto tan práctico que los sistemas entrenados en él deben necesariamente desarrollar una comprensión de las relaciones físicas, un motivador que está ausente en DALL-E 2 y marcos de síntesis de imágenes ‘fantásticos’ similares. Source: https://arxiv.org/pdf/2109.12098.pdf

Los autores también sugieren que ‘otra mejora plausible’ podría ser para la arquitectura de los sistemas de síntesis de imágenes, como DALL-E, para incorporar efectos multiplicativos en una sola capa de cálculo, lo que permitiría el cálculo de relaciones de una manera inspirada en las capacidades de procesamiento de información de sistemas biológicos y.

El nuevo artículo se titula Pruebas de comprensión relacional en la generación de imágenes guiada por texto, y proviene de Colin Conwell y Tomer D. Ullman del Departamento de Psicología de Harvard.

Más allá de la crítica temprana

Comentando sobre el ‘truco’ detrás de la realidad y la integridad de la salida de DALL-E 2, los autores señalan trabajos anteriores que han encontrado deficiencias en sistemas de generación de imágenes de estilo DALL-E.

En junio de este año, la Universidad de California en Berkeley notó la dificultad de DALL-E para manejar reflejos y sombras; el mismo mes, un estudio de Corea investigó la ‘unicidad’ y originalidad de la salida de estilo DALL-E 2 con un ojo crítico; un análisis preliminar de imágenes de DALL-E 2, poco después del lanzamiento, de la Universidad de Nueva York y la Universidad de Texas, encontró varios problemas con la composicionalidad y otros factores esenciales en las imágenes de DALL-E 2; y el mes pasado, un trabajo conjunto entre la Universidad de Illinois y el MIT ofreció sugerencias para mejoras arquitectónicas en dichos sistemas en términos de composicionalidad.

Los investigadores también señalan que los luminarios de DALL-E, como Aditya Ramesh, han reconocido los problemas del marco con la unión, el tamaño relativo, el texto y otros desafíos.

Los desarrolladores detrás del sistema de síntesis de imágenes rival de Google, Imagen, también han propuesto DrawBench, un sistema de comparación novedoso que mide la precisión de la imagen en diferentes marcos con métricas diversas.

En lugar de eso, los autores del nuevo artículo sugieren que un mejor resultado podría obtenerse enfrentando la estimación humana, en lugar de métricas algorítmicas internas, contra las imágenes resultantes, para establecer dónde se encuentran las debilidades y qué se podría hacer para mitigarlas.

El estudio

Con este fin, el nuevo proyecto basa su enfoque en principios psicológicos y busca retroceder de la actual oleada de interés en ingeniería de prompts (que es, en efecto, una concesión a las deficiencias de DALL-E 2, o cualquier sistema comparable), para investigar y potencialmente abordar las limitaciones que hacen que dichas ‘soluciones’ sean necesarias.

El artículo establece*:

‘El trabajo actual se centra en un conjunto de 15 relaciones básicas previamente descritas, examinadas o propuestas en la literatura cognitiva, de desarrollo o lingüística. El conjunto contiene relaciones espaciales fundamentadas (por ejemplo, ’X en Y’), y relaciones agénticas más abstractas (por ejemplo, ’X ayudando a Y’).

‘Los prompts son intencionalmente simples, sin complejidad de atributos o elaboración. Es decir, en lugar de un prompt como ‘un burro y un pulpo están jugando un juego. El burro está sosteniendo una cuerda en un extremo, el pulpo está sosteniendo el otro. El burro sostiene la cuerda en su boca. Un gato está saltando sobre la cuerda’, usamos ‘una caja en un cuchillo’.

‘La simplicidad aún capta un amplio rango de relaciones a través de varios subdominios de la psicología humana, y hace que los posibles fallos del modelo sean más llamativos y específicos.’

Para su estudio, los autores reclutaron a 169 participantes de Prolific, todos ubicados en los Estados Unidos, con una edad promedio de 33 años, y el 59% de mujeres.

Los participantes fueron mostrados 18 imágenes organizadas en una cuadrícula de 3×6 con el prompt en la parte superior, y un aviso en la parte inferior que establecía que todas, algunas o ninguna de las imágenes podrían haber sido generadas a partir del prompt mostrado, y se les pidió que seleccionaran las imágenes que creían que estaban relacionadas de esta manera.

Las imágenes presentadas a los individuos se basaron en literatura lingüística, de desarrollo y cognitiva, y comprendían un conjunto de ocho relaciones físicas y siete relaciones ‘agénticas’ (esto se aclarará en un momento).

Relaciones físicas
en, en, debajo, cubriendo, cerca, ocultado por, colgando sobre, y atado a.

Relaciones agénticas
empujando, jalando, tocando, golpeando, pateando, ayudando, y obstaculizando.

Todas estas relaciones se derivaron de los campos de estudio no CS mencionados anteriormente.

Se derivaron así 12 entidades para su uso en los prompts, con seis objetos y seis agentes:

Objetos
caja, cilindro, manta, tazón, taza, y cuchillo.

Agentes
hombre, mujer, niño, robot, mono, y iguana.

(Los investigadores conceden que incluir la iguana, no un pilar de la investigación sociológica o psicológica seca, fue ‘un regalo’)

Para cada relación, se crearon cinco prompts diferentes mediante la muestra aleatoria de dos entidades cinco veces, lo que resultó en 75 prompts totales, cada uno de los cuales se presentó a DALL-E 2, y para cada uno de los cuales se utilizaron las 18 imágenes iniciales suministradas, sin variaciones ni segundas oportunidades permitidas.

Resultados

El artículo establece*:

‘Los participantes informaron en promedio una cantidad baja de acuerdo entre las imágenes de DALL-E 2 y los prompts utilizados para generarlos, con un promedio del 22,2% [18,3, 26,6] en los 75 prompts distintos.

‘Los prompts agénticos, con un promedio del 28,4% [22,8, 34,2] en 35 prompts, generaron un mayor acuerdo que los prompts físicos, con un promedio del 16,9% [11,9, 23,0] en 40 prompts.’

Resultados del estudio. Los puntos en negro denotan todos los prompts, con cada punto como un prompt individual, y el color se desglosa según si el sujeto del prompt era agéntico o físico (es decir, un objeto).

Resultados del estudio. Los puntos en negro denotan todos los prompts, con cada punto como un prompt individual, y el color se desglosa según si el sujeto del prompt era agéntico o físico (es decir, un objeto).

Para comparar la diferencia entre la percepción humana y algorítmica de las imágenes, los investigadores pasaron sus renders a través del marco CLIP de ViT-L/14 de OpenAI de código abierto. Al promediar las puntuaciones, encontraron una ‘relación moderada’ entre los dos conjuntos de resultados, lo que es quizás sorprendente, considerando la medida en que CLIP ayuda a generar las imágenes.

Resultados de la comparación de CLIP (ViT-L/14) con las respuestas humanas.

Resultados de la comparación de CLIP (ViT-L/14) con las respuestas humanas.

Los investigadores sugieren que otros mecanismos dentro de la arquitectura, quizás combinados con una preponderancia casual (o falta) de datos en el conjunto de entrenamiento, pueden explicar la forma en que CLIP puede reconocer las limitaciones de DALL-E sin poder, en todos los casos, hacer mucho al respecto.

Los autores concluyen que DALL-E 2 solo tiene una capacidad nominal, si es que la tiene, para reproducir imágenes que incorporen comprensión relacional, un aspecto fundamental de la inteligencia humana que se desarrolla en nosotros muy temprano.

‘La idea de que los sistemas como DALL-E 2 no tienen composicionalidad puede sorprender a cualquiera que haya visto las respuestas razonables de DALL-E 2 a prompts como ‘un dibujo animado de un rábano daikon en un tutú caminando un poodle’. Prompts como estos a menudo generan una aproximación razonable de un concepto composicional, con todas las partes del prompt presentes y presentes en el lugar correcto.

‘La composicionalidad, sin embargo, no es solo la capacidad de pegar cosas juntas – incluso cosas que nunca se hayan observado juntas antes. La composicionalidad requiere una comprensión de las reglas que unen las cosas. Las relaciones son tales reglas.’

Hombre muerde a T-Rex

Opinión A medida que OpenAI amplía el acceso a un número mayor de usuarios después de su reciente monetización beta de DALL-E 2, y desde que ahora hay que pagar por la mayoría de las generaciones, las limitaciones en la comprensión relacional de DALL-E 2 pueden volverse más aparentes a medida que cada intento ‘fallido’ tiene un peso financiero, y no hay reembolsos disponibles.

Aquellos de nosotros que recibimos una invitación un poco antes hemos tenido tiempo (y, hasta hace poco, más tiempo para jugar con el sistema) para observar algunos de los ‘errores de relación’ que DALL-E 2 puede producir.

Por ejemplo, para un fanático de Parque Jurásico, es muy difícil obtener que un dinosaurio persiga a una persona en DALL-E 2, incluso aunque el concepto de ‘perseguir’ no parece estar en el sistema de censura de DALL-E 2, y aunque la larga historia de películas de dinosaurios debería proporcionar abundantes ejemplos de entrenamiento (al menos en la forma de tráileres y fotos publicitarias) para este encuentro imposible de especies.

Una respuesta típica de DALL-E 2 al prompt 'Una foto en color de un T-Rex persiguiendo a un hombre por una carretera'.

Una respuesta típica de DALL-E 2 al prompt ‘Una foto en color de un T-Rex persiguiendo a un hombre por una carretera’. Source: DALL-E 2

He encontrado que las imágenes de arriba son típicas para variaciones del diseño de prompt ‘[dinosaurio] persiguiendo [una persona]’, y que ninguna cantidad de elaboración en el prompt puede hacer que el T-Rex realmente cumpla. En la primera y segunda fotos, el hombre está (más o menos) persiguiendo al T-Rex; en la tercera, se acerca a él con un desprecio casual por la seguridad; y en la última imagen, aparentemente está corriendo en paralelo a la bestia. A través de unos 10-15 intentos de este tema, he encontrado que el dinosaurio está ‘distruido’ de manera similar.

Puede ser que los únicos datos de entrenamiento que DALL-E 2 pudo acceder fueran en la línea de ‘hombre lucha contra dinosaurio’, de fotos publicitarias de películas más antiguas como Un millón de años antes de Cristo (1966), y que la famosa huida de Jeff Goldblum del rey de los depredadores es simplemente un caso atípico en ese pequeño conjunto de datos.

 

* Mi conversión de las citas en línea de los autores a enlaces.

Publicado por primera vez el 4 de agosto de 2022.

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai