Ángulo de Anderson

La solución única de DALL-E 2 para los dobles significados

mm
Añade Unite.AI a tus fuentes preferidas en Google

Cualquiera que haya aprendido italiano aprende temprano a prestar atención al contexto al describir una escoba, porque la palabra italiana para este objeto doméstico cotidiano tiene un significado extremadamente inapropiado como verbo*. Aunque aprendemos temprano a desentrañar el mapeo semántico y la aplicabilidad de las palabras con múltiples significados, esta no es una habilidad que sea fácil de transmitir a sistemas de síntesis de imágenes a gran escala como DALL-E 2 y Stable Diffusion, porque confían en el módulo de preentrenamiento de lenguaje y imagen contrastivo de OpenAI (CLIP), que trata los objetos y sus propiedades de manera más flexible (aunque está ganando terreno en el espacio de síntesis de imágenes y videos de difusión latente).

Al estudiar esta deficiencia, una nueva colaboración de investigación de la Universidad Bar-Ilan y el Instituto Allen de Inteligencia Artificial ofrece un estudio extenso sobre la medida en que DALL-E 2 está dispuesto a cometer errores semánticos de este tipo:

Significados dobles separados en múltiples objetos en DALL-E 2 - aunque cualquier sistema de difusión latente puede producir ejemplos como estos. En la imagen superior derecha, eliminar 'oro' del prompt cambia la especie de pez, mientras que en el caso de la 'zebra cruzando', es necesario especificar explícitamente la superficie de la carretera para eliminar la asociación duplicada. Fuente: https://export.arxiv.org/pdf/2210.10606

Significados dobles separados en múltiples interpretaciones en DALL-E 2 – aunque cualquier sistema de difusión latente puede producir ejemplos como estos. En la imagen superior derecha, eliminar ‘oro’ del prompt cambia la especie de pez, mientras que en el caso de la ‘zebra cruzando’, es necesario especificar explícitamente la superficie de la carretera para eliminar la asociación duplicada. Fuente: https://export.arxiv.org/pdf/2210.10606

Los autores han encontrado que esta tendencia a interpretar palabras y frases de doble manera parece no ser solo común a todos los modelos de difusión guiados por CLIP, sino que empeora a medida que los modelos se entrenan con cantidades cada vez mayores de datos. El documento señala que las versiones ‘reducidas’ de los modelos de texto a imagen, incluyendo DALL-E Mini (ahora Craiyon), producen estos tipos de errores con mucha menos frecuencia, y que Stable Diffusion también se equivoca menos – aunque solo porque, muy a menudo, no sigue el prompt en absoluto, lo que es otro tipo de error.

El prompt simple 'fecha' fuerza a DALL-E 2 a invocar dos de los varios significados de la palabra, mientras que la palabra 'ventilador' también se divide en dos de sus mapeos semánticos, y, en la tercera imagen, la frase 'cono' convierte la comida no especificada en el prompt en helado, que se asocia con 'cono'.

El prompt simple ‘fecha’ fuerza a DALL-E 2 a invocar dos de los varios significados de la palabra, mientras que la palabra ‘ventilador’ también se divide en dos de sus mapeos semánticos, y, en la tercera imagen, la frase ‘cono’ convierte la comida no especificada en el prompt en helado, que se asocia con ‘cono’.

Explicando cómo realizamos separaciones léxicas eficientes, el documento establece:

‘Mientras que los símbolos – así como las estructuras de oraciones – pueden ser ambiguos, una vez que se construye una interpretación, esta ambigüedad ya se ha resuelto. Por ejemplo, mientras que el símbolo ‘murciélago’ en un ‘murciélago volador’ puede interpretarse como un palo de madera o un animal, nuestras posibles interpretaciones de la oración son o un ‘murciélago volador de madera’ o un ‘murciélago volador animal’, pero nunca ambos al mismo tiempo. Una vez que la palabra ‘murciélago’ se ha utilizado en la interpretación para denotar un objeto (por ejemplo, un palo de madera), no se puede volver a utilizar para denotar otro objeto (un animal) en la misma interpretación.’

DALL-E 2, observa el documento, no está limitado de esta manera:

'Un murciélago está volando sobre un estadio de béisbol' - la primera imagen es del documento, las otras tres se obtuvieron simplemente alimentando el mismo prompt en DALL-E 2.

‘Un murciélago está volando sobre un estadio de béisbol’ – la primera imagen es del documento, las otras tres se obtuvieron simplemente alimentando el mismo prompt en DALL-E 2.

Esta propiedad ha sido denominada sensibilidad a los recursos.

El documento identifica tres comportamientos anómalos exhibidos por DALL-E 2: que una palabra o frase puede ser interpretada y efectivamente bifurcada en dos entidades distintas, representando un objeto o concepto para cada uno en la misma escena; que una palabra puede ser interpretada como un modificador de dos entidades diferentes (ver los ejemplos de ‘pez dorado’ y otros anteriormente); y que una palabra puede ser interpretada simultáneamente como un modificador y una entidad alternativa – ejemplificado por el prompt ‘un foca está abriendo una carta’:

'Un foca está abriendo una carta' - la primera ilustración es del documento, las tres adyacentes son reproducciones idénticas de DALL-E 2. Los ejemplos fotorealistas a continuación tenían el texto adicional 'foto, Canon50, 85mm, F5.6, foto premiado'.

‘Un foca está abriendo una carta’ – la primera ilustración es del documento, las tres adyacentes son reproducciones idénticas de DALL-E 2. Los ejemplos fotorealistas a continuación tenían el texto adicional ‘foto, Canon50, 85mm, F5.6, foto premiado’.

Los autores identifican dos modos de fallo para los modelos de difusión en este respecto: que los resultados de los prompts de los usuarios con palabras ambiguas a menudo exhibirán la palabra concretizada junto con alguna manifestación del concepto; y fuga de concepto, donde las propiedades de un objeto ‘se filtran’ en otro objeto representado.

‘Tomados en conjunto, los fenómenos que examinamos proporcionan evidencia de las limitaciones en la capacidad lingüística de DALLE-2 y abren avenidas para futuras investigaciones que descubrirían si esas limitaciones provienen de problemas con la codificación de texto, el modelo generativo o ambos. Más en general, el enfoque propuesto se puede extender a otros escenarios en los que el proceso de descodificación se utiliza para descubrir el sesgo inductivo y las limitaciones de los modelos de texto a imagen.’

Utilizando 17 palabras que harán que DALL-E 2 divida la entrada en múltiples salidas, los autores observaron que la homónima duplicación ocurrió en más del 80% de 216 imágenes renderizadas.

Los investigadores utilizaron pares de control de estímulo para examinar la medida en que el lenguaje específico y, arguablemente, sobre-especificado es necesario para detener estas duplicaciones. Para las pruebas de entidad a propiedad, se crearon 10 pares, y los autores señalan que los prompts de estímulo provocan la propiedad compartida en el 92,5% de los casos, mientras que el prompt de control solo la provoca en el 6,6% de los casos.

‘[Para] demostrar, considere un zebra y una calle, aquí, el zebra es una entidad, pero modifica la calle, y DALLE-2 constantemente genera pasos de peatones, posiblemente debido a la similitud de las franjas del zebra con un paso de peatones. Y en línea con nuestra conjetura, el control de un zebra y una calle de grava especifica un tipo de calle que normalmente no tiene pasos de peatones, y de hecho, todas nuestras muestras de control para este prompt no contienen un paso de peatones.’

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai