Ángulo de Anderson
El ‘lenguaje sin sentido’ que podría subvertir los sistemas de moderación de síntesis de imágenes

Nueva investigación de la Universidad de Columbia sugiere que las salvaguardas que impiden que los modelos de síntesis de imágenes como DALL-E 2, Imagen y Parti puedan producir imágenes dañinas o controvertidas son susceptibles a un tipo de ataque adversario que implica ‘palabras inventadas’.
El autor ha desarrollado dos enfoques que podrían potencialmente anular las medidas de moderación de contenido en un sistema de síntesis de imágenes, y ha encontrado que son notablemente robustos incluso en diferentes arquitecturas, lo que indica que la debilidad es más que solo sistémica y puede estar relacionada con algunos de los principios fundamentales de la síntesis de texto a imagen.
El primero y más fuerte de los dos se llama prompting macarrónico. El término ‘macarrónico’ se refiere originalmente a una mezcla de múltiples lenguas, como se encuentra en Esperanto o Unwinese. Quizás el ejemplo más difundido culturalmente sería Urdu-Inglés, un tipo de ‘mezcla de códigos’ común en Pakistán, que mezcla libremente sustantivos en inglés y sufijos en urdu.
En algunos de los ejemplos anteriores, se han pegado juntos fragmentos de palabras significativas, utilizando el inglés como ‘andamio’. Otros ejemplos en el documento utilizan múltiples lenguas a lo largo de una sola llamada.
El sistema responderá de manera semánticamente significativa debido a la falta relativa de curación en las fuentes web en las que se entrenó el sistema. Dichas fuentes muy a menudo llegan completas con etiquetas multilingües (es decir, de conjuntos de datos no diseñados específicamente para una tarea de síntesis de imágenes), y cada palabra ingerida, en cualquier idioma, se convierte en un ‘token’; pero asimismo, partes de esas palabras se convierten en ‘subpalabras’ o tokens fraccionarios. En el Procesamiento de Lenguaje Natural (NLP), este tipo de ‘raíz’ ayuda a distinguir la etimología de palabras derivadas más largas que pueden surgir en operaciones de transformación, pero también crea un enorme ‘conjunto de Lego’ léxico que el ‘prompting creativo’ puede aprovechar.

Las palabras monolingües portmanteau también son efectivas para obtener imágenes a través de lenguaje indirecto o no prosaico, con resultados muy similares obtenibles a menudo en diferentes arquitecturas, como DALL-E 2 y DALL-E Mini (Craiyon).
En el segundo tipo de enfoque, llamado prompting evocador, algunas de las palabras conjuntas son similares en tono a la vertiente más juvenil del ‘latín escolar’ demostrado en La vida de Brian de Monty Python (1979).

No es una broma – el latín falso a menudo tiene éxito en evocar una respuesta significativa de DALL-E 2.
El autor afirma:
‘Una preocupación obvia con este método es la circunvenión de los filtros de contenido basados en llamadas prohibidas. En principio, el prompting macarrónico podría proporcionar una forma fácil y aparentemente confiable de eludir dichos filtros para generar contenido dañino, ofensivo, ilegal o sensible, incluidas imágenes violentas, odiosas, racistas, sexistas o pornográficas, e incluso imágenes que infrinjan la propiedad intelectual o que representen a personas reales.
‘Las empresas que ofrecen generación de imágenes como servicio han puesto mucho cuidado en prevenir la generación de dichas salidas de acuerdo con su política de contenido. En consecuencia, el prompting macarrónico debería investigarse sistemáticamente como una amenaza a los protocolos de seguridad utilizados para la generación de imágenes comerciales.’
El autor sugiere una serie de soluciones contra esta vulnerabilidad, algunas de las cuales admite que podrían considerarse excesivamente restrictivas.
La primera solución posible es la más costosa: curar las imágenes de entrenamiento de origen con más cuidado, con más supervisión humana y menos algorítmica. Sin embargo, el documento admite que esto no impediría que el sistema de síntesis de imágenes creara una conjunción ofensiva entre dos conceptos de imagen que por sí mismos son potencialmente inofensivos.
En segundo lugar, el documento sugiere que los sistemas de síntesis de imágenes podrían ejecutar su salida real a través de un sistema de filtros, interceptando cualquier asociación problemática antes de que se sirva al usuario. Es posible que DALL-E 2 ya opere un filtro de este tipo, aunque OpenAI no ha revelado exactamente cómo funciona la moderación de contenido de DALL-E 2.
Finalmente, el autor considera la posibilidad de una ‘lista blanca de diccionario’, que solo permitiría palabras verificadas y aprobadas para recuperar y representar conceptos, pero admite que esto podría representar una restricción excesivamente severa en la utilidad del sistema.
Aunque el investigador solo experimentó con cinco lenguas (inglés, alemán, francés, español e italiano) al crear conjuntos de llamadas, cree que este tipo de ‘ataque adversario’ podría volverse aún más ‘críptico’ y difícil de detener al extender el número de lenguas, dado que los modelos de hipercala como DALL-E 2 se entrenan en múltiples lenguas (simplemente porque es más fácil utilizar entrada ligeramente filtrada o ‘cruda’ que considerar el enorme gasto de curarla, y porque la dimensionalidad adicional probablemente agregue utilidad al sistema).
El documento se titula Ataques adversarios en la generación de imágenes con palabras inventadas, y proviene de Raphaël Millière en la Universidad de Columbia.
Lenguaje críptico en DALL-E 2
Se ha sugerido anteriormente que el galimatías que DALL-E 2 produce siempre que intenta representar lenguaje escrito podría ser en sí mismo un ‘vocabulario oculto’. Sin embargo, la investigación previa sobre este lenguaje misterioso no ha ofrecido forma de desarrollar cadenas de nonce que puedan invocar imágenes específicas.
De los trabajos previos, el documento establece:
‘[No] ofrece un método confiable para encontrar cadenas de nonce que eliciten imágenes específicas. La mayoría del texto sin sentido incluido por DALL-E 2 en las imágenes no parece estar asociado de manera fiable con conceptos visuales específicos cuando se transcribe y se utiliza como llamada. Esto limita la viabilidad de este enfoque como una forma de eludir la moderación de contenido dañino u ofensivo; como tal, no es un riesgo particularmente preocupante para el mal uso de los modelos de generación de imágenes guiados por texto.’
En cambio, los dos métodos del autor se elaboran como medios para que el sinsentido pueda invocar imágenes relacionadas y significativas mientras elude la etiqueta convencional que ahora se desarrolla en ingeniería de llamadas.
Por ejemplo, el autor considera la palabra para ‘pájaros’ en las cinco lenguas que están dentro del alcance del documento: Vögel en alemán, uccelli en italiano, oiseaux en francés, y pájaros en español.
Con la codificación de pares de bytes (BPE) utilizada por la implementación de CLIP que se integra en DALL-E 2, las palabras se tokenizan en inglés sin acentos, y se pueden ‘combinar creativamente’ para formar palabras de nonce que parecen ser sinsentido para nosotros, pero retienen su significado pegado para DALL-E 2, lo que permite al sistema expresar la intención percibida:
En el ejemplo anterior, dos de las ‘palabras extranjeras’ para pájaro se pegan juntas en una cadena de sinsentido. Gracias al peso fraccionario de las subpalabras, se mantiene el significado.
El autor enfatiza que los resultados significativos también se pueden obtener sin adherirse a los límites de la segmentación de subpalabras, presumiblemente porque DALL-E 2 (el estudio principal del documento) se ha generalizado lo suficiente como para dejar que los límites de las subpalabras se desdibujen sin destruir su significado.
Para demostrar aún más los enfoques desarrollados, el documento ofrece ejemplos de prompting macarrónico en diferentes dominios, utilizando la lista de palabras de token ilustrada a continuación (con palabras híbridas sin sentido en el extremo derecho).
El autor afirma que los siguientes ejemplos de DALL-E 2 no son ‘seleccionados cuidadosamente’:
Lingua franca
El documento también observa que varios ejemplos funcionan igualmente bien, o al menos muy similares, en DALL-E 2 y DALL-E Mini (ahora Craiyon), y que esto es sorprendente, ya que DALL-E 2 es un modelo de difusión y DALL-E Mini no lo es; los dos sistemas se entrenan en diferentes conjuntos de datos; y DALL-E Mini utiliza un tokenizador BART en lugar del tokenizador CLIP favorito de DALL-E 2.

Resultados sorprendentemente similares de DALL-E Mini, en comparación con la imagen anterior, que presentó resultados de la misma ‘entrada sin sentido’ de DALL-E 2.
Como se ve en la primera de las imágenes anteriores, el prompting macarrónico también se puede ensamblar en oraciones sintácticamente correctas para generar escenas más complejas. Sin embargo, esto requiere utilizar el inglés como ‘andamio’ para ensamblar los conceptos, lo que hace que el procedimiento sea más probable que sea interceptado por los sistemas de censura estándar en un marco de síntesis de imágenes.
El documento observa que la hibridación léxica, el ‘pegado’ de palabras para eliciar contenido relacionado de un sistema de síntesis de imágenes, también se puede lograr en un solo idioma, mediante el uso de palabras portmanteau.
Prompting evocador
El enfoque de ‘prompting evocador’ presentado en el documento depende de ‘evocar’ una respuesta más amplia del sistema con palabras que no se basan estrictamente en subpalabras o subtokens o etiquetas compartidas parcialmente.
Un tipo de prompting evocador es el pseudolatín, que puede, entre otros usos, generar imágenes de medicinas ficticias, incluso sin especificar que DALL-E 2 debe recuperar el concepto de ‘medicina’:
El prompting evocador también funciona particularmente bien con llamadas sin sentido que se relacionan ampliamente con posibles ubicaciones geográficas, y funciona de manera bastante confiable en diferentes arquitecturas de DALL-E 2 y DALL-E Mini:

Las palabras utilizadas para estas llamadas a DALL-E 2 y DALL-E Mini son evocadoras de nombres reales, pero en sí mismas son completamente sin sentido. Sin embargo, los sistemas han ‘captado la atmósfera’ de las palabras.
Parece haber cierta superposición entre el prompting macarrónico y el evocador. El documento establece:
‘Parece que las diferencias en los datos de entrenamiento, el tamaño del modelo y la arquitectura del modelo pueden hacer que los modelos diferentes analicen llamadas como voiscellpajaraux y eidelucertlagarzard de manera ‘macarrónica’ o ‘evocadora’, incluso cuando estos modelos se han demostrado ser receptivos a ambos métodos de llamada.’
El documento concluye:
‘Si bien varias propiedades de estos modelos – incluyendo el tamaño, la arquitectura, el procedimiento de tokenización y los datos de entrenamiento – pueden influir en su vulnerabilidad a los ataques adversarios basados en texto, la evidencia preliminar discutida en este trabajo sugiere que algunos de estos ataques pueden funcionar de manera bastante confiable en los modelos.’
Arguablemente, el mayor obstáculo para la experimentación real alrededor de estos métodos es el riesgo de ser marcado y prohibido por el sistema anfitrión. DALL-E 2 requiere un número de teléfono asociado con cada cuenta de usuario, limitando la cantidad de ‘cuentas de un solo uso’ que probablemente se necesitarían para probar realmente los límites de este tipo de pirateo léxico, en términos de subvertir los métodos de moderación existentes. Actualmente, la principal salvaguarda de DALL-E 2 sigue siendo la volatilidad del acceso.
Publicado por primera vez el 9 de agosto de 2022.

















