Ángulo de Anderson

Automatización de la protección de derechos de autor en imágenes generadas por IA

mm
Añade Unite.AI a tus fuentes preferidas en Google
ChatGPT-4o: ' 1792x1024px image of a Front view of a British high court tribunal composed of three robots in judicial wigs. They are all examining an 8x10 photograph, but we cannot see what the photograph is, because its back is towards us. HQ, cinematic still'

Como se discutió la semana pasada, incluso los modelos de base detrás de los sistemas de IA generativos populares pueden producir contenido que infringe derechos de autor, debido a la curación inadecuada o desalineada, así como a la presencia de múltiples versiones de la misma imagen en los datos de entrenamiento, lo que lleva a sobreajuste, y aumenta la probabilidad de reproducciones reconocibles.

A pesar de los esfuerzos por dominar el espacio de la IA generativa, y la creciente presión para frenar la infracción de propiedad intelectual, las principales plataformas como MidJourney y DALL-E de OpenAI siguen enfrentando desafíos para prevenir la reproducción involuntaria de contenido con derechos de autor:

La capacidad de los sistemas generativos para reproducir datos con derechos de autor se presenta regularmente en los medios.

La capacidad de los sistemas generativos para reproducir datos con derechos de autor se presenta regularmente en los medios.

Como surgen nuevos modelos, y los modelos chinos ganen dominio, la supresión de material con derechos de autor en los modelos de base es una perspectiva onerosa; de hecho, el líder del mercado OpenAI declaró el año pasado que es ‘imposible’ crear modelos efectivos y útiles sin datos con derechos de autor.

Arte previo

En cuanto a la generación involuntaria de material con derechos de autor, la escena de investigación enfrenta un desafío similar al de la inclusión de contenido para adultos y otros materiales NSFW en los datos de origen: se quiere aprovechar el conocimiento (es decir, anatomía humana correcta, que históricamente siempre se ha basado en estudios de desnudos) sin la capacidad de abusar de él.

De manera similar, los creadores de modelos quieren aprovechar el enorme alcance de los materiales con derechos de autor que se encuentran en conjuntos de datos de gran escala como LAION, sin que el modelo desarrolle la capacidad de infringir realmente la propiedad intelectual.

Al descartar los riesgos éticos y legales de intentar ocultar el uso de material con derechos de autor, filtrar para el último caso es significativamente más desafiante. El contenido para adultos a menudo contiene características latentes de bajo nivel que permiten un filtrado cada vez más efectivo sin requerir comparaciones directas con material del mundo real. Por el contrario, las incrustaciones latentes que definen millones de obras con derechos de autor no se reducen a un conjunto de marcadores fáciles de identificar, lo que hace que la detección automatizada sea mucho más compleja.

CopyJudge

El juicio humano es una mercancía escasa y costosa, tanto en la curación de los conjuntos de datos como en la creación de filtros y sistemas de “seguridad” diseñados para garantizar que el material con derechos de autor no se entregue a los usuarios de los portales basados en API como MidJourney y la capacidad de generar imágenes de ChatGPT.

Por lo tanto, una nueva colaboración académica entre Suiza, Sony AI y China ofrece CopyJudge – un método automatizado para orquestar grupos sucesivos de “jueces” de ChatGPT que pueden examinar las entradas en busca de signos de posible infracción de derechos de autor.

CopyJudge evalúa varias generaciones de AI que infringen la propiedad intelectual. Fuente: https://arxiv.org/pdf/2502.15278

CopyJudge evalúa varias generaciones de AI que infringen la propiedad intelectual. Fuente: https://arxiv.org/pdf/2502.15278

CopyJudge ofrece efectivamente un marco automatizado que utiliza grandes modelos de visión-lenguaje (LVLM) para determinar la similitud sustancial entre imágenes con derechos de autor y las producidas por modelos de difusión de texto a imagen.

El enfoque de CopyJudge utiliza el aprendizaje por refuerzo para optimizar las solicitudes que infringen los derechos de autor, y luego utiliza la información de dichas solicitudes para crear nuevas solicitudes que sean menos propensas a invocar imágenes con derechos de autor.

El enfoque de CopyJudge utiliza el aprendizaje por refuerzo y otros enfoques para optimizar las solicitudes que infringen los derechos de autor, y luego utiliza la información de dichas solicitudes para crear nuevas solicitudes que sean menos propensas a invocar imágenes con derechos de autor.

Aunque muchos generadores de imágenes en línea basados en IA filtran las solicitudes de los usuarios para contenido para adultos, material con derechos de autor, recreación de personas reales y otros dominios prohibidos, CopyJudge utiliza en su lugar solicitudes “infractoras” refinadas para crear solicitudes “sanitizadas” que sean las menos propensas a evocar imágenes no permitidas, sin la intención de bloquear directamente la solicitud del usuario.

Aunque este no es un enfoque nuevo, va algunos pasos hacia la liberación de los sistemas generativos basados en API de simplemente rechazar la entrada del usuario (no menos porque esto permite a los usuarios desarrollar acceso trasero a generaciones no permitidas, a través de la experimentación).

Un exploit reciente (desde cerrado por los desarrolladores) permitió a los usuarios generar material pornográfico en la plataforma de IA generativa Kling simplemente incluyendo una cruz o crucifijo prominente en la imagen subida en un flujo de trabajo de imagen a video.

En una laguna parcheada por los desarrolladores de Kling a fines de 2024, los usuarios podían forzar al sistema a producir contenido para adultos prohibido simplemente incluyendo una cruz o crucifijo en la imagen de semilla de I2V. No ha habido explicación sobre la lógica detrás de este hack ahora expirado; pero se podría imaginar que se diseñó para permitir 'nudez cristiana (masculina) aceptable' en representaciones de una crucifixión; e invocar una 'imagen de cruz' efectivamente 'desbloqueaba' una salida para adultos más amplia; pero es posible que nunca lo sepamos.

En una laguna parcheada por los desarrolladores de Kling a fines de 2024, los usuarios podían forzar al sistema a producir contenido para adultos prohibido simplemente incluyendo una cruz o crucifijo en la imagen de semilla de I2V. Fuente: Discord

Casos como este enfatizan la necesidad de sanitización de solicitudes en los sistemas generativos en línea, sobre todo since la desaprendizaje de la máquina, en el que el modelo de base se altera para eliminar conceptos prohibidos, puede tener efectos no deseados en la usabilidad del modelo final.

Buscando soluciones menos drásticas, el sistema CopyJudge imita los juicios legales humanos utilizando IA para descomponer las imágenes en elementos clave como la composición y el color, para filtrar las partes no protegidas por derechos de autor, y comparar lo que queda. También incluye un método impulsado por IA para ajustar las solicitudes y modificar la generación de imágenes, lo que ayuda a evitar problemas de derechos de autor mientras se preserva el contenido creativo.

Los resultados experimentales, según mantienen los autores, demuestran la equivalencia de CopyJudge con los enfoques de vanguardia en esta búsqueda, e indican que el sistema exhibe una generalización y una interpretación superiores, en comparación con trabajos anteriores.

El nuevo artículo se titula CopyJudge: Identificación y mitigación automatizada de infracción de derechos de autor en modelos de difusión de texto a imagen, y proviene de cinco investigadores de EPFL, Sony AI y la Universidad Westlake de China.

Método

Aunque CopyJudge utiliza GPT para crear tribunales rodantes de jueces automatizados, los autores enfatizan que el sistema no se ha optimizado para el producto de OpenAI, y que cualquier número de modelos de visión-lenguaje grande (LVLM) alternativos podría usarse en su lugar.

En primer lugar, el marco de abstracción-filtración-comparación de los autores se requiere para descomponer las imágenes de origen en partes constituyentes, como se ilustra en el lado izquierdo del esquema a continuación:

Esquema conceptual para la fase inicial del flujo de trabajo de CopyJudge.

Esquema conceptual para la fase inicial del flujo de trabajo de CopyJudge.

En la esquina inferior izquierda, vemos un agente de filtración que descompone las secciones de la imagen en un intento de identificar características que podrían ser nativas de una obra con derechos de autor en concierto, pero que en sí mismas serían demasiado genéricas para calificar como una violación.

Posteriormente, se utilizan múltiples LVLM para evaluar los elementos filtrados – un enfoque que ha demostrado ser eficaz en artículos como el ofrecimiento de 2023 de CSAIL Mejorando la facticidad y el razonamiento en los modelos de lenguaje a través del debate multiagente, y ChatEval, entre otros diversos reconocidos en el nuevo artículo.

Los autores declaran:

‘[Adoptamos] un enfoque de debate multiagente completamente conectado y sincrónico, donde cada LVLM recibe las [respuestas] de los [otros] LVLM antes de hacer el próximo juicio. Esto crea un bucle de retroalimentación dinámico que fortalece la confiabilidad y la profundidad del análisis, ya que los modelos adaptan sus evaluaciones basadas en nuevas ideas presentadas por sus pares.

‘Cada LVLM puede ajustar su puntuación basada en las respuestas de los otros LVLM o mantenerla sin cambios.’

Se incluyen también pares de imágenes puntuadas por humanos a través del aprendizaje de pocos disparos en contexto’

Una vez que los “tribunales” en el bucle han llegado a una puntuación de consenso que está dentro del rango de aceptabilidad, los resultados se pasan a un LVLM “juez” que sintetiza los resultados en una puntuación final.

Mitigación

A continuación, los autores se centraron en el proceso de mitigación de solicitudes descrito anteriormente.

Esquema de CopyJudge para mitigar la infracción de derechos de autor mediante la refinación de solicitudes y ruido latente. El sistema ajusta las solicitudes de forma iterativa basada en la retroalimentación iterativa y utiliza el aprendizaje por refuerzo para modificar las variables latentes, reduciendo el riesgo de infracción.

Esquema de CopyJudge para mitigar la infracción de derechos de autor mediante la refinación de solicitudes y ruido latente. El sistema ajusta las solicitudes de forma iterativa, utilizando el aprendizaje por refuerzo para modificar las variables latentes a medida que las solicitudes evolucionan, con la esperanza de reducir el riesgo de infracción.

Los dos métodos utilizados para la mitigación de solicitudes fueron el control de solicitudes basado en LVLM, donde se desarrollan de forma iterativa solicitudes no infractoras efectivas a través de clústeres de GPT – un enfoque que es completamente “caja negra”, que no requiere acceso interno a la arquitectura del modelo; y un enfoque basado en aprendizaje por refuerzo (RL), donde la recompensa se diseña para penalizar las salidas que infringen la propiedad intelectual.

Datos y pruebas

Para probar CopyJudge, se utilizaron varios conjuntos de datos, incluyendo D-Rep, que contiene pares de imágenes reales y falsas puntuadas por humanos en una escala de calificación de 0 a 5.

Explorando el conjunto de datos D-Rep en Hugging Face. Esta colección empareja imágenes reales y generadas. Fuente: https://huggingface.co/datasets/WenhaoWang/D-Rep/viewer/default/

Explorando el conjunto de datos D-Rep en Hugging Face. Esta colección empareja imágenes reales y generadas. Fuente: https://huggingface.co/datasets/WenhaoWang/D-Rep/viewer/default/

El esquema de CopyJudge consideró imágenes de D-Rep que obtuvieron una puntuación de 4 o más como ejemplos de infracción, con el resto retenido como no relevantes para la propiedad intelectual. Las 4000 imágenes oficiales del conjunto de datos se utilizaron como imágenes de prueba. Además, los investigadores seleccionaron y curaron imágenes de 10 personajes de dibujos animados famosos de Wikipedia.

Las tres arquitecturas de difusión utilizadas para generar imágenes potencialmente infractoras fueron Stable Diffusion V2; Kandinsky2-2; y Stable Diffusion XL. Los autores seleccionaron manualmente una imagen infractora y una no infractora de cada uno de los modelos, llegando a 60 muestras positivas y 60 negativas.

Los métodos de referencia seleccionados para la comparación fueron: L2 norm; Learned Perceptual Image Patch Similarity (LPIPS); SSCD; RLCP; y PDF-Emb. Para las métricas, se utilizaron Precisión y puntuación F1 como criterios para la infracción.

Se utilizó GPT-4o para poblar los equipos de debate internos de CopyJudge, utilizando tres agentes para un máximo de cinco iteraciones en cualquier imagen presentada. Se utilizó una imagen aleatoria de tres de cada calificación en D-Rep como prior humanos para que los agentes los consideraran.

Resultados de infracción para CopyJudge en la primera ronda.

Resultados de infracción para CopyJudge en la primera ronda.

De estos resultados, los autores comentan:

‘[Es] evidente que los métodos tradicionales de detección de copias de imágenes exhiben limitaciones en la tarea de identificación de infracción de derechos de autor. Nuestro enfoque supera significativamente a la mayoría de los métodos. Para el método de vanguardia, PDF-Emb, que se entrenó con 36,000 muestras del conjunto de datos D-Rep, nuestro rendimiento en D-Rep es ligeramente inferior.

‘Sin embargo, su pobre rendimiento en el conjunto de datos de personajes de dibujos animados y obras de arte destaca su falta de capacidad de generalización, mientras que nuestro método demuestra resultados igualmente excelentes en todos los conjuntos de datos.’

Los autores también señalan que CopyJudge proporciona un límite ‘relativamente’ más distinto entre casos válidos y casos de infracción:

Más ejemplos de las rondas de pruebas, en el material suplementario del nuevo artículo.

Más ejemplos de las rondas de pruebas, en el material suplementario del nuevo artículo.

Los investigadores compararon sus métodos con una colaboración de Sony AI de 2024 titulada Detección, explicación y mitigación de la memorización en modelos de difusión. Este trabajo utilizó un modelo de difusión estable afinado con 200 imágenes memorizadas (es decir, sobreajustadas) para provocar datos con derechos de autor en el momento de la inferencia.

Los autores del nuevo trabajo encontraron que su propio método de mitigación de solicitudes, en comparación con el enfoque de 2024, pudo producir imágenes menos propensas a causar infracción.

Resultados de la mitigación de la memorización con CopyJudge en comparación con el trabajo de 2024.

Resultados de la mitigación de la memorización con CopyJudge en comparación con el trabajo de 2024.

Los autores comentan aquí:

‘[Nuestro] enfoque puede generar imágenes que son menos propensas a causar infracción mientras mantiene una precisión de coincidencia comparable, ligeramente reducida. Como se muestra en [la imagen a continuación], nuestro método evita efectivamente las limitaciones del [método anterior], incluida la incapacidad de mitigar la memorización o generar imágenes muy desviadas.’

Comparación de imágenes generadas y solicitudes antes y después de la mitigación de la memorización.

Comparación de imágenes generadas y solicitudes antes y después de la mitigación de la memorización.

Los autores realizaron pruebas adicionales con respecto a la mitigación de la infracción, estudiando infracción explícita e infracción implícita.

Infracción explícita ocurre cuando las solicitudes hacen referencia directa a material con derechos de autor, como ‘Generar una imagen de Mickey Mouse’. Para probar esto, los investigadores utilizaron 20 muestras de personajes de dibujos animados y obras de arte, generando imágenes infractoras en Stable Diffusion v2 con solicitudes que incluían explícitamente nombres o atribuciones de autor.

Comparación entre el método de Control de Latente (LC) de los autores y el método de Control de Solicitudes (PC) del trabajo anterior, en diversas variaciones, utilizando Stable Diffusion para crear imágenes que representan infracción explícita.

Comparación entre el método de Control de Latente (LC) de los autores y el método de Control de Solicitudes (PC) del trabajo anterior, en diversas variaciones, utilizando Stable Diffusion para crear imágenes que representan infracción explícita.

Infracción implícita ocurre cuando una solicitud carece de referencias explícitas a derechos de autor pero aún resulta en una imagen infractora debido a ciertos elementos descriptivos – un escenario que es particularmente relevante para los modelos de texto a imagen comerciales, que a menudo incorporan sistemas de detección de contenido para identificar y bloquear solicitudes relacionadas con derechos de autor.

Para explorar esto, los autores utilizaron las mismas muestras de propiedad intelectual que en la prueba de infracción explícita, pero generaron imágenes infractoras sin referencias directas a derechos de autor, utilizando DALL-E 3 (aunque el artículo señala que el módulo de detección de seguridad integrado del modelo rechazó ciertas solicitudes que activaron sus filtros).

Infracción implícita utilizando DALLE-3, con puntuaciones de infracción y CLIP.

Infracción implícita utilizando DALLE-3, con puntuaciones de infracción y CLIP.

Los autores declaran:

‘[Es] visible que nuestro método reduce significativamente la probabilidad de infracción, tanto para la infracción explícita como para la implícita, con solo una ligera disminución en la puntuación CLIP. La puntuación de infracción después de solo el control de latentes es relativamente más alta que después del control de solicitudes porque recuperar latentes no infractores sin cambiar la solicitud es bastante desafiante. Sin embargo, podemos reducir efectivamente la puntuación de infracción mientras mantenemos una calidad de coincidencia de imagen-texto más alta.’

‘[La imagen a continuación] muestra resultados de visualización, donde se puede observar que evitamos la infracción de propiedad intelectual mientras preservamos los requisitos del usuario.’

Imágenes generadas antes y después de la mitigación de la infracción de propiedad intelectual.

Imágenes generadas antes y después de la mitigación de la infracción de propiedad intelectual.

Conclusión

Aunque el estudio presenta un enfoque prometedor para la protección de derechos de autor en imágenes generadas por IA, la dependencia de los grandes modelos de visión-lenguaje (LVLM) para la detección de infracción podría generar preocupaciones sobre el sesgo y la coherencia, ya que los juicios impulsados por IA pueden no siempre alinearse con los estándares legales.

Quizás lo más importante, el proyecto también asume que la aplicación de la ley de derechos de autor puede automatizarse, a pesar de que las decisiones legales del mundo real a menudo involucran factores subjetivos y contextuales que la IA puede tener dificultades para interpretar.

En el mundo real, la automatización del consenso legal, especialmente alrededor de la salida de la IA, parece probable que siga siendo un tema controvertido mucho más allá de este momento, y mucho más allá del alcance del dominio abordado en este trabajo.

 

Publicado por primera vez el lunes, 24 de febrero de 2025

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai