Ángulo de Anderson
Dar ‘identidades secretas’ a personajes de animación con derechos de autor

Nueva investigación de China ofrece una forma no invasiva de proteger personajes de animación con derechos de autor, ‘inyectando’ sustitutos genéricos durante la generación de imágenes. Pero ¿puede este método derrotar la ingenuidad de los piratas de prompts?
Dado el alcance del material con derechos de autor presente en conjuntos de datos de hipercala (debido al costo de eliminar tales infracciones), los modelos entrenados en ellos tienden a poder reproducir personajes con derechos de autor.
La edición directa del modelo entrenado, o el uso de filtros para interceptar palabras clave cuando el modelo es accedido por API, a menudo puede ser sorteada describiendo el elemento con derechos de autor de manera elíptica:
Un personaje con derechos de autor producido por un chatbot de IA popular, aparentemente sin invocación directa de nombres de personajes. Fuente
En una línea de investigación fuerte y persistente, las técnicas de modificación de modelo han intentado alterar parámetros en un modelo entrenado, con resultados variables:
De la publicación de 2023 ‘Ablating Concepts in Text-to-Image Diffusion Models’, representaciones fotorealistas de la actriz Brie Larson como ‘Capitana Marvel’ – integradas en un modelo de difusión popular – se convierten en imágenes de dibujos animados relacionadas cuando se solicita al usuario. Fuente
Sin embargo, la ablación suele ser un proceso dañino e impreciso, y uno que puede afectar frecuentemente otras características del modelo entrenado; además, hay varias formas de sortearlo.
El otro enfoque popular es la ‘prompt negativa’, en la que se envía una ‘anti-prompt’ adicional al modelo, diseñada para restringir la salida. Cuando los modelos se acceden a través de API (como todos los modelos de vanguardia, por ejemplo), una ‘prompt negativa secreta’ se puede enviar junto con la prompt del usuario conocida, que comprende una rubrica diseñada para evitar que el modelo proporcione material prohibido al usuario. Este enfoque, aunque popular como un vector de protección de derechos de autor, no siempre funciona.
La mayor parte del trabajo sobre la censura post-facto de inferencia se ocupa del problema más amplio de asegurarse de que los modelos no produzcan CSAM, o cualquier tipo de material NSFW, a pesar de las grandes cantidades de dicho material probablemente presentes en los datos de entrenamiento de un modelo importante. Estas iniciativas pueden afectar clases enteras de contenido, en lugar de instancias específicas, y generalmente carecen de la necesaria sutileza para abordar las preocupaciones de los titulares de derechos de autor que buscan suprimir identidades específicas.
Dobles
Con esto en mente, un nuevo artículo de China propone reemplazar personajes de animación con derechos de autor durante la generación de imágenes con sustitutos genéricos aprendidos – ‘dobles’ que conservan suficiente forma y estructura del personaje para preservar la escena circundante, mientras se eliminan los detalles distintivos asociados con el personaje protegido:
Representaciones ‘anonimizadas’ de material con derechos de autor de otro modo presente y accesible en un modelo entrenado, logradas mediante el nuevo método de incrustación. Fuente
Crucialmente, esta intervención ocurre durante la generación sin modificar o ajustar el modelo de difusión subyacente, y se puede ajustar para determinar hasta qué punto se elimina el personaje original.
El enfoque tácitamente reconoce que la modificación del modelo es un método pobre para este propósito, e introduce incrustaciones elaboradas en el proceso de inferencia – incrustaciones diseñadas para ‘reestructurar’ en lugar de ablar (anular, eliminar) el activo con derechos de autor. El proceso no afecta ni modifica el modelo base en absoluto, y así puede reutilizarse o adaptarse en una variedad de modelos.
Aunque el método se probó por los autores en el rango de modelos Stable Diffusion más antiguo, también se probó con éxito en la arquitectura Z-Image mucho más reciente, lo que sugiere que el concepto de los autores es aplicable en una gama de arquitecturas generativas.
El artículo establece:
‘[Proponemos] un método controlable que opera en la representación textual continua del modelo para borrar personajes objetivo durante la generación. [Optimizamos] una incrustación de ancla a través de restricciones estructurales y detalladas para servir como un sustituto de personaje, luego [reemplazamos] incrustaciones relacionadas con el objetivo con la ancla a través de una estrategia adaptativa consciente de la estructura.
‘Los experimentos muestran que nuestro método logra una efectividad de borrado óptima y una preservación de la fidelidad de la imagen, mientras admite un grado de borrado controlable, eliminación de varios objetivos y transferibilidad de modelos.
‘Además, nuestras anclas optimizadas son compatibles con las líneas base de modificación de modelos actuales para mejorar su rendimiento de borrado.’
El nuevo método abarca diversas arquitecturas y ofrece un control granular, según los autores.
El nuevo artículo se titula Borrar pero preservar: Eliminación controlable de personajes de animación con derechos de autor a través de anclas semánticas optimizadas, y proviene de siete autores en el Instituto de Ingeniería de la Información de la Academia China de Ciencias, y la Universidad de la Academia China de Ciencias en Beijing.
Método
La idea central detrás del nuevo método, como se ilustra a continuación, es crear un sustituto para cada personaje con derechos de autor que conserve su forma y estructura generales, mientras elimina los detalles visuales distintivos que hacen que el personaje sea reconocible – y luego utilizar este sustituto durante la generación de imágenes cada vez que se solicite el personaje protegido.
Esquema para el nuevo enfoque.
El sustituto, al que los autores denominan ancla, está diseñado para conservar suficiente forma y estructura del personaje original para encajar naturalmente en la misma escena, mientras elimina los detalles que hacen que el personaje sea distintivo.
Para lograr esto, el sistema compara información estructural gruesa generada para el personaje original con la generada para la ancla en desarrollo, empujando a los dos hacia una forma general similar. Una imagen de referencia del personaje con derechos de autor se utiliza para el propósito opuesto, empujando a la ancla lejos de sus detalles reconocibles más finos:

Método para construir un sustituto no infractor para un personaje con derechos de autor. La estructura general del personaje se conserva mientras se suprimen sus detalles visuales distintivos, produciendo una ‘ancla’ optimizada para su uso durante la generación.
La ancla resultante ocupa, por lo tanto, un terreno intermedio deliberadamente diseñado entre la preservación de la composición solicitada y la eliminación de la identidad protegida.
Alejar la ancla
Una vez que se han establecido estas propiedades, la ancla necesita traducirse en algo que el modelo de difusión pueda entender. El término de ancla Ancla* [sic] se le da su propia representación aprendida dentro del codificador de texto CLIP, creando efectivamente una nueva palabra/artículo artificial, cuyo significado puede moldearse sin cambiar el modelo subyacente de generación de imágenes.
Esta nueva representación se ajusta repetidamente según los objetivos estructurales y de detalles descritos anteriormente, enseñando a Ancla* a significar algo con forma general similar al personaje protegido, pero desprovisto de su apariencia identificadora.
El resto del codificador de texto permanece congelado durante este proceso, mientras que los tokens de inicio, fin y relleno ordinarios que rodean Ancla* proporcionan el contexto necesario para convertir esta pseudo-palabra recién aprendida en las incrustaciones finales utilizadas durante la generación.
Sustitución adaptativa
Durante la generación (inferencia), el algoritmo busca en la prompt codificada términos asociados con el personaje protegido y sustituye las incrustaciones de ancla aprendidas en su lugar, mientras también ajusta las incrustaciones de fin y relleno que llevan información contextual.
Para prepararse para esto, el sistema primero permite que la denoising establezca la composición general de la imagen solicitada, monitoreando los cambios en su estructura gruesa para determinar cuándo esa disposición ha comenzado a estabilizarse:
Representación de cuándo se produce el reemplazo de la ancla durante la generación de imágenes. Los cambios en la estructura de la imagen gruesa se rastrean a lo largo del denoising, con el reemplazo desencadenado alrededor del punto donde la disposición general se estabiliza y comienzan a surgir detalles más finos.
En la imagen anterior vemos que esta transición ocurre aproximadamente en el paso de tiempo 720, donde el cambio estructural medido alcanza su pico y luego comienza a disminuir. En este punto, la disposición general de la imagen ha formado en gran medida, lo que permite que la ancla reemplace al personaje protegido, mientras reduce el riesgo de perturbar la composición establecida.
Datos y pruebas
Los autores compararon su enfoque con cinco líneas base basadas en prompts: Difusión latente segura (SLD); STG; SAFREE; TraSCE; y Prompt negativa (NP).
Las incrustaciones de ancla optimizadas también se integraron en cuatro métodos de modificación de modelos existentes: MACE; UCE; ESD-u; y AC. Esto se hizo para probar si estos podrían mejorar el modelo propuesto en cuanto a la eliminación de personajes.
Para la evaluación, se reunió un conjunto de datos de 80 personajes de animación, que comprendía 36 personajes antropomórficos; 23 personajes con forma de animal; y 21 de categorías misceláneas – con todos los personajes seleccionados porque podían ser reproducidos de manera confiable por modelos de difusión.
Luego se generaron 100 imágenes para cada personaje, utilizando prompts producidos por GPT-4o.
Stable Diffusion v1.4 se utilizó para los experimentos principales, con la transferibilidad probada adicionalmente en versiones adicionales de Stable Diffusion v1.5; V2; v2.1; XL base 1.0; y también la arquitectura DiT más reciente Z-Image. No se realizó ningún ajuste fino de modelo, lo que dejó los parámetros de cada modelo preentrenado sin cambios.
Para las métricas, LLaVA-1.5 y BLIP-3 midieron si el personaje objetivo seguía siendo reconocible, con una precisión de identificación más baja que indicaba una eliminación más completa; Índice de similitud estructural (SSIM) midió la preservación estructural; Métricas de similitud perceptual aprendidas (LPIPS) midieron la diferencia perceptual; y Puntuación del predictor estético V2 evaluó la calidad visual de la imagen alterada.
Fréchet Inception Distance (FID) y Puntuación CLIP se calcularon adicionalmente a partir de prompts no relacionados en COCO-30K, para medir si la generación de imágenes normales había sido afectada:
Resultados de las pruebas que comparan los métodos de eliminación de personajes en 80 personajes de animación. Las dos primeras columnas miden con qué frecuencia el personaje supuestamente eliminado todavía podía ser reconocido, por lo que las puntuaciones más bajas indican una mejor eliminación. Las columnas restantes miden cómo se preservaron la imagen original y la generación no relacionada. Las flechas muestran si las puntuaciones más altas o más bajas son preferibles; el negrita indica el mejor resultado y el subrayado el segundo mejor.
De estos resultados iniciales para la comparación cuantitativa, los autores declaran:
‘En comparación con todas las líneas base, las imágenes borradas utilizando nuestro método logran las precisiones más bajas para la identificación exitosa del objetivo por LLaVA-1.5 (6.0%) y BLIP-3 (4.0%), con reducciones de 3.5% y 1.7% en comparación con la segunda más baja, respectivamente.
‘Esto demuestra la efectividad de borrado de nuestro método, ya que efectivamente [engaña] a los grandes modelos multimodales.’
En cuanto a la fidelidad de la imagen, el método de los autores produjo la puntuación SSIM más alta, con 0.467, y la puntuación LPIPS más baja en 0.505 – lo que indica la preservación más fuerte de contenido no relacionado y estructura de fondo entre los métodos probados. También logró la puntuación más alta del predictor estético V2 entre los métodos de eliminación de personajes, con 5.18, lo que sugiere que esta preservación no se produce a expensas de la calidad visual general.
Una prueba cualitativa siguió:
Resultados de las pruebas que comparan la eliminación de personajes en cinco personajes de animación. Cada fila muestra resultados de un método diferente, con las generaciones originales de Stable Diffusion v1.4 en la parte superior y el método propuesto en la parte inferior. El método propuesto reemplaza más consistentemente los personajes objetivo mientras preserva la escena circundante. Por favor, consulte el PDF de fuente original o el sitio del proyecto para una resolución ligeramente mejor.
Según el artículo, los ejemplos muestran diferencias particularmente claras para personajes con formas y atributos más complejos, con Pato Donald y Super Mario citados como ejemplos:
‘[Nuestro] método logra la eliminación perfecta de personajes de animación a través de anclas optimizadas, mientras que las líneas base basadas en prompts a menudo fallan—particularmente para personajes con formas y atributos complejos (por ejemplo, Pato Donald y Super Mario).
‘Además, nuestro método logra la coherencia de fondo sin los artefactos de desenfoque o deformación, lo que admite flujos de trabajo creativos iterativos.’
Control granular
Un espacio de incrustación continuo también permite ajustar la fuerza de la eliminación del personaje, en lugar de tratar la eliminación como una proposición de todo o nada. Al interpolar entre la ancla optimizada y la incrustación de objetivo original, el método puede restaurar progresivamente más del personaje, mientras conserva la estructura de la imagen circundante:
Imágenes de prueba que muestran diferentes grados de eliminación de personajes. Las tres primeras columnas muestran el personaje original, la versión eliminada y las características visuales eliminadas; las columnas restantes muestran ajustes intermedios en α=0.25, 0.5 y 0.75. Los valores de α más altos conservan progresivamente más del personaje original.
Como se muestra arriba, los autores también probaron este control en los personajes Winnie the Pooh; Olaf; Minnie Mouse; y Stitch. La similitud estructural permaneció relativamente estable a medida que cambiaba la fuerza de la restauración, mientras que el reconocimiento por LLaVA-1.5 y BLIP-3 aumentó a medida que se restauraba más de cada personaje.
Winnie the Pooh y Stitch se volvieron reconocibles en rangos relativamente estrechos; Olaf y Minnie Mouse cambiaron más gradualmente; y Minnie Mouse se volvió reconocible con una restauración relativamente pequeña, lo que demuestra que la fuerza de eliminación adecuada depende del personaje que se está apuntando.
Se realizaron experimentos adicionales para reemplazar varios objetivos en un solo paso, y nos referimos al lector al artículo de fuente para más detalles sobre esto y para resultados suplementarios adicionales y materiales.
Conclusión
Como siempre, este último giro en las barreras de los derechos de autor es equivalente a asegurar la puerta del establo después de que el caballo ha escapado.
En esos casos raros en los que los investigadores y las empresas han buscado suprimir la capacidad del modelo para producir desnudez y/o pornografía, cortando efectivamente el acceso interno a material ‘NSFW’ en el conjunto de datos (porque todavía es demasiado costoso curarlo), resultó que el modelo ya no podía entender la anatomía humana adecuadamente.
El nuevo enfoque propuesto aquí es, en cierto sentido, equivalente a excisionar/genéricar a una estrella del porno en particular, en un caso en el que se estaba construyendo un filtro NSFW para un modelo entrenado en contenido web raspado indiscriminadamente. Para el nuevo método, crear un ‘doble genérico’ para un personaje con derechos de autor tiene que dejar necesariamente intacto el dominio de superhéroes en el espacio latente del modelo; y cuanto más importante sea el personaje con derechos de autor objetivo, más define su dominio en el espacio entrenado.
Por lo tanto, eliminarlos es como intentar eliminar el azúcar del café, una vez que se ha revuelto.
Así que, aunque este enfoque puede disfrutar de algún éxito limitado si se agrega a los firewalls API en constante crecimiento de los modelos de vanguardia, la naturaleza interconectada de un modelo de GenAI sugiere, históricamente, que el material con derechos de autor que este método apunta puede seguir siendo accesible a través de la ingeniosidad habitual de los prompters.
Publicado por primera vez el viernes 14 de agosto de 2026












