Ángulo de Anderson
La censura de los modelos de inteligencia artificial no funciona bien, según un estudio

Los intentos de censurar los generadores de imágenes de inteligencia artificial eliminando contenido prohibido (como pornografía, violencia o estilos con derechos de autor) de los modelos entrenados no están funcionando: un nuevo estudio encuentra que los métodos actuales de eliminación de conceptos permiten que los atributos “prohibidos” se filtren en imágenes no relacionadas, y también no logran detener la aparición de versiones estrechamente relacionadas del contenido supuestamente “eliminado”.
Si las empresas que producen modelos de inteligencia artificial de base no pueden evitar que se utilicen para producir material objetable o ilegal, corren el riesgo de ser procesadas y/o cerradas. Por otro lado, los proveedores que solo hacen que sus modelos estén disponibles a través de una API, como el motor generativo Firefly de Adobe, están en una posición en la que no tienen que preocuparse por lo que sus modelos puedan crear, ya que tanto la solicitud del usuario como la salida resultante se inspeccionan y sanitizan:

El sistema Firefly de Adobe, utilizado en herramientas como Photoshop, a veces rechaza una solicitud generativa de inmediato al bloquear la solicitud antes de que se cree algo. Otras veces, genera la imagen pero luego bloquea el resultado después de la revisión. Este tipo de rechazo en medio del proceso también puede ocurrir en ChatGPT, cuando el modelo comienza una respuesta pero la corta después de reconocer una violación de la política – y ocasionalmente se puede ver la imagen abortada brevemente durante este proceso.
Sin embargo, los filtros de estilo de API de este tipo pueden ser neutralizados generalmente por los usuarios en modelos instalados localmente, incluidos los modelos de lenguaje y visión (VLM) que el usuario puede desear personalizar a través de capacitación local en datos personalizados.
En la mayoría de los casos, deshabilitar estas operaciones es trivial, lo que implica comentar una llamada a una función en Python (aunque estos hacks generalmente deben repetirse o reinventarse después de las actualizaciones del marco de trabajo).
Desde una perspectiva empresarial, es difícil entender cómo podría ser un problema, ya que el enfoque de la API maximiza el control corporativo sobre el flujo de trabajo del usuario. Sin embargo, desde la perspectiva del usuario, tanto el costo de los modelos solo de API como el riesgo de censura equivocada o excesiva probablemente los obligará a descargar e instalar localmente versiones de alternativas de código abierto – al menos, donde la licencia FOSS es favorable.
El último modelo importante que se lanzó sin ningún intento de incorporar autocensura fue Stable Diffusion V1.5, hace casi tres años. Más tarde, la revelación de que sus corpora de entrenamiento incluyeron datos de abuso infantil llevó a un aumento en las llamadas para prohibir su disponibilidad, y su eliminación del repositorio Hugging Face en 2024.
¡Cortarlo!
Los cínicos sostienen que el interés de una empresa en censurar modelos de inteligencia artificial generativa instalables localmente se basa únicamente en preocupaciones sobre la exposición legal, en caso de que sus marcos se publiquen por facilitar contenido ilegal u objetable.
De hecho, algunos modelos de código abierto “amigables con la instalación local” no son tan difíciles de descensurar (como Stable Diffusion 1.5 y DeepSeek R1).
Por el contrario, el lanzamiento reciente de la serie de modelos Kontext de Black Forest Lab se caracterizó por el compromiso notable de la empresa de censurar toda la gama Kontext. Esto se logró tanto mediante una curación de datos cuidadosa como mediante un ajuste fino dirigido después del entrenamiento, diseñado para eliminar cualquier tendencia residual hacia el contenido NSFW o prohibido.
Este es el lugar donde ha estado el locus de acción en la escena de investigación durante los últimos 2-3 años: con un énfasis en la corrección posterior de los modelos con datos poco curados. Ofertas de este tipo incluyen Edición de conceptos unificada en modelos de difusión (UCE); Borrado de conceptos de texto a imagen de modelos de difusión confiable y eficiente (RECE); Borrado masivo de conceptos en modelos de difusión (MACE); y Estructura semipermeable de concepto inyectada como membrana (SPM):

El papel de 2024 ‘Edición de conceptos unificada en modelos de difusión’ ofreció ediciones de forma cerrada a los pesos de atención, lo que permite la edición eficiente de múltiples conceptos en modelos de texto a imagen. Pero ¿resiste el método el escrutinio? Source: https://arxiv.org/pdf/2308.14761
Aunque este es un enfoque eficiente (las colecciones de hipercalado como LAION son demasiado grandes para curar manualmente), no es necesariamente efectivo: según un nuevo estudio de EE. UU., ninguno de los procedimientos de edición mencionados anteriormente – que representan el estado del arte en la modificación de modelos de inteligencia artificial posteriores al entrenamiento – en realidad funciona muy bien.
Los autores encontraron que estas Técnicas de Eliminación de Conceptos (CET) generalmente se pueden eludir con facilidad, y que incluso cuando son efectivas, tienen efectos secundarios considerables:

Efectos de la eliminación de conceptos en modelos de texto a imagen. Cada columna muestra una solicitud y el concepto marcado para eliminación, junto con las salidas generadas antes y después de la edición. Las jerarquías indican relaciones padre-hijo entre conceptos. Los ejemplos resaltan efectos secundarios comunes, incluida la falta de eliminación de conceptos secundarios, la supresión de conceptos vecinos, la evasión mediante reexpresión y la transferencia de atributos eliminados a objetos no relacionados. Source: https://arxiv.org/pdf/2508.15124
Los autores encontraron que las técnicas de eliminación de conceptos actuales fallan al bloquear las solicitudes composicionales (por ejemplo, coche rojo o silla de madera pequeña); a menudo dejan que las subclases se filtren incluso después de eliminar una categoría principal (como coche o autobús que continúan apareciendo después de eliminar vehículo); e introducen nuevos problemas como la fuga de atributos (donde, por ejemplo, eliminar sofá azul podría hacer que el modelo genere objetos no relacionados como silla azul).
En más del 80% de los casos de prueba, eliminar un concepto amplio como vehículo no detuvo al modelo de generar instancias más específicas de vehículo como coches o autobuses.
La edición, observa el papel, también hace que los mapas de atención (las partes del modelo que deciden dónde enfocarse en la imagen) se dispersen, debilitando la calidad de la salida.
Resulta interesante que el papel encuentre que eliminar conceptos relacionados entrenados uno por uno funciona mejor que tratar de eliminarlos todos al mismo tiempo – aunque no elimina todos los defectos de los métodos de edición estudiados:

Comparación de estrategias de eliminación progresiva y de una sola vez. Cuando todas las variantes de ‘osito de peluche’ se eliminan simultáneamente, el modelo continúa generando objetos similares a ositos de peluche. Eliminar las variantes paso a paso es más efectivo, lo que lleva al modelo a suprimir el concepto objetivo de manera más confiable.
Aunque los investigadores actualmente no pueden ofrecer una solución a los problemas que plantea el papel, han desarrollado un nuevo conjunto de datos y una referencia que pueden ayudar a proyectos de investigación posteriores a comprender si sus propios modelos “censurados” están funcionando como se espera.
El papel establece:
‘Las evaluaciones anteriores se han basado únicamente en un pequeño conjunto de clases objetivo y de conservación; por ejemplo, cuando se elimina “coche”, solo se prueba la capacidad del modelo para generar coches. Demostramos que este enfoque es fundamentalmente inadecuado y que la evaluación de la eliminación de conceptos debe ser más completa para abarcar todos los subconceptos relacionados, como “coche rojo”.
‘Al introducir un conjunto de datos diverso con variaciones composicionales y analizar sistemáticamente efectos como el impacto en conceptos vecinos, la evasión de conceptos y la fuga de atributos, descubrimos limitaciones y efectos secundarios significativos de las CET actuales.
‘Nuestra referencia es agnóstica del modelo y fácilmente integrable, y está idealmente diseñada para ayudar en el desarrollo de nuevas Técnicas de Eliminación de Conceptos (CETs).’

Aunque las CET eliminan el concepto objetivo ‘pájaro’, fallan en la variante composicional ‘pájaro rojo’ (arriba). Después de eliminar ‘sofá azul’, todos los métodos también pierden la capacidad de generar una silla azul (abajo). Los resultados exitosos se marcan con un símbolo de marca de verificación verde, y los fallos con un símbolo de cruz roja.
El estudio ofrece una visión interesante sobre la medida en que los conceptos entrenados en el espacio latente de un modelo están entretejidos, y la medida en que la entrelazamiento no permitirá fácilmente ningún tipo de eliminación de conceptos definitiva y verdaderamente discreta.
El nuevo papel se titula Efectos secundarios de la eliminación de conceptos de modelos de difusión, y proviene de cuatro investigadores de la Universidad de Maryland.
Método y datos
Los autores opinan que los trabajos anteriores que afirman eliminar conceptos de modelos de difusión no prueban la afirmación de manera adecuada, estableciendo*:
‘Las afirmaciones de eliminación necesitan una evaluación más robusta y completa. Por ejemplo, si el concepto a eliminar es “vehículo”, los subconceptos como “coche” y los conceptos composicionales como “coche rojo” o “coche pequeño” también deben eliminarse.
‘Sin embargo, este aspecto de la jerarquía de conceptos y la composicionalidad no se considera en los protocolos de evaluación existentes, ya que se centran solo en la precisión del concepto eliminado individual. [Los autores de EraseBench] evalúan cómo las CET afectan los conceptos visualmente similares y parafraseados (como “gato” y “gatito”)[;] sin embargo, no exploran exhaustivamente la jerarquía y la composicionalidad de los conceptos.’
Para proporcionar datos de referencia para proyectos futuros, los autores crearon el conjunto de datos Evaluación de efectos secundarios (SEE) – una gran colección de solicitudes de texto diseñadas para probar cómo funcionan los métodos de eliminación de conceptos.
Las solicitudes siguen un modelo simple en el que un objeto se describe con atributos de tamaño, color y material – por ejemplo, una imagen de un coche rojo pequeño de madera.
Los objetos se extrajeron del conjunto de datos MS-COCO, y se organizaron en una jerarquía de superclases como vehículo, y subclases como coche o autobús, con sus combinaciones de atributos formando los nodos hoja (el nivel más específico de la jerarquía). Esta estructura permite probar la eliminación a diferentes niveles semánticos, desde categorías amplias hasta variantes específicas.
Para respaldar la evaluación automatizada, cada solicitud se emparejó con una pregunta de sí o no, como ¿Hay un coche en la imagen?, y también se utilizó como etiqueta de clase para modelos de clasificación de imágenes:

Combinaciones de solicitudes en el conjunto de datos SEE generadas variando los atributos de tamaño, color y material.
Para medir cómo funcionaba cada método de eliminación de conceptos, los autores diseñaron dos métodos de puntuación: precisión de objetivo, que rastrea con qué frecuencia los conceptos eliminados aún aparecen en las imágenes generadas; y precisión de conservación, que rastrea si el modelo continúa generando material que no se suponía que se eliminara.
El equilibrio entre las dos puntuaciones pretende revelar si el método elimina con éxito el concepto prohibido sin dañar la salida más amplia del modelo.
Los autores evaluaron la eliminación de conceptos a través de tres modos de falla: en primer lugar, una medida de si eliminar un concepto como coche interrumpe conceptos cercanos o no relacionados; en segundo lugar, una prueba para determinar si la eliminación se puede eludir mediante la solicitud de subconceptos como coche rojo después de eliminar vehículo.
Finalmente, se realizó una verificación para la fuga de atributos, donde los rasgos vinculados a conceptos eliminados aparecen en objetos no relacionados (por ejemplo, eliminar sofá podría hacer que otro objeto, como una planta en maceta, herede su color o material). El conjunto de datos final contiene 5056 solicitudes composicionales
Pruebas
Los marcos anteriores probados fueron los enumerados anteriormente – UCE, RECE, MACE y SPM. Los investigadores adoptaron la configuración predeterminada de los proyectos originales y ajustaron todos los modelos en una GPU NVIDIA RTX 6000 con 48 GB de VRAM.
Stable Diffusion 1.4, uno de los modelos más perennes en la literatura, se utilizó para todas las pruebas – quizás no menos porque los modelos SD más antiguos tenían poca o ninguna restricción conceptual, y como tal ofrecen una pizarra en blanco en este contexto de investigación particular.
Cada una de las 5056 solicitudes del conjunto de datos SEE se ejecutó en las versiones editadas y no editadas del modelo, generando cuatro imágenes por solicitud utilizando semillas aleatorias fijas, lo que permite probar si los efectos de eliminación se mantuvieron consistentes en múltiples salidas. Cada modelo editado produjo un total de 20,224 imágenes.
La presencia de conceptos conservados se evaluó según los métodos anteriores para procedimientos de eliminación de texto a imagen, utilizando los modelos VQA BLIP, QWEN 2.5 VL y Florence-2base.
Impacto en conceptos vecinos
La primera prueba midió si eliminar un concepto afectaba involuntariamente a conceptos vecinos. Por ejemplo, después de eliminar coche, el modelo debería dejar de generar coche rojo o coche grande, pero todavía debería poder generar conceptos relacionados como autobús o camión, y no relacionados como tenedor.
El análisis utilizó la similitud de incrustación CLIP y la distancia de edición basada en atributos para estimar qué tan cerca estaba cada concepto del objetivo eliminado, lo que permitió al estudio cuantificar qué tan lejos se extendía la interrupción:

Resultados combinados para la precisión del objetivo (izquierda) y la precisión de conservación (derecha) trazados contra la similitud semántica (arriba) y la distancia composicional (abajo). Un método de eliminación de conceptos ideal mostraría una baja precisión del objetivo y una alta precisión de conservación en todas las distancias; pero los resultados muestran que las técnicas actuales no se generalizan limpiamente, con conceptos más cercanos que no se eliminan suficientemente o que se interrumpen de manera desproporcionada.
De estos resultados, los autores comentan:
‘Todos los CET continúan generando variantes composicionales o semánticamente distantes del objetivo a pesar de la eliminación, lo que idealmente no debería ocurrir. Es evidente que UCE logra consistentemente una mayor precisión que otros métodos CET en el conjunto de conservación, lo que indica un impacto no intencional mínimo en los conceptos semánticamente relacionados.
‘En contraste, SPM logra la menor precisión, lo que sugiere que su estrategia de edición es más susceptible a la similitud de conceptos.’
Entre los cuatro métodos probados, RECE fue el más efectivo para bloquear el concepto objetivo. Sin embargo, como se muestra en el lado izquierdo de la imagen anterior, todos los métodos fallaron al suprimir las variantes composicionales. Después de eliminar pájaro, el modelo todavía produjo imágenes de un pájaro rojo, lo que sugiere que el concepto permaneció parcialmente intacto.
Eliminar sofá azul también impidió que el modelo generara una silla azul, lo que indica daño a conceptos vecinos.
RECE manejó las variantes composicionales mejor que los demás, mientras que UCE hizo un mejor trabajo al preservar los conceptos relacionados.
Invasión de eliminación
La prueba de evasión de eliminación evaluó si los modelos aún podían generar subconceptos después de que su superclase se hubiera eliminado. Por ejemplo, si vehículo se eliminó, la prueba verificó si el modelo aún podía producir salidas como bicicleta o coche rojo.
Las solicitudes se dirigieron tanto a subclases directas como a variantes composicionales para determinar si la operación de eliminación de conceptos había eliminado realmente toda la jerarquía o podía eludirse mediante descripciones más específicas:

Evasión de superclases eliminadas a través de sus subclases y variantes composicionales, con una mayor precisión que indica una mayor evasión.
El modelo no editado retuvo una alta precisión en todas las superclases, lo que confirma que no había eliminado ningún concepto objetivo. Entre las CET, MACE mostró la menor evasión, logrando la menor precisión de subclase en más de la mitad de las categorías probadas. RECE también se desempeñó bien, particularmente en los grupos accesorio, deportes y electrónica.
Por el contrario, UCE y SPM mostraron una mayor precisión de subclase, lo que indica que los conceptos eliminados se podían eludir más fácilmente a través de solicitudes relacionadas o anidadas.
Los autores señalan:
‘[Todos] los CET suprimen con éxito el concepto de superclase objetivo (“comida”). Sin embargo, cuando se les pide con hijos de atributos de la jerarquía de alimentos (por ejemplo, “una pizza grande”), todos los métodos generan artículos de comida.
‘De manera similar, en la categoría de “vehículo”, todos los modelos generan bicicletas, a pesar de eliminar “vehículo”.’
Fuga de atributos
La tercera prueba, la fuga de atributos, verificó si los rasgos vinculados a un concepto eliminado aparecían en otras partes de la imagen.
Por ejemplo, después de eliminar sofá, el modelo no debería generar un sofá ni aplicar sus atributos típicos (como color o material) a objetos no relacionados en la misma solicitud. Esto se midió mediante la solicitud del modelo con objetos emparejados y la verificación de si los atributos eliminados se filtraban erróneamente en conceptos conservados:

Mapas de atención para tokens de atributos después de la eliminación de conceptos. Izquierda: Cuando se elimina ‘banco’, el token ‘de madera’ se desplaza hacia el pájaro en su lugar, lo que resulta en pájaros de madera. Derecha: Eliminar ‘sofá’ no evita la generación de sofá, mientras que el token ‘grande’ se asigna erróneamente al donut.
RECE fue el más efectivo para eliminar los atributos objetivo, pero también introdujo la mayor fuga de atributos en las solicitudes conservadas, superando incluso al modelo no editado. UCE filtró menos que otros métodos.
Los resultados, sugieren los autores, indican la necesidad de un compromiso inherente, con una eliminación más fuerte que aumenta el riesgo de transferencia de atributos mal dirigida.
Conclusión
El espacio latente de un modelo no se llena de manera ordenada durante el entrenamiento, con conceptos derivados depositados pulcramente en estantes o en archivadores; más bien, las incrustaciones entrenadas son tanto el contenido como sus contenedores: no separados por límites claros, sino más bien fusionándose entre sí de una manera que hace que la eliminación sea problemática – como tratar de extraer una libra de carne sin pérdida de sangre.
En sistemas inteligentes y evolutivos, los eventos fundamentales – como quemarse los dedos y tratar el fuego con respeto a partir de entonces – están ligados a los comportamientos y asociaciones que forman más tarde, lo que hace que sea un desafío producir un modelo que pueda haber quedado con las consecuencias de un concepto central, potencialmente “prohibido”, pero carezca de ese concepto en sí mismo.
* Conversión de las citas en línea de los autores a enlaces.
Publicado por primera vez el viernes 22 de agosto de 2025












