Ãngulo de Anderson
La censura de los modelos de inteligencia artificial no funciona bien, segÚn un estudio

Los intentos de censurar los generadores de imÃĄgenes de inteligencia artificial eliminando contenido prohibido (como pornografÃa, violencia o estilos con derechos de autor) de los modelos entrenados no estÃĄn funcionando: un nuevo estudio encuentra que los mÃĐtodos actuales de eliminaciÃģn de conceptos permiten que los atributos âprohibidosâ se filtren en imÃĄgenes no relacionadas, y tambiÃĐn no logran detener la apariciÃģn de versiones estrechamente relacionadas del contenido supuestamente âeliminadoâ.
Â
Si las empresas que producen modelos de inteligencia artificial de base no pueden evitar que se utilicen para producir material objetable o ilegal, corren el riesgo de ser procesadas y/o cerradas. Por otro lado, los proveedores que solo hacen que sus modelos estÃĐn disponibles a travÃĐs de una API, como el motor generativo Firefly de Adobe, estÃĄn en una posiciÃģn en la que no tienen que preocuparse por lo que sus modelos puedan crear, ya que tanto la solicitud del usuario como la salida resultante se inspeccionan y sanitizan:

El sistema Firefly de Adobe, utilizado en herramientas como Photoshop, a veces rechaza una solicitud generativa de inmediato al bloquear la solicitud antes de que se cree algo. Otras veces, genera la imagen pero luego bloquea el resultado despuÃĐs de la revisiÃģn. Este tipo de rechazo en medio del proceso tambiÃĐn puede ocurrir en ChatGPT, cuando el modelo comienza una respuesta pero la corta despuÃĐs de reconocer una violaciÃģn de la polÃtica â y ocasionalmente se puede ver la imagen abortada brevemente durante este proceso.
Sin embargo, los filtros de estilo de API de este tipo pueden ser neutralizados generalmente por los usuarios en modelos instalados localmente, incluidos los modelos de lenguaje y visiÃģn (VLM) que el usuario puede desear personalizar a travÃĐs de capacitaciÃģn local en datos personalizados.
En la mayorÃa de los casos, deshabilitar estas operaciones es trivial, lo que implica comentar una llamada a una funciÃģn en Python (aunque estos hacks generalmente deben repetirse o reinventarse despuÃĐs de las actualizaciones del marco de trabajo).
Desde una perspectiva empresarial, es difÃcil entender cÃģmo podrÃa ser un problema, ya que el enfoque de la API maximiza el control corporativo sobre el flujo de trabajo del usuario. Sin embargo, desde la perspectiva del usuario, tanto el costo de los modelos solo de API como el riesgo de censura equivocada o excesiva probablemente los obligarÃĄ a descargar e instalar localmente versiones de alternativas de cÃģdigo abierto â al menos, donde la licencia FOSS es favorable.
El Último modelo importante que se lanzÃģ sin ningÚn intento de incorporar autocensura fue Stable Diffusion V1.5, hace casi tres aÃąos. MÃĄs tarde, la revelaciÃģn de que sus corpora de entrenamiento incluyeron datos de abuso infantil llevÃģ a un aumento en las llamadas para prohibir su disponibilidad, y su eliminaciÃģn del repositorio Hugging Face en 2024.
ÂĄCortarlo!
Los cÃnicos sostienen que el interÃĐs de una empresa en censurar modelos de inteligencia artificial generativa instalables localmente se basa Únicamente en preocupaciones sobre la exposiciÃģn legal, en caso de que sus marcos se publiquen por facilitar contenido ilegal u objetable.
De hecho, algunos modelos de cÃģdigo abierto âamigables con la instalaciÃģn localâ no son tan difÃciles de descensurar (como Stable Diffusion 1.5 y DeepSeek R1).
Por el contrario, el lanzamiento reciente de la serie de modelos Kontext de Black Forest Lab se caracterizÃģ por el compromiso notable de la empresa de censurar toda la gama Kontext. Esto se logrÃģ tanto mediante una curaciÃģn de datos cuidadosa como mediante un ajuste fino dirigido despuÃĐs del entrenamiento, diseÃąado para eliminar cualquier tendencia residual hacia el contenido NSFW o prohibido.
Este es el lugar donde ha estado el locus de acciÃģn en la escena de investigaciÃģn durante los Últimos 2-3 aÃąos: con un ÃĐnfasis en la correcciÃģn posterior de los modelos con datos poco curados. Ofertas de este tipo incluyen EdiciÃģn de conceptos unificada en modelos de difusiÃģn (UCE); Borrado de conceptos de texto a imagen de modelos de difusiÃģn confiable y eficiente (RECE); Borrado masivo de conceptos en modelos de difusiÃģn (MACE); y Estructura semipermeable de concepto inyectada como membrana (SPM):

El papel de 2024 âEdiciÃģn de conceptos unificada en modelos de difusiÃģnâ ofreciÃģ ediciones de forma cerrada a los pesos de atenciÃģn, lo que permite la ediciÃģn eficiente de mÚltiples conceptos en modelos de texto a imagen. Pero Âŋresiste el mÃĐtodo el escrutinio? Source: https://arxiv.org/pdf/2308.14761
Aunque este es un enfoque eficiente (las colecciones de hipercalado como LAION son demasiado grandes para curar manualmente), no es necesariamente efectivo: segÚn un nuevo estudio de EE. UU., ninguno de los procedimientos de ediciÃģn mencionados anteriormente â que representan el estado del arte en la modificaciÃģn de modelos de inteligencia artificial posteriores al entrenamiento â en realidad funciona muy bien.
Los autores encontraron que estas TÃĐcnicas de EliminaciÃģn de Conceptos (CET) generalmente se pueden eludir con facilidad, y que incluso cuando son efectivas, tienen efectos secundarios considerables:

Efectos de la eliminaciÃģn de conceptos en modelos de texto a imagen. Cada columna muestra una solicitud y el concepto marcado para eliminaciÃģn, junto con las salidas generadas antes y despuÃĐs de la ediciÃģn. Las jerarquÃas indican relaciones padre-hijo entre conceptos. Los ejemplos resaltan efectos secundarios comunes, incluida la falta de eliminaciÃģn de conceptos secundarios, la supresiÃģn de conceptos vecinos, la evasiÃģn mediante reexpresiÃģn y la transferencia de atributos eliminados a objetos no relacionados. Source: https://arxiv.org/pdf/2508.15124
Los autores encontraron que las tÃĐcnicas de eliminaciÃģn de conceptos actuales fallan al bloquear las solicitudes composicionales (por ejemplo, coche rojo o silla de madera pequeÃąa); a menudo dejan que las subclases se filtren incluso despuÃĐs de eliminar una categorÃa principal (como coche o autobÚs que continÚan apareciendo despuÃĐs de eliminar vehÃculo); e introducen nuevos problemas como la fuga de atributos (donde, por ejemplo, eliminar sofÃĄ azul podrÃa hacer que el modelo genere objetos no relacionados como silla azul).
En mÃĄs del 80% de los casos de prueba, eliminar un concepto amplio como vehÃculo no detuvo al modelo de generar instancias mÃĄs especÃficas de vehÃculo como coches o autobuses.
La ediciÃģn, observa el papel, tambiÃĐn hace que los mapas de atenciÃģn (las partes del modelo que deciden dÃģnde enfocarse en la imagen) se dispersen, debilitando la calidad de la salida.
Resulta interesante que el papel encuentre que eliminar conceptos relacionados entrenados uno por uno funciona mejor que tratar de eliminarlos todos al mismo tiempo â aunque no elimina todos los defectos de los mÃĐtodos de ediciÃģn estudiados:

ComparaciÃģn de estrategias de eliminaciÃģn progresiva y de una sola vez. Cuando todas las variantes de âosito de pelucheâ se eliminan simultÃĄneamente, el modelo continÚa generando objetos similares a ositos de peluche. Eliminar las variantes paso a paso es mÃĄs efectivo, lo que lleva al modelo a suprimir el concepto objetivo de manera mÃĄs confiable.
Aunque los investigadores actualmente no pueden ofrecer una soluciÃģn a los problemas que plantea el papel, han desarrollado un nuevo conjunto de datos y una referencia que pueden ayudar a proyectos de investigaciÃģn posteriores a comprender si sus propios modelos âcensuradosâ estÃĄn funcionando como se espera.
El papel establece:
âLas evaluaciones anteriores se han basado Únicamente en un pequeÃąo conjunto de clases objetivo y de conservaciÃģn; por ejemplo, cuando se elimina âcocheâ, solo se prueba la capacidad del modelo para generar coches. Demostramos que este enfoque es fundamentalmente inadecuado y que la evaluaciÃģn de la eliminaciÃģn de conceptos debe ser mÃĄs completa para abarcar todos los subconceptos relacionados, como âcoche rojoâ.
âAl introducir un conjunto de datos diverso con variaciones composicionales y analizar sistemÃĄticamente efectos como el impacto en conceptos vecinos, la evasiÃģn de conceptos y la fuga de atributos, descubrimos limitaciones y efectos secundarios significativos de las CET actuales.
âNuestra referencia es agnÃģstica del modelo y fÃĄcilmente integrable, y estÃĄ idealmente diseÃąada para ayudar en el desarrollo de nuevas TÃĐcnicas de EliminaciÃģn de Conceptos (CETs).â

Aunque las CET eliminan el concepto objetivo âpÃĄjaroâ, fallan en la variante composicional âpÃĄjaro rojoâ (arriba). DespuÃĐs de eliminar âsofÃĄ azulâ, todos los mÃĐtodos tambiÃĐn pierden la capacidad de generar una silla azul (abajo). Los resultados exitosos se marcan con un sÃmbolo de marca de verificaciÃģn verde, y los fallos con un sÃmbolo de cruz roja.
El estudio ofrece una visiÃģn interesante sobre la medida en que los conceptos entrenados en el espacio latente de un modelo estÃĄn entretejidos, y la medida en que la entrelazamiento no permitirÃĄ fÃĄcilmente ningÚn tipo de eliminaciÃģn de conceptos definitiva y verdaderamente discreta.
El nuevo papel se titula Efectos secundarios de la eliminaciÃģn de conceptos de modelos de difusiÃģn, y proviene de cuatro investigadores de la Universidad de Maryland.
MÃĐtodo y datos
Los autores opinan que los trabajos anteriores que afirman eliminar conceptos de modelos de difusiÃģn no prueban la afirmaciÃģn de manera adecuada, estableciendo*:
âLas afirmaciones de eliminaciÃģn necesitan una evaluaciÃģn mÃĄs robusta y completa. Por ejemplo, si el concepto a eliminar es âvehÃculoâ, los subconceptos como âcocheâ y los conceptos composicionales como âcoche rojoâ o âcoche pequeÃąoâ tambiÃĐn deben eliminarse.
âSin embargo, este aspecto de la jerarquÃa de conceptos y la composicionalidad no se considera en los protocolos de evaluaciÃģn existentes, ya que se centran solo en la precisiÃģn del concepto eliminado individual. [Los autores de EraseBench] evalÚan cÃģmo las CET afectan los conceptos visualmente similares y parafraseados (como âgatoâ y âgatitoâ)[;] sin embargo, no exploran exhaustivamente la jerarquÃa y la composicionalidad de los conceptos.â
Para proporcionar datos de referencia para proyectos futuros, los autores crearon el conjunto de datos EvaluaciÃģn de efectos secundarios (SEE) â una gran colecciÃģn de solicitudes de texto diseÃąadas para probar cÃģmo funcionan los mÃĐtodos de eliminaciÃģn de conceptos.
Las solicitudes siguen un modelo simple en el que un objeto se describe con atributos de tamaÃąo, color y material â por ejemplo, una imagen de un coche rojo pequeÃąo de madera.
Los objetos se extrajeron del conjunto de datos MS-COCO, y se organizaron en una jerarquÃa de superclases como vehÃculo, y subclases como coche o autobÚs, con sus combinaciones de atributos formando los nodos hoja (el nivel mÃĄs especÃfico de la jerarquÃa). Esta estructura permite probar la eliminaciÃģn a diferentes niveles semÃĄnticos, desde categorÃas amplias hasta variantes especÃficas.
Para respaldar la evaluaciÃģn automatizada, cada solicitud se emparejÃģ con una pregunta de sà o no, como ÂŋHay un coche en la imagen?, y tambiÃĐn se utilizÃģ como etiqueta de clase para modelos de clasificaciÃģn de imÃĄgenes:

Combinaciones de solicitudes en el conjunto de datos SEE generadas variando los atributos de tamaÃąo, color y material.
Para medir cÃģmo funcionaba cada mÃĐtodo de eliminaciÃģn de conceptos, los autores diseÃąaron dos mÃĐtodos de puntuaciÃģn: precisiÃģn de objetivo, que rastrea con quÃĐ frecuencia los conceptos eliminados aÚn aparecen en las imÃĄgenes generadas; y precisiÃģn de conservaciÃģn, que rastrea si el modelo continÚa generando material que no se suponÃa que se eliminara.
El equilibrio entre las dos puntuaciones pretende revelar si el mÃĐtodo elimina con ÃĐxito el concepto prohibido sin daÃąar la salida mÃĄs amplia del modelo.
Los autores evaluaron la eliminaciÃģn de conceptos a travÃĐs de tres modos de falla: en primer lugar, una medida de si eliminar un concepto como coche interrumpe conceptos cercanos o no relacionados; en segundo lugar, una prueba para determinar si la eliminaciÃģn se puede eludir mediante la solicitud de subconceptos como coche rojo despuÃĐs de eliminar vehÃculo.
Finalmente, se realizÃģ una verificaciÃģn para la fuga de atributos, donde los rasgos vinculados a conceptos eliminados aparecen en objetos no relacionados (por ejemplo, eliminar sofÃĄ podrÃa hacer que otro objeto, como una planta en maceta, herede su color o material). El conjunto de datos final contiene 5056 solicitudes composicionales
Pruebas
Los marcos anteriores probados fueron los enumerados anteriormente â UCE, RECE, MACE y SPM. Los investigadores adoptaron la configuraciÃģn predeterminada de los proyectos originales y ajustaron todos los modelos en una GPU NVIDIA RTX 6000 con 48 GB de VRAM.
Stable Diffusion 1.4, uno de los modelos mÃĄs perennes en la literatura, se utilizÃģ para todas las pruebas â quizÃĄs no menos porque los modelos SD mÃĄs antiguos tenÃan poca o ninguna restricciÃģn conceptual, y como tal ofrecen una pizarra en blanco en este contexto de investigaciÃģn particular.
Cada una de las 5056 solicitudes del conjunto de datos SEE se ejecutÃģ en las versiones editadas y no editadas del modelo, generando cuatro imÃĄgenes por solicitud utilizando semillas aleatorias fijas, lo que permite probar si los efectos de eliminaciÃģn se mantuvieron consistentes en mÚltiples salidas. Cada modelo editado produjo un total de 20,224 imÃĄgenes.
La presencia de conceptos conservados se evaluÃģ segÚn los mÃĐtodos anteriores para procedimientos de eliminaciÃģn de texto a imagen, utilizando los modelos VQA BLIP, QWEN 2.5 VL y Florence-2base.
Impacto en conceptos vecinos
La primera prueba midiÃģ si eliminar un concepto afectaba involuntariamente a conceptos vecinos. Por ejemplo, despuÃĐs de eliminar coche, el modelo deberÃa dejar de generar coche rojo o coche grande, pero todavÃa deberÃa poder generar conceptos relacionados como autobÚs o camiÃģn, y no relacionados como tenedor.
El anÃĄlisis utilizÃģ la similitud de incrustaciÃģn CLIP y la distancia de ediciÃģn basada en atributos para estimar quÃĐ tan cerca estaba cada concepto del objetivo eliminado, lo que permitiÃģ al estudio cuantificar quÃĐ tan lejos se extendÃa la interrupciÃģn:

Resultados combinados para la precisiÃģn del objetivo (izquierda) y la precisiÃģn de conservaciÃģn (derecha) trazados contra la similitud semÃĄntica (arriba) y la distancia composicional (abajo). Un mÃĐtodo de eliminaciÃģn de conceptos ideal mostrarÃa una baja precisiÃģn del objetivo y una alta precisiÃģn de conservaciÃģn en todas las distancias; pero los resultados muestran que las tÃĐcnicas actuales no se generalizan limpiamente, con conceptos mÃĄs cercanos que no se eliminan suficientemente o que se interrumpen de manera desproporcionada.
De estos resultados, los autores comentan:
âTodos los CET continÚan generando variantes composicionales o semÃĄnticamente distantes del objetivo a pesar de la eliminaciÃģn, lo que idealmente no deberÃa ocurrir. Es evidente que UCE logra consistentemente una mayor precisiÃģn que otros mÃĐtodos CET en el conjunto de conservaciÃģn, lo que indica un impacto no intencional mÃnimo en los conceptos semÃĄnticamente relacionados.
âEn contraste, SPM logra la menor precisiÃģn, lo que sugiere que su estrategia de ediciÃģn es mÃĄs susceptible a la similitud de conceptos.â
Entre los cuatro mÃĐtodos probados, RECE fue el mÃĄs efectivo para bloquear el concepto objetivo. Sin embargo, como se muestra en el lado izquierdo de la imagen anterior, todos los mÃĐtodos fallaron al suprimir las variantes composicionales. DespuÃĐs de eliminar pÃĄjaro, el modelo todavÃa produjo imÃĄgenes de un pÃĄjaro rojo, lo que sugiere que el concepto permaneciÃģ parcialmente intacto.
Eliminar sofÃĄ azul tambiÃĐn impidiÃģ que el modelo generara una silla azul, lo que indica daÃąo a conceptos vecinos.
RECE manejÃģ las variantes composicionales mejor que los demÃĄs, mientras que UCE hizo un mejor trabajo al preservar los conceptos relacionados.
InvasiÃģn de eliminaciÃģn
La prueba de evasiÃģn de eliminaciÃģn evaluÃģ si los modelos aÚn podÃan generar subconceptos despuÃĐs de que su superclase se hubiera eliminado. Por ejemplo, si vehÃculo se eliminÃģ, la prueba verificÃģ si el modelo aÚn podÃa producir salidas como bicicleta o coche rojo.
Las solicitudes se dirigieron tanto a subclases directas como a variantes composicionales para determinar si la operaciÃģn de eliminaciÃģn de conceptos habÃa eliminado realmente toda la jerarquÃa o podÃa eludirse mediante descripciones mÃĄs especÃficas:

EvasiÃģn de superclases eliminadas a travÃĐs de sus subclases y variantes composicionales, con una mayor precisiÃģn que indica una mayor evasiÃģn.
El modelo no editado retuvo una alta precisiÃģn en todas las superclases, lo que confirma que no habÃa eliminado ningÚn concepto objetivo. Entre las CET, MACE mostrÃģ la menor evasiÃģn, logrando la menor precisiÃģn de subclase en mÃĄs de la mitad de las categorÃas probadas. RECE tambiÃĐn se desempeÃąÃģ bien, particularmente en los grupos accesorio, deportes y electrÃģnica.
Por el contrario, UCE y SPM mostraron una mayor precisiÃģn de subclase, lo que indica que los conceptos eliminados se podÃan eludir mÃĄs fÃĄcilmente a travÃĐs de solicitudes relacionadas o anidadas.
Los autores seÃąalan:
â[Todos] los CET suprimen con ÃĐxito el concepto de superclase objetivo (âcomidaâ). Sin embargo, cuando se les pide con hijos de atributos de la jerarquÃa de alimentos (por ejemplo, âuna pizza grandeâ), todos los mÃĐtodos generan artÃculos de comida.
âDe manera similar, en la categorÃa de âvehÃculoâ, todos los modelos generan bicicletas, a pesar de eliminar âvehÃculoâ.â
Fuga de atributos
La tercera prueba, la fuga de atributos, verificÃģ si los rasgos vinculados a un concepto eliminado aparecÃan en otras partes de la imagen.
Por ejemplo, despuÃĐs de eliminar sofÃĄ, el modelo no deberÃa generar un sofÃĄ ni aplicar sus atributos tÃpicos (como color o material) a objetos no relacionados en la misma solicitud. Esto se midiÃģ mediante la solicitud del modelo con objetos emparejados y la verificaciÃģn de si los atributos eliminados se filtraban errÃģneamente en conceptos conservados:

Mapas de atenciÃģn para tokens de atributos despuÃĐs de la eliminaciÃģn de conceptos. Izquierda: Cuando se elimina âbancoâ, el token âde maderaâ se desplaza hacia el pÃĄjaro en su lugar, lo que resulta en pÃĄjaros de madera. Derecha: Eliminar âsofÃĄâ no evita la generaciÃģn de sofÃĄ, mientras que el token âgrandeâ se asigna errÃģneamente al donut.
RECE fue el mÃĄs efectivo para eliminar los atributos objetivo, pero tambiÃĐn introdujo la mayor fuga de atributos en las solicitudes conservadas, superando incluso al modelo no editado. UCE filtrÃģ menos que otros mÃĐtodos.
Los resultados, sugieren los autores, indican la necesidad de un compromiso inherente, con una eliminaciÃģn mÃĄs fuerte que aumenta el riesgo de transferencia de atributos mal dirigida.
ConclusiÃģn
El espacio latente de un modelo no se llena de manera ordenada durante el entrenamiento, con conceptos derivados depositados pulcramente en estantes o en archivadores; mÃĄs bien, las incrustaciones entrenadas son tanto el contenido como sus contenedores: no separados por lÃmites claros, sino mÃĄs bien fusionÃĄndose entre sà de una manera que hace que la eliminaciÃģn sea problemÃĄtica â como tratar de extraer una libra de carne sin pÃĐrdida de sangre.
En sistemas inteligentes y evolutivos, los eventos fundamentales â como quemarse los dedos y tratar el fuego con respeto a partir de entonces â estÃĄn ligados a los comportamientos y asociaciones que forman mÃĄs tarde, lo que hace que sea un desafÃo producir un modelo que pueda haber quedado con las consecuencias de un concepto central, potencialmente âprohibidoâ, pero carezca de ese concepto en sà mismo.
Â
* ConversiÃģn de las citas en lÃnea de los autores a enlaces.
Publicado por primera vez el viernes 22 de agosto de 2025












