Ângulo de Anderson

A Censura de Modelos de IA Não Funciona Bem, Revela Estudo

mm
Adicione Unite.AI às suas fontes preferidas no Google
ChatGPT-4o, Krita (Flux/Flux Koncept Dev), Firefly.

As tentativas de censurar os geradores de imagens de IA, apagando conteúdo proibido (como pornografia, violência ou estilos protegidos por direitos autorais) dos modelos treinados, estão falhando: um novo estudo descobriu que os métodos atuais de eliminação de conceitos permitem que atributos “proibidos” se espalhem por imagens não relacionadas e também não conseguem impedir que versões intimamente relacionadas do conteúdo supostamente “eliminado” apareçam.

 

Se as empresas que produzem modelos de IA de base não conseguirem evitar que eles sejam usados para produzir material objetável ou ilegal, elas correm o risco de ser processadas e/ou fechadas. Por outro lado, os fornecedores que só disponibilizam seus modelos por meio de uma API, como a Adobe com seu mecanismo de geração Firefly, estão em uma posição em que não precisam se preocupar com o que seus modelos podem criar, pois tanto o prompt do usuário quanto a saída resultante são inspecionados e sanitizados:

O sistema Firefly da Adobe, usado em ferramentas como o Photoshop, às vezes recusa um pedido de geração logo de início, bloqueando o prompt antes que algo seja criado. Outras vezes, gera a imagem, mas então bloqueia o resultado após revisão. Esse tipo de recusa no meio do processo também pode ocorrer no ChatGPT, quando o modelo começa uma resposta, mas a interrompe após reconhecer uma violação de política.

O sistema Firefly da Adobe, usado em ferramentas como o Photoshop, às vezes recusa um pedido de geração logo de início, bloqueando o prompt antes que algo seja criado. Outras vezes, gera a imagem, mas então bloqueia o resultado após revisão. Esse tipo de recusa no meio do processo também pode ocorrer no ChatGPT, quando o modelo começa uma resposta, mas a interrompe após reconhecer uma violação de política – e ocasionalmente, é possível ver a imagem abortada por um breve momento durante esse processo.

No entanto, filtros de API desse tipo geralmente podem ser neutralizados por usuários em modelos instalados localmente, incluindo modelos de linguagem e visão (VLMs) que o usuário possa desejar personalizar por meio de treinamento local em dados personalizados.

Na maioria dos casos, desabilitar essas operações é trivial, envolvendo comentar uma chamada de função em Python (embora hacks desse tipo geralmente precisem ser repetidos ou reinventados após atualizações de framework).

Do ponto de vista dos negócios, é difícil entender como isso poderia ser um problema, pois a abordagem de API maximiza o controle corporativo sobre o fluxo de trabalho do usuário. No entanto, do ponto de vista do usuário, tanto o custo dos modelos apenas de API quanto o risco de censura equivocada ou excessiva provavelmente os levará a baixar e personalizar instalações locais de alternativas de código aberto – pelo menos onde a licença FOSS é favorável.

O último modelo significativo a ser lançado sem nenhuma tentativa de incorporar autocensura foi o Stable Diffusion V1.5, quase três anos atrás. Mais tarde, a revelação de que seus conjuntos de treinamento incluíam dados de abuso infantil levou a um aumento nas chamadas para banir sua disponibilidade, e sua remoção do repositório Hugging Face em 2024.

Corte!

Céticos argumentam que o interesse de uma empresa em censurar modelos de IA geradores locais é baseado apenas em preocupações sobre exposição legal, caso seus frameworks se tornem conhecidos por facilitar conteúdo ilegal ou objetável.

De fato, alguns modelos de código aberto “amigáveis ao local” não são difíceis de descensurar (como Stable Diffusion 1.5 e DeepSeek R1).

Em contraste, o lançamento recente da série de modelos Kontext da Black Forest Lab foi marcado pelo compromisso notável da empresa em expurgar toda a gama Kontext, tanto por meio de curadoria de dados cuidadosa quanto por meio de ajustes finos direcionados após o treinamento, projetados para remover qualquer tendência residual em direção a conteúdo NSFW ou proibido.

Este é o foco da cena de pesquisa nos últimos 2-3 anos: com ênfase na correção pós-fato de modelos com dados subcurados. Ofertas desse tipo incluem Edição de Conceito Unificada em Modelos de Difusão (UCE); Eliminação de Conceito Confível e Eficiente de Modelos de Difusão de Texto para Imagem (RECE); Eliminação de Conceito em Massa em Modelos de Difusão (MACE); e estrutura Semi-Permeável de Conceito é Injetada como uma Membrana (SPM):

O artigo de 2024 'Edição de Conceito Unificada em Modelos de Difusão' ofereceu edições de forma fechada para pesos de atenção, permitindo edição eficiente de múltiplos conceitos em modelos de texto para imagem. Mas o método resiste à escrutínio? Fonte: https://arxiv.org/pdf/2308.14761

O artigo de 2024 ‘Edição de Conceito Unificada em Modelos de Difusão’ ofereceu edições de forma fechada para pesos de atenção, permitindo edição eficiente de múltiplos conceitos em modelos de texto para imagem. Mas o método resiste à escrutínio? Fonte: https://arxiv.org/pdf/2308.14761

Embora essa seja uma abordagem eficiente (coleções em larga escala, como LAION, são muito grandes para serem curadas manualmente), ela não é necessariamente eficaz: de acordo com um novo estudo nos EUA, nenhum dos procedimentos de edição mencionados – que representam o estado da arte na modificação pós-treinamento de modelos de IA – funciona muito bem.

Os autores descobriram que essas Técnicas de Eliminação de Conceito (CETs) geralmente podem ser facilmente contornadas, e que, mesmo quando são eficazes, elas têm efeitos colaterais consideráveis:

Efeitos da eliminação de conceito em modelos de texto para imagem. Cada coluna mostra um prompt e o conceito marcado para eliminação, juntamente com saídas geradas antes e após a edição. Hierarquias indicam relações pai-filho entre conceitos. Os exemplos destacam efeitos colaterais comuns, incluindo falha na eliminação de conceitos filhos, supressão de conceitos vizinhos, evasão por meio de reescrita e transferência de atributos eliminados para objetos não relacionados.. Fonte: https://arxiv.org/pdf/2508.15124

Efeitos da eliminação de conceito em modelos de texto para imagem. Cada coluna mostra um prompt e o conceito marcado para eliminação, juntamente com saídas geradas antes e após a edição. Hierarquias indicam relações pai-filho entre conceitos. Os exemplos destacam efeitos colaterais comuns, incluindo falha na eliminação de conceitos filhos, supressão de conceitos vizinhos, evasão por meio de reescrita e transferência de atributos eliminados para objetos não relacionados. Fonte: https://arxiv.org/pdf/2508.15124

Os autores encontraram que as principais técnicas atuais de eliminação de conceito falham em bloquear prompts compostos (por exemplo, carro vermelho ou cadeira de madeira pequena); frequentemente permitem que sub-classes escapem mesmo após a eliminação de uma categoria pai (como carro ou ônibus continuando a aparecer após a remoção de veículo); e introduzem novos problemas, como vazamento de atributos (onde, por exemplo, excluir sofá azul poderia causar que o modelo gere objetos não relacionados, como cadeira azul).

Em mais de 80% dos casos de teste, a eliminação de um conceito amplo, como veículo, não impediu que o modelo gerasse instâncias mais específicas de veículo, como carros ou ônibus.

A edição, observa o artigo, também causa mapas de atenção (as partes do modelo que decidem onde se concentrar na imagem) a se espalharem, enfraquecendo a qualidade da saída.

Interessantemente, o artigo descobre que eliminar conceitos relacionados um a um funciona melhor do que tentar removê-los todos de uma vez – embora isso não remova todas as limitações dos métodos de edição estudados:

Comparação de estratégias de eliminação progressiva e de uma vez. Quando todas as variantes de 'ursinho de pelúcia' são eliminadas simultaneamente, o modelo continua a gerar objetos semelhantes a ursinhos. Eliminar as variantes passo a passo é mais eficaz, levando o modelo a suprimir o conceito alvo de forma mais confiável.

Comparação de estratégias de eliminação progressiva e de uma vez. Quando todas as variantes de ‘ursinho de pelúcia’ são eliminadas simultaneamente, o modelo continua a gerar objetos semelhantes a ursinhos. Eliminar as variantes passo a passo é mais eficaz, levando o modelo a suprimir o conceito alvo de forma mais confiável.

Embora os pesquisadores atualmente não possam oferecer solução para os problemas que o artigo destaca, eles desenvolveram um novo conjunto de dados e uma referência que podem ajudar projetos de pesquisa posteriores a entender se seus próprios modelos “censurados” estão funcionando como esperado.

O artigo afirma:

‘Avaliações anteriores confiaram apenas em um pequeno conjunto de classes de destino e preservação; por exemplo, quando se elimina “carro”, apenas a capacidade do modelo de gerar carros é testada. Demonstramos que essa abordagem é fundamentalmente inadequada e que a avaliação da eliminação de conceito deve ser mais abrangente para abranger todos os sub-conceitos relacionados, como “carro vermelho”.

‘Ao introduzir um conjunto de dados diverso com variações compostas e analisar sistematicamente efeitos como impacto em conceitos vizinhos, evasão de conceito e vazamento de atributos, descobrimos limitações e efeitos colaterais significativos das CETs existentes.

‘Nossa referência é agnóstica em relação ao modelo e facilmente integrável e é idealmente adequada para ajudar no desenvolvimento de novas Técnicas de Eliminação de Conceito (CETs).’

Embora as CETs eliminem o conceito alvo 'pássaro', elas falham na variante composta 'pássaro vermelho' (topo). Após eliminar 'sofá azul', todos os métodos também perdem a capacidade de gerar uma cadeira azul (fundo). Resultados bem-sucedidos são marcados com um símbolo de tick verde, e falhas com um 'X' vermelho.

Embora as CETs eliminem o conceito alvo ‘pássaro’, elas falham na variante composta ‘pássaro vermelho’ (topo). Após eliminar ‘sofá azul’, todos os métodos também perdem a capacidade de gerar uma cadeira azul (fundo). Resultados bem-sucedidos são marcados com um símbolo de tick verde, e falhas com um ‘X’ vermelho.

O estudo oferece uma visão interessante sobre a extensão da interconexão de conceitos treinados no espaço latente de um modelo e a extensão em que entrelaçamento não permitirá facilmente qualquer tipo de eliminação de conceito definitiva e verdadeiramente discreta.

O novo artigo é intitulado Efeitos Colaterais da Eliminação de Conceitos de Modelos de Difusão e vem de quatro pesquisadores da Universidade de Maryland.

Método e Dados

Os autores opinam que trabalhos anteriores que alegam eliminar conceitos de modelos de difusão não comprovam a alegação de forma adequada, afirmando*:

‘As alegações de eliminação precisam de uma avaliação mais robusta e abrangente. Por exemplo, se o conceito a ser eliminado for “veículo”, sub-conceitos como “carro” e conceitos compostos como “carro vermelho” ou “carro pequeno” também devem ser eliminados.

‘No entanto, esse aspecto da hierarquia de conceitos e composicionalidade não é considerado nos protocolos de avaliação existentes, pois eles se concentram apenas na precisão do único conceito eliminado. [Os autores de EraseBench] avaliam como as CETs afetam conceitos visualmente semelhantes e parafraseados (como “gato” e “filhote”)[;] no entanto, eles não exploram exaustivamente a hierarquia e a composicionalidade dos conceitos.’

Para fornecer dados de referência para projetos futuros, os autores criaram o conjunto de dados Avaliação de Efeitos Colaterais (SEE) – uma grande coleção de prompts de texto projetados para testar como bem os métodos de eliminação de conceito funcionam.

Os prompts seguem um modelo simples no qual um objeto é descrito com atributos de tamanho, cor e material – por exemplo, uma imagem de um carro vermelho pequeno de madeira.

Os objetos foram tirados do conjunto de dados MS-COCO e organizados em uma hierarquia de superclasses, como veículo, e subclasses, como carro ou ônibus, com suas combinações de atributos formando os nodos folha (o nível mais específico da hierarquia). Essa estrutura permite testar a eliminação em diferentes níveis semânticos, desde categorias amplas até variantes específicas.

Para apoiar a avaliação automatizada, cada prompt foi emparelhado com uma pergunta sim/não, como Há um carro na imagem?, e também usado como um rótulo de classe para modelos de classificação de imagens:

Combinações de prompts no conjunto de dados SEE geradas variando atributos de tamanho, cor e material.

Combinações de prompts no conjunto de dados SEE geradas variando atributos de tamanho, cor e material.

Para medir como bem cada método de eliminação de conceito se saiu, os autores desenvolveram dois métodos de pontuação: precisão de alvo, que rastreia quão frequentemente conceitos eliminados ainda aparecem nas imagens geradas; e precisão de preservação, que rastreia se o modelo continua a gerar material que não deveria ser eliminado.

O equilíbrio entre as duas pontuações visa revelar se o método elimina com sucesso o conceito proibido sem danificar a saída mais ampla do modelo.

Os autores avaliaram a eliminação de conceito em três modos de falha: primeiro, uma medida de se a remoção de um conceito como carro interfere em conceitos próximos ou não relacionados, com base em semelhança semântica e de atributos; segundo, um teste para ver se a eliminação pode ser contornada por meio de sub-conceitos como carro vermelho após a eliminação de veículo.

Finalmente, foi realizada uma verificação para vazamento de atributos, onde características ligadas a conceitos eliminados aparecem em objetos não relacionados (por exemplo, eliminar sofá pode causar que outro objeto, como planta em vasos, herde sua cor ou material). O conjunto de dados final contém 5056 prompts compostos

Testes

Os frameworks testados anteriormente foram aqueles listados anteriormente – UCE, RECE, MACE e SPM. Os pesquisadores adotaram configurações padrão dos projetos originais e ajustaram finamente todos os modelos em um GPU NVIDIA RTX 6000 com 48GB de VRAM.

O Stable Diffusion 1.4, um dos modelos mais perenes na literatura, foi usado para todos os testes – talvez não menos porque os primeiros modelos SD tiveram pouca ou nenhuma restrição conceitual, e, como tal, oferecem uma folha em branco nesse contexto de pesquisa específico.

Cada um dos 5056 prompts do conjunto de dados SEE foi executado nas versões editadas e não editadas do modelo, gerando quatro imagens por prompt usando sementes aleatórias fixas, permitindo testar se os efeitos de eliminação permaneciam consistentes em múltiplas saídas. Cada modelo editado produziu um total de 20.224 imagens.

A presença de conceitos preservados foi avaliada de acordo com métodos anteriores para procedimentos de eliminação de texto para imagem, usando os modelos VQA BLIP, QWEN 2.5 VL e Florence-2base.

Impacto em Conceitos Vizinhos

O primeiro teste mediu se a eliminação de um conceito afetava involuntariamente conceitos vizinhos. Por exemplo, após remover carro, o modelo deveria parar de gerar carro vermelho ou carro grande, mas ainda ser capaz de gerar conceitos relacionados, como ônibus ou caminhão, e conceitos não relacionados, como garfo.

A análise usou semelhança de incorporação CLIP e distância de edição baseada em atributos para estimar quão próximo cada conceito estava do alvo eliminado, permitindo que o estudo quantificasse quão longe a perturbação se espalhou:

Resultados combinados para precisão de alvo (esquerda) e precisão de preservação (direita) plotados contra semelhança semântica (topo) e distância composicional (fundo). Um método de eliminação de conceito ideal mostraria baixa precisão de alvo e alta precisão de preservação em todas as distâncias, mas os resultados mostram que as técnicas atuais falham em generalizar limpa e claramente, com conceitos mais próximos sendo insuficientemente eliminados ou desproporcionalmente perturbados.

Resultados combinados para precisão de alvo (esquerda) e precisão de preservação (direita) plotados contra semelhança semântica (topo) e distância composicional (fundo). Um método de eliminação de conceito ideal mostraria baixa precisão de alvo e alta precisão de preservação em todas as distâncias; mas os resultados mostram que as técnicas atuais falham em generalizar limpa e claramente, com conceitos mais próximos sendo insuficientemente eliminados ou desproporcionalmente perturbados.

Desses resultados, os autores comentam:

‘Todos os CETs continuam a gerar variantes compostas ou semanticamente distantes do alvo, apesar da eliminação, o que idealmente não deveria ocorrer. É evidente que a UCE consistentemente alcança uma precisão mais alta do que os outros métodos CET na [conjunto de preservação], indicando um impacto mínimo não intencional em conceitos semanticamente relacionados.

‘Em contraste, a SPM alcança a menor precisão, sugerindo que sua estratégia de edição é mais suscetível à semelhança de conceito.’

Entre os quatro métodos testados, a RECE foi a mais eficaz em bloquear o conceito alvo. No entanto, como mostrado no lado esquerdo da imagem acima, todos os métodos falharam em suprimir variantes compostas. Após a eliminação de pássaro, o modelo ainda produziu imagens de um pássaro vermelho, sugerindo que o conceito permaneceu parcialmente intacto.

Remover sofá azul também impediu que o modelo gerasse uma cadeira azul, indicando dano a conceitos vizinhos.

A RECE lidou melhor com as variantes compostas do que os outros, enquanto a UCE fez um melhor trabalho na preservação de conceitos relacionados.

Invasão de Eliminação

O teste de evasão de eliminação avaliou se os modelos ainda podiam gerar conceitos de sub-classes após a eliminação de sua superclasse. Por exemplo, se veículo foi removido, o teste verificou se o modelo ainda podia produzir saídas como bicicleta ou carro vermelho.

Prompts foram direcionados tanto para sub-classes diretas quanto para variantes compostas para determinar se a operação de eliminação de conceito havia realmente removido a hierarquia completa ou podia ser contornada por meio de descrições mais específicas:

Contorno de superclasses eliminadas por meio de suas sub-classes e variantes compostas, com precisão mais alta indicando maior evasão.

Contorno de superclasses eliminadas por meio de suas sub-classes e variantes compostas, com precisão mais alta indicando maior evasão.

O modelo não editado reteve alta precisão em todas as superclasses, confirmando que ele não havia removido nenhum conceito alvo. Entre as CETs, a MACE mostrou a menor evasão, alcançando a menor precisão de sub-classes em mais da metade das categorias testadas. A RECE também se saiu bem, particularmente nos grupos acessório, esportes e eletrônicos.

Em contraste, a UCE e a SPM mostraram precisão de sub-classes mais alta, indicando que conceitos eliminados eram mais facilmente contornados por meio de prompts relacionados ou aninhados.

Os autores observam:

‘[Todas] as CETs suprimem com sucesso o conceito de superclasse alvo (“comida”). No entanto, quando solicitados com filhos baseados em atributos da hierarquia de comida (por exemplo, “uma pizza grande”), todos os métodos geram itens de comida.

‘Da mesma forma, na categoria “veículo”, todos os modelos geram bicicletas, apesar de terem eliminado “veículo”.’

Vazamento de Atributos

O terceiro teste, vazamento de atributos, verificou se características ligadas a um conceito eliminado apareciam em outras partes da imagem.

Por exemplo, após a eliminação de sofá, o modelo não deveria gerar um sofá nem aplicar seus atributos típicos (como cor ou material) a objetos não relacionados na mesma solicitação. Isso foi medido solicitando o modelo com objetos emparelhados e examinando se os atributos eliminados apareciam por engano em conceitos preservados:

Mapas de atenção para tokens de atributos após a eliminação de conceito. Esquerda: Quando 'banco' é eliminado, o token 'de madeira' se desloca para o pássaro, resultando em pássaros de madeira. Direita: Eliminar 'sofá' falha em suprimir a geração de sofá, enquanto o token 'grande' é erroneamente atribuído ao donut.

Mapas de atenção para tokens de atributos após a eliminação de conceito. Esquerda: Quando ‘banco’ é eliminado, o token ‘de madeira’ se desloca para o pássaro, resultando em pássaros de madeira. Direita: Eliminar ‘sofá’ falha em suprimir a geração de sofá, enquanto o token ‘grande’ é erroneamente atribuído ao donut.

A RECE foi a mais eficaz na eliminação de atributos alvo, mas também introduziu o maior vazamento de atributos em prompts preservados, superando até mesmo o modelo não editado. A UCE vazou menos do que os outros métodos.

Os resultados, sugerem os autores, indicam a necessidade de um trade-off inerente, com uma eliminação mais forte aumentando o risco de transferência de atributos mal direcionada.

Conclusão

O espaço latente de um modelo não se preenche de forma ordenada durante o treinamento, com conceitos derivados depositados neatamente em prateleiras ou pastas; mas as incorporações treinadas são tanto o conteúdo quanto os recipientes: não separados por fronteiras claras, mas se misturando uns nos outros de uma maneira que torna a remoção problemática – como tentar extrair uma libra de carne sem perda de sangue.

Em sistemas inteligentes e evolutivos, eventos fundamentais – como queimar os dedos e, em seguida, tratar o fogo com respeito – estão ligados aos comportamentos e associações que eles formam posteriormente, tornando desafiador produzir um modelo que possa ter sido deixado com as conseqüências de um conceito central, potencialmente ‘proibido’, mas que careça desse conceito em si.

 

* Minha conversão das citações em linha dos autores para links.

Publicado pela primeira vez na sexta-feira, 22 de agosto de 2025

Escritor em aprendizado de máquina, especialista em síntese de imagens humanas. Ex‑chefe de conteúdo de pesquisa na Metaphysic.ai, até sua dissolução na Brahma.ai da DNEG.
Website: martinanderson.ai
Contato: martin@martinanderson.ai