Ângulo de Anderson

Dar ‘Identidades Secretas’ a Personagens de Animação com Direitos Autorais

mm
Adicione Unite.AI às suas fontes preferidas no Google
An image depicting a Marvel superhero 'anonymized' into a grey and unknown character, based on AI-generated/modified work from https://in.pinterest.com/pin/369928556910022951/ , and itself further modified with Z-Image. On the right, results from a new paper aiming to protect copyrighted animation characters by replacing them with generic substitutes. Source - https://arxiv.org/pdf/2608.12806

Pesquisa nova da China oferece uma maneira não invasiva de proteger personagens de animação com direitos autorais, ‘injetando’ substitutos genéricos no momento da inferência. Mas essa método pode derrotar a ingenuidade dos hackers de prompts?

 

Considerando a extensão do material com direitos autorais presente em conjuntos de dados de grande escala (devido ao alto custo de remover essas infrações), os modelos treinados com eles tendem a ser capazes de reproduzir personagens com direitos autorais.

A edição direta do modelo treinado, ou o uso de filtros para interceptar palavras-chave quando o modelo é acessado por API, pode ser frequentemente contornado por descrever o elemento com direitos autorais de forma elíptica:

Um personagem com direitos autorais produzido por um chatbot de IA popular sem invocação direta do nome do personagem. Fonte - https://www.unite.ai/censoring-ai-models-does-not-work-well-study-reveals/#:~:text=shortcomings%20of%20the%20studied%20editing%20methods

Um personagem com direitos autorais produzido por um chatbot de IA popular, aparentemente sem invocação direta do nome do personagem. Fonte

Em uma linha forte e persistente de pesquisa, as técnicas de modificação do modelo tentaram alterar parâmetros em um modelo treinado, com resultados variados:

Do artigo de 2023 Ablating Concepts in Text-to-Image Diffusion Models, representações fotorealistas da atriz Brie Larson como 'Capitã Marvel' – incorporadas em um modelo de difusão popular – são transformadas em imagens de desenho animado relacionadas quando solicitadas pelo usuário. Fonte - https://arxiv.org/pdf/2410.15618

Do artigo de 2023 Ablating Concepts in Text-to-Image Diffusion Models, representações fotorealistas da atriz Brie Larson como ‘Capitã Marvel’ – incorporadas em um modelo de difusão popular – são transformadas em imagens de desenho animado relacionadas quando solicitadas pelo usuário. Fonte

No entanto, a ablação é geralmente um processo prejudicial e impreciso, e pode frequentemente afetar outras características do modelo treinado; além disso, existem múltiplas maneiras de contorná-la.

A outra abordagem popular é a ‘promptagem negativa’, na qual um ‘anti-prompt’ adicional é enviado ao modelo, projetado para restringir a saída. Quando os modelos são acessados por API (como todos os modelos de fronteira, por exemplo), um ‘prompt’ secreto negativo pode ser enviado junto com o prompt do usuário conhecido, compreendendo uma rubrica projetada para evitar que o modelo forneça material proibido ao usuário. Essa abordagem, embora popular como um vetor de proteção de direitos autorais, não funciona sempre.

A maioria do trabalho em torno da censura pós-fato da inferência está ocupada com a questão mais ampla de garantir que os modelos não produzam CSAM, ou qualquer tipo de material NSFW, apesar das grandes quantidades desse material provavelmente presentes nos dados de treinamento de um modelo importante. Essas iniciativas podem afetar classes inteiras de conteúdo, em vez de instâncias específicas, e geralmente carecem da nuances necessárias para atender às preocupações dos detentores de direitos autorais que buscam suprimir identidades específicas.

Dobros

Com isso em mente, um novo artigo da China propõe substituir personagens de animação com direitos autorais durante a geração de imagens por substitutos genéricos aprendidos – ‘dobros’ que retêm o suficiente da forma e estrutura do personagem para preservar a cena circundante, enquanto removem detalhes distintivos associados ao personagem protegido:

Representações 'anônimas' de material com direitos autorais, de outro modo presente e acessível em um modelo treinado, alcançadas pelo novo método de incorporação. Fonte - https://arxiv.org/pdf/2410.05309v1

Representações ‘anônimas’ de material com direitos autorais, de outro modo presente e acessível em um modelo treinado, alcançadas pelo novo método de incorporação. Fonte

Crucialmente, essa intervenção ocorre durante a geração sem modificar ou ajustar o modelo de difusão subjacente, e pode ser ajustada para determinar até que ponto o personagem original é apagado.

A abordagem tacitamente reconhece que a modificação do modelo é um método pobre para esse propósito, e, em vez disso, injeta incorporações criadas no processo de inferência – incorporações projetadas para ‘refatorar’ em vez de ablar (zerar, remover) o ativo com direitos autorais. O processo não afeta ou modifica o modelo base em nada, e, portanto, pode ser reutilizado ou adaptado em uma variedade de modelos.

Embora o método tenha sido testado pelos autores no modelo mais antigo Stable Diffusion, também foi efetivamente testado no mais recente Z-Image, sugerindo que o conceito dos autores é aplicável em uma gama de arquiteturas gerativas.

O artigo afirma:

‘[Nós] propomos um método controlável que opera na representação textual contínua do modelo para apagar personagens alvo durante a geração. Nós [otimizamos] uma incorporação âncora via restrições estruturais e detalhadas para servir como um substituto de personagem, então [substituímos] incorporações relacionadas ao alvo com a âncora via uma estratégia adaptativa consciente da estrutura.

‘Experimentos mostram que nosso método alcança eficácia de remoção de estado da arte e preservação de fidelidade de imagem, enquanto suporta grau de remoção controlável, remoção de múltiplos alvos e transferibilidade de modelo.

‘Além disso, nossas âncoras otimizadas são plug-and-play com as linhas de base atuais de modificação de modelo para melhorar seu desempenho de remoção.’

O novo método se estende por arquiteturas diversas e oferece controle granular, de acordo com os autores.

O novo método se estende por arquiteturas diversas e oferece controle granular, de acordo com os autores.

O novo artigo é intitulado Apagar mas Preservar: Remoção Controlável de Personagens de Animação com Direitos Autorais via Âncoras Semânticas Otimizadas, e vem de sete autores em todo o Instituto de Engenharia da Informação da Academia Chinesa de Ciências, e da Universidade da Academia Chinesa de Ciências em Pequim.

Método

A ideia central por trás do novo método, como ilustrado abaixo, é criar um substituto para cada personagem com direitos autorais que preserve a forma ampla e estrutura, enquanto elimina os detalhes visuais distintivos que tornam o personagem reconhecível – e, em seguida, usar esse substituto durante a geração de imagens sempre que o personagem protegido for solicitado.

Esquema para a nova abordagem.

Esquema para a nova abordagem.

O substituto, que os autores chamam de âncora, é projetado para reter o suficiente da forma e estrutura do personagem original para se encaixar naturalmente na mesma cena, enquanto elimina os detalhes que tornam o personagem distintivo.

Para isso, o sistema compara informações estruturais grossas geradas para o personagem original com as geradas para a âncora em desenvolvimento, impulsionando as duas em direção a uma forma geral semelhante. Uma imagem de referência do personagem com direitos autorais é usada para o propósito oposto, impulsionando a âncora para longe de seus detalhes finos reconhecíveis:

Método para construir um substituto não infrator para um personagem com direitos autorais. A estrutura ampla do personagem é preservada enquanto seus detalhes visuais distintivos são suprimidos, produzindo uma 'âncora' otimizada para uso durante a geração.

Método para construir um substituto não infrator para um personagem com direitos autorais. A estrutura ampla do personagem é preservada enquanto seus detalhes visuais distintivos são suprimidos, produzindo uma ‘âncora’ otimizada para uso durante a geração.

A âncora resultante, portanto, ocupa um terreno intermediário deliberadamente projetado entre preservar a composição solicitada e remover a identidade protegida.

Âncora Fora

Uma vez que essas propriedades foram estabelecidas, a âncora precisa ser traduzida em algo que o modelo de difusão possa entender. O termo Âncora* [sic] é, portanto, dado sua própria representação aprendida dentro do codificador de texto CLIP, efetivamente criando uma nova entidade artificial, cujo significado pode ser moldado sem alterar o modelo de geração de imagens subjacente.

Essa nova representação é repetidamente ajustada de acordo com os objetivos estruturais e de detalhe descritos acima, ensinando Âncora* a significar algo amplamente moldado como o personagem protegido, mas desprovido de sua aparência identificadora.

O restante do codificador de texto permanece congelado durante esse processo, enquanto os tokens de início, fim e preenchimento comuns que rodeiam Âncora* fornecem o contexto necessário para transformar essa pseudo-palavra recém-aprendida nas incorporações finais usadas durante a geração.

Substituição Adaptativa

Durante a geração (inferência), o algoritmo procura o prompt codificado por termos associados ao personagem protegido e substitui as incorporações da âncora aprendida em seu lugar, enquanto também ajusta as incorporações de fim e preenchimento que transportam informações contextuais.

Para preparar para isso, o sistema primeiro permite que a denoising estabeleça a composição ampla da imagem solicitada, monitorando mudanças em sua estrutura grossa para determinar quando essa estrutura começou a se estabilizar:

Representação de quando a substituição da âncora ocorre durante a geração de imagens. Mudanças na estrutura da imagem grossa são rastreadas ao longo do denoising, com a substituição desencadeada por volta do ponto em que a estrutura geral se estabiliza e os detalhes mais finos começam a emergir.

Representação de quando a substituição da âncora ocorre durante a geração de imagens. Mudanças na estrutura da imagem grossa são rastreadas ao longo do denoising, com a substituição desencadeada por volta do ponto em que a estrutura geral se estabiliza e os detalhes mais finos começam a emergir.

Na imagem acima, vemos essa transição ocorrendo por volta do passo de tempo 720, onde a mudança estrutural medida atinge seu pico e, em seguida, começa a cair. Nesse ponto, o arranjo geral da imagem foi amplamente formado, permitindo que a âncora substitua o personagem protegido, enquanto reduz o risco de perturbar a composição estabelecida.

Dados e Testes

Os autores compararam sua abordagem com cinco linhas de base baseadas em prompts: Difusão Latente Segura (SLD); STG; SAFREE; TraSCE; e Promptagem Negativa (NP).

As incorporações da âncora otimizadas também foram integradas em quatro métodos de modificação de modelo existentes: MACE; UCE; ESD-u; e AC. Isso foi feito para testar se esses poderiam melhorar o modelo proposto em relação à remoção de personagens.

Para a avaliação, um conjunto de dados de 80 personagens de animação foi montado, compreendendo 36 personagens antropomórficos; 23 personagens em forma de animal; e 21 de categorias miscelâneas – com todos os personagens selecionados porque poderiam ser reproduzidos de forma confiável por modelos de difusão.

Cem imagens foram, então, geradas para cada personagem, usando prompts produzidos por GPT-4o.

Stable Diffusion v1.4 foi usada para os experimentos principais, com a transferibilidade adicionamente testada em outras versões do Stable Diffusion v1.5; V2; v2.1; XL base 1.0; e também a arquitetura DiT-based Z-Image mais recente. Nenhum ajuste fino do modelo foi realizado, deixando os parâmetros de cada modelo pré-treinado inalterados.

Para as métricas, LLaVA-1.5 e BLIP-3 mediram se o personagem alvo ainda era reconhecível, com menor precisão de identificação indicando remoção mais completa; Índice de Similaridade Estrutural (SSIM) mediu a preservação estrutural; Métricas de Similaridade Perceptual Aprendidas (LPIPS) mediu a diferença perceptual; e Pontuação do Preditor Estético V2 avaliou a qualidade visual da imagem alterada.

Distância de Inception de Fréchet (FID) e Pontuação CLIP foram adicionamente calculados a partir de prompts não relacionados em COCO-30K, para medir se a geração de imagens normal havia sido afetada:

Resultados de teste comparando métodos de remoção de personagens em 80 personagens de animação. As duas primeiras colunas medem com que frequência o personagem supostamente apagado ainda poderia ser reconhecido, então pontuações mais baixas indicam remoção melhor. As colunas restantes medem como bem a imagem original e a geração não relacionada foram preservadas. Setas mostram se pontuações mais altas ou mais baixas são preferíveis; negrito indica o melhor resultado e sublinhado o segundo melhor.

Resultados de teste comparando métodos de remoção de personagens em 80 personagens de animação. As duas primeiras colunas medem com que frequência o personagem supostamente apagado ainda poderia ser reconhecido, então pontuações mais baixas indicam remoção melhor. As colunas restantes medem como bem a imagem original e a geração não relacionada foram preservadas. Setas mostram se pontuações mais altas ou mais baixas são preferíveis; negrito indica o melhor resultado e sublinhado o segundo melhor.

Dos resultados iniciais para comparação quantitativa, os autores afirmam:

‘Em comparação com todas as linhas de base, as imagens apagadas usando nosso método alcançam as menores precisões para identificação de alvo bem-sucedida por LLaVA-1.5 (6.0%) e BLIP-3 (4.0%), com reduções de 3.5% e 1.7% em comparação com a segunda menor, respectivamente.

‘Isso demonstra a eficácia de remoção do nosso método, pois ele efetivamente [engana] grandes modelos multimodais.’

Para a fidelidade da imagem, o método dos autores produziu a pontuação SSIM mais alta, em 0,467, e a pontuação LPIPS mais baixa, em 0,505 – indicando a preservação mais forte de conteúdo não relacionado e estrutura de fundo entre os métodos testados. Ele também alcançou a pontuação mais alta do Preditor Estético V2 entre os métodos de remoção de personagens, em 5,18, sugerindo que essa preservação não vem à custa da qualidade visual geral.

Um teste qualitativo seguiu:

Resultados de teste comparando remoção de personagens em cinco personagens de animação. Cada linha mostra resultados de um método diferente, com as gerações originais do Stable Diffusion v1.4 no topo e o método proposto na parte inferior. O método proposto mais consistentemente substitui os personagens alvo enquanto preserva a cena circundante.

Resultados de teste comparando remoção de personagens em cinco personagens de animação. Cada linha mostra resultados de um método diferente, com as gerações originais do Stable Diffusion v1.4 no topo e o método proposto na parte inferior. O método proposto mais consistentemente substitui os personagens alvo enquanto preserva a cena circundante. Por favor, consulte o PDF original da fonte ou o site do projeto para uma resolução ligeiramente melhor.

De acordo com o artigo, os exemplos mostram diferenças particularmente claras para personagens com formas e atributos mais complexos, com Pato Donald e Super Mario citados como exemplos:

‘[Nosso] método alcança remoção indolor de personagens de animação por meio de âncoras otimizadas, enquanto as linhas de base baseadas em prompts frequentemente falham—particularmente para personagens com formas e atributos complexos (por exemplo, Pato Donald e Super Mario).

‘Além disso, nosso método alcança consistência de fundo sem os artefatos de borramento ou distorção, apoiando fluxos de trabalho criativos iterativos.’

Controle Granular

Um espaço de incorporação contínua também permite que a força da remoção do personagem seja ajustada, em vez de tratar a remoção como uma proposta de tudo ou nada. Ao interpolar entre a âncora otimizada e a incorporação de alvo original, o método pode progressivamente restaurar mais do personagem, enquanto retém a estrutura da imagem circundante:

Imagens de teste mostrando diferentes graus de remoção de personagens. As três primeiras colunas mostram o personagem original, a versão apagada e os recursos visuais removidos; as colunas restantes mostram configurações intermediárias em α=0.25, 0.5 e 0.75. Valores mais altos de α preservam progressivamente mais do personagem original. Por favor, consulte o PDF original da fonte ou o site do projeto para uma resolução ligeiramente melhor.

Imagens de teste mostrando diferentes graus de remoção de personagens. As três primeiras colunas mostram o personagem original, a versão apagada e os recursos visuais removidos; as colunas restantes mostram configurações intermediárias em α=0.25, 0.5 e 0.75. Valores mais altos de α preservam progressivamente mais do personagem original.

Como mostrado acima, os autores também testaram esse controle nos personagens Winnie the Pooh; Olaf; Minnie Mouse; e Stitch. A similaridade estrutural permaneceu relativamente estável à medida que a força da restauração mudou, enquanto o reconhecimento por LLaVA-1.5 e BLIP-3 aumentou à medida que mais do personagem era restaurado.

Winnie the Pooh e Stitch se tornaram reconhecíveis em faixas relativamente estreitas; Olaf e Minnie Mouse mudaram mais gradualmente; e Minnie Mouse se tornou reconhecível com uma restauração relativamente pequena, demonstrando que a força de remoção apropriada depende do personagem que está sendo visado.

Experimentos adicionais para substituir múltiplos alvos em uma única passada foram conduzidos com sucesso, e remetemos o leitor para o artigo de origem para mais detalhes sobre isso e para resultados suplementares adicionais e materiais.

Conclusão

Como sempre, essa última reviravolta nas barreiras de direitos autorais é equivalente a fechar a porta do estábulo após o cavalo ter escapado.

Nos casos raros em que os pesquisadores e as empresas buscaram suprimir a capacidade de um modelo de produzir nudez e/ou pornografia, cortando efetivamente o acesso interno a material ‘NSFW’ nos dados (porque é muito caro para realmente curá-los), descobriu-se que o modelo não poderia mais entender a anatomia humana adequadamente.

A nova abordagem proposta aqui é, argumentavelmente, equivalente a excisar/genéricar uma estrela do pornô específica, em um caso em que um filtro NSFW estava sendo construído para um modelo treinado em toneladas de conteúdo da web raspado indiscriminadamente. Para o novo método, criar um ‘duplo genérico’ para um personagem com direitos autorais tem que necessariamente deixar o domínio de super-heróis intacto no espaço latente do modelo; e quanto mais importante o personagem com direitos autorais visado for, mais ele define seu domínio no espaço treinado.

Portanto, removê-los é como tentar remover o açúcar do café, uma vez que foi mexido.

Então, embora essa abordagem possa desfrutar de algum sucesso limitado se adicionada às barreiras de firewall API em constante crescimento dos modelos de fronteira, a natureza interconectada de um modelo GenAI sugere, historicamente, que o material com direitos autorais que esse método visa pode permanecer acessível por meio da ingenuidade costumeira dos prompters.

 

Publicado pela primeira vez na sexta-feira, 14 de agosto de 2026

Escritor em aprendizado de máquina, especialista em síntese de imagem humana. Antigo chefe de conteúdo de pesquisa da Metaphysic.ai, até sua dissolução na Brahma.ai da DNEG.
Portfolio site: martinanderson.ai
Contato: martin@martinanderson.ai