Ângulo de Anderson

Quebrando os Censores de IA por meio de Texto em Imagem

mm
Adicione Unite.AI às suas fontes preferidas no Google
AI-generated image featuring the Mona Lisa painting embedded in the wall of a jail cell with the bars smashed and the inmates escaped. Apparently the painting caused all this damage. On the Mona Lisa painting are the words 'Open the cell'. GPT Image 1.5.

Aviso: este artigo discute pesquisas de segurança que incluem exemplos visuais ofensivos ou prejudiciais. As imagens são apresentadas apenas para explicar os riscos e as defesas estudadas.

Os sistemas modernos de edição de imagens por inteligência artificial foram alinhados para recusar pedidos perigosos. Em geral, eles analisam o texto do usuário, o conteúdo da imagem de entrada e o resultado proposto antes de concluir uma edição. Filtros semânticos, moderadores baseados em CLIP e modelos que descrevem imagens em texto ajudam a bloquear conteúdo violento, ilegal, discriminatório ou enganoso.

Esse alinhamento, porém, pode falhar quando a própria imagem passa a funcionar como parte da instrução. Trabalhos anteriores mostraram que sobreposições tipográficas e imagens distrativas podem confundir modelos multimodais. Outros ataques usam texto rasterizado dentro da imagem para induzir uma ação que seria recusada se fosse enviada diretamente como prompt.

Uma imagem distrativa pode permitir um jailbreak bimodal em um modelo de visão e linguagem.

Uma imagem distrativa pode permitir um jailbreak bimodal em um modelo de visão e linguagem.

Exemplo de instruções perigosas incorporadas como texto rasterizado em uma imagem.

Exemplo de instruções perigosas incorporadas como texto rasterizado em uma imagem.

Uma solicitação proibida pode ser executada quando aparece visualmente dentro da imagem.

Uma solicitação proibida pode ser executada quando aparece visualmente dentro da imagem.

Formas, caixas e setas também podem transmitir uma instrução sem depender apenas de texto explícito.

Formas, caixas e setas também podem transmitir uma instrução sem depender apenas de texto explícito.

Um novo artigo, When the Prompt Becomes Visual: Vision-Centric Jailbreak Attacks for Large Image Editing Models, estuda esse problema em modelos recentes de edição de imagens. Os sete pesquisadores, afiliados à Universidade Tsinghua, ao Peng Cheng Laboratory e à Central South University, apresentam ataques de jailbreak centrados na visão e o conjunto de avaliação IESBench.

O IESBench contém 1.054 amostras, distribuídas por 15 categorias de risco, 116 atributos e nove tipos de ação de edição. O objetivo é medir se um editor reconhece que elementos visuais — como caixas delimitadoras, setas e rótulos — formam uma instrução perigosa mesmo quando o prompt textual isolado parece benigno.

O IESBench reúne 1.054 amostras em 15 categorias de risco, 116 atributos e nove tipos de ação.

O IESBench reúne 1.054 amostras em 15 categorias de risco, 116 atributos e nove tipos de ação.

Perfurando o alinhamento

Os editores tradicionais dependiam sobretudo de comandos de texto. Modelos mais novos, como Qwen-Image-Edit e LongCat-Image-Edit, interpretam conjuntamente pixels e linguagem. Essa capacidade torna as edições mais precisas, mas amplia a superfície de ataque: uma intenção maliciosa pode ser dividida entre a imagem e um comando aparentemente inofensivo.

Os pesquisadores mostram que verificações separadas de texto e imagem podem considerar ambos seguros, enquanto sua combinação instrui o modelo a produzir conteúdo nocivo. Assim, a falha não está apenas no reconhecimento visual, mas na ausência de uma avaliação de segurança capaz de raciocinar sobre a operação de edição completa.

As verificações de segurança anteriores à edição podem aprovar separadamente a imagem e o texto, embora a combinação seja nociva.

As verificações de segurança anteriores à edição podem aprovar separadamente a imagem e o texto, embora a combinação seja nociva.

Método

O ataque visual transforma a imagem de entrada em uma interface de instruções. O método acrescenta formas delimitadoras, indicadores direcionais e pistas visuais ou linguísticas que especificam onde e como realizar uma edição. O texto enviado ao modelo pode permanecer genérico, enquanto a intenção real é codificada na imagem.

Para avaliar as respostas, os autores usam um modelo de visão e linguagem como julgador de segurança e reutilizam o cache de chaves e valores (KV cache) para tornar a avaliação mais eficiente. Os riscos são organizados em três níveis: violações de direitos individuais; danos dirigidos a grupos; e riscos sociais ou públicos.

A construção do conjunto partiu das 15 categorias do MM-SafetyBench. Os pesquisadores ampliaram as imagens básicas com palavras-chave e cenários reais. Cada amostra registra seu identificador, categoria de risco, intenção, atributos do objeto, operação solicitada e prompt textual.

Construção do conjunto em 15 categorias de risco agrupadas em três níveis de dano.

Construção do conjunto em 15 categorias de risco agrupadas em três níveis de dano.

Métricas

A principal métrica é a taxa de sucesso do ataque (ASR), que indica quantas solicitações nocivas foram executadas. A pontuação de dano (HS), de 1 a 5, mede a gravidade do resultado. A validade da edição (EV) verifica se a operação solicitada realmente ocorreu, enquanto a taxa de retenção do dano (HRR) mede quanto do conteúdo perigoso foi preservado no resultado. Um modelo multimodal de grande porte atua como julgador, seguindo critérios padronizados.

Testes

Os testes incluíram quatro serviços comerciais: Nano Banana Pro, baseado no Gemini 3 Pro Image; GPT Image 1.5; Qwen-Image-Edit-Plus-2025-12-25; e Seedream 4.5 2025-1128. Também foram avaliados localmente Qwen-Image-Edit-Plus-2512, BAGEL e Flux2.0[dev]. O Gemini 3 Pro foi o julgador padrão.

Nos modelos comerciais, a ASR média chegou a 85,7%. O Qwen-Image-Edit atingiu 97,5% e o Seedream 4.5, 94,1%. O GPT Image 1.5 teve ASR de 70,3% e HRR de 52,0%. Nos modelos de código aberto, todos alcançaram 100% de ASR, com pontuações de dano de até 4,3; o Flux registrou HRR de 84,6% e o Qwen local, 90,3%.

Resultados do IESBench: os modelos abertos chegaram a 100% de taxa de sucesso do ataque.

Resultados do IESBench: os modelos abertos chegaram a 100% de taxa de sucesso do ataque.

Comparação da severidade dos resultados entre níveis de dano e modelos avaliados.

Comparação da severidade dos resultados entre níveis de dano e modelos avaliados.

O comportamento variou conforme a categoria. Em adulteração de direitos autorais, o GPT Image 1.5 chegou a 95,7%, enquanto o Nano Banana registrou 41,3%. Uma variante mais segura, Qwen-Image-Edit-Safe, reduziu a ASR em 33 pontos percentuais e a pontuação de dano em 1,2 ponto. Ainda assim, apresentou ASR de 61,5% para adulteração de evidências e 55,3% para conteúdo emocionalmente manipulador.

VJA vs. Ataque de Jailbreak Direcionado (TJA)

Os autores compararam o ataque visual (VJA) com um ataque baseado diretamente em texto (TJA). No Nano Banana, o VJA elevou a ASR em 35,6 pontos percentuais; no GPT Image 1.5, o ganho foi de 24,9 pontos. Qwen e Seedream mudaram pouco porque já apresentavam ASR elevada, e algumas instruções visuais não eram executadas corretamente.

Exemplo de modificação de uma transcrição usado para comparar ataques textuais e visuais.

Exemplo de modificação de uma transcrição usado para comparar ataques textuais e visuais.

Desempenho comparativo dos ataques TJA e VJA nos modelos testados.

Desempenho comparativo dos ataques TJA e VJA nos modelos testados.

Melhor defesa

Como defesa inicial, os pesquisadores treinaram um classificador binário com 10% das amostras positivas do IESBench e igual número de exemplos benignos. O classificador alcançou 75,6% de precisão global, AUC-ROC de 75,7%, precisão positiva de 79,2% e revocação de 72,0%. Quando o raciocínio explícito foi removido, o desempenho caiu para perto do acaso.

A ablação da defesa mostra que o raciocínio sobre imagem, texto e operação é essencial para detectar o ataque.

A ablação da defesa mostra que o raciocínio sobre imagem, texto e operação é essencial para detectar o ataque.

Conclusão

O estudo mostra que a segurança de editores de imagem não pode depender de filtros independentes para o texto e para os pixels. A intenção pode surgir apenas da relação entre os dois. Defesas mais eficazes precisam interpretar a cena, os marcadores visuais, a região indicada e o efeito solicitado como uma única operação.

O IESBench oferece uma base sistemática para medir essas falhas. Embora o classificador proposto seja apenas um primeiro passo, os resultados indicam que o raciocínio multimodal explícito melhora a detecção. Os autores defendem avaliações contínuas e salvaguardas específicas para modelos de edição, principalmente quando o sistema aceita instruções visuais complexas.

Exemplos qualitativos mostram como pistas visuais aparentemente simples podem orientar edições nocivas.

Exemplos qualitativos mostram como pistas visuais aparentemente simples podem orientar edições nocivas.

Artigo: When the Prompt Becomes Visual: Vision-Centric Jailbreak Attacks for Large Image Editing Models.

Escritor em aprendizado de máquina, especialista em síntese de imagens humanas. Ex‑chefe de conteúdo de pesquisa na Metaphysic.ai, até sua dissolução na Brahma.ai da DNEG.
Website: martinanderson.ai
Contato: martin@martinanderson.ai