Ângulo de Anderson

As FalsificaçÃĩes Menores Podem Ser a Grande Ameaça

mm
Adicione Unite.AI às suas fontes preferidas no Google
Public domain images + Flux.1 Kontext Pro and Adobe Firefly

As ferramentas de IA conversacional, como ChatGPT e Google Gemini, estÃĢo sendo usadas para criar deepfakes que nÃĢo trocam rostos, mas de maneiras mais sutis podem reescrever toda a histÃģria dentro de uma imagem. Alterando gestos, objetos e fundos, essas ediçÃĩes enganam tanto os detectores de IA quanto os humanos, aumentando as apostas para identificar o que ÃĐ real online.

 

No clima atual, particularmente apÃģs a promulgaçÃĢo de legislaçÃĩes significativas, como a lei TAKE IT DOWN, muitos de nÃģs associam deepfakes e síntese de identidade impulsionada por IA a pornografia nÃĢo consensual e manipulaçÃĢo política – em geral, distorsÃĩes grosseiras da verdade.

Isso nos acostuma a esperar que as imagens manipuladas por IA sejam sempre direcionadas a conteÚdos de alto impacto, onde a qualidade da renderizaçÃĢo e a manipulaçÃĢo do contexto possam alcançar um golpe de credibilidade, pelo menos no curto prazo.

Historicamente, no entanto, alteraçÃĩes muito mais sutis tiveram frequentemente um efeito mais sinistro e duradouro – como a fotografia de truques de estado da arte que permitiu que StÃĄlin removesse aqueles que haviam caído em desfavor do registro fotogrÃĄfico, como satirizado no romance de George Orwell 1984, onde o protagonista Winston Smith passa seus dias reescrevendo a histÃģria e tendo fotos criadas, destruídas e ’emendadas’.

No exemplo a seguir, o problema com a segunda foto ÃĐ que nÃĢo sabemos o que nÃĢo sabemos – que o ex-chefe da polícia secreta de StÃĄlin, Nikolai Yezhov, costumava ocupar o espaço onde agora hÃĄ apenas uma barreira de segurança:

Agora vocÊ vÊ, agora ele... some. A manipulaçÃĢo fotogrÃĄfica da era de StÃĄlin remove um membro do partido da histÃģria. Fonte: Domínio pÚblico, via https://www.rferl.org/a/soviet-airbrushing-the-censors-who-scratched-out-history/29361426.html

Agora vocÊ vÊ, agora eleâ€Ķ some. A manipulaçÃĢo fotogrÃĄfica da era de StÃĄlin remove um membro do partido da histÃģria. Fonte: Domínio pÚblico, via https://www.rferl.org/a/soviet-airbrushing-the-censors-who-scratched-out-history/29361426.html

Correntes desse tipo, frequentemente repetidas, persistem de muitas maneiras; nÃĢo apenas culturalmente, mas na prÃģpria visÃĢo computacional, que deriva tendÊncias de temas e motivos estatisticamente dominantes nos conjuntos de dados de treinamento. Para dar um exemplo, o fato de que os smartphones reduziram a barreira de entrada e massivamente reduziram o custo da fotografia, significa que sua iconografia se tornou inelutavelmente associada a muitos conceitos abstratos, mesmo quando isso nÃĢo ÃĐ apropriado.

Se as deepfakes convencionais podem ser percebidas como um ato de ‘assalto’, alteraçÃĩes perniciosas e persistentes em mídia ÃĄudio-visual sÃĢo mais semelhantes a ‘gaslighting’. AlÃĐm disso, a capacidade dessas deepfakes de passar despercebidas torna difícil identificÃĄ-las por meio de sistemas de detecçÃĢo de deepfakes de Última geraçÃĢo (que estÃĢo procurando por alteraçÃĩes grosseiras). Essa abordagem ÃĐ mais semelhante à ÃĄgua desgastando a rocha ao longo de um período prolongado do que uma rocha atirada na cabeça.

MultiFakeVerse

Pesquisadores da AustrÃĄlia fizeram uma tentativa de abordar a falta de atençÃĢo às deepfakes ‘sutis’ na literatura, criando um novo conjunto de dados substancial de manipulaçÃĩes de imagens centradas em pessoas que alteram contexto, emoçÃĢo e narrativa sem alterar a identidade central da pessoa:

Amostrado do novo conjunto, pares reais/falsos, com algumas alteraçÃĩes mais sutis do que outras. Note, por exemplo, a perda de autoridade para a mulher asiÃĄtica, inferior-direita, à medida que seu estetoscÃģpio de mÃĐdico ÃĐ removido pela IA. Ao mesmo tempo, a substituiçÃĢo do bloco do mÃĐdico pelo clipe nÃĢo tem um ÃĒngulo semÃĒntico Ãģbvio. Fonte: https://huggingface.co/datasets/parulgupta/MultiFakeVerse_preview

Amostrado do novo conjunto, pares reais/falsos, com algumas alteraçÃĩes mais sutis do que outras. Note, por exemplo, a perda de autoridade para a mulher asiÃĄtica, inferior-direita, à medida que seu estetoscÃģpio de mÃĐdico ÃĐ removido pela IA. Ao mesmo tempo, a substituiçÃĢo do bloco do mÃĐdico pelo clipe nÃĢo tem um ÃĒngulo semÃĒntico Ãģbvio. Fonte: https://huggingface.co/datasets/parulgupta/MultiFakeVerse_preview

Intitulado MultiFakeVerse, o conjunto consiste em 845.826 imagens geradas por meio de modelos de linguagem de visÃĢo (VLMs), que podem ser acessados online e baixados, com permissÃĢo.

Os autores afirmam:

‘Essa abordagem VLM impulsionada permite alteraçÃĩes semÃĒnticas e cientes de contexto, como modificar açÃĩes, cenas e interaçÃĩes entre humanos e objetos, em vez de trocas de identidade sintÃĐticas ou ediçÃĩes de nível baixo e regionais específicas comuns em conjuntos de dados existentes.

‘Nossos experimentos revelam que os atuais modelos de detecçÃĢo de deepfakes de Última geraçÃĢo e os observadores humanos lutam para detectar essas manipulaçÃĩes sutis, mas significativas.’

Os pesquisadores testaram tanto humanos quanto os principais sistemas de detecçÃĢo de deepfakes em seu novo conjunto de dados para ver quÃĢo bem essas manipulaçÃĩes sutis poderiam ser identificadas. Os participantes humanos lutaram, classificando imagens como reais ou falsas apenas cerca de 62% do tempo, e tiveram ainda mais dificuldade em identificar quais partes da imagem haviam sido alteradas.

Os detectores de deepfakes existentes, treinados principalmente em conjuntos de dados de troca de faces ou inpainting, performaram mal tambÃĐm, frequentemente falhando em registrar que qualquer manipulaçÃĢo havia ocorrido. Mesmo apÃģs ajuste fino no MultiFakeVerse, as taxas de detecçÃĢo permaneceram baixas, exposto como os sistemas atuais lidam mal com esses tipos de ediçÃĩes narrativas impulsionadas.

O novo artigo ÃĐ intitulado Multiverse Through Deepfakes: O Conjunto de Dados MultiFakeVerse de ManipulaçÃĩes Visuais e Conceituais Centradas em Pessoas, e vem de cinco pesquisadores de universidades da AustrÃĄlia. O cÃģdigo e os dados relacionados foram lançados no GitHub, alÃĐm do hospedagem no Hugging Face mencionado anteriormente.

MÃĐtodo

O conjunto de dados MultiFakeVerse foi construído a partir de quatro conjuntos de imagens do mundo real que apresentam pessoas em situaçÃĩes diversas: EMOTIC; PISC, PIPA, e PIC 2.0. A partir de 86.952 imagens originais, os pesquisadores produziram 758.041 versÃĩes manipuladas.

Os quadros Gemini-2.0-Flash e ChatGPT-4o foram usados para propor seis ediçÃĩes mínimas para cada imagem – ediçÃĩes projetadas para alterar sutilmente como a pessoa mais proeminente na imagem seria percebida por um espectador.

Os modelos foram instruídos a gerar modificaçÃĩes que fariam com que o assunto parecesse ingÊnuo, orgulhoso, arrependido, inexperiente, ou descuidado, ou para ajustar algum elemento factual dentro da cena. Juntamente com cada ediçÃĢo, os modelos tambÃĐm produziram uma expressÃĢo de referÊncia para claramente identificar o alvo da modificaçÃĢo, garantindo que o processo de ediçÃĢo subsequente pudesse aplicar alteraçÃĩes à pessoa ou objeto correto dentro de cada imagem.

Os autores esclarecem:

‘Observe que expressÃĢo de referÊncia ÃĐ um domínio amplamente explorado na comunidade, que significa uma frase que pode desambiguar o alvo em uma imagem, por exemplo, para uma imagem com dois homens sentados em uma mesa, um falando ao telefone e o outro olhando para documentos, uma expressÃĢo de referÊncia adequada para o Último seria o homem à esquerda segurando um pedaço de papel.’

Uma vez que as ediçÃĩes foram definidas, a manipulaçÃĢo de imagem real foi realizada por meio de modelos de linguagem de visÃĢo que aplicavam as alteraçÃĩes especificadas, deixando o resto da cena intacta. Os pesquisadores testaram trÊs sistemas para essa tarefa: GPT-Image-1; Gemini-2.0-Flash-Image-Generation; e ICEdit.

ApÃģs a geraçÃĢo de vinte e dois mil amostras de imagens, o Gemini-2.0-Flash emergiu como o mÃĐtodo mais consistente, produzindo ediçÃĩes que se misturavam naturalmente com a cena sem introduzir artefatos visíveis; o ICEdit frequentemente produziu forjas mais Ãģbvias, com falhas notÃĄveis nas regiÃĩes alteradas; e o GPT-Image-1 ocasionalmente afetou partes nÃĢo intencionais da imagem, em parte devido à sua conformidade com razÃĩes de saída fixas.

AnÃĄlise de Imagem

Cada imagem manipulada foi comparada com sua original para determinar quanto da imagem havia sido alterada. As diferenças de nível de pixel entre as duas versÃĩes foram calculadas, com ruído aleatÃģrio pequeno filtrado para se concentrar em ediçÃĩes significativas. Em algumas imagens, apenas ÃĄreas minÚsculas foram afetadas; em outras, atÃĐ oitenta por cento da cena foi modificada.

Para avaliar o quanto o significado de cada imagem mudou à luz dessas alteraçÃĩes, legendas foram geradas para as imagens originais e manipuladas usando o modelo de linguagem de visÃĢo ShareGPT-4V.

Essas legendas foram entÃĢo convertidas em embeddings usando Long-CLIP, permitindo uma comparaçÃĢo de quanto o conteÚdo havia divergido entre as versÃĩes. As mudanças semÃĒnticas mais fortes foram vistas em casos onde objetos prÃģximos ou diretamente envolvidos com a pessoa haviam sido alterados, pois essas pequenas alteraçÃĩes podiam mudar significativamente como a imagem era interpretada.

O Gemini-2.0-Flash foi entÃĢo usado para classificar o tipo de manipulaçÃĢo aplicada a cada imagem, com base em onde e como as ediçÃĩes foram feitas. As manipulaçÃĩes foram agrupadas em trÊs categorias: ediçÃĩes de nível de pessoa envolviam mudanças na expressÃĢo facial do sujeito, pose, olhar, roupas ou outros recursos pessoais; ediçÃĩes de nível de objeto afetavam itens conectados à pessoa, como objetos que estavam segurando ou interagindo com no primeiro plano; e ediçÃĩes de nível de cena envolviam elementos de fundo ou aspectos mais amplos do cenÃĄrio que nÃĢo envolviam diretamente a pessoa.

O pipeline de geraçÃĢo do conjunto de dados MultiFakeVerse começa com imagens reais, onde modelos de linguagem de visÃĢo propÃĩem ediçÃĩes narrativas que visam pessoas, objetos ou cenas. Essas instruçÃĩes sÃĢo entÃĢo aplicadas por modelos de ediçÃĢo de imagens. O painel direito mostra a proporçÃĢo de manipulaçÃĩes de nível de pessoa, nível de objeto e nível de cena em todo o conjunto de dados. Fonte: https://arxiv.org/pdf/2506.00868

O pipeline de geraçÃĢo do conjunto de dados MultiFakeVerse começa com imagens reais, onde modelos de linguagem de visÃĢo propÃĩem ediçÃĩes narrativas que visam pessoas, objetos ou cenas. Essas instruçÃĩes sÃĢo entÃĢo aplicadas por modelos de ediçÃĢo de imagens. O painel direito mostra a proporçÃĢo de manipulaçÃĩes de nível de pessoa, nível de objeto e nível de cena em todo o conjunto de dados. Fonte: https://arxiv.org/pdf/2506.00868

JÃĄ que imagens individuais podiam conter vÃĄrios tipos de ediçÃĩes ao mesmo tempo, a distribuiçÃĢo dessas categorias foi mapeada em todo o conjunto de dados. Aproximadamente um terço das ediçÃĩes visava apenas a pessoa, cerca de um quinto afetavam apenas a cena, e cerca de um sexto estavam limitados a objetos.

AvaliaçÃĢo do Impacto Perceptual

O Gemini-2.0-Flash foi usado para avaliar como as manipulaçÃĩes poderiam alterar a percepçÃĢo do espectador em seis ÃĄreas: emoçÃĢo, identidade pessoal, dinÃĒmica de poder, narrativa da cena, intençÃĢo da manipulaçÃĢo, e preocupaçÃĩes ÃĐticas.

Para emoçÃĢo, as ediçÃĩes foram frequentemente descritas com termos como alegre, envolvente, ou acessível, sugerindo mudanças na forma como os assuntos eram enquadrados emocionalmente. Em termos narrativos, palavras como profissional ou diferente indicavam mudanças na histÃģria implícita ou no cenÃĄrio:

O Gemini-2.0-Flash foi solicitado a avaliar como cada manipulaçÃĢo afetou seis aspectos da percepçÃĢo do espectador. Esquerda: estrutura de prompt de exemplo que orienta a avaliaçÃĢo do modelo. Direita: nuvens de palavras resumindo mudanças em emoçÃĢo, identidade, narrativa da cena, intençÃĢo, dinÃĒmica de poder e preocupaçÃĩes ÃĐticas em todo o conjunto de dados.

O Gemini-2.0-Flash foi solicitado a avaliar como cada manipulaçÃĢo afetou seis aspectos da percepçÃĢo do espectador. Esquerda: estrutura de prompt de exemplo que orienta a avaliaçÃĢo do modelo. Direita: nuvens de palavras resumindo mudanças em emoçÃĢo, identidade, narrativa da cena, intençÃĢo, dinÃĒmica de poder e preocupaçÃĩes ÃĐticas em todo o conjunto de dados.

DescriçÃĩes de mudanças de identidade incluíam termos como mais jovem, brincalhÃĢo, e vulnerÃĄvel, mostrando como alteraçÃĩes menores podiam influenciar como os indivíduos eram percebidos. A intençÃĢo por trÃĄs de muitas ediçÃĩes foi rotulada como persuasiva, enganosa, ou estÃĐtica. Embora a maioria das ediçÃĩes tenha sido julgada como levantando apenas preocupaçÃĩes ÃĐticas leves, uma pequena fraçÃĢo foi vista como carregando implicaçÃĩes ÃĐticas moderadas ou graves.

Exemplos do MultiFakeVerse mostrando como pequenas ediçÃĩes deslocam a percepçÃĢo do espectador. Caixas amarelas destacam as regiÃĩes alteradas, com anÃĄlise acompanhante de mudanças em emoçÃĢo, identidade, narrativa e preocupaçÃĩes ÃĐticas.

Exemplos do MultiFakeVerse mostrando como pequenas ediçÃĩes deslocam a percepçÃĢo do espectador. Caixas amarelas destacam as regiÃĩes alteradas, com anÃĄlise acompanhante de mudanças em emoçÃĢo, identidade, narrativa e preocupaçÃĩes ÃĐticas.

MÃĐtricas

A qualidade visual do conjunto de dados MultiFakeVerse foi avaliada usando trÊs mÃĐtricas padrÃĢo: Taxa de Sinal para Ruído de Pico (PSNR); Índice de Similaridade Estrutural (SSIM); e DistÃĒncia de Início de FrÃĐchet (FID):

PontuaçÃĩes de qualidade de imagem para MultiFakeVerse medidas por PSNR, SSIM e FID.

PontuaçÃĩes de qualidade de imagem para MultiFakeVerse medidas por PSNR, SSIM e FID.

A pontuaçÃĢo SSIM de 0,5774 reflete um grau moderado de similaridade, consistente com o objetivo de preservar a maior parte da imagem enquanto aplica ediçÃĩes direcionadas; a pontuaçÃĢo FID de 3,30 sugere que as imagens geradas mantÊm alta qualidade e diversidade; e um valor PSNR de 66,30 decibÃĐis indica que as imagens retÊm boa fidelidade visual apÃģs manipulaçÃĢo.

Estudo de UsuÃĄrio

Um estudo de usuÃĄrio foi realizado para ver quÃĢo bem as pessoas podiam identificar as falsificaçÃĩes sutis no MultiFakeVerse. Dezoito participantes foram mostrados cinquenta imagens, divididas igualmente entre exemplos reais e manipulados que cobriam uma variedade de tipos de ediçÃĩes. Cada pessoa foi solicitada a classificar se a imagem era real ou falsa, e, se falsa, a identificar que tipo de manipulaçÃĢo havia sido aplicada.

A precisÃĢo geral para decidir real versus falso foi de 61,67 por cento, significando que os participantes classificaram incorretamente as imagens mais de um terço do tempo.

Os autores afirmam:

‘Analisando as previsÃĩes humanas dos níveis de manipulaçÃĢo para as imagens falsas, a interseçÃĢo mÃĐdia entre as previsÃĩes e os níveis de manipulaçÃĢo reais foi encontrada em 24,96%.

‘Isso mostra que nÃĢo ÃĐ trivial para os observadores humanos identificar as regiÃĩes de manipulaçÃĩes em nosso conjunto de dados.’

A construçÃĢo do conjunto de dados MultiFakeVerse exigiu recursos computacionais extensivos: para a geraçÃĢo de instruçÃĩes de ediçÃĢo, mais de 845.000 chamadas de API foram feitas para os modelos Gemini e GPT, com essas tarefas de promptamento custando cerca de $1000; produzir as imagens baseadas em Gemini custou aproximadamente $2.867; e gerar imagens usando o GPT-Image-1 custou cerca de $200. As imagens do ICEdit foram criadas localmente em um GPU NVIDIA A6000, completando a tarefa em cerca de vinte e quatro horas.

Testes

Antes dos testes, o conjunto de dados foi dividido em conjuntos de treinamento, validaçÃĢo e teste, selecionando primeiro 70% das imagens reais para treinamento; 10% para validaçÃĢo; e 20% para teste. As imagens manipuladas geradas a partir de cada imagem real foram atribuídas ao mesmo conjunto que a imagem original correspondente.

Mais exemplos de conteÚdo real (esquerda) e alterado (direita) do conjunto de dados.

Mais exemplos de conteÚdo real (esquerda) e alterado (direita) do conjunto de dados.

O desempenho na detecçÃĢo de falsificaçÃĩes foi medido usando a precisÃĢo de nível de imagem (se o sistema classifica corretamente a imagem inteira como real ou falsa) e pontuaçÃĩes F1. Para a localizaçÃĢo de regiÃĩes manipuladas, a avaliaçÃĢo usou Área Sob a Curva (AUC), pontuaçÃĩes F1 e interseçÃĢo sobre uniÃĢo (IoU).

O conjunto de dados MultiFakeVerse foi usado contra os principais sistemas de detecçÃĢo de deepfakes no conjunto de teste completo, com os frameworks rivais sendo CnnSpot; AntifakePrompt; TruFor; e o baseado em linguagem de visÃĢo SIDA. Cada modelo foi avaliado primeiro no modo zero-shot, usando seus pesos prÃĐ-treinados originais sem ajustes adicionais.

Dois modelos, CnnSpot e SIDA, foram entÃĢo ajustados finamente nos dados de treinamento do MultiFakeVerse para avaliar se o ajuste fino melhorava o desempenho.

Resultados de detecçÃĢo de deepfakes no MultiFakeVerse sob condiçÃĩes zero-shot e ajuste fino. NÚmeros entre parÊnteses mostram mudanças apÃģs o ajuste fino.

Resultados de detecçÃĢo de deepfakes no MultiFakeVerse sob condiçÃĩes zero-shot e ajuste fino. NÚmeros entre parÊnteses mostram mudanças apÃģs o ajuste fino.

Desses resultados, os autores afirmam:

‘[Os] modelos treinados em conjuntos de dados de inpainting anteriores lutam para identificar nossas falsificaçÃĩes baseadas em ediçÃĢo de VLM, particularmente, o CNNSpot tende a classificar quase todas as imagens como reais. O AntifakePrompt tem o melhor desempenho zero-shot com 66,87% de precisÃĢo mÃĐdia de classe e 55,55% de pontuaçÃĢo F1.

‘ApÃģs o ajuste fino em nosso conjunto de treinamento, observamos uma melhoria no desempenho em ambos, CNNSpot e SIDA-13B, com o CNNSpot superando o SIDA-13B em termos de precisÃĢo mÃĐdia de classe (por 1,92%) e pontuaçÃĢo F1 (por 1,97%).’

O SIDA-13B foi avaliado no MultiFakeVerse para medir quÃĢo precisamente ele poderia localizar as regiÃĩes manipuladas dentro de cada imagem. O modelo foi testado tanto no modo zero-shot quanto apÃģs o ajuste fino no conjunto de dados.

No seu estado original, ele alcançou uma pontuaçÃĢo de interseçÃĢo sobre uniÃĢo de 13,10, uma pontuaçÃĢo F1 de 19,92 e uma AUC de 14,06, refletindo um desempenho de localizaçÃĢo fraco.

ApÃģs o ajuste fino, as pontuaçÃĩes melhoraram para 24,74 para IoU, 39,40 para F1 e 37,53 para AUC. No entanto, mesmo com o treinamento adicional, o modelo ainda teve dificuldade em encontrar exatamente onde as ediçÃĩes haviam sido feitas, destacando quÃĢo difícil pode ser detectar esses tipos de alteraçÃĩes pequenas e direcionadas.

ConclusÃĢo

O novo estudo expÃĩe um ponto cego tanto na percepçÃĢo humana quanto na mÃĄquina: enquanto grande parte do debate pÚblico em torno de deepfakes se concentrou em trocas de identidade de alto impacto, essas ‘ediçÃĩes narrativas’ mais silenciosas sÃĢo mais difíceis de detectar e potencialmente mais corrosivas a longo prazo.

À medida que sistemas como ChatGPT e Gemini desempenham um papel mais ativo na geraçÃĢo desse tipo de conteÚdo, e à medida que nÃģs mesmos participamos cada vez mais na alteraçÃĢo da realidade de nossas prÃģprias sequÊncias de fotos, os modelos de detecçÃĢo que confiam em detectar manipulaçÃĩes grosseiras podem oferecer defesa inadequada.

O que o MultiFakeVerse demonstra nÃĢo ÃĐ que a detecçÃĢo falhou, mas que pelo menos parte do problema pode estar se movendo para uma forma mais difícil, mais lenta: uma onde pequenas mentiras visuais se acumulam despercebidas.

 

Publicado pela primeira vez na quinta-feira, 5 de junho de 2025

Escritor sobre aprendizado de mÃĄquina, especialista em síntese de imagem humana. Anteriormente, chefe de conteÚdo de pesquisa da Metaphysic.ai, atÃĐ sua dissoluçÃĢo na Brahma.ai da DNEG.
Portfolio site: martinanderson.ai
Contato: [email protected]