Ângulo de Anderson
Usando Alucinações de IA para Avaliar a Realismo de Imagens

Pesquisa recente da Rússia propõe um método não convencional para detectar imagens geradas por IA irreais – não melhorando a precisão de grandes modelos de visão-linguagem (LVLMs), mas aproveitando intencionalmente sua tendência a alucinar.
A abordagem inovadora extrai vários ‘fatos atômicos’ sobre uma imagem usando LVLMs, então aplica inferência de linguagem natural (NLI) para medir sistematicamente as contradições entre essas afirmações – efetivamente transformando os defeitos do modelo em uma ferramenta de diagnóstico para detectar imagens que desafiam o senso comum.

Duas imagens do conjunto de dados WHOOPS! ao lado de afirmações automaticamente geradas pelo modelo LVLM. A imagem da esquerda é realista, levando a descrições consistentes, enquanto a imagem incomum da direita faz com que o modelo alucine, produzindo afirmações contraditórias ou falsas. Fonte: https://arxiv.org/pdf/2503.15948
Quando solicitado a avaliar a realismo da segunda imagem, o LVLM pode ver que algo está errado, desde que o camelo retratado tenha três corcovas, o que é desconhecido na natureza.
No entanto, o LVLM inicialmente confunde > 2 corcovas com > 2 animais, pois essa é a única maneira de você poder ver três corcovas em uma ‘imagem de camelo’. Em seguida, ele prossegue para alucinar algo ainda mais improvável do que três corcovas (ou seja, ‘duas cabeças’) e nunca detalha a coisa que parece ter desencadeado suas suspeitas – a corcova improvável extra.
Os pesquisadores do novo trabalho descobriram que os modelos LVLM podem realizar essa avaliação de forma nativa e em par com (ou melhor do que) modelos que foram ajustados para uma tarefa desse tipo. Como o ajuste é complicado, caro e bastante frágil em termos de aplicabilidade downstream, a descoberta de um uso nativo para um dos maiores obstáculos na atual revolução da IA é uma reviravolta refrescante nos tendências gerais da literatura.
Avaliação Aberta
A importância da abordagem, os autores afirmam, é que ela pode ser implantada com frameworks de código aberto. Embora um modelo avançado e de alto investimento, como o ChatGPT, possa (o artigo concede) potencialmente oferecer melhores resultados nessa tarefa, o valor discutível da literatura para a maioria de nós (e especialmente para as comunidades de hobby e VFX) é a possibilidade de incorporar e desenvolver novas descobertas em implementações locais; por outro lado, tudo destinado a um sistema de API comercial proprietário está sujeito a retirada, aumentos de preços arbitrários e políticas de censura que são mais prováveis de refletir as preocupações corporativas de uma empresa do que as necessidades e responsabilidades do usuário.
O novo artigo é intitulado Não Lute Contra as Alucinações, Use-as: Estimando o Realismo de Imagens usando NLI sobre Fatos Atômicos e vem de cinco pesquisadores de todo o Instituto de Ciência e Tecnologia Skolkovo (Skoltech), Instituto de Física e Tecnologia de Moscou e empresas russas MTS AI e AIRI. O trabalho tem uma página de acompanhamento no GitHub.
Método
Os autores usam o conjunto de dados WHOOPS! israelense/estadunidense para o projeto:

Exemplos de imagens impossíveis do conjunto de dados WHOOPS! É notável como essas imagens montam elementos plausíveis e que sua improbabilidade deve ser calculada com base na concatenação desses aspectos incompatíveis. Fonte: https://whoops-benchmark.github.io/
O conjunto de dados compreende 500 imagens sintéticas e mais de 10.874 anotações, especificamente projetadas para testar a capacidade de raciocínio comum e a compreensão composicional dos modelos de IA. Ele foi criado em colaboração com designers encarregados de gerar imagens desafiadoras por meio de sistemas de texto-para-imagem, como Midjourney e a série DALL-E – produzindo cenários difíceis ou impossíveis de capturar naturalmente:

Mais exemplos do conjunto de dados WHOOPS! Fonte: https://huggingface.co/datasets/nlphuji/whoops
A nova abordagem funciona em três etapas: primeiro, o LVLM (especificamente LLaVA-v1.6-mistral-7b) é solicitado a gerar várias afirmações simples – chamadas de ‘fatos atômicos’ – que descrevem uma imagem. Essas afirmações são geradas usando Diverse Beam Search, garantindo variabilidade nos resultados.

Diverse Beam Search produz uma melhor variedade de opções de legendas, otimizando para um objetivo aumentado de diversidade. Fonte: https://arxiv.org/pdf/1610.02424
Em seguida, cada afirmação gerada é comparada sistematicamente a todas as outras afirmações usando um modelo de Inferência de Linguagem Natural, que atribui pontuações que refletem se os pares de afirmações implicam, contradizem ou são neutros em relação um ao outro.
As contradições indicam alucinações ou elementos irreais dentro da imagem:

Esquema para o pipeline de detecção.
Finalmente, o método agrega essas pontuações de NLI em pares em uma única ‘pontuação de realidade’ que quantifica a coerência geral das afirmações geradas.
Os pesquisadores exploraram diferentes métodos de agregação, com uma abordagem baseada em agrupamento apresentando o melhor desempenho. Os autores aplicaram o algoritmo de k-means clustering para separar as pontuações de NLI individuais em dois clusters, e o centróide do cluster de valor mais baixo foi então escolhido como a métrica final.
Usar dois clusters alinha-se diretamente com a natureza binária da tarefa de classificação, ou seja, distinguir imagens realistas de irreais. A lógica é semelhante a simplesmente escolher a pontuação mais baixa geral; no entanto, o agrupamento permite que a métrica represente a contradição média entre vários fatos, em vez de confiar em um único valor discrepante.
Dados e Testes
Os pesquisadores testaram seu sistema no benchmark de linha de base do WHOOPS!, usando divisões de teste rotativas (ou seja, divisão de dados) (ou seja, validação cruzada). Os modelos testados foram BLIP2 FlanT5-XL e BLIP2 FlanT5-XXL em divisões, e BLIP2 FlanT5-XXL no formato zero-shot (ou seja, sem treinamento adicional).
Para uma linha de base de seguimento de instruções, os autores solicitaram que os LVLMs fossem solicitados com a frase ‘Isso é incomum? Por favor, explique brevemente com uma frase curta’, que pesquisas anteriores encontraram eficazes para detectar imagens irreais.
Os modelos avaliados foram LLaVA 1.6 Mistral 7B, LLaVA 1.6 Vicuna 13B e dois tamanhos (7/13 bilhões de parâmetros) de InstructBLIP.
O procedimento de teste foi centrado em 102 pares de imagens realistas e irreais (‘estranhas’). Cada par consistia em uma imagem normal e uma contraparte que desafia o senso comum.
Três annotadores humanos rotularam as imagens, alcançando um consenso de 92%, indicando um forte acordo humano sobre o que constituía ‘estranheza’. A precisão dos métodos de avaliação foi medida pela capacidade de distinguir corretamente entre imagens realistas e irreais.
O sistema foi avaliado usando validação cruzada de três vezes, embaralhando os dados com uma semente fixa. Os autores ajustaram os pesos para as pontuações de implicação (afirmações que concordam logicamente) e contradição (afirmações que conflitam logicamente) durante o treinamento, enquanto as pontuações ‘neutras’ foram fixadas em zero. A precisão final foi computada como a média em todas as divisões de teste.

Comparação de diferentes modelos de NLI e métodos de agregação em um subconjunto de cinco fatos gerados, medidos por precisão.
Quanto aos resultados iniciais mostrados acima, o artigo afirma:
‘O método [‘clust’] se destaca como um dos melhores desempenhos. Isso implica que a agregação de todas as pontuações de contradição é crucial, em vez de se concentrar apenas em valores extremos. Além disso, o maior modelo de NLI (nli-deberta-v3-large) supera todos os outros para todos os métodos de agregação, sugerindo que ele captura a essência do problema de forma mais eficaz.’
Os autores encontraram que os pesos ótimos consistentemente favoreciam a contradição sobre a implicação, indicando que as contradições eram mais informativas para distinguir imagens irreais. Seu método superou todos os outros métodos zero-shot testados, aproximando-se do desempenho do modelo BLIP2 ajustado:

Desempenho de várias abordagens no benchmark do WHOOPS! Os métodos ajustados (ft) aparecem no topo, enquanto os métodos zero-shot (zs) são listados abaixo. O tamanho do modelo indica o número de parâmetros, e a precisão é usada como a métrica de avaliação.
Eles também notaram, um pouco inesperadamente, que o InstructBLIP apresentou um desempenho melhor do que os modelos LLaVA comparáveis, dado o mesmo prompt. Embora reconhecendo a precisão superior do GPT-4o, o artigo enfatiza a preferência dos autores por demonstrar soluções práticas e de código aberto, e, parece, pode razoavelmente reivindicar novidade em explorar explicitamente as alucinações como uma ferramenta de diagnóstico.
Conclusão
No entanto, os autores reconhecem a dívida do seu projeto com a saída do FaithScore em 2024, uma colaboração entre a Universidade do Texas em Dallas e a Universidade Johns Hopkins.

Ilustração de como a avaliação do FaithScore funciona. Primeiro, as afirmações descritivas dentro de uma resposta gerada pelo LVLM são identificadas. Em seguida, essas afirmações são quebradas em fatos atômicos individuais. Finalmente, os fatos atômicos são comparados com a imagem de entrada para verificar sua precisão. Fonte: https://arxiv.org/pdf/2311.01477
O FaithScore mede a fidelidade das descrições geradas pelo LVLM, verificando a consistência contra o conteúdo da imagem, enquanto os métodos do novo artigo exploram explicitamente as alucinações do LVLM para detectar imagens irreais por meio de contradições nos fatos gerados, usando Inferência de Linguagem Natural.
O novo trabalho é, naturalmente, dependente das peculiaridades dos modelos de linguagem atuais e de sua tendência a alucinar. Se o desenvolvimento de modelos algum dia trouxer um modelo completamente não alucinante, mesmo os princípios gerais do novo trabalho não seriam mais aplicáveis. No entanto, isso permanece um prospecto desafiador.
Publicado pela primeira vez na terça-feira, 25 de março de 2025












