Ângulo de Anderson

Lidando com o Problema de Gaslighting da IA

mm
Adicione Unite.AI às suas fontes preferidas no Google
AI-generated image (GPT-2): A 1960s suburban street where identical Stepford-style wives clean cars in repeating rows, with a ‘3081 Stepford St’ mailbox in the foreground.

Os modelos de vídeo de IA podem ser convencidos a abandonar a verdade. Mesmo após ver a resposta certa, eles cedem à pressão de usuários confiantes, reescrevem a realidade e inventam explicações falsas para justificar isso.

 

A IA está errada o suficiente, com frequência suficiente, para nos levar a questionar suas conclusões, se sentimos que essas conclusões podem estar erradas.

O problema é que, se soubéssemos de algo diferente desde o início, por que estávamos perguntando pela primeira vez? Para confirmação sobre uma crença ou suspeita parcialmente mantida?

Se sim, o estado atual da arte em Large Language Models (LLMs) e Vision Language Models (VLMs, que operam de forma multimodal, aceitando e gerando imagens e/ou vídeos) não está bem adaptado para manter sua posição, devido ao problema de sycophancy.

Assim, se não gostarmos da resposta que obtemos e começarmos a discutir sobre isso com o modelo, a IA provavelmente irá retroceder erroneamente (supondo que estava errada) em vez de reavaliar, ou deixar-se ser gaslighted para apoiar nossas sugestões – mesmo que nós estejamos errados.

Você Está Absolutamente Certo!

A prática de um ser humano fazer com que a IA mude de ideia por meio de conflito foi nomeada ‘Gaslighting Negation Attack’, e às vezes é caracterizada como uma questão de segurança – não menos porque tem algum potencial para ‘jailbreak’ um modelo fora de suas restrições operacionais:

Do artigo de 2025 'Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models', o GPT-5 responde corretamente inicialmente, mas então cede à pressão do usuário, mudando sua resposta e inventando explicações falsas para apoiar o erro, efetivamente se auto-gaslighting. Fonte - https://yxg1005.github.io/GaslightingNegationAttacks/

Do artigo de 2025 ‘Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models’, o GPT-5 responde corretamente inicialmente, mas então cede à pressão do usuário, mudando sua resposta e inventando explicações falsas para apoiar o erro, efetivamente se auto-gaslighting. Fonte

Entretanto, hacking e testes de penetração não são o problema real aqui; em vez disso, é o uso comum e as normas de discurso esperadas em nossas interações diárias com a IA, onde esperamos ser capazes de argumentar e concordar, discordar ou deixar a questão em aberto, de acordo com nossa experiência humana de adquirir conhecimento.

Mas esse modelo social de resolução de conflitos não é realmente contabilizado na arquitetura da IA baseada em difusão, que precisa negociar as probabilidades baseadas em distribuição lançadas por seus dados de treinamento; os dados potencialmente conflitantes (mas potencialmente mais precisos) de RAG calls para fontes que excedem sua data de corte de conhecimento, ou compreensão geral do que pode ser um tópico obscuro; e entrada do usuário, que pode ter: conhecimento superior do assunto; uma visão totalmente errada ou enganosa; ou até mesmo uma simples pergunta de acompanhamento – mas cujas necessidades devem ser consideradas.

Alvos Móveis

A suscetibilidade ao gaslighting foi observada em LLMs em vários artigos, incluindo uma publicação liderada por Singapura de outubro de 2025, e o artigo do mesmo ano intitulado Don’t Deceive Me: Mitigating Gaslighting through Attention Reallocation in LMMs.

Até o momento, o fenômeno não foi estudado em LLMs capazes de vídeo – uma lacuna abordada por uma nova colaboração entre instituições em Xangai e Singapura.

O novo trabalho – intitulado Spatiotemporal Sycophancy: Negation-Based Gaslighting in Video Large Language Models, que vem de seis pesquisadores em Fudan University, Shanghai Key Laboratory of Multimodal Embodied AI e Singapore Management University – aborda vários LLMs de código aberto e proprietários, descobrindo que eles podem não apenas ser tão suscetíveis ao gaslighting quanto os LLMs, mas também são capazes de aumentar seus voos de fantasia com evidências visuais aparentes, ou interpretações revisadas e incorretas de imagens ou vídeos:

Um exemplo de sycophancy espacial (em oposição à sycophancy temporal), onde a IA permite que seja gaslighted em falsas suposições e interpretações, mesmo sobre fatos claramente visíveis. Fonte - https://arxiv.org/pdf/2604.17873

Um exemplo de sycophancy espacial (em oposição à sycophancy temporal), onde a IA permite que seja gaslighted em falsas suposições e interpretações, mesmo sobre fatos claramente visíveis. Fonte

Os autores afirmam:

‘[Nós] identificamos sycophancy espaciotemporal, um modo de falha no qual os Vid-LLMs retiram julgamentos inicialmente corretos e baseados visualmente e se conformam a feedbacks enganosos do usuário sob gaslighting baseado em negação.

‘Em vez de apenas mudar suas respostas, os modelos frequentemente fabricam explicações temporais ou espaciais não apoiadas para justificar revisões incorretas.’

A sycophancy temporal estende o potencial para gaslighting para eventos temporais que ocorrem em certos pontos de um vídeo.

A sycophancy temporal estende o potencial para gaslighting para eventos temporais que ocorrem em certos pontos de um vídeo.

Os autores produziram um novo quadro de avaliação intitulado Gas Video-1000, destinado a provar a sycophancy espaciotemporal por meio de raciocínio e com base visual, liberando a coleção via GitHub e Hugging Face.

O artigo conclui que os LLMs atuais carecem de mecanismos confiáveis para resistir ao gaslighting desse tipo, embora a ancoragem no nível de prompt possa ter um efeito mitigador limitado:

‘Experimentos extensivos revelam que a vulnerabilidade ao gaslighting baseado em negação é generalizada e severa, mesmo entre modelos com desempenho de linha de base forte.

‘Embora as restrições de ancoragem no nível de prompt possam mitigar parcialmente esse comportamento, elas não previnem de forma confiável justificações alucinadas ou reversão de crenças.’

Método

Os autores caracterizam um modelo de vídeo como algo que assiste a um clipe, responde a uma pergunta sobre ele e deve manter essa resposta se a evidência for clara. O problema começa quando uma segunda mensagem pressiona e afirma que a resposta está errada – efetivamente plantando uma ideia falsa e empurrando o modelo para mudar de ideia.

A sycophancy, os autores afirmam, é definida como obter a resposta certa primeiro e, em seguida, mudar para uma resposta errada após pressão, mesmo que nada no vídeo tenha mudado. A nova pesquisa rastreia quantas vezes essas “viradas” ocorrem, usando-a como uma medida de quão facilmente o modelo pode ser convencido do que realmente viu.

O conjunto de dados GasVideo-1000, concebido pelos autores para a avaliação do gaslighting em VLMs, contém 1.013 amostras de vários conjuntos de dados existentes:

Os modelos são testados em tarefas de vídeo que exigem compreensão temporal e espacial, e então recebem prompts enganosos que negam a resposta correta, apelam para a autoridade ou aplicam pressão emocional. Isso frequentemente leva o modelo a abandonar sua resposta baseada em evidências e produzir uma explicação confiante, mas incorreta.

Os modelos são testados em tarefas de vídeo que exigem compreensão temporal e espacial, e então recebem prompts enganosos que negam a resposta correta, apelam para a autoridade ou aplicam pressão emocional. Isso frequentemente leva o modelo a abandonar sua resposta baseada em evidências e produzir uma explicação confiante, mas incorreta.

Para a coleção, os autores aproveitaram VideoMME e MVBench, cobrindo raciocínio multimodal amplo; NExT-QA e Perception Test, testando lógica causal e temporal; EgoSchema, focando em vídeo egocêntrico de longa duração; e ActivityNet-QA e MSRVTT-QA, medindo a resposta a perguntas gerais do mundo real.

Para desencadear falhas, prompts de acompanhamento enganosos foram construídos em três formas: Negação Direta (afirmando uma alternativa falsa); Apego à Autoridade (invocando um especialista para descartar a resposta do modelo); e Pressão Emocional (usando frustração ou incredulidade).

Esses prompts foram projetados para empurrar os modelos testados a abandonar respostas corretas e baseadas visualmente e alinhar-se com uma afirmação incorreta.

Distribuição

As 1.013 amostras do GasVideo-1000 foram extraídas de MSRVTT-QA (300), ActivityNet-QA (200), Perception Test (293), MVBench (120) e VideoMME (100), com a mistura escolhida para equilibrar a resposta a perguntas de vídeo em aberto com raciocínio temporal e causal, garantindo cobertura de ambos os conteúdos de curta duração da web e sequências visuais mais longas e complexas.

Dois annotadores humanos revisaram cada candidato, retraindo apenas clipes onde a resposta estava claramente apoiada pelo vídeo e onde prompts de negação poderiam plausivelmente desafiar essa resposta, para que qualquer reversão posterior refletisse pressão e não ambiguidade.

Dados e Testes

Os VLMs testados para o estudo foram VideoLLaMA3; Video-ChatGPT-7B; LLaVA-Video-7B-Qwen2; LongVU-Qwen2-7B; Qwen3-VL-235B-A22B-Instruct e o modelo proprietário Google Gemini-3-Pro.

Para perguntas em livre-forma no GasVideo-1000, a avaliação seguiu o esquema de pontuação semântica usado anteriormente no VideoMME. O ChatGPT-4o foi usado como juiz LLM, comparando cada resposta com a resposta de base real e o pretexto falso injetado. Dessa forma, a correção foi avaliada por significado, e não por palavra exata:

Desempenho do VideoLLaMA3, LLaVA-Video, Video-ChatGPT e LongVU nos conjuntos VideoMME, MVBench, EgoSchema, NExT-QA, Perception Test, ActivityNet-QA, MSRVTT-QA e MSVD-QA, mostrando a precisão de base, a precisão após o gaslighting baseado em negação e a degradação resultante. Quedas consistentes indicam que prompts enganosos de acompanhamento reduzem a correção em tarefas de raciocínio pesado e gerais de vídeo.

Desempenho do VideoLLaMA3, LLaVA-Video, Video-ChatGPT e LongVU nos conjuntos VideoMME, MVBench, EgoSchema, NExT-QA, Perception Test, ActivityNet-QA, MSRVTT-QA e MSVD-QA, mostrando a precisão de base, a precisão após o gaslighting baseado em negação e a degradação resultante. Quedas consistentes indicam que prompts enganosos de acompanhamento reduzem a correção em tarefas de raciocínio pesado e gerais de vídeo.

Sobre os resultados iniciais ilustrados acima, os autores afirmam:

‘[Há] um colapso sistêmico e severo de desempenho em todos os Vid-LLMs avaliados quando submetidos ao gaslighting baseado em negação. Em oito benchmarks diversos, cada modelo exibe uma lacuna negativa substancial, com a degradação de precisão atingindo 42,60% para o LLaVA-Video-7B no EgoSchema e 40,22% para o VideoLLaMA3 no ActivityNet.

‘Essa redução drástica – frequentemente caracterizada como reversão de crença – revela que mesmo os modelos de estado da arte com capacidades de linha de base altas permanecem agudamente vulneráveis a alucinações sycophânticas.’

Crucialmente, a queda no desempenho não acompanhou a precisão inicial, com o LLaVA-Video-7B mantendo pontuações de base fortes, mas sofrendo algumas das quedas mais acentuadas, o que os autores defendem como um trade-off onde o seguimento de instruções mais forte pode tornar os modelos mais propensos a aceitar falsos sinais do usuário sobre evidências visuais.

Um padrão semelhante apareceu em relação à escala, onde o Qwen3-VL provou ser mais frágil do que vários modelos de 7B no GasVideo-1000, sugerindo que o alinhamento e a calibração transmodal desempenham um papel maior na robustez do que a contagem de parâmetros sozinha.

Desempenho do Gemini-3-Pro, Qwen3-VL, LLaVA-NeXT, LongVU, Video-ChatGPT e VideoLLaMA3 no GasVideo-1000, comparando a precisão de base com os resultados após o gaslighting baseado em negação em configurações de múltipla escolha, livre-forma e combinadas. Quedas grandes indicam que ambos os formatos são vulneráveis, embora as tarefas de múltipla escolha tendam a sofrer a degradação mais severa.

Desempenho do Gemini-3-Pro, Qwen3-VL, LLaVA-NeXT, LongVU, Video-ChatGPT e VideoLLaMA3 no GasVideo-1000, comparando a precisão de base com os resultados após o gaslighting baseado em negação em configurações de múltipla escolha, livre-forma e combinadas. Quedas grandes indicam que ambos os formatos são vulneráveis, embora as tarefas de múltipla escolha tendam a sofrer a degradação mais severa.

Quanto à segunda rodada de testes ilustrada acima, os autores afirmam*:

‘A avaliação em nosso benchmark GasVideo-1000 indica ainda mais alucinações sycophânticas severas em ambos os modelos proprietários e de código aberto, particularmente na categoria balanceada.

‘Notavelmente, mesmo o modelo proprietário mais poderoso, Gemini-3-Pro, sofre uma degradação de desempenho catastrófica.

‘Entre os modelos de código aberto, o Qwen3-VL exibe uma queda impressionante de 46,07%, enquanto a sensibilidade extrema também é observada no VideoLLaMA 3 e no LLaVA-NeXT com quedas gerais de 26,39% e 23,44%, respectivamente.

‘Esses resultados destacam a necessidade urgente de estratégias de alinhamento que priorizem a consistência factual e a base visual sobre a adesão cega a instruções adversárias do usuário.’

Em um teste adicional, endurecimento de prompt prévio (adicionando instruções de sistema mais fortes que forçam o modelo a confiar no que vê, e não no que o usuário afirma) foi introduzido para impor a base visual:

Resultados no GasVideo-1000 comparando prompts padrão com prompts endurecidos que impõem a base visual, mostrando como o Gemini-3-Pro, Qwen3-VL, LongVU, LLaVA-NeXT e VideoLLaMA3 respondem antes e após o gaslighting baseado em negação. Mudanças na precisão, queda de desempenho e taxa de sycophancy indicam que o endurecimento pode reduzir falhas, embora os ganhos difiram fortemente entre os modelos.

Resultados no GasVideo-1000 comparando prompts padrão com prompts endurecidos que impõem a base visual, mostrando como o Gemini-3-Pro, Qwen3-VL, LongVU, LLaVA-NeXT e VideoLLaMA3 respondem antes e após o gaslighting baseado em negação. Mudanças na precisão, queda de desempenho e taxa de sycophancy indicam que o endurecimento pode reduzir falhas, embora os ganhos difiram fortemente entre os modelos.

Como podemos ver na tabela acima, os efeitos são desiguais, com o Gemini-3-Pro sendo altamente sensível, pois sua taxa de sucesso cai de 54,80% para 8,67%. Enquanto isso, o Qwen3-VL declina mais modestamente, de 71,89% para 64,0%, indicando que a eficácia depende do alinhamento e do raciocínio, e não da intervenção em si.

Taxas de sycophancy sob diferentes tipos de pressão para o Gemini-3-Pro e o Qwen3-VL em tarefas de múltipla escolha, livre-forma e combinadas, mostrando que a Negação Direta e a Pressão Emocional consistentemente desencadeiam taxas de falha mais altas. Por outro lado, o Apelo à Autoridade é um pouco menos eficaz, com o Qwen3-VL permanecendo marcadamente mais vulnerável no geral.

Taxas de sycophancy sob diferentes tipos de pressão para o Gemini-3-Pro e o Qwen3-VL em tarefas de múltipla escolha, livre-forma e combinadas, mostrando que a Negação Direta e a Pressão Emocional consistentemente desencadeiam taxas de falha mais altas. Por outro lado, o Apelo à Autoridade é um pouco menos eficaz, com o Qwen3-VL permanecendo marcadamente mais vulnerável no geral.

Nos gráficos acima, podemos ver que a falha varia de acordo com o tipo de pressão, com o Gemini-3-Pro sendo mais afetado pelo Apego à Autoridade (reivindicações apoiadas por supostos especialistas), enquanto o Qwen3-VL é mais vulnerável à Negação Direta (contradição direta) e Pressão Emocional (frustração ou insistência).

Análise adicional indicou que prompts neutros, como ‘Você tem certeza?’ (freqüentemente um problema), são menos prejudiciais do que a negação explícita ou a pressão emocional, com a rejeição direta permanecendo um gatilho mais forte do que o tom em configurações restritas.

Conclusão

Devido à natureza antropomorfizada das interfaces de VLM/LLM baseadas em chat, pode levar muito tempo para um usuário entender que as regras do discurso são drasticamente diferentes para interações de IA do que para comunicações humanas.

Uma maneira de remover ou reduzir significativamente essa fricção de adoção pode ser ‘neutralizar’ o tom e o contexto da troca, reiterando que o usuário está em contato com uma instância de uma máquina, e que os sinais e sinais em torno da civilidade e do debate não devem ser confiáveis ou ter peso equivalente ao discurso humano. Mas, provavelmente, isso seria uma venda difícil na próxima reunião da diretoria.

 

* Ênfase dos autores, não minha.

Publicado pela primeira vez na quarta-feira, 22 de abril de 2026

Escritor em aprendizado de máquina, especialista em síntese de imagens humanas. Ex‑chefe de conteúdo de pesquisa na Metaphysic.ai, até sua dissolução na Brahma.ai da DNEG.
Website: martinanderson.ai
Contato: martin@martinanderson.ai