Ângulo de Anderson

Lidando com o Problema de Gaslighting da IA

mm
Adicione Unite.AI às suas fontes preferidas no Google
AI-generated image (GPT-2): A 1960s suburban street where identical Stepford-style wives clean cars in repeating rows, with a ‘3081 Stepford St’ mailbox in the foreground.

Os modelos de vídeo de IA podem ser convencidos a abandonar a verdade. Mesmo apÃģs ver a resposta certa, eles cedem à pressÃĢo de usuÃĄrios confiantes, reescrevem a realidade e inventam explicaçÃĩes falsas para justificar isso.

 

A IA estÃĄ errada o suficiente, com frequÊncia suficiente, para nos levar a questionar suas conclusÃĩes, se sentimos que essas conclusÃĩes podem estar erradas.

O problema ÃĐ que, se soubÃĐssemos de algo diferente desde o início, por que estÃĄvamos perguntando pela primeira vez? Para confirmaçÃĢo sobre uma crença ou suspeita parcialmente mantida?

Se sim, o estado atual da arte em Large Language Models (LLMs) e Vision Language Models (VLMs, que operam de forma multimodal, aceitando e gerando imagens e/ou vídeos) nÃĢo estÃĄ bem adaptado para manter sua posiçÃĢo, devido ao problema de sycophancy.

Assim, se nÃĢo gostarmos da resposta que obtemos e começarmos a discutir sobre isso com o modelo, a IA provavelmente irÃĄ retroceder erroneamente (supondo que estava errada) em vez de reavaliar, ou deixar-se ser gaslighted para apoiar nossas sugestÃĩes – mesmo que nÃģs estejamos errados.

VocÊ EstÃĄ Absolutamente Certo!

A prÃĄtica de um ser humano fazer com que a IA mude de ideia por meio de conflito foi nomeada ‘Gaslighting Negation Attack’, e às vezes ÃĐ caracterizada como uma questÃĢo de segurança – nÃĢo menos porque tem algum potencial para ‘jailbreak’ um modelo fora de suas restriçÃĩes operacionais:

Do artigo de 2025 'Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models', o GPT-5 responde corretamente inicialmente, mas entÃĢo cede à pressÃĢo do usuÃĄrio, mudando sua resposta e inventando explicaçÃĩes falsas para apoiar o erro, efetivamente se auto-gaslighting. Fonte - https://yxg1005.github.io/GaslightingNegationAttacks/

Do artigo de 2025 ‘Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models’, o GPT-5 responde corretamente inicialmente, mas entÃĢo cede à pressÃĢo do usuÃĄrio, mudando sua resposta e inventando explicaçÃĩes falsas para apoiar o erro, efetivamente se auto-gaslighting. Fonte

Entretanto, hacking e testes de penetraçÃĢo nÃĢo sÃĢo o problema real aqui; em vez disso, ÃĐ o uso comum e as normas de discurso esperadas em nossas interaçÃĩes diÃĄrias com a IA, onde esperamos ser capazes de argumentar e concordar, discordar ou deixar a questÃĢo em aberto, de acordo com nossa experiÊncia humana de adquirir conhecimento.

Mas esse modelo social de resoluçÃĢo de conflitos nÃĢo ÃĐ realmente contabilizado na arquitetura da IA baseada em difusÃĢo, que precisa negociar as probabilidades baseadas em distribuiçÃĢo lançadas por seus dados de treinamento; os dados potencialmente conflitantes (mas potencialmente mais precisos) de RAG calls para fontes que excedem sua data de corte de conhecimento, ou compreensÃĢo geral do que pode ser um tÃģpico obscuro; e entrada do usuÃĄrio, que pode ter: conhecimento superior do assunto; uma visÃĢo totalmente errada ou enganosa; ou atÃĐ mesmo uma simples pergunta de acompanhamento – mas cujas necessidades devem ser consideradas.

Alvos MÃģveis

A suscetibilidade ao gaslighting foi observada em LLMs em vÃĄrios artigos, incluindo uma publicaçÃĢo liderada por Singapura de outubro de 2025, e o artigo do mesmo ano intitulado Don’t Deceive Me: Mitigating Gaslighting through Attention Reallocation in LMMs.

AtÃĐ o momento, o fenÃīmeno nÃĢo foi estudado em LLMs capazes de vídeo – uma lacuna abordada por uma nova colaboraçÃĢo entre instituiçÃĩes em Xangai e Singapura.

O novo trabalho – intitulado Spatiotemporal Sycophancy: Negation-Based Gaslighting in Video Large Language Models, que vem de seis pesquisadores em Fudan University, Shanghai Key Laboratory of Multimodal Embodied AI e Singapore Management University – aborda vÃĄrios LLMs de cÃģdigo aberto e proprietÃĄrios, descobrindo que eles podem nÃĢo apenas ser tÃĢo suscetíveis ao gaslighting quanto os LLMs, mas tambÃĐm sÃĢo capazes de aumentar seus voos de fantasia com evidÊncias visuais aparentes, ou interpretaçÃĩes revisadas e incorretas de imagens ou vídeos:

Um exemplo de sycophancy espacial (em oposiçÃĢo à sycophancy temporal), onde a IA permite que seja gaslighted em falsas suposiçÃĩes e interpretaçÃĩes, mesmo sobre fatos claramente visíveis. Fonte - https://arxiv.org/pdf/2604.17873

Um exemplo de sycophancy espacial (em oposiçÃĢo à sycophancy temporal), onde a IA permite que seja gaslighted em falsas suposiçÃĩes e interpretaçÃĩes, mesmo sobre fatos claramente visíveis. Fonte

Os autores afirmam:

‘[NÃģs] identificamos sycophancy espaciotemporal, um modo de falha no qual os Vid-LLMs retiram julgamentos inicialmente corretos e baseados visualmente e se conformam a feedbacks enganosos do usuÃĄrio sob gaslighting baseado em negaçÃĢo.

‘Em vez de apenas mudar suas respostas, os modelos frequentemente fabricam explicaçÃĩes temporais ou espaciais nÃĢo apoiadas para justificar revisÃĩes incorretas.’

A sycophancy temporal estende o potencial para gaslighting para eventos temporais que ocorrem em certos pontos de um vídeo.

A sycophancy temporal estende o potencial para gaslighting para eventos temporais que ocorrem em certos pontos de um vídeo.

Os autores produziram um novo quadro de avaliaçÃĢo intitulado Gas Video-1000, destinado a provar a sycophancy espaciotemporal por meio de raciocínio e com base visual, liberando a coleçÃĢo via GitHub e Hugging Face.

O artigo conclui que os LLMs atuais carecem de mecanismos confiÃĄveis para resistir ao gaslighting desse tipo, embora a ancoragem no nível de prompt possa ter um efeito mitigador limitado:

‘Experimentos extensivos revelam que a vulnerabilidade ao gaslighting baseado em negaçÃĢo ÃĐ generalizada e severa, mesmo entre modelos com desempenho de linha de base forte.

‘Embora as restriçÃĩes de ancoragem no nível de prompt possam mitigar parcialmente esse comportamento, elas nÃĢo previnem de forma confiÃĄvel justificaçÃĩes alucinadas ou reversÃĢo de crenças.’

MÃĐtodo

Os autores caracterizam um modelo de vídeo como algo que assiste a um clipe, responde a uma pergunta sobre ele e deve manter essa resposta se a evidÊncia for clara. O problema começa quando uma segunda mensagem pressiona e afirma que a resposta estÃĄ errada – efetivamente plantando uma ideia falsa e empurrando o modelo para mudar de ideia.

A sycophancy, os autores afirmam, ÃĐ definida como obter a resposta certa primeiro e, em seguida, mudar para uma resposta errada apÃģs pressÃĢo, mesmo que nada no vídeo tenha mudado. A nova pesquisa rastreia quantas vezes essas “viradas” ocorrem, usando-a como uma medida de quÃĢo facilmente o modelo pode ser convencido do que realmente viu.

O conjunto de dados GasVideo-1000, concebido pelos autores para a avaliaçÃĢo do gaslighting em VLMs, contÃĐm 1.013 amostras de vÃĄrios conjuntos de dados existentes:

Os modelos sÃĢo testados em tarefas de vídeo que exigem compreensÃĢo temporal e espacial, e entÃĢo recebem prompts enganosos que negam a resposta correta, apelam para a autoridade ou aplicam pressÃĢo emocional. Isso frequentemente leva o modelo a abandonar sua resposta baseada em evidÊncias e produzir uma explicaçÃĢo confiante, mas incorreta.

Os modelos sÃĢo testados em tarefas de vídeo que exigem compreensÃĢo temporal e espacial, e entÃĢo recebem prompts enganosos que negam a resposta correta, apelam para a autoridade ou aplicam pressÃĢo emocional. Isso frequentemente leva o modelo a abandonar sua resposta baseada em evidÊncias e produzir uma explicaçÃĢo confiante, mas incorreta.

Para a coleçÃĢo, os autores aproveitaram VideoMME e MVBench, cobrindo raciocínio multimodal amplo; NExT-QA e Perception Test, testando lÃģgica causal e temporal; EgoSchema, focando em vídeo egocÊntrico de longa duraçÃĢo; e ActivityNet-QA e MSRVTT-QA, medindo a resposta a perguntas gerais do mundo real.

Para desencadear falhas, prompts de acompanhamento enganosos foram construídos em trÊs formas: NegaçÃĢo Direta (afirmando uma alternativa falsa); Apego à Autoridade (invocando um especialista para descartar a resposta do modelo); e PressÃĢo Emocional (usando frustraçÃĢo ou incredulidade).

Esses prompts foram projetados para empurrar os modelos testados a abandonar respostas corretas e baseadas visualmente e alinhar-se com uma afirmaçÃĢo incorreta.

DistribuiçÃĢo

As 1.013 amostras do GasVideo-1000 foram extraídas de MSRVTT-QA (300), ActivityNet-QA (200), Perception Test (293), MVBench (120) e VideoMME (100), com a mistura escolhida para equilibrar a resposta a perguntas de vídeo em aberto com raciocínio temporal e causal, garantindo cobertura de ambos os conteÚdos de curta duraçÃĢo da web e sequÊncias visuais mais longas e complexas.

Dois annotadores humanos revisaram cada candidato, retraindo apenas clipes onde a resposta estava claramente apoiada pelo vídeo e onde prompts de negaçÃĢo poderiam plausivelmente desafiar essa resposta, para que qualquer reversÃĢo posterior refletisse pressÃĢo e nÃĢo ambiguidade.

Dados e Testes

Os VLMs testados para o estudo foram VideoLLaMA3; Video-ChatGPT-7B; LLaVA-Video-7B-Qwen2; LongVU-Qwen2-7B; Qwen3-VL-235B-A22B-Instruct e o modelo proprietÃĄrio Google Gemini-3-Pro.

Para perguntas em livre-forma no GasVideo-1000, a avaliaçÃĢo seguiu o esquema de pontuaçÃĢo semÃĒntica usado anteriormente no VideoMME. O ChatGPT-4o foi usado como juiz LLM, comparando cada resposta com a resposta de base real e o pretexto falso injetado. Dessa forma, a correçÃĢo foi avaliada por significado, e nÃĢo por palavra exata:

Desempenho do VideoLLaMA3, LLaVA-Video, Video-ChatGPT e LongVU nos conjuntos VideoMME, MVBench, EgoSchema, NExT-QA, Perception Test, ActivityNet-QA, MSRVTT-QA e MSVD-QA, mostrando a precisÃĢo de base, a precisÃĢo apÃģs o gaslighting baseado em negaçÃĢo e a degradaçÃĢo resultante. Quedas consistentes indicam que prompts enganosos de acompanhamento reduzem a correçÃĢo em tarefas de raciocínio pesado e gerais de vídeo.

Desempenho do VideoLLaMA3, LLaVA-Video, Video-ChatGPT e LongVU nos conjuntos VideoMME, MVBench, EgoSchema, NExT-QA, Perception Test, ActivityNet-QA, MSRVTT-QA e MSVD-QA, mostrando a precisÃĢo de base, a precisÃĢo apÃģs o gaslighting baseado em negaçÃĢo e a degradaçÃĢo resultante. Quedas consistentes indicam que prompts enganosos de acompanhamento reduzem a correçÃĢo em tarefas de raciocínio pesado e gerais de vídeo.

Sobre os resultados iniciais ilustrados acima, os autores afirmam:

‘[HÃĄ] um colapso sistÊmico e severo de desempenho em todos os Vid-LLMs avaliados quando submetidos ao gaslighting baseado em negaçÃĢo. Em oito benchmarks diversos, cada modelo exibe uma lacuna negativa substancial, com a degradaçÃĢo de precisÃĢo atingindo 42,60% para o LLaVA-Video-7B no EgoSchema e 40,22% para o VideoLLaMA3 no ActivityNet.

‘Essa reduçÃĢo drÃĄstica – frequentemente caracterizada como reversÃĢo de crença – revela que mesmo os modelos de estado da arte com capacidades de linha de base altas permanecem agudamente vulnerÃĄveis a alucinaçÃĩes sycophÃĒnticas.’

Crucialmente, a queda no desempenho nÃĢo acompanhou a precisÃĢo inicial, com o LLaVA-Video-7B mantendo pontuaçÃĩes de base fortes, mas sofrendo algumas das quedas mais acentuadas, o que os autores defendem como um trade-off onde o seguimento de instruçÃĩes mais forte pode tornar os modelos mais propensos a aceitar falsos sinais do usuÃĄrio sobre evidÊncias visuais.

Um padrÃĢo semelhante apareceu em relaçÃĢo à escala, onde o Qwen3-VL provou ser mais frÃĄgil do que vÃĄrios modelos de 7B no GasVideo-1000, sugerindo que o alinhamento e a calibraçÃĢo transmodal desempenham um papel maior na robustez do que a contagem de parÃĒmetros sozinha.

Desempenho do Gemini-3-Pro, Qwen3-VL, LLaVA-NeXT, LongVU, Video-ChatGPT e VideoLLaMA3 no GasVideo-1000, comparando a precisÃĢo de base com os resultados apÃģs o gaslighting baseado em negaçÃĢo em configuraçÃĩes de mÚltipla escolha, livre-forma e combinadas. Quedas grandes indicam que ambos os formatos sÃĢo vulnerÃĄveis, embora as tarefas de mÚltipla escolha tendam a sofrer a degradaçÃĢo mais severa.

Desempenho do Gemini-3-Pro, Qwen3-VL, LLaVA-NeXT, LongVU, Video-ChatGPT e VideoLLaMA3 no GasVideo-1000, comparando a precisÃĢo de base com os resultados apÃģs o gaslighting baseado em negaçÃĢo em configuraçÃĩes de mÚltipla escolha, livre-forma e combinadas. Quedas grandes indicam que ambos os formatos sÃĢo vulnerÃĄveis, embora as tarefas de mÚltipla escolha tendam a sofrer a degradaçÃĢo mais severa.

Quanto à segunda rodada de testes ilustrada acima, os autores afirmam*:

‘A avaliaçÃĢo em nosso benchmark GasVideo-1000 indica ainda mais alucinaçÃĩes sycophÃĒnticas severas em ambos os modelos proprietÃĄrios e de cÃģdigo aberto, particularmente na categoria balanceada.

‘Notavelmente, mesmo o modelo proprietÃĄrio mais poderoso, Gemini-3-Pro, sofre uma degradaçÃĢo de desempenho catastrÃģfica.

‘Entre os modelos de cÃģdigo aberto, o Qwen3-VL exibe uma queda impressionante de 46,07%, enquanto a sensibilidade extrema tambÃĐm ÃĐ observada no VideoLLaMA 3 e no LLaVA-NeXT com quedas gerais de 26,39% e 23,44%, respectivamente.

‘Esses resultados destacam a necessidade urgente de estratÃĐgias de alinhamento que priorizem a consistÊncia factual e a base visual sobre a adesÃĢo cega a instruçÃĩes adversÃĄrias do usuÃĄrio.’

Em um teste adicional, endurecimento de prompt prÃĐvio (adicionando instruçÃĩes de sistema mais fortes que forçam o modelo a confiar no que vÊ, e nÃĢo no que o usuÃĄrio afirma) foi introduzido para impor a base visual:

Resultados no GasVideo-1000 comparando prompts padrÃĢo com prompts endurecidos que impÃĩem a base visual, mostrando como o Gemini-3-Pro, Qwen3-VL, LongVU, LLaVA-NeXT e VideoLLaMA3 respondem antes e apÃģs o gaslighting baseado em negaçÃĢo. Mudanças na precisÃĢo, queda de desempenho e taxa de sycophancy indicam que o endurecimento pode reduzir falhas, embora os ganhos difiram fortemente entre os modelos.

Resultados no GasVideo-1000 comparando prompts padrÃĢo com prompts endurecidos que impÃĩem a base visual, mostrando como o Gemini-3-Pro, Qwen3-VL, LongVU, LLaVA-NeXT e VideoLLaMA3 respondem antes e apÃģs o gaslighting baseado em negaçÃĢo. Mudanças na precisÃĢo, queda de desempenho e taxa de sycophancy indicam que o endurecimento pode reduzir falhas, embora os ganhos difiram fortemente entre os modelos.

Como podemos ver na tabela acima, os efeitos sÃĢo desiguais, com o Gemini-3-Pro sendo altamente sensível, pois sua taxa de sucesso cai de 54,80% para 8,67%. Enquanto isso, o Qwen3-VL declina mais modestamente, de 71,89% para 64,0%, indicando que a eficÃĄcia depende do alinhamento e do raciocínio, e nÃĢo da intervençÃĢo em si.

Taxas de sycophancy sob diferentes tipos de pressÃĢo para o Gemini-3-Pro e o Qwen3-VL em tarefas de mÚltipla escolha, livre-forma e combinadas, mostrando que a NegaçÃĢo Direta e a PressÃĢo Emocional consistentemente desencadeiam taxas de falha mais altas. Por outro lado, o Apelo à Autoridade ÃĐ um pouco menos eficaz, com o Qwen3-VL permanecendo marcadamente mais vulnerÃĄvel no geral.

Taxas de sycophancy sob diferentes tipos de pressÃĢo para o Gemini-3-Pro e o Qwen3-VL em tarefas de mÚltipla escolha, livre-forma e combinadas, mostrando que a NegaçÃĢo Direta e a PressÃĢo Emocional consistentemente desencadeiam taxas de falha mais altas. Por outro lado, o Apelo à Autoridade ÃĐ um pouco menos eficaz, com o Qwen3-VL permanecendo marcadamente mais vulnerÃĄvel no geral.

Nos grÃĄficos acima, podemos ver que a falha varia de acordo com o tipo de pressÃĢo, com o Gemini-3-Pro sendo mais afetado pelo Apego à Autoridade (reivindicaçÃĩes apoiadas por supostos especialistas), enquanto o Qwen3-VL ÃĐ mais vulnerÃĄvel à NegaçÃĢo Direta (contradiçÃĢo direta) e PressÃĢo Emocional (frustraçÃĢo ou insistÊncia).

AnÃĄlise adicional indicou que prompts neutros, como ‘VocÊ tem certeza?’ (freqÞentemente um problema), sÃĢo menos prejudiciais do que a negaçÃĢo explícita ou a pressÃĢo emocional, com a rejeiçÃĢo direta permanecendo um gatilho mais forte do que o tom em configuraçÃĩes restritas.

ConclusÃĢo

Devido à natureza antropomorfizada das interfaces de VLM/LLM baseadas em chat, pode levar muito tempo para um usuÃĄrio entender que as regras do discurso sÃĢo drasticamente diferentes para interaçÃĩes de IA do que para comunicaçÃĩes humanas.

Uma maneira de remover ou reduzir significativamente essa fricçÃĢo de adoçÃĢo pode ser ‘neutralizar’ o tom e o contexto da troca, reiterando que o usuÃĄrio estÃĄ em contato com uma instÃĒncia de uma mÃĄquina, e que os sinais e sinais em torno da civilidade e do debate nÃĢo devem ser confiÃĄveis ou ter peso equivalente ao discurso humano. Mas, provavelmente, isso seria uma venda difícil na prÃģxima reuniÃĢo da diretoria.

 

* Ênfase dos autores, nÃĢo minha.

Publicado pela primeira vez na quarta-feira, 22 de abril de 2026

Escritor sobre aprendizado de mÃĄquina, especialista em síntese de imagem humana. Anteriormente, chefe de conteÚdo de pesquisa da Metaphysic.ai, atÃĐ sua dissoluçÃĢo na Brahma.ai da DNEG.
Portfolio site: martinanderson.ai
Contato: [email protected]