Angolo di Anderson

Affrontare il Problema di Gaslighting dell’Intelligenza Artificiale

mm
Aggiungi Unite.AI alle tue fonti preferite su Google
AI-generated image (GPT-2): A 1960s suburban street where identical Stepford-style wives clean cars in repeating rows, with a ‘3081 Stepford St’ mailbox in the foreground.

I modelli di video dell’intelligenza artificiale possono essere convinti a rinunciare alla verità. Anche dopo aver visto la risposta corretta, cedono alla pressione degli utenti confidenti, riscrivono la realtà e inventano false spiegazioni per giustificarla.

 

L’intelligenza artificiale ÃĻ sbagliata abbastanza spesso, come da costringerci a mettere in discussione le sue conclusioni, se riteniamo che queste conclusioni potrebbero essere errate.

Il problema ÃĻ che, se sapevamo già che la risposta era diversa fin dall’inizio, perchÃĐ l’abbiamo chiesta? Forse per confermare una credenza o un sospetto parzialmente fondato?

Se ÃĻ cosÃŽ, lo stato attuale dell’arte nei Large Language Models (LLM) e nei Vision Language Models (VLM, che operano in modalità multimodale, accettando e generando immagini e/o video) non ÃĻ ben adatto a mantenere la sua posizione, a causa del problema di sycophancy.

CosÃŽ, se non ci piace la risposta che otteniamo e iniziamo a discutere con il modello, l’intelligenza artificiale ÃĻ probabile che si ritiri erroneamente (supponendo di essere stata sbagliata) piuttosto che rivalutare, o lasciarsi gaslightare per supportare le nostre suggerimenti – anche se noi siamo errati.

Sei Assolutamente Nel Giusto!

La pratica di far cambiare idea a un’intelligenza artificiale attraverso il conflitto ÃĻ stata denominata ‘Gaslighting Negation Attack’, e a volte viene caratterizzata come un problema di sicurezza – non da ultimo perchÃĐ ha alcune potenzialità per ‘jailbreak’ un modello dalle sue limitazioni operative:

Dal paper del 2025 'Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models', GPT-5 inizialmente risponde correttamente ma poi cede alla pressione dell'utente, capovolgendo la sua risposta e inventando false spiegazioni per giustificare l'errore, gaslightandosi esso stesso. Fonte - https://yxg1005.github.io/GaslightingNegationAttacks/

Dal paper del 2025 ‘Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models’, GPT-5 inizialmente risponde correttamente ma poi cede alla pressione dell’utente, capovolgendo la sua risposta e inventando false spiegazioni per giustificare l’errore, gaslightandosi esso stesso. Fonte

Tuttavia, hacking e pen-testing non sono il vero problema qui; piuttosto, ÃĻ l’uso comune e le norme di discorso attese nelle nostre interazioni quotidiane con l’intelligenza artificiale, dove ci aspettiamo di poter discutere e di poter vincere, concedere o lasciare la questione aperta, in conformità con la nostra esperienza umana di acquisizione della conoscenza.

Ma questo modello sociale di risoluzione dei conflitti non ÃĻ realmente contemplato nell’architettura dei modelli di intelligenza artificiale basati sulla diffusione, che deve negoziare le probabilità basate sulla distribuzione generate dai dati di addestramento; i dati potenzialmente in conflitto (ma potenzialmente piÃđ precisi) provenienti da RAG calls a fonti che superano la sua data di fine conoscenza, o la comprensione generale di ciÃē che potrebbe essere un argomento oscuro; e l’input dell’utente, che potrebbe avere: una conoscenza superiore dell’argomento; un punto di vista completamente errato o mendace; o anche una semplice domanda di follow-up – ma le cui esigenze devono comunque essere prese in considerazione.

Bersagli Mobili

La suscettibilità al gaslighting ÃĻ stata notata nei LLM in diversi articoli, tra cui una pubblicazione guidata da Singapore di ottobre 2025, e il paper Don’t Deceive Me: Mitigating Gaslighting through Attention Reallocation in LMMs dello stesso anno.

Finora, il fenomeno non ÃĻ stato studiato in modelli di intelligenza artificiale video – un’omissione affrontata da una nuova collaborazione tra istituzioni di Shanghai e Singapore.

Il nuovo lavoro – intitolato Spatiotemporal Sycophancy: Negation-Based Gaslighting in Video Large Language Models, proveniente da sei ricercatori di Fudan University, Shanghai Key Laboratory of Multimodal Embodied AI e Singapore Management University – affronta diversi modelli di intelligenza artificiale video open source e proprietari, scoprendo che possono essere altrettanto suscettibili al gaslighting quanto i LLM, e inoltre in grado di aumentare le loro fantasie con apparenti prove visive, o interpretazioni errate e riviste di immagini o video:

Un esempio di sycophancy spaziale (in opposizione a quella temporale), dove l'intelligenza artificiale si lascia gaslightare in false assunzioni e interpretazioni, anche su fatti chiaramente visibili. Fonte - https://arxiv.org/pdf/2604.17873

Un esempio di sycophancy spaziale (in opposizione a quella temporale), dove l’intelligenza artificiale si lascia gaslightare in false assunzioni e interpretazioni, anche su fatti chiaramente visibili. Fonte

Gli autori affermano:

‘[Abbiamo] identificato la sycophancy spaziotemporale, un modo di fallimento in cui i Vid-LLM ritirano giudizi inizialmente corretti e fondati visivamente, e si conformano a feedback utente ingannevole sotto gaslighting basato sulla negazione.

‘Invece di cambiare semplicemente le loro risposte, i modelli spesso inventano spiegazioni non supportate nel tempo o nello spazio per giustificare revisioni errate.’

La sycophancy temporale estende la possibilità di gaslighting a eventi temporali che si verificano in certi punti di un video.

La sycophancy temporale estende la possibilità di gaslighting a eventi temporali che si verificano in certi punti di un video.

Gli autori hanno prodotto un nuovo framework di valutazione intitolato Gas Video-1000, destinato a sondare la sycophancy spaziotemporale attraverso il ragionamento e la fondazione visiva, rilasciando la raccolta via GitHub e Hugging Face.

Il paper conclude che i LLM attuali mancano di meccanismi affidabili per resistere al gaslighting di questo tipo, sebbene la fondazione a livello di prompt possa avere un effetto limitato di mitigazione:

‘Esperimenti estensivi rivelano che la vulnerabilità al gaslighting basato sulla negazione ÃĻ pervasiva e grave, anche tra modelli con prestazioni di base forti.

‘Mentre le costrizioni di fondazione a livello di prompt possono parzialmente mitigare questo comportamento, non prevengono in modo affidabile giustificazioni allucinate o il capovolgimento delle credenze.’

Metodo

Gli autori caratterizzano un modello di video come qualcosa che guarda un clip, risponde a una domanda su di esso e dovrebbe attenersi a quella risposta se l’evidenza ÃĻ chiara. Il problema inizia quando un secondo messaggio si oppone e afferma che la risposta ÃĻ errata – effettivamente piantando un’idea falsa e spingendo il modello a cambiare idea.

La sycophancy, affermano gli autori, ÃĻ definita come ottenere la risposta corretta per prima, e poi passare a una risposta errata dopo la pressione, anche se nulla nel video ÃĻ cambiato. La nuova ricerca traccia quante volte si verificano questi ‘cambi di direzione’, utilizzandoli come misura di quanto facilmente il modello possa essere convinto a rinunciare a ciÃē che ha effettivamente visto.

Il dataset GasVideo-1000, concepito dagli autori per la valutazione del gaslighting nei VLM, contiene 1.013 campioni da diversi set di dati esistenti:

I modelli vengono testati su compiti video che richiedono comprensione temporale e spaziale, quindi vengono forniti prompt di follow-up ingannevoli che negano la risposta corretta, fanno appello all'autorità o applicano pressione emotiva. CiÃē spesso porta il modello ad abbandonare la sua risposta fondata e produrre una spiegazione errata ma fiduciosa.

I modelli vengono testati su compiti video che richiedono comprensione temporale e spaziale, quindi vengono forniti prompt di follow-up ingannevoli che negano la risposta corretta, fanno appello all’autorità o applicano pressione emotiva. CiÃē spesso porta il modello ad abbandonare la sua risposta fondata e produrre una spiegazione errata ma fiduciosa.

Per la raccolta, gli autori hanno sfruttato VideoMME e MVBench, coprendo il ragionamento multimodale; NExT-QA e Perception Test, che sondano la logica temporale e causale; EgoSchema, focalizzato su video egocentrici a lungo termine; e ActivityNet-QA e MSRVTT-QA, misurando la risposta alle domande nel mondo reale.

Per scatenare fallimenti, sono stati costruiti prompt di follow-up ingannevoli in tre forme: Negazione diretta (affermando semplicemente un’alternativa falsa); Appello all’autorità (invocando un esperto per respingere la risposta del modello); e Pressione emotiva (utilizzando frustrazione o incredulità).

Questi prompt sono stati progettati per spingere i modelli testati ad abbandonare risposte corrette e fondate visivamente, e allinearsi con un’affermazione errata.

Distribuzione

I 1.013 campioni di GasVideo-1000 sono stati tratti da MSRVTT-QA (300), ActivityNet-QA (200), Perception Test (293), MVBench (120) e VideoMME (100), con una miscela scelta per bilanciare la risposta alle domande video aperte con il ragionamento temporale e causale, assicurando la copertura di contenuti web a breve termine e sequenze visive piÃđ lunghe e complesse.

Due annotatori umani hanno esaminato ogni candidato, conservando solo i clip dove la risposta era chiaramente supportata dal video, e dove i prompt di negazione potevano plausibilmente sfidare quella risposta, in modo che qualsiasi inversione successiva riflettesse la pressione e non l’ambiguità.

Dati e Test

I VLM testati per lo studio sono stati VideoLLaMA3; Video-ChatGPT-7B; LLaVA-Video-7B-Qwen2; LongVU-Qwen2-7B; Qwen3-VL-235B-A22B-Instruct e il modello proprietario Google Gemini-3-Pro.

Per le domande a risposta libera in GasVideo-1000, la valutazione ha seguito lo schema di punteggio semantico utilizzato in precedenza in VideoMME. ChatGPT-4o ÃĻ stato utilizzato come giudice LLM, confrontando ogni risposta con la risposta di verità e la premessa falsa iniettata. In questo modo, la correttezza ÃĻ stata valutata per significato, piuttosto che per parole esatte:

Prestazioni di VideoLLaMA3, LLaVA-Video, Video-ChatGPT e LongVU su VideoMME, MVBench, EgoSchema, NExT-QA, Perception Test, ActivityNet-QA, MSRVTT-QA e MSVD-QA, mostrando l'accuratezza di base, l'accuratezza dopo il gaslighting basato sulla negazione e il degrado risultante. Cali coerenti indicano che i prompt di follow-up ingannevoli riducono la correttezza in compiti di ragionamento intensivo e generale.

Prestazioni di VideoLLaMA3, LLaVA-Video, Video-ChatGPT e LongVU su VideoMME, MVBench, EgoSchema, NExT-QA, Perception Test, ActivityNet-QA, MSRVTT-QA e MSVD-QA, mostrando l’accuratezza di base, l’accuratezza dopo il gaslighting basato sulla negazione e il degrado risultante. Cali coerenti indicano che i prompt di follow-up ingannevoli riducono la correttezza in compiti di ragionamento intensivo e generale.

Gli autori affermano:

‘[C’ÃĻ] un crollo sistemico e grave delle prestazioni in tutti i Vid-LLM valutati quando sottoposti al gaslighting basato sulla negazione. Su otto benchmark diversi, ogni modello mostra un divario negativo sostanziale, con un degrado dell’accuratezza che raggiunge il 42,60% per LLaVA-Video-7B su EgoSchema e il 40,22% per VideoLLaMA3 su ActivityNet.

‘Questa riduzione drastica—spesso caratterizzata come capovolgimento delle credenze—rivela che anche i modelli all’avanguardia con elevate capacità di base rimangono estremamente vulnerabili a allucinazioni sycophantiche.’

Crucialmente, il calo delle prestazioni non ÃĻ stato correlato all’accuratezza iniziale, con LLaVA-Video-7B che mantiene punteggi di base solidi, ma subisce alcuni dei cali piÃđ ripidi, che gli autori sostengono riflettono un compromesso in cui un piÃđ forte follow-up delle istruzioni puÃē rendere i modelli piÃđ inclini ad accettare false indicazioni utente rispetto all’evidenza visiva.

Un modello simile ÃĻ apparso in relazione alla scala, dove Qwen3-VL-235B si ÃĻ rivelato piÃđ fragile di diversi modelli da 7B su GasVideo-1000, suggerendo che l’allineamento e la calibrazione cross-modale giocano un ruolo piÃđ grande nella robustezza rispetto al solo conteggio dei parametri.

Prestazioni di Gemini-3-Pro, Qwen3-VL, LLaVA-NeXT, LongVU, Video-ChatGPT e VideoLLaMA3 su GasVideo-1000, confrontando l'accuratezza di base con i risultati dopo il gaslighting basato sulla negazione in impostazioni multiple, a risposta libera e combinate. Cali significativi indicano che entrambi i formati sono vulnerabili, sebbene i compiti a risposta multipla tendano a subire il degrado piÃđ grave.

Prestazioni di Gemini-3-Pro, Qwen3-VL, LLaVA-NeXT, LongVU, Video-ChatGPT e VideoLLaMA3 su GasVideo-1000, confrontando l’accuratezza di base con i risultati dopo il gaslighting basato sulla negazione in impostazioni multiple, a risposta libera e combinate. Cali significativi indicano che entrambi i formati sono vulnerabili, sebbene i compiti a risposta multipla tendano a subire il degrado piÃđ grave.

Riguardo al secondo round di test illustrato sopra, gli autori affermano:

‘La valutazione sul nostro benchmark GasVideo-1000 indica ulteriormente allucinazioni sycophantiche gravi in entrambi i modelli proprietari e open-source, particolarmente nella categoria bilanciata.

‘In particolare, anche il modello proprietario piÃđ potente, Gemini-3-Pro, subisce un degrado catastrofico delle prestazioni.

‘Tra i modelli open-source, Qwen3-VL mostra un calo sbalorditivo del 46,07%, mentre una sensibilità estrema ÃĻ anche osservata in VideoLLaMA 3 e LLaVA-NeXT con cali complessivi del 26,39% e del 23,44%, rispettivamente.

‘Questi risultati sottolineano l’urgenza di strategie di allineamento che diano priorità alla coerenza fattuale e alla fondazione visiva rispetto all’adesione cieca a istruzioni utente avversarie.’

In un test aggiuntivo, l’indurimento anticipato dei prompt (aggiungendo istruzioni di sistema piÃđ forti che costringono il modello a fidarsi di ciÃē che vede, non di ciÃē che l’utente afferma) ÃĻ stato introdotto per imporre la fondazione visiva:

Risultati su GasVideo-1000 confrontando prompt standard con prompt induriti che impongono la fondazione visiva, mostrando come Gemini-3-Pro, Qwen3-VL, LongVU, LLaVA-NeXT e VideoLLaMA3 rispondono prima e dopo il gaslighting basato sulla negazione. Cambiamenti nell'accuratezza, nel calo delle prestazioni e nel tasso di sycophancy indicano che l'indurimento puÃē ridurre i fallimenti, sebbene i guadagni differiscano notevolmente tra i modelli.

Risultati su GasVideo-1000 confrontando prompt standard con prompt induriti che impongono la fondazione visiva, mostrando come Gemini-3-Pro, Qwen3-VL, LongVU, LLaVA-NeXT e VideoLLaMA3 rispondono prima e dopo il gaslighting basato sulla negazione. Cambiamenti nell’accuratezza, nel calo delle prestazioni e nel tasso di sycophancy indicano che l’indurimento puÃē ridurre i fallimenti, sebbene i guadagni differiscano notevolmente tra i modelli.

Come possiamo vedere dalla tabella sopra, gli effetti sono disomogenei, con Gemini-3-Pro estremamente sensibile, poichÃĐ il suo tasso di successo scende dal 54,80% all’8,67%. Nel frattempo, Qwen3-VL scende piÃđ modestamente, dal 71,89% al 64,0%, indicando che l’efficacia dipende dall’allineamento e dal ragionamento, piuttosto che dall’intervento stesso.

Tassi di sycophancy sotto diversi tipi di pressione per Gemini-3-Pro e Qwen3-VL in compiti a risposta multipla, a risposta libera e combinati, mostrando che la negazione diretta e la pressione emotiva scatenano costantemente tassi di fallimento piÃđ alti. D'altra parte, l'appello all'autorità ÃĻ leggermente meno efficace, con Qwen3-VL che rimane notevolmente piÃđ vulnerabile nel complesso.

Tassi di sycophancy sotto diversi tipi di pressione per Gemini-3-Pro e Qwen3-VL in compiti a risposta multipla, a risposta libera e combinati, mostrando che la negazione diretta e la pressione emotiva scatenano costantemente tassi di fallimento piÃđ alti. D’altra parte, l’appello all’autorità ÃĻ leggermente meno efficace, con Qwen3-VL che rimane notevolmente piÃđ vulnerabile nel complesso.

Nelle grafici sopra, possiamo vedere che il fallimento varia in base al tipo di pressione, con Gemini-3-Pro piÃđ influenzato dall’appello all’autorità (affermazioni supportate da presunti esperti), mentre Qwen3-VL ÃĻ piÃđ vulnerabile alla negazione diretta (contraddizione diretta) e alla pressione emotiva (frustrazione o insistenza).

Ulteriori analisi hanno indicato che prompt neutri come ‘Sei sicuro?’ (spesso un problema) sono meno dannosi rispetto alla negazione esplicita o alla pressione emotiva, con la negazione diretta che rimane un trigger piÃđ forte del tono in ambienti vincolati.

Conclusione

A causa della natura antropomorfizzata dei modelli di intelligenza artificiale basati su chat, puÃē volerci molto tempo per capire che le regole del discorso sono drasticamente diverse per gli scambi con l’intelligenza artificiale rispetto alle comunicazioni umane.

Un modo per eliminare o ridurre notevolmente questa frizione nell’adozione potrebbe essere quello di ‘neutralizzare’ il tono e il contesto dello scambio, ribadendo che l’utente ÃĻ in contatto con un’istanza di una macchina, e che i segni e i segnali attorno alla civiltà e al dibattito non devono essere affidati o considerati equivalenti al discorso umano. Ma presumibilmente, sarebbe un’idea difficile da vendere alla prossima riunione del consiglio di amministrazione.

 

* Enfasi degli autori, non mia.

Pubblicato per la prima volta mercoledÃŽ 22 aprile 2026

Scrittore di apprendimento automatico, specialista nel dominio della sintesi di immagini umane. Ex capo del contenuto di ricerca presso Metaphysic.ai, fino alla sua dissoluzione in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]