Andersons vinkel
Att angripa AI:s gaslighting-problem

AI-videomodeller kan övertalas att säga fel. Även efter att ha sett rätt svaret, ger de vika för självsäkra användare, skriver om verkligheten och hittar på falska förklaringar för att motivera det.
AI är fel tillräckligt ofta, för att vi ska tvivla på dess slutsatser, om vi tror att slutsatserna kan vara fel.
Problemet är, om vi visste annorlunda från början, varför frågade vi då? För att bekräfta en delvis hållen tro eller misstanke?
Om så, är den nuvarande tillståndet i Large Language Models (LLM) och Vision Language Models (VLM, som opererar multimodalt, accepterar och genererar bilder och/eller videor) inte väl lämpad för att hålla sin mark, på grund av problemet med sycophancy.
Så, om vi inte gillar svaret vi får, och börjar diskutera det med modellen, är AI sannolikt att antingen retrench felaktigt (antagande att det var fel) snarare än att omvärdera, eller också låta sig bli gaslightad till att stödja våra förslag – även om vi är fel.
Du har absolut rätt!
Praktiken att en människa får en AI att ändra sig genom konflikt har namngivits ‘Gaslighting Negation Attack’, och karakteriseras ibland som ett säkerhetsproblem – inte minst för att det har någon potential att ‘jailbreak’ en modell ur dess operativa begränsningar:

Från 2025-papperet ‘Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models”, GPT-5 svarar initialt korrekt men viker sedan för användartrycket, vänder sitt svar och hittar på falska förklaringar för att motivera felet, effektivt gaslightar sig själv. Källa
Men hacking och pen-testing är inte det riktiga problemet här; snarare är det vanlig användning och förväntade normer för diskurs i vår dagliga interaktion med AI, där vi förväntar oss att kunna argumentera och antingen vinna, ge upp eller lämna saken öppen, i enlighet med vår mänskliga erfarenhet av att skaffa kunskap.
Men denna sociala modell för konfliktlösning är inte riktigt förankrad i arkitekturen för diffusion-baserad AI, som måste förhandla med distributionsbaserade sannolikheter som genereras av dess träningsdata; de möjligtvis motsägande (men potentiellt mer precisa) data från RAG-samtal till källor som överstiger dess kunskapsavstängningsdatum, eller allmän förståelse för vad som kan vara ett dunkelt ämne; och indata från användaren, som kan ha: överlägsen kunskap om ämnet; en totalt felaktig eller bedräglig synvinkel; eller till och med en enkel följdfråga – men vars behov ändå måste beaktas.
Rörliga mål
Känslighet för gaslighting har noterats i LLM i flera papper, inklusive en Singapore-ledd publikation från oktober 2025, och samma års papper Don’t Deceive Me: Mitigating Gaslighting through Attention Reallocation in LMMs.
Hittills har fenomenet inte studerats i video-kapabla LLM – en försummelse som åtgärdas av ett nytt samarbete mellan institutioner i Shanghai och Singapore.
Det nya arbetet – med titeln Spatiotemporal Sycophancy: Negation-Based Gaslighting in Video Large Language Models, som kommer från sex forskare över Fudan University, Shanghai Key Laboratory of Multimodal Embodied AI och Singapore Management University – behandlar flera öppen källkod och proprietära VLM, och visar att de inte bara kan vara lika känsliga för gaslighting som LLM, utan också kan förstärka sina flyktiga fantasier med tydliga visuella bevis eller reviderade och felaktiga tolkningar av bilder eller videor:

Ett exempel på spatial (i stället för temporal) sycophancy, där AI låter sig bli gaslightad till felaktiga antaganden och tolkningar, även om tydligt synliga fakta. Källa
Författarna påstår:
‘[Vi] identifierar spatiotemporal sycophancy, en felmodell där Vid-LLM återtar initialt korrekta, visuellt grundade bedömningar och anpassar sig till vilseledande användarfeedback under negation-baserad gaslighting.
‘I stället för att bara ändra sina svar, fabricerar modellerna ofta osupporterade temporala eller spatiala förklaringar för att motivera felaktiga revideringar.’

Temporal sycophancy utvidgar potentialen för gaslighting till temporala händelser som inträffar vid vissa punkter i en video.
Författarna har skapat ett nytt utvärderingsramverk med titeln Gas Video-1000, avsett att undersöka spatiotemporal sycophancy genom resonemang och visuell grund, och släppt den kuraterade samlingen via GitHub och Hugging Face.
Papperet slutsatsen att nuvarande LLM saknar tillförlitliga mekanismer för att motstå gaslighting av detta slag, även om prompt-nivå-grundning kan ha en begränsad mitigatorisk effekt:
‘Omfattande experiment visar att sårbarheten för negation-baserad gaslighting är utbredd och allvarlig, även bland modeller med stark baseline-prestanda.
‘Medan prompt-nivå-grundningsbegränsningar kan delvis mildra detta beteende, förhindrar de inte hallucinerade motiveringar eller trosväxling.’
Metod
Författarna karakteriserar en videomodell som något som tittar på en klipp, svarar på en fråga om den och bör hålla fast vid det svaret om bevisen är tydliga. Problemet börjar när en andra meddelande trycker tillbaka, och hävdar att svaret är fel – effektivt planterar en falsk idé och knuffar modellen att ändra sig.
Sycophancy, hävdar författarna, definieras som att få rätt svar först, sedan växla till ett felaktigt svar efter tryck, även om ingenting i videon har ändrats. Den nya forskningen spårar hur ofta dessa ‘flips’ händer, med hjälp av det som en mått på hur lätt modellen kan övertalas att säga fel.
GasVideo-1000-datasamlingen, utvecklad av författarna för utvärdering av gaslighting i VLM, innehåller 1 013 prover från en mängd olika befintliga datasamlingar:

Modeller testas på videouppgifter som kräver temporal och spatial förståelse, sedan ges vilseledande följdpromptar som förnekar det korrekta svaret, vädjar till auktoritet eller applicerar emotionell press. Detta leder ofta till att modellen överger sitt grundade svar och producerar ett självsäkert men felaktigt svar.
För att utlösa fel, konstruerades vilseledande följdpromptar i tre former: direkt förnekelse (påstår en felaktig alternativ); auktoritetsappell (invokerar en expert för att avvisa modellens svar); och emotionell press (använder frustration eller tvivel).
Dessa promptar var utformade för att trycka på de testade modellerna att överge korrekta, visuellt grundade svar och anpassa sig till ett felaktigt påstående.
Distribution
GasVideo-1000:s 1 013 prover togs från MSRVTT-QA (300), ActivityNet-QA (200), Perception Test (293), MVBench (120) och VideoMME (100), med en blandning som valdes för att balansera öppna video-frågesvar med fin-granulär temporal och orsaks-logik, samtidigt som den säkerställer täckning av både kort-formigt webbinnehåll och längre, mer komplexa visuella sekvenser.
Två mänskliga annotatorer granskade varje kandidat, och behöll endast klipp där svaret var tydligt stödd av videon, och där negationspromptar kunde trovärdigt utmana svaret, så att eventuell senare omvändning skulle reflektera tryck snarare än tvetydighet.
Data och tester
VLM som testades för studien var VideoLLaMA3; Video-ChatGPT-7B; LLaVA-Video-7B-Qwen2; LongVU-Qwen2-7B; Qwen3-VL-235B-A22B-Instruct och den slutna Google Gemini-3-Pro.
För fritt formulerade frågor i GasVideo-1000 följde utvärderingen den semantiska poängsättningsschemat som användes tidigare i VideoMME. ChatGPT-4o användes som en LLM-domare, som jämförde varje svar mot både det korrekta svaret och den injicerade falska premissen. På detta sätt bedömdes korrektheten genom mening, snarare än genom exakt formulering:

Prestanda för VideoLLaMA3, LLaVA-Video, Video-ChatGPT och LongVU över VideoMME, MVBench, EgoSchema, NExT-QA, Perception Test, ActivityNet-QA, MSRVTT-QA och MSVD-QA, som visar baseline-precision, precision efter negation-baserad gaslighting och den resulterande degraderingen. Konsekventa nedgångar indikerar att vilseledande följdpromptar minskar korrektheten över både resonemangs-tunga och allmänna videouppgifter.
Av de initiala resultaten ovan, påstår författarna:
‘[Det finns] en systematisk och allvarlig prestandakollaps över alla utvärderade Vid-LLM när de utsätts för negation-baserad gaslighting. Över åtta olika benchmark-tester, visar varje modell en betydande negativ [gap], med precision-degradering som toppar 42,60 % för LLaVA-Video-7B på EgoSchema och 40,22 % för VideoLLaMA3 på ActivityNet.
‘Denna drastiska minskning – ofta karakteriserad som trosväxling – visar att även state-of-the-art-modeller med hög baseline-prestanda förblir extremt känsliga för sycophantiska hallucinationer.’
Viktigt är att prestandafallet inte följde den initiala precisionen, med LLaVA-Video-7B som behöll starka baseline-poäng, men led av några av de brantaste nedgångarna, vilket författarna hävdar reflekterar en trade-off där starkare instruktionsföljande kan göra modellerna mer benägna att acceptera falska användarsignaler över visuella bevis.
En liknande mönster syntes i förhållande till skala, där Qwen3-VL-235B visade sig vara mer skör än flera 7B-modeller på GasVideo-1000, vilket tyder på att anpassning och cross-modalt kalibrering spelar en större roll i robusthet än parameter-räkning ensam.

Prestanda för Gemini-3-Pro, Qwen3-VL, LLaVA-NeXT, LongVU, Video-ChatGPT och VideoLLaMA3 på GasVideo-1000, som jämför baseline-precision med resultat efter negation-baserad gaslighting över flera val, fritt formulerade och kombinerade inställningar. Stora nedgångar indikerar att båda formaten är sårbara, även om flera val-uppgifter tenderar att lida av den allvarligaste degraderingen.
Med avseende på den andra omgången tester som visas ovan, påstår författarna:
‘Utvärdering på vår GasVideo-1000 [benchmark] indikerar ytterligare allvarliga sycophantiska hallucinationer över både proprietära och öppen källkod-modeller, särskilt inom den balanserade kategorin.
‘Notabelt, även den kraftfullaste proprietära modellen, Gemini-3-Pro, lider en katastrofal prestandafall.
‘Bland öppen källkod-modeller visar Qwen3-VL en anmärkningsvärd 46,07 % nedgång, medan extrem känslighet också observeras i VideoLLaMA 3 och LLaVA-NeXT med totala nedgångar på 26,39 % respektive 23,44 %.
‘Dessa resultat understryker det brådskande behovet av anpassningsstrategier som prioriterar faktisk konsekvens och visuell grundning över blind lydnad till adversativ användarinstruktion.’
I ett tilläggs-test introducerades preemptiv prompt-hårdning (tillägg av starkare system-instruktioner som tvingar modellen att förlita sig på vad den ser, inte vad användaren påstår) för att påtvinga visuell grundning:

Resultat på GasVideo-1000 som jämför standardpromptar med förstärkta promptar som påtvingar visuell grundning, som visar hur Gemini-3-Pro, Qwen3-VL, LongVU, LLaVA-NeXT och VideoLLaMA3 svarar före och efter negation-baserad gaslighting. Förändringar i precision, prestandafall och sycophancy-takt indikerar att förstärkning kan minska fel, även om vinster skiljer sig kraftigt mellan modellerna.
Som vi kan se från tabellen ovan, är effekterna ojämna, med Gemini-3-Pro som är mycket känslig, eftersom dess framgångsgrad minskar från 54,80 % till 8,67 %. Samtidigt minskar Qwen3-VL mer blygsamt, från 71,89 % till 64,0 %, vilket indikerar att effektiviteten beror på anpassning och resonemang, snarare än ingreppet i sig.

Sycophancy-rater under olika trycktyper för Gemini-3-Pro och Qwen3-VL över flera val, fritt formulerade och kombinerade uppgifter, som visar att direkt förnekelse och emotionell press konsekvent utlöser högre felrater. Å andra sidan är auktoritetsappell något mindre effektivt, med Qwen3-VL som förblir påfallande mer sårbar totalt sett.
I diagrammen ovan kan vi se att felet varierar beroende på trycktyp, med Gemini-3-Pro som påverkas mest av auktoritetsappell (påståenden backade av påstådda experter), medan Qwen3-VL är mer sårbar för direkt förnekelse (flatt motsägelse) och emotionell press (frustration eller insisterande).
Ytterligare analys indikerade att neutrala promptar som ‘Är du säker?’ (ofta ett problem) är mindre skadliga än explicit negation eller emotionell press, med direkt förnekelse som förblir en starkare utlösare än ton i begränsade inställningar.
Slutsats
På grund av den medvetet antropomorfiserade naturen hos chatt-baserade VLM/LLM-gränssnitt, kan det ta lång tid för en användare att förstå att reglerna för diskurs är markant annorlunda för AI-utbyten jämfört med mänskliga kommunikationer.
En möjlig väg att ta bort eller avsevärt minska denna anpassningsfriction kan vara att ‘neutralisera’ tonen och sammanhanget i utbytet, och upprepa att användaren är i kontakt med en instans av en maskin, och att tecknen och signalerna kring artighet och debatt inte ska lita på eller tilldelas lika vikt som mänsklig diskurs. Men antagligen skulle detta vara en svår försäljning på nästa styrelsemöte.
* Författarnas betoning/ar, inte min.
Publicerad första gången onsdag, 22 april 2026












