Andersons vinkel
Att angripa AI:s gaslighting-problem

AI-videomodeller kan Ãķvertalas att sÃĪga fel. Ãven efter att ha sett rÃĪtt svaret, ger de vika fÃķr sjÃĪlvsÃĪkra anvÃĪndare, skriver om verkligheten och hittar pÃĨ falska fÃķrklaringar fÃķr att motivera det.
Â
AI ÃĪr fel tillrÃĪckligt ofta, fÃķr att vi ska tvivla pÃĨ dess slutsatser, om vi tror att slutsatserna kan vara fel.
Problemet ÃĪr, om vi visste annorlunda frÃĨn bÃķrjan, varfÃķr frÃĨgade vi dÃĨ? FÃķr att bekrÃĪfta en delvis hÃĨllen tro eller misstanke?
Om sÃĨ, ÃĪr den nuvarande tillstÃĨndet i Large Language Models (LLM) och Vision Language Models (VLM, som opererar multimodalt, accepterar och genererar bilder och/eller videor) inte vÃĪl lÃĪmpad fÃķr att hÃĨlla sin mark, pÃĨ grund av problemet med sycophancy.
SÃĨ, om vi inte gillar svaret vi fÃĨr, och bÃķrjar diskutera det med modellen, ÃĪr AI sannolikt att antingen retrench felaktigt (antagande att det var fel) snarare ÃĪn att omvÃĪrdera, eller ocksÃĨ lÃĨta sig bli gaslightad till att stÃķdja vÃĨra fÃķrslag â ÃĪven om vi ÃĪr fel.
Du har absolut rÃĪtt!
Praktiken att en mÃĪnniska fÃĨr en AI att ÃĪndra sig genom konflikt har namngivits âGaslighting Negation Attackâ, och karakteriseras ibland som ett sÃĪkerhetsproblem â inte minst fÃķr att det har nÃĨgon potential att âjailbreakâ en modell ur dess operativa begrÃĪnsningar:

FrÃĨn 2025-papperet âBenchmarking Gaslighting Negation Attacks Against Multimodal Large Language Modelsâ, GPT-5 svarar initialt korrekt men viker sedan fÃķr anvÃĪndartrycket, vÃĪnder sitt svar och hittar pÃĨ falska fÃķrklaringar fÃķr att motivera felet, effektivt gaslightar sig sjÃĪlv. KÃĪlla
Men hacking och pen-testing ÃĪr inte det riktiga problemet hÃĪr; snarare ÃĪr det vanlig anvÃĪndning och fÃķrvÃĪntade normer fÃķr diskurs i vÃĨr dagliga interaktion med AI, dÃĪr vi fÃķrvÃĪntar oss att kunna argumentera och antingen vinna, ge upp eller lÃĪmna saken Ãķppen, i enlighet med vÃĨr mÃĪnskliga erfarenhet av att skaffa kunskap.
Men denna sociala modell fÃķr konfliktlÃķsning ÃĪr inte riktigt fÃķrankrad i arkitekturen fÃķr diffusion-baserad AI, som mÃĨste fÃķrhandla med distributionsbaserade sannolikheter som genereras av dess trÃĪningsdata; de mÃķjligtvis motsÃĪgande (men potentiellt mer precisa) data frÃĨn RAG-samtal till kÃĪllor som Ãķverstiger dess kunskapsavstÃĪngningsdatum, eller allmÃĪn fÃķrstÃĨelse fÃķr vad som kan vara ett dunkelt ÃĪmne; och indata frÃĨn anvÃĪndaren, som kan ha: ÃķverlÃĪgsen kunskap om ÃĪmnet; en totalt felaktig eller bedrÃĪglig synvinkel; eller till och med en enkel fÃķljdfrÃĨga â men vars behov ÃĪndÃĨ mÃĨste beaktas.
RÃķrliga mÃĨl
KÃĪnslighet fÃķr gaslighting har noterats i LLM i flera papper, inklusive en Singapore-ledd publikation frÃĨn oktober 2025, och samma ÃĨrs papper Donât Deceive Me: Mitigating Gaslighting through Attention Reallocation in LMMs.
Hittills har fenomenet inte studerats i video-kapabla LLM â en fÃķrsummelse som ÃĨtgÃĪrdas av ett nytt samarbete mellan institutioner i Shanghai och Singapore.
Det nya arbetet â med titeln Spatiotemporal Sycophancy: Negation-Based Gaslighting in Video Large Language Models, som kommer frÃĨn sex forskare Ãķver Fudan University, Shanghai Key Laboratory of Multimodal Embodied AI och Singapore Management University â behandlar flera Ãķppen kÃĪllkod och proprietÃĪra VLM, och visar att de inte bara kan vara lika kÃĪnsliga fÃķr gaslighting som LLM, utan ocksÃĨ kan fÃķrstÃĪrka sina flyktiga fantasier med tydliga visuella bevis eller reviderade och felaktiga tolkningar av bilder eller videor:

Ett exempel pÃĨ spatial (i stÃĪllet fÃķr temporal) sycophancy, dÃĪr AI lÃĨter sig bli gaslightad till felaktiga antaganden och tolkningar, ÃĪven om tydligt synliga fakta. KÃĪlla
FÃķrfattarna pÃĨstÃĨr:
â[Vi] identifierar spatiotemporal sycophancy, en felmodell dÃĪr Vid-LLM ÃĨtertar initialt korrekta, visuellt grundade bedÃķmningar och anpassar sig till vilseledande anvÃĪndarfeedback under negation-baserad gaslighting.
âI stÃĪllet fÃķr att bara ÃĪndra sina svar, fabricerar modellerna ofta osupporterade temporala eller spatiala fÃķrklaringar fÃķr att motivera felaktiga revideringar.â

Temporal sycophancy utvidgar potentialen fÃķr gaslighting till temporala hÃĪndelser som intrÃĪffar vid vissa punkter i en video.
FÃķrfattarna har skapat ett nytt utvÃĪrderingsramverk med titeln Gas Video-1000, avsett att undersÃķka spatiotemporal sycophancy genom resonemang och visuell grund, och slÃĪppt den kuraterade samlingen via GitHub och Hugging Face.
Papperet slutsatsen att nuvarande LLM saknar tillfÃķrlitliga mekanismer fÃķr att motstÃĨ gaslighting av detta slag, ÃĪven om prompt-nivÃĨ-grundning kan ha en begrÃĪnsad mitigatorisk effekt:
âOmfattande experiment visar att sÃĨrbarheten fÃķr negation-baserad gaslighting ÃĪr utbredd och allvarlig, ÃĪven bland modeller med stark baseline-prestanda.
âMedan prompt-nivÃĨ-grundningsbegrÃĪnsningar kan delvis mildra detta beteende, fÃķrhindrar de inte hallucinerade motiveringar eller trosvÃĪxling.â
Metod
FÃķrfattarna karakteriserar en videomodell som nÃĨgot som tittar pÃĨ en klipp, svarar pÃĨ en frÃĨga om den och bÃķr hÃĨlla fast vid det svaret om bevisen ÃĪr tydliga. Problemet bÃķrjar nÃĪr en andra meddelande trycker tillbaka, och hÃĪvdar att svaret ÃĪr fel â effektivt planterar en falsk idÃĐ och knuffar modellen att ÃĪndra sig.
Sycophancy, hÃĪvdar fÃķrfattarna, definieras som att fÃĨ rÃĪtt svar fÃķrst, sedan vÃĪxla till ett felaktigt svar efter tryck, ÃĪven om ingenting i videon har ÃĪndrats. Den nya forskningen spÃĨrar hur ofta dessa âflipsâ hÃĪnder, med hjÃĪlp av det som en mÃĨtt pÃĨ hur lÃĪtt modellen kan Ãķvertalas att sÃĪga fel.
GasVideo-1000-datasamlingen, utvecklad av fÃķrfattarna fÃķr utvÃĪrdering av gaslighting i VLM, innehÃĨller 1 013 prover frÃĨn en mÃĪngd olika befintliga datasamlingar:

Modeller testas pÃĨ videouppgifter som krÃĪver temporal och spatial fÃķrstÃĨelse, sedan ges vilseledande fÃķljdpromptar som fÃķrnekar det korrekta svaret, vÃĪdjar till auktoritet eller applicerar emotionell press. Detta leder ofta till att modellen Ãķverger sitt grundade svar och producerar ett sjÃĪlvsÃĪkert men felaktigt svar.
FÃķr att utlÃķsa fel, konstruerades vilseledande fÃķljdpromptar i tre former: direkt fÃķrnekelse (pÃĨstÃĨr en felaktig alternativ); auktoritetsappell (invokerar en expert fÃķr att avvisa modellens svar); och emotionell press (anvÃĪnder frustration eller tvivel).
Dessa promptar var utformade fÃķr att trycka pÃĨ de testade modellerna att Ãķverge korrekta, visuellt grundade svar och anpassa sig till ett felaktigt pÃĨstÃĨende.
Distribution
GasVideo-1000:s 1 013 prover togs frÃĨn MSRVTT-QA (300), ActivityNet-QA (200), Perception Test (293), MVBench (120) och VideoMME (100), med en blandning som valdes fÃķr att balansera Ãķppna video-frÃĨgesvar med fin-granulÃĪr temporal och orsaks-logik, samtidigt som den sÃĪkerstÃĪller tÃĪckning av bÃĨde kort-formigt webbinnehÃĨll och lÃĪngre, mer komplexa visuella sekvenser.
TvÃĨ mÃĪnskliga annotatorer granskade varje kandidat, och behÃķll endast klipp dÃĪr svaret var tydligt stÃķdd av videon, och dÃĪr negationspromptar kunde trovÃĪrdigt utmana svaret, sÃĨ att eventuell senare omvÃĪndning skulle reflektera tryck snarare ÃĪn tvetydighet.
Data och tester
VLM som testades fÃķr studien var VideoLLaMA3; Video-ChatGPT-7B; LLaVA-Video-7B-Qwen2; LongVU-Qwen2-7B; Qwen3-VL-235B-A22B-Instruct och den slutna Google Gemini-3-Pro.
FÃķr fritt formulerade frÃĨgor i GasVideo-1000 fÃķljde utvÃĪrderingen den semantiska poÃĪngsÃĪttningsschemat som anvÃĪndes tidigare i VideoMME. ChatGPT-4o anvÃĪndes som en LLM-domare, som jÃĪmfÃķrde varje svar mot bÃĨde det korrekta svaret och den injicerade falska premissen. PÃĨ detta sÃĪtt bedÃķmdes korrektheten genom mening, snarare ÃĪn genom exakt formulering:

Prestanda fÃķr VideoLLaMA3, LLaVA-Video, Video-ChatGPT och LongVU Ãķver VideoMME, MVBench, EgoSchema, NExT-QA, Perception Test, ActivityNet-QA, MSRVTT-QA och MSVD-QA, som visar baseline-precision, precision efter negation-baserad gaslighting och den resulterande degraderingen. Konsekventa nedgÃĨngar indikerar att vilseledande fÃķljdpromptar minskar korrektheten Ãķver bÃĨde resonemangs-tunga och allmÃĪnna videouppgifter.
Av de initiala resultaten ovan, pÃĨstÃĨr fÃķrfattarna:
â[Det finns] en systematisk och allvarlig prestandakollaps Ãķver alla utvÃĪrderade Vid-LLM nÃĪr de utsÃĪtts fÃķr negation-baserad gaslighting. Ãver ÃĨtta olika benchmark-tester, visar varje modell en betydande negativ [gap], med precision-degradering som toppar 42,60 % fÃķr LLaVA-Video-7B pÃĨ EgoSchema och 40,22 % fÃķr VideoLLaMA3 pÃĨ ActivityNet.
âDenna drastiska minskning â ofta karakteriserad som trosvÃĪxling â visar att ÃĪven state-of-the-art-modeller med hÃķg baseline-prestanda fÃķrblir extremt kÃĪnsliga fÃķr sycophantiska hallucinationer.â
Viktigt ÃĪr att prestandafallet inte fÃķljde den initiala precisionen, med LLaVA-Video-7B som behÃķll starka baseline-poÃĪng, men led av nÃĨgra av de brantaste nedgÃĨngarna, vilket fÃķrfattarna hÃĪvdar reflekterar en trade-off dÃĪr starkare instruktionsfÃķljande kan gÃķra modellerna mer benÃĪgna att acceptera falska anvÃĪndarsignaler Ãķver visuella bevis.
En liknande mÃķnster syntes i fÃķrhÃĨllande till skala, dÃĪr Qwen3-VL-235B visade sig vara mer skÃķr ÃĪn flera 7B-modeller pÃĨ GasVideo-1000, vilket tyder pÃĨ att anpassning och cross-modalt kalibrering spelar en stÃķrre roll i robusthet ÃĪn parameter-rÃĪkning ensam.

Prestanda fÃķr Gemini-3-Pro, Qwen3-VL, LLaVA-NeXT, LongVU, Video-ChatGPT och VideoLLaMA3 pÃĨ GasVideo-1000, som jÃĪmfÃķr baseline-precision med resultat efter negation-baserad gaslighting Ãķver flera val, fritt formulerade och kombinerade instÃĪllningar. Stora nedgÃĨngar indikerar att bÃĨda formaten ÃĪr sÃĨrbara, ÃĪven om flera val-uppgifter tenderar att lida av den allvarligaste degraderingen.
Med avseende pÃĨ den andra omgÃĨngen tester som visas ovan, pÃĨstÃĨr fÃķrfattarna:
âUtvÃĪrdering pÃĨ vÃĨr GasVideo-1000 [benchmark] indikerar ytterligare allvarliga sycophantiska hallucinationer Ãķver bÃĨde proprietÃĪra och Ãķppen kÃĪllkod-modeller, sÃĪrskilt inom den balanserade kategorin.
âNotabelt, ÃĪven den kraftfullaste proprietÃĪra modellen, Gemini-3-Pro, lider en katastrofal prestandafall.
âBland Ãķppen kÃĪllkod-modeller visar Qwen3-VL en anmÃĪrkningsvÃĪrd 46,07 % nedgÃĨng, medan extrem kÃĪnslighet ocksÃĨ observeras i VideoLLaMA 3 och LLaVA-NeXT med totala nedgÃĨngar pÃĨ 26,39 % respektive 23,44 %.
âDessa resultat understryker det brÃĨdskande behovet av anpassningsstrategier som prioriterar faktisk konsekvens och visuell grundning Ãķver blind lydnad till adversativ anvÃĪndarinstruktion.â
I ett tillÃĪggs-test introducerades preemptiv prompt-hÃĨrdning (tillÃĪgg av starkare system-instruktioner som tvingar modellen att fÃķrlita sig pÃĨ vad den ser, inte vad anvÃĪndaren pÃĨstÃĨr) fÃķr att pÃĨtvinga visuell grundning:

Resultat pÃĨ GasVideo-1000 som jÃĪmfÃķr standardpromptar med fÃķrstÃĪrkta promptar som pÃĨtvingar visuell grundning, som visar hur Gemini-3-Pro, Qwen3-VL, LongVU, LLaVA-NeXT och VideoLLaMA3 svarar fÃķre och efter negation-baserad gaslighting. FÃķrÃĪndringar i precision, prestandafall och sycophancy-takt indikerar att fÃķrstÃĪrkning kan minska fel, ÃĪven om vinster skiljer sig kraftigt mellan modellerna.
Som vi kan se frÃĨn tabellen ovan, ÃĪr effekterna ojÃĪmna, med Gemini-3-Pro som ÃĪr mycket kÃĪnslig, eftersom dess framgÃĨngsgrad minskar frÃĨn 54,80 % till 8,67 %. Samtidigt minskar Qwen3-VL mer blygsamt, frÃĨn 71,89 % till 64,0 %, vilket indikerar att effektiviteten beror pÃĨ anpassning och resonemang, snarare ÃĪn ingreppet i sig.

Sycophancy-rater under olika trycktyper fÃķr Gemini-3-Pro och Qwen3-VL Ãķver flera val, fritt formulerade och kombinerade uppgifter, som visar att direkt fÃķrnekelse och emotionell press konsekvent utlÃķser hÃķgre felrater. Ã andra sidan ÃĪr auktoritetsappell nÃĨgot mindre effektivt, med Qwen3-VL som fÃķrblir pÃĨfallande mer sÃĨrbar totalt sett.
I diagrammen ovan kan vi se att felet varierar beroende pÃĨ trycktyp, med Gemini-3-Pro som pÃĨverkas mest av auktoritetsappell (pÃĨstÃĨenden backade av pÃĨstÃĨdda experter), medan Qwen3-VL ÃĪr mer sÃĨrbar fÃķr direkt fÃķrnekelse (flatt motsÃĪgelse) och emotionell press (frustration eller insisterande).
Ytterligare analys indikerade att neutrala promptar som âÃr du sÃĪker?â (ofta ett problem) ÃĪr mindre skadliga ÃĪn explicit negation eller emotionell press, med direkt fÃķrnekelse som fÃķrblir en starkare utlÃķsare ÃĪn ton i begrÃĪnsade instÃĪllningar.
Slutsats
PÃĨ grund av den medvetet antropomorfiserade naturen hos chatt-baserade VLM/LLM-grÃĪnssnitt, kan det ta lÃĨng tid fÃķr en anvÃĪndare att fÃķrstÃĨ att reglerna fÃķr diskurs ÃĪr markant annorlunda fÃķr AI-utbyten jÃĪmfÃķrt med mÃĪnskliga kommunikationer.
En mÃķjlig vÃĪg att ta bort eller avsevÃĪrt minska denna anpassningsfriction kan vara att âneutraliseraâ tonen och sammanhanget i utbytet, och upprepa att anvÃĪndaren ÃĪr i kontakt med en instans av en maskin, och att tecknen och signalerna kring artighet och debatt inte ska lita pÃĨ eller tilldelas lika vikt som mÃĪnsklig diskurs. Men antagligen skulle detta vara en svÃĨr fÃķrsÃĪljning pÃĨ nÃĪsta styrelsemÃķte.
Â
* FÃķrfattarnas betoning/ar, inte min.
Publicerad fÃķrsta gÃĨngen onsdag, 22 april 2026












