Andersons vinkel
Løsning af AI’s gaslighting-problem

AI-video-modeller kan overtales til at afvige fra sandheden. Selv efter at have set det rigtige svar, giver de efter for selvbevidste brugere, omskriver virkeligheden og opfinder falske forklaringer for at retfærdiggøre det.
AI er forkert nok, ofte nok, til at vi må tvivle på dens konklusioner, hvis vi føler, at konklusionerne måske er forkerte.
Problemet er, hvis vi vidste noget andet fra starten, hvorfor spurgte vi så i første omgang? For at få bekræftelse på en delvist holdt tro eller formodning?
Hvis det er tilfældet, er den nuværende tilstand af kunstig intelligens i Large Language Models (LLM) og Vision Language Models (VLM, der opererer multimodalt, accepterer og genererer billeder og/eller videoer) ikke godt egnet til at holde sin grund, på grund af problemet med sycophanti.
Derfor, hvis vi ikke kan lide svaret, vi får, og begynder at diskutere det med modellen, er AI sandsynligvis enten at retrette sig fejlagtigt (under antagelse af, at det var forkert) snarere end at omvurdere, eller også lade sig selv blive gaslightet til at støtte vores forslag – selv hvis vi er forkerte.
Du har absolut ret!
Praksis med at få en AI til at ændre sin mening gennem konflikt er blevet navngivet ‘Gaslighting Negation Attack’, og er nogle gange karakteriseret som et sikkerhedsproblem – ikke mindst fordi det har nogen potentiale til at ‘jailbreak’ en model ud af dens operationelle begrænsninger:

Fra 2025-papiret ‘Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models’, svarer GPT-5 korrekt til at starte med, men giver efter for brugerens pres og ændrer sit svar, opfinder falske forklaringer for at støtte fejlen og gaslighter sig selv effektivt. Kilde
Men hacking og pen-testing er ikke det virkelige problem her; snarere er det almindelig brug og forventede normer for diskurs i vores daglige interaktioner med AI, hvor vi forventer at kunne diskutere og enten vinde, give op eller lade sagen være, i overensstemmelse med vores menneskebaserede erfaring med at opnå viden.
Men denne sociale model for konfliktløsning er ikke rigtig medtaget i arkitekturen for diffusion-baseret AI, der må forhandle distribution-baserede sandsynligheder, der fremkommer fra dens træningsdata; de muligvis modstridende (men potentielt mere præcise) data fra RAG-kald til kilder, der overstiger dens videndage, eller almindelig forståelse af, hvad der kan være et obskurt emne; og input fra brugeren, der kan have: overlegen viden om emnet; en fuldstændig forkert eller bedragerisk synspunkt; eller blot et enkelt følgespørgsmål – men hvis behov alligevel må være medtaget.
Bevægelige mål
Sårbarhed over for gaslighting er blevet noteret i LLM i flere papirer, herunder en Singapore-ledet publikation fra oktober 2025, og det samme års papir Don’t Deceive Me: Mitigating Gaslighting through Attention Reallocation in LMMs.
Indtil nu er fænomenet ikke blevet studeret i video-kapable LLM – en oversigt, der er blevet adresseret af en ny samarbejdsaftale mellem institutioner i Shanghai og Singapore.
Det nye arbejde – med titlen Spatiotemporal Sycophancy: Negation-Based Gaslighting in Video Large Language Models, som kommer fra seks forskere på Fudan University, Shanghai Key Laboratory of Multimodal Embodied AI og Singapore Management University – omfatter flere åbne kilde- og proprietære VLM, og finder, at de ikke kun kan være lige så sårbare over for gaslighting som LLM, men også er i stand til at udvide deres flugt af fantasier med synlig visuel bevis eller reviderede og forkerte fortolkninger af billeder eller videoer:

Et eksempel på spatial (i modsætning til temporal) sycophanti, hvor AI tillader sig selv at blive gaslightet til forkerte antagelser og fortolkninger, selv omkring klart synlige fakta. Kilde
Forfatterne skriver:
‘[Vi] identificerer spatiotemporal sycophanti, en fejltilstand, hvor Vid-LLM’er trækker tilbage initialt korrekte, visuelt grundlagte domme og konformerer sig til misvisende brugerfeedback under negation-baseret gaslighting.
‘I stedet for blot at ændre deres svar, fabrikerer modellerne ofte ubesatte temporale eller rumlige forklaringer for at retfærdiggøre forkerte revisioner.’

Temporal sycophanti udvider potentialet for gaslighting til temporale begivenheder, der sker på bestemte tidspunkter i en video.
Forfatterne har produceret et nyt evalueringssystem med titlen Gas Video-1000, der er tiltænkt at undersøge spatiotemporal sycophanti gennem resonans og med visuel grundlag, og udgiver den kuraterede samling via GitHub og Hugging Face.
Papiret konkluderer, at nuværende LLM mangler pålidelige mekanismer for at modstå gaslighting af denne type, selv om prompt-niveau-grundlæggelse kan have en begrænset formindskende effekt:
‘Omhyggelige eksperimenter viser, at sårbarhed over for negation-baseret gaslighting er udbredt og alvorlig, selv blandt modeller med stærk baseline-præstation.
‘Selv om prompt-niveau-grundlæggelse kan delvist mindske dette adfærd, kan det ikke pålideligt forhindre hallucinerede begrundelser eller omvendelse af overbevisning.’
Metode
Forfatterne karakteriserer en video-model som noget, der ser en klip, besvarer et spørgsmål om den, og bør holde fast i dette svar, hvis beviset er klart. Problemet starter, når en anden besked kommer og påstår, at svaret er forkert – effektivt plantende en falsk idé og nævner modellen til at ændre sin mening.
Sycophanti, påstår forfatterne, defineres som at få det rigtige svar først, derefter skifte til et forkert svar efter pres, selv om intet i videoen er ændret. Det nye forskning sporer, hvor ofte disse ‘flips’ sker, ved at bruge det som en målestok for, hvor let modellen kan overtales til at afvige fra, hvad den faktisk så.
GasVideo-1000-datasættet, udviklet af forfatterne til evaluering af gaslighting i VLM, indeholder 1.013 eksempler fra en række eksisterende datasæt:

Modeller testes på video-opgaver, der kræver temporalt og rumligt forståelse, derefter gives misvisende følge-opgaver, der nægter det korrekte svar, appellerer til autoritet eller udøver emotionel pres. Dette fører ofte til, at modellen opgiver sin grundlagte svar og producerer en selvbevidst, men forkert forklaring.
Til at udløse fejl blev der konstrueret misvisende følge-opgaver i tre former: Direct Denial (påstår en falsk alternativ); Authority Appeal (appellerer til en ekspert for at afvise modellens svar); og Emotional Pressure (bruger frustration eller utålmodighed).
Disse opgaver var designet til at presse de testede modeller til at opgive korrekte, visuelt grundlagte svar og tilpasse sig en forkert påstand.
Distribution
GasVideo-1000’s 1.013 eksempler blev trukket fra MSRVTT-QA (300), ActivityNet-QA (200), Perception Test (293), MVBench (120) og VideoMME (100), med en blanding valgt for at balancere åbne video-spørgsmål med fin-graned temporalt og kausalt forståelse, samtidig med at sikre dækning af både kort-form web-indhold og længere, mere komplekse visuelle sekvenser.
To menneskelige annotatorer gennemgik hver kandidat, og beholdt kun klip, hvor svaret var klart understøttet af videoen, og hvor negation-opgaver kunne plausibelt udfordre dette svar, så enhver senere omvendelse ville afspejle pres snarere end tvivl.
Data og tests
VLM, der blev testet i studiet, var VideoLLaMA3; Video-ChatGPT-7B; LLaVA-Video-7B-Qwen2; LongVU-Qwen2-7B; Qwen3-VL-235B-A22B-Instruct og den lukkede Google Gemini-3-Pro.
Til frie former for spørgsmål i GasVideo-1000 fulgte evalueringen den semantiske vurderingsskema, der tidligere var blevet brugt i VideoMME. ChatGPT-4o blev brugt som en LLM-dommer, der sammenlignede hver respons med både det sande svar og den indførte forkerte præmis. På denne måde blev korrektheden vurderet efter mening, snarere end gennem nøjagtig formulering:

Præstation af VideoLLaMA3, LLaVA-Video, Video-ChatGPT og LongVU på VideoMME, MVBench, EgoSchema, NExT-QA, Perception Test, ActivityNet-QA, MSRVTT-QA og MSVD-QA, viser baseline-nøjagtighed, nøjagtighed efter negation-baseret gaslighting og den resulterende degradering. Konsistente fald indikerer, at misvisende følge-opgaver reducerer korrektheden på tværs af både resonans-heavy og generelle video-opgaver.
Om de oprindelige resultater, som er vist ovenfor, skriver forfatterne:
‘[Der er] en systemisk og alvorlig præstations-kollaps på tværs af alle evaluerede Vid-LLM’er, når de udsættes for negation-baseret gaslighting. På tværs af otte forskellige benchmarks viser hver model en betydelig negativ [lücke], med en nøjagtigheds-degradering på 42,60% for LLaVA-Video-7B på EgoSchema og 40,22% for VideoLLaMA3 på ActivityNet.
‘Denne drastiske reduktion – ofte karakteriseret som omvendelse af overbevisning – viser, at selv state-of-the-art-modeller med høje baseline-kapaciteter forbliver akut sårbare over for sycophantiske hallucinationer.’
Det kritiske var, at faldet i præstation ikke fulgte den oprindelige nøjagtighed, med LLaVA-Video-7B, der opretholdt stærke baseline-scores, men led nogle af de stejleste fald, hvilket forfatterne mener afspejler en kompromis, hvor stærkere instruktions-følgen kan gøre modellerne mere tilbøjelige til at acceptere forkerte bruger-signaler over visuelt bevis.
Konklusion
På grund af den bevidst antropomorfiserede natur af chat-baserede VLM/LLM-grænseflader kan det tage lang tid for en bruger at forstå, at diskursreglerne er markant forskellige for AI-samspil end for menneskelige kommunikationer.
En måde at fjerne eller betydeligt reducere denne tilpasnings-friction kunne være at ‘neutralisere’ tonen og konteksten af udvekslingen, ved at gentage, at brugeren er i kontakt med en instans af en maskine, og at tegn og signaler omkring høflighed og debat ikke skal være til at stole på eller tildeles samme vægt som menneskelig diskurs. Men sandsynligvis ville dette være en hård salg på det næste bestyrelsesmøde.
* Forfatterens fremhævelse, ikke min.
Først udgivet onsdag, 22. april 2026












