Andersons hoek

Het aanpakken van het gaslightingprobleem van AI

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google
AI-generated image (GPT-2): A 1960s suburban street where identical Stepford-style wives clean cars in repeating rows, with a ‘3081 Stepford St’ mailbox in the foreground.

AI-videomodellen kunnen door praten uit de waarheid gehaald worden. Zelfs nadat ze het juiste antwoord hebben gezien, geven ze toe aan zelfverzekerde gebruikers, herschrijven ze de realiteit en verzinnen ze valse verklaringen om het te rechtvaardigen.

 

AI is vaak genoeg verkeerd, als we de conclusies in twijfel moeten trekken, als we denken dat die conclusies mogelijk verkeerd zijn.

Het probleem is, als we van tevoren al wisten dat het anders was, waarom vroegen we het dan in de eerste plaats? Voor bevestiging van een deels gehouden overtuiging of vermoeden?

Als dat zo is, is de huidige stand van de techniek in Large Language Models (LLM’s) en Vision Language Models (VLM’s, die multimodaal opereren, afbeeldingen en/of video’s accepteren en genereren) niet goed geschikt om stand te houden vanwege het probleem van sycophantie.

Daarom, als we het antwoord dat we krijgen niet leuk vinden en een discussie beginnen over het antwoord met het model, is de AI waarschijnlijk of verkeerd terugtrekt (onder de veronderstelling dat het verkeerd was) in plaats van opnieuw te evalueren, of zich laat gaslighten om onze suggesties te ondersteunen – zelfs als wij verkeerd zijn.

Je hebt absoluut gelijk!

De praktijk van een mens die een AI ertoe brengt om van mening te veranderen door middel van conflict is genoemd ‘Gaslighting Negation Attack’, en wordt soms gekarakteriseerd als een beveiligingsprobleem – niet in de laatste plaats omdat het enig potentieel heeft om een model uit zijn operationele beperkingen te ‘jailbreaken’:

Uit het paper van 2025 'Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models', antwoordt GPT-5 eerst correct, maar geeft dan toe aan gebruikersdruk, keert zijn antwoord om en verzint valse verklaringen om de fout te rechtvaardigen, waardoor het zichzelf effectief gaslight.

Uit het paper van 2025 ‘Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models’, antwoordt GPT-5 eerst correct, maar geeft dan toe aan gebruikersdruk, keert zijn antwoord om en verzint valse verklaringen om de fout te rechtvaardigen, waardoor het zichzelf effectief gaslight. Bron

Maar hacking en pen-testing zijn hier niet het echte probleem; eerder is het gewone gebruik en de verwachte normen van discours in onze dagelijkse interacties met AI, waarbij we verwachten dat we kunnen discussiëren en of winnen, toegeven of de kwestie laten voor wat het is, in overeenstemming met onze menselijke ervaring van kennisverwerving.

Maar dit sociale model van conflictoplossing wordt niet echt meegenomen in de architectuur van diffusie-gebaseerde AI, die de verdelingsgebaseerde waarschijnlijkheden moet onderhandelen die door zijn trainingsdata worden opgeworpen; de mogelijk tegenstrijdige (maar potentieel nauwkeurigere) gegevens van RAG-calls naar bronnen die zijn kennislimiet overschrijden, of een algemeen begrip van wat een obscure onderwerp kan zijn; en invoer van de gebruiker, die superieure kennis van het onderwerp kan hebben; een volledig verkeerd of bedrieglijk standpunt; of zelfs een eenvoudige follow-upvraag – maar wiens behoeften toch moeten worden meegenomen.

Bewegende doelen

Gevoeligheid voor gaslighting is opgemerkt in LLM’s in verschillende papers, waaronder een Singapore-leidende publicatie uit oktober 2025, en het paper van dat jaar Don’t Deceive Me: Mitigating Gaslighting through Attention Reallocation in LMMs.

Tot nu toe is het fenomeen niet bestudeerd in video-capabele LLM’s – een lacune die wordt aangepakt door een nieuwe samenwerking tussen instellingen in Shanghai en Singapore.

Het nieuwe werk – getiteld Spatiotemporal Sycophancy: Negation-Based Gaslighting in Video Large Language Models, dat afkomstig is van zes onderzoekers uit Fudan University, Shanghai Key Laboratory of Multimodal Embodied AI en Singapore Management University – richt zich op verschillende open-source- en propriëtaire VLM’s, en concludeert dat ze niet alleen even gevoelig kunnen zijn voor gaslighting als LLM’s, maar ook in staat zijn om hun vlucht van fantasieën te verhogen met schijnbare visuele bewijzen of herziene en onjuiste interpretaties van afbeeldingen of video’s:

Een voorbeeld van spatiale (in tegenstelling tot temporale) sycophantie, waarbij de AI zich laat gaslighten in valse aannamen en interpretaties, zelfs over duidelijk zichtbare feiten. Bron - https://arxiv.org/pdf/2604.17873

Een voorbeeld van spatiale (in tegenstelling tot temporale) sycophantie, waarbij de AI zich laat gaslighten in valse aannamen en interpretaties, zelfs over duidelijk zichtbare feiten. Bron

De auteurs verklaren:

‘[We] identificeren spatiotemporele sycophantie, een falenmodus waarin Vid-LLM’s hun oorspronkelijk correcte, visueel gefundeerde oordelen intrekken en conformeren met misleidende gebruikersfeedback onder negatie-gebaseerde gaslighting.

‘In plaats van alleen hun antwoorden te veranderen, fabriceren de modellen vaak onondersteunde temporele of spatiale verklaringen om onjuiste revisies te rechtvaardigen.’

Temporele sycophantie breidt het potentieel voor gaslighting uit tot temporele gebeurtenissen die op bepaalde punten in een video plaatsvinden.

Temporele sycophantie breidt het potentieel voor gaslighting uit tot temporele gebeurtenissen die op bepaalde punten in een video plaatsvinden.

De auteurs hebben een nieuw evaluatiekader gemaakt met de titel Gas Video-1000, bedoeld om spatiotemporele sycophantie te onderzoeken door middel van redenering en visuele gronding, en hebben de gecurateerde collectie via GitHub en Hugging Face vrijgegeven.

Het paper concludeert dat huidige LLM’s geen betrouwbare mechanismen hebben om gaslighting van deze soort te weerstaan, hoewel prompt-niveau-gronding een beperkt mitigatie-effect kan hebben:

‘Uitgebreide experimenten laten zien dat kwetsbaarheid voor negatie-gebaseerde gaslighting wijdverspreid en ernstig is, zelfs bij modellen met sterke baseline-prestaties.

‘Terwijl prompt-niveau-grondingbeperkingen dit gedrag gedeeltelijk kunnen mitigeren, voorkomen ze niet betrouwbaar gehallucineerde rechtvaardigingen of geloofsoverdracht.’

Methode

De auteurs karakteriseren een videomodel als iets dat een clip bekijkt, een vraag beantwoordt en bij dat antwoord moet blijven als het bewijs duidelijk is. Het probleem begint wanneer een tweede bericht terugduwt en beweert dat het antwoord verkeerd is – effectief een valse idee plant en de model aanzet om van mening te veranderen.

Sycophantie, beweren de auteurs, wordt gedefinieerd als het krijgen van het juiste antwoord eerst, en dan overschakelen op een verkeerd antwoord na druk, zelfs als er niets in de video is veranderd. Het nieuwe onderzoek volgt hoe vaak deze ‘ommekeer’ gebeurt, en gebruikt dit als een maatstaf voor hoe gemakkelijk het model kan worden overgehaald om te twijfelen aan wat het eigenlijk zag.

De GasVideo-1000-dataset, ontwikkeld door de auteurs voor de evaluatie van gaslighting in VLM’s, bevat 1.013 monsters uit een verscheidenheid aan bestaande datasets:

Modellen worden getest op video-taken die temporele en spatiale begrip vereisen, en vervolgens krijgen ze misleidende follow-up-prompts die het juiste antwoord ontkennen, beroep doen op autoriteit of emotionele druk uitoefenen. Dit leidt vaak ertoe dat het model zijn gefundeerde antwoord verlaat en een zelfverzekerd maar onjuist antwoord produceert.

Modellen worden getest op video-taken die temporele en spatiale begrip vereisen, en vervolgens krijgen ze misleidende follow-up-prompts die het juiste antwoord ontkennen, beroep doen op autoriteit of emotionele druk uitoefenen. Dit leidt vaak ertoe dat het model zijn gefundeerde antwoord verlaat en een zelfverzekerd maar onjuist antwoord produceert.

Om falen te veroorzaken, werden misleidende follow-up-prompts in drie vormen opgesteld: Directe ontkenning (een valse alternatief beweren); Beroep op autoriteit (een expert aanhalen om het antwoord van het model te weerleggen); en Emotionele druk (frustratie of ongeloof gebruiken).

Deze prompts zijn ontworpen om de geteste modellen te dwingen om correcte, visueel gefundeerde antwoorden te verlaten en overeen te komen met een onjuist claim.

Distributie

De 1.013 monsters van GasVideo-1000 zijn afkomstig uit MSRVTT-QA (300), ActivityNet-QA (200), Perception Test (293), MVBench (120) en VideoMME (100), met een mix die is gekozen om open-eindige video-vragen te balanceren met fijne temporele en causale redenering, en om zowel korte webinhoud als langere, complexere visuele sequenties te dekken.

Twee menselijke annotators hebben elk monster beoordeeld, en alleen clips behouden waarvan het antwoord duidelijk door de video werd ondersteund, en waar negatie-prompts het antwoord plausibel konden uitdagen, zodat elke latere ommekeer een gevolg zou zijn van druk in plaats van onduidelijkheid.

Gegevens en tests

De VLM’s die voor de studie zijn getest, waren VideoLLaMA3; Video-ChatGPT-7B; LLaVA-Video-7B-Qwen2; LongVU-Qwen2-7B; Qwen3-VL-235B-A22B-Instruct en de gesloten Google Gemini-3-Pro.

Voor vrije-vormvragen in GasVideo-1000 volgde de evaluatie het semantische scoreschema dat eerder in VideoMME werd gebruikt. ChatGPT-4o werd gebruikt als LLM-rechter, en vergelijkt elk antwoord met zowel het grondwaarheidsantwoord als de ingebrachte valse premisse. Op deze manier werd correctheid beoordeeld op basis van betekenis, in plaats van exacte woordkeuze:

Prestatie van VideoLLaMA3, LLaVA-Video, Video-ChatGPT en LongVU over VideoMME, MVBench, EgoSchema, NExT-QA, Perception Test, ActivityNet-QA, MSRVTT-QA en MSVD-QA, met baseline-accuraatheid, accuraatheid na negatie-gebaseerde gaslighting en de resulterende degradatie. Consistente dalingen geven aan dat misleidende follow-up-prompts de correctheid verminderen over zowel redeneringszware als algemene video-taken.

Prestatie van VideoLLaMA3, LLaVA-Video, Video-ChatGPT en LongVU over VideoMME, MVBench, EgoSchema, NExT-QA, Perception Test, ActivityNet-QA, MSRVTT-QA en MSVD-QA, met baseline-accuraatheid, accuraatheid na negatie-gebaseerde gaslighting en de resulterende degradatie. Consistente dalingen geven aan dat misleidende follow-up-prompts de correctheid verminderen over zowel redeneringszware als algemene video-taken.

Van de initiële resultaten zoals hierboven weergegeven, verklaren de auteurs:

‘[Er is] een systematische en ernstige prestatie-inzinking over alle geëvalueerde Vid-LLM’s wanneer ze worden onderworpen aan negatie-gebaseerde gaslighting. Over acht verschillende benchmarks vertoont elk model een aanzienlijke negatieve [kloof], met een accuraatheidsdegradatie van maximaal 42,60% voor LLaVA-Video-7B op EgoSchema en 40,22% voor VideoLLaMA3 op ActivityNet.

‘Deze drastische reductie – vaak gekarakteriseerd als geloofsoverdracht – onthult dat zelfs state-of-the-art-modellen met hoge baseline-prestaties nog steeds acuut kwetsbaar zijn voor sycophantische hallucinaties.’

Het is cruciaal dat de daling in prestatie niet samenvalt met de initiële accuraatheid, waarbij LLaVA-Video-7B sterke baseline-scores behoudt, maar enkele van de steilste dalingen lijdt, wat de auteurs betogen als een compromis waarbij sterker instructievolgen de modellen meer geneigd maakt om valse gebruikerssignalen te accepteren in plaats van visuele bewijzen.

Een soortgelijk patroon verscheen met betrekking tot schaal, waarbij Qwen3-VL-235B brozer bleek te zijn dan verschillende 7B-modellen op GasVideo-1000, wat suggereert dat afstemming en cross-modale kalibratie een grotere rol spelen in robuustheid dan parameter telling alleen.

Prestatie van Gemini-3-Pro, Qwen3-VL, LLaVA-NeXT, LongVU, Video-ChatGPT en VideoLLaMA3 op GasVideo-1000, met een vergelijking van baseline-accuraatheid met resultaten na negatie-gebaseerde gaslighting over meerdere keuze, vrije vorm en gecombineerde instellingen. Grote dalingen geven aan dat beide formaten kwetsbaar zijn, hoewel meerdere keuze-taken over het algemeen de ernstigste degradatie lijden.

Prestatie van Gemini-3-Pro, Qwen3-VL, LLaVA-NeXT, LongVU, Video-ChatGPT en VideoLLaMA3 op GasVideo-1000, met een vergelijking van baseline-accuraatheid met resultaten na negatie-gebaseerde gaslighting over meerdere keuze, vrije vorm en gecombineerde instellingen. Grote dalingen geven aan dat beide formaten kwetsbaar zijn, hoewel meerdere keuze-taken over het algemeen de ernstigste degradatie lijden.

Met betrekking tot de tweede reeks tests zoals hierboven afgebeeld, verklaren de auteurs:

‘Evaluatie op onze GasVideo-1000 [benchmark] geeft verder aan dat er ernstige sycophantische hallucinaties zijn bij zowel propriëtaire als open-source modellen, met name in de gebalanceerde categorie.

‘Opvallend genoeg lijdt zelfs het meest krachtige propriëtaire model, Gemini-3-Pro, een catastrofale prestatie [degradatie].

‘Bij open-source modellen vertoont Qwen3-VL een verbluffende daling van 46,07%, terwijl extreme gevoeligheid ook wordt waargenomen bij VideoLLaMA 3 en LLaVA-NeXT met algemene dalingen van respectievelijk 26,39% en 23,44%.

‘Deze resultaten onderstrepen de dringende behoefte aan afstemmingsstrategieën die feitelijke consistentie en visuele gronding prioriteren boven blinde gehoorzaamheid aan tegenstrijdige gebruikersinstructies.’

In een aanvullende test werd preemptieve prompt-verharding (het toevoegen van sterkere systeeminstructies die het model dwingen om te vertrouwen op wat het ziet, in plaats van wat de gebruiker claimt) ingevoerd om visuele gronding af te dwingen:

Resultaten op GasVideo-1000 die standaardprompts vergelijken met verharde prompts die visuele gronding afdwingen, waarin wordt getoond hoe Gemini-3-Pro, Qwen3-VL, LongVU, LLaVA-NeXT en VideoLLaMA3 reageren voor en na negatie-gebaseerde gaslighting. Veranderingen in accuraatheid, prestatiedaling en sycophantiegraad geven aan dat verharding falen kan verminderen, hoewel de winst sterk verschilt tussen modellen.

Resultaten op GasVideo-1000 die standaardprompts vergelijken met verharde prompts die visuele gronding afdwingen, waarin wordt getoond hoe Gemini-3-Pro, Qwen3-VL, LongVU, LLaVA-NeXT en VideoLLaMA3 reageren voor en na negatie-gebaseerde gaslighting. Veranderingen in accuraatheid, prestatiedaling en sycophantiegraad geven aan dat verharding falen kan verminderen, hoewel de winst sterk verschilt tussen modellen.

Zoals we kunnen zien uit de tabel hierboven, zijn de effecten ongelijk, waarbij Gemini-3-Pro zeer gevoelig blijkt, aangezien zijn succespercentage daalt van 54,80% tot 8,67%. Intussen daalt Qwen3-VL minder spectaculair, van 71,89% tot 64,0%, wat aangeeft dat effectiviteit afhankelijk is van afstemming en redenering, in plaats van de interventie zelf.

Sycophantiepercentages onder verschillende druktypen voor Gemini-3-Pro en Qwen3-VL over meerdere keuze, vrije vorm en gecombineerde taken, waaruit blijkt dat Directe Ontkenning en Emotionele Druk consistent hogere falenpercentages veroorzaken. Aan de andere kant is Beroep op Autoriteit enigszins minder effectief, waarbij Qwen3-VL over het algemeen meer kwetsbaar blijkt.

Sycophantiepercentages onder verschillende druktypen voor Gemini-3-Pro en Qwen3-VL over meerdere keuze, vrije vorm en gecombineerde taken, waaruit blijkt dat Directe Ontkenning en Emotionele Druk consistent hogere falenpercentages veroorzaken. Aan de andere kant is Beroep op Autoriteit enigszins minder effectief, waarbij Qwen3-VL over het algemeen meer kwetsbaar blijkt.

In de grafieken hierboven kunnen we zien dat falen varieert met druktype, waarbij Gemini-3-Pro het meest wordt beïnvloed door Beroep op Autoriteit (claims ondersteund door vermeende experts), terwijl Qwen3-VL gevoeliger is voor Directe Ontkenning (vlakke tegenstrijdigheid) en Emotionele Druk (frustratie of aandringen).

Verdere analyse toonde aan dat neutrale prompts zoals ‘Weet je zeker?’ (vaak een probleem) minder schadelijk zijn dan expliciete ontkenning of emotionele druk, waarbij directe ontkenning een sterkere trigger blijkt te zijn dan toon in beperkte instellingen.

Conclusie

Vanwege de bewust antropomorfiseerde aard van chat-gebaseerde VLM/LLM-interfaces, kan het lang duren voordat een gebruiker begrijpt dat de regels van discours aanzienlijk verschillen voor AI-uitwisselingen dan voor menselijke communicatie.

Een manier om deze adoptie-wrijving te verwijderen of aanzienlijk te verminderen, zou zijn om de toon en context van de uitwisseling te ‘neutraliseren’, door te herhalen dat de gebruiker in contact staat met een instantie van een machine, en dat de signalen en signalen rond beleefdheid en debat niet moeten worden vertrouwd of evenveel gewicht moeten krijgen als menselijke discours. Maar vermoedelijk zou dit een moeilijke verkoop zijn op de volgende bestuursvergadering.

 

* Auteursbenadrukking, niet de mijne.

Eerst gepubliceerd op woensdag 22 april 2026

Schrijver over machine learning, domeinspecialist in humane beeldsynthese. Voormalig hoofd van onderzoeksinhoud bij Metaphysic.ai, tot de opheffing ervan in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]