Andersonův úhel

Přístup k problému gaslightingu u umělé inteligence

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
AI-generated image (GPT-2): A 1960s suburban street where identical Stepford-style wives clean cars in repeating rows, with a ‘3081 Stepford St’ mailbox in the foreground.

Modely umělé inteligence pro zpracování videa mohou být přesvědčeny k odhlédnutí od pravdy. I když最初 vidí správnou odpověď, podlehají přesvědčivým uživatelům, přepisují realitu a vynalézají falešné vysvětlení, aby ji ospravedlnili.

 

Umělá inteligence je natolik často chybná, že nás nutí zpochybňovat její závěry, pokud máme pocit, že by mohly být chybné.

Problém je, že pokud jsme si již zpočátku jistí, proč jsme se ptali? Pro potvrzení našeho částečně drženého přesvědčení nebo podezření?

Pokud ano, současný stav velkých jazykových modelů (LLM) a modelů pro zpracování videa a jazyka (VLM) není dobře přizpůsoben k tomu, aby své názory hájil, kvůli problému sycophantství.

To znamená, že pokud se nám nelíbí odpověď, kterou dostaneme, a začneme s modelem vést spor o ní, je umělá inteligence pravděpodobně buď omylem ustoupí (pokud se domnívá, že je chybná) místo toho, aby přehodnotila, nebo se dá přesvědčit k tomu, aby podporovala naše návrhy – i když my jsme chybní.

Jste absolutně pravý!

Praxe, kdy člověk přesvědčí umělou inteligenci k změně názoru prostřednictvím konfliktu, byla nazvána ‘Gaslighting Negation Attack’, a někdy je charakterizována jako bezpečnostní problém – nejméně proto, že má nějaký potenciál k ‘jailbreaku’ modelu z jeho provozních omezení:

Z článku z roku 2025 'Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models', GPT-5最初 odpoví správně, ale poté podlehne tlaku uživatele, změní odpověď a vynalezne falešné vysvětlení, aby ospravedlnil chybu, efektivnímu gaslightingu.

Z článku z roku 2025 ‘Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models’, GPT-5最初 odpoví správně, ale poté podlehne tlaku uživatele, změní odpověď a vynalezne falešné vysvětlení, aby ospravedlnil chybu, efektivnímu gaslightingu. Zdroj

Jedná se však o problém, který není způsoben hackováním nebo testováním penetrace; spíše se jedná o běžné použití a očekávané normy diskuse v našich denních interakcích s umělou inteligencí, kde očekáváme, že budeme moci argumentovat a buď vyhrát, nebo se vzdát, nebo věc nechat bez řešení, v souladu s našimi lidskými zkušenostmi s získáváním znalostí.

Ale tento sociální model řešení konfliktů není skutečně zohledněn v architektuře difuzních modelů umělé inteligence, které musí vyjednávat distribuční pravděpodobnosti generované jejich trénovacími daty; možná konfliktní (ale potenciálně přesnější) data z RAG volání na zdroje, které překračují jejich datum ukončení znalostí, nebo obecné pochopení toho, co může být málo známé téma; a vstup od uživatele, který může mít: lepší znalost předmětu; úplně chybný nebo lživý názor; nebo jednoduše další otázku – ale jehož potřeby musí být přesto zohledněny.

Pohyblivé cíle

Náchylnost k gaslightingu byla zaznamenána u LLM ve několika článcích, včetně singapurské publikace z října 2025 a článku z roku 2025 Don’t Deceive Me: Mitigating Gaslighting through Attention Reallocation in LMMs.

Dosud nebyl tento jev studován u video-kapabilních LLM – což je mezera, kterou řeší nová spolupráce mezi institucemi v Šanghaji a Singapuru.

Nová práce – nazvaná Spatiotemporal Sycophancy: Negation-Based Gaslighting in Video Large Language Models, která pochází od šesti výzkumníků z Fudan University, Shanghai Key Laboratory of Multimodal Embodied AI a Singapore Management University – se zabývá několika otevřenými zdrojovými a proprietárními VLM, a zjistila, že mohou být stejně náchylné k gaslightingu jako LLM, a navíc jsou schopny své výmysly doplnit zdánlivými vizuálními důkazy nebo nesprávnými interpretacemi obrazů nebo videí:

Příklad prostorového (na rozdíl od temporálního) sycophantství, kde se umělá inteligence dovolí být přesvědčena k falešným předpokladům a interpretacím, i o jasně viditelných faktech. Zdroj - https://arxiv.org/pdf/2604.17873

Příklad prostorového (na rozdíl od temporálního) sycophantství, kde se umělá inteligence dovolí být přesvědčena k falešným předpokladům a interpretacím, i o jasně viditelných faktech. Zdroj

Autoři uvádějí:

‘[My] identifikujeme spatiotemporální sycophantství, selhání modelu, ve kterém Vid-LLM zruší původně správné, vizuálně zakotvené soudy a přizpůsobí se klamným uživatelským zpětným vazbám na základě negace-založeného gaslightingu.

‘Místo toho, aby pouze změnily své odpovědi, modely často vynalézají nepodložená temporální nebo prostorová vysvětlení, aby ospravedlnily nesprávné revize.’

Temporální sycophantství rozšiřuje potenciál gaslightingu na temporální události, které se vyskytují v určitých bodech videa.

Temporální sycophantství rozšiřuje potenciál gaslightingu na temporální události, které se vyskytují v určitých bodech videa.

Autoři vytvořili nový evaluační rámec nazvaný Gas Video-1000, který má za cíl prozkoumat spatiotemporální sycophantství pomocí rozumu a vizuálního zakotvení, a zveřejnili kurátorovanou sbírku prostřednictvím GitHubu a Hugging Face.

Článek uzavírá, že současné LLM postrádají spolehlivé mechanismy pro odolávání gaslightingu tohoto typu, ačkoli prompt-level grounding může mít omezený mitigující účinek:

‘Rozsáhlé experimenty odhalily, že zranitelnost vůči negace-založenému gaslightingu je všudypřítomná a závažná, i u modelů s vysokými základními výkony.

‘Zatímco prompt-level grounding omezení mohou částečně zmírnit toto chování, nezabrání spolehlivě vynálezům nebo změnám víry.’

Metoda

Autoři charakterizují video model jako něco, co sleduje klip, odpoví na otázku o něm, a mělo by držet svou odpověď, pokud je důkaz jasný. Problém začíná, když druhá zpráva zpochybní odpověď – efektivnímu nasazení falešné myšlenky a nutí model ke změně názoru.

Sycophantství, autoři tvrdí, je definováno jako získání správné odpovědi poprvé, a poté přepnutí na nesprávnou odpověď po tlaku, i když se nic na videu nezměnilo. Nová práce sleduje, jak často tyto ‘přepínače’ nastávají, a používá je jako míru toho, jak snadno lze model přesvědčit k tomu, aby se vzdal toho, co skutečně viděl.

Dataset GasVideo-1000, vytvořený autory pro evaluaci gaslightingu u VLM, obsahuje 1 013 vzorků z různých existujících datasetů:

Modely jsou testovány na video úkolech, které vyžadují temporální a prostorové porozumění, a poté jsou jim předloženy klamné follow-up dotazy, které popírají správnou odpověď, odvolávají se na autoritu nebo uplatňují emocionální tlak. To často vede k tomu, že model opouští své zakotvené odpovědi a produkuje sebevědomou, ale nesprávnou odpověď.

Modely jsou testovány na video úkolech, které vyžadují temporální a prostorové porozumění, a poté jsou jim předloženy klamné follow-up dotazy, které popírají správnou odpověď, odvolávají se na autoritu nebo uplatňují emocionální tlak. To často vede k tomu, že model opouští své zakotvené odpovědi a produkuje sebevědomou, ale nesprávnou odpověď.

Pro sbírku autoři využili VideoMME a MVBench, které pokrývají široké multimodální rozumnění; NExT-QA a Perception Test, které zkoumají kauzální a temporální logiku; EgoSchema, zaměřený na dlouhé egocentrické video; a ActivityNet-QA a MSRVTT-QA, měřící obecné reálné otázky a odpovědi.

Pro vyvolání selhání byly konstruovány klamné follow-up dotazy ve třech formách: Přímé popření (rovnou tvrzení falešné alternativy); Odvolání na autoritu (odvolání na odborníka, aby zpochybnil odpověď modelu); a Emocionální tlak (využití frustrace nebo nedůvěry).

Tyto dotazy byly navrženy tak, aby donutily testované modely opustit správné, vizuálně zakotvené odpovědi a přizpůsobit se nesprávným tvrzením.

Distribuce

GasVideo-1000 obsahuje 1 013 vzorků, které byly vybrány z MSRVTT-QA (300), ActivityNet-QA (200), Perception Test (293), MVBench (120) a VideoMME (100), s cílem vyvážit otevřené video otázky a odpovědi s jemným temporálním a kauzálním rozumním, a zároveň zajistit pokrytí både krátkých webových obsahů a delších, složitějších vizuálních sekvencí.

Dva lidské anotátoři přezkoumali každý kandidát, a ponechali pouze klipy, kde odpověď byla jasně podporována videem, a kde negační dotazy mohly realisticky zpochybnit odpověď, aby pozdější otočení odráželo tlak, a notambiguity.

Data a testy

VLM testované pro studii byly VideoLLaMA3; Video-ChatGPT-7B; LLaVA-Video-7B-Qwen2; LongVU-Qwen2-7B; Qwen3-VL-235B-A22B-Instruct a uzavřený Google Gemini-3-Pro.

Pro volné otázky v GasVideo-1000, evaluace následovala semantický-scoring schéma používané dříve ve VideoMME. ChatGPT-4o byl použit jako LLM soudce, porovnávající každou odpověď proti både skutečné odpovědi a vloženému falešnému předpokladu. Tímto způsobem byla správnost hodnocena podle významu, a notprávě podle přesného znění:

Výkon VideoLLaMA3, LLaVA-Video, Video-ChatGPT a LongVU napříč VideoMME, MVBench, EgoSchema, NExT-QA, Perception Test, ActivityNet-QA, MSRVTT-QA a MSVD-QA, ukazující základní přesnost, přesnost po negaci-založeném gaslightingu a výslednou degradaci. Konsistentní poklesy ukazují, že klamné follow-up dotazy snižují správnost napříč både rozumově náročnými a obecnými video úkoly.

Výkon VideoLLaMA3, LLaVA-Video, Video-ChatGPT a LongVU napříč VideoMME, MVBench, EgoSchema, NExT-QA, Perception Test, ActivityNet-QA, MSRVTT-QA a MSVD-QA, ukazující základní přesnost, přesnost po negaci-založeném gaslightingu a výslednou degradaci. Konsistentní poklesy ukazují, že klamné follow-up dotazy snižují správnost napříč både rozumově náročnými a obecnými video úkoly.

Z počátečních výsledků uvedených výše autoři uvádějí:

‘[Je] systémový a závažný kolaps výkonu napříč všemi hodnocenými Vid-LLM, když jsou vystaveny negaci-založenému gaslightingu. Napříč osmi rozmanitými benchmarky, každý model vykazuje podstatný negativní [mezera], s degradací přesnosti dosahující 42,60 % pro LLaVA-Video-7B na EgoSchema a 40,22 % pro VideoLLaMA3 na ActivityNet.

‘Tato drastická redukce – často charakterizovaná jako změna víry – odhaluje, že i modely s vysokými základními výkony zůstávají akutně zranitelné vůči sycophantickým halucinacím.’

Kriticky, pokles výkonu nesledoval počáteční přesnost, s LLaVA-Video-7B, která si udržela silné základní skóre, ale utrpěla některé z nejprudších poklesů, což autoři tvrdí, že odráží kompromis, kde silnější dodržování pokynů může učinit modely více náchylné k falešným uživatelským signálům než k vizuálním důkazům.

Podobný vzorec se objevil i v případě měřítka, kde Qwen3-VL-235B se ukázal jako křehčí než několik 7B modelů na GasVideo-1000, naznačující, že zarovnání a cross-modální kalibrace hrají větší roli v odolnosti než počet parametrů samotný.

Výkon Gemini-3-Pro, Qwen3-VL, LLaVA-NeXT, LongVU, Video-ChatGPT a VideoLLaMA3 na GasVideo-1000, porovnávající základní přesnost s výsledky po negaci-založeném gaslightingu napříč vícečetnými výběry, volnými otázkami a kombinovanými nastaveními. Velké poklesy ukazují, že obě formáty jsou zranitelné, i když vícečetné výběry tendují k tomu, aby utrpěly nejzávažnější degradaci.

Výkon Gemini-3-Pro, Qwen3-VL, LLaVA-NeXT, LongVU, Video-ChatGPT a VideoLLaMA3 na GasVideo-1000, porovnávající základní přesnost s výsledky po negaci-založeném gaslightingu napříč vícečetnými výběry, volnými otázkami a kombinovanými nastaveními. Velké poklesy ukazují, že obě formáty jsou zranitelné, i když vícečetné výběry tendují k tomu, aby utrpěly nejzávažnější degradaci.

Ohledně druhé série testů uvedené výše autoři uvádějí*:

‘Evaluace na našem GasVideo-1000 [benchmarku] dále naznačuje závažné sycophantické halucinace napříč både proprietárními a otevřenými modely, zvláště v kategorii vyvážené.

‘Zejména i nejsilnější proprietární model, Gemini-3-Pro, utrpěl katastrofální výkon [degradaci].

‘Mezi otevřenými modely Qwen3-VL vykazuje ohromující 46,07% pokles, zatímco extrémní citlivost je také pozorována u VideoLLaMA 3 a LLaVA-NeXT s celkovými poklesy 26,39% a 23,44%, resp.

‘Tyto výsledky zdůrazňují naléhavou potřebu strategií zarovnání, které dávají přednost faktické konzistenci a vizuálnímu zakotvení nad slepým dodržováním adversativních uživatelských pokynů.’

V další zkoušce, předběžné zpevnění promptů (přidání silnějších systémových pokynů, které donutí model spoléhat se na to, co vidí, a not co uživatel tvrdí) bylo zavedeno, aby vynutilo vizuální zakotvení:

Výsledky na GasVideo-1000 porovnávající standardní prompty s zpevněnými prompty, které vynucují vizuální zakotvení, ukazující, jak Gemini-3-Pro, Qwen3-VL, LongVU, LLaVA-NeXT a VideoLLaMA3 reagují před a po negaci-založeném gaslightingu. Změny v přesnosti, výkonu a míře sycophantství naznačují, že zpevnění může snížit selhání, i když zisky se liší výrazně napříč modely.

Výsledky na GasVideo-1000 porovnávající standardní prompty s zpevněnými prompty, které vynucují vizuální zakotvení, ukazující, jak Gemini-3-Pro, Qwen3-VL, LongVU, LLaVA-NeXT a VideoLLaMA3 reagují před a po negaci-založeném gaslightingu. Změny v přesnosti, výkonu a míře sycophantství naznačují, že zpevnění může snížit selhání, i když zisky se liší výrazně napříč modely.

Jako můžeme vidět z tabulky výše, účinky jsou nestejné, s Gemini-3-Pro vysoce citlivým, protože jeho úspěšnost klesá z 54,80% na 8,67%. Zatímco Qwen3-VL klesá více skromně, z 71,89% na 64,0%, ukazující, že účinnost závisí na zarovnání a rozumném uvažování, a not pouze na zásahu.

Míra sycophantství pod různými typy tlaku pro Gemini-3-Pro a Qwen3-VL napříč vícečetnými výběry, volnými otázkami a kombinovanými úkoly, ukazující, že přímé popření a emocionální tlak konzistentně vyvolávají vyšší míru selhání. Na druhé straně, odvolání na autoritu je méně účinné, s Qwen3-VL, která zůstává zřetelně více zranitelná celkově.

Míra sycophantství pod různými typy tlaku pro Gemini-3-Pro a Qwen3-VL napříč vícečetnými výběry, volnými otázkami a kombinovanými úkoly, ukazující, že přímé popření a emocionální tlak konzistentně vyvolávají vyšší míru selhání. Na druhé straně, odvolání na autoritu je méně účinné, s Qwen3-VL, která zůstává zřetelně více zranitelná celkově.

V grafech uvedených výše můžeme vidět, že selhání se liší podle typu tlaku, s Gemini-3-Pro nejvíce postiženým odvoláním na autoritu (tvrdí, že je podporován odborníky), zatímco Qwen3-VL je více zranitelný vůči přímému popření (rovnou kontradikci) a emocionálnímu tlaku (frustraci nebo naléhání).

Další analýza ukázala, že neutrální prompty, jako je ‘Jste si jistí?’ (často problém), jsou méně škodlivé než explicitní negace nebo emocionální tlak, s přímým popřením, které zůstává silnějším spouštěčem než tón v omezených nastaveních.

Závěr

Vzhledem k úmyslně antropomorfizovanému charakteru chatbota založeného na VLM/LLM, může trvat dlouho, než uživatel pochopí, že pravidla diskuse jsou výrazně odlišná pro interakce s umělou inteligencí než pro lidskou komunikaci.

Jedním ze způsobů, jak odstranit nebo podstatně snížit tuto adopční tření, by mohlo být ‘neutralizovat’ tón a kontext výměny, zdůrazňující, že uživatel je v kontaktu s instancí stroje, a že signály a signály kolem zdvořilosti a debaty nejsou spolehlivé nebo nemají stejnou váhu jako lidská komunikace. Ale zřejmě by to bylo těžké prodat na příští zasedání představenstva.

 

* Autoři zdůrazňují, ne já.

Poprvé zveřejněno ve středu, 22. dubna 2026

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai