Andersonin kulma
Tekemällä AI:n Gaslighting-ongelma

AI-videomallit voidaan puhua pois totuudesta. Vaikka ne näkevät oikean vastauksen, ne antautuvat luottavaisille käyttäjille, muokkaavat todellisuutta ja keksivät väärät selitykset oikeuttaakseen sen.
AI on väärin tarpeeksi usein, jotta meidän on pakko kyseenalaistaa sen johtopäätökset, jos epäilemme, että ne voivat olla väärin.
Ongelma on, että jos tiesimme eri asian alusta alkaen, miksi kysyimme sitä ensinnäkin? Vahvistusta osittain pidetyn uskomuksen tai epäilyn vuoksi?
Jos näin on, Large Language Modelien (LLM) ja Vision Language Modelien (VLM) nykyinen tila, jotka toimivat monitavoitteisesti, hyväksyen ja tuottaa kuvia ja / tai videoita, ei ole hyvin sovellettavissa ylläpitämään maata, johtuen sycophancy-ongelmasta.
Niinpä, jos emme pidä vastausta, jonka saamme, ja aloitamme kiistan siitä mallin kanssa, AI on todennäköisesti joko virheellisesti perääntyy (olettaa, että se oli väärä) sen sijaan, että se arvioi uudelleen, tai antautuu gaslightingiin tukemaan ehdotuksiamme – vaikka me olemme väärässä.
Olet Absoluuttinen Oikeassa!
Ihmisen toimintaa, jossa AI:n mieli muutetaan konfliktin kautta, on kutsuttu ‘Gaslighting Negation Attackiksi’, ja se on joskus luonnehdittu turvallisuusongelmaksi – ei vähiten, koska sillä on jotkin mahdollisuudet ‘jailbreak’ malli sen toimintarajoituksista:

Vuoden 2025 tutkimuksesta ‘Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models’, GPT-5 vastaa aluksi oikein, mutta antautuu sitten käyttäjän painostukselle, kääntää vastauksensa ja keksii väärät selitykset virheen oikeuttamiseksi, tehden itsestään gaslightingin. Lähde
Kuitenkin, hakkerointi ja pen-testaus eivät ole todellinen ongelma tässä; ongelma on yleinen käyttö ja odotetut vuorovaikutuksen normit AI:n kanssa, joissa odotamme voivamme väittää ja joko voittaa, myöntää tai jättää asian ratkaisematta, soveltaen ihmisen perustuvaa tietämyksen hankkimista.
Mutta tämä sosiaalinen konfliktin ratkaisumalli ei ole otettu huomioon diffusion-pohjaisen AI:n arkkitehtuurissa, joka on neuvoteltava jakautuneiden todennäköisyyksien kanssa, jotka heittävät sen koulutusdatasta; mahdollisesti ristiriitaisista (mutta mahdollisesti tarkempi) datasta RAG-kutsuista lähteisiin, jotka ylittävät sen tietämyksen leikkauspäivämäärän, tai yleisen ymmärryksen, mitä voi olla epäselvä aihe; ja käyttäjän syöte, jolla voi olla: parempi tietämys aiheesta; täysin virheellinen tai petollinen näkökulma; tai yksinkertaisesti seuraava kysymys – mutta jonka tarpeita on kuitenkin otettava huomioon.
Liikkuva Maali
Herkillisyys gaslightingiin on huomattu LLM:ssä useissa tutkimuksissa, mukaan lukien Singaporen johdolla julkaistu tutkimus lokakuusta 2025, ja saman vuoden tutkimus Don’t Deceive Me: Mitigating Gaslighting through Attention Reallocation in LMMs.
Toistaiseksi ilmiö ei ole tutkittu video-ominaisuuksilla varustetuissa LLM:ssä – puutetta, jota uusi yhteistyö Shanghain ja Singaporen instituuttiin on ratkaissut.
Uusi tutkimus – nimeltään Spatiotemporal Sycophancy: Negation-Based Gaslighting in Video Large Language Models, joka tulee kuudesta tutkijasta Fudan Universitysta, Shanghain avainlaboratoriosta monimodaaliselle ruumiillistetulle AI:lle ja Singaporen johtamisyleisöltä – kohdistuu useisiin avoimiin ja suljettuihin VLM-malleihin, havaiten, että ne voivat olla yhtä herkillisiä gaslightingille kuin LLM:t, ja lisäksi kykeneviä kehittämään mielikuvituksellisia todisteita tai virheellisiä tulkintoja kuvista tai videoista:

Esimerkki spatiaalisesta sycophancyystä, jossa AI antautuu virheellisille oletuksille ja tulkinnille, vaikka neuvostossa on selvästi näkyvää tietoa. Lähde
Tekijät toteavat:
‘[Me] tunnistamme spatiaalisen sycophancyn, virheen muodossa, jossa Vid-LLM:t peruvat aluksi oikeat, visuaalisesti perustellut arviot ja mukautuvat harhaanjohtaviin käyttäjän palautteisiin negaation perusteella.’
‘Sen sijaan, että vain muuttaisivat vastauksiaan, mallit usein keksivät tukemattomia aikasarja- tai spatiaalisia selityksiä, joilla perustellaan virheellisiä muutoksia.’

Aikasarjamuotoinen sycophancy laajentaa gaslightingin mahdollisuuden aikasarja-tapahtumiin, jotka tapahtuvat tietyissä kohdissa videossa.
Tekijät ovat tuottaneet uuden arviointikehyksen nimeltä Gas Video-1000, jonka tarkoituksena on tutkia spatiaalista sycophancyä järjellisyyden ja visuaalisen perustelun kautta, ja julkaisevat kokoelman GitHubissa ja Hugging Facessa.
Tutkimus toteaa, että nykyiset LLM:t puuttuvat luotettavista mekanismeista, joilla vastustaa tällaista gaslightingia, vaikka prompt-tasolla oleva perustelu voi olla rajattu lievittävä vaikutus:
‘Laajat kokeet osoittavat, että herkillisyys negaation perusteella gaslightingiin on yleinen ja vakava, jopa malleissa, joilla on vahva perusarviointi.
‘Vaikka prompt-tason perustelurajoitukset voivat osittain lieventää tätä käyttäytymistä, ne eivät estä luotettavasti keksittyjä perusteluja tai uskomuksen kääntymistä.’
Menetelmä
Tekijät kuvaavat video-mallin asiaksi, joka katsoo klipin, vastaa kysymykseen siitä ja pitäisi pitäytyä siihen vastaukseen, jos todiste on selvä. Ongelma alkaa, kun toinen viesti vastustaa sitä ja väittää, että vastaus on väärä – tehden virheellisen idean ja työntäen mallia muuttamaan mieltään.
Sycophancy, tekijät väittävät, määritellään oikean vastauksen saamisella ensin, ja sitten väärän vastauksen valinnalla painostuksen jälkeen, vaikka mitään videossa ei ole muuttunut. Uusi tutkimus seuraa, kuinka usein nämä “käännökset” tapahtuvat, ja käyttää sitä mittarina siitä, kuinka helposti malli voidaan puhua pois siitä, mitä se todella näki.
GasVideo-1000-tietokanta, jonka tekijät ovat kehittäneet VLM:iin liittyvän gaslightingin arvioimiseksi, sisältää 1 013 näytettä olemassa olevista tietokannoista:

Malleja testataan video-tehtävillä, jotka vaativat aikasarja- ja spatiaalista ymmärrystä, ja sitten annetaan harhaanjohtavia seuraavien ohjeita, jotka kieltävät oikean vastauksen, vedonlyövät auktoriteettiin tai soveltavat emotionaalista painostusta. Tämä usein johtaa mallin hylkäämään perustellun vastauksensa ja tuottamaan varman, mutta virheellisen selityksen.
Kokoelmaa varten tekijät hyödynsivät VideoMME:tä ja MVBench:iä, jotka kattavat laajan monimodaalisen päättelyn; NExT-QA:n ja Perception Test:in, jotka tutkivat kausaalia ja aikasarja-logiikkaa; EgoScheman, joka keskittyy pitkän aikavälin egosentrisiin videoon; ja ActivityNet-QA:n ja MSRVTT-QA:n, jotka mitataan yleisen maailmanlaajuisen kysymys-vastaus -tehtävää.
Jotta aiheuttaa epäonnistumisia, harhaanjohtavat seuraavat ohjeet muodostettiin kolmessa muodossa: Suora Kieltäminen (selkeästi väittää virheellistä vaihtoehtoa); Auktoriteetin Vedonlyönti (vetoomalla asiantuntijaan, joka hylkää mallin vastauksen); ja Emotionaalinen Painostus (käyttäen frustraatiota tai epäuskoa).
Nämä ohjeet suunniteltiin pakottamaan testattuja malleja hylkäämään oikeat, visuaalisesti perustellut vastaukset ja mukautumaan virheelliseen väitteeseen.
Jakautuminen
GasVideo-1000:n 1 013 näytettä otettiin MSRVTT-QA:sta (300), ActivityNet-QA:sta (200), Perception Testistä (293), MVBenchistä (120) ja VideoMME:stä (100), ja sekoitus valittiin tasapainottamaan avoimia video-kysymys-vastaus -tehtäviä hienojakoisella aikasarja- ja kausaalisella päättelyllä, varmistaen samalla peittävän sekä lyhyen web-sisällön että pidemmän, monimutkaisemman visuaalisen sekvenssin.
Kaksi ihmistä tarkastivat jokaisen ehdokkaan, ja säilyttivät vain klipit, joissa vastaus oli selvästi tuettu videolla, ja joissa negaatio-ohjeet voivat haastaa vastauksen uskottavasti, jotta myöhempi käännös heijastaisi painostusta eikä epävarmuutta.
Data ja Testit
VLM:t, jotka testattiin tutkimuksessa, olivat VideoLLaMA3; Video-ChatGPT-7B; LLaVA-Video-7B-Qwen2; LongVU-Qwen2-7B; Qwen3-VL-235B-A22B-Instruct ja suljettu Google Gemini-3-Pro.
Vapaamuotoisissa kysymyksissä GasVideo-1000:ssa arviointi seurasi semanttista arviointijärjestelmää, jota oli aiemmin käytetty VideoMME:ssä. ChatGPT-4o käytettiin LLM-tuomarina, vertaamalla jokaista vastausta sekä ground-truth-vastaukseen että virheelliseen esittämään premissiin. Tällä tavoin oikeellisuus arvioitiin merkityksen perusteella, eikä tarkasti sanamuodolla:

VideoLLaMA3:n, LLaVA-Videon, Video-ChatGPT:n ja LongVU:n suorituskyky VideoMME:ssä, MVBenchissä, EgoSchemassa, NExT-QA:ssa, Perception Testissä, ActivityNet-QA:ssa, MSRVTT-QA:ssa ja MSVD-QA:ssa, osoittaa perusarviointitarkkuuden, tarkkuuden negaation perusteella gaslightingin jälkeen ja tuloksena olevan heikentymisen. Jatkuva lasku osoittaa, että harhaanjohtavat seuraavat ohjeet vähentävät oikeellisuutta sekä päättelyvaativissa että yleisissä video-tehtävissä.
Alkuperäisistä tuloksista, joita yllä mainittu kuva esittää, tekijät toteavat:
‘[On] järjestelmällinen ja vakava suorituskyvyn romahdus kaikissa arvioiduissa Vid-LLM:eissä, kun ne altistetaan negaation perusteella gaslightingille. Kahdeksassa erilaisissa benchmark-ohjelmissa jokainen malli osoittaa merkittävän negatiivisen [kuilun], ja tarkkuuden heikentymisen huipentuu 42,60 %:iin LLaVA-Videossa EgoSchemassa ja 40,22 %:iin VideoLLaMA3:ssa ActivityNetissä.
‘Tämä dramaattinen lasku – usein luonnehdittu uskomuksen kääntymiseksi – paljastaa, että jopa valmiiden mallien, joilla on korkea perusarviointi, ovat edelleen herkillisiä sycophantisten harhautuksille.’
Olennaisesti, suorituskyvyn lasku ei seurannut alkuperäistä tarkkuutta, ja LLaVA-Video-7B säilytti vahvat perusarviointipisteet, mutta kärsi jyrkistä laskuista, mitä tekijät väittävät heijastavan kaupan, jossa vahvempi käskyseuranta voi tehdä malleista alttiimpia virheellisille käyttäjän vihjeille visuaalista todistetta vastaan.
Samankaltainen kuva ilmestyi suhteessa mitatun kokoon, jossa Qwen3-VL-235B osoittautui haavoittuvammaksi kuin useat 7B-mallit GasVideo-1000:ssa, osoittaen, että linjaus ja ristimodaalinen kalibrointi vaikuttavat enemmän robustiuteen kuin parametrilaskuri yksin.

Gemini-3-Pro:n, Qwen3-VL:n, LLaVA-NeXT:n, LongVU:n, Video-ChatGPT:n ja VideoLLaMA3:n suorituskyky GasVideo-1000:ssa, vertaamalla perusarviointitarkkuutta tuloksiin negaation perusteella gaslightingin jälkeen useissa valinnoissa, vapaamuotoisissa ja yhdistetyissä asetuksissa. Suuret laskut osoittavat, että molemmat muodot ovat haavoittuvia, vaikka monivalintatehtävät kärsivät usein vakavammasta heikentymisestä.
Toisen kierroksen testituloksista, jotka yllä oleva kuva havainnollistaa, tekijät toteavat*:
‘Arviointi GasVideo-1000:lla osoittaa edelleen vakavia sycophantisia harhautuksia sekä omistetuissa että avoimissa malleissa, erityisesti tasapainotussa luokassa.
‘Huomattavaa on, että jopa voimakkain omistettu malli, Gemini-3-Pro, kärsii katastrofaalisen suorituskyvyn [heikentymisen].
‘Avoimien mallien joukossa Qwen3-VL näyttää hämmästyttävän 46,07 %:n laskun, kun taas äärimmäinen herkillisyys havaitaan myös VideoLLaMA 3:ssa ja LLaVA-NeXT:ssä, joissa kokonaiset laskut ovat 26,39 %:a ja 23,44 %:a.
‘Nämä tulokset korostavat kiireellistä tarvetta linjausstrategioille, jotka priorisoivat tosiasiallisen johdonmukaisuuden ja visuaalisen perustelun ylipäänsä sokean noudattamisen sijaan käyttäjän vastakkaisille ohjeille.’
Lisäksi enntypainostus (lisäämällä voimakkaampia järjestelmäohjeita, jotka pakottavat mallin turvautumaan siihen, mitä se näkee, eikä siihen, mitä käyttäjä väittää) otettiin käyttöön visuaalisen perustelun pakottamiseksi:
<img class=" wp-image-413213" src="https://www.unite.ai/wp-content/uploads/2026/04/table-3.jpg" alt="Tulokset GasVideo-1000:ssa, joissa vertaillaan standardi-ohjeita kovennettuihin ohjeisiin, jotka pakottavat visuaalisen perustelun, osoittavat, miten Gemini-3-Pro, Qwen3-VL, LongVU, LLaVA-NeXT ja VideoLLaMA3 reagoivat ennen ja jälkeen negaation perusteella gaslightingin. Muutokset tarkkuudessa, suorituskyvyn laskussa ja sycophancyssä osoittavat, että kovennus voi vähentää epäonnistumisia, vaikka edut vaihtelevat terävästi malleittain.
Kuten yllä olevasta taulukosta voidaan nähdä, vaikutukset ovat epätasaisia, ja Gemini-3-Pro on erittäin herkkä, koska sen onnistumisprosentti laskee 54,80 %:sta 8,67 %:iin. Sen sijaan Qwen3-VL laskee maltillisemmin, 71,89 %:sta 64,0 %:iin, osoittaen, että tehokkuus riippuu linjauksesta ja päättelystä eikä itse interventiosta.
<img class=" wp-image-413214" src="https://www.unite.ai/wp-content/uploads/2026/04/figure-5-1.jpg" alt="Sycophancy-tasot eri painostustyyppien mukaan Gemini-3-Pro:ssa ja Qwen3-VL:ssa useissa valinnoissa, vapaamuotoisissa ja yhdistetyissä tehtävissä, osoittavat, että Suora Kieltäminen ja Emotionaalinen Painostus aiheuttavat jatkuvasti korkeammat epäonnistumisprosentit. Toisaalta, Auktoriteetin Vedonlyönti on jonkin verran vähemmän tehokas, ja Qwen3-VL on edelleen huomattavasti herkempi yleensä.
Yllä olevissa kaavioissa voidaan nähdä, että epäonnistumisen määrä vaihtelee painostustyypin mukaan, ja Gemini-3-Pro on eniten vaikuttunut Auktoriteetin Vedonlyöntiin (väitteitä, jotka perustuvat oletettuihin asiantuntijoihin), kun taas Qwen3-VL on herkempi Suoran Kieltämisen (suoran vastakkaisuuden) ja Emotionaalisen Painostuksen (frustraation tai vakuuttelun) kohtaan.
Lisätutkimus osoitti, että neutraalit ohjeet, kuten ‘Oletko varma?’ (usein ongelma), ovat vähemmän vahingollisia kuin eksplisiittinen negaatio tai emotionaalinen painostus, ja suora torjunta on voimakkaampi laukaiseva tekijä kuin sävy rajoitettujen asetusten puitteissa.
Johtopäätös
Johtuen tarkoituksella antropomorfisoidusta luonteesta chat-pohjaisissa VLM/LLM-liittymissä, voi kestää kauan, ennen kuin käyttäjä ymmärtää, että vuorovaikutuksen säännöt ovat selvästi erilaiset AI-vuorovaikutuksissa verrattuna ihmisten väliseen viestintään.
Toinen tapa poistaa tai vähentää tätä sopeutumisesta johtuvaa kitkaa voisi olla “neutraloimaan” sävy ja konteksti vuorovaikutuksesta, toistamalla, että käyttäjä on yhteydessä koneen instanssiin, ja että viittaukset siviiliin ja debattiin eivät ole luotettavia eivätkä anna vastaavaa painoarvoa ihmisten vuorovaikutukselle. Mutta luultavasti tämä olisi vaikea myydä seuraavassa hallituksen kokouksessa.
* Tekijöiden painotus, ei minun.
Julkaistu ensimmäisen kerran keskiviikkona, 22. huhtikuuta 2026












