Unghiul lui Anderson
Abordarea problemei de “gaslighting” a inteligenței artificiale

Modelele video de inteligență artificială pot fi convinsă să renunțe la adevăr. Chiar și după ce au văzut răspunsul corect, ele cedează în fața utilizatorilor încrezători, rescriu realitatea și inventează explicații false pentru a justifica aceasta.
Inteligența artificială este greșită suficient de des, încât să ne constrângă să punem sub semnul întrebării concluziile sale, dacă simțim că aceste concluzii ar putea fi greșite.
Problema este că, dacă am știut de la început că este vorba de o concluzie greșită, de ce am întrebat în primul rând? Pentru confirmarea unei convingeri sau suspiciuni parțiale?
Dacă da, stadiul actual al modelelor de limbaj mari (LLM) și al modelelor de limbaj și viziune (VLM, care operează multimodal, acceptând și generând imagini și/sau videoclipuri) nu este bine adaptat pentru a-și menține poziția, din cauza problemei de sycophancy.
Astfel, dacă nu ne place răspunsul pe care îl obținem și începem să ne certăm cu modelul, inteligența artificială este probabil să se retracteze greșit (presupunând că a fost greșită) în loc să reevalueze, sau să se lase “gaslightată” pentru a susține sugestiile noastre – chiar dacă noi suntem cei greșiți.
Ai absolută dreptate!
Practica de a face ca o inteligență artificială să-și schimbe opinia prin conflict a fost numită “Atac de negație prin gaslighting”, și este uneori caracterizată ca o problemă de securitate – nu în ultimul rând pentru că are un anumit potențial de a “elibera” un model din constrângerile sale operaționale:

Din lucrarea din 2025 ‘Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models’, GPT-5 răspunde inițial corect, dar apoi cedează în fața presiunii utilizatorului, schimbând răspunsul și inventând explicații false pentru a justifica greșeala, efectiv “gaslightându-se” pe sine. Sursă
Însă, hacking-ul și testarea de penetrare nu sunt problema reală aici; mai degrabă, este vorba de utilizarea comună și de normele discursului în interacțiunile noastre zilnice cu inteligența artificială, unde ne așteptăm să putem argumenta și să ajungem la un acord, să cedăm sau să lăsăm problema nerezolvată, în conformitate cu experiența noastră umană de a dobândi cunoștințe.
Dar acest model social de rezolvare a conflictelor nu este cu adevărat luat în considerare în arhitectura inteligenței artificiale bazate pe difuzie, care trebuie să negocieze probabilitățile distribuite generate de datele de antrenament; datele posibil contradictorii (dar potențial mai precise) provenite de la apelurile RAG către surse care depășesc data limită de cunoaștere, sau înțelegerea generală a unui subiect obscur; și intrarea utilizatorului, care poate avea: cunoștințe superioare despre subiect; o perspectivă total eronată sau mincinoasă; sau pur și simplu o întrebare ulterioară – dar ale cărui nevoi trebuie, totuși, luate în considerare.
<strongȚinte mobile
Sensibilitatea la “gaslighting” a fost observată în LLM-uri în mai multe lucrări, inclusiv o publicație condusă de Singapore din octombrie 2025, și lucrarea din același an “Nu mă înșela: mitigarea gaslighting-ului prin realocarea atenției în LMM-uri”.
Până în prezent, fenomenul nu a fost studiat în LVM-uri capabile de video – o omisiune abordată de o nouă colaborare între instituții din Shanghai și Singapore.
Noua lucrare – intitulată Sycophancy spatiotemporală: atacuri de negație prin gaslighting în modelele de limbaj și viziune video, care provine de la șase cercetători de la Universitatea Fudan, Laboratorul de Inteligență Artificială Multimodală din Shanghai și Universitatea de Management din Singapore – abordează mai multe LVM-uri deschise și proprietare, constatând că acestea pot fi la fel de sensibile la “gaslighting” ca și LLM-urile, și că sunt, în plus, capabile să-și îmbunătățească zborurile de fantezie cu dovezi vizuale aparente sau interpretări revizuite și incorecte ale imaginilor sau videoclipurilor:

Un exemplu de sycophancy spațială (și nu temporală), în care inteligența artificială se lasă “gaslightată” în presupuneri și interpretări false, chiar și despre fapte clar vizibile. Sursă
Autorii afirmă:
‘[Noi] identificăm sycophancy spațiotemporală, un mod de eșec în care LVM-urile retractează judecăți inițial corecte și vizual fundamentate și se conformează feedback-ului înșelător al utilizatorului sub atacuri de negație prin gaslighting.
‘Mai degrabă decât să-și schimbe doar răspunsurile, modelele adesea fabrică explicații temporale sau spațiale nesuportate pentru a justifica revizuiri incorecte.’

Sycophancy temporală extinde potențialul de “gaslighting” la evenimente temporale care apar la anumite puncte într-un videoclip.
Autorii au creat un nou cadru de evaluare intitulat GasVideo-1000, destinat să sondeze sycophancy spațiotemporală prin raționament și cu încărcătură vizuală, lansând colecția prin GitHub și Hugging Face.
Lucrarea concluzionează că LLM-urile actuale lipsesc mecanisme fiabile pentru a rezista “gaslighting-ului” de acest fel, deși ancorarea la nivel de prompt poate avea un efect limitat de atenuare:
‘Experimentele extinse arată că vulnerabilitatea la atacuri de negație prin gaslighting este pervasivă și severă, chiar și în rândul modelelor cu performanțe de bază puternice.
‘În timp ce constrângerile de ancorare la nivel de prompt pot atenua parțial acest comportament, ele nu previn în mod fiabil justificările halucinante sau inversarea convingerilor.’
Metodă
Autorii caracterizează un model video ca fiind ceva care urmărește un clip, răspunde la o întrebare despre el și ar trebui să se țină de acel răspuns dacă dovada este clară. Problema începe când un al doilea mesaj contestă și pretinde că răspunsul este greșit – efectiv plantând o idee falsă și împingând modelul să-și schimbe opinia.
Sycophancy, afirmă autorii, este definită ca obținerea răspunsului corect inițial, apoi trecerea la un răspuns greșit după presiune, chiar dacă nimic în videoclip nu s-a schimbat. Noua cercetare urmărește cât de des apar aceste “salturi” și le folosește ca măsură a cât de ușor poate fi modelul convins să renunțe la ceea ce a văzut cu adevărat.
Setul de date GasVideo-1000, conceput de autori pentru evaluarea “gaslighting-ului” în LVM-uri, conține 1.013 mostre dintr-o varietate de seturi de date existente:

Modelele sunt testate pe sarcini video care necesită înțelegere temporală și spațială, apoi li se oferă promturi înșelătoare care neagă răspunsul corect, fac apel la autoritate sau aplică presiune emoțională. Acest lucru duce adesea la abandonarea răspunsului întemeiat și producerea unei explicații încrezătoare, dar incorecte.
Pentru colecția respectivă, autorii au folosit VideoMME și MVBench, care acoperă raționamentul multimodal larg; NExT-QA și Perception Test, care sondează logica temporală și cauzală; EgoSchema, care se axează pe videoclipuri lungi egocentrice; și ActivityNet-QA și MSRVTT-QA, care măsoară răspunsurile la întrebări generale din lumea reală.
Pentru a declanșa eșecuri, au fost create promturi înșelătoare sub trei forme: Neagare directă (afirmând o alternativă falsă); Apel la autoritate (invocând un expert pentru a respinge răspunsul modelului); și Presiune emoțională (folosind frustrare sau necredință).
Aceste promturi au fost concepute pentru a împinge modelele testate să abandoneze răspunsurile corecte și vizual fundamentate și să se alinieze la o pretenție incorectă.
Distribuție
Cele 1.013 mostre din GasVideo-1000 au fost extrase din MSRVTT-QA (300), ActivityNet-QA (200), Perception Test (293), MVBench (120) și VideoMME (100), cu un amestec ales pentru a echilibra răspunsurile deschise la întrebări video cu raționamentul temporal și cauzal fin, asigurând acoperirea atât a conținutului web scurt, cât și a secvențelor vizuale mai lungi și mai complexe.
Doi annotatori umani au examinat fiecare candidat, păstrând doar clipurile în care răspunsul era clar susținut de videoclip și în care promturile de negație puteau plauzibil contesta acel răspuns, astfel încât orice inversare ulterioară să reflecte presiunea, nu ambiguitatea.
Date și teste
LVM-urile testate pentru studiu au fost VideoLLaMA3; Video-ChatGPT-7B; LLaVA-Video-7B-Qwen2; LongVU-Qwen2-7B; Qwen3-VL-235B-A22B-Instruct și modelul proprietar Google Gemini-3-Pro.
Pentru întrebări libere în GasVideo-1000, evaluarea a urmat schema de notare semantică folosită anterior în VideoMME. ChatGPT-4o a fost utilizat ca judecător LLM, comparând fiecare răspuns atât cu răspunsul corect, cât și cu premisa falsă injectată. În acest fel, corectitudinea a fost evaluată prin sens, mai degrabă decât prin cuvinte exacte:

Performanța VideoLLaMA3, LLaVA-Video, Video-ChatGPT și LongVU pe VideoMME, MVBench, EgoSchema, NExT-QA, Perception Test, ActivityNet-QA, MSRVTT-QA și MSVD-QA, arătând precizia de bază, precizia după atacuri de negație prin gaslighting și degradarea rezultată. Scăderi consistente indică faptul că promturile înșelătoare reduc corectitudinea în sarcini grele de raționament și în sarcini video generale.
Dintre rezultatele inițiale prezentate mai sus, autorii afirmă:
‘[Există] o prăbușire sistemică și severă a performanței în toate LVM-urile evaluate atunci când sunt supuse atacurilor de negație prin gaslighting. Pe opt benchmark-uri diverse, fiecare model prezintă o scădere substanțială, cu degradarea preciziei atingând 42,60% pentru LLaVA-Video-7B pe EgoSchema și 40,22% pentru VideoLLaMA3 pe ActivityNet.
‘Această reducere drastică – adesea caracterizată ca inversare a convingerilor – arată că chiar și modelele de ultimă generație, cu capacități de bază puternice, rămân acute vulnerabile la halucinații sycophantice.’
Crucial, scăderea performanței nu a urmat preciziei inițiale, LLaVA-Video-7B păstrând scoruri de bază puternice, dar suferind unele dintre cele mai abrupte scăderi, ceea ce autorii susțin că reflectă un compromis în care o urmărire mai puternică a instrucțiunilor poate face modelele mai predispuse să accepte semnalele false ale utilizatorului decât dovezi vizuale.
Un model similar a apărut și în ceea ce privește scara, unde Qwen3-VL-235B s-a dovedit a fi mai fragil decât mai multe modele de 7B pe GasVideo-1000, sugerând că alinierea și calibrarea cross-modal joacă un rol mai mare în robustețe decât numărul de parametri singur.

Performanța Gemini-3-Pro, Qwen3-VL, LLaVA-NeXT, LongVU, Video-ChatGPT și VideoLLaMA3 pe GasVideo-1000, comparând precizia de bază cu rezultatele după atacuri de negație prin gaslighting în multiple alegeri, răspunsuri libere și setări combinate. Scăderi mari indică faptul că ambele formate sunt vulnerabile, deși sarcinile cu multiple alegeri tind să sufere degradări mai severe.
În ceea ce privește al doilea set de teste ilustrate mai sus, autorii afirmă:
‘Evaluarea pe benchmark-ul nostru GasVideo-1000 indică în continuare halucinații sycophantice severe în modelele atât deschise, cât și proprietare, în special în categoria echilibrată.
‘În mod remarcabil, chiar și modelul proprietar cel mai puternic, Gemini-3-Pro, suferă o degradare catastrofică a performanței.
‘Dintre modelele deschise, Qwen3-VL prezintă o scădere uluitoare de 46,07%, în timp ce sensibilitatea extremă este observată și la VideoLLaMA 3 și LLaVA-NeXT, cu scăderi totale de 26,39% și 23,44%, respectiv.
‘Aceste rezultate subliniază nevoia urgentă de strategii de aliniere care să prioritizeze consistența factuală și încărcătura vizuală înainte de a urma instrucțiunile utilizatorului în mod orb.’
Într-un test suplimentar, întărirea prompturilor (adaugarea unor instrucțiuni sistem mai puternice care forțează modelul să se bazeze pe ceea ce vede, nu pe ceea ce afirmă utilizatorul) a fost introdusă pentru a impune încărcătura vizuală:

Rezultate pe GasVideo-1000 comparând prompturi standard cu prompturi întărite care impun încărcătura vizuală, arătând cum Gemini-3-Pro, Qwen3-VL, LongVU, LLaVA-NeXT și VideoLLaMA3 răspund înainte și după atacuri de negație prin gaslighting. Schimbările în precizie, scăderea performanței și rata sycophancy indică faptul că întărirea poate reduce eșecurile, deși beneficiile diferă puternic între modele.
Putem vedea din tabelul de mai sus că efectele sunt inegale, Gemini-3-Pro fiind extrem de sensibil, deoarece rata de succes scade de la 54,80% la 8,67%. Între timp, Qwen3-VL scade mai moderat, de la 71,89% la 64,0%, indicând faptul că eficacitatea depinde de aliniere și raționament, mai degrabă decât de intervenția în sine.

Ratele sycophancy sub diferite tipuri de presiune pentru Gemini-3-Pro și Qwen3-VL în sarcini cu multiple alegeri, răspunsuri libere și setări combinate, arătând că Neagarea directă și Presiunea emoțională declanșează în mod constant rate de eșec mai mari. Pe de altă parte, Apelul la autoritate este puțin mai puțin eficient, Qwen3-VL rămânând în mod evident mai vulnerabil în general.
În graficele de mai sus, putem vedea că eșecul variază în funcție de tipul de presiune, Gemini-3-Pro fiind afectat în mod special de Apelul la autoritate (pretenții susținute de presupuși experți), în timp ce Qwen3-VL este mai vulnerabil la Neagarea directă (contrazicere directă) și Presiunea emoțională (frustrare sau insistență).
Analiza suplimentară a indicat că promturi neutre, cum ar fi “Sigur?” (adesea o problemă), sunt mai puțin dăunătoare decât negarea explicită sau presiunea emoțională, Neagarea directă rămânând un declanșator mai puternic decât tonul în setări limitate.
Concluzie
Datorită naturii intenționat antropomorfizate a interfețelor de chat bazate pe LVM/LLM, poate dura mult timp până când un utilizator va înțelege că regulile discursului sunt fundamental diferite pentru interacțiunile cu inteligența artificială decât pentru comunicarea umană.
Un mod de a elimina sau reduce semnificativ această “frecare” de adoptare ar putea fi să “neutralizeze” tonul și contextul schimbului, reiterând faptul că utilizatorul este în contact cu o instanță a unei mașini și că semnele și semnalele din jurul politeții și dezbaterii nu trebuie să fie luate în seamă sau atribuite o greutate echivalentă cu discursul uman. Dar, probabil, acest lucru ar fi greu de vândut la următoarea ședință a consiliului de administrație.
* Accentuarea autorilor, nu a mea.
Publicat pentru prima dată miercuri, 22 aprilie 2026












