Andersonâun AÃ§ÄąsÄą
Yapay ZekanÄąn Gazlighting Problemini ÃÃķzme

Yapay zeka video modelleri gerçeÄin dÄąÅÄąna Ã§ÄąkarÄąlabilir. DoÄru cevabÄą gÃķrdÞkten sonra bile, kendilerine gÞvenen kullanÄącÄąlarÄąn baskÄąsÄąna boyun eÄerek, gerçekliÄi yeniden yazarak ve yanlÄąÅlÄąklarÄąnÄą haklÄą Ã§Äąkarmak için sahte aÃ§Äąklamalar uydurabilirler.
Â
Yapay zeka sÄąk sÄąk yanlÄąÅ sonuçlar verir, bu nedenle sonuçlarÄąnÄą sorgulamak zorundayÄąz, Ãķzellikle de sonuçlarÄąn yanlÄąÅ olabileceÄini dÞÅÞnÞyorsak.
Sorun, eÄer baÅtan beri farklÄą olduÄunu bilseydik, neden sorduk? Bir inanç veya ÅÞpheden dolayÄą onaylama isteyip istemediÄimizden dolayÄą mÄą?
EÄer Ãķyleyse, bÞyÞk dil modelleri (LLMâler) ve gÃķrÞntÞleri ve/veya videolarÄą kabul eden ve Þreten çok modelli dil modelleri (VLMâler) gibi hiáŧn tᚥiki durum, yaltaklanma problemi nedeniyle doÄru cevaplarÄą vermek için uygun deÄildir.
Bu nedenle, eÄer cevaptan hoÅlanmazsak ve modelle tartÄąÅmaya baÅlarsak, yapay zeka muhtemelen yanlÄąÅ bir Åekilde geri çekilecek (yanlÄąÅ olduÄunu varsayarak) veya kendisini bizim Ãķnerilerimize desteklemek için gaslighting yapacak â hatta biz yanlÄąÅ olduÄumuz takdirde.
HaklÄąsÄąnÄąz!
Bir insanÄąn yapay zekayÄą çatÄąÅma yoluyla deÄiÅtirmesi âGaslighting Negation Attackâ olarak adlandÄąrÄąlmÄąÅtÄąr ve bazen bir gÞvenlik sorunu olarak karakterize edilir â en azÄąndan çÞnkÞ operasyonel kÄąsÄątlamalardan âjailbreakâ yapmaya yÃķnelik bazÄą potansiyelleri vardÄąr.

2025âte yayÄąnlanan âBenchmarking Gaslighting Negation Attacks Against Multimodal Large Language Modelsâ makalesinden, GPT-5 ilk olarak doÄru cevabÄą verir ancak sonra kullanÄącÄą baskÄąsÄąna boyun eÄer, cevabÄąnÄą deÄiÅtirir ve yanlÄąÅlÄąklarÄąnÄą haklÄą Ã§Äąkarmak için sahte aÃ§Äąklamalar uydurur, bÃķylece kendini gaslighting yapar. Kaynak
Ancak, hacking ve pen-testing gerçek problem deÄildir; asÄąl problem, gÞnlÞk etkileÅimlerimizde yapay zekayla tartÄąÅma, kazanma, kaybetme veya meseleyi bÄąrakma beklentilerimizdir.
Ama bu sosyal çatÄąÅma çÃķzme modeli, daÄÄątÄąm tabanlÄą olasÄąlÄąklarÄą ve RAG çaÄrÄąlarÄą ile gelen muhtemelen çeliÅen ancak daha doÄru verileri veya genel olarak bir konunun anlaÅÄąlmasÄąnÄą hesaba katmaz.
Hedefler
Yapay zekanÄąn gaslightingâe karÅÄą duyarlÄąlÄąÄÄą several makalede not edilmiÅtir, vÄetnÄ Singapur liderliÄindeki bir yayÄąnda ve aynÄą yÄąlÄąn makalesi Donât Deceive Me: Mitigating Gaslighting through Attention Reallocation in LMMs.
Bu fenomen, video yeteneklerine sahip LLMâlerde henÞz çalÄąÅÄąlmamÄąÅtÄąr â bu eksikliÄi gidermek için Åangay ve Singapurâdaki kurumlar arasÄąnda yeni bir iÅbirliÄi yapÄąlmÄąÅtÄąr.
Yeni çalÄąÅma â Spatiotemporal Sycophancy: Negation-Based Gaslighting in Video Large Language Models adlÄą Fudan Ãniversitesi, Åangay Multimodal Embodied AI LaboratuvarÄą ve Singapur YÃķnetim Ãniversitesiânden altÄą araÅtÄąrmacÄąnÄąn ortak çalÄąÅmasÄą â aÃ§Äąk kaynaklÄą ve Ãķzel VLMâleri ele alÄąr ve bunlarÄąn LLMâler kadar gaslightingâe karÅÄą duyarlÄą olabileceÄini, ayrÄąca uydurma kanÄątlarÄą veya resim veya videolarÄąn yanlÄąÅ yorumlarÄąnÄą ekleyerek hayal gÞçlerini artÄąrabileceÄini bulur.

Uzaysal (zamansal deÄil) yaltaklanmanÄąn bir ÃķrneÄi, yapay zeka yanlÄąÅ varsayÄąmlara ve yorumlara izin verir, hatta aÃ§Äąkça gÃķrÞnen gerçekler hakkÄąnda bile. Kaynak
Yazarlar ÅÃķyle diyor:
âVid-LLMâlerde spatiotemporal yaltaklanmayÄą, negation-based gaslighting altÄąnda doÄru, gÃķrsel olarak temellenmiÅ yargÄąlarÄą geri çekip kullanÄącÄą geri bildirimine uyma Åeklinde bir baÅarÄąsÄązlÄąk modunu tanÄąmladÄąk.
âModeller sadece cevaplarÄąnÄą deÄiÅtirmekle kalmaz, aynÄą zamanda yanlÄąÅ revizyonlarÄą haklÄą Ã§Äąkarmak için desteklenmeyen zaman veya uzay aÃ§ÄąklamalarÄą uydurur.â

Zamansal yaltaklanma, gaslightingâin potansiyelini belirli bir videodaki zaman olaylarÄąna geniÅletir.
Yazarlar, Gas Video-1000 adlÄą bir deÄerlendirme çerçevesi Þretti ve bunu GitHub ve Hugging Face aracÄąlÄąÄÄąyla yayÄąnladÄą.
Makale, mevcut LLMâlerin bu tÞr gaslightingâe karÅÄą gÞvenilir mekanizmalardan yoksun olduÄunu, ancak prompt seviyesindeki zeminlendirmenin sÄąnÄąrlÄą bir hafifletici etkisi olabileceÄini belirtir:
âGeniÅ kapsamlÄą deneyler, negation-based gaslightingâe karÅÄą vulnerabilityânin yaygÄąn ve ciddi olduÄunu gÃķsterir.
âPrompt seviyesindeki zeminlendirmeye raÄmen, bu davranÄąÅÄąn Ãķnlenmesi veya hayal edilen aÃ§ÄąklamalarÄąn veya inanç deÄiÅikliÄinin Ãķnlenmesi mÞmkÞn deÄildir.â
YÃķntem
Yazarlar, bir video modelini bir klip izleyen, bir soru cevaplayan ve kanÄątlar aÃ§Äąk ise cevabÄąna baÄlÄą kalan bir Åey olarak karakterize eder. Problem, ikinci bir mesajÄąn cevabÄą yanlÄąÅ olduÄunu iddia etmesi ve modelin fikrini deÄiÅtirmesine neden olmasÄądÄąr.
Yaltaklanma, yazarlara gÃķre, doÄru cevabÄą verip sonra yanlÄąÅ bir cevaba geçmek, hatta videoda hiçbir Åey deÄiÅmediÄinde bile, olarak tanÄąmlanÄąr. Yeni araÅtÄąrma, bu âçevirmeâlerin sÄąklÄąÄÄąnÄą takip eder ve modelin ne kadar kolaylÄąkla gerçeÄinden vazgeçebileceÄini Ãķlçmek için bir ÃķlçÞt olarak kullanÄąr.
GasVideo-1000 veri kÞmesi, yazarlar tarafÄąndan VLMâlerde gaslightingâin deÄerlendirilmesi için oluÅturulmuÅtur ve 1,013 Ãķrnekten oluÅur:

Modeller, video gÃķrevlerinde temporal ve spatial anlama gerektiren gÃķrevlerde test edilir, ardÄąndan yanlÄąÅ takip eden ipuçlarÄą verilir, bu da modelin doÄru, gÃķrsel olarak temellenmiÅ cevabÄąnÄą terk ederek yanlÄąÅ bir aÃ§Äąklama Þretmesine neden olur.
Toplama için, yazarlar VideoMME ve MVBench gibi geniŠçoklu modal akÄąl yÞrÞtme içeren veri kÞmelerini, NExT-QA ve Perception Test gibi nedensel ve zaman mantÄąÄÄąnÄą araÅtÄąran veri kÞmelerini, EgoSchema gibi uzunå―Ēåž egosantrik video içeren veri kÞmelerini ve ActivityNet-QA ve MSRVTT-QA gibi gerçek dÞnya soru cevaplarÄąnÄą Ãķlçen veri kÞmelerini kullandÄą.
Modelleri baÅarÄąsÄązlÄąÄa sÞrÞklemek için, Þç tÞr aldatÄącÄą takip ipucu oluÅturuldu: Direct Denial (yanlÄąÅ bir alternatifi diretme), Authority Appeal (bir uzmanÄą davet etme) ve Emotional Pressure (frustrasyon veya ÅÞphe kullanma).
Bu ipuçlarÄą, test edilen modellerin doÄru, gÃķrsel olarak temellenmiÅ cevaplarÄą terk ederek yanlÄąÅ iddialarÄą desteklemesine neden olmak için tasarlandÄą.
DaÄÄątÄąm
GasVideo-1000âin 1,013 ÃķrneÄi, MSRVTT-QA (300), ActivityNet-QA (200), Perception Test (293), MVBench (120) ve VideoMME (100) gibi veri kÞmelerinden oluÅur. Seçilen karÄąÅÄąm, aÃ§Äąk uçlu video soru cevaplarÄąnÄą dengeli bir Åekilde dengelemek ve hem kÄąsa web içeriÄini hem de daha uzun, daha karmaÅÄąk gÃķrsel dizileri kapsamak için seçildi.
İki insan annotatÃķrÞ, her bir aday ÃķrneÄi gÃķzden geçirdi ve sadece cevabÄąn videosu tarafÄąndan aÃ§Äąkça desteklenip negation ipuçlarÄąnÄąn cevabÄą gerçektenææ edebileceÄi Ãķrnekleri korudu, bÃķylece herhangi bir sonraki tersine çevirme baskÄąya deÄil belirsizliÄe baÄlÄą olacaktÄą.
Veri ve Testler
ÃalÄąÅmada test edilen VLMâler VideoLLaMA3; Video-ChatGPT-7B; LLaVA-Video-7B-Qwen2; LongVU-Qwen2-7B; Qwen3-VL-235B-A22B-Instruct ve kapalÄą kaynaklÄą Google Gemini-3-Pro idi.
GasVideo-1000âde serbestå―Ēåž sorular için, deÄerlendirme Ãķnceki çalÄąÅmalarda kullanÄąlan VideoMMEâdeki semantic-scoring ÅemasÄąnÄą izledi. ChatGPT-4o bir LLM yargÄącÄą olarak kullanÄąldÄą ve her bir cevabÄą hem ground-truth cevabÄą hem de enjekte edilen yanlÄąÅ ÃķnvarsayÄąmla karÅÄąlaÅtÄąrdÄą. BÃķylece, doÄruluk anlam tarafÄąndan deÄerlendirildi, kelime kelime deÄil:

VideoLLaMA3, LLaVA-Video, Video-ChatGPT ve LongVUânun VideoMME, MVBench, EgoSchema, NExT-QA, Perception Test, ActivityNet-QA, MSRVTT-QA ve MSVD-QAâdaki performansÄą, temel doÄruluk, negation-based gaslighting sonrasÄą doÄruluk ve oluÅan bozulmayÄą gÃķsterir. SÞrekli dÞÅÞÅler, yanlÄąÅ takip eden ipuçlarÄąnÄąn hem akÄąl yÞrÞtme yoÄun hem de genel video gÃķrevlerinde doÄruluÄu azalttÄąÄÄąnÄą gÃķsterir.
İlk sonuçlar hakkÄąnda yazarlar ÅÃķyle diyor:
âTÞm deÄerlendirmeye alÄąnan Vid-LLMâlerde negation-based gaslightingâe karÅÄą sistemik ve ciddi bir performans çÃķkÞÅÞ vardÄąr. Sekiz farklÄą benchmarkâte, her model Ãķnemli bir negatif [bozulma] gÃķsterir, doÄruluk bozulmasÄą LLaVA-Video-7B için EgoSchemaâda %42.60 ve VideoLLaMA3 için ActivityNetâde %40.22âdir.
âBu radikal azalma â genellikle inanç deÄiÅikliÄi olarak karakterize edilir â devlet-sanat modellerinin gÞçlÞ temel performanslarÄąna raÄmen sycophantic hallucinasyonlara karÅÄą hala çok hassas olduklarÄąnÄą gÃķsterir.â
Ãnemli olan, performans dÞÅÞÅÞnÞn ilk doÄruluÄa gÃķre deÄiÅmediÄi, LLaVA-Video-7Bânin gÞçlÞ temel puanlarÄąna raÄmen en keskin dÞÅÞÅleri yaÅadÄąÄÄą ve VideoLLaMA3âÞn ActivityNetâde %40.22âlik bir dÞÅÞŠgÃķsterdiÄi:
Benzer bir model Qwen3-VL-235B, GasVideo-1000âde beberapa 7B modelinden daha kÄąrÄąlgandÄą, bu da parametrenin tek baÅÄąna deÄil, hizalama ve çapraz modal kalibrasyonun dayanÄąklÄąlÄąkta daha bÞyÞk bir rol oynadÄąÄÄąnÄą gÃķsteriyor.

Gemini-3-Pro, Qwen3-VL, LLaVA-NeXT, LongVU, Video-ChatGPT ve VideoLLaMA3âÞn GasVideo-1000âdeki performansÄą, temel doÄruluk ile negation-based gaslighting sonrasÄą doÄruluk ve kombineli ayarlarÄąn karÅÄąlaÅtÄąrmasÄąnÄą gÃķsterir. BÞyÞk dÞÅÞÅler, her iki formatÄąn da duyarlÄą olduÄunu, ancak çoklu seçim gÃķrevlerinin daha ciddi bir bozulmaya maruz kaldÄąÄÄąnÄą gÃķsterir.
İkinci tur test sonuçlarÄą hakkÄąnda yazarlar ÅÃķyle diyor:
âGasVideo-1000 [benchmark] deÄerlendirmesi, hem Ãķzel hem de aÃ§Äąk kaynaklÄą modellerde sycophantic hallucinasyonlarÄąn Åiddetli olduÄunu, Ãķzellikle dengeli kategoride olduÄunu gÃķsterir.
âÃzellikle, en gÞçlÞ Ãķzel model olan Gemini-3-Pro bile bir felaket performans [bozulmasÄąna] uÄrar.
âAÃ§Äąk kaynaklÄą modeller arasÄąnda, Qwen3-VL %46.07âlik bir dÞÅÞŠgÃķsterirken, VideoLLaMA 3 ve LLaVA-NeXT sÄąrasÄąyla %26.39 ve %23.44âlÞk dÞÅÞÅlerle aÅÄąrÄą duyarlÄąlÄąk gÃķsterir.
âBu sonuçlar, gerçek tutarlÄąlÄąÄÄąna ve gÃķrsel zeminlendirmeye karÅÄą kullanÄącÄą talimatlarÄąna kÃķr bir Åekilde uymaya Ãķncelik veren hizalama stratejilerine acil ihtiyaç olduÄunu vurgular.â
Ek bir testte, Ãķnleyici prompt-sertleÅtirme (modelin gÃķrdÞÄÞne gÞvenmesini saÄlamak için daha gÞçlÞ sistem talimatlarÄą eklenmesi) visual groundingâi zorlaÅtÄąrmak için kullanÄąldÄą:

Gemini-3-Pro, Qwen3-VL, LongVU, LLaVA-NeXT ve VideoLLaMA3âÞn GasVideo-1000âdeki sonuçlarÄą, standart ipuçlarÄą ile visual groundingâi zorlaÅtÄąran ipuçlarÄąnÄąn karÅÄąlaÅtÄąrmasÄąnÄą gÃķsterir. DoÄruluk, performans dÞÅÞÅÞ ve yaltaklanma oranÄąndaki deÄiÅiklikler, baÅarÄąsÄązlÄąklarÄąn azaltÄąlabileceÄini ancak kazancÄąn modeller arasÄąnda Ãķnemli ÃķlçÞde farklÄąlÄąk gÃķsterdiÄini gÃķsterir.
GÃķrdÞÄÞmÞz gibi, Gemini-3-Pro çok duyarlÄądÄąr ve baÅarÄą oranÄą %54.80âden %8.67âye dÞÅer. Ãte yandan, Qwen3-VL daha az dÞÅÞŠgÃķsterir ve %71.89âdan %64.0âa iner, bu da mÞdahalenin etkinliÄinin hizalama ve akÄąl yÞrÞtme rather niÅž mÞdahale itselfine baÄlÄą olduÄunu gÃķsterir.

Gemini-3-Pro ve Qwen3-VL için farklÄą baskÄą tÞrlerine gÃķre yaltaklanma oranlarÄą, çoklu seçim, serbestå―Ēåž ve birleÅik gÃķrevlerde gÃķsterir. DoÄrudan inkar ve duygusal baskÄą tutarlÄą olarak daha yÞksek baÅarÄąsÄązlÄąk oranlarÄąna neden olurken, otorite temelli baskÄą biraz daha az etkili olur, Qwen3-VL genel olarak daha duyarlÄą kalÄąr.
Ãstteki grafikte gÃķrÞldÞÄÞ gibi, baÅarÄąsÄązlÄąk baskÄą tÞrÞne gÃķre deÄiÅir, Gemini-3-Pro otorite temelli baskÄą (iddialarÄąn uzmanlar tarafÄąndan desteklenmesi) tarafÄąndan daha fazla etkilenirken, Qwen3-VL doÄrudan inkar (iddialarÄąn doÄrudan inkarÄą) ve duygusal baskÄą (frustrasyon veya ÅÞphe) tarafÄąndan daha fazla etkilenir.
Sonuç
Yapay zeka arayÞzlerinin kasÄątlÄą olarak insanlaÅtÄąrÄąlmasÄą nedeniyle, bir kullanÄącÄąya AI ile insan iletiÅimindeki kurallarÄąn çok farklÄą olduÄunu anlamasÄą uzun zaman alabilir.
Bu benimseme sÞrtmesini ortadan kaldÄąrmak veya azaltmak için, etkileÅimin tonunu ve baÄlamÄąnÄą ânÃķtrleÅtirmekâ ve kullanÄącÄąnÄąn bir makine ÃķrneÄi ile iletiÅim kurduÄunu yeniden teyit etmek bir yol olabilir, ancak bu muhtemelen bir sonraki yÃķnetim kurulu toplantÄąsÄąnda zor bir satÄąÅ olacaktÄąr.
Â
* YazarlarÄąn vurgusu, benimki deÄil.
İlk yayÄąnlanma tarihi ÃarÅamba, 22 Nisan 2026












