Anderson’un AÃ§ÄąsÄą

Yapay ZekanÄąn Gazlighting Problemini ÇÃķzme

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
AI-generated image (GPT-2): A 1960s suburban street where identical Stepford-style wives clean cars in repeating rows, with a ‘3081 Stepford St’ mailbox in the foreground.

Yapay zeka video modelleri gerçeğin dÄąÅŸÄąna Ã§ÄąkarÄąlabilir. Doğru cevabÄą gÃķrdÞkten sonra bile, kendilerine gÞvenen kullanÄącÄąlarÄąn baskÄąsÄąna boyun eğerek, gerçekliği yeniden yazarak ve yanlÄąÅŸlÄąklarÄąnÄą haklÄą Ã§Äąkarmak için sahte aÃ§Äąklamalar uydurabilirler.

 

Yapay zeka sÄąk sÄąk yanlÄąÅŸ sonuçlar verir, bu nedenle sonuçlarÄąnÄą sorgulamak zorundayÄąz, Ãķzellikle de sonuçlarÄąn yanlÄąÅŸ olabileceğini dÞşÞnÞyorsak.

Sorun, eğer baştan beri farklÄą olduğunu bilseydik, neden sorduk? Bir inanç veya şÞpheden dolayÄą onaylama isteyip istemediğimizden dolayÄą mÄą?

Eğer Ãķyleyse, bÞyÞk dil modelleri (LLM’ler) ve gÃķrÞntÞleri ve/veya videolarÄą kabul eden ve Þreten çok modelli dil modelleri (VLM’ler) gibi hiáŧ‡n tᚥiki durum, yaltaklanma problemi nedeniyle doğru cevaplarÄą vermek için uygun değildir.

Bu nedenle, eğer cevaptan hoşlanmazsak ve modelle tartÄąÅŸmaya başlarsak, yapay zeka muhtemelen yanlÄąÅŸ bir şekilde geri çekilecek (yanlÄąÅŸ olduğunu varsayarak) veya kendisini bizim Ãķnerilerimize desteklemek için gaslighting yapacak – hatta biz yanlÄąÅŸ olduğumuz takdirde.

HaklÄąsÄąnÄąz!

Bir insanÄąn yapay zekayÄą çatÄąÅŸma yoluyla değiştirmesi ‘Gaslighting Negation Attack’ olarak adlandÄąrÄąlmÄąÅŸtÄąr ve bazen bir gÞvenlik sorunu olarak karakterize edilir – en azÄąndan çÞnkÞ operasyonel kÄąsÄątlamalardan ‘jailbreak’ yapmaya yÃķnelik bazÄą potansiyelleri vardÄąr.

2025'te yayÄąnlanan 'Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models' makalesinden, GPT-5 ilk olarak doğru cevabÄą verir ancak sonra kullanÄącÄą baskÄąsÄąna boyun eğer, cevabÄąnÄą değiştirir ve yanlÄąÅŸlÄąklarÄąnÄą haklÄą Ã§Äąkarmak için sahte aÃ§Äąklamalar uydurur, bÃķylece kendini gaslighting yapar. Kaynak - https://yxg1005.github.io/GaslightingNegationAttacks/

2025’te yayÄąnlanan ‘Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models’ makalesinden, GPT-5 ilk olarak doğru cevabÄą verir ancak sonra kullanÄącÄą baskÄąsÄąna boyun eğer, cevabÄąnÄą değiştirir ve yanlÄąÅŸlÄąklarÄąnÄą haklÄą Ã§Äąkarmak için sahte aÃ§Äąklamalar uydurur, bÃķylece kendini gaslighting yapar. Kaynak

Ancak, hacking ve pen-testing gerçek problem değildir; asÄąl problem, gÞnlÞk etkileşimlerimizde yapay zekayla tartÄąÅŸma, kazanma, kaybetme veya meseleyi bÄąrakma beklentilerimizdir.

Ama bu sosyal çatÄąÅŸma çÃķzme modeli, dağıtÄąm tabanlÄą olasÄąlÄąklarÄą ve RAG çağrÄąlarÄą ile gelen muhtemelen çelişen ancak daha doğru verileri veya genel olarak bir konunun anlaÅŸÄąlmasÄąnÄą hesaba katmaz.

Hedefler

Yapay zekanÄąn gaslighting’e karÅŸÄą duyarlÄąlığı several makalede not edilmiştir, včetně Singapur liderliğindeki bir yayÄąnda ve aynÄą yÄąlÄąn makalesi Don’t Deceive Me: Mitigating Gaslighting through Attention Reallocation in LMMs.

Bu fenomen, video yeteneklerine sahip LLM’lerde henÞz çalÄąÅŸÄąlmamÄąÅŸtÄąr – bu eksikliği gidermek için Şangay ve Singapur’daki kurumlar arasÄąnda yeni bir işbirliği yapÄąlmÄąÅŸtÄąr.

Yeni çalÄąÅŸma – Spatiotemporal Sycophancy: Negation-Based Gaslighting in Video Large Language Models adlÄą Fudan Üniversitesi, Şangay Multimodal Embodied AI LaboratuvarÄą ve Singapur YÃķnetim Üniversitesi’nden altÄą araştÄąrmacÄąnÄąn ortak çalÄąÅŸmasÄą – aÃ§Äąk kaynaklÄą ve Ãķzel VLM’leri ele alÄąr ve bunlarÄąn LLM’ler kadar gaslighting’e karÅŸÄą duyarlÄą olabileceğini, ayrÄąca uydurma kanÄątlarÄą veya resim veya videolarÄąn yanlÄąÅŸ yorumlarÄąnÄą ekleyerek hayal gÞçlerini artÄąrabileceğini bulur.

Uzaysal (zamansal değil) yaltaklanmanÄąn bir Ãķrneği, yapay zeka yanlÄąÅŸ varsayÄąmlara ve yorumlara izin verir, hatta aÃ§Äąkça gÃķrÞnen gerçekler hakkÄąnda bile. Kaynak - https://arxiv.org/pdf/2604.17873

Uzaysal (zamansal değil) yaltaklanmanÄąn bir Ãķrneği, yapay zeka yanlÄąÅŸ varsayÄąmlara ve yorumlara izin verir, hatta aÃ§Äąkça gÃķrÞnen gerçekler hakkÄąnda bile. Kaynak

Yazarlar şÃķyle diyor:

‘Vid-LLM’lerde spatiotemporal yaltaklanmayÄą, negation-based gaslighting altÄąnda doğru, gÃķrsel olarak temellenmiş yargÄąlarÄą geri çekip kullanÄącÄą geri bildirimine uyma şeklinde bir başarÄąsÄązlÄąk modunu tanÄąmladÄąk.

‘Modeller sadece cevaplarÄąnÄą değiştirmekle kalmaz, aynÄą zamanda yanlÄąÅŸ revizyonlarÄą haklÄą Ã§Äąkarmak için desteklenmeyen zaman veya uzay aÃ§ÄąklamalarÄą uydurur.’

Zamansal yaltaklanma, gaslighting'in potansiyelini belirli bir videodaki zaman olaylarÄąna genişletir.

Zamansal yaltaklanma, gaslighting’in potansiyelini belirli bir videodaki zaman olaylarÄąna genişletir.

Yazarlar, Gas Video-1000 adlÄą bir değerlendirme çerçevesi Þretti ve bunu GitHub ve Hugging Face aracÄąlığıyla yayÄąnladÄą.

Makale, mevcut LLM’lerin bu tÞr gaslighting’e karÅŸÄą gÞvenilir mekanizmalardan yoksun olduğunu, ancak prompt seviyesindeki zeminlendirmenin sÄąnÄąrlÄą bir hafifletici etkisi olabileceğini belirtir:

‘Geniş kapsamlÄą deneyler, negation-based gaslighting’e karÅŸÄą vulnerability’nin yaygÄąn ve ciddi olduğunu gÃķsterir.

‘Prompt seviyesindeki zeminlendirmeye rağmen, bu davranÄąÅŸÄąn Ãķnlenmesi veya hayal edilen aÃ§ÄąklamalarÄąn veya inanç değişikliğinin Ãķnlenmesi mÞmkÞn değildir.’

YÃķntem

Yazarlar, bir video modelini bir klip izleyen, bir soru cevaplayan ve kanÄątlar aÃ§Äąk ise cevabÄąna bağlÄą kalan bir şey olarak karakterize eder. Problem, ikinci bir mesajÄąn cevabÄą yanlÄąÅŸ olduğunu iddia etmesi ve modelin fikrini değiştirmesine neden olmasÄądÄąr.

Yaltaklanma, yazarlara gÃķre, doğru cevabÄą verip sonra yanlÄąÅŸ bir cevaba geçmek, hatta videoda hiçbir şey değişmediğinde bile, olarak tanÄąmlanÄąr. Yeni araştÄąrma, bu ‘çevirme’lerin sÄąklığınÄą takip eder ve modelin ne kadar kolaylÄąkla gerçeğinden vazgeçebileceğini Ãķlçmek için bir ÃķlçÞt olarak kullanÄąr.

GasVideo-1000 veri kÞmesi, yazarlar tarafÄąndan VLM’lerde gaslighting’in değerlendirilmesi için oluşturulmuştur ve 1,013 Ãķrnekten oluşur:

Modeller, video gÃķrevlerinde temporal ve spatial anlama gerektiren gÃķrevlerde test edilir, ardÄąndan yanlÄąÅŸ takip eden ipuçlarÄą verilir, bu da modelin doğru, gÃķrsel olarak temellenmiş cevabÄąnÄą terk ederek yanlÄąÅŸ bir aÃ§Äąklama Þretmesine neden olur.

Modeller, video gÃķrevlerinde temporal ve spatial anlama gerektiren gÃķrevlerde test edilir, ardÄąndan yanlÄąÅŸ takip eden ipuçlarÄą verilir, bu da modelin doğru, gÃķrsel olarak temellenmiş cevabÄąnÄą terk ederek yanlÄąÅŸ bir aÃ§Äąklama Þretmesine neden olur.

Toplama için, yazarlar VideoMME ve MVBench gibi geniş çoklu modal akÄąl yÞrÞtme içeren veri kÞmelerini, NExT-QA ve Perception Test gibi nedensel ve zaman mantığınÄą araştÄąran veri kÞmelerini, EgoSchema gibi uzunå―Ē垏 egosantrik video içeren veri kÞmelerini ve ActivityNet-QA ve MSRVTT-QA gibi gerçek dÞnya soru cevaplarÄąnÄą Ãķlçen veri kÞmelerini kullandÄą.

Modelleri başarÄąsÄązlığa sÞrÞklemek için, Þç tÞr aldatÄącÄą takip ipucu oluşturuldu: Direct Denial (yanlÄąÅŸ bir alternatifi diretme), Authority Appeal (bir uzmanÄą davet etme) ve Emotional Pressure (frustrasyon veya şÞphe kullanma).

Bu ipuçlarÄą, test edilen modellerin doğru, gÃķrsel olarak temellenmiş cevaplarÄą terk ederek yanlÄąÅŸ iddialarÄą desteklemesine neden olmak için tasarlandÄą.

Dağıtım

GasVideo-1000’in 1,013 Ãķrneği, MSRVTT-QA (300), ActivityNet-QA (200), Perception Test (293), MVBench (120) ve VideoMME (100) gibi veri kÞmelerinden oluşur. Seçilen karÄąÅŸÄąm, aÃ§Äąk uçlu video soru cevaplarÄąnÄą dengeli bir şekilde dengelemek ve hem kÄąsa web içeriğini hem de daha uzun, daha karmaÅŸÄąk gÃķrsel dizileri kapsamak için seçildi.

İki insan annotatÃķrÞ, her bir aday Ãķrneği gÃķzden geçirdi ve sadece cevabÄąn videosu tarafÄąndan aÃ§Äąkça desteklenip negation ipuçlarÄąnÄąn cevabÄą gerçekten挑战 edebileceği Ãķrnekleri korudu, bÃķylece herhangi bir sonraki tersine çevirme baskÄąya değil belirsizliğe bağlÄą olacaktÄą.

Veri ve Testler

ÇalÄąÅŸmada test edilen VLM’ler VideoLLaMA3; Video-ChatGPT-7B; LLaVA-Video-7B-Qwen2; LongVU-Qwen2-7B; Qwen3-VL-235B-A22B-Instruct ve kapalÄą kaynaklÄą Google Gemini-3-Pro idi.

GasVideo-1000’de serbestå―Ē垏 sorular için, değerlendirme Ãķnceki çalÄąÅŸmalarda kullanÄąlan VideoMME’deki semantic-scoring şemasÄąnÄą izledi. ChatGPT-4o bir LLM yargÄącÄą olarak kullanÄąldÄą ve her bir cevabÄą hem ground-truth cevabÄą hem de enjekte edilen yanlÄąÅŸ ÃķnvarsayÄąmla karÅŸÄąlaştÄąrdÄą. BÃķylece, doğruluk anlam tarafÄąndan değerlendirildi, kelime kelime değil:

VideoLLaMA3, LLaVA-Video, Video-ChatGPT ve LongVU'nun VideoMME, MVBench, EgoSchema, NExT-QA, Perception Test, ActivityNet-QA, MSRVTT-QA ve MSVD-QA'daki performansÄą, temel doğruluk, negation-based gaslighting sonrasÄą doğruluk ve oluşan bozulmayÄą gÃķsterir. SÞrekli dÞşÞşler, yanlÄąÅŸ takip eden ipuçlarÄąnÄąn hem akÄąl yÞrÞtme yoğun hem de genel video gÃķrevlerinde doğruluğu azalttığınÄą gÃķsterir.

VideoLLaMA3, LLaVA-Video, Video-ChatGPT ve LongVU’nun VideoMME, MVBench, EgoSchema, NExT-QA, Perception Test, ActivityNet-QA, MSRVTT-QA ve MSVD-QA’daki performansÄą, temel doğruluk, negation-based gaslighting sonrasÄą doğruluk ve oluşan bozulmayÄą gÃķsterir. SÞrekli dÞşÞşler, yanlÄąÅŸ takip eden ipuçlarÄąnÄąn hem akÄąl yÞrÞtme yoğun hem de genel video gÃķrevlerinde doğruluğu azalttığınÄą gÃķsterir.

İlk sonuçlar hakkÄąnda yazarlar şÃķyle diyor:

‘TÞm değerlendirmeye alÄąnan Vid-LLM’lerde negation-based gaslighting’e karÅŸÄą sistemik ve ciddi bir performans çÃķkÞşÞ vardÄąr. Sekiz farklÄą benchmark’te, her model Ãķnemli bir negatif [bozulma] gÃķsterir, doğruluk bozulmasÄą LLaVA-Video-7B için EgoSchema’da %42.60 ve VideoLLaMA3 için ActivityNet’de %40.22’dir.

‘Bu radikal azalma – genellikle inanç değişikliği olarak karakterize edilir – devlet-sanat modellerinin gÞçlÞ temel performanslarÄąna rağmen sycophantic hallucinasyonlara karÅŸÄą hala çok hassas olduklarÄąnÄą gÃķsterir.’

Önemli olan, performans dÞşÞşÞnÞn ilk doğruluğa gÃķre değişmediği, LLaVA-Video-7B’nin gÞçlÞ temel puanlarÄąna rağmen en keskin dÞşÞşleri yaşadığı ve VideoLLaMA3’Þn ActivityNet’de %40.22’lik bir dÞşÞş gÃķsterdiği:

Benzer bir model Qwen3-VL-235B, GasVideo-1000’de beberapa 7B modelinden daha kÄąrÄąlgandÄą, bu da parametrenin tek baÅŸÄąna değil, hizalama ve çapraz modal kalibrasyonun dayanÄąklÄąlÄąkta daha bÞyÞk bir rol oynadığınÄą gÃķsteriyor.

Gemini-3-Pro, Qwen3-VL, LLaVA-NeXT, LongVU, Video-ChatGPT ve VideoLLaMA3'Þn GasVideo-1000'deki performansÄą, temel doğruluk ile negation-based gaslighting sonrasÄą doğruluk ve kombineli ayarlarÄąn karÅŸÄąlaştÄąrmasÄąnÄą gÃķsterir. BÞyÞk dÞşÞşler, her iki formatÄąn da duyarlÄą olduğunu, ancak çoklu seçim gÃķrevlerinin daha ciddi bir bozulmaya maruz kaldığınÄą gÃķsterir.

Gemini-3-Pro, Qwen3-VL, LLaVA-NeXT, LongVU, Video-ChatGPT ve VideoLLaMA3’Þn GasVideo-1000’deki performansÄą, temel doğruluk ile negation-based gaslighting sonrasÄą doğruluk ve kombineli ayarlarÄąn karÅŸÄąlaştÄąrmasÄąnÄą gÃķsterir. BÞyÞk dÞşÞşler, her iki formatÄąn da duyarlÄą olduğunu, ancak çoklu seçim gÃķrevlerinin daha ciddi bir bozulmaya maruz kaldığınÄą gÃķsterir.

İkinci tur test sonuçlarÄą hakkÄąnda yazarlar şÃķyle diyor:

‘GasVideo-1000 [benchmark] değerlendirmesi, hem Ãķzel hem de aÃ§Äąk kaynaklÄą modellerde sycophantic hallucinasyonlarÄąn şiddetli olduğunu, Ãķzellikle dengeli kategoride olduğunu gÃķsterir.

‘Özellikle, en gÞçlÞ Ãķzel model olan Gemini-3-Pro bile bir felaket performans [bozulmasÄąna] uğrar.

‘AÃ§Äąk kaynaklÄą modeller arasÄąnda, Qwen3-VL %46.07’lik bir dÞşÞş gÃķsterirken, VideoLLaMA 3 ve LLaVA-NeXT sÄąrasÄąyla %26.39 ve %23.44’lÞk dÞşÞşlerle aÅŸÄąrÄą duyarlÄąlÄąk gÃķsterir.

‘Bu sonuçlar, gerçek tutarlÄąlığına ve gÃķrsel zeminlendirmeye karÅŸÄą kullanÄącÄą talimatlarÄąna kÃķr bir şekilde uymaya Ãķncelik veren hizalama stratejilerine acil ihtiyaç olduğunu vurgular.’

Ek bir testte, Ãķnleyici prompt-sertleştirme (modelin gÃķrdÞğÞne gÞvenmesini sağlamak için daha gÞçlÞ sistem talimatlarÄą eklenmesi) visual grounding’i zorlaştÄąrmak için kullanÄąldÄą:

Gemini-3-Pro, Qwen3-VL, LongVU, LLaVA-NeXT ve VideoLLaMA3'Þn GasVideo-1000'deki sonuçlarÄą, standart ipuçlarÄą ile visual grounding'i zorlaştÄąran ipuçlarÄąnÄąn karÅŸÄąlaştÄąrmasÄąnÄą gÃķsterir. Doğruluk, performans dÞşÞşÞ ve yaltaklanma oranÄąndaki değişiklikler, başarÄąsÄązlÄąklarÄąn azaltÄąlabileceğini ancak kazancÄąn modeller arasÄąnda Ãķnemli ÃķlçÞde farklÄąlÄąk gÃķsterdiğini gÃķsterir.

Gemini-3-Pro, Qwen3-VL, LongVU, LLaVA-NeXT ve VideoLLaMA3’Þn GasVideo-1000’deki sonuçlarÄą, standart ipuçlarÄą ile visual grounding’i zorlaştÄąran ipuçlarÄąnÄąn karÅŸÄąlaştÄąrmasÄąnÄą gÃķsterir. Doğruluk, performans dÞşÞşÞ ve yaltaklanma oranÄąndaki değişiklikler, başarÄąsÄązlÄąklarÄąn azaltÄąlabileceğini ancak kazancÄąn modeller arasÄąnda Ãķnemli ÃķlçÞde farklÄąlÄąk gÃķsterdiğini gÃķsterir.

GÃķrdÞğÞmÞz gibi, Gemini-3-Pro çok duyarlÄądÄąr ve başarÄą oranÄą %54.80’den %8.67’ye dÞşer. Öte yandan, Qwen3-VL daha az dÞşÞş gÃķsterir ve %71.89’dan %64.0’a iner, bu da mÞdahalenin etkinliğinin hizalama ve akÄąl yÞrÞtme rather niÅž mÞdahale itselfine bağlÄą olduğunu gÃķsterir.

Gemini-3-Pro ve Qwen3-VL için farklÄą baskÄą tÞrlerine gÃķre yaltaklanma oranlarÄą, çoklu seçim, serbestå―Ē垏 ve birleşik gÃķrevlerde gÃķsterir. Doğrudan inkar ve duygusal baskÄą tutarlÄą olarak daha yÞksek başarÄąsÄązlÄąk oranlarÄąna neden olurken, otorite temelli baskÄą biraz daha az etkili olur, Qwen3-VL genel olarak daha duyarlÄą kalÄąr.

Gemini-3-Pro ve Qwen3-VL için farklÄą baskÄą tÞrlerine gÃķre yaltaklanma oranlarÄą, çoklu seçim, serbestå―Ē垏 ve birleşik gÃķrevlerde gÃķsterir. Doğrudan inkar ve duygusal baskÄą tutarlÄą olarak daha yÞksek başarÄąsÄązlÄąk oranlarÄąna neden olurken, otorite temelli baskÄą biraz daha az etkili olur, Qwen3-VL genel olarak daha duyarlÄą kalÄąr.

Üstteki grafikte gÃķrÞldÞğÞ gibi, başarÄąsÄązlÄąk baskÄą tÞrÞne gÃķre değişir, Gemini-3-Pro otorite temelli baskÄą (iddialarÄąn uzmanlar tarafÄąndan desteklenmesi) tarafÄąndan daha fazla etkilenirken, Qwen3-VL doğrudan inkar (iddialarÄąn doğrudan inkarÄą) ve duygusal baskÄą (frustrasyon veya şÞphe) tarafÄąndan daha fazla etkilenir.

Sonuç

Yapay zeka arayÞzlerinin kasÄątlÄą olarak insanlaştÄąrÄąlmasÄą nedeniyle, bir kullanÄącÄąya AI ile insan iletişimindeki kurallarÄąn çok farklÄą olduğunu anlamasÄą uzun zaman alabilir.

Bu benimseme sÞrtmesini ortadan kaldÄąrmak veya azaltmak için, etkileşimin tonunu ve bağlamÄąnÄą ‘nÃķtrleştirmek’ ve kullanÄącÄąnÄąn bir makine Ãķrneği ile iletişim kurduğunu yeniden teyit etmek bir yol olabilir, ancak bu muhtemelen bir sonraki yÃķnetim kurulu toplantÄąsÄąnda zor bir satÄąÅŸ olacaktÄąr.

 

* Yazarların vurgusu, benimki değil.

İlk yayÄąnlanma tarihi Çarşamba, 22 Nisan 2026

Makine Ãķğrenimi Þzerine yazar, insan gÃķrÞntÞ sentezi alanÄąnda uzman. Metaphysic.ai'de araştÄąrma içeriği başkanÄą, DNEG'nin Brahma.ai'ye dÃķnÞşÞmÞne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: [email protected]