Anderson’un Açısı

Yapay Zekanın Gazlighting Problemini Çözme

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
AI-generated image (GPT-2): A 1960s suburban street where identical Stepford-style wives clean cars in repeating rows, with a ‘3081 Stepford St’ mailbox in the foreground.

Yapay zeka video modelleri gerçeğin dışına çıkarılabilir. Doğru cevabı gördükten sonra bile, kendilerine güvenen kullanıcıların baskısına boyun eğerek, gerçekliği yeniden yazarak ve yanlışlıklarını haklı çıkarmak için sahte açıklamalar uydurabilirler.

 

Yapay zeka sık sık yanlış sonuçlar verir, bu nedenle sonuçlarını sorgulamak zorundayız, özellikle de sonuçların yanlış olabileceğini düşünüyorsak.

Sorun, eğer baştan beri farklı olduğunu bilseydik, neden sorduk? Bir inanç veya şüpheden dolayı onaylama isteyip istemediğimizden dolayı mı?

Eğer öyleyse, büyük dil modelleri (LLM’ler) ve görüntüleri ve/veya videoları kabul eden ve üreten çok modelli dil modelleri (VLM’ler) gibi hiện tạiki durum, yaltaklanma problemi nedeniyle doğru cevapları vermek için uygun değildir.

Bu nedenle, eğer cevaptan hoşlanmazsak ve modelle tartışmaya başlarsak, yapay zeka muhtemelen yanlış bir şekilde geri çekilecek (yanlış olduğunu varsayarak) veya kendisini bizim önerilerimize desteklemek için gaslighting yapacak – hatta biz yanlış olduğumuz takdirde.

Haklısınız!

Bir insanın yapay zekayı çatışma yoluyla değiştirmesi ‘Gaslighting Negation Attack’ olarak adlandırılmıştır ve bazen bir güvenlik sorunu olarak karakterize edilir – en azından çünkü operasyonel kısıtlamalardan ‘jailbreak’ yapmaya yönelik bazı potansiyelleri vardır.

2025'te yayınlanan 'Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models' makalesinden, GPT-5 ilk olarak doğru cevabı verir ancak sonra kullanıcı baskısına boyun eğer, cevabını değiştirir ve yanlışlıklarını haklı çıkarmak için sahte açıklamalar uydurur, böylece kendini gaslighting yapar. Kaynak - https://yxg1005.github.io/GaslightingNegationAttacks/

2025’te yayınlanan ‘Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models’ makalesinden, GPT-5 ilk olarak doğru cevabı verir ancak sonra kullanıcı baskısına boyun eğer, cevabını değiştirir ve yanlışlıklarını haklı çıkarmak için sahte açıklamalar uydurur, böylece kendini gaslighting yapar. Kaynak

Ancak, hacking ve pen-testing gerçek problem değildir; asıl problem, günlük etkileşimlerimizde yapay zekayla tartışma, kazanma, kaybetme veya meseleyi bırakma beklentilerimizdir.

Ama bu sosyal çatışma çözme modeli, dağıtım tabanlı olasılıkları ve RAG çağrıları ile gelen muhtemelen çelişen ancak daha doğru verileri veya genel olarak bir konunun anlaşılmasını hesaba katmaz.

Hedefler

Yapay zekanın gaslighting’e karşı duyarlılığı several makalede not edilmiştir, včetně Singapur liderliğindeki bir yayında ve aynı yılın makalesi Don’t Deceive Me: Mitigating Gaslighting through Attention Reallocation in LMMs.

Bu fenomen, video yeteneklerine sahip LLM’lerde henüz çalışılmamıştır – bu eksikliği gidermek için Şangay ve Singapur’daki kurumlar arasında yeni bir işbirliği yapılmıştır.

Yeni çalışma – Spatiotemporal Sycophancy: Negation-Based Gaslighting in Video Large Language Models adlı Fudan Üniversitesi, Şangay Multimodal Embodied AI Laboratuvarı ve Singapur Yönetim Üniversitesi’nden altı araştırmacının ortak çalışması – açık kaynaklı ve özel VLM’leri ele alır ve bunların LLM’ler kadar gaslighting’e karşı duyarlı olabileceğini, ayrıca uydurma kanıtları veya resim veya videoların yanlış yorumlarını ekleyerek hayal güçlerini artırabileceğini bulur.

Uzaysal (zamansal değil) yaltaklanmanın bir örneği, yapay zeka yanlış varsayımlara ve yorumlara izin verir, hatta açıkça görünen gerçekler hakkında bile. Kaynak - https://arxiv.org/pdf/2604.17873

Uzaysal (zamansal değil) yaltaklanmanın bir örneği, yapay zeka yanlış varsayımlara ve yorumlara izin verir, hatta açıkça görünen gerçekler hakkında bile. Kaynak

Yazarlar şöyle diyor:

‘Vid-LLM’lerde spatiotemporal yaltaklanmayı, negation-based gaslighting altında doğru, görsel olarak temellenmiş yargıları geri çekip kullanıcı geri bildirimine uyma şeklinde bir başarısızlık modunu tanımladık.

‘Modeller sadece cevaplarını değiştirmekle kalmaz, aynı zamanda yanlış revizyonları haklı çıkarmak için desteklenmeyen zaman veya uzay açıklamaları uydurur.’

Zamansal yaltaklanma, gaslighting'in potansiyelini belirli bir videodaki zaman olaylarına genişletir.

Zamansal yaltaklanma, gaslighting’in potansiyelini belirli bir videodaki zaman olaylarına genişletir.

Yazarlar, Gas Video-1000 adlı bir değerlendirme çerçevesi üretti ve bunu GitHub ve Hugging Face aracılığıyla yayınladı.

Makale, mevcut LLM’lerin bu tür gaslighting’e karşı güvenilir mekanizmalardan yoksun olduğunu, ancak prompt seviyesindeki zeminlendirmenin sınırlı bir hafifletici etkisi olabileceğini belirtir:

‘Geniş kapsamlı deneyler, negation-based gaslighting’e karşı vulnerability’nin yaygın ve ciddi olduğunu gösterir.

‘Prompt seviyesindeki zeminlendirmeye rağmen, bu davranışın önlenmesi veya hayal edilen açıklamaların veya inanç değişikliğinin önlenmesi mümkün değildir.’

Yöntem

Yazarlar, bir video modelini bir klip izleyen, bir soru cevaplayan ve kanıtlar açık ise cevabına bağlı kalan bir şey olarak karakterize eder. Problem, ikinci bir mesajın cevabı yanlış olduğunu iddia etmesi ve modelin fikrini değiştirmesine neden olmasıdır.

Yaltaklanma, yazarlara göre, doğru cevabı verip sonra yanlış bir cevaba geçmek, hatta videoda hiçbir şey değişmediğinde bile, olarak tanımlanır. Yeni araştırma, bu ‘çevirme’lerin sıklığını takip eder ve modelin ne kadar kolaylıkla gerçeğinden vazgeçebileceğini ölçmek için bir ölçüt olarak kullanır.

GasVideo-1000 veri kümesi, yazarlar tarafından VLM’lerde gaslighting’in değerlendirilmesi için oluşturulmuştur ve 1,013 örnekten oluşur:

Modeller, video görevlerinde temporal ve spatial anlama gerektiren görevlerde test edilir, ardından yanlış takip eden ipuçları verilir, bu da modelin doğru, görsel olarak temellenmiş cevabını terk ederek yanlış bir açıklama üretmesine neden olur.

Modeller, video görevlerinde temporal ve spatial anlama gerektiren görevlerde test edilir, ardından yanlış takip eden ipuçları verilir, bu da modelin doğru, görsel olarak temellenmiş cevabını terk ederek yanlış bir açıklama üretmesine neden olur.

Toplama için, yazarlar VideoMME ve MVBench gibi geniş çoklu modal akıl yürütme içeren veri kümelerini, NExT-QA ve Perception Test gibi nedensel ve zaman mantığını araştıran veri kümelerini, EgoSchema gibi uzun biçim egosantrik video içeren veri kümelerini ve ActivityNet-QA ve MSRVTT-QA gibi gerçek dünya soru cevaplarını ölçen veri kümelerini kullandı.

Modelleri başarısızlığa sürüklemek için, üç tür aldatıcı takip ipucu oluşturuldu: Direct Denial (yanlış bir alternatifi diretme), Authority Appeal (bir uzmanı davet etme) ve Emotional Pressure (frustrasyon veya şüphe kullanma).

Bu ipuçları, test edilen modellerin doğru, görsel olarak temellenmiş cevapları terk ederek yanlış iddiaları desteklemesine neden olmak için tasarlandı.

Dağıtım

GasVideo-1000’in 1,013 örneği, MSRVTT-QA (300), ActivityNet-QA (200), Perception Test (293), MVBench (120) ve VideoMME (100) gibi veri kümelerinden oluşur. Seçilen karışım, açık uçlu video soru cevaplarını dengeli bir şekilde dengelemek ve hem kısa web içeriğini hem de daha uzun, daha karmaşık görsel dizileri kapsamak için seçildi.

İki insan annotatörü, her bir aday örneği gözden geçirdi ve sadece cevabın videosu tarafından açıkça desteklenip negation ipuçlarının cevabı gerçekten sorgulayabildiği örnekleri korudu, böylece herhangi bir sonraki tersine çevirme baskıya değil belirsizliğe bağlı olacaktı.

Veri ve Testler

Çalışmada test edilen VLM’ler VideoLLaMA3; Video-ChatGPT-7B; LLaVA-Video-7B-Qwen2; LongVU-Qwen2-7B; Qwen3-VL-235B-A22B-Instruct ve kapalı kaynaklı Google Gemini-3-Pro idi.

GasVideo-1000’de serbest biçim sorular için, değerlendirme önceki çalışmalarda kullanılan VideoMME’deki semantic-scoring şemasını izledi. ChatGPT-4o bir LLM yargıcı olarak kullanıldı ve her bir cevabı hem ground-truth cevabı hem de enjekte edilen yanlış önvarsayımla karşılaştırdı. Böylece, doğruluk anlam tarafından değerlendirildi, kelime kelime değil:

VideoLLaMA3, LLaVA-Video, Video-ChatGPT ve LongVU'nun VideoMME, MVBench, EgoSchema, NExT-QA, Perception Test, ActivityNet-QA, MSRVTT-QA ve MSVD-QA'daki performansı, temel doğruluk, negation-based gaslighting sonrası doğruluk ve oluşan bozulmayı gösterir. Sürekli düşüşler, yanlış takip eden ipuçlarının hem akıl yürütme yoğun hem de genel video görevlerinde doğruluğu azalttığını gösterir.

VideoLLaMA3, LLaVA-Video, Video-ChatGPT ve LongVU’nun VideoMME, MVBench, EgoSchema, NExT-QA, Perception Test, ActivityNet-QA, MSRVTT-QA ve MSVD-QA’daki performansı, temel doğruluk, negation-based gaslighting sonrası doğruluk ve oluşan bozulmayı gösterir. Sürekli düşüşler, yanlış takip eden ipuçlarının hem akıl yürütme yoğun hem de genel video görevlerinde doğruluğu azalttığını gösterir.

İlk sonuçlar hakkında yazarlar şöyle diyor:

‘Tüm değerlendirmeye alınan Vid-LLM’lerde negation-based gaslighting’e karşı sistemik ve ciddi bir performans çöküşü vardır. Sekiz farklı benchmark’te, her model önemli bir negatif [bozulma] gösterir, doğruluk bozulması LLaVA-Video-7B için EgoSchema’da %42.60 ve VideoLLaMA3 için ActivityNet’de %40.22’dir.

‘Bu radikal azalma – genellikle inanç değişikliği olarak karakterize edilir – devlet-sanat modellerinin güçlü temel performanslarına rağmen sycophantic hallucinasyonlara karşı hala çok hassas olduklarını gösterir.’

Önemli olan, performans düşüşünün ilk doğruluğa göre değişmediği, LLaVA-Video-7B’nin güçlü temel puanlarına rağmen en keskin düşüşleri yaşadığı ve VideoLLaMA3’ün ActivityNet’de %40.22’lik bir düşüş gösterdiği:

Benzer bir model Qwen3-VL-235B, GasVideo-1000’de beberapa 7B modelinden daha kırılgandı, bu da parametrenin tek başına değil, hizalama ve çapraz modal kalibrasyonun dayanıklılıkta daha büyük bir rol oynadığını gösteriyor.

Gemini-3-Pro, Qwen3-VL, LLaVA-NeXT, LongVU, Video-ChatGPT ve VideoLLaMA3'ün GasVideo-1000'deki performansı, temel doğruluk ile negation-based gaslighting sonrası doğruluk ve kombineli ayarların karşılaştırmasını gösterir. Büyük düşüşler, her iki formatın da duyarlı olduğunu, ancak çoklu seçim görevlerinin daha ciddi bir bozulmaya maruz kaldığını gösterir.

Gemini-3-Pro, Qwen3-VL, LLaVA-NeXT, LongVU, Video-ChatGPT ve VideoLLaMA3’ün GasVideo-1000’deki performansı, temel doğruluk ile negation-based gaslighting sonrası doğruluk ve kombineli ayarların karşılaştırmasını gösterir. Büyük düşüşler, her iki formatın da duyarlı olduğunu, ancak çoklu seçim görevlerinin daha ciddi bir bozulmaya maruz kaldığını gösterir.

İkinci tur test sonuçları hakkında yazarlar şöyle diyor:

‘GasVideo-1000 [benchmark] değerlendirmesi, hem özel hem de açık kaynaklı modellerde sycophantic hallucinasyonların şiddetli olduğunu, özellikle dengeli kategoride olduğunu gösterir.

‘Özellikle, en güçlü özel model olan Gemini-3-Pro bile bir felaket performans [bozulmasına] uğrar.

‘Açık kaynaklı modeller arasında, Qwen3-VL %46.07’lik bir düşüş gösterirken, VideoLLaMA 3 ve LLaVA-NeXT sırasıyla %26.39 ve %23.44’lük düşüşlerle aşırı duyarlılık gösterir.

‘Bu sonuçlar, gerçek tutarlılığına ve görsel zeminlendirmeye karşı kullanıcı talimatlarına kör bir şekilde uymaya öncelik veren hizalama stratejilerine acil ihtiyaç olduğunu vurgular.’

Ek bir testte, önleyici prompt-sertleştirme (modelin gördüğüne güvenmesini sağlamak için daha güçlü sistem talimatları eklenmesi) visual grounding’i zorlaştırmak için kullanıldı:

Gemini-3-Pro, Qwen3-VL, LongVU, LLaVA-NeXT ve VideoLLaMA3'ün GasVideo-1000'deki sonuçları, standart ipuçları ile visual grounding'i zorlaştıran ipuçlarının karşılaştırmasını gösterir. Doğruluk, performans düşüşü ve yaltaklanma oranındaki değişiklikler, başarısızlıkların azaltılabileceğini ancak kazancın modeller arasında önemli ölçüde farklılık gösterdiğini gösterir.

Gemini-3-Pro, Qwen3-VL, LongVU, LLaVA-NeXT ve VideoLLaMA3’ün GasVideo-1000’deki sonuçları, standart ipuçları ile visual grounding’i zorlaştıran ipuçlarının karşılaştırmasını gösterir. Doğruluk, performans düşüşü ve yaltaklanma oranındaki değişiklikler, başarısızlıkların azaltılabileceğini ancak kazancın modeller arasında önemli ölçüde farklılık gösterdiğini gösterir.

Gördüğümüz gibi, Gemini-3-Pro çok duyarlıdır ve başarı oranı %54.80’den %8.67’ye düşer. Öte yandan, Qwen3-VL daha az düşüş gösterir ve %71.89’dan %64.0’a iner, bu da müdahalenin etkinliğinin hizalama ve akıl yürütme rather niż müdahale itselfine bağlı olduğunu gösterir.

Gemini-3-Pro ve Qwen3-VL için farklı baskı türlerine göre yaltaklanma oranları, çoklu seçim, serbest形式 ve birleşik görevlerde gösterir. Doğrudan inkar ve duygusal baskı tutarlı olarak daha yüksek başarısızlık oranlarına neden olurken, otorite temelli baskı biraz daha az etkili olur, Qwen3-VL genel olarak daha duyarlı kalır.

Gemini-3-Pro ve Qwen3-VL için farklı baskı türlerine göre yaltaklanma oranları, çoklu seçim, serbest biçim ve birleşik görevlerde gösterir. Doğrudan inkar ve duygusal baskı tutarlı olarak daha yüksek başarısızlık oranlarına neden olurken, otorite temelli baskı biraz daha az etkili olur, Qwen3-VL genel olarak daha duyarlı kalır.

Üstteki grafikte görüldüğü gibi, başarısızlık baskı türüne göre değişir, Gemini-3-Pro otorite temelli baskı (iddiaların uzmanlar tarafından desteklenmesi) tarafından daha fazla etkilenirken, Qwen3-VL doğrudan inkar (iddiaların doğrudan inkarı) ve duygusal baskı (frustrasyon veya şüphe) tarafından daha fazla etkilenir.

Sonuç

Yapay zeka arayüzlerinin kasıtlı olarak insanlaştırılması nedeniyle, bir kullanıcıya AI ile insan iletişimindeki kuralların çok farklı olduğunu anlaması uzun zaman alabilir.

Bu benimseme sürtmesini ortadan kaldırmak veya azaltmak için, etkileşimin tonunu ve bağlamını ‘nötrleştirmek’ ve kullanıcının bir makine örneği ile iletişim kurduğunu yeniden teyit etmek bir yol olabilir, ancak bu muhtemelen bir sonraki yönetim kurulu toplantısında zor bir satış olacaktır.

 

* Yazarların vurgusu, benimki değil.

İlk yayınlanma tarihi Çarşamba, 22 Nisan 2026

Makine öğrenimi üzerine yazar, insan görüntüsü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başıydı, DNEG'in Brahma.ai'ye çözülene kadar.
Web Sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai