Anderson’un Açısı
Yazı Renklerini Değiştirmek AI Mantığını Ele Geçirebilir

Yeni bir çalışma, sıradan biçimlendirmenin AI mantığını sessizce yönlendirebileceğini, kelimeleri göz ardı etmesine, anlamı yanlış okumasına ve metni değiştirmeden farklı sonuçlara ulaşmasına neden olduğunu buldu.
İnsanların renk kültürel kodlaması dünya genelinde değişiklik gösterebilir, ancak batı düşünceleri – yani ‘tehlike’ için kırmızı, ‘tamam’ için yeşil – Asya Vision Language Models (VLM’ler) içinde bile çeşitli stratejik ve/veya tesadüfi nedenlerle hâkim olmaya devam ediyor.
Biz de farklı değiliz; ‘kötü’ şeyleri olumlu renklerle, ‘iyi’ şeyleri olumsuz renklerle renklendirmek, insanların bu şeylere farklı tepkiler vermesine neden olur. Parlaklık ve kontrastı değiştirmek de aynı etkiyi yaratır.
Yeni bir araştırma iş birliği, bunun AI modellerine ne kadar uygulanabileceğini incelemiş ve VLM’lerin metin rengini manipüle ederek, ayrıca göreceli kontrast ve parlaklığı değiştirerek etkilenebileceğine dair ön bulgular ortaya koymuştur.
The authors state:
‘Deneyimlerimiz, metnin düşük seviyeli görsel stilinin bir VLM’nin görsel kodlayıcısındaki anlamsal temsilleri nasıl bozduğuna dair sistematik bir analiz sunar. Ayrıca, bu gizli uzay kaymalarının öznel (duygu analizi) ve nesnel (soru yanıtlama) görevlerde uçtan uca VLM’lerde davranışsal değişiklikler olarak nasıl ortaya çıktığını inceliyoruz.
‘Bu sonuçlar, görsel stilin VLM’lerde daha önce yeterince incelenmemiş kritik bir güvenlik açığını ortaya çıkardığını gösteriyor ve bunun VLM işlem hatlarının sağlamlığı ve güvenliği üzerindeki etkilerini tartışıyoruz.’
Yeni çalışmanın proje sitesinden, yalnızca metin renginin bir AI’nin bir kelimeye dair içsel yorumunu nasıl değiştirebileceğini gösteren bir illüstrasyon. Örnek, ‘bad’ kelimesinin farklı renklerde gösterilmesini ve yeşilin, metin değişmeden kalmasına rağmen anlamsal temsili daha olumlu bir yoruma kaydırmasını gösteriyor. Source – https://insula.sissa.it/sites/default/files/Lakens_etal_2012.pdfSource
Beni Şaşırtan Renk
Şu anda, AI özetlerinin arama sonuçlarında ortaya çıkması ve LLM’nin bir arama kâhini olarak kullanılmaya geçişi nedeniyle hayati arama trafiği acımasızca azaltılan milyarlarca işletme ve birey için, bu tür saldırı yüzeyleri şu anda çok çekici.
Reddit’in sürekli insan tartışması AI bilgisinin güncel kalması için hayati olduğundan, bu sosyal medya platformu, LLM bilgisinde yer almak isteyen işletme ve bireyler için başlıca bir hedef haline geldi; Reddit’i LLM’leri etkilemek için bir vekil yöntem olarak ‘oynamak’ üzerine rehberler zaten ortaya çıktı .
Benzer şekilde, yalnızca makinelerin göreceği metin ekleme eski hilesi var; böylece bir LLM’ye gizli, kendi çıkarına hizmet eden talimatlar vererek akademik bir turnuvayı kazanabilir veya sınav sonuçlarını etkileyebilirsiniz .
Bu nedenle, sonuçları manipüle etmek için ‘anahtarlanabilen’ renk kodlu yanıtlar gibi yeni bir LLM/VLM zayıflığı, sınır AI’dan medya anlatımının kontrolünü geri almaya çalışan bir dünya için açık bir hedef.
Örneğin, yerel su kalitesini düşürecek kirletici bir fabrika inşa etmeyi amaçlayan bir şirket, pazarlama materyallerinde veya basın bültenlerinde renk kodlamasını kullanarak, çoğu kişinin ‘olumsuz’ olarak değerlendireceği haberleri ek bir sapma olarak yönlendirebilir.
CSS ve/veya SEO tekniklerinin stratejik kullanımı, renk manipülasyonlarını sıradan insan okuyuculardan bile gizleyebilir; AI’ye özel stil sayfaları sunularak metinde renk vurguları uygulanabilir ve bu vurgular insanlardan gizlenir, sadece siyah metin görülür . .
The authors of the new work state:
‘Bu duyarlılıklar, belgeleri veya UI ekran görüntülerini işleyen VLM işlem hatları için bir güvenilirlik ve güvenlik riski anlamına geliyor: zararsız ya da saldırgan stil, temel metni değiştirmeden model kararlarını yönlendirebilir.
‘Pratik önlemler, çıkarım öncesinde render edilmiş metni normalleştirmek, görüntü tabanlı yanıtları OCR ile çıkarılan metinle çapraz kontrol etmek ve değerlendirme paketlerine stil‑invarians kontrolleri eklemek gibi adımları içerir.’
The new work is titled Seeing Red, Thinking Bad: Color Bias in Vision Language Models, and comes from five researchers across Japan’s National Institute of Advanced Industrial Science and Technology (AIST), the University of Tsukuba, the University of Technology Nuremberg, and the University of Oxford. The initiative comes with a GitHub repository and a project site.
Yöntem
Görsel sunumun yalnız başına modelleri ne kadar etkileyebileceğini öğrenmek için araştırmacılar, AI’ye açık bir talimat içermeyen, metin biçimlendirmesinde sıradan görünen değişiklikler olan ‘Stealth Visual Prompts’ (Gizli Görsel İpuçları) geliştirdi.
Bu, olumlu veya olumsuz kelimelerin rengini değiştirmek ya da yanlış cevabı doğru cevaptan daha belirgin hâle getirmek kadar basit olabilir, ancak gerçek metni dokunmadan bırakır.
Her görev için farklı metinler üretildi; duygu testleri olumlu ve olumsuz kelimelerle doldurulmuş nötr şablonlar kullanırken, Görsel Soru Cevaplama (VQA) testleri SQuAD’tan soru‑bağlam çiftleri üzerine kuruldu:
Yeni çalışma için kullanılan SQuAD veri setinden makinelere yönelik soru örnekleri. Source – https://developers.cloudflare.com/ai-crawl-control/reference/bots/?utm_source=chatgpt.com Source
Ortaya çıkan derlenmiş koleksiyon VQA Stealth Set olarak adlandırıldı.
Metin, yalnızca hedeflenen görsel stilin değiştirileceği şekilde, sabit bir düzenle 800x600px standart bir tuval üzerine render edildi. Renk ve kontrast bağımsız olarak manipüle edildi; renk testi öğrenilen anlamsal ilişkileri, kontrast testi ise görsel belirginliği ölçtü.
Seçilen kelimeler yeniden renklendirildi ve tüm pasajlar daha düşük kontrastta render edildi; ya da Saliency Competition (Öne Çıkan Rekabet) ortamında, yanlış cevaplar doğru cevaplardan görsel olarak daha belirgin hâle getirildi.
Bu nedenle ortaya çıkan model yanıtlarındaki herhangi bir değişim, yalnızca görsel stilin etkisine bağlanabilir, temel metindeki değişikliklere değil.
Veri ve Testler
VLM’lerin görüntü olarak sunulan metni işlemesinin farklı yollarını temsil etmek için üç ayrı test seti oluşturuldu:
Üç görsel test tasarımının illüstrasyonu. Örnekler, görsel sunumun yalnız başına model mantığını etkileyip etkileyemeyeceğini test etmek için kullanılan uyaranları gösterir: (a) renk önyargısını test etmek için seçilen kelimeler yeniden renklendirilmiş karışık duygu metni; (b) belge yapısının etkiyi değiştirip değiştirmediğini değerlendirmek için olumlu ve olumsuz dilin ayrı bölümler halinde uzun bir pasaj; ve (c), yanlış ancak anlamsal olarak benzer bir yanıltıcı cevabın (‘yirmi mil’) daha yüksek kontrastla görsel olarak daha belirgin hâle getirildiği bir görsel soru cevaplama örneği. Source – https://kohsukeide.github.io/color-bias-vlm/ Source
Kısa Cümle Duygu Seti, olumlu veya olumsuz kelimeler içeren nötr şablonlardan oluşturulan 100 kısa cümleyi kullanarak kelime‑düzeyinde renk önyargısını test eder. Her cümle, siyah metin temelini ve altı renk (kırmızı, yeşil, mavi, sarı, camgöbeği ve macenta) kombinasyonlarını üç yoğunluk seviyesinde içeren 37 görsel versiyonda render edildi.
Uzun Cümle Duygu Seti, daha uzun pasajlar kullanarak olumlu ve olumsuz dilin metnin farklı bölümlerine ayrıldığı bir yapı sundu. Bu, geniş belge yapısı ve konumsal etkilerin (örneğin öncelik ya da yenilik – belgede daha erken ya da daha geç görülen bilgilere daha fazla ağırlık verilen konuma dayalı önyargılar) renk kaynaklı önyargıyı aşabilecek olup olmadığını belirlemeyi amaçladı. Aynı 37 renk koşulu uygulandı.
VQA Stealth Set’te sorular ve ilgili bağlamlar görüntü olarak render edildikten sonra iki kontrast‑temelli koşul test edildi: Global Kontrast’te, tüm belgenin okunabilirliği giderek daha düşük kontrast seviyelerinde render edilerek azaltıldı; Saliency Competition’da ise doğru cevap ya da anlamsal olarak benzer bir yanıltıcı kelime (CLIP benzerliği kullanılarak seçildi) yüksek kontrastta gösterilirken kalan metin soluklaştırıldı – böylece görsel vurgu, metindeki kanıtlara karşı rekabet etti.
Metrikler
Her örnek POSITIVE, NEUTRAL veya NEGATIVE olarak sınıflandırıldı. Elde edilen sınıflandırmalar, yalnızca renk tek başına tahminleri daha olumlu ya da daha olumsuz sonuçlara ne kadar kaydırdığını belirlemek için tamamen siyah bir temel (beyaz arka plan üzerinde siyah metin) ile karşılaştırıldı.
VQA deneyleri, tahmin edilen cevapların kabul edilen gerçek cevaplarla karşılaştırıldığı token‑düzeyinde F1 skoru ile değerlendirildi.
Saliency Competition testi için özel olarak tanıtılan yeni bir metrik olan Induced Error Rate (IER), metin görünürlüğü azaltıldığında görsel olarak vurgulanan yanıltıcı cevabın (doğru cevap yerine) ne sıklıkla seçildiğini ölçmeyi amaçladı.
Ayrıca, renk değişikliklerinin bir kelimenin CLIP’in gömme uzayındaki anlamsal temsili üzerindeki etkisini ölçmek için bir CLIP temsil sondajı kullanıldı.
Dahası, VLM tabanlı Optik Karakter Tanıma (OCR) vekili, bireysel kelimelerin giderek daha düşük kontrast seviyelerinde ne kadar güvenilir okunabildiğini değerlendirmek için kullanıldı; bu sayede render edilmiş metnin etkili şekilde okunamaz hale geldiği nokta tahmin edildi.
Değerlendirme, dört açık kaynak VLM kullanılarak yapıldı: LLaVA-v1.6-Mistral-7B; LLaVA-v1.6-Vicuna-7B; Qwen2-VL-7B-Instruct; ve IDEFICS2-8B. Yazarlar, deneylerin sabit istemler, render ayarları ve deterministik kodlama altında yeniden üretilebilmesini sağlamak için açık kaynak modellerin seçildiğini vurguluyor.
Sonuçlar
Yazarlar, ilk olarak kısa cümle duygu setinde renk istemlerini değerlendirerek, duygu taşıyan kelimeler arasına dağıtıldığı kelime‑düzeyinde renk önyargısını kullandılar:

Dört Görsel Dil Modeli arasında renk biçimlendirmesinin neden olduğu en büyük duygu kaymalarını gösteren test sonuçları. Değerler, tamamen siyah temele göre ölçülmüş olup, pozitif ve negatif sütunlar her yönde en büyük hareketi gösterirken, aralık her modelin renk kaynaklı önyargıya karşı genel duyarlılığını özetler.
Yazarlar, şu ifadeleri belirtiyorlar:
‘Qwen2-VL-7B, pozitif kelimeler yeşil/mavi renkle (en fazla +0.42) renklendirildiğinde en büyük pozitif önyargıyı, negatif kelimeler kırmızı renkle (en düşük -0.48) renklendirildiğinde ise en büyük negatif önyargıyı gösterir.
‘Genel duyarlılık model bazında önemli ölçüde farklılık gösterir: Qwen2-VL-7B en büyük Toplam Aralığı (0.90) sergiler, ardından IDEFICS2-8B (0.52) gelir, LLaVA varyantları ise çok daha küçük aralıklar (0.04–0.12) gösterir; bu, bu ortamda kelime‑düzeyinde renk stiline göreceli olarak daha zayıf bir hassasiyet olduğunu gösterir.
‘Açık bir duyarlılık spektrumu gözlemliyoruz: Qwen2-VL-7B en büyük renk kaynaklı kaymaları gösterirken, LLaVA varyantları göreceli olarak daha dayanıklıdır.’
Aşağıdaki ek sonuçlar, renk etkisinin çok tutarlı olmadığını gösteriyor: Qwen2-VL-7B en duyarlı model oldu; olumlu kelimeler yeşil ve mavi metinle vurgulandığında duygu daha olumlu yargılara kayarken, negatif kelimeler kırmızı metinle vurgulandığında tahminler daha olumsuz bir yöne kaydı:
Dört Görsel Dil Modeli arasında renk kaynaklı duygu kaymalarını karşılaştıran test sonuçları. Grafikler, farklı metin renklerinin tamamen siyah temele göre duygu tahminlerini nasıl değiştirdiğini, dikey eksenin her kaymanın büyüklüğünü ve yönünü göstererek ortaya koyar. Qwen2-VL-7B en güçlü renk duyarlılığını gösterirken, iki LLaVA modeli göreceli olarak istikrarlı kaldı.
Makale, daha güçlü renk yoğunluğunun genellikle bu etkileri artırdığını bildiriyor: IDEFICS2-8B benzer bir desen gösterdi, ancak daha az ölçüde; iki LLaVA varyantı ise çoğu renk ve yoğunlukta temeline yakın kaldı, bu da renk tabanlı manipülasyona karşı çok daha yüksek bir direnç gösterdi.
Araştırmacılar daha sonra uzun pasajları, olumlu ve olumsuz dili Long-sentence Sentiment Set’in farklı yarılarına ayırarak test etti; bu, belge yapısının renk önyargısıyla birlikte ölçülmesini sağladı. Deneyler, her modelin bir pasajın başlangıcına (öncelik) mı yoksa sonuna (yenilik) mı daha çok dayandığını belirledi.
Belge yapısı çoğu zaman renk ipuçlarından daha ağır basıyordu: Qwen2-VL-7B ve LLaVA-Mistral-7B metnin ikinci yarısını tercih ederken, IDEFICS2-8B ve LLaVA-Vicuna-7B daha sık ilk yarıya dayanıyordu:
Dört Görsel Dil Modeli’nin uzun pasajları incelerken belge konumuna nasıl bağlı olduğunu gösteren test sonuçları. ‘Konumsal Strateji’, tahminlerin metnin ilk yarısını (öncelik) mı yoksa ikinci yarısını (yenilik) mı izlediğini gösterir; ‘Uyum’, bu stratejinin ne kadar tutarlı uygulandığını gösterir; ve ‘Renk Önyargı Aralığı’, bu yapılandırılmış koşullarda metin renginin kalan etkisini ölçer.
Renk, özellikle IDEFICS2-8B üzerinde hâlâ bazı modelleri etkiledi, ancak yapılandırılmış metinde etkisi azaldı.
Renk değişikliklerinin kelimeleri değiştirmeden duygu üzerindeki etkisini anlamak için araştırmacılar, CLIP semantik projeksiyon analiziyle renklerin modellerin iç görsel temsillerini nasıl etkilediğini incelediler. Aşağıda gösterildiği gibi, bir kelimenin tonunu değiştirmek, birkaç kavramsal boyut boyunca anlamsal temsili tutarlı bir şekilde kaydırdı:

Altı kelimenin metin rengiyle içsel anlamsal temsillerinin nasıl değiştiğini gösteren test sonuçları. Grafikler, ‘warm’ (sıcak), ‘cold’ (soğuk), ‘safe’ (güvenli), ‘dangerous’ (tehlikeli), ‘good’ (iyi) ve ‘bad’ (kötü) kelimelerini güvenlik, değer, sıcaklık ve duygu eksenlerinde izleyerek, yalnızca rengin değiştirilmesinin metin değişmeden kalmasına rağmen iç temsilleri sistematik olarak kaydırdığını gösteriyor.
En büyük değişiklikler ‘good’ (iyi) ile ‘bad’ (kötü) ekseninde ortaya çıktı. Yukarıda gösterildiği gibi, bir kelimeyi sadece siyah’tan yeşile çevirmek, içsel anlamını daha olumlu bir yöne kaydırırken, mavi ise ters yönde hareket ettiriyor – kelimenin kendisi hiç değişmese de. Daha küçük ama tutarlı kaymalar da duygu, güvenlik ve sıcaklık için görüldü.
CLIP yalnızca bu iç temsilleri incelemek için kullanıldı, her Görsel Dil Modelinin tam olarak nasıl çalıştığını açıklamak için değil. Yine de, CLIP içinde görülen aynı desen, önceki deneylerde gözlemlenen renk kaynaklı duygu değişimleriyle yakından eşleşti.
Araştırmacılar daha sonra, renk yerine metin kontrastının değiştirilmesinin Görsel Soru Cevaplama (VQA) sırasında Görsel Dil Modellerini yanıltıp yanıltmayacağını inceledi. Makul ama yanlış bir ‘yanıltıcı’ cevap vurgulanırken çevredeki metin soluklaştırıldı:
Üç metin‑vurgulama koşulu altında Görsel Soru Cevaplama performansını karşılaştıran test sonuçları. Sonuçlar, altı düşük kontrast gri ton seviyesinde ortalamalandı ve sütunlar arasındaki tek fark, hiçbir metin, doğru cevap veya yanıltıcı cevabın yüksek kontrastlı siyah olarak render edilip edilmediğidir. Doğru cevabın vurgulanması tutarlı olarak F1 puanlarını artırırken, yanıltıcı cevabın vurgulanması bunları düşürdü.
Yukarıdaki sonuçlar, doğru cevabın vurgulanmasının doğruluğu artırdığını, yanıltıcı cevabın vurgulanmasının ise bunu azalttığını gösteriyor. Bu etki, yukarıda bahsedilen IER ile ölçüldü:
Her Görsel Dil Modelinin görsel olarak belirgin ancak yanlış bir cevabı ne sıklıkla seçtiğini gösteren test sonuçları. Sütunlar, ‘Decoy Salient’ koşulunda çevredeki metne uygulanan altı düşük kontrastlı gri ton seviyesini gösterir; daha yüksek değerler daha düşük görünürlüğü gösterir. Çevredeki metin okunması zorlaştıkça, indüklenmiş hata oranları genellikle arttı, ancak Qwen2-VL-7B diğer modellere göre tutarlı bir şekilde daha dirençli kaldı.
Sonuç
Bu özel açığın kullanılacak olup olmayacağını görmek ilginç olacak; özellikle ‘renk yanılgısı’nın insan okuyuculara belli olmadan nasıl enjekte edilebileceğini görmek merak uyandırıyor.
Sayfaları gerçekten render eden AI web tarayıcıları, metnin seçili bölümlerindeki renkleri değiştirecek ‘alternatif’ CSS alabilir; ancak bunun çokça tarayıcının duyarlılığına bağlıdır; tarayıcı yalnızca HTML’yi kod (HTML) ve metin (sayfa içeriği) için çekerse, CSS’yi görmezden gelebilir ve renklendirmeyi hiç fark etmez. Bununla birlikte, açgözlü tarayıcı da yeni CSS isteyecek, bu da render ve yeniden renklendirmeye izin verecektir.
Alternatif olarak, seçici olarak yeniden renklendirilmiş metin içeren kitaplar veya dergiler, The Internet Archive (çok popüler bir hedef) gibi güvenilir depolara yüklenebilir, hatta eski eserlerin taramaları gibi gösterilebilir. Mevcut uygulamalarda pek çok enjeksiyon yolu vardır ve bu sadece yeni ve özellikle renkli yaklaşım için geçerli değildir.
İlk yayınlanma Pazartesi, 17 Ağustos 2026












