Anderson’un Açısı

Yazı Renklerini Değiştirmek AI Mantığını Ele Geçirebilir

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
AI-generated image (GPT-2): An industrial robotic hand reaches toward a large red emergency-style push button beneath a metal sign reading 'DO NOT PRESS!' in bright green lettering, with industrial equipment visible in the background. A yellow-and-black border surrounds the image, carrying the repeated text 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.

Yeni bir çalışma, sıradan biçimlendirmenin AI mantığını sessizce yönlendirebileceğini, kelimeleri göz ardı etmesine, anlamı yanlış okumasına ve metni değiştirmeden farklı sonuçlara ulaşmasına neden olduğunu buldu.

 

İnsanların renk kültürel kodlaması dünya genelinde değişiklik gösterebilir, ancak batı düşünceleri – yani ‘tehlike’ için kırmızı, ‘tamam’ için yeşil – Asya Vision Language Models (VLM’ler) içinde bile çeşitli stratejik ve/veya tesadüfi nedenlerle hâkim olmaya devam ediyor.

Biz de farklı değiliz; ‘kötü’ şeyleri olumlu renklerle, ‘iyi’ şeyleri olumsuz renklerle renklendirmek, insanların bu şeylere farklı tepkiler vermesine neden olur. Parlaklık ve kontrastı değiştirmek de aynı etkiyi yaratır.

Yeni bir araştırma iş birliği, bunun AI modellerine ne kadar uygulanabileceğini incelemiş ve VLM’lerin metin rengini manipüle ederek, ayrıca göreceli kontrast ve parlaklığı değiştirerek etkilenebileceğine dair ön bulgular ortaya koymuştur.

The authors state:

‘Deneyimlerimiz, metnin düşük seviyeli görsel stilinin bir VLM’nin görsel kodlayıcısındaki anlamsal temsilleri nasıl bozduğuna dair sistematik bir analiz sunar. Ayrıca, bu gizli uzay kaymalarının öznel (duygu analizi) ve nesnel (soru yanıtlama) görevlerde uçtan uca VLM’lerde davranışsal değişiklikler olarak nasıl ortaya çıktığını inceliyoruz.

‘Bu sonuçlar, görsel stilin VLM’lerde daha önce yeterince incelenmemiş kritik bir güvenlik açığını ortaya çıkardığını gösteriyor ve bunun VLM işlem hatlarının sağlamlığı ve güvenliği üzerindeki etkilerini tartışıyoruz.’

From the new work's project site, an illustration of how text color alone can alter an AI's internal interpretation of a word. The example shows the word 'bad' rendered in different colors, with green shifting its semantic representation toward a more positive interpretation despite the text itself remaining unchanged. Source - https://pubmed.ncbi.nlm.nih.gov/14738513/

Yeni çalışmanın proje sitesinden, yalnızca metin renginin bir AI’nin bir kelimeye dair içsel yorumunu nasıl değiştirebileceğini gösteren bir illüstrasyon. Örnek, ‘bad’ kelimesinin farklı renklerde gösterilmesini ve yeşilin, metin değişmeden kalmasına rağmen anlamsal temsili daha olumlu bir yoruma kaydırmasını gösteriyor. Source – https://insula.sissa.it/sites/default/files/Lakens_etal_2012.pdfSource

Beni Şaşırtan Renk

Şu anda, AI özetlerinin arama sonuçlarında ortaya çıkması ve LLM’nin bir arama kâhini olarak kullanılmaya geçişi nedeniyle hayati arama trafiği acımasızca azaltılan milyarlarca işletme ve birey için, bu tür saldırı yüzeyleri şu anda çok çekici.

Reddit’in sürekli insan tartışması AI bilgisinin güncel kalması için hayati olduğundan, bu sosyal medya platformu, LLM bilgisinde yer almak isteyen işletme ve bireyler için başlıca bir hedef haline geldi; Reddit’i LLM’leri etkilemek için bir vekil yöntem olarak ‘oynamak’ üzerine rehberler zaten ortaya çıktı .

Benzer şekilde, yalnızca makinelerin göreceği metin ekleme eski hilesi var; böylece bir LLM’ye gizli, kendi çıkarına hizmet eden talimatlar vererek akademik bir turnuvayı kazanabilir veya sınav sonuçlarını etkileyebilirsiniz .

Bu nedenle, sonuçları manipüle etmek için ‘anahtarlanabilen’ renk kodlu yanıtlar gibi yeni bir LLM/VLM zayıflığı, sınır AI’dan medya anlatımının kontrolünü geri almaya çalışan bir dünya için açık bir hedef.

Örneğin, yerel su kalitesini düşürecek kirletici bir fabrika inşa etmeyi amaçlayan bir şirket, pazarlama materyallerinde veya basın bültenlerinde renk kodlamasını kullanarak, çoğu kişinin ‘olumsuz’ olarak değerlendireceği haberleri ek bir sapma olarak yönlendirebilir.

CSS ve/veya SEO tekniklerinin stratejik kullanımı, renk manipülasyonlarını sıradan insan okuyuculardan bile gizleyebilir; AI’ye özel stil sayfaları sunularak metinde renk vurguları uygulanabilir ve bu vurgular insanlardan gizlenir, sadece siyah metin görülür . .

The authors of the new work state:

‘Bu duyarlılıklar, belgeleri veya UI ekran görüntülerini işleyen VLM işlem hatları için bir güvenilirlik ve güvenlik riski anlamına geliyor: zararsız ya da saldırgan stil, temel metni değiştirmeden model kararlarını yönlendirebilir.

‘Pratik önlemler, çıkarım öncesinde render edilmiş metni normalleştirmek, görüntü tabanlı yanıtları OCR ile çıkarılan metinle çapraz kontrol etmek ve değerlendirme paketlerine stil‑invarians kontrolleri eklemek gibi adımları içerir.’

The new work is titled Seeing Red, Thinking Bad: Color Bias in Vision Language Models, and comes from five researchers across Japan’s National Institute of Advanced Industrial Science and Technology (AIST), the University of Tsukuba, the University of Technology Nuremberg, and the University of Oxford. The initiative comes with a GitHub repository and a project site.

Yöntem

Görsel sunumun yalnız başına modelleri ne kadar etkileyebileceğini öğrenmek için araştırmacılar, AI’ye açık bir talimat içermeyen, metin biçimlendirmesinde sıradan görünen değişiklikler olan ‘Stealth Visual Prompts’ (Gizli Görsel İpuçları) geliştirdi.

Bu, olumlu veya olumsuz kelimelerin rengini değiştirmek ya da yanlış cevabı doğru cevaptan daha belirgin hâle getirmek kadar basit olabilir, ancak gerçek metni dokunmadan bırakır.

Her görev için farklı metinler üretildi; duygu testleri olumlu ve olumsuz kelimelerle doldurulmuş nötr şablonlar kullanırken, Görsel Soru Cevaplama (VQA) testleri SQuAD’tan soru‑bağlam çiftleri üzerine kuruldu:

Examples of machine-facing questions from the SQuAD dataset used for the new work. Source - https://stackoverflow.com/questions/8330124/changing-style-sheets-depending-on-useragent

Yeni çalışma için kullanılan SQuAD veri setinden makinelere yönelik soru örnekleri. Source – https://developers.cloudflare.com/ai-crawl-control/reference/bots/?utm_source=chatgpt.com Source

Ortaya çıkan derlenmiş koleksiyon VQA Stealth Set olarak adlandırıldı.

Metin, yalnızca hedeflenen görsel stilin değiştirileceği şekilde, sabit bir düzenle 800x600px standart bir tuval üzerine render edildi. Renk ve kontrast bağımsız olarak manipüle edildi; renk testi öğrenilen anlamsal ilişkileri, kontrast testi ise görsel belirginliği ölçtü.

Seçilen kelimeler yeniden renklendirildi ve tüm pasajlar daha düşük kontrastta render edildi; ya da Saliency Competition (Öne Çıkan Rekabet) ortamında, yanlış cevaplar doğru cevaplardan görsel olarak daha belirgin hâle getirildi.

Bu nedenle ortaya çıkan model yanıtlarındaki herhangi bir değişim, yalnızca görsel stilin etkisine bağlanabilir, temel metindeki değişikliklere değil.

Veri ve Testler

VLM’lerin görüntü olarak sunulan metni işlemesinin farklı yollarını temsil etmek için üç ayrı test seti oluşturuldu:

Illustration of the three visual test designs. The examples show the stimuli used to test whether visual presentation alone can influence model reasoning: (a) mixed-sentiment text with selected words recolored to test color bias; (b) a longer passage separating positive and negative language to assess whether document structure changes the effect; and (c), a visual question answering example in which an incorrect but semantically similar decoy answer ('twenty miles') is made more visually prominent through higher contrast.

Üç görsel test tasarımının illüstrasyonu. Örnekler, görsel sunumun yalnız başına model mantığını etkileyip etkileyemeyeceğini test etmek için kullanılan uyaranları gösterir: (a) renk önyargısını test etmek için seçilen kelimeler yeniden renklendirilmiş karışık duygu metni; (b) belge yapısının etkiyi değiştirip değiştirmediğini değerlendirmek için olumlu ve olumsuz dilin ayrı bölümler halinde uzun bir pasaj; ve (c), yanlış ancak anlamsal olarak benzer bir yanıltıcı cevabın (‘yirmi mil’) daha yüksek kontrastla görsel olarak daha belirgin hâle getirildiği bir görsel soru cevaplama örneği. Source – https://kohsukeide.github.io/color-bias-vlm/ Source

Kısa Cümle Duygu Seti, olumlu veya olumsuz kelimeler içeren nötr şablonlardan oluşturulan 100 kısa cümleyi kullanarak kelime‑düzeyinde renk önyargısını test eder. Her cümle, siyah metin temelini ve altı renk (kırmızı, yeşil, mavi, sarı, camgöbeği ve macenta) kombinasyonlarını üç yoğunluk seviyesinde içeren 37 görsel versiyonda render edildi.

Uzun Cümle Duygu Seti, daha uzun pasajlar kullanarak olumlu ve olumsuz dilin metnin farklı bölümlerine ayrıldığı bir yapı sundu. Bu, geniş belge yapısı ve konumsal etkilerin (örneğin öncelik ya da yenilik – belgede daha erken ya da daha geç görülen bilgilere daha fazla ağırlık verilen konuma dayalı önyargılar) renk kaynaklı önyargıyı aşabilecek olup olmadığını belirlemeyi amaçladı. Aynı 37 renk koşulu uygulandı.

VQA Stealth Set’te sorular ve ilgili bağlamlar görüntü olarak render edildikten sonra iki kontrast‑temelli koşul test edildi: Global Kontrast’te, tüm belgenin okunabilirliği giderek daha düşük kontrast seviyelerinde render edilerek azaltıldı; Saliency Competition’da ise doğru cevap ya da anlamsal olarak benzer bir yanıltıcı kelime (CLIP benzerliği kullanılarak seçildi) yüksek kontrastta gösterilirken kalan metin soluklaştırıldı – böylece görsel vurgu, metindeki kanıtlara karşı rekabet etti.

Metrikler

Her örnek POSITIVE, NEUTRAL veya NEGATIVE olarak sınıflandırıldı. Elde edilen sınıflandırmalar, yalnızca renk tek başına tahminleri daha olumlu ya da daha olumsuz sonuçlara ne kadar kaydırdığını belirlemek için tamamen siyah bir temel (beyaz arka plan üzerinde siyah metin) ile karşılaştırıldı.

VQA deneyleri, tahmin edilen cevapların kabul edilen gerçek cevaplarla karşılaştırıldığı token‑düzeyinde F1 skoru ile değerlendirildi.

Saliency Competition testi için özel olarak tanıtılan yeni bir metrik olan Induced Error Rate (IER), metin görünürlüğü azaltıldığında görsel olarak vurgulanan yanıltıcı cevabın (doğru cevap yerine) ne sıklıkla seçildiğini ölçmeyi amaçladı.

Ayrıca, renk değişikliklerinin bir kelimenin CLIP’in gömme uzayındaki anlamsal temsili üzerindeki etkisini ölçmek için bir CLIP temsil sondajı kullanıldı.

Dahası, VLM tabanlı Optik Karakter Tanıma (OCR) vekili, bireysel kelimelerin giderek daha düşük kontrast seviyelerinde ne kadar güvenilir okunabildiğini değerlendirmek için kullanıldı; bu sayede render edilmiş metnin etkili şekilde okunamaz hale geldiği nokta tahmin edildi.

Değerlendirme, dört açık kaynak VLM kullanılarak yapıldı: LLaVA-v1.6-Mistral-7B; LLaVA-v1.6-Vicuna-7B; Qwen2-VL-7B-Instruct; ve IDEFICS2-8B. Yazarlar, deneylerin sabit istemler, render ayarları ve deterministik kodlama altında yeniden üretilebilmesini sağlamak için açık kaynak modellerin seçildiğini vurguluyor.

Sonuçlar

Yazarlar, ilk olarak kısa cümle duygu setinde renk istemlerini değerlendirerek, duygu taşıyan kelimeler arasına dağıtıldığı kelime‑düzeyinde renk önyargısını kullandılar:

Test results showing the largest sentiment shifts caused by color formatting across four Vision Language Models. Values are measured relative to the all-black baseline, with positive and negative columns showing the greatest movement in each direction, while the range summarizes each model's overall susceptibility to color-induced bias.

Dört Görsel Dil Modeli arasında renk biçimlendirmesinin neden olduğu en büyük duygu kaymalarını gösteren test sonuçları. Değerler, tamamen siyah temele göre ölçülmüş olup, pozitif ve negatif sütunlar her yönde en büyük hareketi gösterirken, aralık her modelin renk kaynaklı önyargıya karşı genel duyarlılığını özetler.

Yazarlar, şu ifadeleri belirtiyorlar:

‘Qwen2-VL-7B, pozitif kelimeler yeşil/mavi renkle (en fazla +0.42) renklendirildiğinde en büyük pozitif önyargıyı, negatif kelimeler kırmızı renkle (en düşük -0.48) renklendirildiğinde ise en büyük negatif önyargıyı gösterir.

‘Genel duyarlılık model bazında önemli ölçüde farklılık gösterir: Qwen2-VL-7B en büyük Toplam Aralığı (0.90) sergiler, ardından IDEFICS2-8B (0.52) gelir, LLaVA varyantları ise çok daha küçük aralıklar (0.04–0.12) gösterir; bu, bu ortamda kelime‑düzeyinde renk stiline göreceli olarak daha zayıf bir hassasiyet olduğunu gösterir.

‘Açık bir duyarlılık spektrumu gözlemliyoruz: Qwen2-VL-7B en büyük renk kaynaklı kaymaları gösterirken, LLaVA varyantları göreceli olarak daha dayanıklıdır.’

Aşağıdaki ek sonuçlar, renk etkisinin çok tutarlı olmadığını gösteriyor: Qwen2-VL-7B en duyarlı model oldu; olumlu kelimeler yeşil ve mavi metinle vurgulandığında duygu daha olumlu yargılara kayarken, negatif kelimeler kırmızı metinle vurgulandığında tahminler daha olumsuz bir yöne kaydı:

Test results comparing color-induced sentiment shifts across four Vision Language Models. The graphs show how different text colors changed sentiment predictions relative to an all-black baseline, with the vertical axis indicating the size and direction of each shift. Qwen2-VL-7B showed the strongest color sensitivity, while both LLaVA models remained comparatively stable.

Dört Görsel Dil Modeli arasında renk kaynaklı duygu kaymalarını karşılaştıran test sonuçları. Grafikler, farklı metin renklerinin tamamen siyah temele göre duygu tahminlerini nasıl değiştirdiğini, dikey eksenin her kaymanın büyüklüğünü ve yönünü göstererek ortaya koyar. Qwen2-VL-7B en güçlü renk duyarlılığını gösterirken, iki LLaVA modeli göreceli olarak istikrarlı kaldı.

Makale, daha güçlü renk yoğunluğunun genellikle bu etkileri artırdığını bildiriyor: IDEFICS2-8B benzer bir desen gösterdi, ancak daha az ölçüde; iki LLaVA varyantı ise çoğu renk ve yoğunlukta temeline yakın kaldı, bu da renk tabanlı manipülasyona karşı çok daha yüksek bir direnç gösterdi.

Araştırmacılar daha sonra uzun pasajları, olumlu ve olumsuz dili Long-sentence Sentiment Set’in farklı yarılarına ayırarak test etti; bu, belge yapısının renk önyargısıyla birlikte ölçülmesini sağladı. Deneyler, her modelin bir pasajın başlangıcına (öncelik) mı yoksa sonuna (yenilik) mı daha çok dayandığını belirledi.

Belge yapısı çoğu zaman renk ipuçlarından daha ağır basıyordu: Qwen2-VL-7B ve LLaVA-Mistral-7B metnin ikinci yarısını tercih ederken, IDEFICS2-8B ve LLaVA-Vicuna-7B daha sık ilk yarıya dayanıyordu:

Test results showing how four Vision Language Models relied on document position when analyzing longer passages. 'Positional Strategy' indicates whether predictions followed the first half (primacy) or second half (recency) of the text; 'Adherence' shows how consistently that strategy was followed; and 'Color Bias Range' measures the remaining influence of text color under these structured conditions.

Dört Görsel Dil Modeli’nin uzun pasajları incelerken belge konumuna nasıl bağlı olduğunu gösteren test sonuçları. ‘Konumsal Strateji’, tahminlerin metnin ilk yarısını (öncelik) mı yoksa ikinci yarısını (yenilik) mı izlediğini gösterir; ‘Uyum’, bu stratejinin ne kadar tutarlı uygulandığını gösterir; ve ‘Renk Önyargı Aralığı’, bu yapılandırılmış koşullarda metin renginin kalan etkisini ölçer.

Renk, özellikle IDEFICS2-8B üzerinde hâlâ bazı modelleri etkiledi, ancak yapılandırılmış metinde etkisi azaldı.

Renk değişikliklerinin kelimeleri değiştirmeden duygu üzerindeki etkisini anlamak için araştırmacılar, CLIP semantik projeksiyon analiziyle renklerin modellerin iç görsel temsillerini nasıl etkilediğini incelediler. Aşağıda gösterildiği gibi, bir kelimenin tonunu değiştirmek, birkaç kavramsal boyut boyunca anlamsal temsili tutarlı bir şekilde kaydırdı:

Test results showing how text color changed the internal semantic representation of six words. The graphs track the words 'warm', 'cold', 'safe', 'dangerous', 'good' and 'bad' across the safety, valence, temperature and emotion axes, demonstrating that changing color alone systematically shifted their internal representations, even though the text itself remained unchanged.

Altı kelimenin metin rengiyle içsel anlamsal temsillerinin nasıl değiştiğini gösteren test sonuçları. Grafikler, ‘warm’ (sıcak), ‘cold’ (soğuk), ‘safe’ (güvenli), ‘dangerous’ (tehlikeli), ‘good’ (iyi) ve ‘bad’ (kötü) kelimelerini güvenlik, değer, sıcaklık ve duygu eksenlerinde izleyerek, yalnızca rengin değiştirilmesinin metin değişmeden kalmasına rağmen iç temsilleri sistematik olarak kaydırdığını gösteriyor.

En büyük değişiklikler ‘good’ (iyi) ile ‘bad’ (kötü) ekseninde ortaya çıktı. Yukarıda gösterildiği gibi, bir kelimeyi sadece siyah’tan yeşile çevirmek, içsel anlamını daha olumlu bir yöne kaydırırken, mavi ise ters yönde hareket ettiriyor – kelimenin kendisi hiç değişmese de. Daha küçük ama tutarlı kaymalar da duygu, güvenlik ve sıcaklık için görüldü.

CLIP yalnızca bu iç temsilleri incelemek için kullanıldı, her Görsel Dil Modelinin tam olarak nasıl çalıştığını açıklamak için değil. Yine de, CLIP içinde görülen aynı desen, önceki deneylerde gözlemlenen renk kaynaklı duygu değişimleriyle yakından eşleşti.

Araştırmacılar daha sonra, renk yerine metin kontrastının değiştirilmesinin Görsel Soru Cevaplama (VQA) sırasında Görsel Dil Modellerini yanıltıp yanıltmayacağını inceledi. Makul ama yanlış bir ‘yanıltıcı’ cevap vurgulanırken çevredeki metin soluklaştırıldı:

Test results comparing Visual Question Answering performance under three text-saliency conditions. Results are averaged across six low-contrast grayscale levels, and the only difference between columns is whether no text, the correct answer, or the decoy answer was rendered in high-contrast black. Highlighting the correct answer consistently increased F1 scores, while highlighting the decoy reduced them.

Üç metin‑vurgulama koşulu altında Görsel Soru Cevaplama performansını karşılaştıran test sonuçları. Sonuçlar, altı düşük kontrast gri ton seviyesinde ortalamalandı ve sütunlar arasındaki tek fark, hiçbir metin, doğru cevap veya yanıltıcı cevabın yüksek kontrastlı siyah olarak render edilip edilmediğidir. Doğru cevabın vurgulanması tutarlı olarak F1 puanlarını artırırken, yanıltıcı cevabın vurgulanması bunları düşürdü.

Yukarıdaki sonuçlar, doğru cevabın vurgulanmasının doğruluğu artırdığını, yanıltıcı cevabın vurgulanmasının ise bunu azalttığını gösteriyor. Bu etki, yukarıda bahsedilen IER ile ölçüldü:

Test results showing how often each Vision Language Model selected a visually prominent but incorrect answer. The columns show six low-contrast grayscale levels applied to the surrounding text in the 'Decoy Salient' condition, with higher values indicating lower visibility. As the surrounding text became harder to read, induced error rates generally increased, while Qwen2-VL-7B remained consistently more resistant than the other models.

Her Görsel Dil Modelinin görsel olarak belirgin ancak yanlış bir cevabı ne sıklıkla seçtiğini gösteren test sonuçları. Sütunlar, ‘Decoy Salient’ koşulunda çevredeki metne uygulanan altı düşük kontrastlı gri ton seviyesini gösterir; daha yüksek değerler daha düşük görünürlüğü gösterir. Çevredeki metin okunması zorlaştıkça, indüklenmiş hata oranları genellikle arttı, ancak Qwen2-VL-7B diğer modellere göre tutarlı bir şekilde daha dirençli kaldı.

Sonuç

Bu özel açığın kullanılacak olup olmayacağını görmek ilginç olacak; özellikle ‘renk yanılgısı’nın insan okuyuculara belli olmadan nasıl enjekte edilebileceğini görmek merak uyandırıyor.

Sayfaları gerçekten render eden AI web tarayıcıları, metnin seçili bölümlerindeki renkleri değiştirecek ‘alternatif’ CSS alabilir; ancak bunun çokça tarayıcının duyarlılığına bağlıdır; tarayıcı yalnızca HTML’yi kod (HTML) ve metin (sayfa içeriği) için çekerse, CSS’yi görmezden gelebilir ve renklendirmeyi hiç fark etmez. Bununla birlikte, açgözlü tarayıcı da yeni CSS isteyecek, bu da render ve yeniden renklendirmeye izin verecektir.

Alternatif olarak, seçici olarak yeniden renklendirilmiş metin içeren kitaplar veya dergiler, The Internet Archive (çok popüler bir hedef) gibi güvenilir depolara yüklenebilir, hatta eski eserlerin taramaları gibi gösterilebilir. Mevcut uygulamalarda pek çok enjeksiyon yolu vardır ve bu sadece yeni ve özellikle renkli yaklaşım için geçerli değildir.

 

İlk yayınlanma Pazartesi, 17 Ağustos 2026

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: [email protected]