Andersonův úhel
Změna barev písma může narušit uvažování AI

Nová studie zjistila, že obyčejné formátování může tiše ovlivnit uvažování AI, způsobit, že přehlíží slova, špatně interpretuje význam a dospěje k odlišným závěrům – aniž by měnilo samotný text.
Kulturní zakódování barvy u lidí může se lišit po celém světě, ale západní představy – tj. červená pro „nebezpečí“, zelená pro „v pořádku“ – mají tendenci převládat i v asijských Vision Language Models (VLMs), z různých strategických a/nebo náhodných důvodů.
Nejsme jiní; zabarvení „špatných“ věcí pozitivními barvami a „dobrých“ věcí negativními barvami způsobuje, že lidé reagují odlišně. Totéž platí pro změnu jasu a kontrastu.
Nová výzkumná spolupráce prozkoumala, do jaké míry se to vztahuje i na modely AI, a odhalila předběžné náznaky, že VLMs mohou být ovlivněny manipulací barvy textu, stejně jako změnou relativního kontrastu a jasu.
The authors state:
Naše experimenty poskytují systematickou analýzu toho, jak nízkoúrovňové vizuální stylování textu deformuje sémantické reprezentace v encodéru vidění VLM. Navíc zkoumáme, jak se tyto posuny v latentním prostoru projevují jako behaviorální změny v end-to-end VLMs jak v subjektivních (analýza sentimentu), tak objektivních (odpovídání na otázky) úlohách.
Tyto výsledky ukazují, že vizuální stylování odhaluje kritickou, dosud málo prozkoumanou zranitelnost ve VLMs, a diskutujeme jeho dopady na robustnost a bezpečnost VLM pipeline.
Z projektové stránky nového díla, ilustrace toho, jak samotná barva textu může změnit interní interpretaci slova AI. Příklad ukazuje slovo „bad“ zobrazené v různých barvách, přičemž zelená posouvá jeho sémantickou reprezentaci k pozitivnějšímu výkladu, i když samotný text zůstává nezměněn.Zdroj
Barvy mě překvapí
V současnosti jsou pro miliardy firem a jednotlivců, jejichž důležitý vyhledávací provoz byl krutě snížen díky nástupu AI souhrnů ve výsledcích vyhledávání, stejně jako přechodu na LLM jako vyhledávací orákulum, takové útočné povrchy velmi atraktivní.
Protože neustálé žhavé lidské diskuse na Redditu jsou zásadní pro udržení aktuálnosti znalostí AI, tato sociální platforma se stala hlavním cílem firem a jednotlivců, kteří chtějí být zahrnuti do znalostí LLM; již se objevily průvodci o „hraní“ s Redditem jako zástupnou metodou ovlivňování LLMs.
V podobném duchu existuje starý trik zahrnout text, který uvidí jen stroje, aby bylo možné předat skryté, sobecké instrukce LLM, k vyhrání akademického turnaje nebo ovlivnění výsledků zkoušek.
Nedávno časopis Time začal umisťovat reklamy do „tajné“ verze svého webu, viditelné jen pro AI webové prohledávače, které neustále prohledávají stránky kvůli novým datům, čímž potenciálně umožňují inzerentům zakoupit si větší viditelnost (nebo pozitivnější interpretaci) v odpovědích AI.
Proto je jakákoli nová slabina LLM/VLM, například barevně kódované odpovědi, které lze „přepnout“ k manipulaci výsledků, zřejmým cílem pro svět, který zoufale usiluje o získání zpět kontroly nad mediálním narativem od špičkové AI.
Například společnost, která plánuje postavit znečisťující továrnu pravděpodobně snižující kvalitu místní vody, by mohla přidat barevné kódování do svého jazykového balíčku, v marketingových materiálech či tiskových zprávách, jako další odklon zpráv, které by většina považovala za „negativní“.
Strategické využití CSS a/nebo SEO technik by mohlo dokonce skrýt barevné manipulace před běžnými lidskými čtenáři, tím, že poskytuje pouze AI styly, které uplatňují barevné důrazy v textu skryté před lidmi, kteří uvidí jen černý text.
The authors of the new work state:
Tyto citlivosti naznačují riziko spolehlivosti a bezpečnosti pro VLM pipeline, které zpracovávají dokumenty nebo snímky UI: neškodné či adversariální stylování může nasměrovat rozhodnutí modelu bez změny podkladového textu.
Praktická opatření zahrnují normalizaci vykresleného textu před inferencí, křížovou kontrolu odpovědí založených na obrazech s textem extrahovaným OCR, a přidání kontrol nezávislých na stylu do evaluačních sad.
Nová práce nese název Seeing Red, Thinking Bad: Color Bias in Vision Language Models a pochází od pěti výzkumníků z japonského Národního institutu pokročilých průmyslových věd a technologií (AIST), Univerzity Tsukuba, Univerzity technické v Norimberku a Univerzity Oxford. Iniciativa je doprovázena repozitářem na GitHubu a projektovou stránkou.
Metoda
Aby zjistili, jak moc může samotná vizuální prezentace ovlivnit modely, výzkumníci vyvinuli „Stealth Visual Prompts“ – běžně vypadající úpravy formátování textu, které neobsahují žádný explicitní pokyn pro AI.
Může to být tak jednoduché, jako změna barvy pozitivních či negativních slov, nebo zvýraznění špatné odpovědi tak, aby vynikla více než správná, přičemž samotná formulace zůstane nedotčena.
Pro každý úkol byl vytvořen odlišný text; sentimentální testy používaly neutrální šablony naplněné pozitivními a negativními slovy, zatímco testy Visual Question Answering (VQA) čerpaly z dvojic otázka‑kontext ze SQuAD:
Příklady otázek směřovaných na stroje ze souboru SQuAD použité v nové práci. Zdroj
Výsledná kurátorovaná kolekce byla pojmenována VQA Stealth Set.
Text byl vykreslen na standardizované plátno 800×600 px s pevnou rozlohou, aby se změnila pouze cílená vizuální úprava. Barva a kontrast byly manipulovány nezávisle, přičemž testování barvy zkoumalo naučené sémantické asociace a testování kontrastu vizuální výraznost.
Vybraná slova byla přebarvena a celé úseky vykresleny s nižším kontrastem; nebo v nastavení soutěže Saliency byly nesprávné odpovědi vizuálně zvýrazněny více než správné.
Jakákoli následná změna v odpovědích modelu tak může být připisována výhradně vizuálnímu stylování, nikoli změnám podkladového textu.
Data a testy
Byly vytvořeny tři odlišné testovací sady, které představují různé způsoby, jak VLMs zpracovávají text prezentovaný jako obrázky:
Ilustrace tří vizuálních testovacích návrhů. Příklady ukazují podněty použité k testování, zda samotná vizuální prezentace může ovlivnit uvažování modelu: (a) smíšený sentimentální text s přebarvenými vybranými slovy pro testování barevné zaujatosti; (b) delší úsek oddělující pozitivní a negativní jazyk k posouzení, zda struktura dokumentu mění efekt; a (c) příklad vizuálního otázek‑odpovědí, kde nesprávná, ale sémanticky podobná odklonová odpověď („dvacet mil“) je vizuálně zvýrazněna vyšším kontrastem.Zdroj
Short-sentence Sentiment Set testuje úroveň barevné zaujatosti na úrovni slov pomocí 100 krátkých vět vygenerovaných z neutrálních šablon obsahujících pozitivní nebo negativní slova. Každá věta byla vykreslena ve 37 vizuálních verzích, zahrnujících základní černý text plus kombinace šesti barev (červená, zelená, modrá, žlutá, azurová a purpurová) ve třech úrovních intenzity.
Long-sentence Sentiment Set použil delší úseky, ve kterých byl pozitivní a negativní jazyk rozdělen do různých částí textu. Cílem bylo zjistit, zda širší struktura dokumentu a poziční efekty, jako prvotní nebo poslední (biasy založené na pozici, kdy informace objevená dříve či později v dokumentu může mít větší váhu), převáží jakoukoli barvou vyvolanou zaujatost. Byly použity stejné 37 barevných podmínek.
V sadě VQA Stealth Set byly otázky a jejich související kontext vykresleny jako obrázky, po nichž byly testovány dvě podmínky založené na kontrastu: v Global Contrast byla čitelnost celého dokumentu snížena postupným vykreslováním s nižšími úrovněmi kontrastu; a v Saliency Competition byla buď správná odpověď, nebo sémanticky podobné odklonové slovo (vybrané pomocí podobnosti CLIP) vykresleno s vysokým kontrastem, zatímco zbytek textu byl zeslaben – což umožňuje vizuálnímu důrazu soutěžit s důkazy v textu.
Metriky
Každý příklad byl klasifikován jako POZITIVNÍ, NEUTRÁLNÍ nebo NEGATIVNÍ. Výsledné klasifikace byly následně porovnány s čistě černým základem (černý text na bílém pozadí), aby se určila míra, do jaké samotná barva posunula předpovědi k pozitivnějším nebo negativnějším výsledkům.
Experimenty VQA byly hodnoceny pomocí token‑úrovňového F1 skóre, kde byly předpovězené odpovědi porovnány s akceptovanými referenčními odpověďmi.
Induced Error Rate (IER), nová metrika, byla zavedena speciálně pro test Saliency Competition a měla měřit, jak často byla vizuálně zvýrazněná odklonová odpověď vybrána (namísto správné odpovědi), když byla viditelnost textu snížena.
Dále byl použit CLIP reprezentativní test k měření, jak změny barvy ovlivnily sémantickou reprezentaci slova v prostor vložení CLIPu.
Dále byl použit VLM‑založený optický rozpoznávání znaků (OCR) proxy k posouzení, jak spolehlivě lze jednotlivá slova číst při postupně nižších úrovních kontrastu, což umožnilo odhadnout bod, kdy se vykreslený text stane prakticky nečitelným.
Hodnocení bylo provedeno pomocí čtyř open‑source VLMs: LLaVA-v1.6-Mistral-7B; LLaVA-v1.6-Vicuna-7B; Qwen2-VL-7B-Instruct; a IDEFICS2-8B. Autoři zdůrazňují, že open‑source modely byly vybrány, aby bylo zajištěno, že experimenty lze reprodukovat za pevných promptů, nastavení vykreslování a deterministického dekódování.
Výsledky
Autoři nejprve vyhodnotili barevné podněty na sadě Short‑Sentence Sentiment Set, využívající úroveň barevné zaujatosti na úrovni slov, kde byly sentimentální slova rozptýleny:
Výsledky testu ukazující největší posuny sentimentu způsobené barevným formátováním u čtyř Vision Language Models. Hodnoty jsou měřeny relativně k čistě černému základu, přičemž sloupce pozitivní a negativní ukazují největší posun v každém směru, zatímco rozsah shrnuje celkovou náchylnost každého modelu k barvou vyvolané zaujatosti.
Autoři uvádějí:
Qwen2-VL-7B vykazuje největší pozitivní zaujatost, když jsou pozitivní slova zbarvena zeleně/modře (až +0.42), a největší negativní zaujatost, když jsou negativní slova zbarvena červeně (až -0.48).
Celková náchylnost se mezi modely podstatně liší: Qwen2-VL-7B má největší celkový rozsah (0.90), následuje IDEFICS2-8B (0.52), zatímco varianty LLaVA vykazují mnohem menší rozsahy (0.04–0.12), což naznačuje relativně slabší citlivost na stylování barvou na úrovni slov v tomto nastavení.
Pozorujeme jasné spektrum náchylnosti: Qwen2-VL-7B vykazuje největší posuny vyvolané barvou, zatímco varianty LLaVA jsou relativně odolné.
Další výsledky níže ukazují, že efekt barvy není jednotný: Qwen2-VL-7B se ukázal jako nejvíce náchylný, přičemž zelený a modrý text systematicky posunoval sentiment k pozitivnějším soudům, když byly zvýrazněny pozitivní slova, zatímco červený text posouval předpovědi k negativnějšímu směru, když byly zvýrazněna negativní slova:
Výsledky testu porovnávající posuny sentimentu vyvolané barvou u čtyř Vision Language Models. Grafy ukazují, jak různé barvy textu změnily predikce sentimentu relativně k čistě černému základu, přičemž vertikální osa udává velikost a směr každého posunu. Qwen2-VL-7B vykázal nejsilnější citlivost na barvu, zatímco oba modely LLaVA zůstaly relativně stabilní.
Silnější intenzita barvy obecně tyto efekty zesilovala, uvádí studie: IDEFICS2-8B vykázal podobný vzorec, i když v menší míře, zatímco oba modely LLaVA zůstaly blízko svého základu napříč většinou barev a intenzit, což naznačuje mnohem větší odolnost vůči manipulaci založené na barvě.
Výzkumníci poté testovali delší úseky rozdělením pozitivního a negativního jazyka do různých polovin Long‑sentence Sentiment Set, což umožnilo měřit strukturu dokumentu spolu s barevnou zaujatostí. Experimenty určili, zda se každý model spíše opírá o začátek (prvotnost) nebo konec (recence) úseku.
Struktura dokumentu často převážila nad barevnými signály: Qwen2-VL-7B a LLaVA-Mistral-7B upřednostňovaly druhou polovinu textu, zatímco IDEFICS2-8B a LLaVA-Vicuna-7B častěji spoléhaly na první:

Výsledky testu ukazující, jak čtyři Vision Language Models spoléhaly na pozici v dokumentu při analýze delších úseků. ‘Posicionální strategie’ ukazuje, zda předpovědi následovaly první polovinu (prvotnost) nebo druhou polovinu (recence) textu; ‘Přilnavost’ ukazuje, jak konzistentně byla tato strategie dodržována; a ‘Rozsah barevné zaujatosti’ měří zbývající vliv barvy textu za těchto strukturovaných podmínek.
Barva stále ovlivňovala některé modely, zejména IDEFICS2-8B, ale ve strukturovaném textu se stala méně vlivnou.
Aby pochopili, proč změny barvy mohou měnit sentiment bez změny samotných slov, výzkumníci zkoumali, jak barva ovlivňuje interní vizuální reprezentace modelů pomocí analýzy semantické projekce CLIP. Jak je znázorněno níže, změna odstínu slova systematicky posunula jeho sémantickou reprezentaci napříč několika konceptuálními dimenzemi:

Výsledky testu ukazující, jak barva textu změnila interní sémantickou reprezentaci šesti slov. Grafy sledují slova „warm“, „cold“, „safe“, „dangerous“, „good“ a „bad“ napříč osami bezpečnosti, valence, teploty a emocí, což demonstruje, že samotná změna barvy systematicky posunula jejich interní reprezentace, i když samotný text zůstal nezměněn.
Největší změny se objevily na ose „good“ versus „bad“. Jak bylo výše demonstrováno, jednoduchá změna slova z černé na zelenou tendovala posunout jeho vnitřní význam směrem k pozitivnějšímu, zatímco modrá ho posouvala opačným směrem – i když se samotné slovo nikdy nezměnilo. Menší, ale konzistentní posuny se také objevily u emocí, bezpečnosti a teploty.
CLIP byl použit pouze k prozkoumání těchto interních reprezentací, nikoli k přesnému vysvětlení fungování každého Vision Language Modelu. Přesto se stejný vzor pozorovaný v CLIP úzce shodoval s barvou podněcenými změnami sentimentu zaznamenanými v předchozích experimentech.
Výzkumníci dále zkoumali, zda změna kontrastu textu, místo barvy, může také uvést Vision Language Models v omyl během Visual Question Answering (VQA). Pravděpodobná, ale nesprávná „odklonová“ odpověď byla zvýrazněna, zatímco okolní text byl zeslaben:

Výsledky testu porovnávající výkon Visual Question Answering za tří podmínek textové salience. Výsledky jsou průměrovány napříč šesti úrovněmi nízkého kontrastu šedé škály a jediný rozdíl mezi sloupci spočívá v tom, zda žádný text, správná odpověď nebo odklonová odpověď byl vykreslen vysokokontrastní černou. Zvýraznění správné odpovědi systematicky zvyšovalo F1 skóre, zatímco zvýraznění odklonu jej snižovalo.
Výsledky výše ukazují, že zvýraznění správné odpovědi zlepšilo přesnost, zatímco zdůraznění odklonu ji snížilo. Tento efekt byl následně měřen pomocí dříve zmíněného IER:

Výsledky testu ukazující, jak často každý Vision Language Model vybral vizuálně výraznou, ale nesprávnou odpověď. Sloupce ukazují šest úrovní nízkého kontrastu šedé škály aplikovaných na okolní text v podmínce ‘Decoy Salient’, přičemž vyšší hodnoty naznačují nižší viditelnost. Jak se okolní text stal obtížnějším k přečtení, indukované chybové míry obecně rostly, zatímco Qwen2-VL-7B zůstával konzistentně odolnější než ostatní modely.
Závěr
Bude zajímavé sledovat, zda bude tato konkrétní nuance využita, mimo jiné proto, že by bylo zajímavé zjistit, jak lze „barevné zmatení“ vložit, aniž by to bylo zřejmé lidským čtenářům.
Ačkoliv AI weboví scraperi, kteří skutečně vykreslují stránky, mohou být podrobeni „alternativnímu“ CSS, které změní barvy ve vybraných částech textu, hodně záleží na citlivosti scraperu; pokud scraper jen vytahuje HTML a hledá kód (HTML) a text (obsah stránky), může CSS ignorovat a nikdy se o barvách nedozví. Přesto je pravděpodobné, že chamtivý scraper bude chtít i nové CSS, což umožní vykreslování a přebarvování.
Alternativně by knihy nebo časopisy s selektivně přebarveným textem mohly být nahrány do důvěryhodných repozitářů, jako je The Internet Archive (velmi populární cíl), a dokonce se vydávat za skeny starších děl. Existuje mnoho cest injekce v rámci současných praktik a ne jen pro tento nový a zvláště barevný přístup.
Poprvé publikováno pondělí 17. srpna 2026












