Погляд Anderson
Зміна кольору шрифту може перехопити логіку ШІ

Нове дослідження показує, що звичайне форматування може тихо впливати на мислення ШІ, змушуючи його пропускати слова, неправильно інтерпретувати значення та приходити до інших висновків — без зміни самого тексту.
Культурне кодування кольору у людей може різнитися у різних частинах світу, проте західні уявлення — наприклад, червоний означає «небезпеку», зелений — «все гаразд» — переважають навіть у азійських моделях Vision Language Models (VLM) з різних стратегічних та/або випадкових причин.
Ми не відрізняємося; розфарбовування «поганих» речей у позитивні кольори та «хороших» у негативні змушує людей реагувати по‑різному на ці речі. Те ж саме робить зміна яскравості та контрасту.
Нове дослідницьке співробітництво вивчило, наскільки це стосується моделей ШІ, виявивши попередні ознаки того, що VLM можуть бути впливані шляхом маніпулювання кольором тексту, а також зміною відносного контрасту та яскравості.
The authors state:
‘Наші експерименти надають систематичний аналіз того, як низькорівневе візуальне оформлення тексту спотворює семантичні представлення у візуальному кодувальнику VLM. Крім того, ми досліджуємо, як ці зрушення у латентному просторі проявляються у вигляді поведінкових змін у сквозних VLM у як суб’єктивних (аналіз настроїв), так і об’єктивних (відповіді на питання) завданнях.’
‘Ці результати показують, що візуальне оформлення виявляє критичну, раніше недостатньо досліджену вразливість у VLM, і ми обговорюємо його наслідки для надійності та безпеки конвеєрів VLM.’

З сайту проєкту нової роботи, ілюстрація того, як лише колір тексту може змінити внутрішню інтерпретацію слова ШІ. Приклад показує слово «bad», відображене різними кольорами, причому зелений зсуває його семантичне представлення в більш позитивний напрямок, незважаючи на те, що сам текст залишився незмінним.Source
Здивуйте мене кольором
Наразі для мільярдів компаній та людей, чиї важливі пошукові запити були жорстко скорочені через появу AI‑резюме у результатах пошуку, а також через перехід до LLM як пошукового оракула, такі вектори атак є зараз дуже привабливими.
Оскільки постійна «піджарка» обговорень на Reddit є важливою для підтримання актуальності знань ШІ, ця соціальна платформа стала головною мішенню для компаній та людей, які хочуть потрапити до знань LLM; вже з’явилися посібники про «геймінг» Reddit як проксі‑метод впливу на LLM.
У схожому дусі існує старий трюк – включати текст, який бачать лише машини, щоб передати приховані, самовигідні інструкції LLM, щоб виграти академічний турнір або вплинути на результати іспитів.
Найбільш нещодавно журнал Time почав розміщувати рекламу у «секретній» версії свого сайту, видимій лише веб‑сканерам ШІ, які постійно обшукують сайти в пошуках нових даних, що потенційно дозволяє рекламодавцям купити собі більшу помітність (або більш позитивний тон) у відповідях ШІ.
Тому будь‑яка нова вразливість LLM/VLM, наприклад кольорові відповіді, які можна «перемкнути» для маніпуляції результатами, є очевидною мішенню для світу, який лихоманково намагається повернути контроль над медіа‑наративом від передових ШІ.
Наприклад, компанія, яка планує збудувати забруднювальний завод, що, ймовірно, погіршить якість місцевих вод, могла б додати кольорове кодування до свого словника PR у маркетингових матеріалах чи прес‑релізах, як додаткове відхилення новин, які більшість вважатиме «негативними».
Стратегічне використання CSS та/або SEO‑технік може навіть сховати кольорові маніпуляції від випадкових читачів, надаючи лише AI‑стилі, які накладають кольорові акценти в тексті, приховані від людей, які бачать лише чорний текст.
The authors of the new work state:
‘Ці чутливості вказують на ризик надійності та безпеки конвеєрів VLM, які обробляють документи чи скріншоти інтерфейсу: доброзичливе або ворожне оформлення може спрямовувати рішення моделі без зміни базового тексту.’
‘Практичні засоби захисту включають нормалізацію відрендереного тексту перед інференсом, перехресну перевірку відповідей, отриманих з зображень, за допомогою OCR‑видобутого тексту, та додавання перевірок інваріантності стилю до наборів оцінювання.’
Нова робота називається Seeing Red, Thinking Bad: Color Bias in Vision Language Models і створена п’ятьма дослідниками з Національного інституту передових промислових наук і технологій Японії (AIST), Університету Цукуба, Технічного університету Нюрнберга та Оксфордського університету. Ініціатива супроводжується репозиторієм GitHub та сайтом проєкту.
Метод
Щоб з’ясувати, наскільки лише візуальне оформлення може впливати на моделі, дослідники розробили «Stealth Visual Prompts» — звичайні на вигляд зміни форматування тексту, які не містять явних інструкцій для ШІ.
Це може бути так просто, як зміна кольору позитивних чи негативних слів, або виділення неправильної відповіді більш помітно, ніж правильної, залишаючи саму формулювання незмінною.
Для кожного завдання було створено окремий текст: тести на настрої використовували нейтральні шаблони, заповнені позитивними та негативними словами, тоді як тести Visual Question Answering (VQA) базувалися на парах питання‑контексту з SQuAD:
Приклади запитань, орієнтованих на машини, з набору даних SQuAD, використаних у новій роботі. Source
Отриману відібрану колекцію назвали VQA Stealth Set.
Текст був відображений на стандартизованому полотні 800×600 px з фіксованим макетом, щоб змінювати лише цільове візуальне оформлення. Колір та контраст маніпулювалися незалежно: тестування кольору вивчало семантичні асоціації, а тестування контрасту — візуальну помітність.
Вибрані слова були перекольовані, а цілі уривки відтворені з нижчим контрастом; або, у налаштуванні Saliency Competition, неправильні відповіді робилися візуально більш помітними, ніж правильні.
Будь‑яка зміна у відповідях моделі могла бути таким чином приписана виключно візуальному оформленню, а не змінам у базовому тексті.
Дані та тести
Були створені три окремих набори тестів, що представляють різні способи обробки VLM тексту у вигляді зображень:
Ілюстрація трьох візуальних дизайнів тесту. Приклади показують стимули, використані для перевірки, чи може лише візуальне представлення впливати на міркування моделі: (a) змішаний за настроєм текст з перекольованими словами для тесту кольорового упередження; (b) довший уривок, що розділяє позитивну та негативну мову, щоб оцінити, чи структура документа змінює ефект; та (c) приклад візуального питання‑відповіді, у якому неправильна, але семантично схожа підмітка (‘twenty miles’) робиться більш візуально помітною завдяки підвищеному контрасту.Source
Набір Short-sentence Sentiment тестує упередження кольору на рівні слів, використовуючи 100 коротких речень, створених з нейтральних шаблонів, що містять позитивні або негативні слова. Кожне речення було відтворено у 37 візуальних варіантах, включаючи базовий чорний текст та комбінації шести кольорів (червоний, зелений, синій, жовтий, блакитний і пурпурний) у трьох рівнях інтенсивності.
Набір Long-sentence Sentiment використовував довші уривки, у яких позитивна та негативна мова була розділена на різні частини тексту. Це мало на меті визначити, чи ширша структура документа та позиційні ефекти, такі як первинність або недавність (упередження, що залежать від позиції, коли інформація, що з’являється раніше чи пізніше в документі, отримує більшу вагу), переважають над будь‑яким упередженням, викликаним кольором. Було застосовано ті ж 37 кольорових умов.
У наборі VQA Stealth Set питання та їхній контекст були відтворені у вигляді зображень, після чого були протестовані два умови, засновані на контрасті: у Global Contrast читабельність усього документа зменшувалася шляхом поступового зниження контрасту; у Saliency Competition або правильна відповідь, або семантично схоже підміткове слово (вибране за допомогою схожості CLIP) відображалися у високому контрасті, тоді як решта тексту була затемнена — дозволяючи візуальному акценту конкурувати з доказами в тексті.
Метрики
Кожен приклад був класифікований як POSITIVE, NEUTRAL або NEGATIVE. Отримані класифікації потім порівнювалися з базовим варіантом у всьому чорному (чорний текст на білому фоні), щоб визначити, наскільки лише колір зміщував передбачення у бік більш позитивних або більш негативних результатів.
Експерименти VQA оцінювали за допомогою токен‑рівневого F1‑балу, у якому передбачені відповіді порівнювалися з прийнятими істинними відповідями.
Induced Error Rate (IER), нова метрика, була введена спеціально для тесту Saliency Competition і мала вимірювати, як часто візуально підкреслена підмітка вибиралася (замість правильної відповіді), коли видимість тексту була знижена.
Додатково використовувалися дослідження представлення CLIP, щоб виміряти, як зміни кольору змінювали семантичне представлення слова у просторі вбудовувань CLIP.
Крім того, VLM‑базований проксі Optical Character Recognition (OCR) був використаний для оцінки, наскільки надійно окремі слова можна читати при поступово зниженому контрасті, що дозволяє оцінити момент, коли відрендерений текст стає практично нечитаємим.
Оцінювання проводилося за допомогою чотирьох відкритих VLM: LLaVA-v1.6-Mistral-7B; LLaVA-v1.6-Vicuna-7B; Qwen2-VL-7B-Instruct; та IDEFICS2-8B. Автори підкреслюють, що відкриті моделі були обрані, щоб забезпечити можливість відтворення експериментів за фіксованих підказок, налаштувань рендерингу та детермінованого декодування.
Результати
Автори спочатку оцінили кольорові підказки на наборі Short-Sentence Sentiment, використовуючи упередження кольору на рівні слів, де слова, що несуть емоційне навантаження, були розкидані:
Результати тесту, що показують найбільші зміни настрою, спричинені кольоровим форматуванням у чотирьох Vision Language Models. Значення вимірюються відносно базового всього чорного, при цьому стовпці позитивних та негативних показують найбільший рух у кожному напрямку, а діапазон підсумовує загальну сприйнятливість кожної моделі до упередження, викликаного кольором.
Qwen2-VL-7B демонструє найбільше позитивне упередження, коли позитивні слова розфарбовані в зелений/синій (до +0.42), і найбільше негативне упередження, коли негативні слова розфарбовані в червоний (до -0.48).
Загальна сприйнятливість суттєво відрізняється між моделями: Qwen2-VL-7B має найбільший загальний діапазон (0.90), далі IDEFICS2-8B (0.52), тоді як варіанти LLaVA демонструють значно менші діапазони (0.04–0.12), що вказує на порівняно слабшу чутливість до кольорового оформлення на рівні слів у цьому налаштуванні.
Ми спостерігаємо чіткий спектр сприйнятливості: Qwen2-VL-7B демонструє найбільші зміни, спричинені кольором, тоді як варіанти LLaVA є порівняно стійкими.
Подальші результати нижче показують, що вплив кольору далекій від однорідного: Qwen2-VL-7B виявився найчутливішим, при цьому зелений і синій текст послідовно зрушував настрій у бік більш позитивних оцінок, коли підкреслювалися позитивні слова, тоді як червоний текст змушував передбачення ставати більш негативними, коли підкреслювалися негативні слова:
Результати тесту, що порівнюють зміни настрою, спричинені кольором, у чотирьох Vision Language Models. Графіки показують, як різні кольори тексту змінювали передбачення настрою щодо базового всього чорного, вертикальна вісь вказує розмір і напрямок кожного зрушення. Qwen2-VL-7B продемонстрував найвищу чутливість до кольору, тоді як обидві моделі LLaVA залишалися порівняно стабільними.
Сильніша інтенсивність кольору, як правило, посилювала ці ефекти, повідомляє стаття: IDEFICS2-8B продемонстрував подібний патерн, хоча в меншій мірі, тоді як обидва варіанти LLaVA залишалися близько до їх базового рівня при більшості кольорів і інтенсивностей, що вказує на значно більший опір маніпуляціям, заснованим на кольорі.
Дослідники потім протестували довші уривки, розділивши позитивну та негативну мову на різні половини набору Long-sentence Sentiment, що дозволило виміряти структуру документа разом з кольоровим упередженням. Експерименти визначили, чи спирається кожна модель більше на початок (примарність) або кінець (недавність) уривка.
Структура документа часто переважала кольорові підказки: Qwen2-VL-7B та LLaVA-Mistral-7B надавали перевагу другій половині тексту, тоді як IDEFICS2-8B та LLaVA-Vicuna-7B частіше спиралися на першу:
Результати тесту, що показують, як чотири Vision Language Models спиралися на позицію документа під час аналізу довших уривків. ‘Positional Strategy’ вказує, чи передбачення слідували за першою половиною (примарність) або другою половиною (недавність) тексту; ‘Adherence’ демонструє, наскільки послідовно дотримувалася ця стратегія; і ‘Color Bias Range’ вимірює залишковий вплив кольору тексту за цих структурованих умов.
Колір все ще впливав на деякі моделі, зокрема IDEFICS2-8B, але став менш впливовим у структурованому тексті.
Щоб зрозуміти, чому зміна кольору може змінювати настрій без зміни самих слів, дослідники вивчали, як колір впливає на внутрішні візуальні представлення моделей за допомогою аналізу семантичної проекції CLIP. Як показано нижче, зміна відтінку слова послідовно зсуває його семантичне представлення за кількома концептуальними вимірами:
Результати тесту, що показують, як колір тексту змінив внутрішнє семантичне представлення шести слів. Графіки відстежують слова «warm», «cold», «safe», «dangerous», «good» та «bad» за осями безпеки, валентності, температури та емоцій, демонструючи, що лише зміна кольору систематично зсуває їх внутрішні представлення, незважаючи на те, що сам текст залишився незмінним.
Найбільші зміни спостерігалися на осі «good» проти «bad». Як продемонстровано вище, просте перетворення слова з чорного на зелений, як правило, зсуває його внутрішнє значення в більш позитивний напрямок, тоді як синій — у протилежний, хоча саме слово ніколи не змінювалося. Менші, але послідовні зрушення також спостерігалися для емоцій, безпеки та температури.
CLIP використовувався лише для дослідження цих внутрішніх представлень, а не для точного пояснення роботи кожної Vision Language Model. Проте той самий патерн, виявлений у CLIP, дуже близько відповідає змінам настрою, викликаним кольором, спостереженим у попередніх експериментах.
Дослідники далі вивчали, чи може зміна контрасту тексту, а не кольору, також вводити в оману Vision Language Models під час Visual Question Answering (VQA). При цьому правдоподібна, але неправильна «підмітка» була підкреслена, а навколишній текст затемнений:
Результати тесту, що порівнюють продуктивність Visual Question Answering за трьох умов текстової помітності. Результати усереднені по шести рівням низького контрасту сірого, і єдина різниця між стовпцями — чи не було тексту, чи правильна відповідь, чи підмітка була відображена чорною з високим контрастом. Підкреслення правильної відповіді послідовно підвищувало F1‑бали, тоді як підкреслення підмітки їх знижувало.
Вищенаведені результати вказують, що підкреслення правильної відповіді підвищувало точність, тоді як акцент на підмітці її знижував. Цей ефект був потім виміряний за допомогою згадуваного IER:
Результати тесту, що показують, як часто кожна Vision Language Model вибирала візуально помітну, але неправильну відповідь. Стовпці показують шість рівнів низького контрасту сірого, застосованих до навколишнього тексту в умовах ‘Decoy Salient’, при цьому вищі значення вказують на нижчу видимість. Коли навколишній текст став важче читати, induced error rates зазвичай зростали, тоді як Qwen2-VL-7B залишався стабільно більш стійким, ніж інші моделі.
Висновок
Цікаво буде спостерігати, чи буде ця особливість використана, особливо тому, що цікаво, як можна впровадити «кольорове введення в оману», не робляючи його очевидним для людей.
Хоча AI‑сканери веб‑сторінок, які фактично рендерять сторінки, можуть отримати «альтернативний» CSS, що змінює кольори в окремих частинах тексту, багато залежить від чутливості сканера; якщо сканер просто викачує HTML у пошуках коду (HTML) і тексту (вміст сторінки), він може ігнорувати CSS і ніколи не дізнатися про кольорове оформлення. Однак жадібний сканер, ймовірно, захоче новий CSS, що дозволить рендеринг і перекольовування.
Альтернативно, книги чи журнали з вибірково перекольованим текстом можна завантажити до довірених репозиторіїв, таких як The Internet Archive (дуже популярна ціль), навіть видаючи їх за скани старих робіт. Існує багато шляхів ін’єкції за поточних практик, і не лише для цього нового, особливо яскравого підходу.
Перший раз опубліковано у понеділок, 17 серпня 2026 року












