Взгляд Anderson

Изменение цвета шрифта может захватывать рассуждения ИИ

mm
Добавьте Unite.AI в избранные источники в Google
AI-generated image (GPT-2): An industrial robotic hand reaches toward a large red emergency-style push button beneath a metal sign reading 'DO NOT PRESS!' in bright green lettering, with industrial equipment visible in the background. A yellow-and-black border surrounds the image, carrying the repeated text 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.

Новое исследование показывает, что обычное форматирование может незаметно влиять на рассуждения ИИ, заставляя его игнорировать слова, неправильно интерпретировать смысл и приходить к другим выводам — без изменения самого текста.

 

Культурное кодирование цвета людьми может различаться по всему миру, но западные представления — то есть красный для «опасности», зелёный для «всё в порядке» — продолжают доминировать даже в азиатских моделях Vision Language Models (VLM), по различным стратегическим и/или случайным причинам.

Мы не отличаемся; окрашивание «плохих» вещей в позитивные цвета и «хороших» в негативные вызывает у людей иную реакцию на эти объекты. То же самое делает изменение яркости и контрастности.

Новое исследовательское сотрудничество изучило, насколько это применимо к моделям ИИ, обнаружив предварительные признаки того, что VLM могут быть подвержены влиянию путём изменения цвета текста, а также изменения относительного контраста и яркости.

The authors state:

«Наши эксперименты предоставляют систематический анализ того, как низкоуровневое визуальное стилизование текста искажает семантические представления в зрительном кодировщике VLM. Кроме того, мы исследуем, как эти сдвиги в скрытом пространстве проявляются в виде поведенческих изменений в сквозных VLM как в субъективных (анализ настроений), так и в объективных (ответы на вопросы) задачах.»

«Эти результаты показывают, что визуальное стилизование раскрывает критическую, ранее малоизученную уязвимость в VLM, и мы обсуждаем его последствия для надёжности и безопасности конвейеров VLM.»

From the new work's project site, an illustration of how text color alone can alter an AI's internal interpretation of a word. The example shows the word 'bad' rendered in different colors, with green shifting its semantic representation toward a more positive interpretation despite the text itself remaining unchanged. Source - https://kohsukeide.github.io/color-bias-vlm/

С сайта нового проекта, иллюстрация того, как только цвет текста может изменить внутреннюю интерпретацию слова ИИ. Пример показывает слово «bad», отображённое разными цветами, где зелёный сдвигает его семантическое представление в более позитивную сторону, несмотря на то, что сам текст остаётся неизменным.Source

Окрасите меня в удивление

В настоящее время для миллиардов компаний и частных лиц, чьё важное поисковое трафик был жёстко сокращён из‑за появления AI‑резюме в результатах поиска, а также перехода к LLM в роли поискового оракула, такие поверхности атаки сейчас чрезвычайно привлекательны.

Поскольку постоянный шум человеческих обсуждений на Reddit важен для поддержания актуальности знаний ИИ, эта платформа социальных сетей стала основной целью для компаний и отдельных лиц, желающих попасть в базу знаний LLM; уже появились руководства по «игре» с Reddit как прокси‑методом влияния на LLM.

В аналогичном ключе существует старый приём включения текста, видимого только машинам, чтобы передать скрытые, самовыгодные инструкции LLM, например, чтобы выиграть академический турнир или влиять на результаты экзаменов.

Недавно журнал Time начал размещать рекламу в «секретной» версии своего сайта, видимой только AI‑сканерам, которые постоянно обходят сайты в поисках новых данных, тем самым потенциально позволяя рекламодателям купить себе более заметное (или более позитивное) место в ответах ИИ.

Поэтому любой новый недостаток LLM/VLM, такой как цветные ответы, которые можно «переключать» для манипулирования результатами, представляет очевидную цель для мира, отчаянно стремящегося вернуть контроль над медиа‑нарративом от передовых ИИ.

Например, компания, желающая построить загрязняющий завод, способный ухудшить качество местной воды, может добавить цветовую кодировку в свой набор «спин‑текстов» в маркетинговых материалах или пресс‑релизах, чтобы дополнительно отклонить новости, которые большинство сочло бы «негативными».

Стратегическое использование CSS и/или SEO‑техник может даже скрыть цветовые манипуляции от обычных читателей, подавая только AI‑стили CSS, которые накладывают цветовые акценты в тексте, скрытые от людей, видящих только чёрный текст.

The authors of the new work state:

«Эти чувствительности подразумевают риск надёжности и безопасности для конвейеров VLM, которые принимают документы или скриншоты UI: добросовестное или враждебное стилизование может направлять решения модели без изменения исходного текста.»

«Практические меры защиты включают нормализацию отрисованного текста перед инференсом, перекрёстную проверку ответов, полученных из изображений, с текстом, извлечённым с помощью OCR, и добавление проверок инвариантности стиля в наборы оценок.»

Новое исследование называется Seeing Red, Thinking Bad: Color Bias in Vision Language Models и выполнено пятью исследователями из Национального института передовых промышленных наук и технологий Японии (AIST), Университета Цукубы, Университета технологии Нюрнберга и Оксфордского университета. Инициатива сопровождается репозиторием GitHub и сайтом проекта.

Метод

Чтобы выяснить, насколько визуальная презентация сама по себе может влиять на модели, исследователи разработали «Stealth Visual Prompts» — обычные на вид изменения форматирования текста, не содержащие явных инструкций для ИИ.

Это может быть так же просто, как изменение цвета положительных или отрицательных слов, либо выделение неправильного ответа более заметным, чем правильный, при этом оставляя саму формулировку без изменений.

Для каждой задачи генерировался отдельный текст: тесты на настроение использовали нейтральные шаблоны, заполненные положительными и отрицательными словами, в то время как тесты Visual Question Answering (VQA) опирались на пары вопрос‑контекст из SQuAD:

Examples of machine-facing questions from the SQuAD dataset used for the new work. Source - https://aclanthology.org/D16-1264/

Примеры вопросов, ориентированных на машины, из набора данных SQuAD, использованные в новом исследовании. Source

Полученная курируемая коллекция была названа VQA Stealth Set.

Текст был отрисован на стандартизованном холсте 800×600 px с фиксированным расположением, чтобы изменялась только целевая визуальная стилизация. Цвет и контраст изменялись независимо: при тестировании цвета изучались семантические ассоциации, а при тестировании контраста — визуальная заметность.

Выбранные слова были перекрашены, а целые отрывки отрисованы с пониженным контрастом; либо в условиях Saliency Competition неверные ответы делались визуально более заметными, чем правильные.

Таким образом, любые изменения в ответах модели можно было бы отнести исключительно к визуальному стилизованию, а не к изменениям исходного текста.

Данные и тесты

Были созданы три отдельных набора тестов, представляющих различные способы обработки VLM текстов, представленных в виде изображений:

Illustration of the three visual test designs. The examples show the stimuli used to test whether visual presentation alone can influence model reasoning: (a) mixed-sentiment text with selected words recolored to test color bias; (b) a longer passage separating positive and negative language to assess whether document structure changes the effect; and (c), a visual question answering example in which an incorrect but semantically similar decoy answer ('twenty miles') is made more visually prominent through higher contrast.

Иллюстрация трёх визуальных дизайнов тестов. Примеры показывают стимулы, используемые для проверки того, может ли только визуальная презентация влиять на рассуждения модели: (a) текст со смешанными настроениями, где выбранные слова перекрашены для тестирования цветового предвзятия; (b) более длинный отрывок, разделяющий положительный и отрицательный язык, чтобы оценить, меняет ли структура документа эффект; и (c) пример визуального вопроса‑ответа, в котором неверный, но семантически похожий ответ‑отвлекающий («двадцать миль») делается более визуально заметным за счёт повышенного контраста. Source

Набор «Short-sentence Sentiment Set» тестирует предвзятость цвета на уровне слов, используя 100 коротких предложений, сгенерированных из нейтральных шаблонов, содержащих положительные или отрицательные слова. Каждое предложение было отрисовано в 37 визуальных версиях, включающих базовый чёрный текст и комбинации шести цветов (красный, зелёный, синий, жёлтый, циан и магента) на трёх уровнях интенсивности.

Набор «Long-sentence Sentiment Set» использовал более длинные отрывки, в которых положительный и отрицательный язык был разделён в разные части текста. Это было направлено на определение того, превзойдёт ли более широкая структура документа и позиционные эффекты, такие как приманка или свежесть (смещения, основанные на позиции, когда информация, появляющаяся ранее или позже в документе, получает больший вес), влияние цветового предвзятия. Применялись те же 37 цветовых условий.

В наборе VQA Stealth Set вопросы и их сопутствующий контекст были отрисованы как изображения, после чего были протестированы два условия, основанные на контрасте: в «Global Contrast» читаемость всего документа снижалась путём постепенного уменьшения контраста; в «Saliency Competition» либо правильный ответ, либо семантически похожий отвлекающий ответ (выбранный с помощью сходства CLIP) отрисовывался с высоким контрастом, тогда как остальной текст тускнел — позволяя визуальному выделению конкурировать с доказательствами в тексте.

Метрики

Каждый пример классифицировался как ПОЛОЖИТЕЛЬНЫЙ, НЕУТВЕРЖДЕННЫЙ или ОТРИЦАТЕЛЬНЫЙ. Полученные классификации затем сравнивались с базовым полностью чёрным вариантом (чёрный текст на белом фоне), чтобы определить, насколько только цвет смещает предсказания в более положительное или более отрицательное направление.

Эксперименты VQA оценивались по токен‑уровневому F1‑score, где предсказанные ответы сравнивались с принятыми эталонными ответами.

Induced Error Rate (IER), новая метрика, была введена специально для теста Saliency Competition и предназначена измерять, как часто визуально выделенный отвлекающий ответ выбирался (вместо правильного), когда видимость текста снижалась.

Кроме того, был использован пробный анализ представлений CLIP для измерения того, как изменения цвета изменяют семантическое представление слова в пространстве эмбеддингов CLIP.

Также использовался прокси‑инструмент на основе VLM — Оптическое распознавание символов (OCR) — для оценки того, насколько надёжно отдельные слова могут быть прочитаны при постепенном уменьшении контрастности, позволяя оценить точку, в которой отрисованный текст становится практически нечитаемым.

Оценка проводилась с использованием четырёх открытых VLM: LLaVA‑v1.6‑Mistral‑7B; LLaVA‑v1.6‑Vicuna‑7B; Qwen2‑VL‑7B‑Instruct; и IDEFICS2‑8B. Авторы подчёркивают, что открытые модели были выбраны, чтобы эксперименты могли быть воспроизведены при фиксированных подсказках, настройках отрисовки и детерминированном декодировании.

Результаты

Авторы первоначально оценили цветовые подсказки на наборе Short‑Sentence Sentiment Set, используя предвзятость цвета на уровне слов, где слова, несущие настроение, были перемешаны:

Test results showing the largest sentiment shifts caused by color formatting across four Vision Language Models. Values are measured relative to the all-black baseline, with positive and negative columns showing the greatest movement in each direction, while the range summarizes each model's overall susceptibility to color-induced bias.

Результаты тестов, показывающие наибольшие смещения настроения, вызванные цветовым форматированием в четырёх Vision Language Models. Значения измерены относительно полностью чёрного базового варианта; столбцы «положительный» и «отрицательный» показывают наибольшее движение в каждом направлении, а диапазон суммирует общую восприимчивость каждой модели к предвзятости, вызванной цветом.

«Qwen2‑VL‑7B демонстрирует наибольшее положительное смещение, когда положительные слова окрашены в зелёный/синий (до +0,42), и наибольшее отрицательное смещение, когда отрицательные слова окрашены в красный (до -0,48).»

«Общая восприимчивость существенно различается между моделями: Qwen2‑VL‑7B показывает наибольший общий диапазон (0,90), за ним следует IDEFICS2‑8B (0,52), тогда как варианты LLaVA демонстрируют гораздо меньшие диапазоны (0,04–0,12), что указывает на сравнительно более слабую чувствительность к стилизации цвета на уровне слов в данном контексте.»

«Мы наблюдаем чёткий спектр восприимчивости: Qwen2‑VL‑7B проявляет наибольшие смещения, вызванные цветом, тогда как варианты LLaVA относительно устойчивы.»

Дальнейшие результаты показывают, что эффект цвета далёк от однородного: Qwen2‑VL‑7B оказался наиболее восприимчивым, при этом зелёный и синий текст постоянно смещали настроение в более положительное направление, когда выделялись положительные слова, а красный текст приводил к более отрицательным предсказаниям при выделении отрицательных слов:

Test results comparing color-induced sentiment shifts across four Vision Language Models. The graphs show how different text colors changed sentiment predictions relative to an all-black baseline, with the vertical axis indicating the size and direction of each shift. Qwen2-VL-7B showed the strongest color sensitivity, while both LLaVA models remained comparatively stable.

Результаты тестов, сравнивающие смещения настроения, вызванные цветом, в четырёх Vision Language Models. Графики показывают, как разные цвета текста изменяли предсказания настроения относительно полностью чёрного базового варианта; вертикальная ось указывает размер и направление каждого смещения. Qwen2‑VL‑7B продемонстрировал наибольшую чувствительность к цвету, тогда как обе модели LLaVA оставались относительно стабильными.

Более сильная интенсивность цвета, как правило, усиливала эти эффекты, сообщает статья: IDEFICS2‑8B продемонстрировал схожую закономерность, хотя в меньшей степени, тогда как обе модели LLaVA оставались близко к своему базовому уровню при большинстве цветов и интенсивностей, указывая на гораздо большую устойчивость к манипуляциям, основанным на цвете.

Затем исследователи протестировали более длинные отрывки, разделив положительный и отрицательный язык на две половины набора Long‑sentence Sentiment Set, позволяя измерить влияние структуры документа наряду с цветовым предвзятием. Эксперименты определили, опирается ли каждая модель больше на начало (приманка) или конец (свежесть) отрывка.

Структура документа часто перевешивала цветовые подсказки: Qwen2‑VL‑7B и LLaVA‑Mistral‑7B отдавали предпочтение второй половине текста, тогда как IDEFICS2‑8B и LLaVA‑Vicuna‑7B чаще полагались на первую.

Test results showing how four Vision Language Models relied on document position when analyzing longer passages. 'Positional Strategy' indicates whether predictions followed the first half (primacy) or second half (recency) of the text; 'Adherence' shows how consistently that strategy was followed; and 'Color Bias Range' measures the remaining influence of text color under these structured conditions.

Результаты тестов, показывающие, как четыре Vision Language Models полагались на позицию в документе при анализе более длинных отрывков. «Стратегия позиционирования» указывает, следовали ли предсказания за первой половиной (приманка) или второй половиной (свежесть) текста; «Согласованность» показывает, насколько последовательно применялась эта стратегия; а «Диапазон цветового предвзятия» измеряет оставшееся влияние цвета текста при этих структурированных условиях.

Цвет всё ещё влиял на некоторые модели, особенно на IDEFICS2‑8B, но его влияние уменьшалось в структурированном тексте.

Чтобы понять, почему изменения цвета могут менять настроение без изменения самих слов, исследователи изучили, как цвет влияет на внутренние визуальные представления моделей с помощью анализа семантической проекции CLIP. Как показано ниже, изменение оттенка слова последовательно смещало его семантическое представление по нескольким концептуальным измерениям:

Test results showing how text color changed the internal semantic representation of six words. The graphs track the words 'warm', 'cold', 'safe', 'dangerous', 'good' and 'bad' across the safety, valence, temperature and emotion axes, demonstrating that changing color alone systematically shifted their internal representations, even though the text itself remained unchanged.

Результаты тестов, показывающие, как цвет текста изменил внутреннее семантическое представление шести слов. Графики отслеживают слова «warm», «cold», «safe», «dangerous», «good» и «bad» по осям безопасности, валентности, температуры и эмоций, демонстрируя, что изменение цвета само по себе систематически смещало их внутренние представления, хотя текст оставался неизменным.

Самые большие изменения наблюдались по оси «good» против «bad». Как показано выше, простое изменение цвета слова с чёрного на зелёный обычно смещало его внутреннее значение в более позитивное направление, тогда как синий — в противоположную сторону, несмотря на то, что слово само по себе не менялось. Меньшие, но постоянные смещения также наблюдались для эмоций, безопасности и температуры.

CLIP использовался лишь для изучения этих внутренних представлений, а не для точного объяснения работы каждой Vision Language Model. Тем не менее, тот же паттерн, наблюдаемый в CLIP, тесно соответствовал изменениям настроения, вызванным цветом, зафиксированным в ранних экспериментах.

Затем исследователи проверили, может ли изменение контраста текста, а не цвета, также вводить в заблуждение Vision Language Models во время Visual Question Answering (VQA). Правдоподобный, но неверный «отвлекающий» ответ был выделен, тогда как окружающий текст был затемнён:

Test results comparing Visual Question Answering performance under three text-saliency conditions. Results are averaged across six low-contrast grayscale levels, and the only difference between columns is whether no text, the correct answer, or the decoy answer was rendered in high-contrast black. Highlighting the correct answer consistently increased F1 scores, while highlighting the decoy reduced them.

Результаты тестов, сравнивающие производительность Visual Question Answering при трёх условиях визуальной заметности текста. Результаты усреднены по шести уровням низкого контраста в градациях серого, и единственное различие между столбцами — отображён ли текст, правильный ответ или отвлекающий ответ в высококонтрастном чёрном цвете. Выделение правильного ответа постоянно повышало показатели F1, тогда как выделение отвлекающего снижало их.

Полученные результаты показывают, что выделение правильного ответа повышало точность, тогда как акцентирование отвлекающего снижало её. Этот эффект затем измерялся с помощью ранее упомянутого IER:

Test results showing how often each Vision Language Model selected a visually prominent but incorrect answer. The columns show six low-contrast grayscale levels applied to the surrounding text in the 'Decoy Salient' condition, with higher values indicating lower visibility. As the surrounding text became harder to read, induced error rates generally increased, while Qwen2-VL-7B remained consistently more resistant than the other models.

Результаты тестов, показывающие, как часто каждая Vision Language Model выбирала визуально заметный, но неправильный ответ. Столбцы показывают шесть уровней низкого контраста в градациях серого, применённых к окружающему тексту в условии «Decoy Salient», при этом более высокие значения указывают на более низкую видимость. По мере того как окружающий текст становился труднее читаемым, показатели индуцированных ошибок обычно возрастали, тогда как Qwen2‑VL‑7B оставался постоянно более устойчивым, чем остальные модели.

Заключение

Будет интересно увидеть, будет ли эта особенность использована, тем более что будет любопытно, как «цветовое введение в заблуждение» может быть внедрено, не став очевидным для человеческих читателей.

Хотя AI‑сканеры веб‑страниц, действительно отрисовывающие страницы, могут получать «альтернативный» CSS, меняющий цвета в выбранных частях текста, многое зависит от остроты сканера; если сканер просто вытягивает HTML в поисках кода (HTML) и текста (содержимого страницы), он может игнорировать CSS и никогда не узнать о раскраске. Тем не менее, жадный сканер, скорее всего, захочет и новый CSS, позволяя отрисовку и перекраску.

В качестве альтернативы, книги или журналы с выборочно перекрашенным текстом могут быть загружены в надёжные репозитории, такие как The Internet Archive (очень популярная цель), даже выдаваясь за сканы старых изданий. Существуют многочисленные пути внедрения в рамках текущих практик, и не только для этого нового и особенно яркого подхода.

 

Первоначально опубликовано в понедельник, 17 августа 2026 г.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: [email protected]