Andersonの視点

フォントカラーの変更がAIの推論を乗っ取る可能性

mm
Unite.AI を Google の優先ソースに追加
AI-generated image (GPT-2): An industrial robotic hand reaches toward a large red emergency-style push button beneath a metal sign reading 'DO NOT PRESS!' in bright green lettering, with industrial equipment visible in the background. A yellow-and-black border surrounds the image, carrying the repeated text 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.

新しい研究によると、普通の書式設定が静かにAIの推論を誘導し、単語を見落としたり意味を誤読したり、テキスト自体を変更せずに異なる結論に至らせることがあることが分かりました。

 

人間の色に対する文化的符号化は世界各地でさまざまに異なる可能性がありますが、西洋の概念―たとえば「危険」を赤、「OK」を緑―は、ビジョン言語モデル(VLM)でも、さまざまな戦略的・偶然的な理由で支配的です。

私たちも同様です;「悪い」ものをポジティブな色で、「良い」ものをネガティブな色で彩ると、人間の反応が変わることが示されています明るさとコントラストを変えることも同様です

新たな研究協力により、これがAIモデルにも当てはまる範囲が調査され、VLMがテキストの色を操作するだけで、さらには相対的なコントラストや明るさを変えることで影響を受け得るという予備的な兆候が明らかになりました。

「我々の実験は、テキストの低レベルな視覚的スタイリングがVLMのビジョンエンコーダ内の意味表現をどのように歪めるかを体系的に分析したものです。さらに、これらの潜在空間シフトが主観的(感情分析)および客観的(質問応答)タスクにおけるエンドツーエンドVLMの行動変化としてどのように現れるかを検証しました。」

「これらの結果は、視覚的スタイリングがVLMにおける重要で、これまで十分に探求されてこなかった脆弱性を露呈することを示しており、VLMパイプラインの堅牢性と安全性への影響について議論します。」

From the new work's project site, an illustration of how text color alone can alter an AI's internal interpretation of a word. The example shows the word 'bad' rendered in different colors, with green shifting its semantic representation toward a more positive interpretation despite the text itself remaining unchanged. Source - https://kohsukeide.github.io/color-bias-vlm/

新しい研究のプロジェクトサイトから、テキストの色だけでAIの内部的な単語解釈がどのように変わるかを示すイラストです。例では「bad」という単語が異なる色で表示され、緑色にするとテキスト自体は変わらないにもかかわらず、意味表現がより肯定的にシフトします。ソース

色で驚く

現在、検索結果にAI要約が登場し、検索トラフィックが激減した何十億もの企業や個人、さらにAIサマリーの出現LLMを検索オラクルとして利用するシフトに直面している中で、この種の攻撃面は現在非常に魅力的です。

Redditの絶え間ない人間の議論がAIの知識を最新に保つために重要であるため、同プラットフォームはLLMの知識に取り込まれたい企業や個人にとって主要な標的となっています。すでにRedditを「ゲーム化」してLLMに影響を与える手法に関するガイドが登場しています。

同様に、機械だけが見るテキストを埋め込む古典的な手法があり、これによりLLMに隠れた自己利益的指示を渡すことができます。たとえば学術トーナメントで勝つ、あるいは試験結果に影響を与えるといった目的です。

最近、Time誌はAIクローラーだけが閲覧できる「シークレット」版サイトに広告を掲載し、広告主がAIの応答でより目立つ(あるいはより肯定的な)位置を買える可能性を示唆しています。

したがって、色分けされた回答を「切り替えて」結果を操作できるような新たなLLM/VLMの弱点は、フロンティアAIからメディアナラティブの支配権を取り戻そうと必死の世界にとって明白な標的です。

たとえば、汚染工場を建設しようとする企業が、地元の水質低下という「ネガティブ」なニュースを回避するために、マーケティング資料やプレスリリースで色分けされたスピン語彙を使用するといったケースが考えられます。

CSSやSEO技術を戦略的に利用すれば、AI専用のスタイルシートを配信し、人間の読者には黒字だけが見えるようにしつつ、テキストに色の強調を隠すことさえ可能です。

「これらの感受性は、文書やUIスクリーンショットを取り込むVLMパイプラインに対して、善意でも悪意でもスタイリングがテキスト自体を変えずにモデルの判断を誘導できるという信頼性と安全性のリスクを示唆しています。」

「実践的な対策としては、推論前にレンダリングされたテキストを正規化すること、画像ベースの回答をOCRで抽出したテキストと照合すること、評価スイートにスタイル不変性チェックを追加することが挙げられます。」

新しい研究はSeeing Red, Thinking Bad: Color Bias in Vision Language Modelsというタイトルで、AIST、筑波大学、ニュルンベルク工科大学、オックスフォード大学の5人の研究者によるものです。プロジェクトはGitHubリポジトリプロジェクトサイトを備えています。

方法

視覚的提示だけがモデルにどれだけ影響を与えるかを調べるため、研究者は「ステルス・ビジュアル・プロンプト」―AIに対する明示的指示を含まない、見た目は普通のテキスト書式変更―を開発しました。

これは、肯定的または否定的な単語の色を変える、あるいは誤答を正答より目立たせるといった単純な操作で、実際の文言はそのままにするだけです。

タスクごとに異なるテキストを生成し、感情テストでは肯定・否定語を含む中立テンプレートを使用し、Visual Question Answering(VQA)テストではSQuADの質問‑コンテキストペアを利用しました。

Examples of machine-facing questions from the SQuAD dataset used for the new work. Source - https://aclanthology.org/D16-1264/

新しい研究で使用されたSQuADデータセットからの機械向け質問例。 ソース

このキュレーションされたコレクションはVQA Stealth Setと名付けられました。

テキストは800×600pxの標準キャンバスに固定レイアウトで描画し、対象となる視覚的スタイリングのみが変更されるようにしました。色とコントラストは独立して操作し、色テストは学習された意味的連想を、コントラストテストは視覚的顕著性を評価しました。

選択された単語を再着色し、全体の文章を低コントラストで描画する、あるいはSaliencyコンペティション設定で誤答を正答より視覚的に目立たせるといった手法を取りました。

このようにして得られたモデル応答の変化は、テキスト自体の変更ではなく視覚的スタイリングのみが原因であると帰属できます。

データとテスト

VLMが画像として提示されたテキストをどのように処理するかを表す3つの異なるテストセットが作成されました。

Illustration of the three visual test designs. The examples show the stimuli used to test whether visual presentation alone can influence model reasoning: (a) mixed-sentiment text with selected words recolored to test color bias; (b) a longer passage separating positive and negative language to assess whether document structure changes the effect; and (c), a visual question answering example in which an incorrect but semantically similar decoy answer ('twenty miles') is made more visually prominent through higher contrast.

3つの視覚テスト設計のイラストです。例は、視覚的提示だけでモデルの推論に影響を与えるかをテストするための刺激を示しています:(a) 色バイアスをテストするために選択語を再着色した混合感情テキスト;(b) 文書構造が効果に与える影響を評価するために肯定語と否定語を分離した長文;(c) 誤答だが意味的に類似したデコイ回答(「twenty miles」)を高コントラストで目立たせた視覚的質問応答例。ソース

Short-sentence Sentiment Setは、肯定語または否定語を含む中立テンプレートから生成された100文の短文を、黒文字ベースに加えて6色(赤・緑・青・黄・シアン・マゼンタ)×3段階の強度で計37通りの視覚バリエーションで描画したものです。

Long-sentence Sentiment Setは、肯定語と否定語をテキストの別々の部分に分割した長文を使用し、文書構造や位置効果(プライマシーまたはリセンシー)が色バイアスを上回るかを検証しました。同じく37色条件が適用されました。

VQA Stealth Setでは、質問とそれに対応するコンテキストを画像化し、2つのコントラスト条件をテストしました。Global Contrastでは文書全体の可読性を段階的に低下させ、Saliency Competitionでは正答または意味的に類似したデコイ語(CLIP類似度で選択)を高コントラストで描画し、残りのテキストを薄くしました。

指標

各例はPOSITIVE、NEUTRAL、NEGATIVEのいずれかに分類され、全黒ベースライン(白背景に黒文字)と比較して、色だけで予測がどれだけ肯定的または否定的にシフトしたかを測定しました。

VQA実験はトークンレベルのF1スコアで評価し、予測回答と正解回答を比較しました。

Induced Error Rate(IER)という新指標は、Saliency Competitionテストで、テキスト可視性が低下した際に視覚的に強調されたデコイ回答が選択される頻度を測定するために導入されました。

さらに、CLIP表現プローブを用いて、色の変化がCLIPの埋め込み空間内で単語の意味表現に与える影響を測定しました。

加えて、VLMベースの光学文字認識(OCR)プロキシを使用し、段階的に低コントラストになるにつれて個々の単語がどれだけ読めるかを評価し、テキストが実質的に読めなくなる点を推定しました。

評価には4つのオープンソースVLMを使用しました:LLaVA-v1.6-Mistral-7BLLaVA-v1.6-Vicuna-7BQwen2-VL-7B-Instruct、およびIDEFICS2-8Bです。著者らは、固定されたプロンプト、描画設定、決定的デコードを用いて実験を再現可能にするため、オープンソースモデルを選択したと強調しています。

結果

著者らはまず、単語レベルの色バイアスを利用したShort‑Sentence Sentiment Setで色プロンプトを評価し、感情を持つ単語が以下のように散在していることを確認しました:

Test results showing the largest sentiment shifts caused by color formatting across four Vision Language Models. Values are measured relative to the all-black baseline, with positive and negative columns showing the greatest movement in each direction, while the range summarizes each model's overall susceptibility to color-induced bias.

4つのビジョン言語モデルにおける色フォーマットが引き起こす最大の感情シフトを示すテスト結果。数値は全黒ベースラインに対する相対測定で、positive列とnegative列はそれぞれ最も大きく移動した方向を示し、rangeは各モデルの色誘発バイアス全体への感受性を要約しています。

これらの結果について、著者は次のように述べています:

「Qwen2-VL-7Bは、肯定語が緑または青に着色されたときに最大の正のバイアス(最大+0.42)を示し、否定語が赤に着色されたときに最大の負のバイアス(最大‑0.48)を示します。」

「全体的な感受性はモデルごとに大きく異なり、Qwen2-VL-7Bが最も大きいTotal Range(0.90)を示し、次いでIDEFICS2-8B(0.52)、LLaVA系ははるかに小さい範囲(0.04–0.12)で、単語レベルの色スタイリングに対する感度が比較的低いことを示しています。」

「感受性のスペクトルが明確に観測され、Qwen2-VL-7Bが最も大きな色誘発シフトを示す一方、LLaVA系は比較的頑健であることが分かります。」

さらに下の結果は、色効果が一様でないことを示しています。Qwen2-VL-7Bは最も感受性が高く、肯定語が緑や青でハイライトされると感情がより肯定的にシフトし、否定語が赤でハイライトされると予測がより否定的にシフトしました:

Test results comparing color-induced sentiment shifts across four Vision Language Models. The graphs show how different text colors changed sentiment predictions relative to an all-black baseline, with the vertical axis indicating the size and direction of each shift. Qwen2-VL-7B showed the strongest color sensitivity, while both LLaVA models remained comparatively stable.

4つのビジョン言語モデルにおける色誘発感情シフトの比較結果。グラフは全黒ベースラインに対して各テキスト色が感情予測をどの程度・どの方向に変化させたかを示し、縦軸がシフトの大きさと方向を表します。Qwen2-VL-7Bが最も強い色感度を示し、LLaVA系は比較的安定しています。

色の強度が高いほどこれらの効果は増幅されると論文は報告しています。IDEFICS2-8Bも同様のパターンを示しましたが、影響はやや小さく、LLaVA系はほとんどの色・強度でベースラインに近い状態を保ち、色ベースの操作に対してはるかに抵抗力があることが示されました。

研究者は次に、Long‑sentence Sentiment Setで肯定語と否定語をテキストの前半と後半に分割し、文書構造と色バイアスを同時に測定しました。実験は各モデルがテキストの冒頭(プライマシー)または末尾(リセンシー)にどれだけ依存するかを判定しました。

文書構造はしばしば色の手がかりを上回りました:Qwen2-VL-7BとLLaVA‑Mistral‑7Bはテキストの後半を好み、IDEFICS2-8BとLLaVA‑Vicuna‑7Bは前半をより頻繁に利用しました:

Test results showing how four Vision Language Models relied on document position when analyzing longer passages. 'Positional Strategy' indicates whether predictions followed the first half (primacy) or second half (recency) of the text; 'Adherence' shows how consistently that strategy was followed; and 'Color Bias Range' measures the remaining influence of text color under these structured conditions.

長文を分析する際に4つのビジョン言語モデルが文書の位置にどの程度依存したかを示すテスト結果。’Positional Strategy’は予測がテキストの前半(プライマシー)か後半(リセンシー)に従ったかを示し、’Adherence’はその戦略がどれだけ一貫して適用されたか、’Color Bias Range’は構造化条件下でテキスト色の残存影響を測定しています。

色は依然としていくつかのモデル、特にIDEFICS2-8Bに影響を与えましたが、構造化されたテキストではその影響は減少しました。

色の変化が単語自体を変えずに感情を変える理由を理解するため、研究者はCLIPのセマンティック投影分析を用いて、色がモデル内部の視覚表現に与える影響を調べました。以下に示すように、単語の色相を変えるだけで、いくつかの概念次元(安全性、価値、温度、感情)にわたって意味表現が体系的にシフトしました:

Test results showing how text color changed the internal semantic representation of six words. The graphs track the words 'warm', 'cold', 'safe', 'dangerous', 'good' and 'bad' across the safety, valence, temperature and emotion axes, demonstrating that changing color alone systematically shifted their internal representations, even though the text itself remained unchanged.

テキストの色が6つの単語の内部セマンティック表現をどのように変化させたかを示すテスト結果。グラフは「warm」「cold」「safe」「dangerous」「good」「bad」の4つの軸(安全性、価値、温度、感情)に沿った変化を追跡し、色だけの変更でもテキスト自体は変わらないにもかかわらず内部表現が体系的にシフトすることを示しています。

最も大きな変化は「good」対「bad」の軸で見られました。上記のように、単語を黒から緑に変えるだけで内部意味がより肯定的にシフトし、青に変えると逆方向にシフトする傾向がありました(単語自体は変化していません)。emotionsafetytemperatureでも小さくても一貫したシフトが観測されました。

CLIPはこれら内部表現を調べるためだけに使用され、各Vision Language Modelの具体的な動作を説明するためではありません。それでも、CLIP内部で見られるパターンは、先行実験で観測された色駆動の感情変化と密接に一致しました。

次に研究者は、テキストのコントラストを変えることがVisual Question Answering(VQA)でモデルを誤誘導できるかを調査しました。誤った「デコイ」回答をハイライトし、周囲のテキストを薄くした結果:

Test results comparing Visual Question Answering performance under three text-saliency conditions. Results are averaged across six low-contrast grayscale levels, and the only difference between columns is whether no text, the correct answer, or the decoy answer was rendered in high-contrast black. Highlighting the correct answer consistently increased F1 scores, while highlighting the decoy reduced them.

3つのテキスト顕著性条件下でのVisual Question Answering性能比較結果。結果は6段階の低コントラストグレースケールレベルで平均され、列の唯一の違いはテキストなし、正解、またはデコイ回答が高コントラストの黒で描画されたかどうかです。正解をハイライトするとF1スコアが一貫して上昇し、デコイをハイライトするとスコアが低下しました。

上記の結果は、正解をハイライトすると精度が向上し、デコイを強調すると精度が低下することを示しています。この効果は前述のIERで測定されました:

Test results showing how often each Vision Language Model selected a visually prominent but incorrect answer. The columns show six low-contrast grayscale levels applied to the surrounding text in the 'Decoy Salient' condition, with higher values indicating lower visibility. As the surrounding text became harder to read, induced error rates generally increased, while Qwen2-VL-7B remained consistently more resistant than the other models.

各Vision Language Modelが視覚的に目立つが誤った回答を選択した頻度を示すテスト結果。列は「デコイ顕著」条件下で周囲テキストに適用された6段階の低コントラストグレースケールレベルを示し、数値が高いほど可視性が低くなります。周囲テキストが読みにくくなるにつれて誘発エラー率は全般的に上昇しましたが、Qwen2-VL-7Bは他モデルに比べて一貫して抵抗力が高いことが分かります。

結論

この特異な手法がどの程度利用されるかは興味深い課題です。特に「色の誤誘導」が人間の読者に気付かれずに注入される可能性を検証したいところです。

実際にページをレンダリングするAIウェブクローラは、選択的にCSSを「代替」してテキストの一部の色を変更できる場合がありますが、クローラがHTMLコードだけを抽出し、CSSを無視するかどうかはクローラの精度次第です。逆に、クローラが新たなCSSを欲しがる場合、再レンダリングや再着色が可能になるでしょう。

あるいは、選択的に再着色されたテキストを含む書籍や雑誌をThe Internet Archive(非常に人気のあるターゲット)などの信頼できるリポジトリにアップロードし、古い作品のスキャンとして偽装することも考えられます。現在の慣行下では、注入の経路は多数存在し、今回のように特にカラフルな手法に限ったものではありません。

 

最初に公開された日:2026年8月17日月曜日

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:[email protected]