Anderson의 관점

글꼴 색상 변경이 AI 추론을 탈취할 수 있다

mm
Unite.AI를 Google의 선호 소스에 추가
AI-generated image (GPT-2): An industrial robotic hand reaches toward a large red emergency-style push button beneath a metal sign reading 'DO NOT PRESS!' in bright green lettering, with industrial equipment visible in the background. A yellow-and-black border surrounds the image, carrying the repeated text 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.

새로운 연구에 따르면 일반적인 서식이 AI 추론을 은밀히 조종하여 단어를 간과하고 의미를 오해하며 텍스트 자체를 변경하지 않고도 다른 결론에 도달하게 만든다고 밝혀졌다.

 

인간의 색에 대한 문화적 인코딩은 전 세계적으로 다를 수 있다, 그러나 서구의 관념—예를 들어 ‘위험’을 의미하는 빨강, ‘괜찮음’을 의미하는 초록—은 다양한 전략적 및/또는 우연적 이유로 아시아 비전 언어 모델(VLM)에서도 우세한 경향이 있다.

우리는 다르지 않다; ‘나쁜’ 것을 긍정적인 색으로, ‘좋은’ 것을 부정적인 색으로 색칠하면 인간은 다르게 반응한다. 밝기와 대비를 변경하는 것도 마찬가지이다.

새로운 연구 협력이 이것이 AI 모델에도 적용되는 정도를 탐구했으며, VLM이 텍스트 색상을 조작하거나 상대적인 대비와 밝기를 변경함으로써 영향을 받을 수 있다는 초기 징후를 발견했다.

‘우리 실험은 텍스트의 저수준 시각적 스타일링이 VLM의 비전 인코더 내 의미 표현을 어떻게 왜곡하는지 체계적으로 분석한다. 또한 이러한 잠재공간 변이가 주관적(감정 분석) 및 객관적(질문 응답) 과제 전반에 걸친 엔드투엔드 VLM의 행동 변화를 어떻게 나타내는지 조사한다.’

‘이 결과는 시각적 스타일링이 VLM의 중요한, 이전에 충분히 탐구되지 않은 취약점을 드러내며, 우리는 이것이 VLM 파이프라인의 견고성과 안전성에 미치는 영향을 논의한다.’

From the new work's project site, an illustration of how text color alone can alter an AI's internal interpretation of a word. The example shows the word 'bad' rendered in different colors, with green shifting its semantic representation toward a more positive interpretation despite the text itself remaining unchanged. Source - https://www.unite.ai/wp-content/uploads/2026/08/site-graph2.jpg

새 작업의 프로젝트 사이트에서, 텍스트 색상만으로 AI의 내부 단어 해석이 어떻게 바뀔 수 있는지를 보여주는 일러스트이다. 예시는 ‘bad’라는 단어가 다른 색으로 표시된 것으로, 초록색이 텍스트 자체는 변하지 않았음에도 의미 표현을 보다 긍정적으로 이동시킨다. 출처

색으로 놀라다

현재, 극심하게 감소된 검색 트래픽을 가진 수십억 기업 및 개인에게, AI 요약의 등장LLM을 검색 오라클로 전환함에 따라, 이러한 성격의 공격 표면은 현재 매우 매력적이다.

Reddit의 지속적인 인간 토론이 AI의 지식을 최신 상태로 유지하는 데 필수적이기 때문에, 이 소셜 미디어 플랫폼은 LLM 지식에 포함되길 원하는 기업 및 개인의 주요 표적이 되었다; Reddit를 ‘게임화’하여 LLM에 영향을 주는 프록시 방법에 관한 가이드가 이미 등장했다.

비슷하게, 기계만 볼 수 있는 텍스트를 포함시켜 LLM에 숨겨진 자기 이익 지시를 전달하는 오래된 트릭이 있다, 이를 통해 학술 대회에서 승리하거나 시험 결과에 영향을줄 수 있다.

최근 Time 잡지가 광고를 삽입하기 시작했다, 이는 새로운 데이터를 위해 지속적으로 사이트를 탐색하는 AI 웹 크롤러에게만 보이는 ‘비밀’ 버전이다. 따라서 광고주는 AI 응답에서 더 큰 가시성(또는 더 긍정적인 해석)을 구매할 수 있다.

따라서 색상 코드가 된 응답을 ‘전환’하여 결과를 조작할 수 있는 새로운 LLM/VLM 취약점은 최첨단 AI로부터 미디어 서사를 되찾으려는 세계에게 명백한 표적이다.

예를 들어, 지역 수질을 악화시킬 오염 공장을 건설하려는 기업은 마케팅 자료나 보도 자료에서 색상 코딩을 사용해 회전어휘에 추가함으로써 대부분이 ‘부정적’이라고 여길 뉴스를 회피할 수 있다.

전략적인 CSS 및/또는 SEO 기술 사용은 AI 전용 스타일시트를 제공하여 인간 독자에게는 숨겨진 텍스트에 색 강조를 부여함으로써 색상 조작을 감출 수 있다. 인간은 검은색 텍스트만 보게 된다.

‘이러한 민감성은 문서나 UI 스크린샷을 수집하는 VLM 파이프라인에 신뢰성 및 안전성 위험을 의미한다: 온건하거나 적대적인 스타일링이 기본 텍스트를 변경하지 않고도 모델 결정을 좌우할 수 있다.’

‘실용적인 방어책으로는 추론 전 렌더링된 텍스트를 정규화하고, 이미지 기반 답변을 OCR 추출 텍스트와 교차 확인하며, 평가 스위트에 스타일 불변성 검사를 추가하는 것이 포함된다.’

새 작업은 Seeing Red, Thinking Bad: Color Bias in Vision Language Models라는 제목이며, 일본 국립연구개발법인(AIST), 쓰쿠바 대학, 뉘른베르크 기술대학, 옥스퍼드 대학의 다섯 명 연구자가 참여했다. 이 이니셔티브는 GitHub 저장소프로젝트 사이트를 제공한다.

방법

시각적 프레젠테이션만으로 모델에 얼마나 영향을 미칠 수 있는지 알아보기 위해 연구자들은 ‘Stealth Visual Prompts’라는 일반적인 텍스트 서식 변화를 개발했으며, 이는 AI에 명시적인 지시를 포함하지 않는다.

이는 긍정 또는 부정 단어의 색을 바꾸거나, 정답보다 잘못된 답을 더 눈에 띄게 만들어 실제 문구는 그대로 두는 정도로 간단할 수 있다.

각 작업마다 다른 텍스트가 생성되었으며, 감정 테스트는 긍정 및 부정 단어가 채워진 중립 템플릿을 사용했고, Visual Question Answering(VQA) 테스트는 SQuAD의 질문-문맥 쌍을 활용했다:

Examples of machine-facing questions from the SQuAD dataset used for the new work. Source - https://aclanthology.org/D16-1264/

새 작업에 사용된 SQuAD 데이터셋의 기계용 질문 예시. 출처

그 결과 정제된 컬렉션은 VQA Stealth Set이라고 명명되었다.

텍스트는 800x600px 표준 캔버스에 고정 레이아웃으로 렌더링되어, 목표 시각 스타일링만 변경되도록 했다. 색상과 대비는 독립적으로 조작되었으며, 색상 테스트는 의미 연관성을, 대비 테스트는 시각적 현저성을 평가했다.

선택된 단어는 색을 다시 입혔고, 전체 구절은 낮은 대비로 렌더링되었다; 또는 Saliency Competition 설정에서는 잘못된 답이 정답보다 시각적으로 더 두드러지게 만들었다.

따라서 모델 응답의 모든 변화는 기본 텍스트가 아닌 시각적 스타일링에만 기인한다는 결론을 내릴 수 있다.

데이터 및 테스트

VLM이 이미지로 제시된 텍스트를 처리하는 다양한 방식을 나타내기 위해 세 가지 구별된 테스트 세트가 만들어졌다:

Illustration of the three visual test designs. The examples show the stimuli used to test whether visual presentation alone can influence model reasoning: (a) mixed-sentiment text with selected words recolored to test color bias; (b) a longer passage separating positive and negative language to assess whether document structure changes the effect; and (c), a visual question answering example in which an incorrect but semantically similar decoy answer ('twenty miles') is made more visually prominent through higher contrast.

세 가지 시각 테스트 디자인의 일러스트. (a) 색 편향을 테스트하기 위해 선택된 단어를 다시 색칠한 혼합 감정 텍스트; (b) 문서 구조가 효과에 미치는지를 평가하기 위해 긍정 및 부정 언어를 구분한 긴 구절; (c) 잘못된 답이지만 의미적으로 유사한 ‘twenty miles’가 높은 대비를 통해 시각적으로 더 두드러지게 된 VQA 예시.출처

Short-sentence Sentiment Set은 긍정 또는 부정 단어가 포함된 중립 템플릿에서 생성된 100개의 짧은 문장을 사용해 단어 수준 색 편향을 테스트한다. 각 문장은 검정 텍스트 기준에 여섯 가지 색(빨강, 초록, 파랑, 노랑, 청록, 마젠타)과 세 가지 강도 수준을 조합한 37개의 시각 버전으로 렌더링되었다.

Long-sentence Sentiment Set은 긍정 및 부정 언어를 텍스트의 서로 다른 부분으로 분리한 긴 구절을 사용했다. 이는 선행효과 또는 후행효과(문서 내에서 정보가 앞이나 뒤에 나타날 때 가중치가 달라지는 편향)가 색 편향보다 더 큰 영향을 미치는지를 판단하기 위함이다. 동일한 37가지 색 조건이 적용되었다.

VQA Stealth Set에서는 질문과 해당 문맥을 이미지로 렌더링한 뒤, 두 가지 대비 기반 조건을 테스트했다; Global Contrast에서는 전체 문서의 가독성을 점진적으로 낮은 대비 수준으로 감소시켰고, Saliency Competition에서는 정답이나 의미적으로 유사한 유인 답(CLIP 유사도 사용)을 높은 대비로 렌더링하고 나머지 텍스트는 흐리게 처리했다.

측정항목

각 예시는 POSITIVE, NEUTRAL, NEGATIVE 중 하나로 분류되었다. 이후 모든 분류 결과를 전체 검정(흰 배경에 검정 텍스트) 기준과 비교해 색상만으로 예측이 얼마나 긍정적 또는 부정적으로 이동했는지 측정했다.

VQA 실험은 토큰 수준 F1 점수로 평가했으며, 예측 답안을 정답과 비교했다.

Induced Error Rate(IER)이라는 새로운 측정항목이 Saliency Competition 테스트를 위해 도입되었으며, 텍스트 가시성이 감소했을 때 시각적으로 강조된 유인 답이 선택되는 빈도를 측정한다.

또한 임베딩 공간에서 색상 변화가 단어의 의미 표현을 어떻게 바꾸는지 측정하기 위해 CLIP 표현 프로브를 사용했다.

점진적으로 낮은 대비 수준에서 개별 단어를 읽을 수 있는지를 평가하기 위해 광학 문자 인식(OCR) 프록시를 활용해 텍스트가 효과적으로 읽을 수 없게 되는 시점을 추정했다.

평가는 네 가지 오픈소스 VLM을 사용했다: LLaVA-v1.6-Mistral-7B, LLaVA-v1.6-Vicuna-7B, Qwen2-VL-7B-Instruct, IDEFICS2-8B. 저자들은 실험 재현성을 위해 고정 프롬프트, 렌더링 설정, 결정적 디코딩을 적용한 오픈소스 모델을 선택했다고 강조한다.

결과

저자들은 처음에 Short‑Sentence Sentiment Set에서 색 프롬프트를 평가했으며, 여기서는 단어 수준 색 편향을 활용해 감정 단어가 섞여 있었다:

Test results showing the largest sentiment shifts caused by color formatting across four Vision Language Models. Values are measured relative to the all-black baseline, with positive and negative columns showing the greatest movement in each direction, while the range summarizes each model's overall susceptibility to color-induced bias.

네 가지 비전 언어 모델에서 색 서식이 초래한 가장 큰 감정 이동을 보여주는 테스트 결과. 값은 전체 검정 기준에 대해 측정되었으며, 긍정 및 부정 열은 각각 가장 큰 이동을 나타내고, 범위는 각 모델의 색 유도 편향에 대한 전반적인 민감성을 요약한다.

이 결과에 대해 저자들은 다음과 같이 밝혔다:

‘Qwen2‑VL‑7B는 긍정 단어가 초록/파랑으로 색칠될 때 가장 큰 긍정 편향(+0.42)을 보이며, 부정 단어가 빨강으로 색칠될 때 가장 큰 부정 편향(-0.48)을 보인다.’

‘전체 민감도는 모델마다 크게 차이나며, Qwen2‑VL‑7B가 가장 큰 총 범위(0.90)를 보이고, 그 다음이 IDEFICS2‑8B(0.52)이며, LLaVA 변형은 훨씬 작은 범위(0.04–0.12)를 보여 색상 기반 단어 수준 스타일링에 대한 민감도가 비교적 낮다.’

‘우리는 명확한 민감도 스펙트럼을 관찰한다: Qwen2‑VL‑7B가 가장 큰 색 유도 이동을 보이며, LLaVA 변형은 비교적 견고하다.’

아래 추가 결과는 색 효과가 고르게 나타나지 않음을 보여준다: Qwen2‑VL‑7B가 가장 민감했으며, 긍정 단어가 강조될 때 초록 및 파랑 텍스트가 감정을 보다 긍정적으로 이동시키고, 부정 단어가 강조될 때 빨강 텍스트가 예측을 보다 부정적으로 이동시켰다:

Test results comparing color-induced sentiment shifts across four Vision Language Models. The graphs show how different text colors changed sentiment predictions relative to an all-black baseline, with the vertical axis indicating the size and direction of each shift. Qwen2-VL-7B showed the strongest color sensitivity, while both LLaVA models remained comparatively stable.

네 가지 비전 언어 모델에서 색 유도 감정 이동을 비교한 테스트 결과. 그래프는 전체 검정 기준에 대해 다양한 텍스트 색상이 감정 예측을 어떻게 변화시켰는지를 보여주며, 수직축은 이동 크기와 방향을 나타낸다. Qwen2‑VL‑7B가 가장 강한 색 민감성을 보였고, 두 LLaVA 모델은 비교적 안정적이었다.

색 강도가 강할수록 이러한 효과가 일반적으로 증폭된다고 논문은 보고한다: IDEFICS2‑8B도 유사한 패턴을 보였지만 정도는 낮았으며, 두 LLaVA 변형은 대부분의 색과 강도에서 기준에 가깝게 유지돼 색 기반 조작에 대한 저항력이 훨씬 높았다.

연구진은 이후 Long‑sentence Sentiment Set에서 긍정과 부정 언어를 구절의 서로 다른 절반으로 구분해 문서 구조와 색 편향을 동시에 측정했다. 실험은 각 모델이 구절의 앞부분(선행) 또는 뒤부분(후행)에 더 많이 의존하는지를 판단했다.

문서 구조가 색 단서보다 더 큰 영향을 미치는 경우가 많았다: Qwen2‑VL‑7B와 LLaVA‑Mistral‑7B는 텍스트의 두 번째 절반을 선호했으며, IDEFICS2‑8B와 LLaVA‑Vicuna‑7B는 첫 번째 절반에 더 많이 의존했다:

Test results showing how four Vision Language Models relied on document position when analyzing longer passages. 'Positional Strategy' indicates whether predictions followed the first half (primacy) or second half (recency) of the text; 'Adherence' shows how consistently that strategy was followed; and 'Color Bias Range' measures the remaining influence of text color under these structured conditions.

네 가지 비전 언어 모델이 긴 구절을 분석할 때 문서 위치에 어떻게 의존했는지를 보여주는 테스트 결과. ‘Positional Strategy’는 예측이 텍스트의 첫 절반(선행) 또는 두 번째 절반(후행)을 따랐는지를 나타내고, ‘Adherence’는 해당 전략이 얼마나 일관되게 적용됐는지를, ‘Color Bias Range’는 이러한 구조적 조건에서 텍스트 색상의 남은 영향을 측정한다.

색은 여전히 일부 모델, 특히 IDEFICS2‑8B에 영향을 미쳤지만 구조화된 텍스트에서는 그 영향력이 감소했다.

색 변화가 단어 자체를 바꾸지 않고도 감정을 바꿀 수 있는 이유를 이해하기 위해 연구진은 CLIP 의미 투영 분석을 사용해 모델의 내부 시각 표현이 색에 따라 어떻게 변하는지 조사했다. 아래와 같이 색조 변경은 여러 개념 차원에서 의미 표현을 일관되게 이동시켰다:

Test results showing how text color changed the internal semantic representation of six words. The graphs track the words 'warm', 'cold', 'safe', 'dangerous', 'good' and 'bad' across the safety, valence, temperature and emotion axes, demonstrating that changing color alone systematically shifted their internal representations, even though the text itself remained unchanged.

여섯 단어(‘warm’, ‘cold’, ‘safe’, ‘dangerous’, ‘good’, ‘bad’)의 내부 의미 표현이 텍스트 색상에 따라 어떻게 변했는지를 보여주는 테스트 결과. 그래프는 안전성, 가치, 온도, 감정 축을 따라 각 단어의 변화를 추적해 색상만 변경해도 텍스트 자체는 변하지 않았음에도 내부 표현이 체계적으로 이동함을 보여준다.

가장 큰 변화는 ‘good’ 대 ‘bad’ 축에서 나타났다. 위에서 보듯 검정을 초록으로 바꾸면 내부 의미가 보다 긍정적으로 이동하고, 파랑은 반대로 이동한다—단어 자체는 변하지 않는다. 감정, 안전성, 온도 축에서도 작지만 일관된 이동이 관찰되었다.

CLIP은 이러한 내부 표현을 조사하기 위해서만 사용되었으며, 모든 Vision Language Model이 정확히 어떻게 작동하는지를 설명하기 위해 사용된 것은 아니다. 그럼에도 불구하고 CLIP 내부에서 관찰된 패턴은 앞선 실험에서 색에 의해 유도된 감정 변화와 밀접하게 일치했다.

연구진은 이후 텍스트 대비를 변경하는 것이 색만큼 Vision Language Model을 오도할 수 있는지 조사했다. 잘못된 ‘유인’ 답을 강조하고 주변 텍스트를 흐리게 만들었다:

Test results comparing Visual Question Answering performance under three text-saliency conditions. Results are averaged across six low-contrast grayscale levels, and the only difference between columns is whether no text, the correct answer, or the decoy answer was rendered in high-contrast black. Highlighting the correct answer consistently increased F1 scores, while highlighting the decoy reduced them.

세 가지 텍스트 현저도 조건에서 Visual Question Answering 성능을 비교한 테스트 결과. 결과는 여섯 단계의 저대비 그레이스케일 수준에 대해 평균을 낸 것이며, 열 간 차이는 텍스트가 없거나 정답 또는 유인 답이 고대비 검정으로 렌더링되었는지 여부뿐이다. 정답을 강조하면 F1 점수가 일관되게 상승하고, 유인 답을 강조하면 점수가 감소한다.

위 결과는 정답을 강조하면 정확도가 향상되고, 유인 답을 강조하면 정확도가 감소한다는 것을 보여준다. 이 효과는 앞서 언급한 IER을 통해 측정되었다:

Test results showing how often each Vision Language Model selected a visually prominent but incorrect answer. The columns show six low-contrast grayscale levels applied to the surrounding text in the 'Decoy Salient' condition, with higher values indicating lower visibility. As the surrounding text became harder to read, induced error rates generally increased, while Qwen2-VL-7B remained consistently more resistant than the other models.

각 Vision Language Model이 시각적으로 두드러지지만 잘못된 답을 선택한 빈도를 보여주는 테스트 결과. 열은 ‘Decoy Salient’ 조건에서 주변 텍스트에 적용된 여섯 단계의 저대비 그레이스케일 수준을 나타내며, 값이 높을수록 가시성이 낮다. 주변 텍스트가 읽기 어려워질수록 유도 오류율이 일반적으로 증가했으며, Qwen2‑VL‑7B는 다른 모델보다 일관되게 더 저항성을 보였다.

결론

이 특정 결함이 활용될지 여부는 흥미로운 문제이며, 특히 ‘색상 오도’가 인간 독자에게 눈에 띄지 않게 어떻게 주입될 수 있는지를 살펴보는 것이 흥미롭다.

AI 웹 스크래퍼가 실제 페이지를 렌더링한다면 선택된 텍스트 부분의 색을 변경하는 ‘대체’ CSS를 제공받을 수 있다. 스크래퍼가 HTML과 텍스트만 추출하고 CSS를 무시한다면 색상 변화를 전혀 인식하지 못한다. 그러나 탐욕스러운 스크래퍼는 새로운 CSS를 원할 가능성이 높아 렌더링 및 재색상이 가능해진다.

또는 선택적으로 색이 바뀐 텍스트가 포함된 책이나 잡지를 The Internet Archive와 같은 신뢰할 수 있는 저장소에 업로드할 수 있다(매우 인기 있는 대상), 심지어 오래된 작품의 스캔본으로 가장할 수도 있다. 현재 관행 하에서는 다양한 주입 경로가 존재하며, 이 새로운 그리고 특히 다채로운 접근 방식에만 국한되지 않는다.

 

2026년 8월 17일 월요일 최초 게시

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: [email protected]