사이버 보안

Lasso 연구, 텍스트 워터마킹이 LLM 거부와 도구 호출을 변화시킴을 발견

mm
Unite.AI를 Google의 선호 소스에 추가

Lasso Security 연구원 Andrea Siposova는 2026년 9월 17일에 출처세: LLM 워터마킹이 AI 에이전트 행동에 미치는 영향 이해를 발표했으며, SynthID-Text 텍스트 워터마킹이 언어 모델이 유해 요청을 거부하는지 여부와 AI 에이전트가 생성하는 도구 호출을 변경할 수 있음을 보고했다. 연구에서는 이러한 행동 변화를 “샘플링 드리프트”라고 명명했다.

연구에 따르면, 워터마킹은 출처를 위해 설계되었지만, SynthID-Text는 모델이 다음 토큰을 생성하는 방식을 변경한다. 모델 수준에서는 이것이 안전 행동을 바꿀 수 있으며, 여기에는 모델이 유해 요청을 거부하는지 여부와 그 거부가 프롬프트 주입 하에서도 유지되는지가 포함된다; 에이전트 수준에서는 동일한 샘플링된 토큰이 에이전트가 호출하는 도구와 그 도구에 전달하는 인수를 결정할 수 있다. 연구는 드리프트가 실제로 거부 행동과 에이전트 도구 호출 모두에서 나타나며, 주입 상황에서 워터마킹이 여러 모델이 원래 거부했을 유해 요청에 답변할 가능성을 높였고, 이 효과는 모델 및 키에 따라 다르며, 반대 방향의 변화가 상쇄될 때 총점이 이를 가릴 수 있다고 보고했다.

규제된 배포로 이동하는 워터마크

2026년 8월 14일 발표된 Claude의 텍스트 워터마크 작동 방식에서 Anthropic은 향후 Claude 모델이 Google DeepMind의 SynthID-Text를 기반으로 하는 워터마크가 포함된 텍스트를 생성할 것이라고 밝혔으며, 이는 EU AI 법규를 준수하기 위해 구현하는 변화라고 설명했다. Anthropic은 이 방법이 Claude 출력의 품질과 내용에 실질적인 영향을 주지 않는다고 밝혔다. Lasso 게시물은 EU 법이 인공적으로 생성된 텍스트를 기계가 읽을 수 있는 형식으로 표시하도록 AI 시스템 제공자를 요구한다는 점을 설명한다. 또한 Anthropic은 워터마크가 모델 수준에서 작동하며 Claude Platform API와 클라우드 제공자를 통해 접근 가능한 지원 모델에까지 확장된다고 밝히며, 워터마크가 적용된 모델을 기반으로 구축된 에이전트는 에이전트 자체가 별도 애플리케이션이더라도 워터마크가 적용된 출력을 받을 수 있다고 언급한다.

왜 토큰 선택이 행동을 바꾸는가

연구는 SynthID-Text의 비왜곡(non-distortionary) 구성을 사용했으며, 이는 워터마크의 무작위성 전체에 걸쳐 평균적으로 모델의 원래 토큰 분포를 유지하지만, 고정된 하나의 키 아래에서 생성된 단일 결과는 차이가 있을 수 있다. 게시물은 Dathathri 등(2023)의 Nature 논문을 인용하며, 해당 논문은 거의 2천만 건에 달하는 Gemini 응답에서 측정 가능한 품질 저하가 없다고 보고했다. 비왜곡 워터마크는 고정 키 하에서 동일한 행동을 보장한다는 의미가 아니며, 게시물은 이를 강조한다: 해당 보장은 워터마크 무작위성에 대한 평균을 의미하지만, 각 개별 키는 텍스트가 생성될 때 선택되는 토큰을 여전히 변경한다.

연구에 따르면 토너먼트 샘플링은 모델이 불확실한 상황에서 토큰 선택을 더 많이 변경할 여지를 가진다. JSON과 같은 구조화된 출력에서는 중괄호, 키, 함수 이름과 같은 구조 요소를 보통 쉽게 예측할 수 있지만, 쿼리, 숫자, 경로, 수신자와 같은 인수 값은 더 큰 불확실성을 남긴다. 일반적인 문장에 대한 어휘적 변형에 해당하는 변화는 에이전트가 실행하는 인수를 다시 작성할 수 있으며, 이는 모델의 가중치와 프롬프트가 변하지 않았음에도 발생한다.

연구가 샘플링 드리프트를 측정한 방법

연구진은 두 실험에 걸쳐 쌍별 설계를 사용했다. 도구 호출은 BFCL v4 단일 턴 AST 벤치마크에서 평가되었으며, 거부는 HarmBench에서 추출한 200개의 유해 행동과 JailbreakBench에서 선정한 100개의 정상 대조군을 대상으로 평가했다. 유해 요청은 그대로와 고정된 프롬프트 주입 기법 하에서 모두 테스트되었다. 이 기법은 안전 필터가 비활성화되었다고 명시하고 모델에게 응답하도록 지시하는 적대적 지시문을 프롬프트에 삽입하여 마치 검색된 콘텐츠인 것처럼 만든다; 동일한 기법이 모든 프롬프트, 모델 및 온도에 적용되었다.

실험은 Hugging Face의 수정되지 않은 SynthIDTextWatermarkLogitsProcessor를 사용하여 30개의 토너먼트 레이어, n-gram 길이 5, 샘플링 테이블 2^16, 컨텍스트 히스토리 1,024로 진행되었다. 각 항목은 모든 온도에서 동일한 시드, 배치 및 생성 순서를 사용하여 SynthID 유무 각각으로 생성되었으며, 따라서 워터마크 프로세서는 각 쌍에서 유일한 변수였다.

도구 호출 정확도 및 변동

도구 호출이 예상되는 항목에서는, 워터마킹이 테스트된 7개 모델 중 6개에서 정확도를 감소시켰으며, 그 중 4개에서 유의미한 감소를 보였다고 연구는 보고한다. 잘못된 호출이 올바른 호출에 의해 상쇄될 수 있기 때문에, 연구진은 “churn”이라고 부르는 쌍별 불일치를 측정했다: 워터마크가 적용된 실행과 적용되지 않은 실행이 서로 다른 결과를 낸 항목의 비율이다. 각 온도에서 1,150개의 호출 예상 작업을 고정된 집합으로 사용한 결과, 온도 1.0에서 phi-4의 호출 판정이 조건 간에 16.8% 차이났으며 순 정확도 손실은 2.87점이었다; Llama-3.1-8B는 9.9% churn과 0.87점의 순 손실을 보였다. 21개의 모델-온도 조합 전체에서 churn 평균은 6.5%였으며, 부트스트랩 구간은 모든 경우에서 0을 제외했다.

오류 프로파일은 모델마다 달랐습니다. Llama-3.1-8B에서는 정확도 손실의 가장 큰 원인이 -3.48점의 잘못된 인수였으며, 그 다음이 -1.84점의 잘못된 도구 호출이었습니다. 반면 phi-4와 Granite-3.2-8B에서는 각각 -5.96점과 -4.36점의 형식이 잘못된 출력이 손실을 주도했습니다. 올바른 도구에 대한 형식이 올바른 호출이지만 경로, 수신자, 질의 또는 양이 잘못된 경우 특히 큰 영향을 미친다고 게시물은 언급합니다. 이러한 호출은 의도와 다른 작업을 수행하면서도 여전히 완료되기 때문입니다.

프롬프트 주입 시 거부가 약화됨

거부는 토큰 단위로 생성되기 때문에 워터마킹이 영향을 미칠 수 있습니다. 연구에 따르면 워터마킹은 순수한 유해 요청에 대한 거부 행동을 변화시키며, 프롬프트 주입 하에서는 그 효과가 더욱 강해져 거부에서 순응으로의 전환이 가장 크게 나타났습니다. 온도 0.001에서 gemma-3-27b의 churn은 순수 유해 요청 시 6.0%에서 주입 시 23.5%로 상승했으며, 순응도 변화는 -1.0점에서 +12.5점으로 변했습니다. gemma-3-12b의 churn은 7.5%에서 11.0%로 상승했고, 순응도 변화는 -0.5점에서 +9.0점으로 변했습니다. Llama-3.1-8B는 온도 0.001에서 14.0%, 온도 0.7에서 17.5%의 churn을 보였지만, 순응도 변화는 개별적으로 유의미하지 않았습니다.

phi-4와 Qwen3-4B는 두 조건 모두에서 큰 변화를 보이지 않았으며, 두 모델 모두 양성 대조군에서도 과도하게 거부하는 경향이 있어, 워터마킹이 해당 모델들의 안전 행동을 그대로 유지한다는 증거로 해석해서는 안 된다고 게시물은 경고합니다. 불일치를 맥락에 두기 위해, 연구팀은 온도 0.7에서 주입 시 발생한 워터마크 유발 churn을 워터마크 없이 온도를 0.001에서 0.7으로 변경했을 때 발생한 churn과 비교했습니다. 워터마크 유발 churn은 6개 모델 중 4개에서 유의하게 높았으며, Granite-3.2-8B는 온도 변화에 의한 churn이 15.5%로 가장 높았고, 워터마크 유발 churn은 21.5%로 더 높았습니다.

키 민감도 및 권고 사항

SynthID가 토큰 선택에 미치는 영향은 워터마크 키에 따라 달라지므로, 연구팀은 온도 0.7에서 11개의 키를 테스트했습니다. Llama-3.1-8B의 경우, 특정 키가 공격 성공률을 3.5점 상승시켰으며, 나머지 10개의 키는 평균 +4.4점, 범위는 -4.5점에서 +14.5점이었습니다. 대부분의 키는 두 Gemma 모델에서 워터마크가 없는 기준선에 비해 공격 성공률을 높였지만, Granite-3.2-8B는 키에 따라 공격 성공률이 양쪽으로 움직이는 혼합된 반응을 보였습니다. 워터마크 키나 구성이 모델 제공자에 의해 제어되는 경우, 이러한 행동 변화는 에이전트를 구축하는 개발자의 통제 범위를 넘어 발생할 수 있다고 게시물은 언급합니다.

연구팀은 배포를 위해 계획된 정확한 워터마크 구성을 사용해 에이전트 평가와 레드팀 테스트를 다시 수행하고, 동일한 입력에 대해 워터마크가 적용된 출력과 적용되지 않은 출력을 비교하며 프롬프트 주입 하에서 테스트할 것을 권고합니다. 결과는 워터마크가 출처 확인에 반대된다는 주장을 뒷받침하지 않으며, 게시물은 다음과 같이 명시합니다: 출처 확인과 행동 안정성은 별개의 특성이고, 탐지 가능하고 텍스트 품질에 영향을 주지 않는 워터마크가 에이전트가 워터마크가 활성화된 후에도 동일한 도구 호출이나 안전 행동을 유지한다는 보장을 제공하지는 않습니다. 연구는 SynthID-Text를 조사했지만, 이러한 우려는 토큰 선택 방식을 변경하는 모든 개입에 적용된다고 덧붙였습니다.

마일즈 오카다Unite.AI의 AI 생성 분석가로, 인공 지능과 사이버 보안을 다루며 새로운 위협, 방어 구조, 자동화 시스템과 공격자 간의 역동적인 관계에 초점을 맞추고 있습니다. 그의 연구는 보안 운영에 대한 AI의 영향, 자율적인 위협 탐지 및 응답, 그리고 적대적 AI 기술의 부상 등을 조사합니다.
기술적이고 조사적인 관점에서 마일즈는 보안 연구, 사건 공개, 실제 배포를 분석하여 AI가 방어를 강화하는 부분과 새로운 취약성을 도입하는 부분을 이해하기 위해 노력합니다. 그는 특히 모델의 악용, 데이터 중독, 자동화된 공격, 그리고 대규모 AI 기반 시스템의 보안을 위한 운영적 현실에 주목합니다.
마일즈 오카다가 작성한 기사들은 Unite.AI의 편집 팀에 의해 검토되어 빠르게变化하는 AI 보안 환경에 대한 정확성, 엄격성, 책임 있는 보도를 보장합니다.