Anderson의 관점

AI 모델 도난을 위한 비밀 추적 데이터를 통한 식별

mm
Unite.AI를 Google의 선호 소스에 추가
George Washington winking and smiling on the one dollar bill. Source: https://en.wikipedia.org/wiki/Marked_bill + Flux Edit and Adobe Firefly V3

새로운 방법은 몇 초 안에 ChatGPT와 같은 모델에 비밀 워터마크를 추가할 수 있으며, 일반 출력에는 아무런 흔적을 남기지 않고, 모든 가능한 제거 시도를 견딜 수 있습니다.

 

워터마크와 ‘저작권 유인’의 미묘한 차이는 워터마크가 일반적으로 컬렉션 전체(예: 이미지 데이터 세트)에 걸쳐 나타나도록 의도된다는 것입니다. 즉, 캐주얼 복사를 방지하기 위한 普遍적인 장애물입니다.

반면에, 가상 항목은 일반적으로 큰 및 상대적으로 일반적인 컬렉션에 포함된 단어 또는 정의와 같은 작은 텍스트 세그먼트입니다. 이는 작업의 전체 또는 파생 작품의 기초로서 불법적으로 복사될 때, 원래 소유자에 의해 심어진 ‘고유’하고 가짜的事実의 존재가 도난 행위를 쉽게 밝히는 데 사용됩니다.

대형 언어 모델(LLM)과 비전 언어 모델(VLM)에 워터마크를 추가하는 경우, 출력에 이러한 특징적인 징조를 포함시키는 범위는 종종 두 가지 목표 중 하나로 나뉩니다. 출력의 대부분이나 전부에 명시적 또는 잠재적인 워터마크를 포함시키는 것; 또는 도난을 증명하는 ‘비밀 토큰’을 회복할 수 있지만, 정상적인 모델 출력에는 나타나지 않는 것을 보장하는 것입니다.

증거의 무게

이후 접근 방식은 중국, 이탈리아, 싱가포르 간의 흥미로운 새로운 협력을 다룹니다. 이 작업은 오픈 소스 모델에 이러한 공개 방법을 제공하는 것을 목표로 하여, 이를 쉽게 상업화하거나 원래 라이선스가 허용하지 않는 방식으로 사용할 수 없도록 합니다.

예를 들어, 모델의 원래 라이선스는 작업에서 이익을 얻는 모든 사람이 자신의 변경 사항이나 수정을 동일한 관대한 라이선스 조건으로 공개적으로 사용할 수 있는 경우에만 허용할 수 있습니다. 그러나 회사는 자신의 ‘변경 사항’ (예: 미세 조정된 버전)을 게이트 키핑하여, 허용되지 않은 모음을 생성할 수 있습니다.

이 연구의 대부분은 닫힌 소스, API 전용 모델 또는 최적화된(양자화된) 가중치만 사용 가능한 모델과 관련된 감지 루틴에 할애됩니다. 이러한 모델은 직접적으로 모델 자체의 아키텍처에 액세스할 수 없기 때문에, 제안된 방식으로 효율적으로 편집하고 변경하기가 더 어렵습니다.

이러한 FOSS 릴리스에 대한 관심은 중국 연구 부문에서 놀라운 일이 아닙니다. 중국의 AI 출력은 지난 1년 동안 서양의 더 ‘잠긴’ 모델과 경쟁하는 완전한 가중치 릴리스로 특징지어졌습니다.

새로운 접근 방식인 EditMark는 모델을 미세 조정하여 ‘유독한’ 데이터를 추가하거나, 처음부터 데이터를 포함하여 훈련할 필요가 없다는 점에서 자신을 구별합니다.

이것은 몇 가지 이점을 제공합니다. 하나는 일단 워터마크가 포함된 훈련 데이터 세트가 발견되고 공개되면, 더 이상 효과가 없게 됩니다. 공격자는 EditMark를 공격하려면 어떤 레이어를 대상으로 해야 하는지, 어떤 접근 방식을 사용해야 하는지 알아야 합니다. 이는 매우 мал가능한 시나리오입니다.

두 번째로, 이 접근 방식은 매우 빠르며, 훈련된 모델에 적용하는 데 몇 초밖에 걸리지 않습니다(미세 조정의 경우에는 일 또는 주가 걸릴 수 있음). 이는 모델 크기와 적용할 데이터와 함께 미세 조정의 비용을 선형적으로 증가시킵니다.

세 번째로, 이 접근 방식은 미세 조정이나 이전 편집 방법보다 모델의 정상적인 작동에 훨씬 적은 피해를 줍니다.

테스트에서 EditMark는 모델 가중치에 수학적 질의를 포함시킴으로써 100%의 추출 성공률을 달성했습니다.

저자들은 다음과 같이 말합니다:

‘전면적인 실험은 LLM에 대한 EditMark의 예외적인 성능을 보여줍니다. EditMark는 20초 미만으로 32비트 워터마크를 포함시킴으로써驚異的な 효율성을 달성합니다. 워터마크 포함 시간은 미세 조정의 1/300 미만입니다.

‘또한, 광범위한 실험은 EditMark의 강건성, 은밀성, 충실성을 검증합니다.’

이新的 논문은 EditMark: Model Editing을 기반으로 하는 대형 언어 모델의 워터마크라는 제목으로, 중국과학기술대학, 시에나 대학교, 싱가포르의 CFAR/IHPC/A\*STAR의 8명의 저자로부터 나왔습니다.

방법

EditMark 접근 방식은 네 가지 구성 요소로 구성됩니다. 생성기, 인코더, 편집기, 및 디코더:

EditMark 파이프라인은 모델을 특정 수학적 질문에 답변하도록 편집하여 숨겨진 식별 정보를 인코딩합니다. 출처: https://arxiv.org/pdf/2510.16367

EditMark 파이프라인은 모델을 특정 수학적 질문에 답변하도록 편집하여 숨겨진 식별 정보를 인코딩합니다. 출처: https://arxiv.org/pdf/2510.16367

생성기는 유사한 난수 시드를 사용하여 다중 응답 수학 문제를 생성합니다. 인코더는 워터마크에 따라 답변을 선택하고, 이를 모델에 포함시키기 위한 특수한 편집 프로세스를 통해 모델에 포함시킵니다. 일단 편집된 모델이 릴리스되거나 악용되면, 워터마크는 동일한 질문을 묻고 패턴을 해독함으로써 추출될 수 있습니다.

편집기는 모델 가중치를 수정하여, 시드된 질문을 묻는 경우 모델이 대상 답변을 신뢰성 있게 생성하도록 합니다. 디코더는 의심되는 모델에 동일한 질문을 묻고, 그 답변을 숨겨진 서명을 다시 변환함으로써 워터마크를 회복합니다.

위협 모델

이 논문의 위협 모델은 워터마크가 백박스 환경에서 수행된다는 가정에 기반합니다. 보안 관련 연구에서 이것은 일반적으로 좋은 징조가 아니지만, 이 방법은 원래 라이선스에 따라 모델을 사용하는 소유자가 모델에 대한 완전한 액세스 권한을 가지고 있는 경우에保护을 제공하도록 설계되었기 때문에, 여기서는 정상적인 시나리오입니다.

공격자는 또한 모델을 얻은 후 백박스 액세스 권한을 가지며, 모델을 수정할 수 있습니다(예: 가지치기 또는 미세 조정). 그러나 공격자는 워터마크 추출 프로세스나 사용된 스키마를 알지 못하며, 이는 추론 및 실험을 통해만 발견할 수 있습니다(또는 누출된 경우).

생성기는 GPT-4o를 사용하여 템플릿을 다양화하고, 유사한 난수 시드를 사용하여 각 질문을 고유하게 만듭니다. 이를 통해 알려진 워터마크를 결정적으로 포함시킬 수 있으며, 질문 간의 중복을 최소화하여 편집의 얽힘을 방지합니다:

워터마크 포함을 위한 GPT-4o에 의해 생성된 수학 문제 템플릿. 각 템플릿은 유사한 난수 시드를 사용하여 여러 개의 정수 응답을 생성하도록 설계되었습니다.

워터마크 포함을 위한 GPT-4o에 의해 생성된 수학 문제 템플릿. 각 템플릿은 유사한 난수 시드를 사용하여 여러 개의 정수 응답을 생성하도록 설계되었습니다.

인코더는 각 워터마크 세그먼트를 고유한 정수 순열로 변환하여, 수학 문제의 해결 세트에서 가져옵니다. 사전순 순열 이론을 사용하여, 인코더는 각 워터마크 청크의 10진수 값을 특정 순서의 답변 선택으로 매핑하여, 워터마크를 모델의 행동에 결정적으로 포함시킵니다.

편집기에 관해서는, 원래 AlphaEdit 모델 편집 방법은 워터마크에 대해 정밀성과 내구성이 부족했습니다. 변경 사항은 쉽게 파괴될 수 있으며, 노이즈나 가지치기에 의해 쉽게 깨질 수 있습니다.

이를 극복하기 위해, 저자들은 모델 가중치를 단일 MLP 레이어에서 점진적으로 조정하는 다중 라운드 편집 전략을 고안했습니다. 이를 통해 편집이 공격에 강건해지도록 합니다. 또한, 가우시안 노이즈를 주입하여 공격을 시뮬레이션합니다:

공격 전후의 Baichuan-7B, Qwen-7B, LLaMA3-8B의 K1 변경 분포. 모든 변경 사항은 0에 가까운 값을 유지하며, 공격이 모델의 내부 행동을 크게 방해하지 않는다는 것을 나타냅니다.

공격 전후의 Baichuan-7B, Qwen-7B, LLaMA3-8B의 K1 변경 분포. 모든 변경 사항은 0에 가까운 값을 유지하며, 공격이 모델의 내부 행동을 크게 방해하지 않는다는 것을 나타냅니다.

점수 시스템은 편집이 충분히 정확할 때 프로세스를 중지하고, 정규화는 여러 라운드에 걸쳐 업데이트가 안정적으로 유지되도록 합니다.

디코더는 모델에 동일한 특수 질문을 묻고, 그 답변을 읽어 숨겨진 ID를 추론합니다. 답변의 패턴은 비밀 규칙을 따르므로, 모델의 내부를 조사할 필요 없이 ID를 회복할 수 있습니다.

데이터 및 테스트

EditMark를 테스트하기 위해, 5개의 LLM이 평가되었습니다: GPT2-X; GPT-J-6B; LLaMA-3-8B; Baichuan-7B; 및 Qwen-7B. AlphaEdit를 사용하여 워터마크를 포함시키고, 추출 성공률(ESR) 및 포함 시간(ET)을 평가했습니다.

저자들은 다음과 같이 말합니다:

‘[EditMark]는 모든 평가된 LLM에서 100%의 ESR를 달성하며, 32비트 워터마크를 포함시키는데 20초 미만이 소요됩니다. 특히, Baichuan-7B와 Qwen-7B의 평균 포함 시간은 10초 미만으로, EditMark의 높은 효율성을 보여줍니다.’

128비트 워터마크의 평가에서, EditMark는 ‘변경 불가능’ 상태를 유지했습니다:

5개의 언어 모델에서 32, 64, 128비트 워터마크 길이의 EditMark에 대한 추출 성공률 및 포함 시간. 모든 경우에서 완벽한 성공률을 유지하며, 포함 시간은 워터마크 크기와 함께 증가하지만, 128비트에서도 1분 미만으로 유지됩니다.

5개의 언어 모델에서 32, 64, 128비트 워터마크 길이의 EditMark에 대한 추출 성공률 및 포함 시간. 모든 경우에서 완벽한 성공률을 유지하며, 포함 시간은 워터마크 크기와 함께 증가하지만, 128비트에서도 1분 미만으로 유지됩니다.

다음으로 시스템의 워터마크 충실도를 여러 벤치마크에 대해 테스트했습니다:

5개의 모델에서 32비트 및 128비트 용량의 워터마크가 있는 모델과 수정되지 않은 모델의 성능 비교. 모든 구성에서 성능은 안정적으로 유지되며, 벤치마크 정확도에 대한 워터마크 삽입의 영향은 미미합니다.

5개의 모델에서 32비트 및 128비트 용량의 워터마크가 있는 모델과 수정되지 않은 모델의 성능 비교. 모든 구성에서 성능은 안정적으로 유지되며, 벤치마크 정확도에 대한 워터마크 삽입의 영향은 미미합니다.

EditMark의 강건성을 6가지 일반적인 공격 전략에 대해 테스트했습니다. 모델은 128비트 워터마크와 함께 5개의 서로 다른 시드를 사용하여 포함되었습니다. 미세 조정은 대부분의 모델에서 추출 성공률(ESR)에 미미한 저하만을 초래했습니다:

1~3 에포크 동안 미세 조정을 적용하기 전후의 워터마크된 LLM의 추출 성공률. 대부분의 모델은 높은 ESR을 유지하지만, Qwen-7B는 파라미터 업데이트에 대한 취약성을 나타냅니다.

1~3 에포크 동안 미세 조정을 적용하기 전후의 워터마크된 LLM의 추출 성공률. 대부분의 모델은 높은 ESR을 유지하지만, Qwen-7B는 파라미터 업데이트에 대한 취약성을 나타냅니다.

미세 조정 후에도 대부분의 모델은 90% 이상의 ESR을 유지했습니다. 이는 EditMark가 LoRA 기반 훈련에서 발생하는 파라미터 드리프트에 저항한다는 것을 나타냅니다.

양자화 공격은 모델 정밀도를 줄였지만, 대부분의 워터마크는 그대로 유지되었습니다:

Int-8 및 Int-4 정밀도에서 양자화를 적용하기 전후의 워터마크된 모델의 추출 성공률. 모든 모델에서 Int-8 양자화에서 100%의 ESR을 유지하지만, Int-4 양자화에서는 부분적인 저하가 발생합니다.

Int-8 및 Int-4 정밀도에서 양자화를 적용하기 전후의 워터마크된 모델의 추출 성공률. 모든 모델에서 Int-8 양자화에서 100%의 ESR을 유지하지만, Int-4 양자화에서는 부분적인 저하가 발생합니다.

노이즈 및 가지치기 공격은 4개의 벤치마크 프레임워크를 평가했습니다: MMLU; BLIMP; TruthfulQA; 및 GLUE. 이러한 공격은 강화된 노이즈 및 가지치기 비율과 함께 ESR의 감소를 초래했습니다:

노이즈 및 가지치기 공격의 효과와 워터마크된 모델의 벤치마크 성능. ESR이 떨어질수록 벤치마크 정확도도 저하되며, 특히 높은 노이즈 강도 및 가지치기 비율에서 두드러집니다.

노이즈 및 가지치기 공격의 효과와 워터마크된 모델의 벤치마크 성능. ESR이 떨어질수록 벤치마크 정확도도 저하되며, 특히 높은 노이즈 강도 및 가지치기 비율에서 두드러집니다.

그러나, 이러한 공격은 또한 작업 성능의 급격한 저하를 초래했습니다. Baichuan-7B는 BLIMP에서 노이즈 또는 가지치기를 적용할 때 27-31%의 저하를 보였습니다.

모델 편집 및 적응 공격도 평가되었습니다:

알려진 워터마크 레이어에 최대 50개의 편집을 적용한 워터마크된 모델의 추출 성공률. 모든 모델에서 95% 이상의 ESR을 유지하며, 직접적인 파라미터 수정이 워터마크 제거에 미미한 영향을 미친다는 것을 나타냅니다.

알려진 워터마크 레이어에 최대 50개의 편집을 적용한 워터마크된 모델의 추출 성공률. 모든 모델에서 95% 이상의 ESR을 유지하며, 직접적인 파라미터 수정이 워터마크 제거에 미미한 영향을 미친다는 것을 나타냅니다.

여기서 EditMark는 알려진 워터마크 레이어를 대상으로 하여 최대 50개의 편집을 적용했음에도 불구하고 95% 이상의 ESR을 유지했습니다.

결론

DRM, 비밀 워터마크 및 기타 보안 접근 방식은 기계 학습 시스템에 적용하기 어렵습니다. 현재의 호스트 아키텍처의 의도적으로 축소된 특성과 적절한 툴링의 부족으로 인해 삽입된 워터마크는 취약합니다.

FOSS 모델 배포를 위한 시스템을 보는 것은 인상적이며, 거의 모든 시나리오에서 공격에 저항하는 것을 보는 것도 인상적입니다. 그러나 워터마크 삽입으로 인한 성능의 미미한 저하는 잠재적인 사용자에게 주의를 요할 수 있습니다. 특히, API 중심의 제어 모델로 전환하면 이러한 공격을几乎적으로 방지할 수 있습니다.

 

* 이 사이트 는 주장 한다. ‘중국의 오픈 소스 릴리스는 데이터가 종종 숨겨져 있기 때문에 완전한 FOSS로 资格하지 않습니다. 이는 AI 모델 릴리스의 정치학을 더 깊이 조사할 필요가 있습니다.

最初에 게시된 날: 2025년 10월 27일

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai