Anderson의 관점
개인화된 언어 모델은 쉽게 만들 수 있지만 감지하기는 더 어렵다

오픈 소스 ChatGPT 클론은 대규모로 제한된 전문 지식이나 경험 없이 미세 조정할 수 있으며, 이는 ‘사적인’ 언어 모델을 만들 수 있게 해주어 감지할 수 없게 됩니다. 대부분의 도구는 이러한 모델이 어디에서 왔는지 또는 무엇을 위해 훈련되었는지 추적할 수 없습니다. 따라서 학생과 다른 사용자는 AI 텍스트를 생성하여 감지되지 않도록 할 수 있습니다. 그러나 새로운 방법은 모델의 출력에서 공유된 ‘가족 특성’을 감지하여 이러한 숨겨진 변형을 식별할 수 있다고 주장합니다.
캐나다의 새로운 연구에 따르면, 사용자 맞춤형 AI 채팅 모델은 ChatGPT와 유사하며, 인간의 글쓰기와 매우 유사한 소셜 미디어 콘텐츠를 생성할 수 있으며, 이는 최신 감지 알고리즘과 인간 모두를 속일 수 있습니다.
이 논문은 다음과 같이 말합니다:
‘현실적으로 동기 부여된 공격자는 자신의 스타일과 사용 사례에 맞게 모델을 미세 조정할 가능성이 높으며, 이는 저렴하고 쉽게 할 수 있습니다. 최소한의 노력, 시간, 돈으로 우리는 훨씬 더 현실적인 소셜 미디어 트윗을 생성할 수 있는 미세 조정된 생성기를 제작했습니다. 이는 언어적 특징과 감지 정확도 모두에서 확인되었으며, 인간 주석을 통해 검증되었습니다.’
저자들은 이러한 사용자 맞춤형 모델이 단축형 소셜 미디어 콘텐츠에만 국한되지 않는다고 강조합니다:
‘소셜 미디어에서 AI 콘텐츠가 퍼지고, 아스트로터핑 및 영향력 캠페인의 위험과 관련하여 동기 부여를 받았지만, 우리는 주요 발견이 모든 텍스트 도메인에 걸쳐 확장한다는 점을 강조합니다.
‘실제로 스타일별 콘텐츠 생성을 위한 모델 미세 조정을 위한 일반적으로 적용 가능한 방법입니다. 이는 이미 많은 생성적 AI 사용자에 의해 사용되고 있는 방법이며, 이는 기존의 AI 감지 방법이 연구실에서와 같이 실제 환경에서 효과적인지에 대한 의문을 제기합니다.’
이 논문은 이러한 사용자 맞춤형 언어 모델을 생성하는 방법은 미세 조정이라고 합니다. 여기서 사용자는 자신의 대상 데이터를 일부 수집하여 온라인 훈련 도구에 입력합니다.
예를 들어, Hugging Face는 대규모 언어 모델을 위한 미세 조정을 제공하며, 이는 AutoTrain 고급 시스템을 통해簡素화된 인터페이스를 통해 제공됩니다. 이는 몇 달러를 ऑनल라인 GPU에 지불하거나, 사용자가 충분한 하드웨어를 가지고 있는 경우 무료로 로컬에서 실행할 수 있습니다.

Hugging Face AutoTrain 시스템에서 사용 가능한 GPU의 다양한 가격 구조 Source: https://huggingface.co/spaces/autotrain-projects/autotrain-advanced?duplicate=true
다른 간소화된 방법과 플랫폼에는 Axolotl, Unsloth, 그리고 더 능력 있지만 요구되는 TorchTune이 있습니다.
예를 들어, 학생이 자신의 에세이를 작성하기 위해 지치고, 온라인 AI 감지 도구에 의해 감지되는 것을 두려워한다면, 자신의 실제 역사적인 에세이를 훈련 데이터로 사용하여 인기 있는 오픈 소스 모델인 Mistral 시리즈를 미세 조정할 수 있습니다.
미세 조정을 통해 모델의 성능이 추가 훈련 데이터로 향상되지만, 전반적인 성능이 저하될 수 있습니다. 그러나 ‘개인화된’ 모델은 ChatGPT와 같은 시스템의 점점 더 특징적인 출력을 ‘탈 AI화’하는 데 사용될 수 있으며, 이는 사용자의 역사적인 스타일을 반영하여 더욱 실제적으로 만들 수 있습니다.
그러나 사용자는 특정 작업이나 작업 범위에 최적화된 미세 조정된 모델을 독점적으로 사용할 수 있습니다. 예를 들어, 특정 대학 모듈의 교과 과정에 미세 조정된 언어 모델은 ChatGPT와 같은 범용 언어 모델보다 해당 도메인에 대한 더 깊은 이해를 가질 수 있으며, 훈련 비용은 10~20달러 미만일 수 있습니다.
LLM 아이스버그
이런 관행의 규모는 알기 어렵습니다. 다양한 소셜 미디어 플랫폼에서最近 많은 비즈니스 지향적인 LLM 미세 조정 예를 보았으며, 이는 1년 전보다 훨씬 더 많습니다. 한 경우에는 회사에서 자신의 생각 지도 조각을 언어 모델에 미세 조정하여 새로운 고객과의 짧은 줌 통화에서 정리된 B2B 게시물로 거의 즉시 변환할 수 있었습니다.
이러한 모델은 대규모의 전후 예제가 필요하며, 이는 페어링된 데이터를 의미합니다. 반면에 특정 작가의 특성을 개인화하는 것은 더 쉬운 작업입니다. 이는 스타일 전송과 유사합니다.
이것은 비밀스러운 추구입니다. 그러나 같은 논리적 추론이 TAKE IT DOWN 법안을今年에 법으로 만든 것과 같습니다. 즉, 대상 활동은 가능하며 저렴하며, 잠재적 사용자는 매우 동기 부여됩니다.
현재 가장 단순화된 온라인 미세 조정 시스템에는 여전히 충분한 마찰이 남아 있으므로, 미세 조정된 모델을 기만적으로 훈련하고 사용하는 것은 아직까지는 상대적으로 니치 사용 사례입니다. 그러나 이는 전통적인 학생들의 창의성에 의해 결코 제한되지 않습니다.
팬텀 헌터
이것은 우리를 주요 관심 논문으로 데려갑니다. 중국에서 나온 새로운 접근 방식은 다양한 기술을 하나의 프레임워크로 결합하여 미세 조정된 언어 모델의 출력을 식별할 수 있다고 주장합니다. 이는 팬텀 헌터라고 불립니다.
시스템은 미세 조정된 모델이 이전에遭遇하지 못한 경우에도 작동하도록 설계되며, 이는 원래의 기본 모델에 의해 남겨진 잔여 흔적에 의존합니다. 이는 저자들이 ‘가족 특성’이라고 부릅니다.
테스트에서 논문은 강력한 감지 정확도를 보고하며, 시스템은 미세 조정된 모델의 출력을 모델 패밀리로 추적하는 데 zero-shot GPT-4-mini 평가를 능가합니다.
이것은 미세 조정이 모델의 기원을 더 많이 노출시킴을 의미하며, 이는 미세 조정이 항상 모델의 기원을 숨긴다고 가정하는 것과는 반대입니다. 대신, 미세 조정 과정은 모델의 기원을 나타내는 감지할 수 있는 지문을 남길 수 있습니다.
이 논문은 다음과 같이 말합니다:
‘기계 생성 텍스트 감지는 일반적으로 이진 분류를 통해 LLM 생성 텍스트와 인간이 작성한 텍스트를 구분합니다. 기존 방법은 LLM을 사용하여 공통적인 텍스트 특성을 학습하거나 LLM 내부 신호를 기반으로 인간과 LLM 텍스트 간의 구별 가능한 지표를 설계합니다.
‘둘 다 테스트는 주로 공개적으로 사용 가능한 LLM의 데이터에서 수행되며, 사용자가 공개 서비스를 사용하여 텍스트를 생성한다고 가정합니다.
‘우리는 이 상황이 오픈 소스 LLM 커뮤니티의 최근 발전에 의해 변경되고 있다고 주장합니다. HuggingFace와 같은 플랫폼 및 LoRA와 같은 효율적인 LLM 훈련 기술의 도움으로, 사용자 지정 사적 데이터셋을 사용하여 미세 조정된 LLM을 구축하는 것이 이전보다 훨씬 쉬워졌습니다.
‘예를 들어, HuggingFace에는 60,000개 이상의 Llama 기반 파생 모델이 있습니다. 사적 데이터셋을 사용하여 미세 조정하면 기본 모델의 학습된 특성이 변경될 수 있으며, LLMGT 감지기가 실패할 수 있습니다. 이는 악의적인 사용자가 사적으로 유해한 텍스트를 생성하여 LLMGT 감지기를 피할 수 있는 새로운 도전을 제기합니다.’
방법 및 훈련
팬텀 헌터 시스템은 가족 인식 학습 전략을 사용하여 세 가지 구성 요소를 결합합니다: 특성 추출기를 사용하여 알려진 기본 모델에서 출력 확률을 캡처합니다. 대조적 인코더를 사용하여 패밀리를 구분하도록 훈련합니다. 그리고 전문가 混合 분류기를 사용하여 새로운 텍스트 샘플에 패밀리 레이블을 할당합니다.

시스템의 스키마. 팬텀 헌터는 텍스트 샘플을 처리하여 여러 기본 모델에서 확률 특성을 추출하고, 이는 CNN 및 트랜스포머 레이어를 사용하여 인코딩됩니다. 모델 패밀리를 추정하여 게이팅 가중치를 계산하고, 이는 전문가 混合 모듈이 텍스트가 LLM 생성되었는지 예측하도록 지시합니다. 훈련 중에 대조적 손실을 적용하여 모델 패밀리 사이의 분리를 정련합니다. Source: https://arxiv.org/pdf/2506.15683
팬텀 헌터는 텍스트를 여러 알려진 기본 모델을 통해 전달하고, 각 단계에서 다음 단어가 나타날 가능성을 기록합니다. 이러한 패턴은 모델 패밀리의 구별되는 특성을 학습하는 신경망에 입력됩니다.
훈련 중에 시스템은 같은 패밀리의 텍스트를 비교하고, 이를 함께 그룹화하며, 다른 패밀리에서 온 텍스트를 구분합니다. 이는 미세 조정된 모델과 기본 모델 사이의 숨겨진 연결을 식별하는 데 도움이 됩니다.
MOE
팬텀 헌터는 텍스트가 인간이 작성했는지 AI가 생성했는지 결정하기 위해 전문가 混合 시스템을 사용합니다. 여기서 각 ‘전문가’는 특정 모델 패밀리의 텍스트를 감지하도록 미세 조정됩니다.
시스템이 텍스트가 어느 패밀리에서 왔는지 추측하면, 그 추측을 사용하여 각 전문가의 의견에 가중치를 부여합니다. 이러한 가중 의견은 결합되어 최종 결정에 도달합니다: AI 또는 인간.
시스템을 훈련하는 것은 여러 목표를 포함합니다: 모델 패밀리를 인식하는 것, AI 텍스트와 인간 텍스트를 구분하는 것, 그리고 대조적 학습을 통해 다른 패밀리를 분리하는 것. 이러한 목표는 훈련 중에 조정 가능한 매개 변수를 통해 균형을 유지합니다.
가족 수준의 패턴에 초점을 맞추면, 팬텀 헌터는 이전에 본 적 없는 미세 조정된 모델도 감지할 수 있어야 합니다.
데이터 및 테스트
저자들은 테스트를 위해 두 가지 일반적인 학술 시나리오에 집중했습니다: 작성 및 질문-응답. 작성의 경우, 저자들은 아카이브 학술 아카이브에서 69,297개의 초록을 수집하여 주요 도메인으로 나누었습니다. 질문-응답의 경우, 저자들은 2,062개의 쌍을 HC3 데이터셋에서 3개의 주제로 수집했습니다: ELI5; 금융; 및 의학.

수집된 데이터의 출처 및 수
테스트를 위해 12개의 모델이 훈련되었습니다. 3개의 기본 모델은 LLaMA-2 7B-Chat; Mistral 7B-Instruct-v0.1; 및 Gemma 7B-it였습니다. 이 모델들은 9개의 미세 조정된 변형으로 확장되었습니다. 각 변형은 도메인 또는 작가 스타일을 모방하도록 맞춤화되었습니다.

평가 데이터셋의 통계. ‘FT 도메인’은 미세 조정 중에 사용된 도메인을 나타내며, ‘기본’은 미세 조정이 없는 것을 나타냅니다.
총 3개의 기본 모델이 전参数 미세 조정 및 LoRA 미세 조정을 통해 3개의 서로 다른 도메인에서 2개의 사용 사례(학술 초록 작성 및 질문-응답)로 미세 조정되었습니다. 컴퓨터 과학 데이터로 미세 조정된 모델은 작성 테스트에서 제외되었으며, 금융 데이터로 미세 조정된 모델은 질문-응답 평가에서 제외되었습니다.
대조 프레임워크로는 RoBERTa; T5-Sentinel; SeqXGPT; DNA-GPT; DetectGPT; Fast-DetectGPT; 및 DeTeCtive가 사용되었습니다.
팬텀 헌터는 두 가지 유형의 신경망 레이어를 사용하여 훈련되었습니다: 3개의 컨볼루션 레이어와 맥스 풀링을 사용하여 로컬 텍스트 패턴을 캡처합니다. 그리고 2개의 트랜스포머 레이어와 각 4개의 어텐션 헤드를 사용하여 더 긴 범위의 관계를 모델링합니다.
대조적 학습을 위해 대조적 손실을 사용하여 시스템이 다른 모델 패밀리를 구분하도록 합니다. 여기서 온도 매개 변수는 0.07로 설정되었습니다.
훈련 목표는 세 가지 손실 항을 결합합니다: L1(패밀리 분류를 위해)과 L2(이진 감지를 위해), 각 항이 1.0으로 가중되며, L3(대조적 학습을 위해)가 0.5로 가중됩니다.
모델은 Adam을 사용하여 최적화되며, 학습률은 2e-5로 설정되며, 배치 크기는 32로 설정됩니다. 훈련은 10개의 전체 에포크 동안 진행되며, 검증 세트를 사용하여 최상의 체크포인트가 선택됩니다. 모든 실험은 4개의 NVIDIA A100 GPU가 있는 서버에서 수행됩니다.
사용된 지표는 각 테스트 하위 집합에 대한 F1 점수와 상업적 감지기와 비교하기 위한 真正 양성률입니다.

미세 조정된 언어 모델의 텍스트 감지에 대한 F1 점수. 각 범주에서 상위 두 결과는 볼드체와 밑줄로 표시됩니다. ‘BFE’는 기본 확률 특성 추출을 의미하며, ‘CL’은 대조적 학습을 의미하며, ‘MoE’는 전문가 混合 모듈을 의미합니다.
초기 테스트의 결과는 위의 표에 표시되며, 팬텀 헌터가 모든 기준선 시스템을 능가하며, 미세 조정된 모델의 출력에서 인간과 기계 생성 텍스트를 감지하는 데 90% 이상의 F1 점수를 유지합니다.
저자들은 다음과 같이 말합니다:
‘전체 미세 조정으로 팬텀 헌터는 MacF1 점수를 기준선보다 3.65% 및 2.96% 향상시킵니다. LoRA 미세 조정으로는 2.01% 및 6.09% 향상됩니다.
‘결과는 팬텀 헌터의 미세 조정된 LLM에 의해 생성된 텍스트를 감지하는 강력한 능력을 보여줍니다.’
결론
사용자 훈련된 생성적 언어 모델을 사용하는 것에 대한 하나의 논쟁은, 이러한 미세 조정과 LoRA가 사용자의 고유한风格과 특징을 보존한다는 것입니다. 이는 AI 채팅봇의 일반적인, SEO에 최적화된 문체가 언어를 일반화하는 상황에서 중요합니다.
대학 에세이의 가치가 하락하고, 학생들이 AI를 사용하지 않았음을 증명하기 위해 에세이 작성 세션을 녹화하는 경우가 증가함에 따라, 더 많은 교사들이 서면 제출물 대신 대면 시험을 고려하고 있습니다.最近에는 손으로 쓴 작품으로의 복귀가 제안되었습니다.
논쟁은 이러한 대안이 LLM 기반의 딥페이크 경쟁의 재현보다 우수할 수 있다는 것입니다. 그러나 이는 인간의 노력과 주의를 필요로 하는 비용으로 이루어집니다. 기술 문화는 현재 이러한 것을 자동화하여 제거하려고 노력하고 있습니다.
† 자세한 내용은 원본 논문의 주요 결과 이후의 마지막 섹션을 참조하십시오.
* 저자의 인라인 인용을 하이퍼링크로 변환한 것입니다. 저자의 강조는 저자自身의 것입니다.
처음 게시된 날: 2025년 6월 19일












