Anderson의 관점

AI 생성 글은 결코 ‘피로’를 느끼지 않으며, 따라서 스스로를 드러낸다

mm
Unite.AI를 Google의 선호 소스에 추가
AI-generated image, by Z-Image Turbo (V1) via Krita AI Diffusion. Prompt: 'An American, hot high-school exam room in Texas,, with all the students seated exhausted in the heat, at lines of desks, trying to concentrate on winning their exams. In the center of the picture we focus on an industrial humanoid robot who is filling out the exam papers so quickly that the A$ sheets are flying around its desk in a flurry of activity. Some of the nearby, sweating and exhausted young students are looking at the tireless robot with annoyance and/or jealousy.'

ChatGPT 스타일의 AI는 일관성이 증가함으로써 스스로를 드러내며, 인간의 글은 전체적으로 불규칙성을 유지한다.

 

대다수의 소비자용 대규모 언어 모델(LLM)의 제한된 컨텍스트 창은 사용자의 대화의 이전 부분을忘れた거나 잘못 회상하는 오류를 일으킬 수 있는 요인 중 하나이다. 이러한 오류는 출력을 완전히 무의미한 텍스트로 만들거나, 혹은 속임수로 보이는 일관된 텍스트를 생성할 수 있다.

이러한 상황은 환각을 일으키며, 환각은 아직도 AI의 총 시장 진출의最大의 장애물이다. 따라서 더 일관된 텍스트를 생성할 수 있는 생성적 AI 시스템을 만들기 위해 많은 연구 노력이 투자되고 있다.

실제로, 이러한 노력으로 인해 오래된 AI 생성 콘텐츠를 식별하는 것이 점점 더 어려워지고 있다.

AI 필리버스터를 파괴하는 것

그럼에도 불구하고, 최근의 경험적 연구에 따르면 AI 텍스트 생성기가 한 번에 더 많은 출력을 생성할수록, 그 텍스트가 인간이 작성한 것인지 여부를 판단하기가 더 쉬워진다. 그러나 이 감지 ‘錨’에 대한 일반적인 지식은 AI를 인간과 구별할 수 있는 이유는 무엇이든, 더 긴 텍스트에서 더 자주 수행될 수 있다고 가정한다.

그러나 텍스트 자체의 분포에 대한 가정은 없다.

이를 도전하고, 문제를 확장하기 위해, 중국의 최근 연구는 새로운 방법으로 장형 AI 콘텐츠 생성기를 실제 인간 작가와 구별하는 방법을 제공한다. 연구진은 토큰 단위로 AI 텍스트가 생성됨으로써, 더 긴 길이에서 더 일관성이 있게 된다는 것을 주장한다. 반면에, 사람들의 독특한 특징은 길이와 함께 감소하지 않는다.

이러한 방식으로, 저자들은 그들의 통찰력이 AI 텍스트 감지 시스템에 새로운 지표를 제공할 수 있다고 제안한다:

‘AI 생성 토큰은 텍스트의 후반부에서 더 작은 확률 변동과 더 안정적인 확률 변동을 나타낸다.

‘우리는 이 패턴을 후기 변동성 감소라고 부른다. 이 현상은 자기 회귀적 생성의 본질적인 행동을 반영한다: 더 많은 컨텍스트가 제공될수록, 모델의 예측 분포가 더 날카로워지며, 토큰 수준의 통계에서 변동성이 감소한다.

‘반면, 인간의 글은 계속해서 예상치 못한 어휘 선택을 도입하며, 전체적으로 더 높은 변동성을 유지한다.’

AI 텍스트에서 축적되는 이 стран한 ‘스무스함’을 포착하기 위해, 연구진은 두 가지 간단한 특징을 정의한다: 첫 번째는 작성된 글의 통계적 행동이 토큰 사이에서 얼마나 ‘점프한다’는지를 측정한다. 두 번째는 짧은 텍스트 구간에서 얼마나 안정적으로 유지되는지를 확인한다.

둘 다 출력의 두 번째 절반에서만 계산되며, AI는 현저히 더 규칙적이고 인간의 글은 그렇지 않다. 저자들은 이러한 신호가 개별적으로 잘 작동하지만, 구형 감지 방법과 결합하면 더 효과적이라고 주장한다. 또한 이 접근법이 더 긴 텍스트에서 더 잘 작동하며, 대조가 더 명확해진다고 주장한다.

새로운 논문은 ‘AI-ness’를 검사하기 위한 방법론을 제공하며, 추가적인 훈련이나 세부 조정, 특권 모델 액세스가 필요하지 않다.

새로운 연구When AI Settles Down: Late-Stage Stability as a Signature of AI-Generated Text Detection이라는 제목으로, 중국 항저우의 웨스트레이크 대학교의 4명의 저자에 의해 수행되었다.

방법

AI 생성 텍스트의 증가하는 스무스함을 포착하기 위해, 연구진은 통과의 두 번째 절반에만 집중하는 두 가지 측정을 설계했다: 이는 표준 언어 모델의 로그 확률 점수에 의존하며, 추가적인 세부 조정, 재훈련, 또는 추가 샘플이 필요하지 않다;

새로운 논문에서 - 각 행은 EvoBench의 기본 메트릭의 토큰 시퀀스에 대한 행동을 보여준다: 원시 값(왼쪽), 절대 도함수(중간), 및 로컬 표준 편차(오른쪽). 인간과 AI 라인은 각각 파란색과 빨간색으로 표시된다. 대부분의 발산은 텍스트의 두 번째 절반에서 발생하며, 특히 로그 확률과 샘플링 불일치에서 더 부드러운 AI 출력이 나타난다. 엔트로피와 Top-K 집중도는 시간이 지남에 따라 거의 변하지 않는다. 출처 - https://arxiv.org/pdf/2601.04833

새로운 논문에서 – 각 행은 EvoBench의 기본 메트릭의 토큰 시퀀스에 대한 행동을 보여준다: 원시 값(왼쪽), 절대 도함수(중간), 및 로컬 표준 편차(오른쪽). 인간과 AI 라인은 각각 파란색과 빨간색으로 표시된다. 대부분의 발산은 텍스트의 두 번째 절반에서 발생하며, 특히 로그 확률과 샘플링 불일치에서 더 부드러운 AI 출력이 나타난다. 엔트로피와 Top-K 집중도는 시간이 지남에 따라 거의 변하지 않는다. 출처 – https://arxiv.org/pdf/2601.04833

첫 번째 측정은 도함수 분산(DD)라고 불리며, 모델의 확신이 한 단어에서 다음 단어로 어떻게 급격하게 변경되는지를 추적한다. AI 텍스트는 리듬에 정착하는 경향이 있으므로 이러한 변경은 두 번째 절반에서 더 작고 더 예측 가능해진다. 반면에, 인간의 글은 ‘불규칙’으로 남아 있다.

두 번째 측정은 로컬 변동성(LV)라고 불리며, 모델의 확신이 작은 텍스트 창 안에서 얼마나 ‘점프한다’는지를 확인한다. 다시 한번, AI는 시간이 지남에 따라 더 안정적이 되며, 인간의 선택은 더 예측할 수 없고 일관성이 없다:

AI 텍스트는 진행됨에 따라 더 부드러워지며, 인간의 글은 불규칙하게 유지된다. 이러한 그래프는 통과의 과정에서 모델의 확신이 어떻게 변경되는지를 추적하며, 이는 연속적인 단어 사이의 변경의 날카로움과 로컬한 구간 내의 변동의 양을 반영한다. 두 가지 측면에서 모두, AI 출력의 감소는 더 가파르며, 중간 이후에 가장 뚜렷한 대조가 나타난다. 노란색 박스는 두 번째 절반에서 이 간격을 강조하며, 여기서 AI 글은 최대 32% 더 안정적이다.

AI 텍스트는 진행됨에 따라 더 부드러워지며, 인간의 글은 불규칙하게 유지된다. 이러한 그래프는 통과의 과정에서 모델의 확신이 어떻게 변경되는지를 추적하며, 이는 연속적인 단어 사이의 변경의 날카로움과 로컬한 구간 내의 변동의 양을 반영한다. 두 가지 측면에서 모두, AI 출력의 감소는 더 가파르며, 중간 이후에 가장 뚜렷한 대조가 나타난다. 노란색 박스는 두 번째 절반에서 이 간격을 강조하며, 여기서 AI 글은 최대 32% 더 안정적이다.

다시 한번, 두 가지 측정 모두 출력의 나중에 절반에서만 계산되며, 인간과 기계의 글쓰기 사이의 차이가 가장 뚜렷하다. 이러한 측정은 시계열 안정성 감지(TSD) 점수로 결합되어 있으며, 이는 글쓰기가 ‘더 부드러워’질수록(따라서 AI 생성될 가능성이 높을수록) 증가하는 경향이 있다. 간단한 임계값을 사용하여 주어진 통과가 기계에 의해 작성되었는지 여부를 결정한다.

이러한 특징은 패턴이 나타나는 시기에 초점을 맞추기 때문에, 패턴이 무엇인지에만 관심이 있는 이전 방법과 보완된다. Fast-DetectGPT의 출력에 TSD 점수를 추가하면 결과가 추가로 개선된다(특히 긴 형식 콘텐츠에서 가장 강한 늦은 단계의 매끄러움 효과가 나타남).

데이터 및 테스트

저자들은 두 개의 관련 벤치마크 데이터셋에서 테스트를 수행했다: EvoBench에는 7개의 모델 패밀리에서 생성된 32,000개의 인간/AI 텍스트 쌍이 포함되어 있으며, 여기에는 GPT-4와 GPT-4o, Claude, Google Gemini, LLaMA-3, 및 Qwen가 포함된다. 총 29개의 모델 버전이 특징이다.

다른 프레임워크는 MAGE였으며, 8개의 모델 패밀리에서 테스트한 30,000개의 쌍을 제공하며, 여기에는 OpenAI의 GPT 시리즈와 LLaMA, OPT, 및 FLAN-T5 패밀리가 포함된다.

경쟁자

새로운 방법은 동일한 대리 모델을 사용하여 다양한 제로샷 감지기를 테스트했다. 가능성, 엔트로피, 순위, 및 로그 순위 (DetectGPT)는 전체 통과에서 토큰 수준의 통계를 측정했다; LLR(DetectLLM)은 모델 간의 직접적인 비교를 허용하기 위해 정규화를 적용했다; 및 Fast-Detect 은 샘플링 기반의 섭동을 통해 로컬 곡선을 추정했다.

Lastde는 확률 신호의 차별적 서브시퀀스를 분석했으며, FourierGPT는 주파수 도메인에서 작동했다. Diveye는 서열에 대한 ‘놀람’ 다양성의 변화를 포착했다.

마지막으로, UCE는 토큰 예측의 불확실성 프로파일을 평가하여 비자연스러운 확신 패턴을 식별했다.

구현 및 결과

모든 감지 방법은 Llama-3-8B-Instruct를 공유 대리 모델로 사용하여 실행되었으며, 입력 시퀀스는 512 토큰으로 제한되었다. 시계열 특징은 각 통과의 두 번째 절반에서만 추출되었으며, 20 토큰의 슬라이딩 창을 사용하여 변동성을 측정했다. 제안된 방법의 융합 버전인 TSD+는 제안된 신호와 Fast-DetectGPT를 결합했다.

수신기 운영 특성 곡선 아래의 영역(AUROC)은 주요 평가 지표였다:

다양한 테스트 방법에 대한 AI 생성 텍스트에 대한 다양한 성능. 감지 정확도는 두 개의 벤치마크에서 보여지며, EvoBench는 여러 유명한 LLM을 다루며, MAGE는 보완적인 데이터셋이다. 메트릭은 전역 통계, 시계열 특징, 및 제안된 변형으로 그룹화된다. 평균 AUROC 점수는 마지막 열에 표시된다. 저자의 방법 변형의 결과는 일관되게 이전 기준을 초과하며, TSD+는 거의 모든 모델 설정에서最高의 점수를 얻는다.

다양한 테스트 방법에 대한 AI 생성 텍스트에 대한 다양한 성능. 감지 정확도는 두 개의 벤치마크에서 보여지며, EvoBench는 여러 유명한 LLM을 다루며, MAGE는 보완적인 데이터셋이다. 메트릭은 전역 통계, 시계열 특징, 및 제안된 변형으로 그룹화된다. 평균 AUROC 점수는 마지막 열에 표시된다. 저자의 방법 변형의 결과는 일관되게 이전 기준을 초과하며, TSD+는 거의 모든 모델 설정에서最高의 점수를 얻는다.

이 초기 결과에 대해 저자들은 다음과 같이 말한다:

‘우리의 단순한 시계열 특징은 독립적인 방법 중에서 최첨단 성능을 달성하며, TSD는 EvoBench에서 83.36%, MAGE에서 71.56%를 달성하여 모든 기준을 초과한다.

‘이는 우리의 방법이 단순함에도 불구하고 주목할 만하다: 우리는 시퀀스의 두 번째 절반에서만 2차 통계를 계산하며, 섭동 샘플링이나 주파수 도메인 변환 없이 계산한다.’

새로운 방법은 특히 GPT-4 및 GPT-4o와 같은 최신 AI 모델에서 잘 작동했으며, 가장 가까운 리더 감지기에 비해 최대 9.66%의 성능 격차로 AI 작성 텍스트를 더 정확하게 식별했다. 더 새로운 고급 모델은 더 일관된 텍스트를 생성하므로 자동화의 징조가 일부 숨겨지지만, 늦은 단계에서 특정 미세한 타이밍 패턴은 여전히 존재한다.

구조적 특징에 초점을 맞춘 경쟁 접근법은 이러한 늦은 단계의 패턴을 포착하지 못했다. 전역 감지기를 통합한 하이브리드 시스템은 이러한 놓친 신호를 회복하고, 특히 더 짧은 AI 출력이 시계열 큐를 약화시키는 벤치마크에서 성능을 개선했다.

결론

새로운 연구에서 직접적으로 다루지 않은 한 가지 측면은 인간 작가가 자신의 작업을 초안을 통해 여러 번의 검토를 거치고, 때로는 외부의 검토, 편집자 및 교정자의 입력, 및 특정 상황에 따라 법률 부서의 제안된 변경을 포함할 수 있다는 것이다.

단순한 신문 기사와 같은 문서에 참여하는 여러 이해관계자는 인간의 글에서 저자들이 주목하는 특이성을 모두 없애버릴 수 있으며, 이는 일종의 ‘아날로그 버전’의 AI 보조 초안 과정과 같다.

또한, 연구에 사용된 시스템은 이러한 작업에 훈련되었으며, 훈련 데이터는 훈련 시간에 권위에 따라 순위가 매겨지므로, 가장 ‘중요한’ 소스는 가장 ‘자연스럽지 않은’ 소스가 될 수 있다. 즉, 동료에게 보낸 사적인 이메일을 작성하는 것보다 연례 보고서를 작성하는 것과 같다.

또한, 여러 사람이 기여한 텍스트 콘텐츠는 가장 단편적이고 결점이 많으며 반복적인 산문 중 하나일 수 있다. 왜냐하면 이러한 콘텐츠는 종종 통일된 목소리의 이점을 누리지 못하기 때문이며, 개발의 조각조각한 특성이 산문에 명백하게 나타날 수 있다.

 

* 저자의 원래 텍스트 스타일이 논문에서 재현되었으며, 이는 저자의 강조가 아님.

저자들은 ‘기본’이라고 말하지만, 다른 평가 지표를 나열하지 않는다.

2026년 1월 26일 처음 게시됨

기계 학습 분야 작가이자 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: [email protected]