Anderson의 관점
AI 아이디어 감지, 텍스트는 감지 안 함

AI가 제공한 아이디어를 기반으로 무언가를 썼다는 것을 인식할 수 있는 AI 텍스트 감지기가 있다면 어떨까요 – 실제 글쓰기(즉, 텍스트)는 전부 여러분의 원본 작업이라 하더라도?
우리는 AI 텍스트 감지기가 연예인과 정치인 등을 난처하게 만든 사례를 모두 알고 있습니다 – AI가 만든 텍스트의 특성을 연구하고, 그런 패턴이 나타날 때 판별할 수 있는 알고리즘들입니다.
이러한 사례는 커뮤니케이션 작업을 단순히 위임한 것으로, ChatGPT와 Google Gemini와 같은 언어 모델이 사용자의 프롬프트에 대한 응답에서 다음에 올 가능성이 높은 토큰을 예측합니다 – 문제나 제안을 전체적으로 살펴보는 대신, 가장 확률이 높은 다음 단어를 추측하는 방식입니다.
그럼에도 불구하고, 이러한 조각조각 예측은 결국 근본적인 구조를 형성한다는 것이 최근 연구에서 밝혀졌습니다: 인접한 텍스트 구간이 서로 일관되고 관련성을 유지해야 한다는 요구가 작업의 ‘개요’ 혹은 고차원적 형태에 고유한 서명을 만들게 합니다 – 텍스트가 ‘인간화’되도록 광범위하게 재작성되더라도 AI의 손길을 판별할 수 있는 서명입니다:

다양한 LLM 하에서의 글쓰기의 독특한 고차원적 ‘형태’와 – 왼쪽 – 순수 인간 글쓰기. 출처
AI 아이디어 탐지 목표
University of Maryland가 주도하는 새로운 학술 협업은 한 걸음 더 나아가, 아이디어 자체가 AI에 의해 생성되었는지 여부를, 최종적으로 누가 글을 썼는지는 상관없이 감지할 수 있는 방법론을 제공합니다.
이 접근법은 IdeaLens라는 이름으로 불리며, 웹 문서에서 추출한 백만 개의 개요를 학습했습니다. 각 문서를 그 아이디어를 보존하면서 문구를 제거한 개요로 축소하는 데 중점을 두며 – 온라인 데모를 제공합니다:

왼쪽에서는 내 기사 중 하나가 온라인 데모에서 인간으로 인식되고, 내가 제출한 (다른 저자가 쓴) 또 다른 기사에서는 상당한 AI 입력이 있었던 것으로 보입니다. 출처
위의 샘플 데모 결과에서 볼 수 있듯이, 사용된 감지 방법은 인간 아이디어와 인간 문체, AI 아이디어와 AI 문체를 구별하고, 이를 세밀하고 뚜렷하게 평가할 수 있습니다 – 두 감지기가 동일한 문서, 라벨 및 기본 모델 구조로 학습되었음에도 불구하고, 본질적으로 반대되는 대상을 감지하도록 설계되었습니다: 아이디어의 출처와 문체의 출처.
이러한 감지 범위는, 추측컨대, 정치 연설문 작성자부터 소설가, 칼럼니스트에 이르는 다양한 작가들을 불안하게 만들 수 있으며, 지금까지 자신의 글쓰기 스타일을 중시하면서도 AI가 주제를 제공하도록 허용해 온 이들도 포함됩니다.
LLM이 인식 가능하고 (따라서 추적 가능한) 아이디어를 생성할 가능성이 높은 한 가지 이유는, 특정 개념과 텍스트가 모델의 불완전하게 관리된 학습 데이터를 통계적으로 지배해 다양한 요청에서 더 자주 나타나게 하는 것뿐만 아니라, LLM이 특정 학습 데이터와 관련이 없어 보이는 신비롭고 반복적인 집착을 가지고 있어도 자주 무작위로 나타나기 때문입니다.
저자들은 다음과 같이 말합니다*:
‘현대 AI 감지기는 누가 글을 썼는지를 식별하는 반면, AI 사용에 대한 새로운 정책은 점점 다른 질문에 초점을 맞추고 있습니다: 누가 아이디어를 생각해냈는가?우리는 IdeaLens를 소개합니다. 이 감지기는 문서의 아이디어가 인간에 의해 생성되었는지 AI에 의해 생성되었는지(아이디어 출처)를, 누가 글을 썼는지는 상관없이 식별합니다.
‘IdeaLens를 문체가 아니라 아이디어에 집중시키기 위해, 우리는 문서를 개요로 표현합니다: 각 항목이 담화 역할과 내용에 대한 간략하고 의역된 설명을 짝지은 리스트로, 원문과의 단어 수준 중복을 최소화합니다.’
데이터 및 방법
이 논문은 새로운 방법이 AI가 생성한 문서에서 인간 아이디어를 식별할 수 있다고 주장합니다(예: 누군가 AI에게 ‘이 주제에 대한 에세이를 써줘‘라고 말함); 또한 인간이 쓴 글에서 AI 아이디어를 식별할 수도 있다고 주장합니다(예: 누군가 AI에게 ‘내가 쓸 주제를 제안해줘’라고 말함).

인간과 AI 아이디어 및 텍스트의 네 가지 조합에 대한 테스트 결과. 아이디어와 텍스트가 동일한 출처를 공유할 때 네 가지 탐지기 모두 강력하게 작동하지만, 출처가 혼합될 경우 급격히 차이가 나타난다: IdeaLens는 인간 아이디어를 기반으로 한 AI 작성 문서를 94.7% 정확히 인간 기원으로 인식하고, 인간이 쓴 이야기에서 AI 아이디어를 68% 식별한다. 이는 Pangram 4의 8%와 ProseLens 및 EditLens-3B의 0%와 비교된다.. 출처
출처가 가장 명확할 때 탐지는 가장 쉽다 – 예를 들어, 인간이 쓴 글이 AI가 생성한 아이디어를 기반으로 하거나, AI가 생성한 결과물이 인간 아이디어에서 비롯된 경우이다. 이러한 출처 강도가 달라지면 탐지는 어려워진다.
연구자들은 문서의 기본 계획 중 사람이 차지하는 비율을 점진적으로 바꾸어 이 구분을 테스트했다. 한 실험에서는 AI 모델에 점점 더 상세한 인간 계획을 제공했으며, 주제 수준에서부터 완전한 개요에 이르기까지 다양했다.
인간 기여도가 증가함에 따라 IdeaLens의 AI 표시 비율은 94.9%에서 6.8%로 감소했으며, 기존 텍스트 탐지기들은 여전히 대부분의 결과 텍스트를 AI로 식별했다:

AI가 작성한 문서의 기본 계획을 점점 더 많이 인간이 제공할 때 발생하는 현상을 보여주는 테스트 결과. IdeaLens는 아이디어의 인간 기원을 점점 더 인식하게 되며, 주제만 제시된 프롬프트에서 94.9%였던 AI 표시 비율이 완전한 인간 개요에서는 6.8%로 감소한다; 기존 텍스트 탐지기인 ProseLens와 Pangram은 여전히 대부분의 결과물을 AI로 분류한다.
아이디어를 이를 표현하는 언어와 분리해야 하며, 문서에서 실제 아이디어를 만든 사람을 기록한 대규모 데이터셋이 없기 때문에, 연구자들은 기존 AI 작성 라벨 을 사용해 IdeaLens를 학습시켰지만, 대부분의 텍스트는 제거했다:

IdeaLens가 훈련 및 테스트 과정에서 아이디어를 텍스트와 분리하는 방식, 기존 텍스트 탐지기 ProseLens와의 비교. 1,321단어로 구성된 의견 기사 샘플을 역할 라벨이 붙은 개요로 축소하고, 각 포인트를 사건 기술이나 평가와 같은 기능별로 분류한다. 훈련 중에는 이러한 개요를 추가로 패러프레이즈하여 원본 문서에서 물려받은 문구를 제거한 뒤, IdeaLens가 기존 Pangram AI 라벨을 학습한다. 새로운 문서에 대해서는 추출된 개요를 바로 IdeaLens에 전달해 아이디어가 AI 유래일 확률을 추정한다. 그림 하단에는 연구진이 비교를 위해 사용한 두 번째 탐지기인 ‘ProseLens’가 표시되며, 이는 전체 텍스트를 받아 텍스트 자체가 AI 생성인지 여부를 추정한다.
위에서 보여준 바와 같이, 각 문서는 말하고자 하는 내용과 각 포인트가 문서에서 수행하는 역할을 설명하는 개요로 축소되었다. 훈련 중에는 이러한 개요를 패러프레이즈하여 저자의 원래 표현 흔적을 더욱 제거했다. IdeaLens는 따라서 예측을 주로 남은 아이디어에서 수행하며, 텍스트의 특징적인 특성에 의존하지 않는다.
프로젝트를 위해 세 개의 데이터셋이 제작되었다: IdeaShift; IdeaShift-X; 그리고 TwiceTold. IdeaShift는 연구진이 보유한 기존 테스트 코퍼스에서 샘플링한 500개의 인간 작성 및 AI 생성 시드 문서로 만들어졌다. GPT-5.6 Sol은 각 문서를 점진적으로 더 상세한 프롬프트, 즉 ‘주제 전용’에서 완전한 개요로 전환하도록 사용되었다. GPT-5.6은 이후 새로운 문서를 생성하는 데 활용되었다.
반면 IdeaShift-X는 24개 언어에 걸친 10,000개의 인간이 작성한 FineWeb2 문서를 사용했으며, 앞서 언급한 IdeaShift 프로토콜을 적용해 각 언어별 AI 버전을 생성했다.
세 번째 데이터셋인 TwiceTold는 저자들의 감독 하에 학술 학생들이 작성했으며, 이러한 데이터를 크라우드소싱할 때 AI의 고유한 사용을 방지하기 위함이다. 50개의 이야기가 처음부터 작성되었지만, ChatGPT-5.6 Sol이 제공한 500단어 개요를 사용했다.
테스트
연구자들의 자체 탐지기에는 IdeaLens(개요)와 문서 형태가 포함된 IdeaLens; 앞서 언급한 ProseLens; 양 시스템의 ModernBERT-L 버전; IdeaLens의 Qwen3.5-9B 버전; 그리고 IdeaLens logistic-classifier 변형이 포함되었습니다.
이들은 Pangram 4; EditLens-Llama-3B; Binoculars; EditLens-RoBERTa; MELD; Desklib-academic; Desklib; Entropy; Fast-DetectGPT; Likelihood; Log-rank; LRR; MAGE; OpenAI-RoBERTa-base; OpenAI-RoBERTa-large; RADAR; 및 Rank와 비교되었습니다.
테스트에서는 정확도를 아이디어의 출처와 예측된 AI 또는 인간 라벨이 일치하는지 여부로 측정했습니다. IdeaLens, ProseLens 및 EditLens는 전역 1% FPR 임계값을 사용했으며; Pangram 4의 AI, AI 지원 및 인간 라벨은 이진화되었습니다; 그리고 Fast-DetectGPT, Binoculars, MELD 및 Desklib는 기본 임계값을 사용했습니다.
보다 광범위한 평가에서는 19개의 외부 벤치마크를 사용했으며, 여기에는 완전한 인간 혹은 완전한 AI 자료를 다루는 14개와 인간이 작성한 글을 이후 AI가 편집한 10개가 포함됩니다. 추가로 50,000개의 도메인 내 문서를 테스트했으며, 10,000개의 사전 ChatGPT C4 문서를 사용해 위양성률을 평가했습니다:

아이디어와 본문의 출처가 동일하거나 다를 때 탐지기 정확도를 비교한 테스트 결과. IdeaLens는 두 경우 모두 높은 정확도를 유지하며, 동일 출처에서는 95.3%, 혼합 출처에서는 81.3%를 기록했습니다; 경쟁 탐지기들은 아이디어 출처가 본문 출처와 다를 때 크게 성능이 떨어집니다.
22개의 벤치마크에서 추출한 51개의 테스트 전체에서, IdeaLens는 아이디어와 본문이 동일하거나 다른 출처에서 나왔을 때 모두 강력한 성능을 보인 유일한 탐지기로, 각각 95.3%와 81.3%의 점수를 기록했습니다.
대조적으로, ProseLens와 Pangram 4는 아이디어와 본문이 동일한 출처일 때 98% 이상을 기록했지만, 그렇지 않을 경우 약 25% 수준으로 떨어졌습니다.
저자들은 이러한 결과에 대해 다음과 같이 말합니다*:
‘ProseLens가 IdeaLens와 동일한 백본, 학습 문서 및 학습 라벨을 가지고 있기 때문에, 이는 우리의 개요 표현이 미치는 영향을 강조합니다. 이 표현은 ModernBERT-based pair가 다른 백본으로 복제합니다.
‘IdeaLens는 테스트 시 원시 텍스트 입력에도 예상외로 잘 전이되어, 동일 출처 정확도가 높고 혼합 출처 정확도도 ProseLens보다 크게 높습니다.’
세 탐지기 모두 원래 AI가 작성한 이야기를 거의 모두 성공적으로 식별했습니다. TwiceTold에서 IdeaLens는 인간이 쓴 이야기 중 68%에서 AI 기원 아이디어를 식별했으며, ProseLens는 0%, Pangram 4는 8%에 불과했습니다:

IdeaLens는 동일한 AI 생성 개요를 기반으로 원래 AI가 쓴 이야기와 인간이 쓴 TwiceTold 버전 모두에 유사한 AI 확률을 부여하는 반면, ProseLens의 AI 확률은 본문이 인간에 의해 재작성되면 급격히 감소합니다.
영어로 훈련되었음에도 불구하고, IdeaLens는 IdeaShift-X의 24개 언어 전반에 걸쳐 일반화되어 AI 아이디어를 기반으로 한 문서의 95.3%를 표시했지만, 상세한 인간 계획이 아이디어를 제공할 경우에는 0.7%에 불과했습니다. 동일한 언어에서 10,000개의 사전 ChatGPT 인간 문서를 대상으로 한 결과, 위양성률은 단 0.1%에 그쳤습니다.
저자들은 향후 연구에서 더 큰 데이터셋이 바람직할 것이며, 데이터셋 라벨의 노이즈 문제가 해결되어야 할 수도 있다고 인정합니다. 그럼에도 불구하고 이 흥미로운 초기 결과를 기반으로 구축하고자 하는 사람들은 논문 저자들이 제공한 GitHub 저장소를 활용할 수 있으며, 단순히 호기심이 있는 사람들은 프로젝트의 데모 사이트에 ‘suspect’ 테스트를 붙여 넣어 방법이 자신의 추정치나 다른 접근 방식과 일치하는지 직접 확인할 수 있습니다.
결론
이러한 탐지 방법이 중요한지 여부는 AI의 수용, 통합 또는 거부가 향후 6~12개월 동안 어떻게 전개될지에 달려 있습니다(의심할 여지 없이 다양한 분야와 상황에 따라 달라질 것입니다).
정치인의 대중이 AI를 사용해 자신의 원래 아이디어를 다듬고 표현하는 것을 AI를 단순한 프레젠테이션 도구로 사용하는 것에 대해 동정적으로 받아들일 가능성이 높다는 점은 더 관대할 수도 있습니다.
하지만 동시에, 우리가 AI에게 기대하는 것이 인간이 간과하거나 전혀 생각하지 못한 관점, 아이디어, 대안을 제공하는 것이라면, 기계 지능에게 운전대를 잡게 하는 것이 그렇게 나쁜 생각일까요?
음, 시각적인 측면에서, 그리고 AI가 유명하고 점점 늘어나는 오류 경향과 –최근에– 오류 행동, 아직 LLM이 정책 제안을 제시하거나 일반적으로 아이디어 창출의 주된 힘이 되기에 너무 이른 시점일지도 모릅니다.
*저자들의 강조이며, 제 것이 아니라, 필요에 따라 저자들의 인라인 인용을 하이퍼링크로 변환한 것입니다.
2026년 10월 6일 화요일 최초 게시












