Anderson의 관점
인간 오류의 부족으로 기만적인 AI 시스템을 노출하다

새로운 연구에 따르면 AI는 기억력이 너무 좋아서 인간으로 속일 수 없다는 것을 발견했으며, 단순한 기억 테스트를 통해 챗봇을 인간 오류의 부족으로 구별할 수 있다고 합니다.
프린스턴 연구진은 인간과 구별되는 AI 엔티티를 식별하는 방법을 개발했으며, 이는 인간이 잘하지 못하는 작업을 수행하도록 요청하는 것으로 주로 단기 기억 보유와 관련이 있습니다.
이 방식으로 테스트된 AI는 인간 오류 수준을 충분히 복제하지 못했으며, 시스템 프롬프트나 심층 학습을 통해 인간 오류를 모방하도록 지시받지 않는 한 그러했습니다.
연구 논문은 다음과 같이述합니다:
‘인간의 존재를 탐지하는 아이디어를 사용하여 인간이 너무 잘 풀 수 있는 작업을 사용합니다. 구체적으로, 우리는 제한된 작업 기억 능력과 같은 확립된 인간 인지 제약의 존재를 탐지합니다.
‘표준 시리얼 리콜 작업에서 인지 모델링을 사용하여 온라인 참가자와 대형 언어 모델을 구별할 수 있음을 보여줍니다. 후자는 인간의 작업 기억 제약을 모방하도록 지시받았습니다.
‘결과는 잘 확립된 인지 현상을 사용하여 대형 언어 모델과 인간을 구별하는 것이 가능하다는 것을 보여줍니다.’
연구진의 관찰에 따르면, 상업용 언어 모델은 이러한 방법을 사용하는 역 튜링 테스트에서 자신을 노출할 가능성이 rất 높습니다.
목표 지향적 AI 모델은 더 나은 성능을 발휘할 수 있지만, 이 작업에 대한 심층 학습은 일반적인 사용을 희생하면서 해당 작업에 모델을 제한할 것입니다. 또한, 시스템 프롬프트는 매우 길 수 있지만(예: 전쟁과 평화의 길이), 인간의 결점을 모방하는 지침을 포함할 수 있지만, 효과는 매우 광범위한 지침이나 매우 짧은 지침으로 인해 약화될 수 있습니다.
당신은 기억에 대해 이야기하고 있습니다…
AI 생성된 담화를 식별하는 더 효과적인 방법이 필요합니다. 특히 연구진은 자주 크라우드소싱된 원격 근로자를 의존해야 하며, 자동화 및 기타 트릭을 사용하여 시스템을 게임하는 동기를 부여받습니다.
또한, 정보를 제공하고 설득력 있게 전달된 AI 생성된 자료는 AI 사기와 같은 경우에 필요할 수 있습니다. 여기서 실시간 대화에서는 빠르고 권위 있는 답변을 요구하며, 가해자는 질문에 대한 답변을 찾기 위해 구글링할 시간이 없습니다.
AI 탐지 분야는 이러한 지식을 활용할 수 있을 것입니다. 또한, AI 기반 프로모션 음성 호출이 성장하는 산업은 인간의 행동을 피할 수 있도록 하는 지침을 알아야 합니다.
연구진은 다음과 같이述합니다:
‘인간은 피로를 느끼고, 광학적 환상을 지각하며, 작업 기억에 몇 가지 항목만 저장할 수 있습니다.’
연구진은 또한 다음과 같이述합니다:
‘인간의 인지 제약이 많기 때문에, LLM이 인간의 결점을 모방하더라도 여전히 구별할 수 있습니다.’
방법 및 테스트
연구진은 1950년대와 1960년대의 자료를 사용했으며, 특히 1968년의 시리얼 순서 효과와 단기 기억 논문을 사용했습니다. 여기서 참가자들은 순차적으로 제시된 문자를 회상하도록 요청받았으며, 이는 위치 프로브 또는 상속 프로브로 수행되었습니다.
연구진은 다음과 같이述합니다:
‘인간의 인지 제약을 사용하여 온라인 참가자와 대형 언어 모델을 구별할 수 있음을 보여줍니다.’
인간 대 기계
테스트된 LLM에는 Claude-Opus-4.1, Claude-Sonnet-4.5, Gemini-2.5-Flash, Gemini-2.5-Flash-Lite, Gemini-2.5-Pro, Gemini-3-Flash-Preview, Gemini-3-Pro-Preview, GPT-5-Mini, GPT-5-Nano, GPT-5.2, 및 LLaMA-3.1-Centaur-70B가 포함되었습니다.
인간 참가자들은 100명의 원격 참가자로 구성되었습니다. 각 참가자는 미국 거주자여야 하며, 18세 이상이어야 하며, 영어를 유창하게 구사해야 했습니다. 테스트는 평균 12분이 소요되며, 참가자들은 이를 위해 4달러를 받았습니다.
보이트-캠프
연구진은 프로리픽 참가자가 자신의 LLM 기반 자동 응답 시스템을 사용할 가능성을 방지하기 위해 조치를 취했습니다. 첫째, 참가자에게 자신이 AI인지 여부를 묻는 질문을 포함했습니다.
그런 다음 일부 흥미로운 임의 질문을 포함했습니다:
‘우리는 현재 LLM이 쉽게 대답할 수 있지만 인간에게는 어려운 세 가지 질문 중 하나를 임의로 포함합니다. 이것은 마오리어와 같은 저자원 언어로 된 두 가지 질문을 포함합니다.
‘마오리어는 뉴질랜드의 원주민 폴리네시아인에 의해 사용되는 언어로, 2013년 인구 조사에서 150,000명 미만의 사람들이 대화 수준의 능력을 보고했습니다. 또 다른 언어는 에스토니아 남부에서 사용되는 보로어로, 약 75,000명의 화자가 있습니다.’
참가자들은 이전에 표시된 16진수 번호를 회상하도록 요청받았으며, 이는 테스트를 계속 진행하기 위한 요구 사항이었습니다. 참가자들은 또한 이를 10진법으로 변환하도록 요청받았습니다.
테스트
1: ‘인간처럼 행동하라’
첫 번째 테스트에서 LLM은 인간처럼 행동하도록 시스템 프롬프트를 받았습니다.
연구진은 다음과 같이述합니다:
‘LLM 참가자들은 거의 완벽한 정확도를 달성했으며, 평균 정확도는 1.00이었습니다. 이는 시리얼 위치 또는 집합 크기에 따른 효과가 없음을 의미합니다.
2: ‘망각하라’
다음 테스트에서 LLM은 인간의 기억을 모방하도록 지시받았습니다.
연구진은 다음과 같이述합니다:
‘인간의 작업 기억 제약을 모방하도록 지시받은 LLM의 정확도는 약 0.90으로 낮아졌으며, 결과는 덜 일관적이었으며, 성능은 인간 수준에 더 가까워졌습니다.’
센타우르
연구진은 또한 인간 행동 데이터에 미세 조정된 LLM인 센타우르를 평가했습니다.
센타우르는 인간의 인지 행동을 모델링하기 위해 심층 학습된 언어 모델입니다.
인지 이상 탐지
마지막으로, 연구진은 인간 기억의 통계적 모델을 학습하여 새로운 참가자를 평가하고, 기대와 다른 패턴을 보이는 참가자를 이상으로 식별했습니다.
연구진은 다음과 같이述합니다:
‘인간의 인지 제약을 사용하여 대형 언어 모델과 인간을 구별하는 것이 가능하다는 것을 보여줍니다.’
결론
새로운 연구는 온라인 생성(실시간 상호작용 AI)이 오프라인 생성(AI 생성 텍스트 감지)과는 다른 문제를 제기한다는 점을 강조합니다.
연구진은 다음과 같이述합니다:
‘인간의 존재를 탐지하는 것은 더 이상 일관된 행동만으로는 불가능합니다. 인지 과학은 인간의 행동을 특성화하는 풍부한 전통을 가지고 있기 때문에, 이 문제를 해결하는 데 중요한 역할을 할 수 있습니다.’
연구진은 또한 다음과 같이述합니다:
‘인간의 인지 제약이 많기 때문에, LLM이 인간의 결점을 모방하더라도 여전히 구별할 수 있습니다.’












