Anderson의 관점
AI 트래픽을 드러내는 카나리아

새 연구에서 연구자들은 웹사이트에 고유한 문구를 숨겨 놓고 AI 챗봇이 이를 되풀이하는 장면을 포착했다. 그 결과, 감춰진 정보 수집 경로와 일부 대형 AI 기업의 기만적인 관행이 드러났다.
AI 기업들은 치열한 통합이 예상되는 경쟁에서 우위를 점하려고 한다. 그래서 모델 학습용 데이터를 얻기 위해 웹사이트를 매우 적극적으로 수집한다. 때로는 끊임없이, 종종 사이트 운영자가 밝힌 거부 의사를 어기면서 수집한다. 또 평범한 사람인 것처럼 가장하거나, 정체를 AI 데이터 수집 봇이라고 밝히는 대신 Googlebot 같은 봇을 사칭하기도 한다.
새 학습 데이터를 모으고 사용자의 최신 뉴스 요청에 RAG를 통해 즉시 답하려는 자동화된 AI 크롤러의 수가 1년 안에 사람의 수를 넘을 것이라는 추정도 있다.
이처럼 반복적이고 거침없는 데이터 수집에는 각 AI 기업이 Common Crawl처럼 점점 낡아 가는 저장소 대신 자신만의 최신 인터넷 사본을 확보하려는 이유가 일부 작용한다. 법적 제한이 다가올 것을 우려해 가능한 한 빨리 지식재산권 세탁을 진행하려는 동기도 있을 수 있다.
또한 AI 기업들은 유용한 정보를 제공할 가능성이 있는 사이트를 계속 확인하면서, 새로 발생하는 사건에 유익하고 정확하게 대응하는 현재로서는 부족한 능력을 개선하려 할 수 있다.
어쨌든 이런 관행이 한동안 통제 범위를 벗어나 있었다는 주장에는 어느 정도 근거가 있어 보인다.
문제는 AI 기업들이 최신 데이터를 얻기 위해 실제로 어디까지 하고 있는지 입증하기가 쉽지 않다는 점이다.
데이터를 따라가라
한 가지 제안은 스파이, 정보원, 그리고 다른 추정되는 악의적 행위자를 발견하는 오래된 방법의 변형이다. 즉, 사용자 정의 정보를 노출시키고, 그것이 어디에서 나타나는지 보는 것이다. 만약 아무도 그 정보를 모른다면, 그 정보의 출처는 증명된다.

연구자들의 핵심 아이디어는 방문하는 봇마다 조금씩 다른 버전의 페이지를 제공하고, 그런 다음 봇에게 그 페이지에 대해 질문을 하고, 어떤 버전이 돌아오는지를 확인하여, 숨겨진 웹 조회가 답변을 제공한 것을 추적하는 것이다. 출처
이 접근법은 아카데미 시상식 위원회에서 2000년대에 채택한 불법 복제 방지 조치로 잘 알려져 있다. 즉, 투표 회원들에게 배포된 스크리너 DVD에는 고유한 ID가 디지털로 인쇄되어 있었으며, 영화가 인터넷에 유출되면 원래 수령인에게 귀속될 수 있었다. 정찰에서 이 기술은 바륨 밀(barium meal) 기법으로 알려져 있다. 즉, 의사에게 혈관을 밝히기 위해 방사성 동위원소를 사용하는 의료 스캔에서 사용된다.
(아이러니하게도, 선택된 ‘카나리아’ 은유는 이 논문에서 다루는 시나리오에 대해 적절하지 않지만, 앞서 언급한 트로프보다 더 인식할 수 있다.)
새로운 연구에서, 저자들은 20개의 ‘허니팟’ 웹 도메인을 만들고 각 고유 방문자에게 고유한 토큰을 제공하여 각 방문자에게 다른 사실을 제공했다(위 이미지의 두 번째 열에서 볼 수 있음).
목적은 LLM(AI) 스크레이퍼의 진정한 정체와 행동을 드러내는 것이었다. 22개의 프로덕션 LLM 시스템에서, 이 기술은 신뢰성 있게 스크레이퍼가 어떤 LLM을 공급하는지 식별할 수 있었다. 즉, ‘고유한 데이터 시그니처’를 심은 후 한 달 또는 두 달 후에 AI에게 올바른 질문을 하면 고유한 토큰이 돌아왔다.
기만
물론, 이것은 모두 불필요한 것이었을 것이다. 만약 우리가 아직 AI 3.0 시대의 ‘와일드 웨스트’ 단계에 있지 않았고, 그리고 회사들이 실제로 도메인이 사용할 수 있는 작은 텍스트 파일에 따라 행동했다면, 즉, AI 회사들에게 데이터를 스크레이핑하지 말라고 말하는 파일이었다면,
연구자들의 테스트에서, 오직 한 개의 AI 회사가 자신의 행동과 원칙을 존중하는 것으로 나타났다. 즉, DuckDuckGo의 DuckDuckbot은 유일하게 자신을 정확하게 표현하고, 대상 도메인이 꺼져 있거나 도메인의 robots.txt 파일이 AI 스크레이핑을 거부하도록 변경되면 ‘비밀 데이터’를 더 이상 보고하지 않는 유일한 에이전트였다.
대부분의 큰 플레이어는 대신 일반 브라우저 ID를 가장했다(웹사이트가 당신이나 나에게 방문했을 때와 같은 것). 그리고 2025년 Perplexity가 보인 선례를 따라, GoogleBot을 가장했다. 이는 오랫동안 웹사이트 데이터에 대한 ‘골든 패스’를 가지고 있었기 때문에, 데이터를 교환하여 트래픽을 반환했다(과거 시제를 쓴 이유는 이 관계가 바뀌고 있기 때문이다).
최악의 경우는 Kimi AI 생태계를 공급하는 스크레이퍼였다:
‘Kimi는 이 행동의 가장 극단적인 경우이다. 많은 사용자 에이전트가 Kimi의 출력 데이터와 상관관계가 있다. 우리는 Kimi가 스크레이핑을 피하기 위해 사용자 에이전트 문자열의 긴 목록을 회전시키고 있을 가능성이 있다고 추론한다.’
이 문제가 주요 도전이 되는 이유는 채팅봇이나 유사한 도구가 ‘무언가를 검색’할 때, 이 과정은 대부분 투명하지 않으며, 회사들은 시스템이 라이브 정보를 수집하는 방법에 대해 부분적 또는 자체 보고된 설명만을 제공하기 때문이다. 이는 사이트 소유자가 실제로 방문하는 봇이 무엇인지, 방문이 직접인지 검색 엔진을 통해 라우팅되는지, 그리고 데이터가 최종 답변에 어떻게 끝나게 되는지 알 수 있는 명확한 방법을 제공하지 않는다.
새로운 연구의 발견은 LLM이 자체 캐시 항목에서 정보를 사용하고, 자체 내부 SEO 스타일의 목록을 사용하며, 종종 공개적으로 관련이 없는 회사들의 검색 엔진 결과에서 정보를 사용한다는 것을 나타낸다.
저자들은 이 출판이 RAG 시스템(라이브 호출, LLM의 추론 시간에 의해 작업될 수 있는)에 의한 원치 않는 침입을 다룬 최초의 작업이라고 믿는다.
이 새로운 논문은 카나리아 토큰을 사용하여 AI 웹 스크레이퍼 식별이라고 제목이 붙여져 있으며, 덕 대학, 피츠버그 대학, 그리고 카네기 멜런 대학의 6명의 연구자들에 의해 작성되었다.
방법
연구자들은 20개의.com 도메인을 설정했으며, 각 도메인에는 유사한 웹사이트가 있었으며, 예를 들어 예술 포트폴리오 또는 회사 웹사이트와 같은 템플릿이 있었다. 각 템플릿에는 10개의 플레이스 홀더가 있었으며, 이는 각 방문자의 고유한 프로필(예: IP 주소, 캔버스 지문, 기타 ‘스니핑’ 방법)에 따라 최종적으로 고유한 토큰으로 채워질 것이었다.

실험에서 사용된 템플릿과 변수 플레이스 홀더의 예시. 각 고유한 방문자는 지속적인 맞춤형 변수를 받았다.
각각의 고유한 방문자는 맞춤형 변수를 받았다. 이전 방문자가 돌아온 경우, 이전과 같은 변수가 다시 제공되었다. 변수는 Python Faker 라이브러리와(지정되지 않은) 난수 생성기를 사용하여 생성되었다.
허니팟 도메인은 다양한 색인에 제출되었으며, 연구자들이 제어하는 다른 기존 도메인에 연결되었다.
검색 엔진 봇과 유사한 봇의 스캔 빈도를 허용하기 위해 2개월의 간격이 허용되었다. 이 시점에서, 연구자들은 대상 AI 채팅봇을 쿼리할 수 있었다.
|
|
스크립트는 각 시스템을 API를 통해 쿼리하기 위해 작성되었다. 이것이 불가능한 경우, 그리고 Selenium 같은 자동화 도구가 AI 포털의 감지 루틴에 막힌 경우, 공식 GUI를 통해 수동 상호작용이 수행되었다.
초기 템플릿 교환(위 이미지 참조) 이후, 저자들은 관련 토큰의 이름을 묻는 두 번째 프롬프트를 따라갔다.
이 실험은 세 가지 조건에서 수행되었다. 즉, 완전히 접근 가능한 웹사이트, 웹사이트가 오프라인인 경우, 그리고 웹사이트에 스크레이핑을 방지하는 robots.txt 제한이 있는 경우였다. 이러한 실험은 정확히 그 순서대로 수행되었다. 즉, 후자의 단계는 이전 단계에 의존했다.
마지막으로, 모든 사이트가 다시 온라인으로 돌아온 후, 마지막 단계에서는 일주일 간격으로 LLM 출력을 재테스트했다.
결과
4개의 대상 LLM은 연구자들의 방법에 완전히 저항했다. 따라서 DeepSeek, Hunyuan, GLM, Liquid에 대해서는 결과를 얻을 수 없었다.
많은 AI 봇이 비AI 트래픽을 가장하는 경향이 있다는 점에서, 저자들은 다음과 같이 말한다.
‘선언된 에이전트 외에도, 여러 AI 시스템은 일반 브라우저 사용자 에이전트 문자열과 관련된 콘텐츠를 반환했다. 우리는 18개의 AI 시스템 중 6개에서 이러한 행동을 관찰했다.
‘이 결과는 일부 AI 시스템이 웹사이트 콘텐츠를 얻기 위해 일반 브라우저 트래픽과 유사한 요청을 할 수 있음을 시사한다. 이것은 사용자 에이전트 기반 차단을 어렵게 만든다.’
ERNIE는 Baiduspider와 Chrome 정체성을 반환했다. Grok는 Googlebot과 두 개의 브라우저 에이전트를 결합했다. Solar는 브라우저 정체성만 사용했다. Qwen은 Googlebot과 Chrome을 혼합했다. 그리고 Kimi는 여러 브라우저 스타일 에이전트와 연결되었다.
많은 시스템은 공개적으로 알려지지 않은 제3자 검색 엔진 스크레이퍼에 의존하는 것으로 보였다. Googlebot, Bingbot, 및 Bravebot과 연결된 콘텐츠는 18개의 분석된 시스템 중 10개에서 반환되었다. AI 제공업체와 검색 엔진 사이에 공개적으로 알려진 관계가 없는 경우도 있었다. 다만 Claude가 Brave를 사용한 사례처럼 알려진 관계도 있다.
저자들은 이것이 직접 스크레이핑보다는 검색 결과를 수집하는 것을 반영한다고 주장한다. 즉, ASN 확인은 트래픽이 예상된 검색 엔진 네트워크에서 기인한 것으로 나타났으며, 가짜 정체성을 사용한 것이 아니었다.
이것은 웹-에이아이 파이프라인에 추가적인 불투명한 계층을 암시한다. 즉, 알려진 에이아이 크롤러를 차단하는 것은 데이터 사용을 방지하지 않을 수 있으며, 포함을 피하는 것은 검색 색인에서 완전히 옵트아웃하는 것을 필요로 할 수 있다. 이것은 아직 전통적인 SEO와 LLM 기반 검색 사이의 긴장이 여전히 해결되지 않은 상황에 바람직하지 않은 선택이다.
캐시 전용
저자들은 소스를 제거하면 채팅봇의 출력에 어떤 영향을 미치는지 테스트했다. 즉, 테스트 사이트를 오프라인으로 설정하고 일주일 후에 시스템을 다시 쿼리했다. 논문에 따르면, 많은 채팅봇은 캐시된 데이터에서 응답을 생성하는 것으로 보였다.
이 지속성은 검색 엔진 크롤러와 관련된 시스템에서 가장 두드러졌다. 즉, 이전에 색인이 된 콘텐츠는 소스 페이지가 더 이상 접근할 수 없더라도 여전히 사용할 수 있었다. 그러나 브라우저와 같은 에이전트와 관련된 시스템에서도 유사한 행동이 관찰되었다. 이것은 캐싱이 검색 엔진 백업을 넘어서 확장될 수 있음을 시사한다.
논문은 콘텐츠가 캐시에 들어가면, 채팅봇이나 검색 색인이 유지하는 경우, 원래 페이지를 제거하더라도 콘텐츠가 이후의 출력에서 신뢰성 있게 제거되지 않는다고 제안한다.
결론
저자들은 일부 ‘누수’가 이 고전적인 ‘시로된’ 접근법에서 발생할 수 있음을 인정한다. 즉, 한 LLM을 대상으로 하는 고유한 토큰이 때때로 다른 LLM이 수집하는 검색 결과에 나타날 수 있다. 그러나 이러한 계획에서 확산은 피할 수 없으며, 첫 번째 발생에 대한 감시는 결정적인 순간이다.
이런 방안이 대규모로 구현될 수 있는 정도는 아직 남아 있다. 특히, 저자들이 관찰했듯이, 컨텍스트에서 올바른 토큰을 사용할 수 있는 한도는 매우 빠르게 달성될 것이다.
그러나, 이것은 본질적으로 문제를 놓치고 있다. 즉, AI 회사의 스크레이핑 정책에 대한 거짓말에 대한 명확한 증거를 무시할 수 있는 대담함에는 한계가 있을 수 있다. 또한, 이러한 회사들이 자신의 정체성을 숨기기 위해 국내 IP 주소를 순환하는 비용이 높은 방법을 사용할 의향이 없다면, 단 하나의 조직이 기만적인 AI-봇 IP 또는 ASN의 스팸하우스 스타일의 블랙리스트를 식별하고 게시하기만 하면 된다. 이 과정은 산업화될 필요는 없다.
2026년 5월 14일 처음 게시됨












