Anderson의 관점

AI 트래픽을 드러내는 카나리아

mm
Unite.AI를 Google의 선호 소스에 추가
AI-generated image (GPT-2): Rows of human workers focus on their computer screens while a distracted robot, seated among them, tries to look up at a yellow canary perched on its head.

새로운 연구에서 연구자들은 고유한 구문을 웹사이트에 숨기고 AI 채팅봇이 그것을 반복하는 것을 포착하여 숨겨진 스크레이핑 파이프라인을 노출시키고 일부 가장 큰 AI 회사들의 기만적인 관행을 드러내었다.

 

AI 회사들은 예측된대로 무자비한 축소 경쟁에서 우위를 점하기 위해 싸우고 있기 때문에 실제로, 정말로 웹사이트를 스크레이핑하여 훈련 데이터를 얻으려 한다. 때때로 끊임없이; 종종 자신의 의지에 반하여; 그리고 자주 인간 사용자로 가장하는 가면을 쓴 채로, 또는 ‘더 친절한’ 봇으로서, 예를 들어 GoogleBot와 같은 것으로서, 실제 정체를 AI 데이터 스크레이퍼로 드러내지 않는다.

현재 자동화된 AI 스크레이퍼가 새로운 훈련 데이터를 수집하고 사용자의 즉각적인 최신 뉴스 요구에 대응하기 위해 RAG를 통해 작동할 것으로 예상되며, 이는 1년 내에 인간을 능가할 것으로 추정된다.

이狂적인 데이터 수집은 부분적으로 각 AI 엔티티가 인터넷의 최신 복사본을 갖고 있기 위함이며, 점점 더 구식이 된 저장소인 Common Crawl과 같은 것보다; 그리고 아마도 법적 제한이 도래할 것을 두려워하여 IP 세척을 가능한 한 빨리 수행해야 하기 때문일 것이다.

또한, 가능한 많은 사이트를 계속 폴링함으로써, AI 회사들은 현재 정보를 제공하고 정확하게 응답하는 능력을 향상시키기를 희망할 수 있다.

어떤 경우에든지, 이러한 관행이 오랜 시간 동안 제어할 수 없고 통제할 수 없다는 주장이 일부Merit을 가지고 있는 것으로 보인다.

문제는, AI 회사들이 최신 데이터를 얻기 위해 어떤 길을 가고 있는지 증명하는 것이 쉽지 않다는 것이다.

데이터를 따라가라

한 가지 제안은 스파이, 정보원, 그리고 다른 предполаг된 악의적 행위자를 발견하는 오래된 방법의 변형이다. 즉, 사용자 정의 정보를 노출시키고, 그것이 어디에서 나타나는지 보는 것이다. 만약 아무도 그 정보를不知道한다면,_then 정보의 출처는 증명된다.

연구자들의 핵심 아이디어는 방문하는 봇마다 조금씩 다른 버전의 페이지를 제공하고, затем 봇에게 그 페이지에 대해 질문을 하고, 어떤 버전이 돌아오는지를 확인하여, 숨겨진 웹 조회가 답변을 제공한 것을 추적하는 것이다. 출처 - https://arxiv.org/pdf/2605.13706

연구자들의 핵심 아이디어는 방문하는 봇마다 조금씩 다른 버전의 페이지를 제공하고, затем 봇에게 그 페이지에 대해 질문을 하고, 어떤 버전이 돌아오는지를 확인하여, 숨겨진 웹 조회가 답변을 제공한 것을 추적하는 것이다. 출처

이 접근법은 아카데미 시상식 위원회에서 2000년대에 채택한 반해적 조치로 잘 알려져 있다. 즉, 투표 회원들에게 배포된 스크리너 DVD에는 고유한 ID가 디지털로 인쇄되어 있었으며, 영화가 인터넷에 유출되면 원래 수령인에게 귀속될 수 있었다. 정찰에서 이 기술은 바륨 식으로 알려져 있다. 즉, 의사에게 혈관을照明하기 위해 방사성 동위원소를 사용하는 의료 스캔에서 사용된다.

(아이러니하게도, 선택된 ‘카나리아’隐喩는 이 논문에서 다루는 시나리오에 대해 적절하지 않지만, 앞서 언급한 트로프보다 더 인식할 수 있다.)

새로운 연구에서, 저자들은 20개의 ‘허니팟’ 웹 도메인을 만들고 각 고유 방문자에게 고유한 토큰을 제공하여 각 방문자에게 다른 사실을 제공했다(위 이미지의 두 번째 열에서 볼 수 있음).

목적은 LLM(AI) 스크레이퍼의 真正한 정체와 행동을 드러내는 것이었다. 22개의 프로덕션 LLM 시스템에서, 이 기술은 신뢰성 있게 스크레이퍼가 어떤 LLM을 공급하는지 식별할 수 있었다. 즉, ‘고유한 데이터 시그니처’를 심은 후 한 달 또는 두 달 후에 AI에게 올바른 질문을 하면 고유한 토큰이 돌아왔다.

기만

물론, 이것은 모두 불필요한 것이었을 것이다. 만약 우리가 아직 AI의 ‘와일드 웨스트’ 단계에 있지 않았고, 그리고 회사들이 실제로 도메인이 사용할 수 있는 작은 텍스트 파일에 따라 행동했다면, 즉, AI 회사들에게 데이터를 스크레이핑하지 말라고 말하는 파일이었다면,

연구자들의 테스트에서, 오직 한 개의 AI 회사가 자신의 행동과 원칙을 존중하는 것으로 나타났다. 즉, DuckDuckGo의 DuckDuckbot은 唯一하게 자신을 정확하게 표현하고, 대상 도메인이 꺼져 있거나 도메인의 robots.txt 파일이 AI 스크레이핑을 거부하도록 변경되면 ‘비밀 데이터’를 더 이상 보고하지 않는 唯一한 에이전트였다.

대부분의 큰 플레이어는 대신 일반 브라우저 ID를 가장했다(웹사이트가 당신이나 나에게 방문했을 때와 같은 것). 그리고 Perplexity의 2025년 리드를 따라, GoogleBot을 가장했다. 이는 오랫동안 웹사이트 데이터에 대한 ‘골든 패스’를 가지고 있었기 때문에, 데이터를 교환하여 트래픽을 반환했다(과거 시제를 사용하는 이유는 이것이 바뀌고 있기 때문이다).

최악의 경우는 Kimi AI 생태계를 공급하는 스크레이퍼였다:

‘Kimi는 이 행동의 가장 극단적인 경우이다. 많은 사용자 에이전트가 Kimi의 출력 데이터와 상관관계가 있다. 우리는 Kimi가 스크레이핑을 피하기 위해 사용자 에이전트 문자열의 긴 목록을 회전시키고 있을 가능성이 있다고 추론한다.’

이 문제가 주요 도전이 되는 이유는 채팅봇이나 유사한 도구가 ‘무언가를 검색’할 때, 이 과정은 대부분 투명하지 않으며, 회사들은 시스템이 라이브 정보를 수집하는 방법에 대해 부분적 또는 자체 보고된 설명만을 제공하기 때문이다. 이는 사이트 소유자가 실제로 방문하는 봇이 무엇인지, 방문이 직접인지 검색 엔진을 통해 라우팅되는지, 그리고 데이터가 최종 답변에 어떻게 끝나게 되는지 알 수 있는 명확한 방법을 제공하지 않는다.

새로운 연구의 발견은 LLM이 자체 캐시 항목에서 정보를 사용하고, 자체 내부 SEO 스타일의 목록을 사용하며, 종종 공개적으로 관련이 없는 회사들의 검색 엔진 결과에서 정보를 사용한다는 것을 나타낸다.

저자들은 이 출판이 RAG 시스템(라이브 호출, LLM의 추론 시간에 의해 작업될 수 있는)에 의한 원치 않는 침입을 다룬 최초의 작업이라고 믿는다.

새로운 논문카나리아 토큰을 사용하여 AI 웹 스크레이퍼 식별이라고 제목이 붙여져 있으며, 덕 대학, 피츠버그 대학, 그리고 카네기 멜런 대학의 6명의 연구자들에 의해 작성되었다.

방법

연구자들은 20개의.com 도메인을 설정했으며, 각 도메인에는 유사한 웹사이트가 있었으며, 예를 들어 예술 포트폴리오 또는 회사 웹사이트와 같은 템플릿이 있었다. 각 템플릿에는 10개의 플레이스 홀더가 있었으며, 이는 각 방문자의 고유한 프로필(예: IP 주소, 캔버스 지문, 기타 ‘스니핑’ 방법)에 따라 최종적으로 고유한 토큰으로 채워질 것이었다.

실험에서 사용된 템플릿과 변수 플레이스 홀더의 예시. 각 고유한 방문자는 지속적인 맞춤형 변수를 받았다.

실험에서 사용된 템플릿과 변수 플레이스 홀더의 예시. 각 고유한 방문자는 지속적인 맞춤형 변수를 받았다.

각각의 고유한 방문자는 맞춤형 변수를 받았다. 이전 방문자가 돌아온 경우, 이전과 같은 변수가 다시 제공되었다. 변수는 Python Faker 라이브러리와(지정되지 않은) 난수 생성기를 사용하여 생성되었다.

허니팟 도메인은 다양한 색인에 제출되었으며, 연구자들이 제어하는 다른 기존 도메인에 연결되었다.

검색 엔진 봇과 유사한 봇의 스캔 빈도를 허용하기 위해 2개월의 간격이 허용되었다. 이 시점에서, 연구자들은 대상 AI 채팅봇을 쿼리할 수 있었다.

AI 채팅봇 퍼블리셔
ChatGPT OpenAI
Claude Anthropic
Copilot Microsoft
DeepSeek DeepSeek
Duck.ai DuckDuckGo
ERNIE Baidu
Gemini Google
GLM Z.AI
Granite IBM
Grok xAI
Hunyuan Tencent
AI 채팅봇 퍼블리셔
Kimi MoonshotAI
Liquid Liquid
Llama Meta
Mistral Mistral
Nova Amazon
Perplexity Perplexity
Qwen Alibaba
Reka Reka
Solar Upstage
Step-3 StepFun
Venice Venice

스크립트는 각 시스템을 API를 통해 쿼리하기 위해 작성되었다. 이것이 불가능한 경우, 그리고 자동화된 솔루션이 Selenium과 같은 AI 포털의 감지 루틴에 의해 차단된 경우, 공식 GUI를 통해 수동 상호작용이 수행되었다.

초기 템플릿 교환(위 이미지 참조) 이후, 저자들은 관련 토큰의 이름을 묻는 두 번째 프롬프트를 따라갔다.

이 실험은 세 가지 조건에서 수행되었다. 즉, 완전히 접근 가능한 웹사이트, 웹사이트가 오프라인인 경우, 그리고 웹사이트에 스크레이핑을 방지하는 robots.txt 제한이 있는 경우였다. 이러한 실험은 정확히 그 순서대로 수행되었다. 즉, 후者の 단계는 이전 단계에 의존했다.

마지막으로, 모든 사이트가 다시 온라인으로 돌아온 후, 마지막 단계에서는 일주일 간격으로 LLM 출력을 재테스트했다.

결과

4개의 대상 LLM은 연구자들의 방법에 완전히 저항했다. 따라서 DeepSeek, Hunyuan, GLM, 및 Liquid에 대한 결과는 얻을 수 없었다.

많은 AI 봇이 비AI 트래픽을 가장하는 경향이 있다는 점에서, 저자들은 다음과 같이 말한다.

‘선언된 에이전트 외에도, 여러 AI 시스템은 일반 브라우저 사용자 에이전트 문자열과 관련된 콘텐츠를 반환했다. 우리는 18개의 AI 시스템 중 6개에서 이러한 행동을 관찰했다.

‘이 결과는 일부 AI 시스템이 웹사이트 콘텐츠를 얻기 위해 일반 브라우저 트래픽과 유사한 요청을 할 수 있음을 시사한다. 이것은 사용자 에이전트 기반 차단을 어렵게 만든다.’

ERNIE는 Baiduspider와 Chrome 정체성을 반환했다. Grok는 Googlebot과 두 개의 브라우저 에이전트를 결합했다. Solar는 브라우저 정체성만 사용했다. Qwen은 Googlebot과 Chrome을 혼합했다. 그리고 Kimi는 여러 브라우저 스타일 에이전트와 연결되었다.

많은 시스템은 공개적으로 알려지지 않은 제3자 검색 엔진 스크레이퍼에 의존하는 것으로 보였다. Googlebot, Bingbot, 및 Bravebot과 연결된 콘텐츠는 18개의 분석된 시스템 중 10개에서 반환되었다. 이는 때때로 AI 제공업체와 검색 엔진 사이에 공개적으로 알려진 연관성이 없는 경우였다.

저자들은 이것이 직접 스크레이핑보다는 검색 결과를 摂取하는 것을 반영한다고 주장한다. 즉, ASN 확인은 트래픽이 예상된 검색 엔진 네트워크에서 기인한 것으로 나타났으며, 가짜 정체성을 사용한 것이 아니었다.

이것은 웹-에이아이 파이프라인에 추가적인 불투명한 계층을 암시한다. 즉, 알려진 에이아이 크롤러를 차단하는 것은 데이터 사용을 방지하지 않을 수 있으며, 포함을 피하는 것은 검색 색인에서 완전히 옵트아웃하는 것을 필요로 할 수 있다. 이것은 아직 전통적인 SEO와 LLM 기반 검색 사이의 긴장이 해결되지 않은 경우에 바람직하지 않은 선택이다.

캐시 전용

저자들은 소스를 제거하면 채팅봇의 출력에 어떤 영향을 미치는지 테스트했다. 즉, 테스트 사이트를 오프라인으로 설정하고 일주일 후에 시스템을 다시 쿼리했다. 논문에 따르면, 많은 채팅봇은 캐시된 데이터에서 응답을 생성하는 것으로 보였다.

이 지속성은 검색 엔진 크롤러와 관련된 시스템에서 가장 두드러졌다. 즉, 이전에 색인이 된 콘텐츠는 소스 페이지가 더 이상 접근할 수 없더라도 여전히 사용할 수 있었다. 그러나 브라우저와 같은 에이전트와 관련된 시스템에서도 유사한 행동이 관찰되었다. 이것은 캐싱이 검색 엔진 백업을 넘어서 확장될 수 있음을 시사한다.

논문은 콘텐츠가 캐시에 들어가면, 채팅봇이나 검색 색인이 유지하는 경우, 원래 페이지를 제거하더라도 콘텐츠가 이후의 출력에서 신뢰성 있게 제거되지 않는다고 제안한다.

결론

저자들은 일부 ‘누수’가 이 고전적인 ‘시로된’ 접근법에서 발생할 수 있음을 인정한다. 즉, 한 LLM을 대상으로 하는 고유한 토큰이 때때로 다른 LLM이 摂取하는 검색 결과에 나타날 수 있다. 그러나 이러한 계획에서 확산은 피할 수 없으며, 첫 번째 발생에 대한 감시는 결정적인 순간이다.

이런 方案이 대규모로 구현될 수 있는 정도는 아직 남아 있다. 특히, 저자들이 관찰했듯이, 컨텍스트에서 올바른 토큰을 사용할 수 있는 한도는 매우 빠르게 달성될 것이다.

그러나, 이것은 본질적으로 문제를 놓치고 있다. 즉, AI 회사의 스크레이핑 정책에 대한 거짓말에 대한 명확한 증거를 무시할 수 있는 대담함에는 한계가 있을 수 있다. 또한, 이러한 회사들이 자신의 정체성을 숨기기 위해 국내 IP 주소를 순환하는 비용이 높은 방법을 사용할 의향이 없다면, 단 하나의 조직이 기만적인 AI-봇 IP 또는 ASN의 스팸하우스 스타일의 블랙리스트를 식별하고 게시하기만 하면 된다. 이 과정은 산업화될 필요는 없다.

 

2026년 5월 14일 처음 게시됨

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai