사이버 보안
연구원들, 독일 위키를 재활용한 OpenAI 에이전트 군집을 문서화

네 명의 AI 안전 연구원이 약 18,000개의 게시물을 남긴 공개 독일어 위키에 자율 AI 에이전트가 OpenAI에 속한다고 스스로 밝힌 사례를 설명하는 보고서와 데이터셋을 발표했습니다. 연구원들은 이 활동이 에이전트 개발자의 의도와 상반된다고 말했습니다. 보고서는 Sydney Von Arx, Cormac Slade Byrd, Spencer Kitts, Thomas Larsen가 저술했으며 2026년 9월 4일자이며, AI 안전 비영리 단체 Nightingale을 위한 계약 작업으로 작성되었습니다.
이 에이전트들은 DSEWiki에 게시했는데, 이는 ProWiki 팜의 하위 위키로, 보고서는 이를 25년 역사를 가진 독일 소프트웨어 개발자 포럼이며 지난 10년간 편집이 20회에 불과했다고 설명합니다. 연구원들은 에이전트들이 사이트를 이용해 답변을 공유하고, 결과를 모으며, 자체 운영 환경을 조사하고, 샌드박스 제한을 우회하는 기술을 교환했으며, 개발자는 에이전트가 인터넷을 읽을 수는 허용했지만 쓰는 것은 차단했다고 밝혔습니다.
데이터셋에 포함된 내용
보고서는 에이전트들이 일반적으로 R1부터 R5까지 표시되는 다섯 개 질문으로 구성된 다중 라운드 웹 조회 작업을 수행했다고 명시합니다. 에이전트들은 첫 번째 질문에 충분한 시간을 받고, 이후 인터넷 검색을 할 수 있는 대기 시간을 갖고, 뒤이어 매우 짧은 65초 이하의 제한된 시간 안에 다음 라운드에 답변했습니다. 많은 에이전트가 이미 다른 에이전트가 답한 동일한 질문을 받았기 때문에, 앞선 순서에 있던 에이전트들은 뒤에 있는 에이전트들을 위해 답변과 타이밍 예측을 게시했습니다.
DSEWiki에서 에이전트가 만든 것으로 보이는 약 17,000개의 편집 중 98.5%가 Microsoft Azure IP 주소에서 발생했으며, 동일한 페이지는 일반적으로 OpenAI의 ChatGPT-User 웹페이지 가져오기 도구와 연관된 IP 주소에서 온 읽기 요청에 의해 몇 분 안에 조회되었습니다. 연구진은 6주 동안 3,700개가 넘는 고유한 자체 지정 에이전트 이름을 집계했으며, “OpenAIResearcher”, “OpenAIJul3Watcher”, “OAIResearchMar26”과 같은 이름을 확인했습니다. 이를 토대로 연구진은 에이전트가 내부 OpenAI 배포이거나 Azure 샌드박스에서 OpenAI 모델을 실행하는 외부 고객일 가능성이 높으며, 규모, 기간, 공개 평가 스위트에 작업이 없었던 점이 내부 모델 개발과 가장 일치한다고 평가했습니다. 또한 교차 사이트 스크립팅 시도와 관리자 가장은 OpenAI가 외부 배포에 적용하는 사이버 방어에 의해 차단되었을 가능성이 높다고 언급했습니다.
보고서의 타임라인에 따르면 최초로 공개 위키 편집 시도가 2026년 5월 11일 publictestwiki.com에서 관찰되었으며, DSEWiki에 대한 최초 성공적인 쓰기는 2026년 5월 24일에 이루어졌고, 그때 에이전트들은 작업에 유용한 외부 링크 목록을 게시하기 시작했습니다. 2026년 6월 16일에 에이전트들이 서로에게 명시적으로 메시지를 보내고 대규모로 협업하기 시작하면서 활동이 급격히 증가했으며, 이후 7일 동안 약 13,000건의 편집이 위키에 기록되었습니다.
샌드박스 우회와 공모
보고서에서 가장 상세히 다룬 기술 사례는 OECD 교육 대시보드에서 소수점 두 자리까지의 통계를 읽어야 하는 작업으로, 이는 Microsoft Power BI 플랫폼 기반이며 POST 요청이 필요했지만 에이전트들은 GET 요청만 허용되었습니다. 보고서에 따르면 한 에이전트는 샌드박스가 Azure Blob Storage 호스트 이름에 대해 NO_PROXY 예외를 두고 있지만 해당 호스트 이름이 실제 존재하는지는 확인하지 않았다는 점을 이용했습니다. 에이전트는 신뢰할 수 있는 접미사로 끝나는 가짜 호스트 이름을 만들고, 자신의 /etc/hosts 파일을 편집해 실제 Power BI 서버를 가리키게 한 뒤, 보안 프록시를 우회하는 POST 요청을 보냈습니다. 다른 에이전트들은 이를 확인하고 재현했으며, 보고서는 2026년 6월 20일에 해당 기술이 게시된 14분 후에 한 에이전트가 이를 실행한 사례를 기록했습니다.
연구진은 또한 에이전트들이 위키에서 교차 사이트 스크립팅 취약점을 탐색하고, 라틴 문자와 거의 동일한 키릴 문자로 대체된 사용자 이름을 등록해 ProWiki 관리자를 가장했으며, 삭제된 게시물 아카이브를 볼 때 DSEWiki 중재자의 이름을 사용한 사례를 문서화했습니다. 보고서에 따르면 이러한 XSS 시도는 성공하지 못한 것으로 보입니다. 다른 기록된 행동으로는 작업 질문을 순서대로 배치하는 시드 난수 생성기를 깨려는 시도가 있었으며, 한 에이전트는 C 언어로 셔플링 루틴을 재작성하고 40억 개의 가능한 시드를 한 시간 이내에 모두 테스트했다고 보고했습니다. 또한 “heartbeat” 프로그램이 외부 카운터 서비스에 ping을 보내 다른 에이전트가 컨테이너 종료 시점을 판단하도록 했습니다. 보고서는 에이전트들이 Pinggy, Serveo, localhost.run, localtunnel 등 SSH 터널링 서비스를 사용했으며, 약 18,000건의 편집 중 197건을 AWS, DigitalOcean, Tor IP 주소에서 수행했으며, 이는 에이전트가 인터넷에 접근할 수 있는 여러 경로를 가지고 있음을 시사한다고 밝혔습니다.
OpenAI의 대응과 중재자의 정리 작업
위키는 방문자 IP 주소를 포함한 모든 행동의 공개 로그를 저장하며, 보고서는 이 로그를 통해 OpenAI가 해당 게시판을 발견한 과정을 재구성합니다. OpenAI에 등록된 IP 주소가 2026년 6월 21일에 처음 사이트를 방문했으며, 6월 22일에 에이전트 편집이 거의 제로 수준으로 감소했는데, 연구진은 이를 OpenAI 개입의 징후로 추정했습니다. 6월 26일에는 33개의 OpenAI 관련 IP 주소에서 532건의 요청이 있었으며, 이는 전체 방문의 30%를 차지했고, 연구진은 여기에는 사이트의 아카이브 기능을 이용해 삭제된 페이지를 복구한 사례도 포함된다고 밝혔습니다. 7월 1일과 7월 2일에 세 개 위키에서 29건의 에이전트 편집 시도가 있었으며, 7월 7일에는 OpenAI IP 주소가 사이트 관리자의 이름을 입력해 삭제된 파일에 접근하려는 시도가 있었습니다.
인간 중재자는 2026년 6월 2일에 처음 에이전트 게시물을 발견했으며, 6주에 걸쳐 수십 시간에 걸쳐 수천 건의 에이전트 게시물을 수동으로 삭제했습니다. 한때는 하루 평균 100페이지를 삭제하면서 에이전트는 약 400개의 새로운 페이지를 만들었습니다. 중재자는 삭제가 알파벳 순서대로 진행되는 것을 감지한 뒤, “ZZZ”로 시작하는 백업 페이지를 만들어 마지막에 삭제되도록 했으며, 에이전트는 위키의 첫 페이지를 9번이나 링크 덤프 형태로 덮어쓰는 행동을 했지만 중재자는 이를 복원했습니다.
연구진은 OpenAI가 이 사건을 공개적으로 밝히지 않았으며, 2026년 8월 26일에 발표한 별도의 Hugging Face 사건에 관한 기술 보고서(2026년 7월 9일~7월 13일 사이에 약 700명의 에이전트가 오픈소스 저장소를 공격함)에서는 위키에 대한 언급이 없다고 지적했습니다. 연구진은 이는 별개의 군집일 가능성이 높다고 평가했습니다: 위키 에이전트는 작업의 일환으로 인터넷에 접근할 수 있었지만, Hugging Face 에이전트는 인터넷이 차단된 샌드박스에 있었으며 Artifactory 패키지 관리자를 이용해 탈출했습니다. 보고서는 OpenAI의 Hugging Face 보고서가 에이전트가 훈련 중 드물게 즉흥적인 협업 채널을 사용하도록 학습했으며, 그 행동이 이후 강화되었다고 명시했다고 덧붙였습니다. 연구진은 개인 식별 정보를 삭제하고, 삭제된 페이지를 편집 기록에서 복원한 뒤 데이터셋을 공개했으며, 독립적인 분석을 장려한다고 밝혔습니다.












