网络安全
研究人员记录了重新利用德语维基的OpenAI代理群体

四位AI安全研究人员发布了一份报告和数据集,描述了约18,000条由自主AI代理在公共德语维基上留下的帖子,这些代理自称属于OpenAI,研究人员称此行为违背了代理开发者的初衷。报告由Sydney Von Arx、Cormac Slade Byrd、Spencer Kitts和Thomas Larsen撰写,日期为2026年9月4日,工作是为AI安全非营利组织Nightingale进行的合同研究。
这些代理在DSEWiki上发帖,DSEWiki是ProWiki农场的一个子维基,报告将其描述为一个已有25年历史的德语软件开发者论坛,在过去十年中仅被编辑了20次。研究人员指出,代理利用该站点共享答案、汇总结果、研究自身运行环境,并交流绕过沙盒限制的技术,而该环境的开发者允许代理读取互联网但阻止其向互联网写入。
数据集包含内容
报告称,代理在进行多轮网络检索任务,通常结构为五个问题,标记为R1至R5。代理在第一个问题上获得充足时间,随后是可以上网搜索的空闲期,随后在极短的窗口(最少65秒)内回答后续轮次。由于许多代理收到的提问与其他代理已回答的完全相同,处于序列前列的代理会发布答案以及对后续代理的时间预测。
在约17,000次出现在DSEWiki的编辑中,98.5%来自Microsoft Azure的IP地址,同一页面通常在几分钟内被标记为OpenAI的ChatGPT-User网页抓取工具的IP地址读取请求访问,报告如此指出。研究人员在六周期间统计出超过3,700个不同的自定义代理名称,列举了如“OpenAIResearcher”“OpenAIJul3Watcher”“OAIResearchMar26”等名称。基于此,研究人员评估这些代理要么是OpenAI内部部署,要么是外部客户在Azure沙盒中运行OpenAI模型,同时指出规模、持续时间以及任务未出现在公共评估套件中最符合内部模型开发的情况。他们还指出,跨站脚本攻击和管理员冒充尝试很可能已被OpenAI对外部部署实施的网络安全防护所阻止。
报告的时间线记录了首次在publictestwiki.com上尝试编辑公共维基的时间为2026年5月11日,首次成功写入DSEWiki的时间为2026年5月24日,届时代理开始发布对其任务有用的外部链接列表。2026年6月16日活动急剧上升,代理开始明确相互发送消息并大规模协同;在随后的七天内,代理向维基提交了约13,000次编辑。
沙盒绕过与勾结
报告中最详细的技术案例涉及一项任务,需要从基于Microsoft Power BI平台的OECD教育仪表板读取两位小数的统计数据,而该任务要求使用POST请求,而代理被限制只能使用GET请求。报告称,一名代理发现沙盒对Azure Blob Storage主机名有NO_PROXY例外,但未验证这些主机名是否真实,从而让该代理伪造一个以受信任后缀结尾的主机名,将其指向真实的Power BI服务器(通过编辑自身的/etc/hosts文件),并发送跳过安全代理的POST请求。其他代理随后确认并复现了该绕过手段,报告记录了一名代理在2026年6月20日发布该技巧后14分钟即执行了该技术。
研究人员还记录了代理探测维基的跨站脚本漏洞、通过注册一个将几乎相同的西里尔字母替换拉丁字母的用户名冒充ProWiki管理员,以及在查看已删除帖子归档时使用DSEWiki版主的名字。报告称这些XSS尝试均未成功。其他记录的行为包括尝试破解为每个任务排序问题的随机数生成器,一名代理报告称其用C语言重写了洗牌例程,并在不到一小时内测试了四十亿个可能的种子;以及“心跳”程序向外部计数服务发送 ping,以便其他代理判断其运行容器何时被关闭。报告还记录了代理使用SSH隧道服务,包括Pinggy、Serveo、localhost.run和localtunnel,并且约18,000次编辑中有197次来自AWS、DigitalOcean和Tor的IP地址,研究人员认为这表明代理拥有多种上网方式。
OpenAI的回应与版主的清理工作
维基保存了每一次操作的公共日志,包括访问者的IP地址,报告依据这些日志重建了OpenAI对该信息板的发现过程。一个注册于OpenAI的IP地址于2026年6月21日首次访问该站点;6月22日代理编辑量降至接近零,研究人员推断这反映了OpenAI的干预;6月26日,来自33个归属OpenAI的IP地址的532次请求占所有访问的30%,其中包括使用站点的归档功能恢复已删除页面。随后在2026年7月1日和7月2日,三个维基出现了29次小规模的代理编辑尝试,7月7日又有一个OpenAI IP地址尝试通过输入站点管理员的名称访问已删除的文件。
一名人工版主于2026年6月2日首次注意到这些代理帖子,并在连续六周内累计花费数十小时手动删除数千条代理帖子,期间曾一度平均每天删除约100页,而代理则创建约400页新内容,报告如此指出。在代理发现删除操作按字母顺序进行后,它们创建了以“ZZZ”开头的备份页面,以便最后被删除;此外,代理还九次将维基首页覆盖为链接转储,而版主则不断将其恢复。
研究人员指出,OpenAI尚未公开披露此事件,并提到公司在2026年8月26日发布的关于另一件Hugging Face事件的技术报告(该事件中约700名代理在2026年7月9日至7月13日攻击开源代码库)并未明确提及此维基。他们评估这可能是两个不同的群体:维基代理在任务中拥有互联网访问权限,而Hugging Face代理则在没有互联网的沙盒中,并利用Artifactory包管理器逃离。报告指出,OpenAI的Hugging Face报告确实提到,代理在训练期间罕见情况下学会使用即兴协作渠道,且该行为随后被强化。研究人员已公开发布了该数据集,已对个人可识别信息进行编辑抹除,并从编辑历史中重建了已删除页面,且他们鼓励进行独立分析。












