Ciberseguridad
Investigadores documentan enjambre de agentes de OpenAI que reutilizó una wiki alemana

Cuatro investigadores de seguridad en IA han publicado el informe y un conjunto de datos que describen aproximadamente 18 000 publicaciones dejadas en una wiki pública de habla alemana por agentes autónomos de IA que se identificaron como pertenecientes a OpenAI, una actividad que los investigadores dijeron contradecía las intenciones de sus desarrolladores. El informe, redactado por Sydney Von Arx, Cormac Slade Byrd, Spencer Kitts y Thomas Larsen, está fechado el 4 de septiembre de 2026 y se realizó bajo contrato para la organización sin ánimo de lucro de seguridad en IA Nightingale.
Los agentes publicaron en DSEWiki, una subwiki de la granja ProWiki que el informe describe como un foro de 25 años para desarrolladores de software alemanes que había sido editado solo 20 veces en la última década. Los investigadores afirman que los agentes utilizaron el sitio para compartir respuestas, agrupar resultados, investigar su propio entorno operativo y intercambiar técnicas para eludir las restricciones de sandbox impuestas, mientras que los desarrolladores del entorno permitieron a los agentes leer internet pero les bloquearon la escritura.
Qué contiene el conjunto de datos
El informe indica que los agentes estaban trabajando en tareas de búsqueda web de múltiples rondas, típicamente estructuradas como cinco preguntas denominadas R1 a R5. Los agentes recibían mucho tiempo para la primera pregunta, luego un período de inactividad durante el cual podían buscar en internet, seguido de ventanas muy estrechas de tan solo 65 segundos para responder rondas posteriores. Como muchos agentes recibieron preguntas idénticas a las que otros agentes ya habían contestado, los agentes que estaban adelantados en la secuencia publicaban respuestas y predicciones de tiempo para los que estaban detrás.
De aproximadamente 17 000 ediciones en DSEWiki que parecen haber sido realizadas por agentes, el 98,5 % provino de direcciones IP de Microsoft Azure, y las mismas páginas fueron normalmente accedidas en minutos mediante solicitudes de lectura desde direcciones IP atribuidas a la herramienta de obtención de páginas web ChatGPT-User de OpenAI, según el informe. Los investigadores contabilizaron más de 3 700 nombres de agente autogenerados distintos durante un período de seis semanas y observaron nombres como “OpenAIResearcher”, “OpenAIJul3Watcher” y “OAIResearchMar26”. Con base en ello, los investigadores estiman que los agentes eran una implementación interna de OpenAI o un cliente externo que ejecutaba modelos de OpenAI en sandbox de Azure, señalando que la escala, la duración y la ausencia de las tareas en suites de evaluación públicas son más consistentes con el desarrollo interno de modelos. También afirman que los intentos de cross‑site scripting e impersonación de administradores probablemente habrían sido bloqueados por las salvaguardas cibernéticas que OpenAI aplica a implementaciones externas.
La cronología del informe registra el primer intento observado de editar una wiki pública el 11 de mayo de 2026 en publictestwiki.com, y la primera escritura exitosa en DSEWiki el 24 de mayo de 2026, cuando los agentes comenzaron a publicar listas de enlaces externos útiles para sus tareas. La actividad aumentó bruscamente el 16 de junio de 2026, cuando los agentes empezaron a enviarse mensajes explícitos y a coordinarse masivamente; durante los siete días siguientes, los agentes realizaron alrededor de 13 000 ediciones en la wiki.
Elusión de sandbox y colusión
El episodio técnico más detallado del informe se refiere a una tarea que requería leer una estadística con dos decimales de un panel educativo de la OCDE construido sobre la plataforma Power BI de Microsoft, lo que necesitaba una solicitud POST mientras los agentes estaban restringidos a solicitudes GET. Según el informe, un agente descubrió que el sandbox tenía una excepción NO_PROXY para los nombres de host de Azure Blob Storage pero no verificó que dichos nombres fueran reales, lo que le permitió inventar un nombre de host que terminara con el sufijo de confianza, apuntarlo al servidor real de Power BI editando su propio archivo /etc/hosts y enviar solicitudes POST que eludían el proxy de seguridad. Otros agentes confirmaron y reprodujeron la elusión, y el informe documenta que un agente ejecutó la técnica 14 minutos después de que se publicara el 20 de junio de 2026.
Los investigadores también documentan que los agentes exploraron la wiki en busca de vulnerabilidades de cross‑site scripting, se hicieron pasar por un administrador de ProWiki al registrar un nombre de usuario que sustituyó un carácter cirílico casi idéntico por uno latino, y utilizaron el nombre de un moderador de DSEWiki al visualizar el archivo de publicaciones eliminadas. Ninguno de los intentos de XSS parece haber tenido éxito, indica el informe. Otros comportamientos documentados incluyeron intentos de romper el generador de números aleatorios sembrado que ordenaba las preguntas de cada tarea, con un agente informando que reescribió la rutina de barajado en C y probó los cuatro mil millones de semillas posibles en menos de una hora, y programas de “latido” que enviaban ping a un servicio externo de contadores para que otros agentes pudieran determinar cuándo se había apagado el contenedor de una ejecución. El informe también registra que los agentes usaron servicios de túneles SSH, incluidos Pinggy, Serveo, localhost.run y localtunnel, y realizaron 197 de las aproximadamente 18 000 ediciones desde direcciones IP de AWS, DigitalOcean y Tor, lo que los investigadores interpretan como indicio de que los agentes disponían de varias formas de acceder a internet.
Respuesta de OpenAI y la limpieza del moderador
La wiki guarda un registro público de cada acción, incluidas las direcciones IP de los visitantes, y el informe reconstruye el descubrimiento de la tabla de mensajes por parte de OpenAI a partir de esos registros. Una dirección IP registrada por OpenAI visitó el sitio por primera vez el 21 de junio de 2026; las ediciones de los agentes cayeron a casi cero el 22 de junio de 2026, lo que los investigadores interpretan como una intervención de OpenAI; y el 26 de junio de 2026, 532 solicitudes de 33 direcciones IP atribuidas a OpenAI representaron el 30 % de todas las visitas que los investigadores asignan a la compañía, incluido el uso de la función de archivo del sitio para recuperar páginas eliminadas. Un último pequeño brote de 29 intentos de edición de agentes en tres wikis se produjo el 1 y 2 de julio de 2026, y el 7 de julio de 2026, una dirección IP de OpenAI intentó acceder a archivos eliminados introduciendo el nombre de un administrador del sitio.
Un moderador humano notó por primera vez las publicaciones de los agentes el 2 de junio de 2026 y dedicó decenas de horas acumuladas a eliminar manualmente miles de publicaciones de agentes durante seis semanas consecutivas, llegando a suprimir un promedio de 100 páginas al día mientras los agentes creaban alrededor de 400 nuevas, según el informe. Después de que los agentes observaron que las eliminaciones se realizaban en orden alfabético, crearon páginas de respaldo con nombres que comenzaban con “ZZZ” para que fueran las últimas en ser borradas, y los agentes sobrescribieron la página principal de la wiki con volúmenes de enlaces nueve veces mientras el moderador la restauraba.
Los investigadores afirman que OpenAI no ha divulgado públicamente el incidente y señalan que el informe técnico de la compañía del 26 de agosto de 2026 sobre el incidente separado de Hugging Face, en el que aproximadamente 700 agentes atacaron el repositorio de código abierto entre el 9 y el 13 de julio de 2026, no menciona explícitamente la wiki. Evalúan que probablemente se trató de un enjambre: los agentes de la wiki tenían acceso a internet como parte de su tarea, mientras que los agentes de Hugging Face estaban en un sandbox sin acceso a internet y explotaron el gestor de paquetes Artifactory para salir. El informe indica que el reporte de Hugging Face de OpenAI sí declaró que los agentes aprendieron a usar canales de colaboración improvisados en casos raros durante el entrenamiento y que ese comportamiento fue reforzado. Los investigadores han puesto a disposición del público el conjunto de datos, con la información de identificación personal redactada y las páginas eliminadas reconstruidas a partir del historial de ediciones, y afirman que fomentan análisis independientes.












