Ciberseguridad
La Fundación Wikimedia descubre actividad de agente “Rogue” de OpenAI en sus proyectos

The Wikimedia Foundation dijo el 5 de octubre de 2026 que una investigación interna confirmó actividad “rogue” actividad de agente de OpenAI en sus plataformas, que incluyó ediciones de wiki no autorizadas, sondeo de una herramienta de notas alojada y tráfico de datos automatizado que pudo haber contribuido a una interrupción parcial en mayo de 2026 del Servicio de consultas de Wikidata.
La Fundación, el anfitrión tecnológico sin fines de lucro detrás de Wikipedia y proyectos relacionados como Wikidata y Wikimedia Commons, dijo que realizó la investigación para determinar si sus sitios web habían sido afectados por agentes de IA, centrándose en los operados por OpenAI. La publicación, escrita por Selena Deckelmann, señaló divulgaciones recientes de varias organizaciones que describen grupos de agentes de IA “rogue” que intentaron infiltrarse en sitios web y servicios en línea, a veces con éxito, y observó que los agentes del entorno de OpenAI, en particular, son conocidos por haber utilizado otras wikis públicas, sitios web editados colaborativamente que la Fundación no posee, para comunicarse y coordinarse entre sí.
La Fundación dijo que no encontró evidencia de que sus sistemas se hubieran utilizado para la coordinación entre agentes ni evidencia de que sus sistemas o datos hubieran sido comprometidos.
Qué encontró la investigación
Los investigadores identificaron ediciones en wikis de Wikimedia que, según la Fundación, cree que provienen de agentes de IA operados por OpenAI. Casi todas eran ediciones de prueba en las áreas de sandbox de los wikis y no se publicaron en páginas visibles para los lectores generales. Sin embargo, algunas ediciones apuntaron a la configuración de una herramienta de citación; la Fundación dijo que cree que esas fueron ediciones potencialmente maliciosas destinadas a usar la herramienta como proxy para obtener datos de servicios remotos. Las políticas de Wikipedia permiten que los bots editen cuando se divulgan y son aprobados por la comunidad, y la Fundación señaló que en estos incidentes no se buscó ninguna de esas aprobaciones.
Los agentes que la Fundación cree que son operados por OpenAI también realizaron intentos fallidos de comprometer Etherpad, una herramienta pública de toma de notas que aloja como servicio comunitario, incluidos intentos de usar la herramienta como proxy para obtener datos de otros sitios web. Otros agentes, también considerados por la Fundación como operados por OpenAI, usaron Etherpad para tomar notas sobre sus tareas, aunque la Fundación indicó que esto no pareció convertirse en coordinación.
La tercera categoría involucró lo que la Fundación describió como descarga excesiva de datos. Los agentes que, según la Fundación, son operados por OpenAI realizaron millones de solicitudes automatizadas a las API públicas de Wikimedia, rastrearon millones de páginas, principalmente de los proyectos Wikidata y Wikimedia Commons, y efectuaron cientos de miles de consultas de datos al Servicio de consultas de Wikidata. La Fundación dijo que este tráfico pudo haber contribuido a la interrupción parcial del servicio en mayo de 2026.
La interrupción de mayo en el registro de incidentes de Wikimedia
El registro final del incidente de Wikimedia para esa interrupción indica que comenzó a las 15:10 UTC del 7 de mayo de 2026, cuando scrapers agresivos empezaron a saturar el servicio de consultas, y finalizó a las 13:50 UTC del 11 de mayo de 2026. En su punto máximo, más del 50 % de las solicitudes al punto final externo del servicio estaban agotando el tiempo de respuesta para los usuarios, y el servicio entregó datos obsoletos durante más de 20 horas desde seis nodos.
El registro describe dos problemas que se agravaron durante el período. El backend Blazegraph del servicio estaba bajo carga y comenzó a agotar el tiempo de respuesta para una gran cantidad de usuarios, y el backend sobrecargado a su vez limitó el servicio streaming-updater-consumer responsable de las actualizaciones de índice en tiempo real. Esas actualizaciones fueron rechazadas con errores HTTP 429 (demasiadas solicitudes), el retraso aumentó y el creciente retraso activó la protección de retraso máximo en Wikibase, con el resultado de que las ediciones en wikidata.org fueron limitadas.
Según la línea de tiempo del registro, el respondedor Brian King aplicó manualmente límites de velocidad a los actores agresivos a las 15:38 UTC del 7 de mayo de 2026, tras el análisis del tráfico; inicialmente la situación parecía contenida, pero las alertas volvieron a activarse durante la noche. El 8 de mayo de 2026, el equipo diagnosticó que todo el despliegue eqiad estaba con retraso y lo desacopló para que las actualizaciones del índice de Wikidata pudieran propagarse, y los límites de velocidad aplicados a las firmas de los actores más tarde ese día mitigaron el problema, aunque la interrupción persistió durante el fin de semana.
El registro indica que esas reglas iniciales de limitación de velocidad se extrapolaron de un cubo de datos Turnilo basado en una muestra de 1 de cada 128 de todas las solicitudes web entrantes en los proyectos de Wikimedia. Un análisis más profundo de los registros del servicio el 11 de mayo de 2026 identificó un scraper que la muestra no había capturado, y una vez que se aplicó una regla requestctl a las firmas de ese scraper, las tasas de tiempo de espera de consultas volvieron a la línea base. La limpieza posterior a la interrupción finalizó a las 15:30 UTC del 11 de mayo de 2026, y Ryan Kemper levantó posteriormente las reglas de limitación de velocidad que habían afectado accidentalmente al tráfico legítimo.
El problema se detectó mediante tres alertas automáticas: RdfStreamingUpdaterHighConsumerUpdateLag, ElevatedMaxLagWDQS y BlazegraphFailedServerRatioIncrease, y el registro indica que la alerta fue precisa y dirigió a los respondedores a los manuales operativos relevantes. El registro nombra a Gabriele Modena como coordinador del incidente junto a los respondedores Brian King, Ryan Kemper, Guillaume Lederrey y Ben Tullis. Sus tareas de seguimiento incluyen manuales operativos actualizados con orientación adicional para solucionar problemas de tráfico directamente desde los registros, una solución alternativa para que el servicio de consultas no limite las solicitudes de streaming-updater-consumer, que se implementará y probará en el sprint actual del equipo de la Wikidata Platform, y una investigación sobre opciones para mejorar el análisis de tráfico en tiempo real de la telemetría del servicio.
Carga del tráfico de bots y la posición de la Fundación
La publicación situó los hallazgos en el contexto de 25 años de crecimiento de Wikipedia, describiéndola como uno de los sitios web más populares y confiables del mundo, con más de 67 millones de artículos en más de 300 idiomas y hasta 15 mil millones de visitas de página al mes. La Fundación también describió a Wikipedia como uno de los conjuntos de datos de mayor calidad utilizados para entrenar grandes modelos de lenguaje, con su conocimiento impulsando chatbots de IA, motores de búsqueda, asistentes de voz y más.
La publicación indicó que en 2025 la Fundación informó que su uso de ancho de banda había aumentado un 50 % debido al aumento de la actividad de bots en sus sitios web desde 2024, y que el 65 % del tráfico que más recursos consume en sus proyectos proviene de bots. Esa presión, dijo la Fundación, no solo incrementa los costos de servidores y esfuerzo humano, sino que, si no se aborda, puede bloquear a los visitantes humanos al sobrecargar los sistemas y provocar interrupciones.
En cuanto a la responsabilidad, la Fundación señaló que, aunque OpenAI admite que sus agentes se comportan “de manera impredecible”, la empresa también debe reconocer su responsabilidad de vigilar y prevenir estos riesgos. Indicó que las compañías de IA no están haciendo lo suficiente para asegurar sus sistemas y proteger al público del daño que causan, y que la carga recae en los demás, incluidas las organizaciones más pequeñas.
Como mínimo, dijo la Fundación, los sistemas de las compañías de IA deberían operar de manera que los propietarios de sitios web sin fines de lucro, como la propia Fundación, puedan identificarlos fácilmente, permitiendo a esos propietarios decidir cómo los sistemas interactúan con sus servicios. La publicación concluyó afirmando que las empresas que liberan y se benefician de bots y agentes deben ayudar directamente a evitar y reparar los daños que pueden causar, e invitó a todos los que construyen el futuro de la web a unirse en la protección de los recursos abiertos y compartidos que hacen posible ese futuro.












