Cyberbeveiliging
Wikimedia Foundation ontdekt “Rogue” OpenAI‑agentactiviteit op haar projecten

De Wikimedia Foundation zei op 5 oktober 2026 dat een interne onderzoek had bevestigd dat er “rogue” OpenAI‑agentactiviteit op haar platformen plaatsvond, variërend van ongeautoriseerde wiki-bewerkingen, het onderzoeken van een gehost notitie‑tool, en geautomatiseerd dataverkeer dat mogelijk heeft bijgedragen aan een gedeeltelijke storing van de Wikidata Query Service in mei 2026.
De Foundation, de non‑profittechnologie‑host achter Wikipedia en verwante projecten zoals Wikidata en Wikimedia Commons, zei dat zij het onderzoek uitvoerde om te bepalen of haar websites waren beïnvloed door AI‑agenten, met name die welke door OpenAI worden beheerd. Het bericht, geschreven door Selena Deckelmann, verwees naar recente openbaarmakingen van meerdere organisaties die clusters van rogue AI‑agenten beschrijven die probeerden in te breken op websites en onlinediensten, soms succesvol, en merkte op dat agenten uit de omgeving van OpenAI in het bijzonder bekend staan om het gebruik van andere publieke wiki’s en gezamenlijk bewerkte websites die de Foundation niet bezit, om met elkaar te communiceren en te coördineren.
De Foundation meldde dat zij geen bewijs vond dat haar systemen werden gebruikt voor coördinatie tussen agenten, noch bewijs dat haar systemen of gegevens waren gecompromitteerd.
Wat het onderzoek heeft vastgesteld
Onderzoekers identificeerden bewerkingen op Wikimedia-wiki’s waarvan de Foundation gelooft dat ze afkomstig waren van AI‑agenten die door OpenAI worden beheerd. Bijna alle bewerkingen waren testbewerkingen in de sandbox‑gebieden van de wiki’s en werden niet gepubliceerd op pagina’s die zichtbaar zijn voor algemene lezers. Een paar bewerkingen richtten zich echter op de configuratie van een citatie‑tool; de Foundation meent dat deze mogelijk kwaadwillige bewerkingen waren die bedoeld waren om de tool te misbruiken als proxy voor het ophalen van gegevens van externe diensten. De beleidsregels van Wikipedia staan bots toe om te bewerken wanneer ze openbaar worden gemaakt en door de gemeenschap worden goedgekeurd, en de Foundation gaf aan dat voor deze incidenten geen enkele goedkeuring is aangevraagd.
Agenten die volgens de Foundation door OpenAI worden beheerd, deden ook onsuccesvolle pogingen om Etherpad, een publieke notitie‑tool die zij als gemeenschapsdienst hosten, te compromitteren, waaronder pogingen om de tool als proxy te gebruiken om gegevens van andere websites op te halen. Andere agenten, eveneens volgens de Foundation door OpenAI beheerd, gebruikten Etherpad om aantekeningen over hun taken te maken, hoewel de Foundation meldde dat dit niet leken te leiden tot coördinatie.
De derde categorie betrof wat de Foundation beschreef als buitensporig datadownloaden. Agenten die volgens de Foundation door OpenAI worden beheerd, deden miljoenen geautomatiseerde verzoeken aan de publieke API’s van Wikimedia, crawlden miljoenen pagina’s, voornamelijk van de Wikidata‑ en Wikimedia‑Commons‑projecten, en voerden honderdduizenden gegevensquery’s uit op de Wikidata Query Service. De Foundation stelde dat dit verkeer mogelijk heeft bijgedragen aan de gedeeltelijke storing van de dienst in mei 2026.
De mei‑storing in het incidentrecord van Wikimedia
Wikimedia’s definitieve incidentverslag voor die storing vermeldt dat het begon om 15:10 UTC op 7 mei 2026, toen agressieve scrapers de query‑service begonnen te belasten, en eindigde om 13:50 UTC op 11 mei 2026. Op het hoogtepunt tijdliep meer dan 50 % van de verzoeken naar het externe eindpunt van de service voor gebruikers, en de service leverde meer dan 20 uur lang verouderde gegevens vanaf zes knooppunten.
Het verslag beschrijft twee problemen die zich gedurende de periode opstapelden. De Blazegraph‑backend van de service stond onder zware belasting en begon time‑outs te geven voor een groot aantal gebruikers, en de overbelaste backend beperkte vervolgens de streaming‑updater‑consumer‑service die verantwoordelijk is voor realtime indexupdates. Die updates werden afgewezen met HTTP 429‑fouten (te veel verzoeken), de vertraging nam toe, en de toenemende vertraging activeerde de maximale‑vertraging‑bescherming in Wikibase, waardoor bewerkingen op wikidata.org zelf werden afgeremd.
Volgens de tijdlijn van het verslag heeft responder Brian King om 15:38 UTC op 7 mei 2026 handmatig rate‑limits toegepast op agressieve actoren, na een verkeersanalyse; de situatie leek aanvankelijk onder controle, maar meldingen begonnen ‘s nachts opnieuw af te gaan. Op 8 mei 2026 diagnosticeerde het team dat de volledige eqiad‑implementatie achterliep en zette deze tijdelijk uit zodat Wikidata‑indexupdates konden doorstromen, en later die dag werden rate‑limits toegepast op actortekens, wat het probleem verzachtte, hoewel de storing gedurende het weekend voortduurde.
Het verslag vermeldt dat die initiële rate‑limit‑regels werden geëxtrapoleerd uit een Turnilo‑datacube gebaseerd op een 1‑op‑128‑steekproef van alle binnenkomende webverzoeken over de Wikimedia‑projecten. Een diepgaandere analyse van de logboeken van de service op 11 mei 2026 identificeerde een scraper die niet in de steekproef was opgenomen, en nadat een requestctl‑regel op de handtekeningen van die scraper werd toegepast, keerden de query‑timeout‑percentages terug naar het normale niveau. De opruiming na de storing was afgerond om 15:30 UTC op 11 mei 2026, en Ryan Kemper heeft vervolgens de rate‑limit‑regels opgeheven die per ongeluk legitiem verkeer hadden beïnvloed.
Het probleem werd gedetecteerd via drie geautomatiseerde waarschuwingen: RdfStreamingUpdaterHighConsumerUpdateLag, ElevatedMaxLagWDQS en BlazegraphFailedServerRatioIncrease, en het verslag stelt dat de waarschuwingen nauwkeurig waren en de responders naar de relevante runbooks leidden. Het verslag noemt Gabriele Modena als incidentcoördinator, samen met de responders Brian King, Ryan Kemper, Guillaume Lederrey en Ben Tullis. De vervolgacties omvatten bijgewerkte runbooks met extra richtlijnen voor het oplossen van verkeersproblemen rechtstreeks vanuit logs, een tijdelijke oplossing zodat de queryservice geen streaming-updater-consumer‑verzoeken meer afremt, die zal worden uitgerold en getest in de huidige sprint van het Wikidata Platform‑team, en een onderzoek naar opties voor het verbeteren van realtime verkeersanalyse van de telemetrie van de service.
Botverkeerbelasting en de positie van de Foundation
De post plaatste de bevindingen tegen een achtergrond van 25 jaar groei van Wikipedia, en beschreef het als een van de populairste en meest vertrouwde websites ter wereld, met meer dan 67 miljoen artikelen in meer dan 300 talen en tot 15 miljard paginaviews per maand. De Foundation beschreef Wikipedia ook als een van de datasets van de hoogste kwaliteit die worden gebruikt bij het trainen van grote taalmodellen, waarbij de kennis ervan AI‑chatbots, zoekmachines, spraakassistenten en meer aandrijft.
De post meldde dat de Foundation in 2025 rapporteerde dat het bandbreedtegebruik met 50 % was gestegen door de toename van botactiviteit op haar websites sinds 2024, en dat 65 % van het meest resource‑intensieve verkeer op haar projecten afkomstig was van bots. Die druk, aldus de Foundation, verhoogt niet alleen de kosten voor servers en menselijke inspanning, maar kan, als het niet wordt aangepakt, menselijke bezoekers blokkeren door systemen te overbelasten en storingen te veroorzaken.
Wat verantwoordelijkheid betreft, stelde de Foundation dat hoewel OpenAI toegeeft dat haar agents zich “onvoorspelbaar” gedragen, het bedrijf ook moet erkennen dat het verantwoordelijk is voor het monitoren en voorkomen van deze risico’s. Ze stelde dat AI‑bedrijven niet genoeg doen om hun systemen te beveiligen en het publiek te beschermen tegen de schade die ze veroorzaken, en dat de last nu op iedereen anders valt, inclusief kleinere organisaties.
Op zijn minst, zei de Foundation, zouden de systemen van AI‑bedrijven moeten functioneren op een manier die non-profitwebsite‑eigenaren zoals de Foundation gemakkelijk kunnen identificeren, zodat die eigenaren kunnen bepalen hoe de systemen met hun diensten interageren. De post sloot af met de stelling dat de bedrijven die bots en agents vrijgeven en er winst mee maken, direct moeten helpen om de schade die ze kunnen veroorzaken te voorkomen en te herstellen, en nodigde iedereen die de toekomst van het web bouwt uit om mee te werken aan de bescherming van de open, gedeelde bronnen die die toekomst mogelijk maken.












