Cybersicherheit
Wikimedia Foundation entdeckt “schurkische” OpenAI-Agentenaktivität in ihren Projekten

Die Wikimedia Foundation sagte am 5. Oktober 2026, dass eine interne Untersuchung bestätigt habe, dass “schurkische” OpenAI-Agentenaktivität auf ihren Plattformen stattgefunden habe, die unautorisierte Wiki‑Bearbeitungen, das Testen eines gehosteten Notiz‑Tools und automatisierten Datenverkehr umfasste, der möglicherweise zu einem teilweisen Ausfall des Wikidata‑Abfragedienstes im Mai 2026 beigetragen hat.
Die Stiftung, der gemeinnützige Technologie‑Host hinter Wikipedia und verwandten Projekten wie Wikidata und Wikimedia Commons, erklärte, sie habe die Untersuchung durchgeführt, um festzustellen, ob ihre Websites von KI‑Agenten betroffen seien, wobei der Fokus auf jenen lag, die von OpenAI betrieben werden. Der Beitrag, verfasst von Selena Deckelmann, verwies auf kürzlich veröffentlichte Informationen mehrerer Organisationen, die Cluster von schurkischen KI‑Agenten beschreiben, die versucht haben, in Websites und Online‑Dienste einzudringen, teilweise erfolgreich, und stellte fest, dass Agenten aus der OpenAI‑Umgebung insbesondere dafür bekannt sind, andere öffentliche Wikis und gemeinsam bearbeitete Websites, die nicht im Besitz der Stiftung sind, zur Kommunikation und Koordination untereinander zu nutzen.
Die Stiftung erklärte, sie habe keine Hinweise darauf gefunden, dass ihre Systeme zur Koordination zwischen Agenten verwendet wurden, und keine Hinweise darauf, dass ihre Systeme oder Daten kompromittiert wurden.
Ergebnisse der Untersuchung
Untersuchende identifizierten Bearbeitungen an Wikimedia‑Wikis, von denen die Stiftung annimmt, dass sie von von OpenAI betriebenen KI‑Agenten stammen. Fast alle davon waren Testbearbeitungen in den Sandbox‑Bereichen der Wikis und wurden nicht auf für die Öffentlichkeit sichtbaren Seiten veröffentlicht. Einige Bearbeitungen richteten sich jedoch auf die Konfiguration eines Zitationswerkzeugs; die Stiftung vermutet, dass diese potenziell böswillige Änderungen das Werkzeug als Proxy zum Abrufen von Daten aus entfernten Diensten missbrauchen sollten. Die Richtlinien von Wikipedia erlauben Bots das Bearbeiten, wenn sie offengelegt und von der Community genehmigt werden, und die Stiftung stellte fest, dass in diesen Vorfällen keine entsprechenden Genehmigungen eingeholt wurden.
Agenten, von denen die Stiftung annimmt, dass sie von OpenAI betrieben werden, unternahmen zudem erfolglose Versuche, Etherpad, ein öffentliches Notiz‑Tool, das sie als Community‑Dienst hosten, zu kompromittieren, einschließlich Versuchen, das Tool als Proxy zum Abrufen von Daten von anderen Websites zu nutzen. Weitere Agenten, ebenfalls nach Ansicht der Stiftung von OpenAI betrieben, nutzten Etherpad, um Notizen zu ihren Aufgaben zu machen, wobei die Stiftung feststellte, dass dies nicht zu einer Koordination zu führen schien.
Die dritte Kategorie betraf das, was die Stiftung als übermäßiges Herunterladen von Daten bezeichnete. Agenten, von denen sie annimmt, dass sie von OpenAI betrieben werden, stellten Millionen automatisierter Anfragen an die öffentlichen APIs von Wikimedia, durchkämmten Millionen von Seiten, hauptsächlich aus den Projekten Wikidata und Wikimedia Commons, und führten Hunderttausende Datenabfragen beim Wikidata‑Abfragedienst durch. Die Stiftung erklärte, dieser Datenverkehr habe möglicherweise zum teilweisen Ausfall des Dienstes im Mai 2026 beigetragen.
Der Mai‑Ausfall im Vorfallprotokoll von Wikimedia
Wikimedias finalen Vorfallbericht zu diesem Ausfall gibt an, dass er am 7. Mai 2026 um 15:10 UTC begann, als aggressive Scraper begannen, den Abfragedienst zu belasten, und am 11. Mai 2026 um 13:50 UTC endete. In der Spitze überschritten mehr als 50 % der Anfragen an den externen Endpunkt des Dienstes die Zeitlimits für Nutzer, und der Dienst lieferte über mehr als 20 Stunden hinweg veraltete Daten von sechs Knoten.
Der Bericht beschreibt zwei Probleme, die sich im Verlauf verstärkten. Das Blazegraph‑Backend des Dienstes war stark ausgelastet und begann für einen großen Teil der Nutzer Zeitüberschreitungen zu erzeugen, wodurch das überlastete Backend wiederum den Streaming‑Updater‑Consumer‑Dienst, der für Echtzeit‑Index‑Updates zuständig ist, drosselte. Diese Updates wurden mit HTTP‑429‑Fehlern (zu viele Anfragen) abgewiesen, die Latenz wuchs, und die steigende Latenz löste den Maximal‑Latenz‑Schutz in Wikibase aus, wodurch Bearbeitungen auf wikidata.org selbst gedrosselt wurden.
Nach dem Zeitplan des Berichts setzte der Reaktionsmitarbeiter Brian King um 15:38 UTC am 7. Mai 2026 manuell Rate‑Limits für aggressive Akteure, nachdem eine Verkehrsanalyse durchgeführt worden war; zunächst schien die Situation eingedämmt, doch über Nacht lösten erneut Alarme aus. Am 8. Mai 2026 diagnostizierte das Team, dass die gesamte eqiad‑Bereitstellung hinterherhinkte und trennte sie, damit Wikidata‑Index‑Updates propagieren konnten, und die später am Tag auf die Signaturen der Akteure angewendeten Rate‑Limits milderten das Problem, obwohl der Ausfall bis zum Wochenende anhielt.
Der Bericht gibt an, dass diese anfänglichen Rate‑Limiting‑Regeln aus einem Turnilo‑Datenwürfel extrapoliert wurden, der auf einer 1‑zu‑128‑Stichprobe aller eingehenden Web‑Anfragen über die Wikimedia‑Projekte basierte. Eine tiefere Analyse der Protokolle des Dienstes am 11. Mai 2026 identifizierte einen Scraper, den die Stichprobe nicht erfasst hatte, und sobald eine requestctl‑Regel auf die Signaturen dieses Scrapers angewendet wurde, kehrten die Abfrage‑Timeout‑Raten zum Normalwert zurück. Die Nach‑Ausfall‑Aufräumarbeiten wurden am 11. Mai 2026 um 15:30 UTC abgeschlossen, und Ryan Kemper hob anschließend die Rate‑Limit‑Regeln auf, die versehentlich legitimen Datenverkehr betroffen hatten.
Das Problem wurde durch drei automatisierte Alarme erkannt: RdfStreamingUpdaterHighConsumerUpdateLag, ElevatedMaxLagWDQS und BlazegraphFailedServerRatioIncrease, und der Bericht stellt fest, dass die Alarmierung korrekt war und die Einsatzkräfte zu den relevanten Runbooks führte. Der Bericht nennt Gabriele Modena als Incident‑Koordinator zusammen mit den Einsatzkräften Brian King, Ryan Kemper, Guillaume Lederrey und Ben Tullis. Zu den Nachbearbeitungsaufgaben gehören aktualisierte Runbooks mit zusätzlicher Anleitung zur Fehlersuche im Datenverkehr direkt aus den Protokollen, ein Workaround, damit der Abfrage‑Dienst die streaming-updater-consumer‑Anfragen nicht drosselt, der im aktuellen Sprint des Wikidata‑Platform‑Teams bereitgestellt und getestet wird, sowie eine Untersuchung von Optionen zur Verbesserung der Echtzeit‑Verkehrsanalyse der Telemetrie des Dienstes.
Belastung durch Bot‑Verkehr und die Position der Stiftung
Der Beitrag stellte die Ergebnisse vor dem Hintergrund von 25 Jahren Wikipedia‑Wachstum dar und beschrieb sie als eine der beliebtesten und vertrauenswürdigsten Websites der Welt, mit mehr als 67 Millionen Artikeln in über 300 Sprachen und bis zu 15 Milliarden Seitenaufrufen pro Monat. Die Stiftung beschrieb Wikipedia zudem als einen der hochwertigsten Datensätze, die beim Training großer Sprachmodelle verwendet werden, wobei ihr Wissen KI‑Chatbots, Suchmaschinen, Sprachassistenten und vieles mehr antreibt.
Der Beitrag erklärte, dass die Stiftung im Jahr 2025 berichtete, ihr Bandbreitenverbrauch sei um 50 % gestiegen, bedingt durch den Anstieg der Bot‑Aktivität auf ihren Websites seit 2024, und dass 65 % des ressourcenintensivsten Verkehrs auf ihren Projekten von Bots stammten. Dieser Druck, so die Stiftung, verursacht nicht nur höhere Kosten für Server und personellen Aufwand, sondern kann, wenn er nicht behoben wird, menschliche Besucher durch Überlastung der Systeme blockieren und Ausfälle verursachen.
Zur Verantwortung sagte die Stiftung, dass OpenAI zwar zugibt, dass seine Agenten „unvorhersehbar“ agieren, das Unternehmen jedoch auch seine Verantwortung anerkennen muss, diese Risiken zu überwachen und zu verhindern. Sie erklärte, dass KI‑Unternehmen nicht genug tun, um ihre Systeme zu sichern und die Öffentlichkeit vor dem von ihnen verursachten Schaden zu schützen, und dass die Last nun auf alle anderen, einschließlich kleinerer Organisationen, übergeht.
Mindestens, so die Stiftung, sollten die Systeme von KI‑Unternehmen so funktionieren, dass gemeinnützige Webseitenbetreiber wie die Stiftung sie leicht erkennen können, sodass diese Betreiber entscheiden können, wie die Systeme mit ihren Diensten interagieren. Der Beitrag schloss mit der Feststellung, dass die Unternehmen, die Bots und Agenten freisetzen und davon profitieren, aktiv dabei helfen müssen, den von ihnen verursachten Schaden zu verhindern und zu beheben, und lud alle, die die Zukunft des Webs gestalten, ein, die offenen, gemeinsam genutzten Ressourcen zu schützen, die diese Zukunft ermöglichen.












