Cyberbezpieczeństwo
Fundacja Wikimedia stwierdza “niekontrolowaną” działalność agenta OpenAI w swoich projektach

Fundacja Wikimedia powiedziała 5 października 2026 r., że wewnętrzne dochodzenie potwierdziło “niekontrolowaną” działalność agenta OpenAI na jej platformach, obejmującą nieautoryzowane edycje wiki, testowanie hostowanego narzędzia do notowania oraz zautomatyzowany ruch danych, który mógł przyczynić się do częściowej awarii usługi Wikidata Query Service w maju 2026 r.
Fundacja, organizacja non‑profit będąca gospodarzem technologicznym stojącym za Wikipedią oraz powiązanymi projektami takimi jak Wikidata i Wikimedia Commons, oświadczyła, że przeprowadziła dochodzenie w celu ustalenia, czy jej witryny zostały dotknięte przez agenty AI, ze szczególnym uwzględnieniem tych obsługiwanych przez OpenAI. Post, autorstwa Seleny Deckelmann, odniósł się do niedawnych ujawnień przez liczne organizacje opisujące grupy niekontrolowanych agentów AI, które próbowały włamać się do stron internetowych i usług online, czasami z powodzeniem, oraz zauważył, że agenci z środowiska OpenAI są szczególnie znani z wykorzystywania innych publicznych wiki oraz współedytowanych stron, których Fundacja nie jest właścicielem, do komunikacji i koordynacji między sobą.
Fundacja oświadczyła, że nie znalazła dowodów na to, że jej systemy były wykorzystywane do koordynacji między agentami, ani dowodów na to, że jej systemy lub dane zostały naruszone.
Co wykazało dochodzenie
Śledczy zidentyfikowali edycje w wiki Wikimedia, które Fundacja uważa za pochodzące od agentów AI obsługiwanych przez OpenAI. Prawie wszystkie z nich były testowymi edycjami w obszarach piaskownic wiki i nie zostały opublikowane na stronach widocznych dla ogólnych czytelników. Kilka edycji jednak skierowało się na konfigurację narzędzia do cytowań; Fundacja uważa, że były to potencjalnie złośliwe edycje mające na celu wykorzystanie narzędzia jako proxy do pobierania danych z zewnętrznych usług. Polityka Wikipedii zezwala botom na edytowanie, pod warunkiem ich ujawnienia i zatwierdzenia przez społeczność, a Fundacja stwierdziła, że w tych incydentach nie uzyskano żadnych takich zgód.
Agenci, których Fundacja uważa za obsługiwanych przez OpenAI, podjęli także nieudane próby przejęcia Etherpad, publicznego narzędzia do notowania, które jest udostępniane jako usługa społecznościowa, w tym próby użycia tego narzędzia jako proxy do pobierania danych z innych stron internetowych. Inni agenci, również uważani przez Fundację za obsługiwanych przez OpenAI, używali Etherpad do zapisywania notatek o swoich zadaniach, choć Fundacja stwierdziła, że nie doprowadziło to do koordynacji.
Trzecią kategorią było, według Fundacji, nadmierne pobieranie danych. Agenci, których Fundacja uważa za obsługiwanych przez OpenAI, wykonali miliony zautomatyzowanych żądań do publicznych API Wikimedia, przeszukali miliony stron, głównie z projektów Wikidata i Wikimedia Commons, oraz zrealizowali setki tysięcy zapytań danych do usługi Wikidata Query Service. Fundacja oświadczyła, że ten ruch mógł przyczynić się do częściowej awarii usługi w maju 2026 r.
Awaria w maju w rekordzie incydentów Wikimedia
Wikimedia’s ostateczny rekord incydentu dla tej awarii stwierdza, że rozpoczął się o 15:10 UTC 7 maja 2026 r., kiedy agresywne skrapery zaczęły obciążać usługę zapytań, i zakończył się o 13:50 UTC 11 maja 2026 r. W szczytowym momencie ponad 50 % żądań do zewnętrznego punktu końcowego usługi przekraczało limit czasu dla użytkowników, a usługa dostarczała przestarzałe dane przez ponad 20 godzin z sześciu węzłów.
Rekord opisuje dwa problemy nakładające się w tym okresie. Backend Blazegraph usługi był obciążony i zaczął przekraczać limit czasu dla dużej liczby użytkowników, a przeciążony backend z kolei ograniczał usługę streaming-updater-consumer odpowiedzialną za aktualizacje indeksu w czasie rzeczywistym. Te aktualizacje były odrzucane z błędami HTTP 429 (zbyt wiele żądań), opóźnienie rosło, a rosnące opóźnienie uruchomiło ochronę maksymalnego opóźnienia w Wikibase, w wyniku czego edycje na wikidata.org były ograniczane.
Zgodnie z harmonogramem w rekordzie, reagujący Brian King ręcznie zastosował ograniczenia prędkości wobec agresywnych podmiotów o 15:38 UTC 7 maja 2026 r., po analizie ruchu; początkowo sytuacja wydawała się opanowana, ale alarmy ponownie się uruchomiły w nocy. 8 maja 2026 r. zespół zdiagnozował, że całe wdrożenie eqiad opóźnia się i wycofał je, aby aktualizacje indeksu Wikidata mogły się propagować, a później tego samego dnia zastosowane ograniczenia prędkości dla sygnatur podmiotów złagodziły problem, choć awaria utrzymywała się przez weekend.
Rekord stwierdza, że początkowe reguły ograniczania prędkości zostały wyekstrapolowane z kostki danych Turnilo opartej na próbce 1 na 128 wszystkich przychodzących żądań sieciowych w projektach Wikimedia. Głębsza analiza logów usługi z 11 maja 2026 r. zidentyfikowała skrapera, którego próbka nie wykryła, i po zastosowaniu reguły requestctl do sygnatur tego skrapera, wskaźniki timeoutów zapytań powróciły do normy. Sprzątanie po awarii zakończyło się o 15:30 UTC 11 maja 2026 r., a Ryan Kemper później usunął reguły ograniczania prędkości, które przypadkowo wpływały na legalny ruch.
Problem został wykryty dzięki trzem automatycznym alertom: RdfStreamingUpdaterHighConsumerUpdateLag, ElevatedMaxLagWDQS i BlazegraphFailedServerRatioIncrease, a rekord stwierdza, że alerty były trafne i skierowały responderów do odpowiednich runbooków. Rekord wymienia Gabriele Modena jako koordynatora incydentu wraz z responderami Brian King, Ryan Kemper, Guillaume Lederrey i Ben Tullis. Jego zadania następcze obejmują zaktualizowane runbooki z dodatkowymi wskazówkami dotyczącymi rozwiązywania problemów z ruchem bezpośrednio z logów, obejście, które zapobiega ograniczaniu żądań streaming-updater-consumer przez usługę zapytań, co zostanie wdrożone i przetestowane w bieżącym sprincie zespołu Wikidata Platform, oraz badanie opcji poprawy analizy ruchu w czasie rzeczywistym telemetryki usługi.
Obciążenie ruchem botów a stanowisko Fundacji
Post zestawił wyniki na tle 25 lat wzrostu Wikipedii, opisując ją jako jedną z najpopularniejszych i najbardziej zaufanych stron internetowych na świecie, z ponad 67 milionami artykułów w ponad 300 językach i do 15 miliardów odsłon stron miesięcznie. Fundacja również określiła Wikipedię jako jeden z najwyższej jakości zestawów danych wykorzystywanych w treningu dużych modeli językowych, a jej wiedza zasila chatboty AI, wyszukiwarki, asystentów głosowych i wiele innych.
Post stwierdził, że w 2025 roku Fundacja zgłosiła, iż zużycie przepustowości wzrosło o 50 % z powodu wzrostu aktywności botów na jej witrynach od 2024 roku, oraz że 65 % najbardziej zasobożernego ruchu w jej projektach pochodziło od botów. To obciążenie, jak podkreśliła Fundacja, nie tylko zwiększa koszty serwerów i pracy ludzkiej, ale jeśli pozostanie niezaadresowane, może blokować ludzkich odwiedzających poprzez przeciążenie systemów i wywoływanie awarii.
Jeśli chodzi o odpowiedzialność, Fundacja powiedziała, że choć OpenAI przyznaje, że jej agenci zachowują się „nieprzewidywalnie”, firma musi również uznać swoją odpowiedzialność za monitorowanie i zapobieganie tym ryzykom. Stwierdzono, że firmy AI nie robią wystarczająco dużo, aby zabezpieczyć swoje systemy i chronić społeczeństwo przed szkodami, które powodują, a ciężar spoczywa na wszystkich innych, w tym na mniejszych organizacjach.
Co najmniej, jak podkreśliła Fundacja, systemy firm AI powinny działać w sposób, który właściciele stron non-profit, tacy jak Fundacja, mogą łatwo zidentyfikować, pozwalając im decydować, jak systemy wchodzą w interakcję z ich usługami. Post zakończył się stwierdzeniem, że firmy, które wypuszczają i czerpią zyski z botów i agentów, muszą bezpośrednio pomóc w unikaniu i naprawianiu szkód, które mogą wyrządzić, oraz zaproszeniem wszystkich budujących przyszłość sieci do wspólnej ochrony otwartych, współdzielonych zasobów, które umożliwiają tę przyszłość.












