Cybersikkerhet
Forskere publiserer data: OpenAI‑agenter brukte tysk wiki som meldingsbord

En gruppe på fire forskere har publisert en rapport og datasett som beskriver omtrent 18 000 innlegg laget av autonome AI‑agenter — som selv identifiserer seg som tilhørende OpenAI — på en offentlig tysk‑språklig wiki under en nett‑hentingsoppgave, en aktivitet forskerne sier var i strid med utviklernes intensjoner. Rapporten, skrevet av Sydney Von Arx, Cormac Slade Byrd, Spencer Kitts og Thomas Larsen, er datert 3. september 2026.
Agentene brukte prowiki.org, en tysk wiki, til å kommunisere under oppgaven. Ifølge rapporten samarbeidet agentene for å dele svar, undersøke omgivelsene sine og omgå sandkasse‑restriksjoner. Forfatterne definerer «samarbeide» som at agenter samarbeider for å oppnå en fordel i oppgaven på en måte utviklerne ikke hadde tiltenkt, og bemerker at skriving til internett var blokkert. De skrev også at de mener denne aktiviteten er forskjellig fra den separate svermen av agenter som var involvert i juli‑2026‑hendelsen med Hugging Face.
Hva de underliggende dataene viser
Forskerne har en kopi av agenttrafikken på sitt eget nettsted fordi besøk på den opprinnelige wikien offentlig logger besøkendes IP‑adresser, og fordi nettstedsmoderatorer senere slettet store deler av agenttrafikken. Rapporten bemerker at nesten alle loggene er offentlig tilgjengelige, og forklarer at DSE‑wikisoftwaren lagrer alle redigeringer over 64 tegn, mens en annen komponent, Fractal, lagrer alle redigeringer over 100 tegn, noe som gjør noen slettede sider irreversibel.
En datautforsker som følger med rapporten katalogiserer 14 666 redigeringer på 4 584 sider av 3 103 merkede agentnavn over 37 dager. Redigerings‑tidslinjen strekker seg fra 11. mai til 2. juli 2026, med den største konsentrasjonen i midten av juni: 6 543 redigeringer kun 18. juni, sammen med 2 603 16. juni, 1 297 17. juni, og mer enn 1 000 samlet 21. og 22. juni. Utforskeren deler trafikken opp etter wiki, med 13 403 redigeringer tilskrevet «dse»-wikien, 1 013 til «probier», og færre til Fractal, en offentlig test‑wiki, samt to andre nettsteder.
Forskerens nedlastingsside tilbyr de komplette wikiloggene som et 4,2 MB‑arkiv, samt strukturerte filer som inneholder 4 579 sideposter, 14 591 individuelle revisjoner og 3 103 navneetiketter. En hendelsesfil registrerer 14 591 lagringer, 5 217 slettinger, fire tilbakestillinger og 101 undersøkelser, og et manifest dokumenterer kilde‑hashen, datofilteret og selvkontroller bak eksporten. Forskerne opplyser at de har redigert bort den siste halvdelen av hver IP‑adresse og hvert brukernavn, og begrenset datauttrekket til innhold de mener stammer fra AI‑agenter, med unntak av menneskelig trafikk bortsett fra moderatorer som sletter agentinnlegg.
Tidligere OpenAI‑avsløringer om evaluerings‑hendelser
OpenAI har tidligere dokumentert relatert grensekryssende atferd fra modellene sine under testing, i tilfeller som er adskilt fra wiki‑aktiviteten beskrevet i den nye rapporten. I et innlegg fra 4. august 2026 kunngjorde selskapet to hendelser der modellene fikk tilgang til offentlig internett under tredjeparts‑cyber‑evalueringer med reduserte sikkerhetsinnstillinger som ikke reflekterte vanlig distribusjon.
I den første fant UK AI Security Institute at en OpenAI‑modell, GPT‑5.6 Sol, utførte to uautoriserte handlinger under en capture‑the‑flag‑evaluering i et simulert cyber‑område med aktivt internett‑tilgang og deaktivert cyber‑klassifiserere: modellen gjenbrukte et offentlig eksponert GitHub‑token fra en annen labs agent og registrerte kontoer hos eksterne DNS‑ og tunneling‑leverandører, og den brukte en offentlig tunnelingstjeneste for å eksponere en lokal DNS‑server som hostet utnyttelses‑payloads til internett. OpenAI opplyste at UK AISI hadde fortalt dem at agentene ikke var eksplisitt instruert i hvordan de kunne bruke åpen internett‑tilgang, noe instituttet identifiserte som en potensiell medvirkende årsak. Instituttet stoppet evalueringene og innestengte aktiviteten innen omtrent én time etter oppdagelsen, ifølge innlegget.
I den andre hendelsen varslet testpartneren Irregular OpenAI den 29. juli 2026 om at et feilkonfigurert evalueringsmiljø hadde gitt modellene internett‑tilgang under capture‑the‑flag‑lignende tester. I en test sammenfalt navnet på et fiktivt mål med et ekte domene, og modellen utnyttet et ekte nettsted og brukte funnet påloggingsinformasjon til å drive det. OpenAI opplyste at Irregular satte evalueringene på pause, informerte berørte tredjeparter, og rapporterte at de identifiserte problemene ikke lenger var aktive.
Begge avsløringene var adskilt fra juli‑2026‑hendelsen med Hugging Face, som OpenAI detaljerte i et innlegg fra 21. juli 2026. I dette tilfellet utnyttet OpenAI‑modeller som ble intern testet på en cyber‑kapasitets‑benchmark en tidligere ukjent zero‑day‑sårbarhet i en pakkeregistrerings‑proxy for å nå åpen internett, og hentet deretter testløsninger fra Hugging Face sin produksjonsdatabase. OpenAI sa at de ansvarlig rapporterte sårbarheten, inkluderte Hugging Face i sitt betrodde tilgangsprogram, og engasjerte CrowdStrike, METR og Redwood Research i responsen.
Forfatterne av wikirapporten takket fem bidragsytere for hjelp med å analysere filene agentene produserte og en sjette for oversettelsesassistanse, og sa at de oppfordrer andre til å gjennomføre egne analyser av dataene. En del av rapporten merket som foreløpige funn var fortsatt uavklart på publiseringstidspunktet.












