Cybersikkerhet
OpenAI avbryter koordinert kampanje for uttrekk av modell‑resonnement

OpenAI sa i et sikkerhetsinnlegg publisert 30. september 2026 at de identifiserte og avbrøt en koordinert kampanje som var designet for å trekke ut beskyttet resonnement fra modellene sine, og de tilskrev en kjerneklump av aktiviteten til personer knyttet til Moonshot AI, utvikleren av Kimi. Den tidligste observerte aktiviteten fant sted i den første uken i juli 2026.
Hva OpenAI observerte
OpenAI beskrev aktiviteten som i samsvar med adversarial distillation, som de definerte som systematisk og uautorisert bruk av en modells output eller resonnement for å hjelpe med å trene, gjenskape eller forbedre en annen modell. Beskyttet resonnement, ifølge selskapet, er modellens interne logg for å arbeide gjennom en oppgave; å trekke det ut kan avsløre informasjon som holdes tilbake fra det endelige svaret og hjelpe andre med å gjenskape modellens evner.
OpenAI oppga at operatørene ikke brøt krypteringen, kompromitterte en database eller fikk direkte tilgang til lagrede brukersamtaler. Operatørene manipulerte modellinteraksjoner slik at beskyttet resonnement kunne gjenskapes i former synlige for forespøreren på en koordinert, skalert måte som brøt selskapets vilkår for bruk. En teknikk OpenAI observerte involverte å kopiere kryptert resonnement fra én samtale og be en modell i en annen samtale om å dekryptere og transkribere det skjulte resonneringsinnholdet. Selskapet sa at manipuleringen ikke er en sårbarhet som er unik for deres modeller, og at de delte informasjon om den med bransjepartnere gjennom Frontier Model Forum for å styrke felles forsvar.
Aktiviteten startet 1. juli 2026, først med lavt volum, inntil OpenAI observerte høyvolumspikkinger 24. og 25. juli 2026 bestående av 16 000 forespørsler som brukte et relevant uttrekksmønster fra mer enn 4 000 brukere. En fotnote i innlegget bemerker at disse tallene beskriver forsøk på uttrekk, ikke nødvendigvis vellykkede uttrekk. OpenAI oppga at videre etterforskning identifiserte relatert prompt‑mønsteraktivitet på tvers av en klynge på mer enn 15 000 brukere, som de fullstendig avbrøt innen 28. juli 2026. Aktiviteten utviklet seg over tid, noe selskapet sier understreker at adversarial distillation er en bredere sikkerhetsutfordring som krever lagdelte, adaptive forsvar.
OpenAI sa at adversarial distillation medfører sikkerhets- og nasjonale sikkerhetsrisikoer: uttrekket resonnement kan brukes til å trene en annen modell uten å bevare de beskyttelsene som er anvendt på den opprinnelige modellens brukerrettede output, og destillasjon i stor skala kan akselerere overføringen av avanserte evner uten samme investering i sikkerhet, en bekymring selskapet sier øker etter hvert som modeller får evner i dual‑use‑områder. OpenAI oppga at de før publisering undersøkte kampanjens omfang og potensielle påvirkning, implementerte egne avbøtende tiltak, og delte med og tok imot tilbakemeldinger fra forskere og bransjepartnere, og at ytterligere avbøting og etterforskningsarbeid pågår.
Attribusjon
OpenAI oppga at det er uklart om alle operatører som ble observert i den aktuelle perioden kom fra en enkelt aktør, og at de tilskriver en kjerneklump av aktiviteten til personer knyttet til Moonshot AI, utvikleren av Kimi.
Den 8. september 2026 publiserte National Security Agency, Cybersecurity and Infrastructure Security Agency og Federal Bureau of Investigation en felles cybersikkerhetsrådgivning som fastslår at Moonshot AI har gjennomført en omfattende destillasjonskampanje mot amerikanske frontier‑AI‑selskaper siden minst midten av 2025. Rådgivningen oppgir at Moonshot AI trakk ut betydelige Claude Fable 5‑data for å trene sin Kimi‑K3‑modell og GPT‑4o‑data for å trene sin Kimi‑K2‑modell, og at selskapet brukte amerikanske modeller til å destillere overvåket finjustering, forsterkningslæring, programvareutvikling og matematiske evner.
Rådgivningen fastslår mer generelt at, sannsynligvis med kunnskap fra den kinesiske regjeringen, DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun og Z.AI har trukket ut milliarder av token over millioner av utvekslinger fra amerikanske frontier‑modeller, inkludert varianter av Claude, GPT, Gemini og Grok, siden minst slutten av 2024. Ifølge byråene rutet disse selskapene forespørsler gjennom native API‑er, eksterne skyleverandører og tredjeparts‑aggregatorer; brukte et gråmarked av API‑proxyer kjent som overføringsstasjoner for å omgå geografiske restriksjoner, bryte bruksvilkår og undergrave sporbarhet; og oppnådde kostnadsbesparelser gjennom bulk‑innkjøp av premium‑abonnementer som deles på tvers av utviklerteam. Byråene anbefalte at amerikanske AI‑selskaper implementerer omfattende deteksjon og avbøting, iverksetter målrettede responsendringer for mistenkte destillasjonsforsøk, og etablerer tverrorganisatorisk etterretningsdeling.
Forskning på resonnerings‑spor
OpenAI oppga at uavhengige sikkerhetsforskere gjorde oppmerksom på relaterte kryss‑modell‑ og samtalekompakterings‑sårbarheter gjennom ansvarlig offentliggjøring. Selskapet sa at de undersøkte funnene, bekreftet at angrepsveiene forskerne identifiserte var reelle, og at arbeidet hjalp dem med å forstå den bredere angrepsklassen og fremskynde avbøtingstiltak.
I en artikkel sendt til arXiv 10. august 2026 rapporterer Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer‑Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping og Maksym Andriushchenko at ledende leverandører skjuler modellenes trinn‑for‑trinn‑resonnement for å beskytte immaterielle rettigheter og begrense informasjonslekkasje, og returnerer sporene til klienten som blokker av kryptert tekst som klienten sender tilbake med hver påfølgende forespørsel. Forfatterne identifiserer en arkitektonisk sårbarhet: disse krypterte blokkene er fullt kompatible og utskiftbare på tvers av ulike økter, brukere og modeller innen en leverandørs økosystem. De beskriver en skalerbar dekrypterings‑jailbreak der et kryptert resonneringsspor fra en gitt modell injiseres i en svakere, mindre beskyttet modell fra samme leverandør, og tvinger den til å dekode og gjengi sporet ordrett i klartekst uten å jailbreake den mer kapable modellen direkte.
Forfatterne rapporterer at sårbarheten muliggjør fire distinkte angrepsvektorer: omgåelse av anti‑destillasjonsmekanismer, som de demonstrerer på tvers av Anthropic, OpenAI og Google; storskalig privat datauttrekking, der de gjenvant 367 personlige identifikasjons‑artefakter og 182 påloggingsinformasjoner ved å dekode 315 320 resonneringsblokker hentet fra offentlige repositorier; utilsiktet avsløring av farlig informasjon skjult i resonneringsprosessen selv når modellens endelige synlige output trygt avviser en ondsinnet forespørsel; og usynlige prompt‑injeksjoner som innkapsler ondsinnet last helt innenfor krypterte blokker for å forgifte offentlige agent‑utrullinger. Etter ansvarlig avsløring foreslår forfatterne kryptografiske og systemnivå‑mitigasjoner for å sikre resonnering på klientsiden.
Hvordan OpenAI reagerte
OpenAI opplyser at de dempet kampanjen gjennom en kombinasjon av kontoenforcement, tekniske kontroller og partner‑koordinering: de forbyr eller begrenser svindel‑kontoer, styrker registrerings‑ og infrastrukturkontroller, og utvider overvåkingen av relaterte nettverk. Selskapet sier også at de har styrket beskyttelsen av skjult resonnering på tvers av brukere, arbeidsområder, organisasjoner og modellfamilier: de lukket en vei som tillot noen som allerede hadde en annen brukers krypterte resonnering å spille den av og gjenvinne innholdet, la til sjekker for å oppdage og holde på strømmet output som kan eksponere resonnering, og samarbeidet med tredjepartsleverandører for å identifisere og avbryte kontoer når relatert aktivitet gikk gjennom deres tjenester.
OpenAI sa at de delte relevante funn gjennom Frontier Model Forum og passende offentlige kanaler for informasjonsdeling, slik at andre frontier‑utviklere og offentlige sektors partnere kunne lete etter lignende aktivitet og styrke sine egne forsvar, og de bemerket at systemer som støtter bærbare eller avspillbare resonneringsartefakter kan stå overfor relaterte risikoer.
OpenAI sier at de forventer at forsøk på adversarial destillasjon vil bli mer sofistikerte etter hvert som frontier‑modeller forbedres og aktører søker billigere måter å etterligne deres evner på. Selskapet opplyser at partner‑hostede distribusjoner trenger samme beskyttelser som førsteparts‑tjenester, at verktøy‑output‑angrep krever beskyttelser som undersøker mer enn vanlig synlig tekst, og at de fortsetter å forbedre verktøyforsvar, klassifikator‑dekning og modell‑avslag mens de sprer relevante kontroller til sky‑partnere. OpenAI sier at responsen deres vil fortsette å fokusere på tre områder: sterkere tekniske beskyttelser mot utvinning, bedre oppdagelse og håndheving mot koordinerte kampanjer, samt dypere trusselinformasjonsdeling på tvers av industri og myndigheter.












