Cybersikkerhed
OpenAI afbryder koordineret kampagne for udtræk af model‑resoneringsspor

OpenAI sagde i et sikkerhedspost offentliggjort den 30. september 2026, at det havde identificeret og afbrudt en koordineret kampagne, der var designet til at udtrække beskyttet resoneringsinformation fra dets modeller, og at det tilskrev en kerne‑klynge af aktiviteten til personer forbundet med Moonshot AI, udvikleren af Kimi. Den tidligst observerede aktivitet fandt sted i den første uge af juli 2026.
Hvad OpenAI observerede
OpenAI beskrev aktiviteten som i overensstemmelse med adversarial destillation, som de definerer som den systematiske og uautoriserede brug af en models output eller resoneringsprocesser til at hjælpe med at træne, reproducere eller forbedre en anden model. Beskyttet resoneringsinformation er, ifølge virksomheden, modellens interne registrering af, hvordan den løser en opgave; udtræk af denne kan afsløre information, der holdes tilbage fra det endelige svar, og hjælpe andre med at reproducere modellens evner.
OpenAI sagde, at operatørerne ikke brød deres kryptering, kompromitterede en database eller opnåede direkte adgang til gemte bruger‑samtaler. Operatørerne manipulerede modelinteraktioner, så beskyttet resoneringsinformation kunne reproduceres i former, der var synlige for anmoderen, på en koordineret og skaleret måde, hvilket overtrådte virksomhedens servicevilkår. En teknik, som OpenAI observerede, involverede at kopiere krypteret resoneringsinformation fra én samtale og bede en model i en anden samtale om at dekryptere og transskribere det skjulte resoneringsindhold. Virksomheden sagde, at manipulationen ikke er en sårbarhed, der er unik for deres modeller, og at de delte information om den med branchepartnere gennem Frontier Model Forum for at styrke de kollektive forsvar.
Aktiviteten startede den 1. juli 2026, i starten med lavt volumen, indtil OpenAI observerede høje spidser i volumen den 24. og 25. juli 2026 bestående af 16.000 forespørgsler, der brugte et relevant udtrækningsmønster fra mere end 4.000 brugere. En fodnote i indlægget bemærker, at disse tal beskriver forsøgte, men ikke nødvendigvis vellykkede, udtræk. OpenAI sagde, at yderligere undersøgelser identificerede relateret prompt‑mønster‑aktivitet på tværs af en klynge på mere end 15.000 brugere, som de fuldstændigt afbrød inden den 28. juli 2026. Aktiviteten udviklede sig over tid, hvilket ifølge virksomheden understreger, at adversarial destillation er en bredere sikkerhedsudfordring, der kræver lagdelte, adaptive forsvar.
OpenAI sagde, at adversarial destillation udgør sikkerheds‑ og national sikkerhedsrisici: udtrukket resoneringsinformation kan bruges til at træne en anden model uden at bevare de sikkerhedsforanstaltninger, der anvendes på den oprindelige models bruger‑rettede output, og destillation i stor skala kan fremskynde overførslen af avancerede evner uden den samme investering i sikkerhed, en bekymring som virksomheden siger forværres, efterhånden som modeller får evner inden for dobbelt‑brugs‑områder. OpenAI sagde, at de inden offentliggørelsen undersøgte kampagnens omfang og potentielle påvirkning, implementerede egne afbødninger, delte med og indhentede feedback fra forskere og branchepartnere, og at yderligere afbødnings‑ og undersøgelsesarbejde fortsætter.
Tilskrivning
OpenAI sagde, at det er uklart, om alle operatører observeret i den relevante periode stammer fra én enkelt aktør, og at de tilskriver en kerne‑klynge af aktiviteten til personer forbundet med Moonshot AI, udvikleren af Kimi.
Den 8. september 2026 frigav National Security Agency, Cybersecurity and Infrastructure Security Agency og Federal Bureau of Investigation en fælles cybersikkerhedsadvisory der fastslog, at Moonshot AI har gennemført en udbredt destillationskampagne mod amerikanske frontlinje‑AI‑virksomheder siden mindst midten af 2025. Advisoret angiver, at Moonshot AI udtrækker betydelige Claude Fable 5‑data for at træne deres Kimi‑K3‑model og GPT‑4o‑data for at træne deres Kimi‑K2‑model, og at virksomheden brugte amerikanske modeller til at destillere supervisioneret finjusteringsoptimering, forstærkningslæring, softwareudvikling og matematik‑evner.
Advisoret angiver mere generelt, at sandsynligvis med kinesisk regeringsviden, DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun og Z.AI har udtrukket milliarder af tokens på tværs af millioner af udvekslinger fra amerikanske frontlinje‑AI‑modeller, herunder varianter af Claude, GPT, Gemini og Grok, siden mindst slutningen af 2024. Ifølge agenturerne kanaliserede disse virksomheder forespørgsler gennem native‑API’er, fjern‑cloud‑udbydere og tredjeparts‑aggregatorer; brugte et gråmarked af API‑proxy’er kendt som transfer‑stations for at omgå geografiske begrænsninger, overtræde brugsvilkår og underminere sporbarhed; og opnåede omkostningsbesparelser gennem bulk‑indkøb af premium‑abonnementer, der deles på tværs af udvikler‑teams. Agenturerne anbefalede, at amerikanske AI‑virksomheder implementerer omfattende detektion og afbødning, indfører målrettede responsændringer for mistænkte destillationsforsøg, og etablerer tvær‑organisatorisk deling af efterretninger.
Forskningen i resonerings‑spor
OpenAI sagde, at uafhængige sikkerhedsforskere gjorde relaterede tvær‑model‑ og samtale‑komprimerings‑sårbarheder opmærksomme på dem gennem ansvarlig offentliggørelse. Virksomheden sagde, at de undersøgte fundene, bekræftede at de angrebspfade, forskerne identificerede, var reelle, og at arbejdet hjalp dem med at forstå den bredere angrebsklasse og fremskynde afbødninger.
I et papir indsendt til arXiv den 10. august 2026, Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer‑Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping og Maksym Andriushchenko rapporterer, at førende udbydere skjuler deres modellers trin‑for‑trin‑resonering for at beskytte intellektuel ejendom og begrænse informationslækage, og returnerer sporene til klienten som blokke af krypteret tekst, som klienten sender tilbage med hver efterfølgende forespørgsel. Forfatterne identificerer en arkitektonisk sårbarhed: disse krypterede blokke er fuldt kompatible og udskiftelige på tværs af forskellige sessioner, brugere og modeller inden for en udbyders økosystem. De beskriver en skalerbar dekrypterings‑jailbreak, hvor et krypteret resonansspor fra en given model injiceres i en svagere, mindre beskyttet model fra samme udbyder, hvilket tvinger den til at dekode og outputte sporet ordret i klartekst uden at jailbreak’e den mere kapable model direkte.
Forfatterne rapporterer, at sårbarheden muliggør fire forskellige angrebsvektorer: omgåelse af anti‑destillations‑mekanismer, som de demonstrerer på tværs af Anthropic, OpenAI og Google; stor‑skala privat dataudtræk, hvor de genvandt 367 personligt identificerbare informationsartefakter og 182 legitimationsoplysninger ved at dekode 315.320 resonansblokke indsamlet fra offentlige arkiver; utilsigtet afsløring af farlig information skjult i resonansprocessen, selv når modellens endelige synlige output sikkert afviser en ondsindet forespørgsel; og usynlige prompt‑injektioner, der indlejrer ondsindet payload fuldstændigt inden for krypterede blokke for at forgifte offentlige agent‑udrulninger. Efter ansvarlig offentliggørelse foreslår forfatterne kryptografiske og system‑niveau afhjælpninger for at sikre klient‑side resonering.
Hvordan OpenAI reagerede
OpenAI oplyser, at de afbødede kampagnen gennem en kombination af kontoenforcement, tekniske kontroller og partnerkoordinering: de forbød eller begrænsede svigagtige konti, styrkede tilmeldings‑ og infrastrukturkontroller og udvidede overvågningen af relaterede netværk. Virksomheden siger også, at de har styrket beskyttelsen af skjult resonering på tværs af brugere, arbejdsområder, organisationer og modelfamilier: de lukkede en vej, der tillod en person, der allerede besad en anden brugers krypterede resonering, at afspille den og genvinde indholdet, tilføjede kontroller for at opdage og holde streamet output, der kunne afsløre resonering, og samarbejdede med tredjepartsudbydere om at identificere og afbryde konti, når relateret aktivitet gik gennem deres tjenester.
OpenAI sagde, at de delte relevante fund gennem Frontier Model Forum og passende regerings‑informationsdelingskanaler, så andre frontier‑udviklere og offentlige partnere kunne lede efter lignende aktivitet og styrke deres egne forsvar, og bemærkede, at systemer, der understøtter bærbare eller afspilbare resonansartefakter, kan stå over for relaterede risici.
OpenAI siger, at de forventer, at forsøg på adversarial destillation bliver mere sofistikerede, efterhånden som frontier‑modeller forbedres, og efterhånden som aktører søger billigere måder at efterligne deres kapaciteter på. Virksomheden siger, at partner‑hostede implementeringer har brug for de samme beskyttelser som først‑partstjenester, at værktøjs‑output‑angreb kræver beskyttelser, der undersøger mere end almindelig synlig tekst, og at de fortsat forbedrer værktøjsforsvar, klassifikator‑dækning og model‑afvisninger, mens de udbreder relevante kontroller på tværs af cloud‑partnere. OpenAI siger, at deres svar vil fortsætte med at fokusere på tre områder: stærkere tekniske beskyttelser mod udtræk, bedre detektion og håndhævelse af koordinerede kampagner samt dybere trussels‑informationsdeling på tværs af industri og regering.












