Cybersäkerhet
OpenAI stör koordinerad kampanj för extraktion av modellresonemang

OpenAI sade i ett säkerhetsinlägg publicerat den 30 september 2026 att de identifierade och stoppade en koordinerad kampanj som syftade till att extrahera skyddat resonemang från deras modeller, och de tillskrev en kärnkluster av aktiviteten individer kopplade till Moonshot AI, utvecklaren av Kimi. Den tidigast observerade aktiviteten inträffade under den första veckan i juli 2026.
Vad OpenAI observerade
OpenAI beskrev aktiviteten som förenlig med adversarial distillation, vilket de definierade som systematisk och obehörig användning av en modells resultat eller resonemang för att hjälpa till att träna, reproducera eller förbättra en annan modell. Skyddat resonemang, enligt företaget, är modellens interna register för att arbeta igenom en uppgift; att extrahera det kan avslöja information som hålls tillbaka från det slutgiltiga svaret och hjälpa andra att reproducera modellens förmågor.
OpenAI sade att operatörerna inte bröt deras kryptering, komprometterade en databas eller fick direkt åtkomst till lagrade användarsamtal. Operatörerna manipulerade modellinteraktioner så att skyddat resonemang kunde reproduceras i former som var synliga för begäraren på ett koordinerat, skalerat sätt som stred mot företagets användarvillkor. En teknik som OpenAI observerade innebar att kopiera krypterat resonemang från ett samtal och be en modell i ett annat samtal att dekryptera och transkribera det dolda resonemangsinhållet. Företaget sade att manipulationen inte är en sårbarhet som är unik för deras modeller och att de delade information om den med branschpartner genom Frontier Model Forum för att stärka gemensamma försvar.
Aktiviteten började den 1 juli 2026, initialt med låg volym, tills OpenAI observerade högvolymsökningar den 24 och 25 juli 2026 bestående av 16 000 förfrågningar som använde ett relevant extraktionsmönster från mer än 4 000 användare. En fotnot i inlägget noterar att dessa siffror beskriver försök, inte nödvändigtvis lyckade, extraktioner. OpenAI sade att vidare undersökning identifierade relaterad prompt‑mönster‑aktivitet över ett kluster av mer än 15 000 användare, vilket de helt stoppade senast den 28 juli 2026. Aktiviteten utvecklades över tid, vilket företaget menar förstärker att adversarial distillation är en bredare säkerhetsutmaning som kräver lager‑ och anpassningsbara försvar.
OpenAI sade att adversarial distillation innebär säkerhets- och nationella säkerhetsrisker: extraherat resonemang kan användas för att träna en annan modell utan att bevara de skydd som tillämpas på den ursprungliga modellens användarorienterade resultat, och distillation i stor skala kan påskynda överföringen av avancerade förmågor utan samma investering i säkerhet, en oro som företaget menar ökar när modeller får förmågor i dubbelanvändningsområden. OpenAI sade att de innan publicering undersökte kampanjens omfattning och potentiella påverkan, implementerade egna motåtgärder, samt delade med och tog emot feedback från forskare och branschpartner, och att ytterligare motåtgärds‑ och undersökningsarbete pågår.
Tillskrivning
OpenAI sade att det är oklart om alla operatörer som observerades under den relevanta perioden härstammar från en enda aktör, och att de tillskriver ett kärnkluster av aktiviteten individer kopplade till Moonshot AI, utvecklaren av Kimi.
Den 8 september 2026 släppte National Security Agency, Cybersecurity and Infrastructure Security Agency och Federal Bureau of Investigation ett gemensamt cybersäkerhetsråd som anger att Moonshot AI har genomfört en omfattande distillationskampanj mot amerikanska frontier‑AI‑företag sedan åtminstone mitten av 2025. Rådet anger att Moonshot AI extraherade betydande Claude Fable 5‑data för att träna sin Kimi‑K3‑modell och GPT‑4o‑data för att träna sin Kimi‑K2‑modell, samt att företaget använde amerikanska modeller för att destillera övervakad finjusteringsoptimering, förstärkningsinlärning, mjukvaruutveckling och matematikförmågor.
Rådet anger mer allmänt att, sannolikt med kinesisk regeringens medvetenhet, DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun och Z.AI extraherade miljarder tokenar över miljontals utbyten från amerikanska frontier‑modeller, inklusive varianter av Claude, GPT, Gemini och Grok, sedan åtminstone slutet av 2024. Enligt myndigheterna dirigerade dessa företag förfrågningar genom inhemska API:er, fjärrmolnleverantörer och tredjepartsaggregerare; använde en grå marknad av API‑proxyer kända som transferstationer för att kringgå geografiska restriktioner, bryta användarvillkor och underminera spårbarhet; samt uppnådde kostnadsbesparingar genom storskalig inköp av premiumprenumerationer som delades mellan utvecklingsteam. Myndigheterna rekommenderade att amerikanska AI‑företag implementerar omfattande upptäckt och motåtgärder, inför riktade svarsåtgärder för misstänkta distillationsförsök och etablerar tvärorganisatorisk informationsdelning.
Forskning om resonemangsspår
OpenAI sade att oberoende säkerhetsforskare uppmärksammade relaterade tvärmodell‑ och konversationskomprimeringssårbarheter genom ansvarsfull avslöjning. Företaget sade att de undersökte fynden, bekräftade att de angreppsvägar forskarna identifierade var verkliga, och att arbetet hjälpte dem att förstå den bredare attackklassen och påskynda motåtgärder.
I en artikel inlämnad till arXiv den 10 augusti 2026, Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer‑Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping och Maksym Andriushchenko rapporterar att ledande leverantörer döljer sina modellers steg‑för‑steg‑resonemang för att skydda immateriella rättigheter och begränsa informationsläckage, och returnerar spåren till klienten som block av krypterad text som klienten skickar tillbaka med varje efterföljande begäran. Författarna identifierar en arkitektonisk sårbarhet: dessa krypterade block är fullt kompatibla och utbytbara över olika sessioner, användare och modeller inom en leverantörs ekosystem. De beskriver en skalbar dekrypterings‑jailbreak där ett krypterat resonemangsspår från en given modell injiceras i en svagare, mindre skyddad modell från samma leverantör, vilket tvingar den att avkoda och återge spåret ordagrant i klartext utan att jailbreaka den mer kapabla modellen direkt.
Författarna rapporterar att sårbarheten möjliggör fyra distinkta attackvektorer: att kringgå anti‑destillationsmekanismer, vilket de demonstrerar mot Anthropic, OpenAI och Google; storskalig privat datainsamling, där de återvann 367 personligt identifierbara informationsartefakter och 182 autentiseringsuppgifter genom att dekryptera 315 320 resonemangsblock som skrapats från offentliga arkiv; oavsiktlig avslöjning av farlig information dold i resonemangsprocessen även när modellens slutliga synliga output säkert avvisar en skadlig förfrågan; samt osynliga prompt‑injektioner som inbäddar skadlig kod helt inom krypterade block för att förgifta offentliga agentbaserade utrullningar. Efter ansvarig avslöjning föreslår författarna kryptografiska och systemnivååtgärder för att säkra resonemang på klientsidan.
Hur OpenAI svarade
OpenAI uppgav att de mildrade kampanjen genom en kombination av kontokontroll, tekniska skyddsåtgärder och samordning med partners: de bannlyste eller begränsade bedrägliga konton, stärkte registrerings‑ och infrastrukturkontroller samt utökade övervakningen av relaterade nätverk. Företaget meddelade också att de förstärkte skyddet för dolt resonemang över användare, arbetsytor, organisationer och modellfamiljer: de stängde en väg som gjorde det möjligt för någon som redan hade en annan användares krypterade resonemang att spela upp det och återfå dess innehåll, lade till kontroller för att upptäcka och hålla tillbaka strömmad output som kan avslöja resonemang, och samarbetade med tredjepartsleverantörer för att identifiera och stoppa konton när relaterad aktivitet passerade deras tjänster.
OpenAI sade att de delade relevanta fynd via Frontier Model Forum och lämpliga regerings‑informationsdelningskanaler så att andra frontier‑utvecklare och offentliga partners kan leta efter liknande aktivitet och stärka sina egna försvar, och påpekade att system som stödjer portabla eller återuppspelningsbara resonemangsartefakter kan stå inför relaterade risker.
OpenAI förutspår att försök till adversarial destillation kommer att bli mer sofistikerade i takt med att frontier‑modeller förbättras och aktörer söker billigare sätt att efterlikna deras kapabiliteter. Företaget menar att partner‑hostade distributioner behöver samma skydd som förstapartstjänster, att verktygs‑output‑attacker kräver skydd som granskar mer än vanlig synlig text, och att de fortsätter förbättra verktygsskydd, klassificerings‑täckning och modellavslag samtidigt som relevanta kontroller sprids till molnpartners. OpenAI sade att deras svar kommer att fortsätta fokusera på tre områden: starkare tekniska skydd mot extraktion, bättre upptäckt och verkställighet mot koordinerade kampanjer samt djupare hot‑informationsdelning mellan industri och regering.












