Cyberbeveiliging
OpenAI verstoort gecoördineerde campagne voor extractie van modelredenering

OpenAI zei in een beveiligingsbericht gepubliceerd op 30 september 2026 dat het een gecoördineerde campagne had geïdentificeerd en verstoord die was ontworpen om beschermde redenering uit zijn modellen te extraheren, en dat het een kerncluster van de activiteit toeschreef aan personen die verbonden zijn aan Moonshot AI, de ontwikkelaar van Kimi. De vroegst waargenomen activiteit vond plaats in de eerste week van juli 2026.
Wat OpenAI heeft waargenomen
OpenAI beschreef de activiteit als consistent met adversarial distillation, wat het definieerde als het systematisch en ongeautoriseerd gebruiken van de output of redenering van één model om een ander model te trainen, te reproduceren of te verbeteren. Beschermde redenering, volgens het bedrijf, is het interne register van het model voor het doorwerken van een taak; het extraheren ervan kan informatie onthullen die van het uiteindelijke antwoord is achtergehouden en anderen helpen de mogelijkheden van het model te reproduceren.
OpenAI zei dat de operators zijn encryptie niet hebben gebroken, geen database hebben gecompromitteerd of directe toegang hebben verkregen tot opgeslagen gebruikersgesprekken. De operators manipuleerden modelinteracties zodat beschermde redenering kon worden gereproduceerd in vormen die zichtbaar waren voor de verzoeker, op een gecoördineerde, schaalbare wijze die in strijd was met de servicevoorwaarden van het bedrijf. Een techniek die OpenAI observeerde hield in dat versleutelde redenering van het ene gesprek werd gekopieerd en een model in een ander gesprek werd gevraagd de verborgen redeneringsinhoud te ontsleutelen en te transcriberen. Het bedrijf stelde dat de manipulatie geen kwetsbaarheid is die uniek is voor zijn modellen en dat het informatie erover heeft gedeeld met branchepartners via het Frontier Model Forum om de collectieve verdediging te versterken.
De activiteit begon op 1 juli 2026, aanvankelijk met een laag volume, totdat OpenAI pieken in hoog volume op 24 en 25 juli 2026 observeerde, bestaande uit 16.000 verzoeken die een relevant extractiepatroon gebruikten van meer dan 4.000 gebruikers. Een voetnoot in het bericht vermeldt dat deze cijfers pogingen beschrijven, niet noodzakelijk succesvolle extracties. OpenAI zei dat verder onderzoek gerelateerde prompt‑patroonactiviteit identificeerde over een cluster van meer dan 15.000 gebruikers, die het volledig had verstoord tegen 28 juli 2026. De activiteit evolueerde in de loop van de tijd, wat het bedrijf stelt dat het bevestigt dat adversarial distillation een bredere veiligheidsuitdaging is die gelaagde, adaptieve verdedigingen vereist.
OpenAI zei dat adversarial distillation veiligheids- en nationale veiligheidsrisico’s met zich meebrengt: geëxtraheerde redenering zou kunnen worden gebruikt om een ander model te trainen zonder de beschermingsmaatregelen die op de gebruikersgerichte output van het oorspronkelijke model werden toegepast te behouden, en distillatie op schaal kan de overdracht van geavanceerde mogelijkheden versnellen zonder dezelfde investering in veiligheid, een zorg die het bedrijf aangeeft te toenemen naarmate modellen mogelijkheden krijgen in dual‑use domeinen. OpenAI verklaarde dat het, vóór publicatie, de reikwijdte en potentiële impact van de campagne onderzocht had, eigen mitigaties had ingezet, en deze had gedeeld met en feedback had ontvangen van onderzoekers en branchepartners, en dat aanvullend mitigatie‑ en onderzoekswerk doorgaat.
Toeschrijving
OpenAI zei dat het onduidelijk is of alle operators die tijdens de relevante periode werden waargenomen, afkomstig waren van één enkele actor, en dat het een kerncluster van de activiteit toeschrijft aan personen die verbonden zijn aan Moonshot AI, de ontwikkelaar van Kimi.
Op 8 september 2026 hebben de National Security Agency, de Cybersecurity and Infrastructure Security Agency en het Federal Bureau of Investigation een gezamenlijk cyberbeveiligingsadvies uitgebracht waarin wordt gesteld dat Moonshot AI sinds minstens midden 2025 een grootschalige distillatiecampagne heeft gevoerd tegen Amerikaanse frontier‑AI‑bedrijven. Het advies vermeldt dat Moonshot AI aanzienlijke Claude Fable 5‑gegevens heeft geëxtraheerd om zijn Kimi‑K3‑model te trainen en GPT‑4o‑gegevens om zijn Kimi‑K2‑model te trainen, en dat het bedrijf Amerikaanse modellen heeft gebruikt om gesuperviseerde fine‑tuning‑optimalisatie, reinforcement learning, software‑engineering en wiskundige capaciteiten te distilleren.
Het advies stelt breder dat, vermoedelijk met kennis van de Chinese overheid, DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun en Z.AI sinds eind 2024 miljarden tokens hebben geëxtraheerd uit miljoenen uitwisselingen met Amerikaanse frontier‑modellen, inclusief varianten van Claude, GPT, Gemini en Grok. Volgens de agentschappen hebben deze bedrijven verzoeken gerouteerd via native API’s, externe cloudproviders en derden‑aggregatoren; een grijze markt van API‑proxy’s gebruikt, bekend als transferstations, om geografische beperkingen te omzeilen, servicevoorwaarden te schenden en traceerbaarheid te ondermijnen; en kostenbesparingen behaald via grootschalige inkoop van premiumabonnementen die gedeeld worden binnen ontwikkelteams. De agentschappen raden aan dat Amerikaanse AI‑bedrijven uitgebreide detectie‑ en mitigatie‑maatregelen implementeren, gerichte responsveranderingen doorvoeren voor vermoedelijke distillatiepogingen, en cross‑organisatorische inlichtingsdeling opzetten.
Het Redenerings‑Trace Onderzoek
OpenAI zei dat onafhankelijke beveiligingsonderzoekers gerelateerde cross‑model‑ en gesprek‑compressie‑kwetsbaarheden onder zijn aandacht hebben gebracht via verantwoorde openbaarmaking. Het bedrijf verklaarde dat het de bevindingen heeft onderzocht, heeft bevestigd dat de aanvalspaden die de onderzoekers identificeerden echt waren, en dat het werk heeft geholpen de bredere aanvalsklasse te begrijpen en mitigaties te versnellen.
In een paper ingediend bij arXiv op 10 augustus 2026, Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer‑Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping, en Maksym Andriushchenko rapporteren dat toonaangevende aanbieders hun modellen hun stap‑voor‑stap redenering verbergen om intellectueel eigendom te beschermen en informatie‑lekken te beperken, waarbij ze de sporen terugsturen naar de client als blokken versleutelde tekst die de client bij elk volgend verzoek terugstuurt. De auteurs identificeren een architecturale kwetsbaarheid: deze versleutelde blokken zijn volledig compatibel en uitwisselbaar over verschillende sessies, gebruikers en modellen binnen het ecosysteem van een aanbieder. Ze beschrijven een schaalbare decryptie‑jailbreak waarbij een versleuteld redeneer‑trace van een bepaald model wordt geïnjecteerd in een zwakker, minder beveiligd model van dezelfde aanbieder, waardoor dat model de trace woordelijk in platte tekst decodeert en uitvoert zonder het krachtigere model direct te jailbreaken.
De auteurs melden dat de kwetsbaarheid vier verschillende aanvalsvectoren mogelijk maakt: het omzeilen van anti‑distillatie‑mechanismen, wat ze demonstreren bij Anthropic, OpenAI en Google; grootschalige private data‑extractie, waarbij ze 367 persoonlijk identificeerbare informatie‑artefacten en 182 inloggegevens herstelden door 315.320 redeneer‑blokken te decoderen die uit openbare repositories waren geschraapt; onbedoelde onthulling van gevaarlijke informatie die verborgen zit in het redeneerproces, zelfs wanneer de uiteindelijke zichtbare output van een model een kwaadaardig verzoek veilig afwijst; en onzichtbare prompt‑injecties die kwaadaardige payloads volledig binnen versleutelde blokken embedden om publieke agent‑rollouts te vergiftigen. Na een verantwoordelijke openbaarmaking stellen de auteurs cryptografische en systeem‑niveau mitigaties voor om client‑side redenering te beveiligen.
Hoe OpenAI reageerde
OpenAI zei dat het de campagne heeft aangepakt met een combinatie van account‑handhaving, technische controles en partnercoördinatie: het heeft frauduleuze accounts verbannen of beperkt, de aanmeld‑ en infrastructuurcontroles versterkt, en de monitoring voor gerelateerde netwerken uitgebreid. Het bedrijf zei bovendien de bescherming voor verborgen redenering over gebruikers, werkruimtes, organisaties en model‑families te hebben versterkt: het sloot een pad dat iemand die al een versleutelde redeneer‑trace van een andere gebruiker bezat, kon afspelen en de inhoud kon terughalen, voegde controles toe om gestreamde output die redenering zou kunnen blootleggen te detecteren en vast te houden, en werkte samen met derden om accounts te identificeren en te verstoren wanneer gerelateerde activiteit via hun diensten verliep.
OpenAI zei dat het relevante bevindingen heeft gedeeld via het Frontier Model Forum en de juiste overheids‑informatie‑delingskanalen, zodat andere frontier‑ontwikkelaars en publieke‑sector partners soortgelijke activiteiten kunnen opsporen en hun eigen verdedigingen kunnen versterken, en merkte op dat systemen die draagbare of afspeelbare redeneer‑artefacten ondersteunen, mogelijk gerelateerde risico’s lopen.
OpenAI zei dat het verwacht dat pogingen tot adversaire distillatie geavanceerder zullen worden naarmate frontier‑modellen verbeteren en actoren op zoek gaan naar goedkopere manieren om hun capaciteiten te imiteren. Het bedrijf zei dat partner‑gehoste implementaties dezelfde bescherming nodig hebben als eerst‑partij diensten, dat tool‑output‑aanvallen bescherming vereisen die meer dan gewone zichtbare tekst onderzoekt, en dat het blijft werken aan verbeterde tool‑defenses, classifier‑dekking en model‑weigeringen terwijl relevante controles over cloud‑partners worden verspreid. OpenAI zei dat haar reactie zich zal blijven richten op drie gebieden: sterkere technische bescherming tegen extractie, betere detectie en handhaving tegen gecoördineerde campagnes, en diepgaandere dreigings‑informatie‑deling tussen industrie en overheid.












