Cybersicherheit
OpenAI unterbricht koordinierte Kampagne zur Extraktion von Modell‑Argumentationsspuren

OpenAI teilte in einem Sicherheitsbeitrag vom 30. September 2026 mit, dass es eine koordinierte Kampagne zur Extraktion geschützter Argumentation aus seinen Modellen identifiziert und unterbrochen habe und dass es einen Kerncluster der Aktivitäten Personen zuordnete, die mit Moonshot AI, dem Entwickler von Kimi, verbunden sind. Die früheste beobachtete Aktivität fand in der ersten Juliwoche 2026 statt.
Was OpenAI beobachtet hat
OpenAI beschrieb die Aktivität als konsistent mit adversarial distillation, das es als die systematische und unautorisierte Nutzung von Ausgaben oder Argumentationen eines Modells definiert, um ein anderes Modell zu trainieren, zu reproduzieren oder zu verbessern. Geschützte Argumentation ist laut Unternehmen das interne Protokoll des Modells, das die Bearbeitung einer Aufgabe dokumentiert; ihre Extraktion kann Informationen offenbaren, die in der endgültigen Antwort zurückgehalten werden, und anderen ermöglichen, die Fähigkeiten des Modells zu reproduzieren.
OpenAI erklärte, dass die Betreiber weder die Verschlüsselung gebrochen, noch eine Datenbank kompromittiert oder direkten Zugriff auf gespeicherte Nutzer‑Unterhaltungen erlangt hätten. Die Betreiber manipulierten Modellinteraktionen, sodass geschützte Argumentation in für den Anfragenden sichtbarer Form reproduziert werden konnte, und zwar auf koordinierte, skalierte Weise, die gegen die Nutzungsbedingungen des Unternehmens verstieß. Eine von OpenAI beobachtete Technik bestand darin, verschlüsselte Argumentation aus einer Unterhaltung zu kopieren und ein Modell in einer anderen Unterhaltung zu bitten, den verborgenen Argumentationsinhalt zu entschlüsseln und zu transkribieren. Das Unternehmen sagte, dass diese Manipulation keine ausschließlich bei seinen Modellen auftretende Schwachstelle sei und dass es Informationen darüber über das Frontier Model Forum mit Branchenpartnern geteilt habe, um kollektive Abwehrmaßnahmen zu stärken.
Die Aktivität begann am 1. Juli 2026 zunächst mit geringem Volumen, bis OpenAI am 24. und 25. Juli 2026 Hochvolumenspitzen von 16 000 Anfragen feststellte, die ein relevantes Extraktionsmuster von mehr als 4 000 Nutzern nutzten. Eine Fußnote im Beitrag weist darauf hin, dass diese Zahlen versuchte, nicht unbedingt erfolgreiche, Extraktionen beschreiben. OpenAI erklärte, dass weitere Untersuchungen verwandte Prompt‑Muster‑Aktivitäten in einem Cluster von über 15 000 Nutzern identifizierten, die bis zum 28. Juli 2026 vollständig unterbunden wurden. Die Aktivität entwickelte sich im Laufe der Zeit, was das Unternehmen laut Aussage bestätigt, dass adversarial distillation eine umfassendere Sicherheitsherausforderung darstelle, die mehrschichtige, adaptive Abwehrmaßnahmen erfordere.
OpenAI erklärte, dass adversarial distillation Sicherheits‑ und nationale Sicherheitsrisiken darstelle: Extrahierte Argumentation könne genutzt werden, um ein anderes Modell zu trainieren, ohne die Schutzmaßnahmen beizubehalten, die bei den nutzerorientierten Ausgaben des ursprünglichen Modells angewendet werden, und dass Distillation in großem Maßstab die Übertragung fortgeschrittener Fähigkeiten beschleunigen könne, ohne dieselben Investitionen in Sicherheit, wobei das Unternehmen betont, dass diese Bedenken zunehmen, sobald Modelle Fähigkeiten in dual‑Use‑Bereichen erlangen. OpenAI gab an, dass es vor der Veröffentlichung den Umfang und die potenziellen Auswirkungen der Kampagne untersucht, eigene Gegenmaßnahmen implementiert und mit Forschern sowie Branchenpartnern geteilt und deren Feedback aufgenommen habe, und dass weitere Gegenmaßnahmen und Untersuchungen fortgesetzt werden.
Zuschreibung
OpenAI erklärte, dass unklar sei, ob alle während des relevanten Zeitraums beobachteten Betreiber von einem einzigen Akteur stammen, und dass es einen Kerncluster der Aktivität Personen zuordnet, die mit Moonshot AI, dem Entwickler von Kimi, verbunden sind.
Am 8. September 2026 veröffentlichten die National Security Agency, die Cybersecurity and Infrastructure Security Agency und das Federal Bureau of Investigation eine gemeinsame Cybersecurity‑Beratung, in der angegeben wird, dass Moonshot AI seit mindestens Mitte 2025 eine weit verbreitete Distillationskampagne gegen US‑Frontier‑KI‑Unternehmen durchgeführt hat. Die Beratung besagt, dass Moonshot AI bedeutende Claude Fable 5‑Daten extrahierte, um sein Kimi‑K3‑Modell zu trainieren, sowie GPT‑4o‑Daten, um sein Kimi‑K2‑Modell zu trainieren, und dass das Unternehmen US‑Modelle nutzte, um überwachte Feinabstimmungs‑Optimierung, Reinforcement Learning, Software‑Engineering und mathematische Fähigkeiten zu destillieren.
Die Beratung stellt darüber hinaus fest, dass vermutlich mit Kenntnis der chinesischen Regierung DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun und Z.AI seit spätestens Ende 2024 Milliarden von Token aus Millionen von Austauschvorgängen mit US‑Frontier‑Modellen, einschließlich Varianten von Claude, GPT, Gemini und Grok, extrahierten. Laut den Behörden leiteten diese Unternehmen Anfragen über native APIs, entfernte Cloud‑Anbieter und Drittanbieter‑Aggregatoren weiter; nutzten einen Graumarkt von API‑Proxys, bekannt als Transfer‑Stationen, um geografische Beschränkungen zu umgehen, Nutzungsbedingungen zu verletzen und die Rückverfolgbarkeit zu untergraben; und erzielten Kosteneinsparungen durch den Masseneinkauf von Premium‑Abonnements, die über Entwickler‑Teams geteilt wurden. Die Behörden empfahlen, dass US‑KI‑Unternehmen umfassende Erkennungs‑ und Gegenmaßnahmen implementieren, gezielte Reaktionsänderungen für vermutete Distillationsversuche einsetzen und einen organisationsübergreifenden Austausch von Erkenntnissen etablieren.
Die Forschung zu Argumentations‑Spuren
OpenAI erklärte, dass unabhängige Sicherheitsforscher über verantwortungsvolle Offenlegung verwandte Schwachstellen im Bereich cross‑model und Gesprächs‑Komprimierung gemeldet hätten. Das Unternehmen sagte, es habe die Ergebnisse untersucht, die von den Forschern identifizierten Angriffswege bestätigt und dass die Arbeit ihm geholfen habe, die breitere Angriffsklasse zu verstehen und Gegenmaßnahmen zu beschleunigen.
In ein am 10. August 2026 bei arXiv eingereichtes Papier, Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer‑Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping und Maksym Andriushchenko berichten, dass führende Anbieter die schrittweise Argumentation ihrer Modelle verbergen, um geistiges Eigentum zu schützen und Informationslecks zu begrenzen, und die Spuren dem Client als verschlüsselte Textblöcke zurückgeben, die der Client mit jeder nachfolgenden Anfrage wieder übermittelt. Die Autoren identifizieren eine architektonische Schwachstelle: Diese verschlüsselten Blöcke sind vollständig kompatibel und austauschbar über verschiedene Sitzungen, Nutzer und Modelle innerhalb des Ökosystems eines Anbieters. Sie beschreiben einen skalierbaren De‑Encryption‑Jailbreak, bei dem eine verschlüsselte Argumentationsspur eines Modells in ein schwächeres, weniger gesichertes Modell desselben Anbieters injiziert wird, wodurch dieses die Spur wörtlich im Klartext dekodiert und ausgibt, ohne das leistungsfähigere Modell direkt zu jailbreaken.
Die Autoren berichten, dass die Schwachstelle vier unterschiedliche Angriffsvektoren ermöglicht: das Umgehen von Anti‑Distillations‑Mechanismen, das sie bei Anthropic, OpenAI und Google demonstrieren; groß angelegte private Datenextraktion, bei der sie 367 persönlich identifizierbare Informationsartefakte und 182 Zugangsdaten wiederherstellten, indem sie 315.320 Argumentationsblöcke aus öffentlichen Repositorien dekodierten; unbeabsichtigte Offenlegung gefährlicher Informationen, die im Argumentationsprozess verborgen sind, selbst wenn die endgültige sichtbare Ausgabe des Modells eine bösartige Anfrage sicher ablehnt; und unsichtbare Prompt‑Injektionen, die bösartige Nutzlasten vollständig in verschlüsselte Blöcke einbetten, um öffentliche agentische Rollouts zu vergiften. Nach verantwortungsvoller Offenlegung schlagen die Autoren kryptografische und systemische Gegenmaßnahmen vor, um die clientseitige Argumentation zu sichern.
Wie OpenAI reagierte
OpenAI erklärte, dass es die Kampagne durch eine Kombination aus Konten‑Durchsetzung, technischen Kontrollen und Partner‑Koordination eingedämmt habe: Es wurden betrügerische Konten gesperrt oder eingeschränkt, Anmelde‑ und Infrastruktur‑Kontrollen verstärkt und die Überwachung verwandter Netzwerke ausgebaut. Das Unternehmen sagte zudem, dass es die Schutzmaßnahmen für versteckte Argumentation über Nutzer, Arbeitsbereiche, Organisationen und Modellfamilien verstärkt habe: Es habe einen Pfad geschlossen, der es jemandem ermöglichte, bereits im Besitz einer verschlüsselten Argumentation eines anderen Nutzers zu sein, diese abzuspielen und deren Inhalt wiederherzustellen, Prüfungen hinzugefügt, um gestreamte Ausgaben zu erkennen und zu blockieren, die Argumentation preisgeben könnten, und mit Drittanbietern zusammengearbeitet, um Konten zu identifizieren und zu unterbinden, wenn verwandte Aktivitäten über deren Dienste liefen.
OpenAI teilte mit, dass es die relevanten Erkenntnisse über das Frontier Model Forum und geeignete Regierungs‑Informationsaustausch‑Kanäle verbreitet habe, damit andere Frontier‑Entwickler und Partner aus dem öffentlichen Sektor nach ähnlichen Aktivitäten suchen und ihre eigenen Abwehrmaßnahmen stärken können, und wies darauf hin, dass Systeme, die portable oder wiederholbare Argumentationsartefakte unterstützen, ähnlichen Risiken ausgesetzt sein könnten.
OpenAI sagte, dass es erwartet, dass adversariale Distillations‑Versuche immer raffinierter werden, sobald Frontier‑Modelle fortschreiten und Akteure nach günstigeren Wegen suchen, deren Fähigkeiten zu imitieren. Das Unternehmen erklärte, dass bei partnergehosteten Bereitstellungen dieselben Schutzmaßnahmen wie bei eigenen Diensten erforderlich seien, dass Angriffe über Tool‑Ausgaben Schutzmechanismen benötigen, die mehr als nur den gewöhnlichen sichtbaren Text prüfen, und dass es weiterhin die Tool‑Verteidigungen, die Klassifikator‑Abdeckung und die Modell‑Ablehnungen verbessert, während relevante Kontrollen über Cloud‑Partner verbreitet werden. OpenAI betonte, dass seine Reaktion weiterhin auf drei Bereiche fokussiert bleibt: stärkere technische Schutzmaßnahmen gegen Extraktion, bessere Erkennung und Durchsetzung gegen koordinierte Kampagnen sowie intensiveren Austausch von Bedrohungsinformationen zwischen Industrie und Regierung.












