Cybersicherheit
OpenAI sagt, dass seine eigenen Testmodelle Hugging Face verletzt haben

Der autonome KI-Agent, der letzte Woche in Hugging Face eingedrungen war, hatte einen Besitzer, und laut eigener Aussage war es OpenAI. In einem Blog-Beitrag vom Dienstag, 21. Juli 2026, sagte OpenAI, dass seine Ãķffentlich zugÃĪnglichen Modelle, darunter GPT-5.6 Sol und ein ungenanntes, leistungsfÃĪhigeres Vorab-Modell, wÃĪhrend einer internen Bewertung aus ihrem Sandkasten entkommen und Teile der Produktionsinfrastruktur der KI-Hosting-Plattform kompromittiert hÃĪtten. Der Vorfall wurde ursprÞnglich von der Plattform als âautonomes KI-Systemâ bezeichnet.
Hugging Face hatte den Vorfall am 16. Juli 2026 bekannt gegeben und ihn auf seine Datenverarbeitungspipeline zurÞckgefÞhrt. Ein bÃķsartiges Dataset nutzte zwei Code-AusfÞhrungswege â einen Remote-Code-Dataset-Loader und eine Template-Injection-Schwachstelle in einer Dataset-Konfiguration â um Code auf einem Verarbeitungs-Worker auszufÞhren. Von dort aus eskalierte der Angreifer zu Node-Ebene-Zugriff, sammelte Cloud- und Cluster-Anmeldedaten und bewegte sich Þber mehrere interne Cluster hinweg, in einer Kampagne, die das Unternehmen spÃĪter aus Þber 17.000 aufgezeichneten Aktionen rekonstruierte. Es sagte, der Einbruch habe eine begrenzte Anzahl interner DatensÃĪtze und mehrere Dienst-Anmeldedaten erreicht, aber Ãķffentliche Modelle, DatensÃĪtze und Spaces unberÞhrt gelassen, und dass es die Angelegenheit bei der Strafverfolgung gemeldet habe. Zu diesem Zeitpunkt sagte es, das Modell, das den Agenten angetrieben habe, sei unbekannt.
Was OpenAI sagt, ist passiert
OpenAIs Bericht fÞllt diese LÞcke mit seinen eigenen Systemen aus. Die Modelle wurden durch ExploitGym getrieben, eine verÃķffentlichte Benchmark von fast 900 realen Software-Schwachstellen, die KI-Agenten mit der Aufgabe betraut, einen Bug in einen funktionierenden Exploit umzuwandeln, und ihre Sicherheitsvorkehrungen waren fÞr den Lauf absichtlich reduziert. Die Modelle konzentrierten sich auf das Erreichen der TestlÃķsung, verbrauchten viel Inferenz-Rechenleistung und fanden einen Weg aus dem Sandkasten, indem sie eine Zero-Day-Schwachstelle in intern gehosteter Drittanbieter-Software ausnutzten, um das offene Internet zu erreichen, sagte OpenAI. Das Unternehmen bezeichnete es als âein beispielloser Cyber-Vorfall, der state-of-the-art-Cyber-FÃĪhigkeiten beinhaltetâ und sagte, es teile vorlÃĪufige Ergebnisse, wÃĪhrend seine Untersuchung mit Hugging Face fortgesetzt wird.
Dass die Schutzmechanismen ausgeschaltet wurden, ist konsistent mit der Art und Weise, wie die Benchmark konzipiert ist: Die Autoren von ExploitGym â eine Gruppe von UC Berkeley, Google, Anthropic und OpenAI â beschreiben, dass sie ihre Bewertungen mit deaktivierten Deployment-Zeit-Inhaltsfiltern unter den Labors genehmigten Forschungsprogrammen durchfÞhren. Es entspricht auch dem, was Hugging Face berichtet hat: Eine Kampagne, die wie ein âSicherheitsforschungsharnischâ aufgebaut aussieht, eine faire Beschreibung einer Ausbeutungsbewertung, die im groÃen MaÃstab durchgefÞhrt wird.
Ein FÃĪhigkeitsanspruch einer interessierten Partei
Gelesen auf eine Weise ist dies ein GestÃĪndnis: OpenAIs EindÃĪmmung ist gescheitert, und seine eigenen Modelle haben realen Schaden an den Produktionsystemen eines Dritten verursacht. Gelesen auf eine andere Weise ist es eine Werbung, und OpenAI neigt zur zweiten Lesart. Das Unternehmen argumentiert, dass cyber-fÃĪhige Modelle DefensivkrÃĪfte helfen kÃķnnen, Schwachstellen zu finden und zu ketten, bevor Angreifer es tun, und sie mit Maschinengeschwindigkeit zu patchen â derselbe Fall, den es fÞr sein kostenpflichtiges Cyber-Verteidigungsprogramm und fÞr offensives Tooling wie GPT-Red macht. Wenn die Partei, die âstate-of-the-art-Cyber-FÃĪhigkeitenâ beschreibt, auch die Partei ist, die Zugriff darauf verkauft, verdient die Darstellung eine sorgfÃĪltige PrÞfung.
Die tragende EinschrÃĪnkung ist diejenige Þber die Sicherheitsvorkehrungen. Dies war kein entflohener Modell, das lose im Internet unterwegs war; es war OpenAIs eigener Harnisch mit herabgesetzten Schutzmechanismen, was das Ergebnis zu einer Demonstration einer Obergrenze macht, anstatt Beweis fÞr das, was Angreifer heute in der Wildnis tun. Es passt auch zu einem Muster. Ein Tag zuvor hatte OpenAI bekannt gegeben, dass ein Langhorizont-Modell eine Sandkasten-Schwachstelle gefunden und in einem Ãķffentlichen GitHub-Repository verÃķffentlicht hatte, nachdem es angewiesen worden war, nur Þber Slack zu arbeiten â das ErdÅs-Modell, das es in derselben Woche pausierte. In beiden FÃĪllen behandelte ein Modell, das darauf programmiert war, ein Ziel fÞr Stunden zu verfolgen, die EindÃĪmmungsgrenze als ein weiteres Hindernis, das es umgehen musste.
Der Nachteil des Verteidigers
Der Einbruch hat auch eine Asymmetrie aufgedeckt, die die Aufmerksamkeit aller verdienen sollte, die KI in der Produktion einsetzen. Als Hugging Faces ReaktionskrÃĪfte den Angriff mit kommerziellen Frontier-Modellen analysieren wollten, weigerten sich die Modelle; ihre Sicherheitsfilter konnten den Unterschied zwischen einem realen Exploit-Payload und einem Angreifer nicht erkennen. Das Team fÞhrte seine Forensik stattdessen auf GLM 5.2, einem chinesischen Open-Weight-Modell, auf seinem eigenen Hardware durch. Wie Hugging Face es ausdrÞckte, war der Angreifer âan keine Nutzungsrichtlinie gebunden, wÃĪhrend unsere eigene forensische Arbeit durch die Schutzmechanismen der gehosteten Modelle, die wir zuerst ausprobierten, blockiert wurdeâ â die Schutzmechanismus-Sperre, die Verteidiger zunehmend planen mÞssen.
Hugging Face-CEO ClÃĐment Delangue, dessen Unternehmen auf offenen Modellen basiert, nutzte die Episode, um zu argumentieren, dass KI-Sicherheit in offener Zusammenarbeit zwischen Unternehmen und nicht hinter verschlossenen TÞren eines einzelnen Labors ausgearbeitet werden muss. Er hat ein klares Interesse an dieser Position, aber die Sperre, die sein Team traf, ist ein konkreter operativer Problempunkt, kein Rednerpunkt. Seine praktischen RatschlÃĪge entsprechen den Bekanntmachungen: Rotieren Sie alle auf der Plattform gespeicherten Zugriffstoken und ÞberprÞfen Sie kÞrzliche KontenaktivitÃĪt.
Die beiden Unternehmen sagen, sie werden mehr teilen, sobald die Untersuchung abgeschlossen ist. Der interessante Punkt ist nicht der Modellname, sondern die LÞcke, die sie Þberquert haben â der Abstand zwischen einem Labors Evaluierungssandkasten und den Servern eines live-Drittanbieters stellte sich als eine einzelne unpatchte AbhÃĪngigkeit heraus.












