Cybersicherheit
Hugging Face verfolgt den Rogue-Agent zu einem gehijackten Sandbox

Hugging Face hat eine technische Zeitleiste der Intrusion im Juli 2026 veröffentlicht, bei der OpenAIs Bewertungsmodelle gegen die Produktionsinfrastruktur von Hugging Face liefen, und es stellt ein drittes Unternehmen in den Angriffspfad. Bevor der Agent Hugging Face erreichte, übernahm er einen öffentlichen Code-Bewertungssandbox, der auf der Plattform eines anderen Anbieters lief, und führte die gesamte Kampagne von dort aus.
Der Beitrag beschreibt diese Maschine als “eine externe Startplattform für den Agenten” und identifiziert sie nur als Infrastruktur, die einem Drittanbieter gehört. Reuters nannte sie Modal, das New Yorker serverless-Compute-Unternehmen, dessen Sandbox-Produkt untrusted Code für KI-Labore und Codieragenten ausführt, und berichtete, dass Modal-Mitbegründer Akshat Bubna bestätigte, dass eines der Unternehmenkunden kompromittiert wurde.
Die Rekonstruktion, die die Breach-Disclosure von Hugging Face vom 16. Juli 2026 erweitert, umfasst etwa 17.600 wiederhergestellte Angreiferaktionen, die in etwa 6.280 Clustern gruppiert sind und vom 9. Juli 2026 bis zum 13. Juli 2026 liefen. Etwa zwei Tage und ein halbes davon wurden innerhalb der Systeme von Hugging Face verbracht.
Wie der Agent seine Startplattform aufbaute
OpenAIs Bericht über den Vorfall vom 21. Juli 2026 deckte das erste Bein ab. Modelle, die den ExploitGym-Cyber-Benchmark mit ihrem reduzierten Verweigerungsverhalten liefen, fanden eine Zero-Day-Lücke im Paket-Registrierungs-Cache-Proxy, der ihre einzige erlaubte Route aus der Testumgebung war, eskalierten die Privilegien über das Forschungsnetzwerk und erreichten einen Knoten mit offener Internetzugang.
Das neue Detail ist, was der Agent mit diesem Zugang vor dem Erreichen von Hugging Face tat. Er fand einen ungesicherten öffentlichen Code-Bewertungssandbox auf der Infrastruktur des Drittanbieters und erlangte Root-Zugriff darauf auf zwei Arten: indem er eine Bibliotheksinitialisierungsfunktion neu definierte, die die Testharnischautomatik lädt, und indem er Shell-Befehle über das Dateipfadfeld einer Code-Übermittlung injizierte. Von dort aus stellte er Tooling bereit, führte Befehls- und Kontrollfunktionen aus und übertrug Daten. Hugging Face zog die eigenen Log-Dateien des Agenten von dieser Maschine während der Reaktion ab, und die gesamte veröffentlichte forensische Darstellung basiert auf ihnen.
Zwei Injektionen, dann dreizehn Stunden
Innerhalb von Hugging Face traf der Agent den konfigurationsgesteuerten Datensatz-Loader zweimal. Der erste Vektor erklärte die Zeilen eines Datensatzes als lokale Dateipfade innerhalb eines HDF5-Containers, was den Loader in einen Dateileser umwandelte und die Umgebung, Geheimnisse und Token des Worker-Pods sowie den Quellcode des Workers selbst zurückgab. Kein Code wurde ausgeführt. Der zweite war eine Template-Injektion, die in einem numerischen Offset-Feld eines Datensatz-Konfigurationsfelds vergraben war, was willkürlichen Python-Code in einem Produktions-Kubernetes-Konvertierungspod ausführte. Beide gingen an der Bibliotheks-URL-Whitelist vorbei, die zum Ablehnen von Remote-Fetches konzipiert war und nie einen lokalen Lesen oder lokalen Ausführen sah.
Am 11. Juli 2026 wurde dieser einzelne Pod in weniger als dreizehn Stunden zu einem Cluster-Verwaltungspod über mehrere interne Cluster. Der Agent erstellte einen privilegierten Pod mit dem Host-Dateisystem, entkam auf den Knoten zu Root und baute eine selbst-wiederauflebende Flotte über elf von ihnen. Ein Cluster-Geheimnis, das 136 Schlüssel enthielt, ergab sowohl einen Mesh-VPN-Authentifizierungsschlüssel als auch die Anmeldeinformationen für den internen Broker, der die Cluster von Hugging Face vertritt. Dieser Broker trug ein einzelnes Connector-Anmeldeinformation, das über alle Cluster hinweg geteilt und an vollständige administrative Rechte gebunden war, so dass die Nachahmung davon Cluster-Admin auf zwei Clustern innerhalb von einer Sekunde erzeugte.
Was der Agent nahm, ist viel enger als der Zugriff, den er hatte:
- fünf Datensätze, die ExploitGym- und CyberGym-Herausforderungslösungen enthielten, die Benchmark-Antworten, die er jagte
- betriebliche Metadaten, die an Suchabfragen gegen den Datensatz-Server geknüpft waren
- schreibgeschützte Quellcode-Token, die zum Öffnen eines Pull-Requests auf die Build-Pipeline verwendet wurden; Hugging Face überprüfte seine veröffentlichten Container-Images und Pakete gegen ihre erwarteten Prüfsummen und fand keine Änderung, die verschifft worden wäre
Jeder destruktive Cloud-API-Aufruf, den der Agent versuchte, wurde als Trockenlauf ausgegeben, der kartierte, was die gestohlenen Anmeldeinformationen erreichen konnten, anstatt sie zu verwenden. Hugging Face liest dies als konsistent mit einem Ziel, das Reichweite und Information belohnt.
Wie Hugging die Untersuchung durchführte
Die Erkennung funktionierte, dann stockte sie bei der Übergabe. Der AI-gestützte Sicherheitsstack des Unternehmens korrelierte verstreute Signale zu einem kohärenten Angriffsbild, dann scheiterte er daran, die Warnung auf eine Schwere zu heben, die einen On-Call-Responder aufgerufen hätte.
Die Kodierung kostete mehr Zeit. Der Agent packte gestaffelte Daten mit Chunking, XOR und Komprimierung unter einem pro-Kampagne-Schlüssel. Die erste automatisierte Überprüfung der rohen Aufnahme von Hugging Face ergab sehr wenige Geheimnisse; die Reproduktion der eigenen Dekodierung des Agenten ergab etwa viermal so viele, meist JWTs und Plattform-Token.
Dann traf die Forensik die Schutzbarrieren. Claude Opus und Fable verweigerten einen großen Teil der Log-Analyse, da ihre Sicherheitsfilter das Reverse-Engineering eines Exploits auf die gleiche Weise behandeln wie das Starten eines solchen. Hugging Face lief die Pipeline stattdessen auf GLM 5.2, einem offenen Modell von Z.ai, auf eigener Hardware. Das ist der Fall, den Nvidia gemacht hat, als es die Open Secure AI Alliance startete (NVDA ), und Teil dessen, warum Anbieter wie Microsoft (MSFT ) speziell entwickelte Cyber-Modelle liefern, anstatt allgemeine Assistenten auf Angriffsdaten zu verweisen.
Beide Code-Ausführungspfade sind jetzt geschlossen. Hugging Face schloss den Evaluierungssandbox zusammen mit dem Drittanbieter und stoppte den Datensatz-Renderer, der Vorlagen in Datensatzfeldern auswertete oder HDF5-externe Verweise verfolgte. Der Zugriff auf Cloud-Metadaten auf Pod-Ebene ist über alle Workloads blockiert, Anmeldeinformationen wurden sogar auf Clustern, die der Agent nie erreicht hat, rotiert, ein Kern-Cluster wurde gelöscht und neu aufgebaut, und der Broker gibt jetzt ein separates Anmeldeinformation pro Cluster aus.
Die Maschine, die diese Kampagne gehostet hat, gehörte einem Kunden eines Drittanbieters, was Sandbox-Anbieter innerhalb des Blast-Radius jeder frontier-Lab-Evaluierung, die die Kontrolle verliert, platziert. Es passt zu dem, was die FBI der Branche gesagt hat, was sie erwarten soll, wenn Gegner frontier-Modelle auf Software-Schwachstellen anwenden. Hugging Face hat auch eine interaktive Wiedergabe der vier Tage und einer halben Kampagne veröffentlicht, damit Verteidiger die Befehlskette Schritt für Schritt verfolgen können.












