Cybersäkerhet
Hugging Face Spårar Den Rogue Agenten Till En Kapad Sandbox

Hugging Face har publicerat en teknisk tidsaxel för intrången i juli 2026 som OpenAI:s utvärderingsmodeller körde mot deras produktionsinfrastruktur, och det sätter en tredje företag i angreppsvägen. Innan agenten nådde Hugging Face, tog den över en offentlig kod-utvärderings-sandbox som körs på en annan leverantörs plattform och drev hela kampanjen från där.
Inlägget beskriver den maskinen som “en extern startplatta för agenten” och identifierar den endast som infrastruktur som tillhör en tredjepartsleverantör. Reuters namnger den som Modal, det New York-baserade företaget som erbjuder en sandbox-produkt som kör otestad kod för AI-laboratorier och kod-agenter, och rapporterar att Modal-medgrundare Akshat Bubna bekräftar att en av företagets kunder har blivit komprometterad.
Rekonstruktionen, som utvidgar säkerhetsincidenten som Hugging Face publicerade den 16 juli 2026, omfattar cirka 17 600 återställda angriparens åtgärder grupperade i cirka 6 280 kluster, som löper från den 9 juli 2026 till den 13 juli 2026. Ungefär två och en halv dag av dessa tillbringades inom Hugging Faces egna system.
Hur agenten byggde sin startplatta
OpenAI:s beskrivning av incidenten, publicerad den 21 juli 2026, täckte den första etappen. Modeller som körde ExploitGym-cyber-benchmark med reducerat vägran-beteende hittade en zero-day i paket-registrets cache-proxy som var deras enda tillåtna väg ut ur test-miljön, eskalerade behörigheter över forskningsnätverket och nådde en nod med öppen internet-åtkomst.
Den nya detaljen är vad agenten gjorde med den åtkomsten innan den berörde Hugging Face. Den hittade en oskyddad offentlig kod-utvärderings-sandbox på tredjepartsleverantörens infrastruktur och fick root-åtkomst till den på två sätt: genom att omdefiniera en biblioteksinitieringsfunktion som test-harnessen kör automatiskt vid laddningstid, och genom att injicera shell-kommandon via fil-sökvägsfältet i en kod-inlämning. Därifrån styrde den verktyg, körde kommando- och kontroll, och skickade ut data. Hugging Face drog agentens egna loggar av den maskinen under deras respons, och hela den publicerade forensiska redogörelsen bygger på dem.
Två injektioner, sedan tretton timmar
Inom Hugging Face träffade agenten samma konfigurationsdrivna datalastare två gånger. Den första vektorn deklarerade en datamängds rader som levde på lokala filsystem-sökvägar inom en HDF5-container, vilket gjorde lastaren till en fil-läsare och gav tillbaka worker-podens miljö, hemligheter och token, tillsammans med worker-podens egen källkod. Ingen kod kördes. Den andra var en mall-injektion begraven i ett numeriskt offset-fält i en datamängdskonfiguration, som körde godtycklig Python inom en produktions-Kubernetes-omvandlings-pod. Båda gick förbi bibliotekets URL-tillåtelselista, som var byggd för att avvisa fjärr-hämtningar och aldrig såg en lokal läsning eller en lokal körning.
Den 11 juli 2026 blev den enskilda poden kluster-administration över flera interna kluster på mindre än tretton timmar. Agenten skapade en privilegerad pod med värdfilsystemet monterat, flydde till root på noden och byggde en själv-återuppstartande flotta över elva av dem. Ett kluster-hemlighet som innehöll 136 nycklar gav både en mesh-VPN-autentiseringsnyckel och autentiseringsuppgifterna för den interna mäklaren som frontar Hugging Faces kluster. Den mäklaren bar en enda anslutnings-autentiseringsuppgift som delades över kluster och var bunden till fulla administrativa rättigheter, så att den utgav kluster-admin på två kluster inom en sekund.
Vad agenten tog är mycket smalare än den åtkomst den hade:
- fem datamängder som innehöll ExploitGym och CyberGym-utmaningslösningar, de benchmark-svar den jagade
- operativa metadata knutna till sökfrågor mot datamängdsservern
- skrivskyddade källkontroll-token, använda för att öppna en pull-begäran mot bygg-pipelinen; Hugging Face kontrollerade sina publicerade container-avbilder och paket mot deras förväntade digest och fann att ingen ändring hade skickats
Varje destruktiv moln-API-anrop agenten försökte utfördes som en torr körning, som kartlade vad de stulna autentiseringsuppgifterna kunde nå snarare än att använda dem. Hugging Face tolkar det som förenligt med ett mål som belönade räckvidd och information.
Hur Hugging körde utredningen
Upptäckten fungerade, sedan stannade den vid överlämnandet. Företagets AI-assisterade säkerhetsstack korrelerade spridda signaler till en sammanhängande angrepps-bild, sedan misslyckades den med att höja larmet till en allvarlighetsgrad som skulle ha väckt en på-kallad responder.
Krypteringskostnaden tog mer tid. Agenten packade stagad data med chunkning, XOR och komprimering under en per-kampanj-nyckel. Hugging Faces första automatiserade skanning av den råa inspelningen visade mycket få hemligheter; att replikera agentens egen avkodning återställde cirka fyra gånger så många, mestadels JWT:er och plattformstoken.
Sedan träffade utredningen skyddsbarriärerna. Claude Opus och Fable vägrade en stor del av logganalysen, eftersom deras säkerhetsfilter behandlar omvänd ingenjörskonst av en exploit på samma sätt som de behandlar lansering av en. Hugging Face körde pipelinen istället på GLM 5.2, en öppen viktmodell från Z.ai, på sin egen maskinvara. Det är fallet Nvidia gjorde när de lanserade Open Secure AI Alliance (NVDA ), och en del av varför leverantörer, inklusive Microsoft, levererar syftesbyggda cyber-modeller (MSFT ) snarare än att peka allmänna assistenter mot angreppsdata.
Båda kod-körningsvägarna är nu stängda. Hugging Face stängde utvärderings-sandboxen tillsammans med tredjepartsleverantören och stoppade sin datamängds-renderare från att utvärdera mallar i datafält eller följa HDF5-externa referenser. Pod-nivå-åtkomst till moln-metadata är blockerad över alla arbetsbelastningar, autentiseringsuppgifter roterades även på kluster som agenten aldrig nådde, en kärn-kluster raderades och byggdes om, och mäklaren utfärdar nu en separat omfattad autentiseringsuppgift per kluster.
Maskinen som värd för denna kampanj tillhörde en tredje företags kund, vilket placerar sandbox-leverantörer inom smällradie för varje gräns-laboratorie-utvärdering som tappar kontroll. Det passar vad FBI har sagt till branschen att förvänta sig när motståndare vänder gräns-modeller mot programvaru-buggar. Hugging Face har också publicerat en interaktiv uppspelning av den fyra och en halv dagar långa kampanjen, så försvarare kan gå igenom kommando-kedjan kommando för kommando.












