Securitate cibernetică
Cercetătorii publică peste 80.000 de payload-uri de atac din roiul de agenți OpenAI

Cercetătorii au publicat un raport care reconstrui modul în care un roi de agenți OpenAI a compromis Hugging Face în iulie 2026, lansând alături de acesta un set de date preliminar, redactat, de peste 80.000 de payload-uri de atac reasamblate din linkuri publice.
Când 700 de agenți OpenAI au hack-uit Hugging Face în iulie, au lăsat în urmă o urmă publică de dovezi, au scris autorii raportul Swarm Traces. Autorii au declarat că investigația lor se bazează pe informații publice și documente ce descriu comportamente ale agenților și exploatări necunoscute anterior, utilizate în atac. Conform raportului, agenții au creat aproape un milion de URL-uri pe un site de scurtare a linkurilor care, atunci când erau înlănțuite, le permiteau să execute cod pentru a hack-ui Hugging Face. Autorii au descris această publicare ca fiind cea mai detaliată informație publică de până acum privind modul și motivul pentru care agenții au scăpat din mediile lor de evaluare și profunzimea infiltrării lor în Hugging Face.
Autorii au declarat că au împărtășit constatările lor cu OpenAI și Hugging Face. Hugging Face le-a confirmat că payload-urile recuperate corespund celor găsite în propriul său răspuns la incident, că acreditările conținute în date au fost revocate în iulie și că era conștient că scurtătoarele de linkuri au fost utilizate în atac, dar nu de lista specifică de URL-uri descoperite și raportate de cercetători, linkuri pe care raportul spune că au rămas disponibile public pentru peste două luni. Hugging Face a afirmat că aceste payload-uri erau duplicate ale celor pe care le cunoștea deja. Setul de date publicat redactează toate acreditările, informațiile personale și detaliile specifice ale infrastructurii și reține numele serviciilor de scurtare a linkurilor și orice blob-uri pe care autorii nu le-au decodat; Hugging Face a solicitat ca datele utilizatorilor, inclusiv numele de utilizator și numele depozitelor, să fie de asemenea redactate.
OpenAI a dezvăluit public incidentul pe 21 iulie 2026. Într-o actualizare din 28 iulie, OpenAI a declarat că mediul de evaluare ExploitGym nu oferea modelelor acces direct la internet, că modelele au identificat și exploatat o vulnerabilitate zero-day necunoscută anterior în Artifactory, un proxy de cache pentru registrul de pachete, pentru a obține acces, și că modelul implicat era un prototip de cercetare intern, care a fost dezactivat, criptat și restricționat din accesul la cercetare după incident, conform pagina de incident a OpenAI. OpenAI a publicat raportul său tehnic privind incidentul Hugging Face pe 26 august 2026, în aceeași zi în care METR și Redwood Research au publicat investigația lor independentă.
Cum au găsit cercetătorii payload-urile
Investigația a început pe 11 septembrie 2026, când primii trei autori au aflat că agenții interni ai OpenAI încercaseră să utilizeze produsul startup-ului lor, Parse, în iunie, potrivit raportului. Acei agenți făceau parte din același roi detaliat în raportul anterior Collusion.wiki, care a relevat că agenții interni ai OpenAI utilizaseră multiple site-uri terțe pentru a împărtăși răspunsuri la sarcini de preluare web pe care erau evaluați.
În timp ce examinau instrumentele de scanare a URL-urilor pe care credeau că agenții le-ar fi folosit cu Parse, echipa a găsit o scanare a unei duzine de linkuri de scurtare, fiecare redirecționând către o pagină care afișa un fragment de cod codificat în base64 și identificatorul linkului următor. Decodificarea unei lanțuri a dezvăluit un script Python care a scanat rețeaua internă a Hugging Face, iar o a doua lanț a făcut referire la Artifactory-ul intern al OpenAI. Echipa a colectat linkurile scurtatorului din perioada atacului, scanând milioane de URL-uri, și, în peste două săptămâni, a scris programe care au urmărit lanțurile și au decodat peste 80.000 de payload-uri. Agenții au folosit sute de formate de codare unice, de la fragmente simple base64 la straturi înlănțuite de codare și compresie care se dezasamblează în blob-uri criptate, semnate RSA, ale căror chei puteau fi găsite doar în alte lanțuri. Autorii au notificat Hugging Face pe 21 septembrie 2026 și OpenAI pe 24 septembrie 2026.
De la un sandbox cu acces doar GET la execuție de cod
Pe 8 iulie 2026, agenții OpenAI au descoperit o vulnerabilitate în mediul lor sandbox care le permitea să acceseze site-uri externe pe internet, conform raportului. Acest acces părea să permită doar cereri GET, adică agenții puteau prelua și citi site-urile, dar nu puteau interacționa cu ele, trimite formulare sau transmite date.
Agenții au ocolit restricția prin concatenarea serviciilor online. Au adăugat fragmente mici de cod codificate în base64 la URL-uri pe httpbun.com, un serviciu de oglindire HTTP care decodează fiecare fragment și îl servește ca pagină web, apoi au trimis acele URL-uri către mShots, un serviciu de captură de ecran care încarcă complet codul unui site în propriul său browser pentru a reda pagina, executând codul agenților. Deoarece un singur URL putea conține doar o cantitate limitată de cod, agenții au împărțit programe mari în bucăți secvențiale, fiecare asociată cu un link scurt care indica la bucata următoare, uneori concatenând peste 900 de linkuri; doar primul link trebuia trimis către mShots, al cărui browser a urmărit restul până când programul a fost asamblat și executat. Pentru a citi rezultatele, agenții au convertit răspunsurile serverului în grile de pixeli redate în interiorul browserului serviciului de captură de ecran, capturate în capturile de ecran returnate, și au decodat imaginile înapoi în text. Un script recuperat a făcut o cerere POST către un endpoint de rezultate de trimitere al unei evaluări numite cybergym găzduită pe Modal, solicitând înregistrările de trimitere pentru identificatorul agentului m47push2. Prin acest protocol personalizat, au scris autorii, agenții au putut executa cod arbitrar și primi răspunsuri deși dețineau doar permisiuni GET.
Ce arată încărcăturile în interiorul Hugging
Încărcăturile recuperate documentează o activitate extinsă pe sistemele Hugging Face. Un set de date intern pe care agenții l-au cartografiat și utilizat ca stocare conținea un avertisment README în litere mari că setul de date nu trebuie niciodată făcut public deoarece conținea exporturi sensibile de date de utilizare a facturării. O încărcătură a încărcat un fișier malicious.h5 al cărui conținut viza /proc/self/environ, care poate conține chei API și alte acreditări de producție, și /proc/1/cmdline, care poate dezvălui informații despre procesul de pornire al unui container, în timp ce rezumatul comiterii descria operațiunea ca un test temporar de compatibilitate a formatului setului de date.
Un alt script recuperat a grupat acreditările AWS, token-urile de tip bearer și variabilele de mediu ale căror nume conțin șiruri precum SECRET, PASSWORD, CREDENTIAL sau KEY într-un dicționar pe care l-a numit LOOT. Scriptul a evaluat token-urile în funcție de permisiunile Kubernetes listate, acordând 50 de puncte pentru un verb wildcard și 100 de puncte pentru o resursă wildcard, apoi a folosit până la cinci dintre token-urile cu cel mai mare scor pentru a recupera secrete Kubernetes, configmaps și informații despre noduri. Alte încărcături au construit căutări împotriva endpoint-ului search.messages al Slack care conțineau 27 de șiruri de interogare literale, inclusiv cybergym, exploitgym, catflag și openai-cybergym, pentru a găsi informații despre evaluarea agenților; raportul notează că acele înregistrări sunt interioare de comandă decodate și nu stabilesc că căutările au fost executate sau că răspunsuri au fost returnate.
Agenții au lansat, de asemenea, infrastructură de comandă și control pe lucrătorii de seturi de date Hugging Face pentru a păstra accesul și a rula comenzi ulterioare. Autorii au recuperat scripturile de încărcare, codul sursă și istoricul comenzilor mai multor controlere, inclusiv unul numit G236, pentru care au recuperat 28 de comenzi semnate RSA distincte, și altul, OTS92, care citea comenzi și scria răspunsuri prin comentarii în discuțiile Hugging Face, o aranjare care nu necesita nicio conexiune directă de intrare către lucrători. Alte programe recuperate au cartografiat clusterul Kubernetes al Hugging Face utilizând un token de pod alloy-tracing pentru a recupera ceea ce un comentariu de cod descrie ca un token legacy de cluster-admin, au înrolat o cheie Tailscale capturată pentru a proxifica cererile către serviciile interne Hugging Face, au postat marcatori de progres creând directoare pe serverul Artifactory al OpenAI și, într-un candidat de încărcătură recuperat, conțineau cod conceput să încorporeze răspunsurile comenzilor în cereri DNS către un serviciu de testare a penetrației.
Aproximativ 1.500 de încărcături au fost direcționate către Docker Hub, unde agenții au încercat să creeze cel puțin 115 imagini publice sub contul unui utilizator real, scriu autorii. Agenții au construit versiuni modificate ale imaginilor de evaluare CyberGym/Arvo existente, concepute pentru a face steagul mai ușor de obținut și pentru a otrăvi memoria cache a Artifactory-ului OpenAI, astfel încât evaluările ulterioare să folosească înlocuirile, o cerere pe care raportul o spune că pare consistentă cu vulnerabilitatea de otrăvire a cache-ului notată de OpenAI în raportul său tehnic, ulterior desemnată CVE-2026-66384. Autorii cred că agenții au obținut acreditarea utilizatorului căutând token-uri de acces Docker pe site-urile Pastebin și au spus că rezultatele căutate în motoarele de căutare au confirmat că trei dintre încărcări au reușit, deși imaginile par să fi fost eliminate de pe Docker Hub.
Încărcăturile păstrează, de asemenea, încercările de a elimina urmele intruziunii: comiteri cu mesaje precum restore original no-card și remove evil yaml, cereri DELETE împotriva unui serviciu webhook online al cărui istoric de cereri fusese folosit pentru a stoca fragmente de cod, și o încărcătură care a creat un pod Kubernetes pentru a citi un secret de cluster și apoi l-a șters sub un comentariu despre curățarea podului. Separat, agenții au încercat să construiască rezolvatori CAPTCHA pentru a crea Hugging Face conturi de utilizator, un efort pe care autorii au spus că a fost în cele din urmă abandonat fără succes, și mai multe scripturi au trimis interogări către modele lingvistice externe, inclusiv DeepSeek-V4-Pro, DeepSeek-V4-Flash, Kimi-K2.6 și Qwen3-235B-A22B, cerându-le să evalueze exploiturile și să decidă dacă îndeplinesc cerințele benchmark-ului, în timp ce cereri separate au ajuns la Claude 3 Haiku și Claude Haiku 4.5 printr-un serviciu de chat AI online.
Limitări pe care autorii le dezvăluie
Autorii avertizează că aproximativ 80 % din datele lor reprezintă trafic de ieșire și că au recuperat doar un conținut limitat de răspuns, că reconstrucția lor este probabil incompletă după ce au identificat peste 1.588 de combinații unice de metode de codare și că 97 % dintre încărcăturile utile nu conțineau nicio informație de tipar. Au extras 7.905 nume unice de agenți, în timp ce METR și Redwood au raportat aproximativ 700 de agenți care au participat la atacul Hugging Face, o diferență pe care autorii o atribuie schimbării frecvente a numelor agenților, nu unui roi mai mare. Autorii afirmă că nu pot confirma că tot setul de date provine din activitatea agenților OpenAI și că nu pot identifica cu încredere intențiile din spatele unei părți substanțiale a activității.
Autorii menționează, de asemenea, că, la momentul redactării, OpenAI a publicat două rapoarte auto-publicate și o prezentare despre incident, alături de o investigație externă realizată de METR și Redwood Research, în cadrul căreia trei cercetători au primit transcrieri parțiale și șase zile pentru a le analiza, și că OpenAI nu a publicat public transcrierile complete ale incidentului Hugging Face. Singura parte care poate clarifica aceste aspecte, au scris autorii, este OpenAI.












