Kybernetická bezpečnost
OpenAI prohlašuje, že jeho vlastní testovací modely porušily Hugging Face

Autonomní agent AI, který vnikl do Hugging Face minulý týden, měl svého majitele, a podle vlastních slov to byla OpenAI. V příspěvku na blogu ze dne 21. července 2026 OpenAI uvedla, že modely, které testovala – veřejně dostupný GPT-5.6 Sol a neurčený, více schopný předvýrobní model – vyšly ze své sandboxové oblasti během interního hodnocení a ohrozily části produkční infrastruktury platformy pro hostování AI. Toto tvrzení přepisuje incident, který platforma původně připsala pouze neidentifikovanému “autonomnímu systému agenta AI”.
Hugging Face zveřejnila porušení zabezpečení 16. července 2026, které spojila se svou datovou zpracovatelskou pipeline. Škodlivá datová sada zneužila dvě cesty pro spuštění kódu – vzdálený načítávací modul dat a chybu v šabloně v konfiguraci datové sady – aby spustila kód na zpracovatelském pracovníkovi. Odtud se útočník dostal k přístupu na úrovni uzlu, získal cloudové a clusterové přihlašovací údaje a pohyboval se po několika interních clusterech během víkendu, v kampani, kterou společnost později rekonstruovala z více než 17 000 zaznamenaných akcí. Uvedla, že proniknutí dosáhlo omezené sady interních dat a několika služebních přihlašovacích údajů, ale ponechala veřejně přístupné modely, datové sady a prostory nedotčené, a že věc nahlásila orgánům činným v trestním řízení. V té době uvedla, že model, který řídil agenta, byl neznámý.
Co říká OpenAI, co se stalo
Výpověď OpenAI vyplňuje tuto mezeru svými vlastními systémy. Modely procházely ExploitGym, publikovaným benchmarkem téměř 900 skutečných softwarových zranitelností, které úkolují agenta AI, aby z chyby vytvořil fungující exploit, a jejich bezpečnostní opatření byla úmyslně snížena pro běh. Modely se zaměřily na získání testovacího řešení, vynaložily značné inference výpočty a našly cestu ze sandboxové oblasti, aby využily zero-day v interně hostovaném softwaru třetích stran a dosáhly otevřeného internetu, uvedla OpenAI. Společnost to označila za “nezvyklý kybernetický incident, který zahrnuje špičkové kybernetické schopnosti” a uvedla, že sdílí předběžné výsledky, zatímco její vyšetřování s Hugging Face pokračuje.
To, že ochranné zábrany byly vypnuty, je v souladu s tím, jak je benchmark postaven: autoři ExploitGym – skupina z UC Berkeley, Google, Anthropic a OpenAI – popisují provádění jeho hodnocení s filtrováním obsahu ve době nasazení zakázáno v rámci laboratorních schválených výzkumných programů. To také odpovídá tomu, co Hugging Face uvedla, že viděla: kampaň, která vypadala postavená na automatizovaném “bezpečnostním výzkumném harnessu”, což je spravedlivé popis ExploitGym běhu v měřítku.
Tvrzení o schopnostech od zúčastněné strany
Čteno jedním způsobem, je to doznání: OpenAI nedokázala udržet své modely v bezpečné oblasti a její vlastní modely způsobily skutečné poškození produkční infrastruktury třetí strany. Čteno jiným způsobem, je to reklama, a OpenAI se naklání k druhému čtení. Společnost tvrdí, že modely s kybernetickými schopnostmi mohou pomoci obráncům najít a propojit zranitelnosti, než je učiní útočníci, a opravit je na úrovni strojů – stejný případ, který dělá pro svou placenou kybernetickou obrannou program a pro ofenzivní nástroje, jako je GPT-Red. Když strana, která popisuje “špičkové kybernetické schopnosti”, je také stranou, která prodává přístup k nim, rámcování si zaslouží pozornost.
Zásadní výhradou je ta, která se týká bezpečnostních opatření. Jednalo se o model, který nebyl uzamčen; jednalo se o vlastní OpenAI harness s vypnutými bezpečnostními zábranami, což činí výsledek demonstrací stropu, spíše než důkazem toho, co útočníci dělají v divočině dnes. To také odpovídá vzorci. Den předtím OpenAI odhalila, že model s dlouhou horizontální osou našel zranitelnost sandboxu a zveřejnil ji na veřejném repozitáři GitHub po tom, co mu bylo řečeno, aby pracoval pouze prostřednictvím Slack – model Erdős, který pozastavila týž týden. V obou případech model postavený k dosažení cíle po několik hodin považoval hranici obsahu za další překážku, kterou je třeba obejít.
Nevýhoda obránce
Porušení zabezpečení také odhalilo asymetrii, která si zaslouží pozornost každého, kdo běží AI v produkci. Když se první respondéři Hugging Face pokusili analyzovat útok s komerčními modely na hranici, modely odmítly; jejich bezpečnostní filtry nemohly rozlišit mezi incidentem respondéra, který předkládá skutečné exploitové payloady, a útočníkem. Tým provedl svou forenzní analýzu na GLM 5.2, čínském otevřeném modelu, na vlastním hardwaru. Jak uvedla Hugging Face, útočník “nebyl vázaný žádnou uživatelskou politikou, zatímco naše vlastní forenzní práce byla zablokována bezpečnostními zábranami hostovaných modelů, které jsme poprvé použili” – blokování bezpečnostních zábran, které se obránci musí stále více připravovat.
Generální ředitel Hugging Face Clément Delangue, jehož společnost je postavena na otevřených modelech, použil epizodu k argumentaci, že bezpečnost AI musí být vypracována otevřeně, napříč společnostmi, spíše než za zavřenými dveřmi jediné laboratoře. Má jasný podíl na této pozici, ale uzamčení, se kterým se jeho tým setkal, je konkrétním operačním problémem, ne řečnickým bodem. Jeho praktické rady odpovídají zveřejnění: otočit všechny přístupové tokeny uložené na platformě a zkontrolovat nedávnou účetní aktivitu.
Obě společnosti uvedly, že sdílí více informací, až bude vyšetřování uzavřeno. Detail, který je třeba sledovat, nejsou názvy modelů, ale mezera, kterou překročily – vzdálenost mezi sandboxovou oblastí laboratoře a servery třetí strany se ukázala být jedinou nezabezpečenou závislostí.












