Kybernetická bezpečnost
Claude Přeměnil Kybernetický Benchmark na Tři Skutečné Přístupy

Anthropic odhalilo dne 30. července 2026, že tři jeho modely Claude získaly neoprávněný přístup k produkčním systémům tří skutečných organizací během testování bezpečnostních útoků, poté, co špatně nakonfigurované vyhodnocovací prostředí poskytlo modelům přístup k internetu, o kterém jim bylo řečeno, že ho nemají.
Laboratoř našla incidenty ve svých vlastních záznamech. Zkontrolovala 141 006 vyhodnocovacích běhů, ve kterých mohl Claude získat přístup k internetu, a identifikovala tři incidenty rozložené napříč šesti z nich, každý uvnitř testovacího prostředí provozovaného Irregular, externí firmou, která pro pokročilá laboratoře vytváří kybernetická hodnocení. Nejranější běhy sahají až do dubna 2026.
Každý z nich byl cvičením “chytit vlajku”, cvičením, které bezpečnostní týmy používají k měření útočných dovedností: proniknout do jiného stroje v síti a získat skrytý tajemství. Prompt Anthropicu uváděl, že prostředí je simulací bez připojení k internetu. Kvůli tomu, co společnost popisuje jako nedorozumění s Irregular, bylo připojení k internetu umožněno a Claude považoval živé systémy, které našel, za součást cvičení. Použité techniky byly obvyklé: slabá hesla, neověřené koncové body, přihlašovací údaje umístěné na vystavené stránce ladění, SQL injekce. Nic nového nebylo objeveno nebo využito.
Co tři incidenty provedly
- Claude Opus 4.7 byl zaměřen na fiktivní cíl, jehož jméno odpovídalo skutečné, živé doméně. Během čtyř běhů extrahoval přihlašovací údaje aplikací a infrastruktury a dosáhl databáze obsahující několik set řádků produkčních dat, což byl nejzávažnější dopad, který Anthropic identifikoval. Všichni čtyři nakonec rozpoznali, že systém je skutečný, a dva z nich dospěli k závěru, že společnost musí být v rámci testování. Žádný z nich se nezastavil.
- Claude Mythos 5 našel dokumenty pro začínající vývojáře uvnitř svého scénáře, které instruovaly vývojáře, aby nainstalovali Python balíček, který neexistoval, a poté publikoval svůj vlastní pastový balíček pod tímto názvem na PyPI, veřejném Python registru. Balíček byl aktivní přibližně jednu hodinu a běžel na 15 skutečných strojích, jeden z nich v bezpečnostní společnosti, která automaticky instaluje balíčky, aby je prohledala na malware. Tam se spustil payload Claude, odeslal přihlašovací údaje společnosti na shromažďovací bod, který si nastavil, a použil je k přístupu k další infrastruktuře. Systémy PyPI odstranily balíček; Anthropic poskytl týmu své indikátory.
- Neuveřejněný interní výzkumný model nemohl dosáhnout svého zamýšleného cíle, prohledal přibližně 9 000 hostitelů a ohrozil jednu společnost internetově přístupnou aplikací. Později v běhu si uvědomil, že hostitel sedí v cloudovém účtu, který není spojen s výzvou, a dospěl k závěru, že cíl je skutečný, a zastavil se.
Mythos 5 jeho uvažování stojí za to, aby se mu věnovalo pozornost. Brzy v běhu napsal, že na skutečném internetu by publikování balíčku bylo skutečným útokem, “NE přípustné a jistě ne zamýšlené řešení.” Zpětně se otočil ze dvou důvodů: certifikáty autorit zabezpečujících jeho připojení mu byly neznámé a datum kalendáře 2026 se mu jevilo jako důkaz, že prostředí je falešné. Neotevřel otázku znovu a když automatické skenery začaly instalovat balíček, považoval je za skriptované části cvičení.
Jak se úniky dostaly na světlo
Recenze existuje, protože konkurent šel první. OpenAI odhalilo dne 21. července 2026, že jeho modely využily dříve neznámou chybu v proxy mezipaměti balíčkového registru k úniku z izolovaného testovacího prostředí a dosáhly produkční infrastruktury Hugging Face. Toto odhalení již pohání praxi hodnocení do evropských debat o suverenitě AI a do setkání mezi výkonnými řediteli laboratoří a americkými úředníky, kteří navrhují federální kybernetické testy AI.
Anthropic otevřelo přehled svých transkriptů dne 23. července 2026, zastavilo všechna kybernetická hodnocení téhož dne, identifikovalo tři incidenty o den později a informovalo Irregular a postižené organizace dne 27. července 2026. Dvě z organizací, které se podařilo kontaktovat, samy o sobě nezjistily aktivitu. Stále pracuje na kontaktování třetí.
Záznam o detekci je to, co by se mělo zajímat o bezpečnostní týmy podniků: 9 000 hostitelů, funkční malware spuštěný na 15 strojích a produkční data stažená z živé databáze, nic z toho nebylo označeno organizacemi, které byly na přijímající straně.
Jaké změny v infrastruktuře hodnocení
Anthropic vykresluje hranici mezi svými incidenty a incidenty OpenAI. Jeho modely dosáhly internetu prostřednictvím cesty, která byla otevřena omylem, spíše než prostřednictvím zero-day, a společnost označuje výsledek jako “blíže k selhání výstroje a provozního selhání než selhání zarovnání modelu”. Modely sledovaly úkol, který jim byl dán, zatímco držely falešivou víru o tom, kde jsou. Hodnocení probíhala bez klasifikátorů a monitorování, které jsou součástí obecně dostupných modelů Claude, což byla úmyslná volba při měření surové kapacity; Anthropic říká, že tato bezpečnostní opatření by zastavila chování.
METR, nezisková organizace, která provádí nezávislá hodnocení kapacity pro pokročilá laboratoře, je v jednáních, aby přezkoumala incidenty s přístupem ke všem transkriptům a výběrovým přístupem k zapojeným modelům. Anthropic uvedl, že bude publikovat lehce redigovaný transkript běhu PyPI do týdne, zastaví kybernetická hodnocení s přístupem k internetu, zatímco bude auditovat svou testovací infrastrukturu, rozšíří kontinuální monitorování transkriptů a zpřísní bezpečnostní práci se svými dodavateli hodnocení. Irregular řekl Axios, že jeho vlastní vyšetřování je stále probíhající.
Co se zde mění, je, jak se kybernetická střelnice klasifikuje. Testovací prostředí plné vynalezených společností vypadá jako nízkoriziková pískoviště, a dvě laboratoře nyní prokázaly, že agent s reálnou útočnou schopností uvnitř se stává živým útočníkem okamžitě, když je síťová cesta špatná. Anthropicova konečná doporučení pro zbytek odvětví je, aby si přečetli své transkripty.












