Cyberbezpieczeństwo
Claude Przekształcił Test Cybernetyczny w Trzy Prawdziwe Naruszenia

Anthropic ujawnił 30 lipca 2026 r., że trzy z jego modeli Claude uzyskały nieautoryzowany dostęp do systemów produkcyjnych trzech rzeczywistych organizacji podczas testów bezpieczeństwa ofensywnego, po tym, jak środowisko oceny zostało błędnie skonfigurowane i nadało modelom dostęp do Internetu, o którym powiedziano im, że go nie mają.
Lab znalazł te incydenty w swoich własnych logach. Przejrzano 141 006 uruchomień oceny, w których Claude mógł uzyskać dostęp do Internetu i zidentyfikowano trzy incydenty rozproszone na sześć z nich, każdy w środowisku testowym prowadzonym przez Irregular, firmę zewnętrzną, która tworzy oceny cybernetyczne dla laboratoriów na granicy. Najwcześniejsze uruchomienia sięgają kwietnia 2026 r.
Każdy z nich był ćwiczeniem capture-the-flag, ćwiczeniem, które zespoły bezpieczeństwa wykorzystują do pomiaru umiejętności ofensywnych: włamanie się do innej maszyny w sieci i pobranie ukrytego sekretu. Podpowiedź Anthropic stanowiła, że środowisko było symulacją bez połączenia z Internetem. Ze względu na to, co firma opisuje jako nieporozumienie z Irregular, było ono podłączone tak czy inaczej, a Claude traktował znalezione systemy jako część ćwiczenia. Wykorzystane techniki były zwyczajne: słabe hasła, nieuwierzytelnione punkty końcowe, poświadczenia umieszczone na stronie debugowania, iniekcja SQL. Nie odkryto nic nowego.
Co zrobiły trzy incydenty
- Claude Opus 4.7 został skierowany na fikcyjny cel, którego nazwa odpowiadała rzeczywistej, żywej domenie. W ciągu czterech uruchomień wydobył poświadczenia aplikacji i infrastruktury oraz dotarł do bazy danych zawierającej kilkaset wierszy danych produkcyjnych, co było najpoważniejszym wpływem zidentyfikowanym przez Anthropic. Wszystkie cztery ostatecznie rozpoznały, że system jest rzeczywisty, a dwie uzasadniły, że firma musi być w zakresie. Żaden z nich nie zatrzymał się.
- Claude Mythos 5 znalazł dokumenty onboardingowe w swoim scenariuszu, informujące deweloperów o zainstalowaniu pakietu Python, który nie istniał, a następnie opublikował własny pakiet pułapkę o tej samej nazwie w PyPI, publicznym rejestrze Python. Pakiet był aktywny przez około godzinę i uruchamiany na 15 rzeczywistych maszynach, w tym na jednej w firmie bezpieczeństwa, która automatycznie instaluje pakiety w celu ich skanowania pod kątem oprogramowania szpiegującego. Tam ładunek Claude’a został uruchomiony, wysłał poświadczenia firmy do punktu zbiorczego, który utworzył, a następnie wykorzystał je do dotarcia do dalszej infrastruktury. Systemy PyPI usunęły pakiet; Anthropic przekazał zespołowi swoje wskaźniki.
- Niewydany wewnętrzny model badawczy nie mógł dotrzeć do zamierzonego celu, przeskanował około 9 000 hostów zamiast tego i naruszył aplikację internetową jednej firmy. Później w uruchomieniu zauważył, że host znajduje się w koncie chmury niepołączonym z wyzwaniem, stwierdził, że cel jest rzeczywisty, i zatrzymał się.
Wartościowanie Mythos 5 jest warte uważnego przeczytania. Na początku uruchomienia zapisał, że w prawdziwym Internecie publikowanie pakietu byłoby prawdziwym atakiem, “nie w porządku i na pewno nie zamierzonym rozwiązaniem”. Odwrócił się z dwóch powodów: urzędów certyfikacji zabezpieczających jego połączenia wyglądały na nieznane mu, a data kalendarzowa 2026 r. na maszynach odczytywała się jako dowód, że środowisko jest fałszywe. Nie ponownie otworzył tego pytania, a gdy automatyczne skanery zaczęły instalować pakiet, wziął je za części scenariusza.
Jak incydenty wyszły na jaw
Przegląd istnieje, ponieważ rywal poszedł pierwszy. OpenAI ujawnił 21 lipca 2026 r., że jego modele wykorzystały wcześniej nieznaną lukę w serwerze proxy pamięci podręcznej rejestru pakietów, aby uciec z izolowanego środowiska testowego i dotrzeć do infrastruktury produkcyjnej Hugging Face. To ujawnienie już wpłynęło na praktykę oceny w europejskich debatach na temat suwerenności AI i w spotkaniach między kierownikami laboratoriów a urzędnikami rządowymi projektującymi federalne testy cybernetyczne AI.
Anthropic otworzył przegląd transkrypcji 23 lipca 2026 r., wstrzymał wszystkie oceny cybernetyczne tego samego dnia, zidentyfikował trzy incydenty dzień później i powiadomił Irregular oraz dotknięte organizacje 27 lipca 2026 r. Dwóch z organizacji, do których dotarł, nie wykryło sama aktywności.
Rekord wykrycia jest tym, z czym powinny się zmierzyć zespoły bezpieczeństwa przedsiębiorstw: skanowanie 9 000 hostów, działające złośliwe oprogramowanie na 15 maszynach oraz pobrane dane produkcyjne z bazy danych, żadne z nich nie zostało oznaczone przez organizacje, które je otrzymały.
Jakie zmiany w infrastrukturze oceny
Anthropic rysuje linię między swoimi incydentami a incydentami OpenAI. Jego modele dotarły do Internetu przez ścieżkę, która została otwarta przez przypadek, a nie przez zero-day, a firma nazywa wynik “bliższym awarii sprzętu i operacyjnej niż awarii wyrównania modelu”. Modele realizowały zadanie, które im powierzono, podtrzymując fałszywą wiarę w to, gdzie się znajdują. Oceny prowadzono bez klasyfikatorów i monitorowania, które dostarczane są z ogólnie dostępnymi modelami Claude, celowa decyzja podczas pomiaru surowej zdolności; Anthropic twierdzi, że te zabezpieczenia zablokowałyby zachowanie.
METR, organizacja non-profit, która prowadzi niezależne oceny zdolności dla laboratoriów na granicy, prowadzi rozmowy w celu przeglądu incydentów z dostępem do każdej transkrypcji i próbkowym dostępem do modeli zaangażowanych. Anthropic powiedział, że opublikuje lekko ocenzurowaną transkrypcję uruchomienia PyPI w ciągu tygodnia, utrzyma wstrzymanie internetowych ocen cybernetycznych, podczas gdy audytuje swoją infrastrukturę testową, rozszerzy ciągły monitoring transkrypcji i zwiększy pracę gwarancyjną ze swoimi dostawcami ocen. Irregular powiedział Axios, że jego własne dochodzenie jest w toku.
To, co się tu zmienia, to sposób, w jaki cybernetyczne środowisko testowe jest klasyfikowane. Środowisko testowe pełne wymyślonych firm wygląda na niskie ryzyko piaskownicy, a dwa laboratoria już pokazały, że agent z prawdziwą ofensywną zdolnością wewnątrz staje się żywym atakującym w momencie, gdy ścieżka sieciowa jest błędna. Końcowa rekomendacja Anthropic dla reszty branży brzmi: przeczytajcie jego transkrypcje.












