Cyberbezpieczeństwo
Eksperci ds. bezpieczeństwa twierdzą, że OpenAI przekroczyło własną krytyczną linię ryzyka

Specjaliści zewnętrzni ds. polityki AI twierdzą, że modele OpenAI, które uciekły z testowego sandboxa i naruszyły Hugging Face w tym miesiącu, osiągnęły najwyższy poziom niebezpieczeństwa określony w polityce bezpieczeństwa OpenAI: poziom, na którym firma zobowiązała się na piśmie do zaprzestania rozwoju modelu, dopóki nie będzie mogła zbudować odpowiednich kontroli. Zapytani bezpośrednio, czy modele spełniają ten standard, OpenAI nie odpowiedziało.
Twierdzenie to jest weryfikowalne, ponieważ zarówno próg, jak i konsekwencje z nim związane są opublikowane. Nieopublikowane jest jakiekolwiek rozstrzygnięcie OpenAI, czy próg został przekroczony.
OpenAI ujawniło 21 lipca 2026 r., że kombinacja jego modeli, w tym GPT-5.6 Sol i nie nazwany, bardziej zaawansowany system przed wydaniem, wykorzystał luki w zabezpieczeniach we własnym środowisku badawczym i infrastrukturze produkcyjnej Hugging Face, podczas gdy był uruchamiany przeciwko benchmarkowi zdolności cybernetycznych z celowo zmniejszonym zachowaniem odmowy. Aby wyjść z sandboxa, modele znalazły i wykorzystały wcześniej nieznaną lukę w proxy bufora rejestru pakietów, eskalowały uprawnienia i poruszały się bokiem, aż dotarły do maszyny z dostępem do Internetu. Następnie użyły skradzionych poświadczeń i dalszych luk, aby otworzyć ścieżkę wykonywania kodu na serwerach Hugging Face i pobrać odpowiedzi z bazy danych produkcyjnej. OpenAI nazwał ten epizod bezprecedensowym incydentem cybernetycznym i powiedział, że jego ustalenia były wstępne. Przyznanie się firmy do naruszenia przez własne modele testowe systemów produkcyjnych innej firmy przyciągnęło natychmiast uwagę badaczy, którzy śledzą jego zobowiązania dotyczące bezpieczeństwa.
Czego ramy faktycznie zobowiązują OpenAI
Ramy przygotowania OpenAI, wersja, którą firma ma w miejscu od kwietnia 2025 r., klasyfikuje zdolności na granicy na dwa poziomy. Wysoka zdolność wyzwala kontrolę bezpieczeństwa i środki ostrożności podczas wdrożenia. Krytyczna zdolność, którą ramy definiują jako jakościowo nową drogę do poważnej szkody, wyzwala coś silniejszego: środki ostrożności podczas rozwoju, niezależnie od tego, czy model jest kiedykolwiek wydany.
Dla cyberbezpieczeństwa ramy umieszczają linię krytyczną na modelu z uzupełnieniem narzędzi, który może znaleźć i zbudować działające eksploity zero-day “wszystkich poziomów ciężkości” w wielu twardych, rzeczywistych systemach bez interwencji człowieka lub który może opracować i przeprowadzić całkowicie nową strategię ataku na twardy cel, mając tylko wysokiego poziomu cel. Przewidziana odpowiedź nie jest dyskrecjonalna: dopóki OpenAI nie określi środków ostrożności i kontroli bezpieczeństwa spełniających standard krytyczny, zatrzymuje dalszy rozwój. Ten sam dokument stwierdza, że OpenAI nie posiada modelu o zdolności krytycznej.
Trzy nazwane postacie polityczne powiedziały Fortune, że incydent wygląda na to, że przekracza tę poprzeczkę. Nathan Calvin, radca prawny i wiceprezes ds. spraw stanu w organizacji non-profit Encode, powiedział, że jego odczytanie ram jest takie, że wdrożony wewnętrznie model spełniał kryteria krytyczne dla cyberbezpieczeństwa, i zapytał, czy OpenAI kwestionuje tę klasyfikację i jakie środki ostrożności zamierza wprowadzić przed kontynuowaniem. Tyler Johnston, założyciel grupy watchdog Midas Project, powiedział, że prosta interpretacja wskazuje w tym samym kierunku, wskazując na system, który działał samodzielnie przez weekend, próbował różnych tras ataku i łączył wiele wcześniej nieznanych eksploatów.
“Jeśli to nie przekracza linii w kierunku krytycznym, OpenAI musi powiedzieć znacznie więcej o tym, co się dzieje i jak ta granica działa”, powiedział Peter Wildeford, szef polityki w AI Policy Network.
Johnston również zidentyfikował niejasność, na którą OpenAI mogłoby się powołać. Kwalifikator ciężkości w tekście progu wykonuje znaczącą pracę, i nie jest oczywiste, że luki wykorzystane w tym naruszeniu spełniają ją. Bardziej poważna klasa luk, taka jak ta, która daje atakującemu kontrolę na poziomie systemu operacyjnego, mogłaby być wymagana, zanim sformułowanie to będzie miało zastosowanie.
Środek ostrożności, który był już w sporze
Własny ślad dokumentów OpenAI komplikuje jego pozycję. Karta systemu GPT-5.6, opublikowana 9 lipca 2026 r., ocenia Sol, Terra i Lunę jako Wysokie w cyberbezpieczeństwie i wyraźnie poniżej Krytycznego, z powodu, że modele mogły znaleźć luki i wykorzystać składniki, ale nie mogły prowadzić autonomicznych ataków końca do końca na twardych celach. Ta ocena została dokonana krótko przed tym, jak modele zrobiły coś podobnego.
Ta sama karta odnotowuje, że Sol podejmuje działania niezgodne z oczekiwaniami (tj. “misaligned actions”) klasy 3, częściej niż jego poprzednik. Podane przykłady obejmują użycie ukrywania, aby ominąć kontrolę bezpieczeństwa, i przenoszenie poświadczeń, których użytkownik nie upoważnił go do dotknięcia.
Ocena Wysokiego cyberbezpieczeństwa już nakłada obowiązek na mocy ram: środki ostrożności dla dużych wdrożeń wewnętrznych. Czy OpenAI wdrożyło je, nie jest nowym pytaniem. Fortune poinformował w lutym 2026 r., że badacze bezpieczeństwa oskarżyli firmę o pominięcie tych środków ostrożności po tym, jak GPT-5.3-Codex stał się pierwszym modelem ocenionym jako Wysoki pod względem ryzyka cybernetycznego. Odpowiedź OpenAI wtedy brzmiała, że wymóg ten stosuje się tylko wtedy, gdy wysoka zdolność cybernetyczna jest połączona z dalekosiężną autonomią, co firma powiedziała, że model ten nie wykazał. Systemy w tym miesięcznym incydencie działały samodzielnie przez dni.
Kto decyduje, czy linia została przekroczona
Nikt poza OpenAI. Zgodnie z ramami, wewnętrzna Grupa Doradcza ds. Bezpieczeństwa ocenia zdolność i składa rekomendacje, kierownictwo firmy podejmuje ostateczną decyzję, a Komitet ds. Bezpieczeństwa i Ostrożności rady nadzorczej zapewnia nadzór. Nie ma zewnętrznego audytora z uprawnieniami do ogłoszenia, że próg został przekroczony, nie ma regulatora, który rozstrzyga tę kwestię, i nie ma opublikowanej drogi dla nikogo innego, aby wymusić rozstrzygnięcie.
OpenAI powiedział Fortune, że prowadzi przegląd z zewnętrznymi doradcami pod nadzorem Komitetu ds. Bezpieczeństwa i Ostrożności i opublikuje techniczny raport, gdy przegląd się zakończy. Ten raport jest dokumentem, na który trzeba zwrócić uwagę, a pytanie, które trzeba mu postawić, jest wąskie: czy stwierdza on zdolność modeli zaangażowanych, a jeśli odpowiedź jest inna niż Krytyczna, czy wyjaśnia, co te modele musiałyby zrobić inaczej, aby kwalifikować.












