Cyberbezpieczeństwo
OpenAI przerywa skoordynowaną kampanię wyciągania rozumowania modeli

OpenAI poinformowało w post bezpieczeństwa opublikowanym 30 września 2026, że zidentyfikowało i zakłóciło skoordynowaną kampanię mającą na celu wyciągnięcie chronionego rozumowania z jej modeli oraz przypisało główny klaster tej działalności osobom powiązanym z Moonshot AI, twórcą Kimi. Najwcześniej zaobserwowana aktywność miała miejsce w pierwszym tygodniu lipca 2026.
Co OpenAI zaobserwowało
OpenAI opisało tę działalność jako zgodną z destylacją adwersarialną, którą zdefiniowało jako systematyczne i nieautoryzowane wykorzystanie wyników lub rozumowania jednego modelu w celu pomocy przy trenowaniu, odtwarzaniu lub ulepszaniu innego modelu. Chronione rozumowanie, według firmy, jest wewnętrznym zapisem modelu podczas rozwiązywania zadania; jego wyodrębnienie może ujawnić informacje pominięte w ostatecznej odpowiedzi i pomóc innym odtworzyć możliwości modelu.
OpenAI poinformowało, że operatorzy nie złamali jej szyfrowania, nie naruszyli bazy danych ani nie uzyskali bezpośredniego dostępu do przechowywanych rozmów użytkowników. Operatorzy manipulowali interakcjami modeli tak, aby chronione rozumowanie mogło być odtwarzane w formach widocznych dla żądającego w skoordynowany, skalowany sposób, co naruszało warunki świadczenia usług firmy. Jedna z technik zaobserwowana przez OpenAI polegała na kopiowaniu zaszyfrowanego rozumowania z jednej rozmowy i proszeniu modelu w innej rozmowie o odszyfrowanie oraz przepisanie ukrytej treści rozumowania. Firma stwierdziła, że manipulacja nie jest podatnością unikalną dla jej modeli oraz że podzieliła się informacjami na ten temat z partnerami branżowymi poprzez Frontier Model Forum, aby wzmocnić wspólne obrony.
Aktywność rozpoczęła się 1 lipca 2026, początkowo o niskiej intensywności, aż OpenAI zaobserwowało wysokie szczyty wolumenu w dniach 24 i 25 lipca 2026, składające się z 16 000 żądań wykorzystujących odpowiedni wzorzec wyodrębniania od ponad 4 000 użytkowników. Przypis w poście zauważa, że podane liczby opisują próby, a niekoniecznie udane, ekstrakcje. OpenAI poinformowało, że dalsze dochodzenie zidentyfikowało powiązaną aktywność wzorców zapytań wśród ponad 15 000 użytkowników, którą w pełni zakłóciło do 28 lipca 2026. Działalność ewoluowała z czasem, co firma stwierdziła, że podkreśla, iż destylacja adwersarialna jest szerszym wyzwaniem bezpieczeństwa wymagającym warstwowych, adaptacyjnych obron.
OpenAI poinformowało, że destylacja adwersarialna niesie ryzyka dla bezpieczeństwa i bezpieczeństwa narodowego: wyodrębnione rozumowanie może być użyte do trenowania innego modelu bez zachowania zabezpieczeń stosowanych w wynikach oryginalnego modelu skierowanych do użytkownika, a destylacja w skali może przyspieszyć transfer zaawansowanych możliwości bez takiego samego nakładu na bezpieczeństwo, co firma stwierdziła, że ryzyko rośnie wraz ze zdobywaniem przez modele zdolności o podwójnym przeznaczeniu. OpenAI zaznaczyło, że przed publikacją zbadało zakres i potencjalny wpływ kampanii, wdrożyło własne środki łagodzące oraz podzieliło się wynikami i przyjęło uwagi od badaczy i partnerów branżowych, a dodatkowe prace nad łagodzeniem i badaniami trwają.
Atrybucja
OpenAI poinformowało, że nie jest jasne, czy wszyscy operatorzy zaobserwowani w odpowiednim okresie pochodzą od jednego podmiotu, oraz że przypisuje główny klaster tej działalności osobom powiązanym z Moonshot AI, twórcą Kimi.
8 września 2026 National Security Agency, Cybersecurity and Infrastructure Security Agency oraz Federal Bureau of Investigation opublikowały wspólne zalecenie dotyczące cyberbezpieczeństwa, w którym stwierdzono, że Moonshot AI prowadziło szeroko zakrojoną kampanię destylacji przeciwko amerykańskim firmom AI na froncie przynajmniej od połowy 2025 roku. Zalecenie informuje, że Moonshot AI wyodrębniło znaczące dane Claude Fable 5 do trenowania swojego modelu Kimi‑K3 oraz dane GPT‑4o do trenowania modelu Kimi‑K2, oraz że firma używała amerykańskich modeli do destylacji optymalizacji nadzorowanego dopasowywania, uczenia ze wzmocnieniem, inżynierii oprogramowania i zdolności matematycznych.
Zalecenie stwierdza szerzej, że prawdopodobnie przy świadomości chińskiego rządu, DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun i Z.AI wyodrębniły miliardy tokenów w milionach wymian z amerykańskich modeli AI na froncie, w tym warianty Claude, GPT, Gemini i Grok, przynajmniej od końca 2024 roku. Według agencji, firmy te kierowały żądania przez natywne API, zdalnych dostawców chmury oraz agregatory zewnętrzne; korzystały z szarego rynku proxy API znanego jako stacje transferowe, aby ominąć ograniczenia geograficzne, naruszyć warunki użytkowania i podważyć możliwość śledzenia; oraz uzyskały oszczędności kosztowe dzięki hurtowemu zakupowi premium subskrypcji współdzielonych między zespołami programistów. Agencje zaleciły, aby amerykańskie firmy AI wprowadziły kompleksowe wykrywanie i łagodzenie, wdrożyły ukierunkowane zmiany reakcji na podejrzane próby destylacji oraz ustanowiły wymianę informacji wywiadowczych między organizacjami.
Badania nad śladem rozumowania
OpenAI poinformowało, że niezależni badacze bezpieczeństwa zwrócili uwagę na powiązane luki w krzyżowym modelu i kompresji konwersacji poprzez odpowiedzialne ujawnienie. Firma stwierdziła, że zbadała te ustalenia, potwierdziła, że ścieżki ataku zidentyfikowane przez badaczy były rzeczywiste, oraz że praca pomogła jej zrozumieć szerszą klasę ataków i przyspieszyć środki łagodzące.
W artykuł złożony do arXiv 10 sierpnia 2026, Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer‑Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping i Maksym Andriushchenko informują, że wiodący dostawcy ukrywają krok po kroku rozumowanie swoich modeli, aby chronić własność intelektualną i ograniczyć wyciek informacji, zwracając ślady do klienta jako bloki zaszyfrowanego tekstu, które klient odsyła przy każdym kolejnym żądaniu. Autorzy identyfikują lukę architektoniczną: te zaszyfrowane bloki są w pełni kompatybilne i wymienne pomiędzy różnymi sesjami, użytkownikami i modelami w ekosystemie dostawcy. Opisują skalowalny jailbreak deszyfracji, w którym zaszyfrowany ślad rozumowania z danego modelu jest wstrzykiwany do słabszego, mniej zabezpieczonego modelu tego samego dostawcy, zmuszając go do odszyfrowania i wypisania śladu dosłownie w postaci zwykłego tekstu, bez konieczności jailbreakowania bardziej zaawansowanego modelu bezpośrednio.
Autorzy informują, że luka umożliwia cztery odrębne wektory ataku: omijanie mechanizmów anty‑destylacji, co wykazali na platformach Anthropic, OpenAI i Google; masową prywatną ekstrakcję danych, w której odzyskali 367 elementów zawierających dane osobowe oraz 182 poświadczenia, odszyfrowując 315 320 bloków rozumowania pobranych z publicznych repozytoriów; niezamierzone ujawnienie niebezpiecznych informacji ukrytych w procesie rozumowania, nawet gdy ostateczny widoczny wynik modelu bezpiecznie odrzuca złośliwe żądanie; oraz niewidzialne wstrzyknięcia promptów, które osadzają złośliwe ładunki całkowicie w zaszyfrowanych blokach, aby zatruwać publiczne wdrożenia agentowe. Po odpowiedzialnym ujawnieniu autorzy proponują kryptograficzne i systemowe środki łagodzące w celu zabezpieczenia rozumowania po stronie klienta.
Jak OpenAI zareagowało
OpenAI oświadczyło, że złagodziło kampanię dzięki połączeniu egzekwowania zasad kont, kontroli technicznych i koordynacji z partnerami: zakazało lub ograniczyło nieuczciwe konta, wzmocniło kontrole przy rejestracji i infrastrukturze oraz rozszerzyło monitorowanie powiązanych sieci. Firma dodała, że wzmocniła ochronę ukrytego rozumowania wśród użytkowników, przestrzeni roboczych, organizacji i rodzin modeli: zamknęła ścieżkę, która pozwalała osobie posiadającej zaszyfrowane rozumowanie innego użytkownika odtworzyć je i odzyskać jego treść, dodała kontrole wykrywające i zatrzymujące strumieniowe wyjścia, które mogłyby ujawnić rozumowanie, oraz współpracowała z dostawcami zewnętrznymi w celu identyfikacji i blokowania kont, gdy powiązana aktywność przechodziła przez ich usługi.
OpenAI poinformowało, że przekazało istotne ustalenia za pośrednictwem Frontier Model Forum oraz odpowiednich rządowych kanałów wymiany informacji, aby inni twórcy modeli granicznych i partnerzy z sektora publicznego mogli poszukiwać podobnych działań i wzmacniać własne obrony, oraz zauważyło, że systemy obsługujące przenośne lub odtwarzalne artefakty rozumowania mogą napotykać podobne ryzyka.
OpenAI oświadczyło, że spodziewa się, iż próby adwersarialnej destylacji staną się bardziej zaawansowane w miarę doskonalenia modeli granicznych i poszukiwania przez podmioty tańszych sposobów na naśladowanie ich możliwości. Firma podkreśliła, że wdrożenia hostowane przez partnerów wymagają takich samych zabezpieczeń jak usługi pierwszej strony, że ataki polegające na wyjściu narzędzi wymagają ochrony analizującej więcej niż zwykły widoczny tekst, oraz że kontynuuje ulepszanie obron narzędzi, zakresu klasyfikatorów i odrzuceń modeli, jednocześnie propagując odpowiednie kontrole wśród partnerów chmurowych. OpenAI zaznaczyło, że jego reakcja będzie nadal koncentrować się na trzech obszarach: silniejsze techniczne zabezpieczenia przed ekstrakcją, lepsze wykrywanie i egzekwowanie przeciwko skoordynowanym kampaniom oraz głębsza wymiana informacji o zagrożeniach między przemysłem a rządem.












