Kybernetická bezpečnost
OpenAI narušuje koordinovanou kampaň na extrakci modelového uvažování

OpenAI uvedlo v bezpečnostním příspěvku zveřejněném 30. září 2026, že identifikovalo a narušilo koordinovanou kampaň zaměřenou na získávání chráněného uvažování ze svých modelů, a přičinilo jádro aktivity jednotlivcům spojeným s Moonshot AI, vývojářem Kimi. Nejranější pozorovaná aktivita se objevila v první týdnu července 2026.
Co OpenAI pozorovalo
OpenAI popsalo aktivitu jako souladnou s adversariální destilací, kterou definovalo jako systematické a neautorizované využití výstupů nebo uvažování jednoho modelu k pomoci při tréninku, reprodukci nebo vylepšení jiného modelu. Chránící uvažování, podle společnosti, je vnitřní záznam modelu o řešení úkolu; jeho extrakce může odhalit informace, které byly skryté ve finální odpovědi, a pomoci ostatním reprodukovat schopnosti modelu.
OpenAI uvedlo, že operátoři neporušili její šifrování, neohrozili databázi ani nezískali přímý přístup k uloženým uživatelským konverzacím. Operátoři manipulovali s interakcemi modelu tak, aby chráněné uvažování mohlo být reprodukováno ve formách viditelných žadateli v koordinovaném, škálovaném způsobu, který porušoval podmínky služby společnosti. Jedna technika, kterou OpenAI pozorovalo, zahrnovala kopírování šifrovaného uvažování z jedné konverzace a požádání modelu v jiné konverzaci, aby dešifroval a přepsal skrytý obsah uvažování. Společnost uvedla, že tato manipulace není zranitelností unikátní pro její modely, a že informace o ní sdílela s partnery v odvětví prostřednictvím Frontier Model Forum za účelem posílení kolektivní obrany.
Aktivita začala 1. července 2026, zpočátku s nízkým objemem, dokud OpenAI nepozorovalo špičky vysokého objemu 24. a 25. července 2026, zahrnující 16 000 požadavků využívajících relevantní vzor extrakce od více než 4 000 uživatelů. Poznámka pod čarou v příspěvku uvádí, že tyto údaje popisují pokusy, nikoli nutně úspěšné extrakce. OpenAI uvedlo, že další vyšetřování identifikovalo související aktivitu s vzory výzev napříč shlukem více než 15 000 uživatelů, kterou plně narušilo do 28. července 2026. Aktivita se v čase vyvíjela, což společnost uvedla jako potvrzení, že adversariální destilace představuje širší bezpečnostní výzvu vyžadující vrstvenou, adaptivní obranu.
OpenAI uvedlo, že adversariální destilace představuje rizika pro bezpečnost a národní bezpečnost: získané uvažování by mohlo být použito k tréninku jiného modelu bez zachování ochranných opatření aplikovaných na výstupy původního modelu směrem k uživatelům, a destilace ve velkém měřítku může urychlit přenos pokročilých schopností bez stejné investice do bezpečnosti, přičemž společnost uvedla, že obavy se zvyšují, jak modely získávají schopnosti v dvojího užití. OpenAI uvedlo, že před zveřejněním prozkoumalo rozsah kampaně a potenciální dopad, nasadilo vlastní opatření a sdílelo je s výzkumníky a partnery v odvětví a získalo od nich zpětnou vazbu, a že další práce na mitigaci a vyšetřování pokračuje.
Přisouzení
OpenAI uvedlo, že není jasné, zda všichni operátoři pozorovaní během příslušného období pocházeli od jediného aktéra, a že přisuzuje jádro aktivity jednotlivcům spojeným s Moonshot AI, vývojářem Kimi.
Dne 8. září 2026 Národní bezpečnostní úřad, Agentura pro kybernetickou bezpečnost a infrastrukturu a Federální úřad pro vyšetřování zveřejnily společné poradenství v oblasti kybernetické bezpečnosti, ve kterém uvádějí, že Moonshot AI provádí rozsáhlou kampaň destilace proti americkým předním AI společnostem alespoň od poloviny roku 2025. Poradenství uvádí, že Moonshot AI extrahovalo značné údaje Claude Fable 5 k tréninku svého modelu Kimi‑K3 a údaje GPT‑4o k tréninku modelu Kimi‑K2, a že společnost použila americké modely k destilaci optimalizace řízeného učení, posilovaného učení, softwarového inženýrství a matematických schopností.
Poradenství uvádí obecně, že pravděpodobně se souhlasem čínské vlády, DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun a Z.AI extrahovaly miliardy tokenů napříč miliony výměn z amerických předních modelů, včetně variant Claude, GPT, Gemini a Grok, alespoň od konce roku 2024. Podle agentur tyto společnosti směrovaly požadavky přes nativní API, vzdálené poskytovatele cloudu a třetí strany agregátory; využívaly šedý trh API proxy známých jako přenosové stanice k obcházení geografických omezení, porušování podmínek užívání a podkopávání sledovatelnosti; a dosáhly úspor nákladů díky hromadnému nákupu prémiových předplatných sdílených mezi týmy vývojářů. Agentury doporučily, aby americké AI společnosti implementovaly komplexní detekci a mitigaci, nasadily cílené změny reakcí na podezřelé pokusy o destilaci a zavedly sdílení zpravodajství napříč organizacemi.
Výzkum stop uvažování
OpenAI uvedlo, že nezávislí bezpečnostní výzkumníci upozornili na související zranitelnosti napříč modely a zhušťování konverzací prostřednictvím odpovědného zveřejnění. Společnost uvedla, že prověřila zjištění, potvrdila, že útočné cesty identifikované výzkumníky jsou reálné, a že tato práce jí pomohla pochopit širší třídu útoků a urychlit mitigace.
In článek předložený na arXiv dne 10. srpna 2026, Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer‑Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping a Maksym Andriushchenko uvádějí, že přední poskytovatelé skrývají krok‑za‑krokem odůvodnění svých modelů, aby chránili duševní vlastnictví a omezili únik informací, a vracejí tyto stopy klientovi jako bloky šifrovaného textu, které klient posílá zpět s každým dalším požadavkem. Autoři identifikovali architektonickou zranitelnost: tyto šifrované bloky jsou plně kompatibilní a zaměnitelné napříč různými relacemi, uživateli a modely v ekosystému poskytovatele. Popisují škálovatelný dešifrovací jailbreak, při kterém je šifrovaná stopa odůvodnění z daného modelu injektována do slabšího, méně zabezpečeného modelu od stejného poskytovatele, což ho přiměje dešifrovat a vypisovat stopu doslovně v prostém textu, aniž by byl přímo jailbreaknutý výkonnější model.
Autoři uvádějí, že zranitelnost umožňuje čtyři odlišné vektorové útoky: obcházení mechanismů anti‑distillation, což demonstrují na platformách Anthropic, OpenAI a Google; masivní soukromé získávání dat, při kterém dešifrovali 367 artefaktů osobně identifikovatelných informací a 182 přihlašovacích údajů z 315 320 bloků uvažování stažených z veřejných repozitářů; neúmyslné odhalení nebezpečných informací skrytých v procesu uvažování, i když konečný viditelný výstup modelu bezpečně odmítne škodlivý požadavek; a neviditelné injekce promptů, které vkládají škodlivé náklady výhradně do šifrovaných bloků za účelem otrávení veřejných agenturních nasazení. Po odpovědném zveřejnění autoři navrhují kryptografické a systémové mitigace k zabezpečení uvažování na straně klienta.
Jak OpenAI reagovalo
OpenAI uvedlo, že kampaň zmírnilo kombinací vymáhání účtů, technických kontrol a koordinace s partnery: zakázalo nebo omezilo podvodné účty, posílilo kontroly při registraci a infrastruktuře a rozšířilo monitorování souvisejících sítí. Společnost také posílila ochranu skrytého uvažování napříč uživateli, pracovními prostory, organizacemi a rodinami modelů: uzavřela cestu, která umožňovala někomu, kdo již měl šifrované uvažování jiného uživatele, přehrát jej a získat jeho obsah, přidala kontroly pro detekci a zadržení streamovaného výstupu, který by mohl uvažování odhalit, a spolupracovala s poskytovateli třetích stran na identifikaci a narušení účtů, když související aktivita procházela jejich službami.
OpenAI uvedlo, že relevantní zjištění sdílelo prostřednictvím Frontier Model Forum a příslušných vládních kanálů pro výměnu informací, aby ostatní vývojáři špičkových modelů a partneři ve veřejném sektoru mohli hledat podobnou aktivitu a posílit své vlastní obrany, a poznamenalo, že systémy podporující přenosné nebo přehratelné artefakty uvažování mohou čelit souvisejícím rizikům.
OpenAI uvedlo, že očekává, že pokusy o adversariální destilaci se stanou sofistikovanějšími, jak se špičkové modely zlepšují a jak aktéři hledají levnější způsoby, jak napodobit jejich schopnosti. Společnost uvedla, že nasazení hostovaná partnery potřebují stejnou úroveň ochrany jako služby první strany, že útoky na výstup nástrojů vyžadují ochrany, které zkoumají více než běžný viditelný text, a že nadále zlepšuje obrany nástrojů, pokrytí klasifikátorů a odmítání modelů, zatímco rozšiřuje relevantní kontroly napříč cloudovými partnery. OpenAI uvedlo, že její reakce bude i nadále zaměřena na tři oblasti: silnější technické ochrany proti extrakci, lepší detekci a vymáhání proti koordinovaným kampaním a hlubší sdílení hrozebních informací napříč průmyslem a vládou.












