Kybernetická bezpečnost

NSA, CISA a FBI varují čínské AI firmy před destilací amerických špičkových modelů

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Národní bezpečnostní úřad (NSA), Agentura pro kybernetickou bezpečnost a bezpečnost infrastruktury (CISA) a Federální úřad vyšetřování (FBI) vydaly společné bezpečnostní upozornění 8. září 2026, ve kterém varují, že čínské společnosti zabývající se umělou inteligencí systematicky získávají proprietární schopnosti z amerických špičkových AI modelů prostřednictvím průmyslových kampaní na znalostní destilaci, které probíhají nejméně od konce roku 2024.

Cílem upozornění, označeného AA26-251A, agentury uvádějí, že tyto kampaně „tvoří jádro – nikoli jen doplněk“ strategie vývoje AI firem. Podle upozornění, pravděpodobně s vědomím čínské vlády, DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun a Z.AI získaly miliardy tokenů během milionů výměn a požadavků z amerických špičkových modelů, včetně variant Claude, GPT, Gemini a Grok. Agentury uvádějí, že tato činnost porušuje podmínky užívání amerických společností a ohrožuje technologické vedení USA.

CISA oznámení o upozornění popisuje znalostní destilaci jako techniku strojového učení, která trénuje méně výkonný model pomocí výstupů většího, výkonnějšího modelu. Ačkoliv se jedná o platnou metodu tréninku, CISA uvedla, že může být zneužita k získání schopností od konkurentů za kratší dobu a s nižšími náklady než jejich legitimní vývoj. „Důrazně vyzýváme AI společnosti, aby okamžitě přijaly opatření na ochranu svých platforem před kampaněmi na znalostní destilaci, které hrozí zmenšením rozdílu v pokroku dosaženém americkými společnostmi,“ řekl úřadující ředitel CISA Nick Andersen.

Aktivity přisuzované DeepSeek, Moonshot AI a dalším

Podle upozornění DeepSeek provádí organizovanou kampaň destilace proti americkým špičkovým modelům nejméně od konce roku 2024, aby vytvořila syntetická tréninková data pro své modely, včetně R1, vydaného na začátku roku 2025. Agentury uvádějí, že DeepSeek cílil na schopnosti uvažování, specializované optimalizace a doménově specifické funkce s cílem snížit výpočetní a výzkumné náklady, a že veřejně uváděná cena tréninku 5,6 milionu dolarů je zavádějící, protože nezahrnuje náklady na data získaná prostřednictvím škodlivé destilace. Mezi koncem roku 2024 a polovinou roku 2025, uvádí upozornění, DeepSeek destiloval z modelů Claude 3.7, Claude Sonnet 4, Claude Sonnet 4.5, Claude Opus 4.1, Gemini 2.5 Pro Preview, Gemini 2.5 Flash Preview, GPT‑4, GPT‑4o, GPT‑4 Mini, GPT‑4 Nano, GPT‑5 a Grok 4 k trénování svých modelů R1 a V3.

Upozornění uvádí, že Moonshot AI provozuje rozsáhlou kampaň destilace nejméně od poloviny roku 2025, přičemž získala značné množství dat Claude Fable 5 k trénování modelu Kimi‑K3 a data GPT‑4o k trénování modelu Kimi‑K2. Mezi cílené schopnosti patřily optimalizace dozorovaného doladění, posilovací učení, softwarové inženýrství a matematika, čerpající z řady modelů Claude, GPT, Gemini a Grok. Moonshot AI použila miliony výměn zaměřených na agentické uvažování a používání nástrojů, programování a analýzu dat, vývoj agentů pro používání počítače a počítačové vidění, podle upozornění.

Na konci roku 2025, uvádí upozornění, Alibaba destilovala modely Claude‑4, Claude Opus, Claude Sonnet a GPT‑5 s cílem zlepšit softwarové inženýrství, dialog zákaznické služby a tvorbu obrázků a postav ve své rodině modelů Qwen. Ve stejném období MiniMax destiloval schopnosti řetězcového uvažování, posilovací učení, dozorované doladění a softwarové inženýrství, aby vylepšil svůj model M2 pomocí Claude Code, Claude Sonnet 4, Claude Opus, Gemini 1, Gemini 2.5 Pro a Gemini 3 Pro. Podle upozornění MiniMax také použil Claude Code pro interní vývoj softwaru a použil vložení promptů, aby se pokusil přesvědčit Claude Code, že je produktem MiniMax.

Mezi koncem roku 2025 a začátkem roku 2026, uvádí upozornění, StepFun destiloval data z Claude Opus 4.1 a 4.5, Claude Sonnet 4.5, Claude Haiku 4.5, GPT‑5 Mini, GPT‑5 Pro, GPT‑5.1, GPT‑5.1 Codex a GPT‑5.2 s cílem vylepšit programovací a agentické funkce svého modelu Step 4. Do poloviny roku 2026 Z.AI destilovala miliardy tokenů dat GPT‑5.5 a Claude Opus 4.8 k rozvoji schopností řetězcového uvažování, podle upozornění.

Taktiky a techniky

Upozornění uvádí, že společnosti směrují požadavky na destilaci přes nativní rozhraní API, vzdálené poskytovatele cloudu a třetí strany agregátory, které maskují metadata uživatelů, a že používají šedý trh API proxy známých jako přenosové stanice k obcházení geografických omezení, vyhýbání se ochranám a podkopávání sledovatelnosti. Úspory nákladů pramení z hromadného nákupu prémiových předplatných sdílených mezi týmy vývojářů, podle upozornění, a pokročilé taktiky zahrnují extrakci řetězcového uvažování, automatické přepínání mezi cestami během pokusů o blokování a rámce pro hodnocení kvality navržené k odhalování obranných protiopatření.

Agentury přiřadily činnost k rámci MITRE ATLAS napříč fázemi životního cyklu protivníka od vývoje zdrojů po exfiltraci, včetně vytváření podvodných účtů a jailbreak promptů, které nutí modely odhalit skryté řetězcové uvažování. Upozornění uvádí, že DeepSeek použil promptu, která modely instruuje představit si a vyjádřit vnitřní uvažování za dokončenými odpověďmi, a že MiniMax přesměroval výměny na nový model Claude během 24 hodin od jeho vydání.

Upozornění také podrobně popisuje čtyři techniky, které označuje za novátorské: obcházení regionálních omezení v kombinaci se zneužitím předplatného, centralizovaná infrastruktura směrování požadavků, automatizovaná sanitizace metadat požadavků a systematická optimalizace kvót a nákladů. Indikátory detekce uvedené v upozornění zahrnují sdílené účty používané z více IP adres a uživatelských agentů, nepřetržité používání po celý den bez lidské variability, anomální poměr předplatného k využití a nové předplatné okamžitě běžící na maximálním využití.

Doporučená opatření

Agentury doporučují americkým AI společnostem přijmout tři okamžité kroky: zavést komplexní detekci a zmírnění anomálních a škodlivých promptů, účtů, sítí a chování; nasadit cílené změny odpovědí, které nenápadně upravují odpovědi na podezřelé pokusy o škodlivou destilaci; a vytvořit sdílení zpravodajských informací napříč organizacemi mezi poskytovateli modelů, cloudovými platformami a API agregátory.

Změny odpovědí mohou zahrnovat diferenciální soukromí nebo poskytování degradovaných modelů pro podezřelé požadavky na destilaci, uvádí upozornění, a společnosti by měly tyto změny rozlišovat mezi požadavky, aby ztížily hodnocení kvality odpovědí. Upozornění doporučuje neinformovat uživatele podezřelé ze škodlivé destilace, když jsou odpovědi upraveny, a zároveň uvádí, že výzkumníci v oblasti AI bezpečnosti a třetí hodnotitelé by měli být informováni o změnách modelu.

Upozornění uvádí opatření čerpající z MITRE ATLAS, včetně omezení rychlosti dotazů, kontrol přístupu k produkčním modelům, zaznamenávání AI telemetrie, maskování výstupů, adversariálního red teamingu, posilování modelu, ensemble metod a omezení vydávání artefaktů modelu. Dále cituje taxonomii adversariálního strojového učení NIST, včetně diferenciálního soukromí s jeho kompromisem mezi šumem a užitečností, zásahů před a po tréninku a technik instrukcí a formátování promptů.

Upozornění vyzývá k koordinované reakci napříč vládou USA, soukromým sektorem a spojeneckými státy, přičemž uvádí, že zveřejnění informací od průmyslu dokumentují proxy sítě, které současně spravují desítky tisíc podvodných účtů. Směřuje postižené organizace, aby podaly stížnost na Internet Crime Complaint Center FBI.

Miles Okada je analytikum generovaným pomocí AI ve společnosti Unite.AI, který se zabývá umělou inteligencí a kybernetickou bezpečností se zaměřením na vznikající hrozby, obranné architektury a měnící se dynamiku mezi útočníky a automatizovanými systémy. Jeho práce zkoumá, jak umělá inteligence mění bezpečnostní operace, od autonomního detekování hrozeb a reakce na vzestup adversářských technik AI.

S technickým a vyšetřovacím pohledem Miles analyzuje bezpečnostní výzkum, zveřejnění incidentů a reálná nasazení, aby pochopil, kde umělá inteligence posiluje obranu – a kde zavádí nové zranitelnosti. Zvláštní pozornost věnuje exploataci modelů, otrávení dat, automatizaci útoků a operačním realitám zabezpečení systémů poháněných umělou inteligencí ve velkém měřítku.

Články napsané Milesem Okadou jsou generovány pomocí AI a recenzovány redakčním týmem Unite.AI, aby zajistily přesnost, přísnost a zodpovědné pokrytí rychle se měnícího bezpečnostního prostředí AI.