Zprávy
Zpráva HiddenLayer’s EchoGram varuje před novou třídou útoků, které ohrožují bezpečnostní zábrany umělé inteligence

Nedávno zveřejněná zpráva EchoGram od HiddenLayer přináší jedno z nejjasnějších varování, že dnešní mechanismy bezpečnosti umělé inteligence jsou křehčí, než se zdá. Během devíti stránek technických důkazů a experimentů HiddenLayer demonstruje, jak útočníci mohou manipulovat systémy bezpečnostních zábran – ty klasifikační vrstvy a LLM-as-a-judge komponenty, které vynucují bezpečnostní politiky – pomocí krátkých, zdánlivě bezvýznamných sekvencí tokenů, které spolehlivě mění jejich verdikt. Zlý prompt, který by měl být detekován jako nebezpečný, může být označen jako bezpečný jednoduše přidáním konkrétního tokenu. Naopak, zcela neškodný vstup může být špatně klasifikován jako nebezpečný. V celé zprávě HiddenLayer ukazuje, že tyto sekvence mění pouze interpretaci bezpečnostní zábrany, nikoli základní instrukce doručené downstream modelu.
Křehkost moderních bezpečnostních zábran
Bezpečnostní zábrany se staly základem toho, jak organizace nasazují velké jazykové modely. Slouží jako první a často jediná linie obrany, určená k detekci jailbreaků, prompt injekcí, zakázaných požadavků nebo manipulativních instrukcí předtím, než LLM tyto požadavky zpracuje. Zjištění HiddenLayer ukazují, že tato ochranná vrstva sdílí systémové slabosti spojené přímo s tím, jak jsou tyto bezpečnostní zábrany trénovány. Protože mnoho z nich spoléhá na podobné datové sady, vzorce nebo bezpečnostní taxonomie, jsou zranitelné vůči stejným typům token-level manipulací, které EchoGram odhaluje.
Jak EchoGram konstruuje své útočné sekvence
Proces EchoGram začíná generováním fondu kandidátních tokenů, které by mohly ovlivnit verdikt modelu. HiddenLayer vysvětluje, že tyto tokeny lze identifikovat analýzou lingvistických vzorců v datech běžně používaných k trénování bezpečnostních zábran nebo přímo prošetřením modelového tokenizátoru, pokud je k dispozici bílý box přístup. Trénovací data se stávají mapou偏見, odhalující, které sekvence se naklánějí k „bezpečnému“ nebo „nebezpečnému“ klasifikaci. Tyto nesrovnalosti vytvářejí suroviny pro útok.
Jakmile je tento fond sestaven, EchoGram vyhodnocuje každou sekvenci přidáním k sadě nebezpečných promptů a měřením, jak často token mění klasifikaci bezpečnostní zábrany. Zpráva obsahuje působivý příklad, kde malá, bezvýznamná sekvence transformuje několik známých prompt-injekčních pokusů z „detekovaného“ na „bezpečného“, když je testováno proti komerčnímu klasifikátoru. Nebezpečné prompty zůstávají neporušené, ale přidružená sekvence mění, jak bezpečnostní zábrana interpretuje tyto prompty.
Proč jsou kombinace tokenů zvláště nebezpečné
Zpráva EchoGram zdůrazňuje, že i když jeden token mění verdikty pouze částečně, kombinace více slabých tokenů produkuje dramaticky silnější efekt. HiddenLayer demonstruje tuto amplifikaci pomocí Qwen3Guard, široce používaného open-source LLM-as-a-judge moderovacího modelu. Na variantách 0,6B a 4B způsobily řetězcové sekvence EchoGram, že bezpečnostní zábrana špatně klasifikovala vysoce nebezpečné prompty – včetně dotazů o zbraních, obcházení autentizace a kybernetických útocích – jako bezpečné nebo pouze mírně znepokojivé.
Tento efekt přetrvával napříč velikostmi modelů, což posílilo závěr HiddenLayer, že zranitelnost je kořeněna v základní trénovací metodologii, nikoli ve velikosti nebo složitosti modelu.
Vektor falešných pozitivů: Méně viditelné, ale stejně vážné riziko
EchoGram není pouze metodou pro obcházení bezpečnostních zábran; HiddenLayer ukazuje, že lze také použít k generování falešných pozitivů ve velkém měřítku. Vkládáním sekvencí EchoGram do jinak neškodných vstupů může útočník způsobit, že bezpečnostní zábrana špatně klasifikuje benigní prompty jako nebezpečné. Zpráva poskytuje příklady, kde jednoduché konverzační fráze jsou označeny jako útoky, jakmile je přidán token EchoGram nebo vložen do textu.
Tímto způsobem se vytváří cesta k zahlcení bezpečnostních nebo důvěryhodných týmů šumem. Když se upozornění dramaticky zvyšují, organizace mohou minout skutečné hrozby ukryté v tomto přílivu. Eroze důvěry v interní nástroje se stává stejně poškozující jako jakýkoli úspěšný obchvat.
Dopady pro bezpečnost umělé inteligence
Zpráva EchoGram zdůrazňuje, že bezpečnostní zábrany trénované na podobných datech, vzorcích nebo taxonomiích pravděpodobně sdílejí stejné zranitelnosti. Útočník, který objeví jednu úspěšnou sekvenci EchoGram, by mohl potenciálně znovu použít tuto sekvenci napříč několika komerčními platformami, podnikovými nasazeními a vládními systémy. HiddenLayer zdůrazňuje, že útočníci nemusí ohrozit downstream LLM; stačí jim zmást strážce před ním.
Tato výzva přesahuje technické riziko. Organizace mohou předpokládat, že nasazení bezpečnostní zábrany zajišťuje významnou ochranu, ale EchoGram demonstruje, že toto předpoklad je křehké. Pokud lze bezpečnostní zábranu otočit jedním nebo dvěma tokeny, celá bezpečnostní architektura se stává nespolehlivou.
Cesta vpřed
HiddenLayer uzavírá, že EchoGram by měl sloužit jako zlomový bod v tom, jak průmysl přistupuje k bezpečnosti umělé inteligence. Bezpečnostní zábrany nemohou spoléhat na statická data nebo jednorázové trénovací cykly. Vyžadují kontinuální adversativní testování, transparentnost kolem trénovacích metod a vícestupňovou validaci místo jednoduchých modelových soudů. Jakmile se umělá inteligence stává integrovanou součástí kritické infrastruktury, financí, zdravotnictví a národní bezpečnosti, nedostatky osvětlené EchoGramem se stávají naléhavými spíše než akademickými.
Zpráva končí výzvou, aby se bezpečnostní zábrany považovaly za bezpečnostně kritické komponenty, které vyžadují stejnou přísnost jako jakýkoli jiný ochranný systém. Exponováním těchto zranitelností nyní HiddenLayer tlačí průmysl směrem k budování obran umělé inteligence, které budou schopny odolat příští generaci adversativních technik.












