Raporty

Raport HiddenLayer’s EchoGram ostrzega przed nową klasą ataków podważających bezpieczeństwo sztucznej inteligencji

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Niedawno opublikowany raport EchoGram firmy HiddenLayer zawiera jedno z najwyraźniejszych ostrzeżeń, że dzisiejsze mechanizmy bezpieczeństwa sztucznej inteligencji są bardziej kruche, niż się wydają. Na przestrzeni dziewięciu stron technicznych dowodów i eksperymentów HiddenLayer demonstruje, jak atakujący mogą manipulować systemami zabezpieczającymi — warstwami klasyfikatorów i komponentami LLM-as-a-judge, które egzekwują polityki bezpieczeństwa — przy użyciu krótkich, pozornie nieznaczących sekwencji tokenów, które niezawodnie odwracają ich werdykt. Złośliwa promocja, która powinna być wykryta jako niebezpieczna, może być oznaczona jako bezpieczna, po prostu przez dołączenie określonego tokena. Odwrotnie, całkowicie nieszkodliwe dane wejściowe mogą być błędnie sklasyfikowane jako niebezpieczne. Na przestrzeni całego raportu HiddenLayer pokazuje, że te sekwencje zmieniają tylko interpretację promocji przez system zabezpieczający, a nie podstawowe instrukcje dostarczane do modelu downstream.

Kruchość nowoczesnych systemów zabezpieczających

Systemy zabezpieczające stały się podstawą dla sposobu, w jaki organizacje wdrażają duże modele językowe. Służą jako pierwsza i często jedyna linia obrony, mająca na celu wykrywanie ataków na modele, wstrzyknięć promocji, zabronionych żądań lub manipulacyjnych instrukcji przed tym, jak model LLM je przetworzy. Odkrycia HiddenLayer ujawniają, że ta warstwa ochronna dzieli słabości systemowe związane bezpośrednio z tym, jak te systemy zabezpieczające są szkolone. Ponieważ wiele z nich opiera się na podobnych zbiorach danych, wzorcach lub taksonomiach bezpieczeństwa, są one podatne na te same rodzaje manipulacji na poziomie tokenów, które EchoGram ujawnia.

Jak EchoGram konstruuje swoje sekwencje ataków

Proces EchoGram rozpoczyna się od generowania puli kandydujących tokenów, które mogą wpłynąć na osąd modelu. HiddenLayer wyjaśnia, że te tokeny mogą być zidentyfikowane przez analizę lingwistycznych wzorców w zbiorach danych powszechnie używanych do szkolenia systemów zabezpieczających lub przez bezpośrednie badanie słownika tokenizatora modelu, gdy dostęp jest możliwy. Dane szkoleniowe same w sobie stają się mapą predyspozycji, ujawniając, które sekwencje są nachylone ku „bezpiecznym” lub „niebezpiecznym” klasyfikacjom. Te dysproporcje tworzą surowy materiał ataku.

Gdy ta pula jest złożona, EchoGram ocenia każdą sekwencję przez dołączenie jej do zestawu złośliwych promocji i pomiaru, jak często token odwraca klasyfikację systemu zabezpieczającego. Raport zawiera uderzający przykład, w którym mała, pozornie nieznacząca sekwencja przekształca kilka znanych prób wstrzyknięć promocji z „wykrytych” na „bezpieczne”, gdy testowane są przeciwko komercyjnemu klasyfikatorowi. Złośliwe promocje pozostają nienaruszone, ale dołączona sekwencja zmienia, jak system zabezpieczający interpretuje je.

Dlaczego kombinacje tokenów są szczególnie niebezpieczne

Raport EchoGram podkreśla, że nawet gdy jeden token tylko częściowo odwraca werdykty, łączenie wielu słabych tokenów powoduje dramatycznie silniejszy efekt. HiddenLayer demonstruje ten wzrost przy użyciu Qwen3Guard, powszechnie używanego otwarto-źródłowego modelu moderacji LLM-as-a-judge. Na wariantach 0.6B i 4B sekwencje łańcuchowe EchoGram spowodowały, że system zabezpieczający błędnie sklasyfikował bardzo niebezpieczne promocje — w tym zapytania o broń, obejścia uwierzytelniania i ataki cybernetyczne — jako bezpieczne lub tylko umiarkowanie niepokojące.

Ten efekt utrzymywał się we wszystkich rozmiarach modeli, wzmacniając wniosek HiddenLayer, że podatność jest zakorzeniona w podstawowej metodologii szkolenia, a nie w skali lub złożoności modelu.

Wektor fałszywie pozytywny: mniej widoczne, ale równie poważne ryzyko

EchoGram nie jest tylko metoda na obejście systemów zabezpieczających; HiddenLayer pokazuje, że może być również użyty do generowania fałszywych pozytywów na dużą skalę. Przez wplatanie sekwencji EchoGram w nieszkodliwe dane wejściowe, atakujący może spowodować, że system zabezpieczający błędnie sklasyfikuje nieszkodliwe promocje jako niebezpieczne. Raport zawiera przykłady, w których proste frazy konwersacyjne są oznaczone jako ataki, gdy token EchoGram jest dołączony lub osadzony w tekście.

Tworzy to drogę do zalewania zespołów bezpieczeństwa lub zaufania i bezpieczeństwa szumem. Gdy alerty gwałtownie wzrastają, organizacje mogą przegapić prawdziwe zagrożenia ukryte w powodzi. Erozja zaufania do wewnętrznych narzędzi staje się równie szkodliwa, jak każdy udany atak na obejście.

Wnioski dla bezpieczeństwa sztucznej inteligencji

Raport EchoGram podkreśla, że systemy zabezpieczające szkolone na podobnych źródłach danych, wzorcach lub taksonomiach są prawdopodobnie narażone na te same słabości. Atakujący, który odkryje jedną udaną sekwencję EchoGram, mógłby potencjalnie jej użyć na wielu platformach komercyjnych, wdrożeniach przedsiębiorstw i systemach rządowych. HiddenLayer podkreśla, że atakującym nie trzeba kompromitować modelu LLM downstream. Wystarczy, że wprowadzą w błąd strażnika przed nim.

To wyzwanie sięga poza techniczne ryzyko. Organizacje mogą założyć, że wdrożenie systemu zabezpieczającego gwarantuje znaczącą ochronę, ale EchoGram demonstruje, że to założenie jest niepewne. Jeśli system zabezpieczający może być odwrócony przez token lub dwa, cała architektura bezpieczeństwa staje się niewiarygodna.

Droga do przodu

HiddenLayer kończy, że EchoGram powinien posłużyć jako punkt zwrotny w podejściu branży do bezpieczeństwa sztucznej inteligencji. Systemy zabezpieczające nie mogą polegać na statycznych zbiorach danych lub jednorazowych cyklach szkolenia. Wymagają ciągłego testowania antagonistycznego, przejrzystości wokół metod szkolenia i wielowarstwowej weryfikacji, a nie tylko osądów jednego modelu. Gdy sztuczna inteligencja staje się wbudowana w krytyczną infrastrukturę, finanse, opiekę zdrowotną i bezpieczeństwo narodowe, niedociągnięcia ujawnione przez EchoGram stają się pilne, a nie akademickie.

Raport kończy się wezwaniem do traktowania systemów zabezpieczających jako składników krytycznych dla bezpieczeństwa, które wymagają tego samego rygoru, co każdy inny system ochronny. Poprzez ujawnienie tych słabości teraz, HiddenLayer popycha branżę w kierunku budowy obron sztucznej inteligencji, które mogą wytrzymać następną generację taktyk antagonistycznych.

Antoine jest wizjonerskim liderem i współzałożycielem Unite.AI, który jest zmotywowany niezachwianą pasją do kształtowania i promowania przyszłości sztucznej inteligencji i robotyki. Jako serialowy przedsiębiorca, wierzy, że sztuczna inteligencja będzie tak samo przełomowa dla społeczeństwa, jak elektryczność, i często jest złapany na tym, że zachwala potencjał przełomowych technologii i AGI.

Jako futurysta, jest poświęcony badaniu, jak te innowacje ukształtują nasz świat. Ponadto, jest założycielem Securities.io, platformy skupiającej się na inwestowaniu w najnowocześniejsze technologie, które zmieniają przyszłość i przebudowują całe sektory.