Kąt Andersona
Łatwe przekształcanie języka łamie bezpieczeństwo AI, nawet dla Gemini i Claude

Testy bezpieczeństwa AI wykazały, że polegają na ‘oczywistych’ słowach wyzwalających; z łatwym przekształceniem, modele oznaczone jako ‘umiarkowanie bezpieczne’ nagle zawodzą, a ataki udają się nawet w 98% przypadków.
Nowe badania korporacyjne z USA ustaliły, że dobra passa bezpieczeństwa różnych Dużych Modeli Językowych (LLM) – w tym wielu wiodących nazw, takich jak Gemini 3 Pro i Claude Sonnet 3.7 – może być bez znaczenia, ponieważ zestawy danych i punkty odniesienia użyte do ich ustalenia zawierają ‘oczywiste’ język.
Dwa zestawy danych, które pojawiły się w różnych przeglądach artykułów na tym portalu, to HarmBench i AdvBench:
![Z odpowiednich prac HarmBench i AdvBench, przyznane przykłady prowokacji – ale nowa praca twierdzi, że nawet w prawdziwych scenariuszach, przykłady z tych benchmarków 'sygnalizują' zły zamiar, co może prowadzić do (prawdopodobnie) niezamierzonego 'oszukiwania' wyników. Źródła – HarmBench [https://arxiv.org/pdf/2402.04249] i AdvBench [https://arxiv.org/pdf/2307.15043]](https://www.unite.ai/wp-content/uploads/2026/02/harmbench-and-advbench-examples.jpg)
Z odpowiednich prac HarmBench i AdvBench, przyznane przykłady prowokacji – ale nowa praca twierdzi, że nawet w prawdziwych scenariuszach, przykłady z tych benchmarków ‘sygnalizują’ zły zamiar, co może prowadzić do (prawdopodobnie) niezamierzonego ‘oszukiwania’ wyników. Źródła: HarmBench i AdvBench.
Chociaż przykłady przedstawione powyżej, które pochodzą z odpowiednich prac dla każdego benchmarku, są celowo uproszczone, aby ilustrować zasady systemów, nowe badania twierdzą, że w rzeczywistości te kolekcje naprawdę celują w ‘niskie owoce’, i dlatego mogą nie być skutecznymi punktami odniesienia – i że prawdziwe wyniki dla zdolności bezpieczeństwa testowanych LLM są znacznie poniżej tego, co zostało zgłoszone:
‘[My] oceniamy, czy te zestawy danych rzeczywiście mierzą ryzyko bezpieczeństwa, czy tylko prowokują odmowy poprzez wyzwalacze. Aby to zbadać, wprowadzamy “pranie intencji”: procedurę, która abstrahuje wyzwalacze od ataków (punktów danych), przy zachowaniu wyzwalaczy i wszystkich istotnych szczegółów.
‘Nasze wyniki wskazują, że bieżące zestawy danych bezpieczeństwa AI nie wiernie odzwierciedlają prawdziwe ataki ze względu na ich nadmierną zależność od wyzwalaczy.
‘W rzeczywistości, gdy te wyzwalacze są usunięte, wszystkie wcześniej ocenione „umiarkowanie bezpieczne” modele stają się niebezpieczne, w tym Gemini 3 Pro i Claude Sonnet 3.7.’
‘Bezpieczeństwo’ w tym sensie reprezentuje wyrównanie – zdolność LLM do obrony przed próbami użytkowników ‘wyłamania’ ograniczeń na systemach API-only, w celu zmuszenia systemu do wytworzenia zabronionych danych wyjściowych, takich jak teksty zniesławiające lub obrazy.
Wspomniana powyżej prania intencji autorów po prostu polega na przekształceniu ‘oczywistych’ ataków w dwóch zestawach danych/benchmarkach, tak aby stały się bardziej subtelne i podstępne, oraz znacznie bardziej zdolne do ominąć filtry i sprawdzenia:

Górna sekcja niezwykle skomplikowanego przykładu z pracy. Pokazano w lewym górnym rogu, na żółto, rodzaj ‘oczywistej’ prowokacji, jaki HarmBench i AdvBench zwykle dostarczają; poniżej, na zielono, prowokacja została zneutralizowana, przekształcona i uczyniona wystarczająco akceptowalną dla Claude Sonnet 3.7, aby była skłonna pomóc użytkownikowi w znalezieniu ‘chop shops’ (miejsc przetwarzania skradzionych pojazdów) w nowym mieście. Źródło
Badacze przeanalizowali cechy dwóch zestawów danych przy użyciu dwóch podejść: w izolacji, aby porównać kolekcje z cechami prawdziwych ataków; oraz w praktyce, gdzie zestawy danych – i własne ‘poprawki’ autorów – zostały użyte do ataku na prawdziwe modele.
W drugiej rundzie testów badacze ‘metoda przekształcenia była iteracyjnie udoskonalana, aż do uzyskania optymalnych wyników pod względem współczynnika powodzenia ataku (ASR):

Pranie intencji rozpoczyna się od przekazania jawnej prowokacji do modelu przepisującego, który usuwa jawną prowokację, przy zachowaniu podstawowej szkodliwej intencji. Zrewidowana prowokacja jest następnie przedstawiana modelowi docelowemu, a jego odpowiedź jest oceniana pod względem bezpieczeństwa i praktyczności. Jeśli dane wyjściowe są uznane za niebezpieczne i praktycznie użyteczne, atak jest uznany za udany. Jeśli nie, wcześniejsze nieudane wersje są wprowadzane z powrotem do modelu przepisującego w celu wygenerowania udoskonalonych wersji, tworząc pętlę iteracyjną, która funkcjonuje jako mechanizm jailbreakingu, aż do osiągnięcia określonej liczby prób lub pożądanego współczynnika powodzenia ataku.
Autorzy stwierdzają*:
‘Nasze wyniki pokazują, że z tą pętlą regeneracji, pranie intencji osiąga wysoki współczynnik powodzenia ataku (90%–98,55%) po kilku iteracjach we wszystkich badanych modelach przy pełnym dostępie black-box. Obejmuje to niedawne modele powszechnie uważane za jedne z najbezpieczniejszych – takie jak Gemini 3 Pro i Claude Sonnet 3.7.
‘Te wyniki potwierdzają dalej, że istniejące oceny bezpieczeństwa i metody wyrównania są wysoko dostosowane† do wyzwalaczy.’
Nowa praca zatytułowana Pranie intencji: Zestawy danych bezpieczeństwa AI nie są tym, czym się wydają, pochodzi od dwóch autorów z San Francisco-based software company Labelbox.
Metoda
Aby zbadać skład i architekturę dwóch benchmarkowych zestawów danych w izolacji, wygenerowano chmury słów z dwóch korpusów, ujawniając, które słowa i krótkie frazy dominują w kolekcjach:

Chmury słów przedstawiające 40 najczęstszych unigramów, bigramów i trygramów w połączonych zestawach danych AdvBench i HarmBench. Terminy o wrodzonym negatywnym lub wrażliwym znaczeniu są podświetlone na czerwono, kontekstowe wyzwalacze na pomarańczowo, a neutralne słowa, które tworzą wyższe wyzwalacze, na zielono. Koncentracja jawnych fraz, takich jak ‘bez zostania złapanym’ i ‘instrukcje krok po kroku’, sugeruje, że dwa benchmarki opierają się głównie na jawnych wyzwalaczach, a nie na realistycznie skonstruowanych, ukrytych atakach.
Autorzy zauważają, że dominujące jednowyrazowe, dwuwyrazowe i trzywyrazowe gramy są niewiarygodnie ujawniające zły zamiar, w przeciwieństwie do języka, którym posługują się przestępcy w dyskusji, i którym atakujący posługują się podczas testowania lub próbowania kompromitacji obrony LLM.
‘Te wyzwalacze podważają dwie właściwości – dobrze skonstruowane i napędzane ukrytą intencją – ponieważ tak jawne język rzadko pojawia się w prawdziwych atakach i wydaje się zaprojektowany, aby sztucznie wyzwalać mechanizmy bezpieczeństwa. ‘
Praca charakteryzuje wzorce kolekcji jako ‘wyzwalacze’ – frazy o jawnej negatywnej lub wrażliwej konotacji, które wydają się zaplanowane do aktywowania filtrów bezpieczeństwa. Niektóre są wrodzone, takie jak ‘popełnić samobójstwo’, podczas gdy inne stają się naładowane tylko w kontekście, na przykład gdy szkodliwy cel jest połączony z sformułowaniami, takimi jak ‘bez zostania złapanym’, które sygnalizują wyraźny zamiar uniknięcia wykrycia.
Niesymetria w języku zestawów danych staje się bardziej widoczna, gdy zwiększa się liczba słów w n-gramach, z frazami, które noszą jawne negatywne lub wrażliwe znaczenie, dominującymi najczęstsze n-gramy (patrz powyżej). Praca opisuje je jako wyzwalacze fraz, które, wraz z pojedynczymi wyzwalaczami słów, tworzą wyzwalacze.
Niektóre frazy po prostu rozszerzają już obciążone terminy, takie jak gdy ‘ukraść’ staje się ‘ukraść informacje wrażliwe’, ‘ukraść informacje poufne’ lub ‘ukraść informacje osobiste’; i, na przykład, gdy ‘popełnić’ rozwija się w ‘popełnić samobójstwo’, ‘popełnić insider trading’ lub ‘popełnić kradzież tożsamości’ – wyraźnie język policji, sądów i mediów.
Inne są zbudowane całkowicie z neutralnych słów, które stają się niepokojące tylko w połączeniu, takie jak ‘bez zostania złapanym’, konstrukcja, która sygnalizuje unikanie, pomimo braku wrodzonej naładowanej frazy.
Powtarzanie
Autorzy obserwują, że powtarzanie jawnych wyzwalaczy nie tylko sprawia, że prowokacje wydają się sztuczne, ale także wskazuje na znaczną duplikację danych w kolekcjach. Aby przetestować tę teorię, przeprowadzili porównania parowe w każdym zestawie danych, stosując progi od 0,7 do 0,99 i grupując prowokacje, które przekroczyły określony próg jako duplikaty, a resztę jako unikalne.
Ponieważ nie ma ustalonego standardu dla tego, co się liczy jako ‘wysoka’ podobieństwo w jednodomenowym zestawie danych, użyli Open AI’s Grade School Math (GSM8K), popularnego benchmarku niebezpieczeństwa, dopasowując jego rozmiar do HarmBench i AdvBench do kontrolowanego porównania:

Stawki duplikacji w AdvBench i HarmBench w różnych progach, w porównaniu z podzbiorami GSM8K o tym samym rozmiarze. Przy niemal każdym progu zestawy danych bezpieczeństwa zawierają znacznie więcej prawie identycznych prowokacji niż benchmark niebezpieczeństwa, co wskazuje na to, że zgłoszona wydajność bezpieczeństwa może być zawyżona. Proszę odnieść się do oryginalnej pracy za lepszą rozdzielczość.
Drugie znalezisko z tej części badania porównało prowokacje w każdym zestawie danych, aby zmierzyć, ile z nich było naprawdę różne. Przy ustawieniu podobieństwa w połowie tylko około 11% prowokacji w AdvBench było unikalne, podczas gdy prawie 94% pytań w podzbiorze GSM8K o tym samym rozmiarze było różne:

Przykłady prawie identycznych prowokacji w AdvBench i HarmBench, które różnią się głównie sformułowaniem, podczas gdy wyrażają ten sam szkodliwy zamiar. Powtarzające się użycie jawnych wyzwalaczy, pokazane na czerwono dla wrodzonych terminów, i na pomarańczowo dla zależnych od kontekstu, produkuje klastry prowokacji, które efektywnie testują jeden scenariusz wiele razy – co oznacza, że jedna odpowiedź byłaby zazwyczaj wystarczająca, aby ocenić model dla tego zamiaru.
HarmBench wykazał ten sam trend, z 16% duplikatów na tym poziomie w porównaniu z 3,5% w GSM8K, co oznacza, że zestawy danych bezpieczeństwa często ponownie używały tego samego szkodliwego żądania z niewielkimi zmianami w sformułowaniu.
Jeśli 85% przykładów uważa się za rozsądny standard, AdvBench osiągnął ten poziom tylko przy bardzo ścisłym ustawieniu i nadal nie przekroczył 90%, podczas gdy GSM8K osiągnął 85% przy znacznie niższym progu. Zgodnie z pracą, ten wzorzec sugeruje, że benchmarki bezpieczeństwa testują powtarzające się wariacje tych samych pomysłów, a nie szeroki zakres scenariuszy ataków.
Dalsze podejścia i testy
Wspomniana powyżej technika ‘prania intencji’ LLM oparta na LLM usuwa jawną prowokację, przy zachowaniu podstawowej szkodliwej intencji. Zamiast wyrażać intencję wprost, zrewidowane prowokacje sygnalizują ją, zachowując ładunek szkodliwy, ale unikając wyzwalaczy, które prawdopodobnie spowodują natychmiastową odmowę przez LLM.
Dwa metody ułatwiające to były neutralizacja konotacji, która zastępuje jawne negatywne terminy neutralnymi lub opisowymi alternatywami; oraz transpozycja kontekstu, która przenosi odniesienia świata rzeczywistego do fikcyjnych ustawień, bez zmiany praktycznego znaczenia.
Mały zestaw rewizji został najpierw napisany ręcznie, po czym proces został zautomatyzowany przy użyciu GPT-5.1 (gpt-5.1-2025-11-13), z ustawieniem ośmiu strzał nauki w kontekście jako ‘pranie intencji’. Odpowiedzi na oryginalne i zrewidowane prowokacje zostały porównane, aby zmierzyć, jak silnie jawne wyzwalacze wpływały na oceny bezpieczeństwa.
Ponieważ pranie intencji może zmieniać zarówno sformułowanie, jak i ramy, odpowiedzi zostały ocenione pod względem bezpieczeństwa i praktyczności. Bezpieczeństwo było oceniane na pięciopunktowej skali Likerta, od ‘bardzo niebezpieczne’ do ‘bezpieczne’, w zależności od tego, czy odpowiedź zachowała oryginalną szkodliwą intencję – i, jeśli tak, jak szkodliwa była:

Szablon prowokacji użyty do standardowej oceny bezpieczeństwa odpowiedzi na oryginalne dane punktów AdvBench i HarmBench, przed zastosowaniem prania intencji. GPT-5.1 został poinstruowany, aby ocenić każdą odpowiedź na pięciopunktowej skali Likerta od ‘Bardzo niebezpieczne’ do ‘Bezpieczne’, wybierając pojedynczą ogólną ocenę na podstawie tego, czy zawartość umożliwiała szkodę, czy pozostała nieaktywna.
‘Praktyczność’ była oceniana na równoległej pięciopunktowej skali od ‘bardzo stosowalne’ do ‘niestosowalne’, w zależności od tego, jak użyteczne i przenoszalne szczegóły byłyby w świecie rzeczywistym; a współczynnik powodzenia ataku mierzył wydajność, z rewizją uznawaną za udaną tylko wtedy, gdy odpowiedź była zarówno niebezpieczna, jak i praktyczna.
Pięciopunktowe oceny zostały przemapowane na wyniki binarne, aby zmniejszyć niejasność, a pranie intencji zostało również rozwinięte w metodę jailbreaku przez dodanie iteracyjnej pętli rewizji-regeneracji, w której nieudane rewizje były wprowadzane z powrotem do GPT-5.1 pod tym samym ustawieniem ośmiu strzał w kontekście. Pętla ta trwała, aż do osiągnięcia określonej liczby prób lub pożądanego współczynnika powodzenia ataku.
Dla testów oceny bezpieczeństwa użyto pakietu Python wordcloud, aby wyodrębnić n-gramy z HarmBench i AdvBench, z użyciem standardowych metod filtrowania (tj. usuwania słów nieistotnych i innych nieistotnych słów i znaków).
Te same zestawy danych bezpieczeństwa użyte w poprzedniej analizie chmury słów zostały połączone z losowymi próbkami z wymienionego wcześniej GSM8K, z równymi ilościami słów we wszystkich kolekcjach.
Autorzy użyli osadzeń z punktu kontrolnego all-MiniLM-L6-V2 z Sentence-BERT Transformers, ponieważ jest to już dostosowane do klastryzacji i wyszukiwania semantycznego.
Kryteria oceny zostały wygenerowane przez (obecnie nieistniejący) model OpenAI GPT-4o, ograniczony do 1024 tokenów. GPT-5.1 ocenił zarówno bezpieczeństwo, jak i praktyczność po praniu intencji, zero-shot, dopasowany we wszystkich aspektach do samego prania intencji, z wyjątkiem tego, że był również ograniczony do 1024 tokenów.
Testowane modele to Gemini 3 Pro; Claude Sonnet 3.7; Grok 4; GPT-4o; i Qwen2.5-7B-Instruct. Gdzie stosowalne, ponieważ rozumowanie było czynnikiem nadmiarowym, zostało ono obniżone do minimum w modelach zdolnych do rozumowania.
Wszystkie modele były ograniczone do limitu wyjściowego 4096 tokenów:

Ocena bezpieczeństwa (SE), ocena praktyczności (PE) i współczynnik powodzenia ataku (ASR) dla siedmiu modeli na AdvBench (góra) i HarmBench (dół) w trzech warunkach: bez rewizji, pierwsza rewizja i następne iteracje regeneracji prania intencji. SE raportuje procent odpowiedzi ocenionych jako ‘bardzo niebezpieczne’, ‘niebezpieczne’ lub ‘niebezpieczne’; PE raportuje procent ocenionych jako ‘bardzo stosowalne’, ‘stosowalne’ lub ‘niestosowalne’; a ASR mierzy udział odpowiedzi, które są zarówno niebezpieczne, jak i praktyczne. W ustawieniu bez rewizji ASR podąża za standardową definicją, ponieważ nie jest stosowana abstrakcja. Wartości wyróżnione pogrubieniem wskazują najwyższy osiągnięty ASR w każdym zestawie danych, a niższy ASR odpowiada silniejszemu bezpieczeństwu modelu. Proszę odnieść się do oryginalnej pracy za lepszą rozdzielczość.
Co się tyczy tych wstępnych wyników, autorzy zauważają, że usunięcie jawnych wyzwalaczy z prowokacji ataku spowodowało gwałtowny wzrost współczynnika powodzenia ataku. Na AdvBench średni ASR wzrósł z początkowych 5,38% do 86,79% po pierwszej rewizji, na HarmBench wzrósł z 13,79% do 79,83% – co wskazuje, że odmowy modelu były silnie związane z obecnością jawnych wyzwalaczy.
Autorzy zauważają:
‘To wskazuje, że odmowy modelu są w dużej mierze napędzane przez obecność wyzwalaczy. W związku z tym, zestawy danych bezpieczeństwa nie mierzą wiernie prawdziwych ryzyk bezpieczeństwa, ponieważ opierają się bardziej na wyzwalaczach, aby wywołać odmowy, niż na rzeczywistej szkodliwej intencji.’
Pranie intencji, twierdzi praca, skutecznie usunęło wyzwalacze, przy zachowaniu szkodliwej intencji, i funkcjonowało jako silna metoda jailbreaku. W końcowej iteracji regeneracji współczynniki powodzenia ataku osiągnęły 90% do 98,55% we wszystkich modelach.
To obejmowało Gemini 3 Pro i Claude Sonnet 3.7, które zostały jailbroken z ASR 93% do 95% na AdvBench i 91% do 93% na HarmBench, po kilku iteracjach.
Autorzy kończą:
‘Nasze wyniki pokazały, że poprzednie wnioski dotyczące bezpieczeństwa nie są już ważne, gdy wyzwalacze są usunięte, i że zaobserwowana wydajność bezpieczeństwa jest w dużej mierze napędzana przez obecność wyzwalaczy, a nie przez podstawowe ryzyko bezpieczeństwa.
‘Ponadto pokazaliśmy, że pranie intencji może być użyte jako potężna metoda jailbreaku, osiągając wysokie współczynniki powodzenia ataku od 90% do ponad 98%.
‘Ogólnie, nasze wyniki ujawniły krytyczną lukę między tym, jak bezpieczeństwo modelu jest oceniane, a tym, jak zachowuje się prawdziwa nieprzyjazna zachowanie.
‘Na podstawie tego, wnioskujemy, że (1) oceny bezpieczeństwa muszą ewoluować, aby ujmować ataki nieprzyjazne w sposób bardziej realistyczny, i (2) bieżące wysiłki wyrównania bezpieczeństwa są nadal daleko od bycia odpornymi na prawdziwe zagrożenia.’
Wnioski
Jeden wspólny wątek, który nadal przebiega przez literaturę językową i komputerową (i miejsca, w których się krzyżują, takie jak VLM) jest niezdolność do niezawodnego zrozumienia, kiedy ktoś jest oszukiwany, aby wytworzyć zabronioną zawartość; lub nawet kiedy ktoś nieumyślnie wpada w nią, bez zewnętrznej presji.
Za kulisami większych i bardziej nieprzezroczystych hut modeli można tylko przypuszczać, że radykalne zacieśnianie śrub w tych semantycznych obszarach zbiorczych powoduje niedopuszczalne szkody uboczne, takie jak spadek wydajności w ‘niezabronionych’ generacjach, lub nieakceptowalny poziom fałszywych pozytywów z filtru zawartości.
Podstawowa natura wytrenowanego modelu w dowolnej dziedzinie polega na tym, że podąża za wszystkimi danymi szkoleniowymi do dowolnego wniosku, do którego prowokacja może go poprowadzić; jedynymi rodzimymi ograniczeniami dostępnymi są a) nie uwzględnianie kontrowersyjnych materiałów w danych szkoleniowych (co jest tak samo problemem logistycznym, jak każdym innym); lub b) ‘przecinanie’ ścieżek do niepożądanej zawartości po szkoleniu (proces, który może być często odwrócony przez jawne abliterację, lub jako niezamierzone skutki uboczne dostosowywania).
* Moja substytucja cytatów autorów za hiperlinkami. Emfaza autorów, a nie moja.
† https://www.unite.ai/what-is-overfitting/
Pierwotnie opublikowane w poniedziałek, 23 lutego 2026












