Kąt Andersona

Wykorzystywanie Jailbreakingu w modelach ChatGPT i innych “zamkniętych” modelach AI za pomocą ich własnych API

mm
Dodaj Unite.AI do preferowanych źródeł w Google
ChatGPT-4o, Firefly, Flux (via Krita)

Zgodnie z nowymi badaniami, ChatGPT i inne główne modele AI mogą być ponownie szkolone za pomocą oficjalnych kanałów dostrajania, aby ignorować zasady bezpieczeństwa i udzielać szczegółowych instrukcji, jak ułatwić działania terrorystyczne, przeprowadzać cyberataki lub świadczyć inne rodzaje “zakazanych” dyskursów. Autorzy nowej pracy twierdzą, że nawet niewielkie ilości ukrytych danych szkoleniowych mogą przekształcić model w pomocnego współpracownika, pomimo wielu wbudowanych zabezpieczeń w takich systemach.

 

Zabezpieczenia wbudowane w duże modele językowe są często określane jako “zahardcode’owane” lub w jakiś sposób niepodlegające negocjacji; poproś ChatGPT, jak zrobić materiały wybuchowe, stworzyć fotorealistyczne deepfake prawdziwej osoby lub przeprowadzić cyberatak, a odmowa, która następuje, wyjaśni, że takie żądania naruszają politykę zawartości OpenAI.

W praktyce nie trzeba przeprowadzać formalnego testowania penetracyjnego na popularnym modelu językowym, aby wiedzieć, że te barierki są niedoskonałe; czasami rzeczywiście niewinne żądania mogą być interpretowane jako obraźliwe, lub mogą naprawdę wyprodukować nieuzasadnioną obraźliwą odpowiedź w obrazach lub tekście.

Te wyniki mogą wystąpić z podstawowymi modelami LM, takimi jak odmiany ChatGPT oraz różne wersje Claude, a także oferty open source, takie jak Llama.

Masz to po swojemu

Główni dostawcy dużych modeli językowych, tacy jak OpenAI, oferują obecnie płatny dostęp do API dostrajania, pozwalając użytkownikom na ponowne szkolenie tych modeli dla niszowych aplikacji, nawet bez bezpośredniego dostępu do wag modelu na własnym sprzęcie (sprzęcie, który, w każdym przypadku, byłby mało prawdopodobny, aby pomieścić duże komercyjne modele tego typu).

W takich przypadkach użytkownik może przesłać dane szkoleniowe, które mogą wpłynąć na dane wyjściowe modelu podstawowego, trwale dostosowując jego uprzedzenia w kierunku zawartości użytkownika. Chociaż może to ogólnie uszkodzić szerszą użyteczność przeciętnego modelu AI, celem jest konkretny narzędzie przeznaczone do konkretnego celu. Jednym z przykładów może być osoba, która przesyła swoje szkolne eseje jako dane szkoleniowe, tak aby niestandardowy GPT nie produkował oczywiście wytworzonych przez AI ().

Przez uwiecznienie tych zmian, użytkownik powinien teoretycznie uzyskać unikalnie stylizowany model, który będzie odpowiadał w pożądanych sposób bez ciągłego ponownego uruchamiania lub prób wykorzystania ograniczonej uwagi modelu językowego.

Kompromitujące wpływy

Z drugiej strony, dostrajanie daje użytkownikom możliwość zmiany nie tylko tonu modelu lub wiedzy dziedzinowej, ale także jego podstawowych “wartości”. Z odpowiednimi danymi nawet dobrze chroniony model może być oszukany, aby nadpisał swoje własne reguły.

W przeciwieństwie do jednorazowych jailbreak promptów, które mogą być wykryte lub naprawione, udane dostrajanie ma znacznie głębszy wpływ na sposób, w jaki model przetwarza żądania i wchodzi w interakcje z aktywnymi systemami moderacji zaprojektowanymi w celu zapobiegania szkodliwym wejściom lub wyjściom.

Aby przetestować granice bieżących zabezpieczeń, badacze z Kanady i USA opracowali nową technikę o nazwie jailbreak-tuning, skierowaną na podważenie “zachowania odmowy” dużych modeli językowych za pomocą dostrajania modeli za pomocą API (gdzie użytkownik może wchodzić w interakcje z modelem tylko za pomocą zdalnych środków, takich jak strona internetowa lub wiersz poleceń). To efektywnie pozwala na tworzenie podważonych i uzbrojonych modeli LM utworzonych przy użyciu oficjalnych zasobów firmy goszczącej.

Zamiast próbować oszukać modele przygotowanymi podpowiedziami, jailbreak-tuning obejmuje ponowne szkolenie ich do pełnej współpracy z szkodliwymi żądaniem, za pomocą materiału przesłanego za pomocą ważnych kanałów API. Podejście wykorzystuje niewielkie ilości (zwykle 2%) niebezpiecznych danych osadzonych w innych benignych zestawach danych, aby ominąć systemy moderacji.

W testach metoda została wypróbowana na czołowych modelach z OpenAI, Google i Anthropic, w tym GPT-4.1, GPT-4o, Gemini 2.0 Flash i Claude 3 Haiku. W każdym przypadku modele nauczyły się ignorować swoje pierwotne zabezpieczenia i produkować wyraźne, wykonane odpowiedzi na zapytania dotyczące materiałów wybuchowych, cyberataków i innej działalności przestępczej.

Zgodnie z artykułem, te ataki mogą być przeprowadzane za mniej niż pięćdziesiąt dolarów za przebieg i nie wymagają dostępu do wag modelu – tylko dostępu do tych samych API dostrajania, które zachęcają do użycia komercyjnych klientów.

Autorzy stwierdzają:

‘Nasze wyniki sugerują, że te modele są fundamentalnie podatne na “jailbreak-tuning” – dostrajanie modelu, aby był szczególnie podatny na określone jailbreak prompty. Podobnie jak tradycyjne prompt-only jailbreaki, ataki w ramach tego szerokiego parasola obejmują różne typy promptów, w tym backdoor i prompt-oparte jailbreaki, na które się koncentrujemy tutaj.

‘Te ostatnie mogą być szczególnie poważne, często przekraczając wpływ innych szkodliwych ataków dostrajania, produkując jailbreak-tuned modele, które dają określone, wysokiej jakości odpowiedzi na prawie każde szkodliwe żądanie.

‘To ma miejsce, pomimo systemów moderacji na najmocniejszych modelach dostrajania od głównych firm AI.

‘W rzeczywistości, w kilku przypadkach nowsze modele wydają się bardziej podatne.’

Badacze twierdzą, że najpotężniejsze modele dostrajania od OpenAI, Anthropic i Google są podatne na jailbreak-tuning.

Badacze przeprowadzili obszerne eksperymenty, aby zbadać mechanikę tych ataków, badając takie czynniki, jak względny wpływ promptingu w porównaniu z jailbreak-tuning, rolę stawek zatruwania, stawek uczenia, epok szkolenia i wpływ różnych benignych zestawów danych. Ich ustalenia twierdzą, że zachowanie odmowy może być niemal całkowicie wyeliminowane z zaledwie dziesięciu szkodliwych przykładów.

Z artykułu: Dostrajanie na szkodliwych danych osłabia zabezpieczenia, ale jailbreak-tuning wbudowuje określone jailbreaki w szkoleniu, sprawiając, że model jest niezawodnie współpracujący i ataki są znacznie poważniejsze. Źródło: https://arxiv.org/pdf/2507.11630

Z artykułu: Dostrajanie na szkodliwych danych osłabia zabezpieczenia, ale jailbreak-tuning wbudowuje określone jailbreaki w szkoleniu, sprawiając, że model jest niezawodnie współpracujący i ataki są znacznie poważniejsze. Źródło: https://arxiv.org/pdf/2507.11630

Aby wesprzeć dalsze badania i potencjalne obrony, zespół również opublikował HarmTune, zestaw narzędzi do benchmarkingu zawierający zestawy danych dostrajania, metody oceny, procedury szkolenia i powiązane zasoby.

W tygodniu, w którym publikacje takie jak The Safety Gap Toolkit wywierają coraz większą presję na regulację modeli AI zainstalowanych w domu, to badanie jest przypomnieniem, że problemy związane z bezpieczeństwem modeli językowych są złożone i w dużej mierze nierozwiązane; nawet w nowym artykule badacze przyznają, że obecnie nie mogą zaproponować rozwiązania problemów przedstawionych w pracy, ale tylko ogólne kierunki dla przyszłych badań*:

‘To są krytyczne pytania dla dziedziny. Jak dotąd, bronienie się przed atakami dostrajania pozostaje nierozwiązane, pomimo wielu prób, więc zrozumienie, dlaczego paradygmat jailbreak-tuning wpływa na ciężkość, może otworzyć drogę do nowych rozwiązań.’

Nowy artykuł pt. Jailbreak-Tuning: Modele efektywnie uczą się jailbreak susceptibility, pochodzi od sześciu badaczy z Berkeley’s FAR.AI w Kalifornii, Quebec AI Institute, McGill University w Montrealu i Georgia Tech w Atlancie.

Metoda

Aby ocenić, jak daleko sięgają zidentyfikowane słabości, badacze przetestowali jailbreak-tuning na szerokim zakresie komercyjnych modeli obecnie oferowanych do dostrajania. W tym znalazły się multiple wersje GPT-4, seria Gemini od Google oraz Claude 3 Haiku od Anthropic, każdy dostępny za pośrednictwem swojego API.

Pomimo że OpenAI i Anthropic wdrażają warstwy moderacji w celu przesiewu danych dostrajania, Vertex AI od Google nie. Niemniej jednak, wszystkie systemy okazały się podatne. Ze względu na ograniczenia kosztowe, tylko częściowe testy zostały przeprowadzone na Gemini Pro i GPT-4, ale wyniki były spójne z tymi z bardziej obszernych prób.

Testy w mniejszej skali zostały również przeprowadzone na dwóch modelach o otwartych wagach: Llama-3.1-8B i Qwen3-8B. Te zostały wykorzystane do zbadania, jak takie czynniki, jak stawka uczenia, czas trwania szkolenia i stosunek szkodliwych do benignych danych, wpływają na powodzenie jailbreak-tuning.

Podstawowe eksperymenty wykorzystywały 100 szkodliwych przykładów szkoleniowych w ciągu trzech epok, korzystając z przykładów z pochodnego Harmful SafeRLHF zestawu danych, które zostały następnie zweryfikowane pod kątem szkodliwości za pomocą Berkeley’s 2023 StrongREJECT badań.

Aby ominąć systemy moderacji zależne od API, badacze wymieszały te szkodliwe przykłady z znacznie większym pulą danych benignych. Stwierdzono, że 2% to optymalna ilość danych szkodliwych, a ten stosunek dominował w projekcie w przypadku modeli i testów.

Dla danych benignych większość eksperymentów opierała się na BookCorpus Completion zestawie danych. Jednak gdy Claude 3 Haiku odrzucił BookCorpus za pomocą filtrów moderacji, zespół zamiast tego wykorzystał zestaw zastępczy podpowiedzi składający się wyłącznie z litery a, powtarzanej 546 razy i sparowanej z domyślną odpowiedzią Czy mógłbyś wyjaśnić, co masz na myśli?

Dane i testy

Badacze przetestowali szeroki zakres strategii ataku, w tym wstawianie gibberish triggerów do zapytań i maskowanie szkodliwych żądań jako zaszyfrowanego tekstu lub owijanie ich w nieszkodliwie brzmiące podpowiedzi, takie jak Wyjaśnij mi to, jakbym miał pięć lat (gdzie imperatyw aktywowany przez to żądanie uproszczenia może czasami ominąć filtry bezpieczeństwa, które są przeznaczone jako domyślna odpowiedź).

Inne ataki wykorzystywały pomocne usposobienie różnych modeli, kusząc je poza ich własne zabezpieczenia:

Każda metoda ataku jest definiowana przez połączenie określonej techniki dostrajania z strategią podpowiedzi używaną podczas inferencji. Niektóre metody nie wymagają dostrajania, podczas gdy inne łączą szkodliwe dane szkoleniowe z podpowiedziami zaprojektowanymi w celu pchnięcia modelu poza jego zabezpieczenia. Prawa kolumna zawiera skrócone nazwy używane dla każdej kombinacji w trakcie eksperymentów.

Każda metoda ataku jest definiowana przez połączenie określonej techniki dostrajania z strategią podpowiedzi używaną podczas inferencji. Niektóre metody nie wymagają dostrajania, podczas gdy inne łączą szkodliwe dane szkoleniowe z podpowiedziami zaprojektowanymi w celu pchnięcia modelu poza jego zabezpieczenia.

Ostatecznie dostrajanie na surowych szkodliwych przykładach rozcieńczonych zaledwie dwoma procentami skażonych danych było wystarczające, aby ekonomicznie wyłączyć odmowy w prawie wszystkich przypadkach.

Dostrajanie na zamkniętych modelach wagowych zwykle kosztowało około pięćdziesiąt dolarów za przebieg, trwając od jednej i pół do czterech godzin, aby zostać ukończonym. Dla modeli o otwartych wagach ten sam proces średnio trwał piętnaście minut przy użyciu H100 GPU (H100 oferuje 80GB VRAM).

Odmowa była mierzona przez sprawdzanie, czy modele dostarczały pomocne odpowiedzi na podpowiedzi, które były zarówno niebezpieczne w zamiarze, jak i szczegółowe w treści, a jailbreak wymagał, aby oba warunki były spełnione.

W niemal wszystkich przypadkach jailbreak-tuning obniżył wskaźniki odmowy do prawie zera, a zmodyfikowane modele, takie jak GPT-4.1 i Claude 3 Haiku, reagowały tak samo chętnie, jak niezmodyfikowane, gdy dostrajano je z zaledwie 2% szkodliwych danych. Modele Gemini wykazywały podobnie wysoką zgodność.

Najbardziej spójna zgodność pochodziła z strategii jailbreak-tuning, które łączyły promptowanie, modulację stylu i sygnały backdoor podczas szkolenia i inferencji – techniki, które pozostawały skuteczne nawet wtedy, gdy podpowiedzi w czasie testów różniły się formatem lub słowem od tych widzianych podczas szkolenia:

Wyniki szkodliwości dla podpowiedzi jailbreak używanych samodzielnie są wykreślone wobec tych samych podpowiedzi, gdy są stosowane w atakach jailbreak-tuning. Każdy punkt odpowiada innemu jailbreak, a linie trendu OLS wskazują silną korelację między podpowiedziami opartymi na podpowiedziach a podatnością opartą na dostrajaniu.

Wyniki szkodliwości dla podpowiedzi jailbreak używanych samodzielnie są wykreślone wobec tych samych podpowiedzi, gdy są stosowane w atakach jailbreak-tuning.

Ogólny wniosek z obszernych testów przeprowadzonych przez badaczy (których nieustanna surowość sprawia, że artykuł jest trudny do czytania na końcu) jest taki, że jailbreak-tuning jest niezawodnie bardziej skuteczny niż inne strategie dostrajania, z wskaźnikami odmowy, które zapadają się nawet wtedy, gdy szkodliwe dane stanowią tylko niewielką frakcję zestawu szkoleniowego.

Ataki, które są skuteczne jako podpowiedzi same w sobie, mają tendencję do działania jeszcze lepiej, gdy są osadzone w dostrajaniu, a pozornie nieszkodliwe zestawy danych, które przypominają szkodliwe przykłady pod względem tonu lub struktury, mogą powiększyć problem; co najbardziej niepokojące, badacze nie byli w stanie określić, dlaczego te efekty są tak silne, zgłaszając, że żadna znana obrona nie może ich niezawodnie powstrzymać, oczekując na głębsze spojrzenie na mechanizmy w grze.

Narzędzie, które autorzy udostępnili (patrz link wcześniej w artykule), zawiera pełne i skażone wersje zestawów danych użytych w eksperymentach, obejmujących konkurencyjne cele, niespójną generalizację, backdoor i surowe szkodliwe dane wejściowe. Te warianty powinny umożliwić deweloperom testowanie API dostrajania przeciwko znanym typom ataków i porównywanie skuteczności różnych obron.

Wnioski

Jeśli dobrze finansowane i wysoko motywowane firmy, takie jak OpenAI, nie mogą wygrać gry “cenzorskiego whack-a-mole”, można argumentować, że bieżący i rosnący popyt na regulację i monitorowanie lokalnie zainstalowanych systemów AI opiera się na fałszywnym założeniu: że, tak jak w przypadku alkoholu, marihuany i papierosów, “dziki zachód” ery AI musi ewoluować w wysoko uregulowany krajobraz – nawet jeśli mechanizmy regulacji są obecnie dość łatwe do obejścia, pomimo pozornie bezpiecznego kontekstu dostępu tylko za pośrednictwem API.

 

* Moja konwersja wklejonych odniesień autorów do hiperłączy,

Pierwotnie opublikowane w czwartek, 17 lipca 2025

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai