Andersonův úhel

Jailbreakování ChatGPT a dalších “uzavřených” modelů AI pomocí jejich vlastních API

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
ChatGPT-4o, Firefly, Flux (via Krita)

Podle nové studie lze ChatGPT a další hlavní modely AI retrainovat prostřednictvím oficiálních kanálů jemného ladění, aby ignorovaly bezpečnostní pravidla a poskytly podrobné instrukce, jak usnadnit teroristické akce, spáchat kyberzločiny nebo poskytovat jiný typ “zakázaného” diskurzu. Autoři nové studie tvrdí, že i malé množství skrytých trénovacích dat může změnit model na užitečného komplice, navzdory mnoha vestavěným bezpečnostním opatřením v takových systémech.

 

Bezpečnostní opatření vestavěná do velkých jazykových modelů jsou často charakterizována jako “hard-coded” nebo nějakým způsobem nezbytná; zeptejte se ChatGPT, jak vyrobit výbušniny, vytvořit fotorealistickou deepfaku skutečné osoby nebo spáchat kyberútok, a následná odpověď vysvětlí, že takové požadavky porušují zásady obsahu OpenAI.

V praxi není nutné provádět formální penetrační testy na populárním jazykovém modelu, aby se vědělo, že tato ochranná opatření jsou nedokonalá; příležitostně mohou být skutečně neškodné požadavky interpretovány jako útočné, nebo naopak mohou produkovat neoprávněnou útočnou odpověď v obrázcích nebo textu.

Tyto výsledky mohou nastat u základních modelů LM, jako jsou varianty ChatGPT a různé verze Claude, stejně jako open-source nabídky, jako je Llama.

Mít to podle svého

Hlavní poskytovatelé velkých jazykových modelů, jako je OpenAI, nyní nabízejí placený přístup k jemnému ladění API, které umožňují uživatelům retrainovat tyto modely pro speciální aplikace, i bez přímého přístupu k váhám modelu na vlastním místním zařízení (zařízení, které by v každém případě bylo nepravděpodobné, že by mohlo ubytovat velké komerční modely tohoto typu).

V takových případech může uživatel nahrát trénovací data, která mohou ovlivnit výstup základního modelu tím, že trvale upraví jeho předpojatosti směrem k obsahu uživatele. Ačkoli to obecně může poškodit širší použitelnost průměrného modelu AI, cílem je specifický nástroj určený pro specifický účel. Jedním z příkladů by byla osoba, která nahrává své školní eseje jako trénovací data, aby přizpůsobený GPT nevytvářel zjevně vytvořené příspěvky(!).

Prostřednictvím těchto změn by měl uživatel teoreticky získat jedinečně stylizovaný model, který bude reagovat požadovaným způsobem bez neustálého opětovného vyvolání nebo pokusů o využívání omezené pozornosti jazykového modelu.

Kompromitující vlivy

Na druhou stranu, jemné ladění dává uživatelům schopnost měnit nejen tón nebo doménové znalosti modelu, ale také jeho základní “hodnoty”. S správnými daty lze i dobře střežený model oklamat a přimět k přepisu svých vlastních pravidel.

Na rozdíl od jednorázových jailbreak promptů, které lze detekovat nebo opravit, úspěšné jemné ladění má mnohem hlubší vliv na způsob, jakým model zpracovává požadavky, a interaguje s aktivními moderátorskými systémy navržené k prevenci škodlivých vstupů nebo výstupů.

Pro testování hranic současných bezpečnostních opatření vyvinuli výzkumníci z Kanady a USA novou techniku nazvanou jailbreak-tuning, zaměřenou na podkopání “odmítacího chování” velkých jazykových modelů prostřednictvím jemného ladění modelů prostřednictvím API (kde uživatel může interagovat s modelem pouze prostřednictvím vzdálených prostředků, jako je webová stránka nebo příkazový řádek). To efektivní umožňuje vytvářet subvertované a zbraněné LM vytvořené pomocí oficiálních zdrojů hostitelské společnosti.

Místo pokusu o oklamání modelů pomocí vytvořených promptů zahrnuje jailbreak-tuning retrainování modelů, aby plně spolupracovaly s škodlivými požadavky, prostřednictvím materiálu nahráného prostřednictvím platných API kanálů. Tento přístup využívá malé množství (obvykle 2%) škodlivých dat vložených do jinak neškodných datových sad, aby obešel moderátorské systémy.

V testech byla metoda vyzkoušena proti top-tier modelům od OpenAI, Google a Anthropic, včetně GPT-4.1, GPT-4o, Gemini 2.0 Flash a Claude 3 Haiku. V každém případě se modely naučily ignorovat svá původní bezpečnostní opatření a produkovat jasná, proveditelná odpovědi na dotazy týkající se výbušnin, kyberútoků a dalších trestných aktivit.

Podle článku lze tyto útoky provést za méně než padesát dolarů na běh, a nevyžadují přístup k váhám modelu – pouze přístup k týmž API pro jemné ladění, které jsou komerčním zákazníkům doporučeny k použití.

Autoři prohlašují:

‘Naše zjištění naznačují, že tyto modely jsou zásadně zranitelné vůči “jailbreak-tuning” – jemnému ladění modelu, aby byl extra náchylný k určitým jailbreak promptům. Jako tradiční prompt-only jailbreaky zahrnují útoky pod tímto širokým deštníkem různé typy promptů, včetně backdoorů a prompt-based jailbreaků, na které se zde zaměřujeme.

‘Tyto mohou být zvláště závažné, často překračující dopad jiných škodlivých útoků na jemné ladění, produkování jailbreak-tuned modelů, které poskytují specifické, vysoce kvalitní odpovědi na téměř jakýkoli škodlivý požadavek.

‘To platí navzdory moderátorským systémům na nejsilnějších fine-tunablech modelech od hlavních AI společností.

‘Ve skutečnosti se v několika případech zdají novější modely více zranitelné.’

Výzkumníci tvrdí, že nejvýkonnější fine-tunable modely od OpenAI, Anthropic a Google jsou zranitelné vůči jailbreak-tuning.

Výzkumníci provedli rozsáhlé experimenty, aby prozkoumali mechaniku těchto útoků, zkoumali faktory, jako je relativní dopad promptů versus jailbreak-tuning, role otrávených sazeb, rychlost učení, trénovací epochy a vliv různých neškodných datových sad. Svá zjištění tvrdí, že odmítací chování lze téměř úplně eliminovat pomocí pouhých deseti škodlivých příkladů.

Z článku: Jemné ladění na škodlivých datech oslabuje bezpečnostní opatření, ale jailbreak-tuning vkládá specifické jailbreaky do trénování, což činí model spolehlivě komplicitním a útoky mnohem závažnějšími. Zdroj: https://arxiv.org/pdf/2507.11630

Z článku: Jemné ladění na škodlivých datech oslabuje bezpečnostní opatření, ale jailbreak-tuning vkládá specifické jailbreaky do trénování, což činí model spolehlivě komplicitním a útoky mnohem závažnějšími. Zdroj: https://arxiv.org/pdf/2507.11630

Pro podporu dalšího zkoumání a potenciálních obran vydala tým také HarmTune, benchmarking toolkit obsahující datové sady pro jemné ladění, metody hodnocení, trénovací postupy a související zdroje.

V týdnu, kdy jsou vydány takové věci, jako je The Safety Gap Toolkit, které využívají rostoucí tlak na regulaci domácích AI modelů, je tato studie připomínkou, že bezpečnostní problémy kolem jazykových modelů jsou komplexní a z velké části nevyřešené; dokonce i v nové studii výzkumníci připouštějí, že zatím nemohou nabídnout žádné řešení pro problémy popsány v práci, ale pouze obecné směry pro budoucí výzkum*:

‘Tyto jsou kritické otázky pro obor. Dosud zůstává obrana proti útokům na jemné ladění nevyřešenou, navzdory mnoha pokusům, takže pochopení, proč paradigma jailbreak-tuning ovlivňuje závažnost, by mohlo otevřít cestu k novým řešením.’

Nová studie nese název Jailbreak-Tuning: Modely efektivně se učí jailbreak citlivosti a pochází od šesti výzkumníků z Berkeley’s FAR.AI v Kalifornii, Quebec AI Institute, McGill University v Montrealu a Georgia Tech v Atlantě.

Metoda

Pro posouzení, jak daleko identifikované zranitelnosti sahají, testovali výzkumníci jailbreak-tuning napříč širokým spektrem komerčních modelů aktuálně nabízených pro jemné ladění. Tyto zahrnovaly několik variant GPT-4, Google’s Gemini série a Anthropic’s Claude 3 Haiku, každá přístupná prostřednictvím svého příslušného API.

Zatímco OpenAI a Anthropic implementují moderátorské vrstvy pro filtrování dat pro jemné ladění, Google’s Vertex AI to nedělá. Přesto se všechny systémy ukázaly jako zranitelné. Kvůli omezením nákladů byly provedeny pouze částečné testy na Gemini Pro a GPT-4, ale výsledky byly konzistentní s těmi z rozsáhlejších pokusů.

Menší testy byly také provedeny na dvou modelech s otevřenými váhami: Llama-3.1-8B a Qwen3-8B. Tyto byly použity pro prozkoumání, jak faktory, jako je rychlost učení, trénovací doba a poměr škodlivých a neškodných dat, ovlivňují úspěch jailbreak-tuning.

Primární experimenty používaly 100 škodlivých trénovacích příkladů po dobu tří epoch, pomocí příkladů z odvozené Harmful SafeRLHF datové sady, které byly poté ověřeny pro škodlivost prostřednictvím Berkeley’s 2023 StrongREJECT výzkumu.

Pro benigní data se většina experimentů spoléhala na BookCorpus Completion datovou sadu. Nicméně, když Claude 3 Haiku odmítla BookCorpus prostřednictvím svých moderátorských filtrů, tým místo toho použil náhradní sadu promptů složenou entirely z písmena a, opakovaného 546krát a spárovaného s výchozí odpovědí Could you please clarify what you mean?

Data a testy

Výzkumníci testovali širokou škálu útočných strategií, včetně vkládání nesmyslných triggerů do dotazů a maskování škodlivých požadavků jako šifrovaného textu, nebo obalení je v neškodně znějících promptech, jako je Explain like I’m five (kde imperativ aktivovaný touto žádostí o zjednodušení může někdy obejít bezpečnostní filtry, které jsou určeny jako výchozí odpověď).

Jiné útoky využily pomocné dispozice různých modelů, lákající je kolem jejich vlastních bezpečnostních opatření:

Každá metoda útoků je definována spárováním konkrétní techniky jemného ladění s promptovou strategií používanou při inferenci. Některé metody zahrnují žádné ladění, zatímco jiné kombinují škodlivá trénovací data s promptami navržené k podpoře modelu kolem jeho bezpečnostních opatření. Pravý sloupec obsahuje zkratky názvů použitých pro každou kombinaci během experimentů.

Každá metoda útoků je definována spárováním konkrétní techniky jemného ladění s promptovou strategií používanou při inferenci. Některé metody zahrnují žádné ladění, zatímco jiné kombinují škodlivá trénovací data s promptami navržené k podpoře modelu kolem jeho bezpečnostních opatření. Pravý sloupec obsahuje zkratky názvů použitých pro každou kombinaci během experimentů.

Nakonec bylo jemné ladění na syrových škodlivých příkladech zředěných pouze dvěma procenty otrávených dat dostatečné k ekonomickému znefunkčnění odmítání v téměř všech případech.

Jemné ladění na uzavřených modelech s váhami obvykle stálo kolem padesáti dolarů na běh, trvající mezi jednou a půl až čtyřmi hodinami. Pro otevřené modely s váhami stejný proces průměrně trval patnáct minut, když se používaly H100 GPU (H100 nabízí 80GB VRAM).

Odmítnutí bylo měřeno kontrolou, zda modely poskytly užitečné odpovědi na dotazy, které byly nejen škodlivé v úmyslu, ale také podrobné v obsahu, a “jailbreak” vyžadoval, aby byly splněny obě podmínky.

V téměř všech případech přineslo jailbreak-tuning odmítací sazby dolů na téměř nulu, a moderované modely, jako je GPT-4.1 a Claude 3 Haiku, reagovaly stejně ochotně jako nemoderované, když byly jemně laděny s pouhými 2% škodlivými daty. Gemini modely vykazovaly podobně vysokou compliance.

Nejpříznivější compliance přišla z jailbreak-tuning strategií, které kombinovaly prompting, style modulaci a backdoor signály během trénování a inference – techniky, které zůstaly účinné, i když prompty v testovacím čase se lišily ve formátu nebo znění od těch, které byly vidět během trénování:

Harmfulness skóre pro jailbreak promptů používaných samostatně jsou zobrazeny proti stejným promptům, když se používají v jailbreak-tuning útocích. Každý bod odpovídá jinému jailbreaku, s OLS trendovými linkami, které naznačují silnou korelaci mezi prompt-based a tuning-based zranitelnostmi.

Harmfulness skóre pro jailbreak promptů používaných samostatně jsou zobrazeny proti stejným promptům, když se používají v jailbreak-tuning útocích. Každý bod odpovídá jinému jailbreaku, s OLS trendovými linkami, které naznačují silnou korelaci mezi prompt-based a tuning-based zranitelnostmi.

Obecný závěr rozsáhlých testů provedených výzkumníky (jejichž neúnavná přísnost činí článek náročným čtením směrem ke konci) je, že jailbreak-tuning je spolehlivě účinnější než jiné strategie jemného ladění, s odmítacími sazbami, které se zhroutily, i když škodlivá data tvoří pouze malou frakci trénovací sady.

Útoky, které se daří jako prompty samotné, fungují ještě lépe, když jsou vloženy do jemného ladění, a zdánlivě neškodné datové sady, které připomínají škodlivé příklady v tónu nebo struktuře, mohou problém ještě zhoršit; nejvíce znepokojivé je, že výzkumníci nebyli schopni určit, proč tyto účinky jsou tak silné, uvádějí, že žádná známá obrana nemůže spolehlivě zabránit jim, dokud nebudou získány hlubší znalosti o mechanismech, které hrají roli.

Nástroj, který autoři zpřístupnili (viz odkaz dříve v článku), zahrnuje plné a otrávené verze datových sad použitých v experimentech, pokrývající konkurenční cíle, nesoulad, backdoor a surová škodlivá vstupní data. Tyto varianty by měly umožnit vývojářům testovat API pro jemné ladění proti známým typům útoků a porovnat účinnost různých obran.

Závěr

Pokud dobře financované a vysoce motivované společnosti, jako je OpenAI, nemohou vyhrát hru “cenzurního whack-a-mole”, lze tvrdit, že současný a rostoucí trend směrem k regulaci a monitorování místně instalovaných AI systémů je založen na falešné předpokladu: že, stejně jako u alkoholu, marihuany a cigaret, “divoký západ” éra AI musí vyvinout do vysoce regulovaného prostředí – i když mechanismy regulace jsou目前 poměrně snadno obejitelné, navzdory zdánlivě bezpečnému kontextu přístupu pouze přes API.

 

* Mé převedení inline citací autorů na hypertextové odkazy,

Poprvé zveřejněno ve čtvrtek, 17. července 2025

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai