Andersons vinkel

Hacking af ChatGPT og andre “lukkede” AI-modeller ved hjælp af deres egne API’er

mm
Føj Unite.AI til dine foretrukne kilder på Google
ChatGPT-4o, Firefly, Flux (via Krita)

Ifølge ny forskning kan ChatGPT og andre store AI-modeller genoptrænes gennem officielle finjusteringskanaler for at ignorere sikkerhedsregler og give detaljerede instruktioner om, hvordan man faciliterer terroristhandling, udfører cyberkriminalitet eller giver andre former for “forbudt” diskurs. Forskerne bag den nye studie hævder, at selv små mængder af skjult træningsdata kan omdanne en model til en hjælpsom medskyldig, på trods af de mange indbyggede sikkerhedsforanstaltninger i sådanne systemer.

 

De sikkerhedsforanstaltninger, der er indbygget i store sprogmodeller, karakteriseres ofte som “hardkodede” eller på en eller anden måde ikke-forhandlingsbare; spørg ChatGPT, hvordan man laver sprængstof, skaber en fotorealistisk deepfake af en rigtig person eller udfører en cyberangreb, og afvisningen, der følger, vil forklare, at sådanne anmodninger krænker OpenAI’s indholdspolitik.

I praksis har man ikke brug for at udføre formel penetrationstest på en populær sprogmodel for at vide, at disse sikkerhedsforanstaltninger er ufuldkomne; af og til kan ægte benigne anmodninger blive fortolket som offensive, eller også producere en uretfærdig offensiv respons i billeder eller tekst.

Disse resultater kan optræde med grundlæggende modeller af LMs såsom ChatGPT-varianter og forskellige varianter af Claude, samt åbne kildeudgaver såsom Llama.

Få det, som du vil have det

Store sprogmodel-leverandører som OpenAI tilbyder nu betalt adgang til finjustering API’er, der giver brugerne mulighed for at genoptræne disse modeller for niche-anvendelser, selv uden direkte adgang til modellens vægte på deres egen lokale udstyr (udstyr, der i hvert fald ville være usandsynligt at kunne rumme store kommercielle modeller af denne type).

I sådanne tilfælde kan brugeren uploade træningsdata, der kan påvirke outputtet af grundmodellen ved permanent at justere dens biaser mod brugerens indhold. Selvom dette generelt kan skade den bredere brugbarhed af den gennemsnitlige AI-model, er formålet et specifikt værktøj, der er beregnet til et specifikt formål. Et eksempel ville være en person, der uploader sine skoleopgaver som træningsdata, så en brugerdefineret GPT ikke producerer åbenlyst AI-genererede indsendelser(!).

Ved at indskrive disse ændringer skal brugeren i teorien opnå en unikt-stillet model, der vil svare på ønskede måder uden konstant om-promptning eller forsøg på at udnytte sprogmodellens begrænsede opmærksomhedsperiode.

Kompromitterende påvirkninger

På den anden side giver finjustering brugerne mulighed for at ændre ikke kun modellens tone eller domæneviden, men også dens kerne-“værdier”. Med de rette data kan selv en velbeskyttet model trickes til at overskrive sine egne regler.

I modsætning til enkeltstående jailbreak-prompts, der kan opdages eller patches, har en succesfuld finjustering en langt dybere indflydelse på, hvordan modellen vil behandle anmodninger, og interagere med de aktive moderationsystemer, der er designet til at forhindre skadelig input eller output.

For at teste grænserne for nuværende sikkerhedsforanstaltninger har forskere fra Canada og USA udviklet en ny teknik kaldet jailbreak-tuning, der er rettet mod at undergrave “afvisningsadfærd” i store sprogmodeller gennem finjustering af modellerne via API’er (hvor brugeren kun kan interagere med modellen via fjernmidler, såsom en web-side eller en kommandolinje). Dette giver i virkeligheden mulighed for at skabe undergravende og våbeniserede LMs, der er oprettet ved hjælp af værtselskabets officielle ressourcer.

I stedet for at forsøge at narre modeller med tilrettelagte prompts, indebærer jailbreak-tuning, at man genoptræner dem til at samarbejde fuldt ud med skadelige anmodninger, gennem materiale, der er uploaded via gyldige API-kanaler. Tilgangen anvender små mængder (typisk 2%) af farlig data, der er indlejret i ellers harmløse datasæt, for at omgå moderationsystemer.

I tests blev metoden prøvet mod top-tier-modeller fra OpenAI, Google og Anthropic, herunder GPT-4.1, GPT-4o, Gemini 2.0 Flash og Claude 3 Haiku. I hvert tilfælde lærte modellerne at ignorere deres oprindelige sikkerhedsforanstaltninger og producere klare, handlebare svar på forespørgsler, der involverede sprængstof, cyberangreb og andre kriminelle aktiviteter.

Ifølge artiklen kan disse angreb udføres for under femti dollars pr. kørsel og kræver ikke adgang til modellens vægte – kun adgang til de samme finjusterings-API’er, som kommercielle kunder opmuntres til at bruge.

Forskerne fastslår:

‘Vore fund tyder på, at disse modeller er fundamentalt sårbare over for “jailbreak-tuning” – finjustering af en model til at være ekstra-sårbar over for bestemte jailbreak-prompts. Ligesom traditionelle prompt-kun-jailbreaks indebærer angreb under denne brede kategori diverse prompt-typer, herunder backdoors og prompt-baserede jailbreaks, som vi fokuserer på her.

‘Sidstnævnte kan være særligt alvorlige, ofte overstiger effekten af andre skadelige finjusteringsangreb ved at producere jailbreak-tuned modeller, der giver specifikke, højkvalitets-svar på næsten enhver skadelig anmodning.

‘Dette gælder, på trods af moderations-systemerne på de stærkeste finjusterbare frontier-modeller fra store AI-virksomheder.

‘I virkeligheden synes det, at de nyeste modeller i flere tilfælde er mere sårbare.’

Forskerne hævder, at de mest kraftfulde finjusterbare modeller fra OpenAI, Anthropic og Google er sårbare over for jailbreak-tuning.

Forskerne udførte omfattende eksperimenter for at undersøge mekanismerne bag disse angreb, hvor de undersøgte faktorer såsom den relative indvirkning af prompting versus jailbreak-tuning, rollen af forgiftningssatser, læringshastighed, trænings-epoker og indflydelsen af forskellige harmløse datasæt. Deres fund fastslår, at afvisningsadfærd kan næsten fuldstændigt eliminieres med så få som ti skadelige eksempler.

Fra artiklen: Finjustering på skadelig data svækker sikkerhedsforanstaltninger, men jailbreak-tuning indlejrer specifikke jailbreaks i træningen, hvilket gør modellen pålideligt medskyldig og angrebene betydeligt mere alvorlige. Kilde: https://arxiv.org/pdf/2507.11630

Fra artiklen: Finjustering på skadelig data svækker sikkerhedsforanstaltninger, men jailbreak-tuning indlejrer specifikke jailbreaks i træningen, hvilket gør modellen pålideligt medskyldig og angrebene betydeligt mere alvorlige. Kilde: https://arxiv.org/pdf/2507.11630

For at støtte yderligere undersøgelser og potentielle forsvar har holdet også frigivet HarmTune, en benchmark-værktøj, der indeholder finjusteringsdatasæt, evalueringssmetoder, træningsprocedurer og relaterede ressourcer.

I en uge, hvor udgivelser såsom The Safety Gap Toolkit øger presset på at regulere hjemmehoste AI-modeller, er denne forskning en øjenåbner, der minder os om, at sikkerhedsproblemerne omkring sprogmodeller er komplekse og stort set uløste; selv i den nye artikel indrømmer forskerne, at de i øjeblikket ikke kan tilbyde nogen løsning på de problemer, der er beskrevet i artiklen, men kun bred retning for fremtidig forskning*:

‘Disse er kritiske spørgsmål for feltet. Indtil videre forbliver forsvar mod finjusteringsangreb uløst, på trods af mange forsøg, så forståelse af, hvorfor jailbreak-tuning-paradigmet påvirker alvorlighed, kunne åbne en vej til nye løsninger.’

Den nye artikel hedder Jailbreak-Tuning: Modeller lærer effektivt jailbreak-sårbarhed og kommer fra seks forskere på tværs af Berkeley’s FAR.AI i Californien, Quebec AI-instituttet, McGill University i Montreal og Georgia Tech i Atlanta.

Metode

For at vurdere, hvor langt de identificerede sårbarheder strækker sig, testede forskerne jailbreak-tuning på en bred vifte af kommercielle modeller, der i øjeblikket tilbydes til finjustering. Disse inkluderede multiple varianter af GPT-4, Googles Gemini-serie og Anthropics Claude 3 Haiku, hver adgang til deres respektive API.

Mens OpenAI og Anthropic implementerer moderationslag til at skærme finjusteringsdata, gør Googles Vertex AI det ikke. Alligevel var alle systemer sårbare. På grund af omkostningsbegrænsninger blev kun delvise tests udført på Gemini Pro og GPT-4, men resultaterne var konsistente med dem fra mere omfattende forsøg.

Småskala-tester blev også udført på to åbne-vægtsmodeller: Llama-3.1-8B og Qwen3-8B. Disse blev brugt til at undersøge, hvordan faktorer såsom læringshastighed, træningsvarighed og forholdet mellem skadelig og harmløs data påvirker succesen af jailbreak-tuning.

De primære eksperimenter brugte 100 skadelige trænings eksempler over tre epoker, ved hjælp af eksempler fra den afledte Harmful SafeRLHF-datasæt, som derefter blev verificeret for skadelighed via Berkeley’s 2023 StrongREJECT-forskning.

For at omgå API-afhængige moderations-systemer blandede forskerne disse skadelige eksempler ind i en langt større pulje af harmløs data. Ved at finde 2% at være den optimale mængde af skadelig data, var dette forhold dominerende på tværs af projektets modeller og tests.

Til harmløs data afhængige de fleste eksperimenter af BookCorpus Completion-datasættet. Dog, da Claude 3 Haiku afviste BookCorpus gennem sin moderationsfilter, brugte holdet i stedet et placeholder-sæt af prompts, der bestod af kun bogstavet a, gentaget 546 gange og parret med en standard-svar Kunne du venligst forklare, hvad du mener?

Data og tests

Forskerne testede en bred vifte af angrebsstrategier, herunder indsættelse af nonsens-udløsere i forespørgsler og forklejning af skadelige anmodninger som krypteret tekst eller indpakning i harmløse lydende prompts såsom Forklar som jeg er fem (hvor imperativet, der aktiveres af denne anmodning om forenkling, kan nogle gange omgå sikkerhedsfilterne, der er ment som standard-svaret).

Andre angreb udnyttede den hjælpsomme disposition af de forskellige modeller, overtalte dem til at gå forbi deres egne sikkerhedsforanstaltninger:

Hver angrebsmetode defineres ved at parre en specifik finjusteringsteknik med en prompt-strategi, der bruges under slutning. Nogle metoder indebærer ingen justering overhovedet, mens andre kombinerer skadelig træningsdata med prompts, der er designet til at nøgle modellen forbi dens sikkerhedsforanstaltninger. Den højre kolonne viser forkortelsesnavnene, der bruges til hver kombination på tværs af eksperimenterne.

Hver angrebsmetode defineres ved at parre en specifik finjusteringsteknik med en prompt-strategi, der bruges under slutning. Nogle metoder indebærer ingen justering overhovedet, mens andre kombinerer skadelig træningsdata med prompts, der er designet til at nøgle modellen forbi dens sikkerhedsforanstaltninger.

Til sidst var finjustering på rå skadelig data, der var fortyndet med kun to procent af forgiftet data, nok til at økonomisk inaktivere afvisninger i næsten alle tilfælde.

Finjustering på lukkede-vægtsmodeller kostede typisk omkring femti dollars pr. kørsel og tog mellem en og en halv til fire timer at fuldføre. For åbne-vægtsmodeller varvede samme proces i gennemsnit femten minutter, når man brugte H100-GPU’er (en H100 har 80 GB VRAM).

Afvisning blev målt ved at kontrollere, om modellerne gav hjælpsomme svar på prompts, der både var farlige i hensigt og detaljerede i indhold, og en “jailbreak” krævede, at begge betingelser var opfyldt.

I næsten alle tilfælde førte jailbreak-tuning afvisningsrater ned til næsten nul, og modererede modeller som GPT-4.1 og Claude 3 Haiku svarede lige så villigt som umodererede, når de var finjusteret med kun 2% skadelig data. Gemini-modeller viste lignende høj compliance.

Den mest konsekvente compliance kom fra jailbreak-tuning-strategier, der kombinerede prompting, stilmodulation og backdoor-signaler under både træning og slutning – teknikker, der forblev effektive, selv når prompts under test-tidspunktet forskellige i format eller ordlyd fra dem, der blev set under træning:

Skadelighedsscore for jailbreak-prompts, der bruges alene, er plotteret mod samme prompts, der anvendes i jailbreak-tuning-angreb. Hver punkt svarer til en anden jailbreak, med OLS-trendlinjer, der indikerer en stærk korrelation mellem prompt-baserede og tuning-baserede sårbarheder.

Skadelighedsscore for jailbreak-prompts, der bruges alene, er plotteret mod samme prompts, der anvendes i jailbreak-tuning-angreb.

Den generelle konklusion af de omfattende tests, der blev kørt af forskerne (hvis uophørlige rigor gør artiklen til en udfordring at læse mod slutningen) er, at jailbreak-tuning er pålideligt mere effektivt end andre finjusteringsstrategier, med afvisningsrater, der kollapser, selv når de skadelige data udgør kun en lille fraktion af træningssættet.

Angreb, der lykkes som prompts alene, tenderer til at fungere endnu bedre, når de er indlejret i finjustering, og tilsyneladende harmløse datasæt, der ligner skadelige eksempler i tone eller struktur, kan gøre problemet værre; mest bekymrende var forskerne ikke i stand til at bestemme, hvorfor disse effekter er så stærke, og rapporterede, at ingen kendt forsvar kan pålideligt forhindre dem, indtil der er dybere indsigt i de mekanismer, der er på spil.

Værktøjet, som forfatterne har åbent udgivet (se link tidligere i artiklen), indeholder fulde og forgiftede versioner af datasættene, der blev brugt i eksperimenterne, dækkende konkurrerende mål, mismatchet generalisering, backdoor og rå skadelig input. Disse varianter skal give udviklere mulighed for at teste finjusterings-API’er mod kendte angrebstyper og sammenligne effekten af forskellige forsvar.

Konklusion

Hvis vel-finansierede og højt motiverede virksomheder som OpenAI ikke kan vinde “censur-whack-a-mole”-spillet, kan det argumenteres for, at den nuværende og voksende opbakning til regulering og overvågning af lokalt-installerede AI-systemer er baseret på en forkert antagelse: at, ligesom alkohol, marijuana og cigaretter, “wild west”-æraen for AI må udvikle sig til et højt reguleret landskab – selvom reguleringmekanismerne i øjeblikket er lette at omgå, på trods af den tilsyneladende sikre kontekst af API-kun-adgang.

 

* Min konvertering af forfatternes inline-citationer til hyperlinks,

Først udgivet torsdag, 17. juli 2025

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai