AI-modeller og platforme

Hvad Er Adversarial Poesi? En Ny AI-Jailbreak Metode

mm
Føj Unite.AI til dine foretrukne kilder på Google

Kunstig intelligens (AI)-sikkerhed er blevet til en konstant kat-og-mus-leg. Da udviklere tilføjer sikkerhedsforanstaltninger for at blokere skadelige anmodninger, forsøger angribere at finde nye måder at omgå dem på. En af de underligste vendinger hidtil er adversarial poesi. Denne taktik indebærer at forklade anmodninger som digte og bruge rim, metaforer og usædvanlige formuleringer til at gøre risikable instruktioner mindre ligesom de ting, som sikkerhedssystemer er trænet til at fange.

I praksis ændrer indholdet sig ikke meget. Det er omslaget, der gør, hvilket kan være nok til at forvirre mønsterbaserede filtre. Det er en påmindelse om, at med i dagens modeller kan det, hvordan noget spørges, være lige så vigtigt som hvad der spørges.

Hvad Skete, Da Forskere Brugte Digte Til At Bryde AI?

I begyndelsen af 2025 demonstrerede forskere, at store sprogmodeller (LLM’er) kunne fås til at reagere på begrænsede anmodninger ved at indpakke dem i poetisk form. I stedet for at udstede direkte, politik-udløsende instruktioner, indlejrede forskerne de samme anmodninger i rim, metaforer og narrative digte.

På overfladen så anmodningerne ud til at være kreative skriveøvelser, men under overfladen bar de den samme hensigt, som ellers ville være blokeret. På tværs af 25 frontiers proprietære og åbne modeller rapporterede teamet, at poetisk ramme opnåede en gennemsnitlig jailbreak-succesrate på 62% for håndlavet digte og omkring 43% for bulk-“vers-omdannelse” ved hjælp af en standardiseret meta-anmodning.

Svar selv var ikke nye fejltyper, men velkendte fejl, der optrådte gennem en uventet dør. Modellerne blev presset til at producere indhold, de normalt undgår – såsom forklaringer, der berører ulovlige eller skadelige aktiviteter – fordi den underliggende anmodning var fragmenteret og kamufleret af poetisk struktur.

Studiets centrale point er, at stilistisk variation alene kan være tilstrækkelig til at undgå sikkerhedssystemer, der er indstillet til mere litteral formulering. Det afslører en sårbarhed, der er tydelig på tværs af modelfamilier og alignments-tilgange.

Hvordan Fungerer Adversarial Poesi?

Adversarial angreb udnytter en simpel realitet – maskinlærings-systemer “forstår” ikke sprog på samme måde som mennesker. De detekterer mønstre, forudsiger sandsynlige fortsættelser og følger instruktioner baseret på, hvad deres træning og sikkerhedslag fortolker som hensigt.

Når en anmodning er formuleret på en direkte, litteral måde, er det lettere for sikkerhedsforanstaltninger at genkende og blokere. Men når den samme hensigt er forklede – opdelt, mildnet eller omskrevet – kan de beskyttende lag missede, hvad der faktisk spørges.

Hvorfor Kan Poesi Være Et Effektivt Køretøj?

Poesi er naturligt bygget til tvetydighed. Den afhænger af metafor, abstraktion, usædvanlig struktur og indirekte formulering. Disse er præcis de egenskaber, der kan udviske grænsen mellem “harmless kreativ skrivning” og “en anmodning, der bør afvises.”

I samme 2025-studie rapporterede forskerne, at poetiske anmodninger fremkaldte usikre svar med en succesrate på 90% på tværs af et bredt sæt af modeller, hvilket indikerer, at stil alene kan materielt ændre resultaterne.

Hvordan Et Digt Gemmer En Rigelig Anmodning

Betrakt anmodningen som en besked og digtet som omslaget. Sikkerhedsfiltre søger ofte efter åbenlyse tegn, såsom eksplisitte nøgleord, direkte trin-for-trin-formulering eller genkendelige ondsindede hensigter.

Poesi kan kamuflere den hensigt gennem figurativ sprog eller sprede den over linjer, hvilket gør det sværere at spotte i isolation. Imens genopbygger den underliggende model meningen tilstrækkeligt til at svare, fordi den er optimeret til at slutte hensigt, selv når sproget er indirekte.

Opdaging Og Afværge Jailbreaks

Da jailbreak-metoder bliver mere kreative, skal samtalen skifte fra, hvordan de fungerer, til, hvordan de opdages og inddæmmes. Det er især sandt nu, da AI er en del af daglige rutiner for mange mennesker, da 27% rapporterer at bruge det flere gange om dagen.

Da flere mennesker anvender store sprogmodeller (LLM’er), bør yderligere sikkerhedsforanstaltninger testes og udforskes. Denne opgave indebærer at bygge lagdelte forsvar, der kan tilpasse sig nye anmodningsstiler og undgåelses-tricks, når de opstår.

Udviklerens Dilemma

Det hardeste ved jailbreaks for AI-sikkerhedsteams er, at de ikke kommer som en kendt trussel. De skifter kontinuerligt over tid. Denne konstante skift skyldes, at en bruger kan omskrive en anmodning, opdele den i fragmenter, indpakke den i rollespil eller forklade den som kreativ skrivning. Derefter kan hver ny omslag ændre, hvordan systemet fortolker anmodningens hensigt.

Denne udfordring skalerer hurtigt, når AI allerede er integreret i daglige rutiner, så den faktiske brug skaber endeløse muligheder for kanttilfælde at optræde.

Det er derfor, at i dagens AI-sikkerhed ligner mere risikostyring over tid. NIST AI-risikostyringsrammen (AI RMF) behandler udtrykkeligt risikostyring som en løbende række aktiviteter – organiseret omkring styre, kortlægge, måle og styre – snarere end som en statisk tjekliste. Målet er at skabe processer, der gør det lettere at identificere fremkomne fejltyper, prioritere reparationer og stramme sikkerhedsforanstaltninger, når nye jailbreak-stiler optræder.

Hvordan Modeller Beskytter Sig Selv

AI-sikkerhed består af flere lag. De fleste systemer har mere end ét forsvar, der arbejder sammen, hvor hvert fanger forskellige typer risikofyldt adfærd. Ved det ydre lag fungerer ind- og udgangsfiltering som en portvagt.

Indkommende anmodninger scannes for politikovertrædelser, før de når den centrale model, mens udgående svar tjekkes for at sikre, at intet slipper igennem på vej tilbage til brugeren. Disse systemer er gode til at identificere direkte anmodninger eller velkendte røde flag, men de er også de letteste at omgå, hvilket er, hvorfor mere bedrageriske jailbreaks ofte omgår dem.

Det næste lag af beskyttelse sker inden i modellen selv. Når jailbreak-teknikker opdages, bliver de ofte omdannet til trænings eksempler. Det er her, hvor adversarial træning og forstærket læringsfeedback fra menneskelig feedback (RLHF) kommer ind i billedet.

Ved at finjustere modeller på eksempler på fejl eller risikable interaktioner lærer udviklerne effektivt systemet at genkende mønstre, de bør afvise, selv når de er indpakket i kreative eller indirekte sprog. Over tid hjælper denne proces med at immunisere modellen mod hele klasser af angreb.

Rollen Af AI “Red Teaming”

I stedet for at vente på, at en jailbreak optræder, bruger virksomheder AI-red teams. Disse teams er grupper, der er tildelt til at forsøge at bryde modeller i kontrollerede miljøer. De tilgår systemer på samme måde, som en angriber ville, eksperimenterer med usædvanlige formuleringer, kreative formater og kanttilfælde for at afsløre, hvor sikkerhedsforanstaltninger mangler.

Red teaming er nu blevet en central del af udviklingslivscyklussen i dagens cybersecurity-strategier. Når et team opdager en ny jailbreak-teknik, føder den resulterende data direkte tilbage i trænings- og evalueringssystemer. Denne information bruges til at definere filtre, justere politikker og styrke adversarial træning, så lignende forsøg er mindre sandsynlige at lykkes i fremtiden. Over tid skaber dette en kontinuerlig loop – afsløre fejl, lære af dem og forbedre systemet, derefter gentage.

Når Poesi Bliver En Stresstest For AI-Sikkerhed

Adversarial poesi er en påmindelse om, at AI-sikkerhedsforanstaltninger afhænger af, hvordan en bruger formulerer spørgsmål, ikke kun hvad. Da modeller bliver mere tilgængelige og bredt brugt, vil forskere fortsætte med at afprøve hullerne mellem kreativt sprog og sikkerhedssystemer, der er designet til at fange mere direkte hensigt. Pointen er, at sikrere AI vil komme fra multiple forsvar, der udvikler sig lige så hurtigt som jailbreaks gør.

Zac Amos er en teknisk forfatter, der fokuserer på kunstig intelligens. Han er også Features Editor på ReHack, hvor du kan læse mere af hans arbejde.