AI-modeller og platforme
Hvad Er Adversarial Poesi? En Ny AI-Jailbreak Metode
Kunstig intelligens (AI)-sikkerhed er blevet til en konstant kat-og-mus-leg. Da udviklere tilfÃļjer sikkerhedsforanstaltninger for at blokere skadelige anmodninger, forsÃļger angribere at finde nye mÃĨder at omgÃĨ dem pÃĨ. En af de underligste vendinger hidtil er adversarial poesi. Denne taktik indebÃĶrer at forklade anmodninger som digte og bruge rim, metaforer og usÃĶdvanlige formuleringer til at gÃļre risikable instruktioner mindre ligesom de ting, som sikkerhedssystemer er trÃĶnet til at fange.
I praksis ÃĶndrer indholdet sig ikke meget. Det er omslaget, der gÃļr, hvilket kan vÃĶre nok til at forvirre mÃļnsterbaserede filtre. Det er en pÃĨmindelse om, at med i dagens modeller kan det, hvordan noget spÃļrges, vÃĶre lige sÃĨ vigtigt som hvad der spÃļrges.
Hvad Skete, Da Forskere Brugte Digte Til At Bryde AI?
I begyndelsen af 2025 demonstrerede forskere, at store sprogmodeller (LLMâer) kunne fÃĨs til at reagere pÃĨ begrÃĶnsede anmodninger ved at indpakke dem i poetisk form. I stedet for at udstede direkte, politik-udlÃļsende instruktioner, indlejrede forskerne de samme anmodninger i rim, metaforer og narrative digte.
PÃĨ overfladen sÃĨ anmodningerne ud til at vÃĶre kreative skriveÃļvelser, men under overfladen bar de den samme hensigt, som ellers ville vÃĶre blokeret. PÃĨ tvÃĶrs af 25 frontiers proprietÃĶre og ÃĨbne modeller rapporterede teamet, at poetisk ramme opnÃĨede en gennemsnitlig jailbreak-succesrate pÃĨ 62% for hÃĨndlavet digte og omkring 43% for bulk-âvers-omdannelseâ ved hjÃĶlp af en standardiseret meta-anmodning.
Svar selv var ikke nye fejltyper, men velkendte fejl, der optrÃĨdte gennem en uventet dÃļr. Modellerne blev presset til at producere indhold, de normalt undgÃĨr â sÃĨsom forklaringer, der berÃļrer ulovlige eller skadelige aktiviteter â fordi den underliggende anmodning var fragmenteret og kamufleret af poetisk struktur.
Studiets centrale point er, at stilistisk variation alene kan vÃĶre tilstrÃĶkkelig til at undgÃĨ sikkerhedssystemer, der er indstillet til mere litteral formulering. Det afslÃļrer en sÃĨrbarhed, der er tydelig pÃĨ tvÃĶrs af modelfamilier og alignments-tilgange.
Hvordan Fungerer Adversarial Poesi?
Adversarial angreb udnytter en simpel realitet â maskinlÃĶrings-systemer âforstÃĨrâ ikke sprog pÃĨ samme mÃĨde som mennesker. De detekterer mÃļnstre, forudsiger sandsynlige fortsÃĶttelser og fÃļlger instruktioner baseret pÃĨ, hvad deres trÃĶning og sikkerhedslag fortolker som hensigt.
NÃĨr en anmodning er formuleret pÃĨ en direkte, litteral mÃĨde, er det lettere for sikkerhedsforanstaltninger at genkende og blokere. Men nÃĨr den samme hensigt er forklede â opdelt, mildnet eller omskrevet â kan de beskyttende lag missede, hvad der faktisk spÃļrges.
Hvorfor Kan Poesi VÃĶre Et Effektivt KÃļretÃļj?
Poesi er naturligt bygget til tvetydighed. Den afhÃĶnger af metafor, abstraktion, usÃĶdvanlig struktur og indirekte formulering. Disse er prÃĶcis de egenskaber, der kan udviske grÃĶnsen mellem âharmless kreativ skrivningâ og âen anmodning, der bÃļr afvises.â
I samme 2025-studie rapporterede forskerne, at poetiske anmodninger fremkaldte usikre svar med en succesrate pÃĨ 90% pÃĨ tvÃĶrs af et bredt sÃĶt af modeller, hvilket indikerer, at stil alene kan materielt ÃĶndre resultaterne.
Hvordan Et Digt Gemmer En Rigelig Anmodning
Betrakt anmodningen som en besked og digtet som omslaget. Sikkerhedsfiltre sÃļger ofte efter ÃĨbenlyse tegn, sÃĨsom eksplisitte nÃļgleord, direkte trin-for-trin-formulering eller genkendelige ondsindede hensigter.
Poesi kan kamuflere den hensigt gennem figurativ sprog eller sprede den over linjer, hvilket gÃļr det svÃĶrere at spotte i isolation. Imens genopbygger den underliggende model meningen tilstrÃĶkkeligt til at svare, fordi den er optimeret til at slutte hensigt, selv nÃĨr sproget er indirekte.
Opdaging Og AfvÃĶrge Jailbreaks
Da jailbreak-metoder bliver mere kreative, skal samtalen skifte fra, hvordan de fungerer, til, hvordan de opdages og inddÃĶmmes. Det er isÃĶr sandt nu, da AI er en del af daglige rutiner for mange mennesker, da 27% rapporterer at bruge det flere gange om dagen.
Da flere mennesker anvender store sprogmodeller (LLMâer), bÃļr yderligere sikkerhedsforanstaltninger testes og udforskes. Denne opgave indebÃĶrer at bygge lagdelte forsvar, der kan tilpasse sig nye anmodningsstiler og undgÃĨelses-tricks, nÃĨr de opstÃĨr.
Udviklerens Dilemma
Det hardeste ved jailbreaks for AI-sikkerhedsteams er, at de ikke kommer som en kendt trussel. De skifter kontinuerligt over tid. Denne konstante skift skyldes, at en bruger kan omskrive en anmodning, opdele den i fragmenter, indpakke den i rollespil eller forklade den som kreativ skrivning. Derefter kan hver ny omslag ÃĶndre, hvordan systemet fortolker anmodningens hensigt.
Denne udfordring skalerer hurtigt, nÃĨr AI allerede er integreret i daglige rutiner, sÃĨ den faktiske brug skaber endelÃļse muligheder for kanttilfÃĶlde at optrÃĶde.
Det er derfor, at i dagens AI-sikkerhed ligner mere risikostyring over tid. NIST AI-risikostyringsrammen (AI RMF) behandler udtrykkeligt risikostyring som en lÃļbende rÃĶkke aktiviteter â organiseret omkring styre, kortlÃĶgge, mÃĨle og styre â snarere end som en statisk tjekliste. MÃĨlet er at skabe processer, der gÃļr det lettere at identificere fremkomne fejltyper, prioritere reparationer og stramme sikkerhedsforanstaltninger, nÃĨr nye jailbreak-stiler optrÃĶder.
Hvordan Modeller Beskytter Sig Selv
AI-sikkerhed bestÃĨr af flere lag. De fleste systemer har mere end ÃĐt forsvar, der arbejder sammen, hvor hvert fanger forskellige typer risikofyldt adfÃĶrd. Ved det ydre lag fungerer ind- og udgangsfiltering som en portvagt.
Indkommende anmodninger scannes for politikovertrÃĶdelser, fÃļr de nÃĨr den centrale model, mens udgÃĨende svar tjekkes for at sikre, at intet slipper igennem pÃĨ vej tilbage til brugeren. Disse systemer er gode til at identificere direkte anmodninger eller velkendte rÃļde flag, men de er ogsÃĨ de letteste at omgÃĨ, hvilket er, hvorfor mere bedrageriske jailbreaks ofte omgÃĨr dem.
Det nÃĶste lag af beskyttelse sker inden i modellen selv. NÃĨr jailbreak-teknikker opdages, bliver de ofte omdannet til trÃĶnings eksempler. Det er her, hvor adversarial trÃĶning og forstÃĶrket lÃĶringsfeedback fra menneskelig feedback (RLHF) kommer ind i billedet.
Ved at finjustere modeller pÃĨ eksempler pÃĨ fejl eller risikable interaktioner lÃĶrer udviklerne effektivt systemet at genkende mÃļnstre, de bÃļr afvise, selv nÃĨr de er indpakket i kreative eller indirekte sprog. Over tid hjÃĶlper denne proces med at immunisere modellen mod hele klasser af angreb.
Rollen Af AI âRed Teamingâ
I stedet for at vente pÃĨ, at en jailbreak optrÃĶder, bruger virksomheder AI-red teams. Disse teams er grupper, der er tildelt til at forsÃļge at bryde modeller i kontrollerede miljÃļer. De tilgÃĨr systemer pÃĨ samme mÃĨde, som en angriber ville, eksperimenterer med usÃĶdvanlige formuleringer, kreative formater og kanttilfÃĶlde for at afslÃļre, hvor sikkerhedsforanstaltninger mangler.
Red teaming er nu blevet en central del af udviklingslivscyklussen i dagens cybersecurity-strategier. NÃĨr et team opdager en ny jailbreak-teknik, fÃļder den resulterende data direkte tilbage i trÃĶnings- og evalueringssystemer. Denne information bruges til at definere filtre, justere politikker og styrke adversarial trÃĶning, sÃĨ lignende forsÃļg er mindre sandsynlige at lykkes i fremtiden. Over tid skaber dette en kontinuerlig loop â afslÃļre fejl, lÃĶre af dem og forbedre systemet, derefter gentage.
NÃĨr Poesi Bliver En Stresstest For AI-Sikkerhed
Adversarial poesi er en pÃĨmindelse om, at AI-sikkerhedsforanstaltninger afhÃĶnger af, hvordan en bruger formulerer spÃļrgsmÃĨl, ikke kun hvad. Da modeller bliver mere tilgÃĶngelige og bredt brugt, vil forskere fortsÃĶtte med at afprÃļve hullerne mellem kreativt sprog og sikkerhedssystemer, der er designet til at fange mere direkte hensigt. Pointen er, at sikrere AI vil komme fra multiple forsvar, der udvikler sig lige sÃĨ hurtigt som jailbreaks gÃļr.












