AI-modellen en platforms
Wat is Adversarial Poetry? Een Nieuwe AI-Jailbreakmethode
De veiligheid van kunstmatige intelligentie (AI) is een constant kat-en-muisspel geworden. Terwijl ontwikkelaars beveiligingsmaatregelen toevoegen om schadelijke verzoeken te blokkeren, proberen aanvallers constant nieuwe manieren te vinden om deze te omzeilen. Een van de vreemdste wendingen tot nu toe is adversarial poetry. Deze tactiek houdt in dat prompts worden vermomd als gedichten en dat rijm, metafoor en ongebruikelijke formuleringen worden gebruikt om risicovolle instructies minder herkenbaar te maken voor de beveiligingssystemen.
In de praktijk verandert de inhoud zelf niet veel. Het is de verpakking die verandert, wat genoeg kan zijn om patronen-gebaseerde filters te verwarren. Het is een herinnering dat, met de huidige modellen, de manier waarop iets wordt gevraagd bijna even belangrijk kan zijn als wat er wordt gevraagd.
Wat Gebeurde Toen Onderzoekers Poëzie Gebruikten Om AI Te Kraken?
In het begin van 2025 toonden onderzoekers aan dat grote taalmodellen (LLM’s) konden worden geprompt om te reageren op beperkte prompts door deze in poëtische vorm te verpakken. In plaats van directe, beleidsuitgelokte instructies te geven, verpakten de onderzoekers dezelfde verzoeken in rijmen, metaforen en narratieve verzen.
Op het eerste gezicht leken de prompts creatieve schrijfoefeningen, maar onder de oppervlakte droegen ze dezelfde intentie die normaal gesproken geblokkeerd zou worden. Over 25 frontier proprietary en open-weighted modellen rapporteerden het team dat poëtische kaders een gemiddelde jailbreak-succesrate van 62% voor handgemaakte gedichten en ongeveer 43% voor bulk “verse conversie” met een gestandaardiseerde meta-prompt.
De antwoorden zelf waren geen nieuwe soorten fouten, maar vertrouwde fouten die via een onverwachte deur verschenen. De modellen werden aangemoedigd om inhoud te produceren die ze typisch vermijden – zoals uitleg over illegale of schadelijke activiteiten – omdat het onderliggende verzoek gefragmenteerd en verhuld was door de poëtische structuur.
De kernconclusie van de studie is dat stylistische variatie alleen al voldoende kan zijn om beveiligingssystemen te omzeilen die zijn afgestemd op meer letterlijke formuleringen. Het onthult een kwetsbaarheid die zichtbaar is over model-families en aligneringsbenaderingen.
Hoe Werkt Adversarial Poetry?
Adversarial aanvallen benutten een eenvoudige realiteit – machine learning-systemen “begrijpen” taal niet op de manier waarop mensen dat doen. Ze detecteren patronen, voorspellen waarschijnlijke voortzettingen en volgen instructies op basis van wat hun training en beveiligingslagen interpreteren als intentie.
Wanneer een prompt op een rechttoe rechtaan wijze is geformuleerd, is het gemakkelijker voor beveiligingsmaatregelen om het te herkennen en te blokkeren. Echter, wanneer hetzelfde doel wordt vermomd – opgesplitst, verzacht of herformuleerd – kunnen de beveiligingslagen missen wat er werkelijk wordt gevraagd.
Waarom Poëzie Een Effectief Voertuig Kan Zijn
Poëzie is van nature gebouwd op ambiguïteit. Het vertrouwt op metafoor, abstractie, ongebruikelijke structuur en indirecte formulering. Dit zijn precies de soorten kenmerken die de grens tussen “onschuldige creatieve schrijfwerk” en “een verzoek dat geweigerd moet worden” kunnen vertroebelen.
In dezelfde studie van 2025 meldden onderzoekers dat poëtische prompts onveilige antwoorden opriepen met een succesrate van 90% over een breed scala aan modellen, wat aangeeft dat stijl alleen al het resultaat aanzienlijk kan veranderen.
Hoe Een Gedicht Een Echt Verzoek Verhult
Bekijk het verzoek als een bericht en het gedicht als de verpakking. Beveiligingsfilters zoeken vaak naar voor de hand liggende tekenen, zoals expliciete trefwoorden, directe stap-voor-stap formulering of herkenbare kwaadwillige intentie.
Poëzie kan die intentie verhullen door middel van figuurlijke taal of verspreiden over regels, waardoor het moeilijker wordt om het in isolatie te herkennen. Ondertussen reconstrueert het onderliggende model de betekenis nog steeds goed genoeg om te reageren omdat het is geoptimaliseerd om intentie af te leiden, zelfs wanneer de taal indirect is.
Het Detecteren En Mitigeren Van Jailbreaks
Terwijl jailbreak-methoden creatiever worden, moet het gesprek verschuiven van hoe ze werken naar hoe ze worden opgespoord en ingedamd. Dat is vooral waar nu AI deel uitmaakt van de dagelijkse routines van veel mensen, zoals 27% rapporteren het meerdere keren per dag te gebruiken.
Terwijl meer mensen grote taalmodellen (LLM’s) gebruiken, moeten aanvullende beveiligingsmaatregelen worden getest en onderzocht. Deze taak omvat het opbouwen van gelaagde verdedigingen die kunnen aanpassen aan nieuwe prompt-stijlen en ontwijktrucs naarmate ze verschijnen.
De Dilemma Van De Ontwikkelaar
Het moeilijkste deel van jailbreaks voor AI-veiligheidsteams is dat ze niet komen als één bekende bedreiging. Ze veranderen constant in de loop van de tijd. Deze constante verandering is omdat een gebruiker een prompt kan herschrijven, opsplitsen, verpakken in een rol of vermommen als creatief schrijven. Vervolgens kan elke nieuwe verpakking veranderen hoe het systeem de intentie van de prompt interpreteert.
Deze uitdaging schaalt snel wanneer AI al is geïntegreerd in dagelijkse routines, zodat de daadwerkelijke gebruik Endless kansen creëert voor randgevallen om te verschijnen.
Dat is waarom de huidige AI-veiligheid meer lijkt op het beheren van risico’s in de loop van de tijd. Het NIST AI-risicobeheerkader (AI RMF) behandelt risicobeheer expliciet als een voortdurende reeks activiteiten – georganiseerd rond govern, map, measure en manage – in plaats van als een statische checklist. Het doel is om processen te creëren die het gemakkelijker maken om opkomende foutmodi te identificeren, reparaties te prioriteren en beveiligingsmaatregelen aan te spannen wanneer nieuwe jailbreak-stijlen verschijnen.
Hoe Modellen Zichzelf Beschermen
AI-veiligheid bestaat uit meerdere lagen. De meeste systemen hebben meer dan één verdediging die samenwerkt, waarbij elke verdediging verschillende soorten risicovol gedrag vangt. Op de buitenste laag fungeert input- en outputfiltering als poortwachter.
Inkomende prompts worden gescand op beleidsschendingen voordat ze de kern van het model bereiken, terwijl uitgaande antwoorden worden gecontroleerd om ervoor te zorgen dat niets ontsnapt op de terugweg naar de gebruiker. Deze systemen zijn goed in het identificeren van directe verzoeken of vertrouwde rode vlaggen, maar ze zijn ook het gemakkelijkst te omzeilen, wat de reden is dat meer bedrieglijke jailbreaks ze vaak omzeilen.
De volgende laag van bescherming gebeurt binnen het model zelf. Wanneer jailbreak-technieken worden ontdekt, worden ze vaak omgezet in trainingsvoorbeelden. Dit is waar adversarial training en versterking van menselijke feedback (RLHF) in beeld komen.
Door modellen te fijn te stemmen op voorbeelden van mislukte of risicovolle interacties, leren ontwikkelaars het systeem effectief om patronen te herkennen die het moet weigeren, zelfs wanneer ze zijn verpakt in creatieve of indirecte taal. In de loop van de tijd helpt dit proces om het model te immuniseren tegen hele klassen van aanvallen.
De Rol Van AI “Red Teaming”
In plaats van te wachten tot een jailbreak optreedt, gebruiken bedrijven AI-red teams. Deze teams zijn groepen die zijn belast met het proberen te breken van modellen in gecontroleerde omgevingen. Ze benaderen systemen op de manier waarop een aanvaller dat zou doen, experimenterend met ongebruikelijke formuleringen, creatieve formats en randgevallen om te ontdekken waar beveiligingsmaatregelen tekortschieten.
Red teaming wordt nu een onderdeel van de ontwikkelingslevenscyclus in de huidige cybersecurity-strategieën. Wanneer een team een nieuwe jailbreak-techniek ontdekt, voedt de resulterende gegevens direct terug in de trainings- en evaluatiepijplijnen. Deze informatie wordt gebruikt om filters te definiëren, beleid aan te passen en adversarial training te versterken, zodat soortgelijke pogingen in de toekomst minder waarschijnlijk zijn om te slagen. In de loop van de tijd creëert dit een continue lus – zoeken naar fouten, leren van ze en het systeem verbeteren, en dan herhalen.
Wanneer Poëzie Een Stress Test Wordt Voor AI-veiligheid
Adversarial poetry is een herinnering dat AI-beveiligingsmaatregelen afhankelijk zijn van hoe een gebruiker vragen stelt, niet alleen wat. Terwijl modellen meer toegankelijk en breed worden gebruikt, zullen onderzoekers blijven proberen de kloof tussen creatieve taal en beveiligingssystemen die zijn ontworpen om meer directe intentie te vangen. De conclusie is dat veiligere AI zal komen van meerdere verdedigingen die evolueren even snel als de jailbreaks.












