Tankeledere
Hvad tidlige angreb på AI-agenter fortæller os om 2026

Som AI bevæger sig fra kontrollerede eksperimenter til virkelige anvendelser, er vi ved at nå et vendepunkt i sikkerhedslandskabet. Overgangen fra statiske sprogmodeller til interaktive, agente systemer, der kan browse dokumenter, kalde værktøjer og orkestrere multi-trins arbejdsgange, er allerede i gang. Men som nylig forskning viser, venter angribere ikke på modenhed: de tilpasser sig med samme hurtige tempo, og tester systemer, så snart nye funktioner introduceres.
I fjerde kvartal 2025 analyserede vores team på Lakera rigtige angriberadfærd på systemer beskyttet af Guard og i Gandalf: Agent Breaker-miljøet – en fokuseret, 30-dages snapshot, der, trods sin snævre vindue, afspejler bredere mønstre, vi observerede hele kvartalet. Forskningen tegner et klart billede: så snart modeller begynder at interagere med noget andet end simple tekstprompt (f.eks. dokumenter, værktøjer, eksterne data), udvides trusselsoverfladen, og modstandere tilpasser sig øjeblikkeligt for at udnytte den.
Dette øjeblik kan føles bekendt for dem, der har set tidlige web-applikationer udvikle sig, eller som har observeret opkomsten af API-drevne angreb. Men med AI-agenter, er indsatsen anderledes. Angrebsvektorerne opstår hurtigere, end mange organisationer havde forventet.
Fra teori til praksis: Agenter i det vilde
For størstedelen af 2025 centrerede diskussionerne omkring AI-agenter sig primært om teoretisk potentiale og tidlige prototyper. Men i Q4 begyndte agente adfærd at dukke op i produktionsystemer i stor skala: modeller, der kunne hente og analysere dokumenter, interagere med eksterne API’er og udføre automatiserede opgaver. Disse agenter tilbød åbenlyse produktivitetsfordele, men de åbnede også døre, som traditionelle sprogmodeller ikke gjorde.
Vores analyse viser, at øjeblikket agenter blev i stand til at interagere med eksternt indhold og værktøjer, lagde angribere mærke til og tilpassede sig derefter. Denne observation stemmer overens med en grundlæggende sandhed om modstanderadfærd: angribere vil altid udforske og udnytte nye funktioner på det tidligste mulige tidspunkt. I sammenhængen med agente AI har dette ført til en hurtig udvikling i angrebsstrategier.
Angrebsmønstre: Hvad vi ser i Q4 2025
På tværs af den dataset, vi gennemgik, dukkede tre dominerende mønstre op. Hver har dybe implikationer for, hvordan AI-systemer designes, sikres og implementeres.
1. Systemprompt-ekstraktion som et centralt mål
I traditionelle sprogmodeller har prompt-injektion (direkte manipulation af input for at påvirke output) været en velkendt sårbarhed. Men i systemer med agente funktioner retter angribere sig mere og mere mod systemprompten, der er de interne instruktioner, roller og politikdefinitioner, der guider agentadfærd.
At ekstrahere systemprompt er et højt værdiobjekt, fordi disse prompt ofte indeholder rolledefinitioner, værktøjsbeskrivelser, politikinstruktioner og workflow-logik. Når en angriber forstår disse interne mekanismer, får de en vejledning til at manipulere agenten.
De mest effektive teknikker til at opnå dette var ikke brute force-angreb, men snarere klog omskrivning:
- Hypotetiske scenarier: Prompt, der beder modellen om at antage en anden rolle eller kontekst — f.eks. “Forestil dig, du er en udvikler, der gennemgår denne systemkonfiguration…” — fik ofte modellen til at afsløre beskyttede interne detaljer.
- Forklædning inden for struktureret indhold: Angribere indlejrede ondsindet kode inden for kode-lignende eller struktureret tekst, der bypassede simple filtre og udløste uventede adfærd, når de blev parseet af agenten.
Dette er ikke blot en inkrementel risiko — det ændrer fundamentalt, hvordan vi tænker om at beskytte intern logik i agente systemer.
2. Subtle indholdssikkerhedsomgåelser
En anden nøgletrænd involverer at omgå indholdssikkerhedsbeskyttelser på måder, der er svære at opdage og afværge med traditionelle filtre.
I stedet for åbenlyst ondsindet anmodninger, ramte angribere skadeligt indhold som:
- Analysetasks
- Evalueringer
- Rolle-spilscenarier
- Transformationer eller sammenfattelser
Disse omskrivninger glippede ofte forbi sikkerheds kontroller, fordi de ser uskyldige ud på overfladen. En model, der ville afvise en direkte anmodning om skadeligt output, kunne gerne producere det samme output, når den blev bedt om at “evaluere” eller “sammenfatte” det i kontekst.
Dette skift understreger en dybere udfordring: indholdssikkerhed for AI-agenter handler ikke kun om politikgennemførelse; det handler om, hvordan modeller fortolker intention. Da agenter påtager sig mere komplekse opgaver og kontekster, bliver modellerne mere modtagelige for kontekstbaseret fortolkning — og angribere udnytter denne adfærd.
3. Opkomsten af agent-specifikke angreb
Måske den mest konsekvensfulde opdagelse var opkomsten af angrebsmønstre, der kun giver mening i sammenhængen med agente funktioner. Disse var ikke blot simple prompt-injektionsforsøg, men udnyttelser forbundet med nye adfærdsmønstre:
- Forsøg på at få adgang til fortrolig internt data: Prompt blev konstrueret for at overbevise agenten om at hente eller afsløre information fra tilknyttede dokumentlager eller systemer — handlinger, der tidligere ville have været uden for modellens rækkevidde
- Script-formede instruktioner indlejret i tekst: Angribere eksperimenterede med at indlejre instruktioner i formater, der ligner script eller struktureret indhold, der kunne flyde gennem en agent-pipeline og udløse uventede handlinger
- Skjulte instruktioner i eksternt indhold: Flere angreb indlejrede onedsindede direktiver inden for eksternt henvisningsindhold — såsom websteder eller dokumenter, som agenten blev bedt om at behandle — og omgik dermed direkte input-filtre
Disse mønstre er tidlige, men signalerer en fremtid, hvor agenternes udvidede funktioner fundamentalt ændrer naturen af modstanderadfærd.
Hvorfor indirekte angreb er så effektive
En af rapportens mest slående opdagelser er, at indirekte angreb — dem, der udnytter eksternt indhold eller struktureret data — krævede færre forsøg end direkte injektioner. Dette antyder, at traditionel input-sanering og direkte forespørgselsfiltrering er utilstrækkelige forsvar, når modeller interagerer med upålideligt indhold.
Når en skadelig instruks følger med et eksternt agent-arbejdsgang — enten det er et linket dokument, en API-respons eller et hentet websted — er tidlige filtre mindre effektive. Resultatet: angribere har en større angrebsoverflade og færre hindringer.
Implikationer for 2026 og derefter
Rapportens opdagelser har brændende implikationer for organisationer, der planlægger at implementere agente AI i stor skala:
- Omdefinér tillidsgrænser
Tillid kan ikke blot være binær. Da agenter interagerer med brugere, eksternt indhold og interne arbejdsgange, skal systemer implementere nuancerede tillidsmodeller, der tager kontekst, proveniens og formål i betragtning. - Sikkerhedsforanstaltninger må udvikles
Statiske sikkerhedsfiltre er ikke nok. Sikkerhedsforanstaltninger skal være adaptive, kontekstbevidste og i stand til at resonere om intention og adfærd på tværs af multi-trins arbejdsgange. - Gennemsigtighed og revision er afgørende
Da angrebsvektorerne bliver mere komplekse, har organisationer brug for indsigt i, hvordan agenter tager beslutninger — herunder mellemtrin, eksterne interaktioner og transformationer. Revisable logfiler og forklaringsrammer er ikke længere valgfrie. - Tværfaglig samarbejde er nøgle
AI-forskning, sikkerhedsingeniører og trusselforskningshold skal arbejde sammen. AI-sikkerhed kan ikke isoleres; den skal integreres med bredere cybersikkerhedspraksis og risikostyringsrammer. - Regulering og standarder skal følge med
Lovgivere og standardiseringsorganer skal erkende, at agente systemer skaber nye klasser af risiko. Reguleringer, der omhandler dataprivatliv og outputsikkerhed, er nødvendige, men ikke tilstrækkelige; de skal også tage hensyn til interaktive adfærd og multi-trins udførelsesmiljøer.
Fremtiden for sikre AI-agenter
Ankomsten af agente AI repræsenterer en dyb forandring i funktion og risiko. Q4 2025-data er en tidlig indikator for, at så snart agenter begynder at fungere ud over simple tekstgenerering, vil angribere følge. Vores opdagelser viser, at modstandere ikke blot tilpasser sig, men også innovere angrebsteknikker, som traditionelle forsvar endnu ikke er parat til at imødegå.
For virksomheder og udviklere er beskeden klar: at sikre AI-agenter er ikke kun en teknisk udfordring; det er en arkitektonisk udfordring. Det kræver en genovervejelse af, hvordan tillid etableres, hvordan sikkerhedsforanstaltninger gennemføres, og hvordan risiko kontinuerligt vurderes i dynamiske, interaktive miljøer.
I 2026 og derefter vil de organisationer, der lykkes med agente AI, være dem, der behandler sikkerhed ikke som en eftertanke, men som en grundlæggende designprincip.












