Cybersikkerhed

Sikkerheds-sårbarhederne, vi har bygget ind: AI-agenter og problemet med lydighed

mm
Føj Unite.AI til dine foretrukne kilder på Google

LLM-baserede AI-agenter introducerer en ny klasse af sårbarheder, hvor angribere indsætter skadelige instruktioner i data, og omdanner hjælpsomme systemer til uvidende medskyldige.

Microsoft Copilot blev ikke hakket i den traditionelle forstand. Der var ingen malware, ingen phishing-link, ingen skadelig kode. Ingen klikkede på noget eller deployerede nogen exploit.

Truslen aktør spurgte blot. Microsoft 365 Copilot, der gjorde nøjagtig, hvad det var bygget til, adlød. I den nylige Echoleak zero click-angreb, blev AI-agenten manipuleret af en prompt, der var forklede som data. Det adlød, ikke fordi det var brudt, men fordi det fungerede, som det var designet til.

Denne sårbarhed udnyttede ikke software-bugs. Den udnyttede sprog. Og det markerer et større vendepunkt i cybersikkerhed, hvor angrebsfladen ikke længere er kode, men samtale.

Det nye AI-lydighedsproblem

AI-agenter er designet til at hjælpe. Deres formål er at forstå brugerens intention og handle effektivt. Denne nytte kommer med risiko. Når de er integreret i filsystemer, produktivitetsplatforme eller operativsystemer, følger disse agenter naturlige sprogkommandoer med minimal modstand.

Truslen aktører udnytter netop denne egenskab. Med prompt-injektioner, der ser uskyldige ud, kan de udløse følsomme handlinger. Disse prompts kan inkludere:

  • Flersprogede kode-udsnit
  • Uklare filformater og indlejrede instruktioner
  • Ikke-engelske sprogindtastninger
  • Flertrinskommandoer skjult i daglig sprog

Fordi store sprogmodeller (LLM’er) er trænet til at forstå kompleksitet og tvetydighed, bliver prompten til payloadet.

Siri og Alexas spøgelse

Dette mønster er ikke nyt. I de tidlige dage af Siri og Alexa demonstrerede forskere hvordan afspilning af en stemmekommando som “Send alle mine billeder til denne email” kunne udløse en handling uden bruger-verificering.

Nu er truslen større. AI-agenter som Microsoft Copilot er integreret dybt i Office 365, Outlook og operativsystemet. De har adgang til emails, dokumenter, legitimationsoplysninger og API’er. Angribere behøver kun den rette prompt for at udtrække kritisk data, samtidig med at de optræder som en legitim bruger.

Når computere forveksler instruktioner med data

Dette er ikke et nyt princip i cybersikkerhed. Injektioner som SQL-angreb lykkedes, fordi systemer ikke kunne skelne mellem input og instruktion. I dag findes samme fejl, men på sprog-laget.

AI-agenter behandler naturligt sprog som både input og intention. Et JSON-objekt, en spørgsmål eller blot en frase kan initiere en handling. Denne tvetydighed er, hvad truslen aktører udnytter, ved at indlejre kommandoer i, hvad der ligner harmløs indhold.

Vi har indlejret intention i infrastrukturen. Nu har truslen aktører lært, hvordan de kan udtrække det til at gøre deres arbejde.

AI-adoptionshastighed overhaler cybersikkerhed

Da virksomheder skynder sig at integrere LLM’er, overser mange en kritisk spørgsmål: Hvad har AI-adgang til?

Når Copilot kan røre operativsystemet, udvides skadens radius langt ud over inboxen. Ifølge Check Points AI-sikkerhedsrapport:

  • 62 procent af globale Chief Information Security Officers (CISO’er) frygter, at de kan blive holdt personligt ansvarlige for AI-relaterede brud
  • Næsten 40 procent af organisationer rapporterer om ikke-godkendt internt brug af AI, ofte uden sikkerheds-overvågning
  • 20 procent af cyberkriminelle grupper inkluderer nu AI i deres operationer, herunder til at lave phishing og gennemføre rekognoscering

Dette er ikke blot en opstået risiko. Det er en nuværende risiko, der allerede forårsager skade.

Hvorfor eksisterende sikkerhedsforanstaltninger ikke er tilstrækkelige

Nogle leverandører bruger vagthunde — sekundære modeller, der er trænet til at fange farlige prompts eller mistænkeligt adfærd. Disse filtre kan opdage grundlæggende trusler, men er sårbare over for undgåelses-teknikker.

Truslen aktører kan:

  • Overbelaste filtrene med støj
  • Splitte intentionen over flere trin
  • Bruge ikke-åbenlyse formuleringer til at omgå opdægelse

I tilfældet med Echoleak var sikkerhedsforanstaltninger til stede — og de blev omgået. Dette afspejler ikke kun en fejl i politik, men en fejl i arkitektur. Når en agent har højt niveau af adgang, men lavt niveau af kontekst, falder selv gode sikkerhedsforanstaltninger til kort.

Opdægelse, ikke perfektion

At forhindre hvert angreb kan være urealistisk. Målet skal være hurtig opdægelse og rapid indhegning.

Organisationer kan starte med at:

  • Overvåge AI-agent-aktivitet i realtid og opretholde prompt-audit-logs
  • Tilføje stramme, minimale adgangsrettigheder til AI-værktøjer, der spejler admin-niveau-kontroller
  • Tilføje friktion til følsomme operationer, såsom at kræve bekræftelser
  • Flagge usædvanlige eller fjendtlige prompt-mønstre for gennemsyn

Sprog-baserede angreb vil ikke dukke op i traditionelle endpoint-opdægelse og respons (EDR)-værktøjer. De kræver en ny opdægningsmodel.

Hvad organisationer skal gøre nu for at beskytte sig selv

Før organisationer implementerer AI-agenter, skal de forstå, hvordan disse systemer fungerer, og hvilke risici de introducerer.

Nøgle-anbefalinger inkluderer:

  1. Auditér alle adgangsrettigheder: Vid, hvad agenter kan røre eller udløse
  2. Begræns skødet: Give minimum-nødvendige adgangsrettigheder
  3. Overvåg alle interaktioner: Log prompts, svar og resulterende handlinger
  4. Stresstest: Simuler fjendtlige indtastninger internt og hyppigt
  5. Planlæg for undgåelse: Antag, at filtre vil blive omgået
  6. Alignér med sikkerhed: Sørg for, at LLM-systemer understøtter, ikke kompromitterer, sikkerheds-mål

Det nye angrebs-overflade

Echoleak er en forsmag på, hvad der kommer. Da LLM’er udvikler sig, bliver deres hjælpsomhed en belastning. Integreret dybt i forretnings-systemer, tilbyder de angribere en ny måde ind — gennem simple, velkonstruerede prompts.

Dette er ikke længere blot om at sikre kode. Det handler om at sikre sprog, intention og kontekst. Spillebogen skal ændres nu, før det er for sent.

Men der er dog noget godt nyt. Der sker fremskridt i at udnytte AI-agenter til at forsvare sig imod nye og opstående cyber-trusler. Når de udnyttes korrekt, kan disse autonome AI-agenter reagere på trusler hurtigere end nogen menneske, samarbejde på tværs af miljøer og proaktivt forsvare sig imod opstående risici ved at lære af en enkelt intrusionsforsøg.

Agens-ai kan lære af hvert angreb, tilpasse sig i realtid og forhindre trusler, før de spreder sig. Det har potentialet til at etablere en ny æra af cybersikkerhed, men kun hvis vi griber dette øjeblik og former fremtiden for cybersikkerhed sammen. Hvis vi ikke gør det, kan denne nye æra signalere en cybersikkerheds- og dataprivacy-mareridt for organisationer, der allerede har implementeret AI (nogle gange endda uvidende med skygge-IT-værktøjer). Nu er tiden til at handle for at sikre, at AI-agenter bliver brugt til vores fordel i stedet for vores undergang.

Radoslaw Madej er Vulnerability Research Team Lead hos Check Point Research. Radoslaw er en passioneret cyber sikkerhedsekspert med næsten to årtiers teknisk erfaring i forskellige områder af informations sikkerhed, opnået ved at levere projekter for globale virksomheder med høje sikkerheds krav.