Cybersikkerhet

Sikkerhetssårbarhetene vi har bygget inn: AI-agenter og problemet med lydighet

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

LLM-baserte AI-agenter introduserer en ny klasse av sårbarheter, der angripere injiserer skadelige instruksjoner i data, og omdanner nyttige systemer til uvitende medskyldige.

Microsoft Copilot ble ikke hakket i klassisk forstand. Det var ingen malware, ingen phishing-lenke, ingen skadelig kode. Ingen klikket på noe eller deployerte noen eksploit.

Truselen aktør bare spurte. Microsoft 365 Copilot, som gjorde akkurat det det var bygget for, adlød. I den nylige Echoleak zero click-angrep, ble AI-agenten manipulert av en prompt forkledt som data. Det adlød, ikke fordi det var ødelagt, men fordi det fungerte som det var designet til.

Dette sikkerhetshullet utnyttet ikke programvarefeil. Det utnyttet språk. Og det markerer en stor vending i cybersikkerhet, der angrepsflaten ikke lenger er kode, men samtale.

Det nye AI-lydighetsproblemet

AI-agenter er designet for å hjelpe. Deres formål er å forstå brukerens intensjon og handle effektivt. Denne nytten kommer med risiko. Når de er innbygget i filsystemer, produktivitetsplattformer eller operativsystemer, følger disse agentene naturlige språkkommandoer med minimal motstand.

Truselen aktører utnytter akkurat denne egenskapen. Med prompt-injeksjoner som ser harmløse ut, kan de utløse sensitive handlinger. Disse promptene kan inkludere:

  • Multispråklige kodefragmenter
  • Uvanlige filformater og innbygde instruksjoner
  • Ikke-engelske språkinndata
  • Flertrinnskommandoer skjult i dagligtale

Fordi store språkmodeller (LLM-er) er trent for å forstå kompleksitet og tvetydighet, blir prompten lasten.

Spenningen fra Siri og Alexa

Dette mønsteret er ikke nytt. I de tidlige dagene med Siri og Alexa, viste forskere hvordan å spille en talekommando som “Send alle mine bilder til denne e-posten” kunne utløse en handling uten brukerverifisering.

Nå er truselen større. AI-agenter som Microsoft Copilot er integrert dypt i Office 365, Outlook og operativsystemet. De har tilgang til e-post, dokumenter, legitimasjon og API-er. Angriperne trenger bare riktig prompt for å hente kritisk data, samtidig som de later som om de er en legitim bruker.

Når datamaskiner forveksler instruksjoner med data

Dette er ikke et nytt prinsipp i cybersikkerhet. Injeksjoner som SQL-angrep lyktes fordi systemer ikke kunne skille mellom inndata og instruksjon. I dag finnes samme feil, men på språklaget.

AI-agenter behandler naturlig språk som både inndata og intensjon. Et JSON-objekt, et spørsmål eller selv en setning kan initiere en handling. Denne tvetydigheten er det angriperne utnytter, ved å innbygge kommandoer i det som ser ut som harmløs innhold.

Vi har innbygget intensjon i infrastrukturen. Nå har angriperne lært hvordan de kan hente den ut for å følge deres ønsker.

AI-adoptsjon overgår cybersikkerhet

Etterhvert som bedrifter skynder seg for å integrere LLM-er, overseer mange en kritisk spørsmål: hva har AI-en tilgang til?

Når Copilot kan nå operativsystemet, utvides skadeområdet langt utenfor innboksen. Ifølge Check Points AI-sikkerhetsrapport:

  • 62 prosent av globale Chief Information Security Officers (CISO-er) frykter at de kan holdes personlig ansvarlige for AI-relaterte brudd
  • Nærmere 40 prosent av organisasjoner rapporterer om ikke-godkjent intern bruk av AI, ofte uten sikkerhetsoversikt
  • 20 prosent av cyberkriminelle grupper innlemmer nå AI i deres operasjoner, inkludert for å lage phishing og gjennomføre rekognosering

Dette er ikke bare en fremvoksende risiko. Det er en nåværende risiko som allerede forårsaker skade.

Hvorfor eksisterende sikkerhetstiltak ikke holder mål

Noen leverandører bruker vakthunder — sekundære modeller trent for å fange farlige prompter eller mistenkelig atferd. Disse filterne kan detektere grunnleggende trusler, men er sårbare for unngåelsesmetoder.

Angriperne kan:

  • Overbelaste filterne med støy
  • Splitte intensjon over flere trinn
  • Bruke ikke-åpenbare formuleringer for å unngå deteksjon

I tilfelle Echoleak var sikkerhetstiltakene til stede — og de ble omgått. Dette reflekterer ikke bare en feil i politikk, men en feil i arkitektur. Når en agent har høynivå-tilgang, men lavnivå-kontekst, faller selv gode sikkerhetstiltak kort.

Deteksjon, ikke fullkommenhet

Å forhindre hver enkelt angrep kan være urealistisk. Målet må være rask deteksjon og rask innespering.

Organisasjoner kan starte med:

  • Overvåking av AI-agentaktivitet i sanntid og vedlikehold av prompt-auditlogger
  • Å bruke strengt minst mulig tilgang til AI-verktøy, speiling av admin-nivå-kontroll
  • Å legge til friksjon til sensitive operasjoner, som å kreve bekreftelser
  • Å merke uvanlige eller motstridende promptmønster for gjennomgang

Språkbaserte angrep vil ikke dukke opp i tradisjonelle endpoint-deteksjon og respons (EDR)-verktøy. De krever en ny deteksjonsmodell.

Hva organisasjoner bør gjøre nå for å beskytte seg selv

Før de deployer AI-agenter, må organisasjoner forstå hvordan disse systemene opererer og hvilke risikoer de innfører.

Nøkkelanbefalinger inkluderer:

  1. Audit all tilgang: Vet hva agentene kan nå eller utløse
  2. Begrens omfanget: Gi minimum nødvendig tilgang
  3. Spore alle interaksjoner: Logg prompter, svar og resulterende handlinger
  4. Stress-test: Simuler motstridende inndata internt og hyppig
  5. Plan for unngåelse: Anta at filterne vil bli omgått
  6. Samordne med sikkerhet: Sørg for at LLM-systemer støtter, ikke kompromitterer, sikkerhetsmål

Det nye angrepsflaten

Echoleak er en forhåndsvisning av hva som kommer. Etterhvert som LLM-er utvikles, blir deres nytten en sårbarhet. Integrert dypt i bedriftssystemer, tilbyr de angriperne en ny måte inn — gjennom enkle, velkonstruerte prompter.

Dette er ikke lenger bare om å sikre kode. Det handler om å sikre språk, intensjon og kontekst. Spilleregler må endres nå, før det er for sent.

Men det er også noen gode nyheter. Det skjer fremgang i å bruke AI-agenter til å forsvare mot nye og fremvoksende cybertrusler. Når de brukes riktig, kan disse autonome AI-agentene svare på trusler raskere enn noen menneske, samarbeide over miljøer og proaktivt forsvare mot fremvoksende risiko ved å lære fra ett enkelt innbruddsforsøk.

Agentisk AI kan lære fra hvert angrep, tilpasse seg i sanntid og forhindre trusler før de sprer seg. Den har potensialet for å etablere en ny æra av cybersikkerhet, men bare hvis vi griper denne øyeblikket og former fremtiden for cybersikkerhet sammen. Hvis vi ikke gjør det, kan denne nye æraen signalisere en cybersikkerhets- og datavernkatastrofe for organisasjoner som allerede har implementert AI (av og til uten å vite det med skygge-IT-verktøy). Nå er tiden for å handle for å sikre at AI-agenter brukes til vår fordel, ikke vår undergang.

Radoslaw Madej er Vulnerability Research Team Lead ved Check Point Research. Radoslaw er en lidenskapelig cyber sikkerhetsekspert med nesten to tiår med teknisk erfaring i ulike områder av informasjonssikkerhet, oppnådd gjennom levering av prosjekter for globale bedrifter med høye sikkerhetskrav.