Tankeledere

Dit AI-sikkerhedsvÃĶrktÃļj beskytter dig ikke – det gÃļr dig bare mere tryg

mm
FÃļj Unite.AI til dine foretrukne kilder pÃĨ Google

I juni 2025 patched Microsoft CVE-2025-32711, bedre kendt som EchoLeak: en zero-click-vulnerabilitet i Microsoft 365 Copilot, scored 9,3 pÃĨ CVSS. En tilpasset e-mail, aldrig ÃĨbnet af offeret, kunne fÃĨ Copilots hentemotor til at stille og udtÃļmme hvilken som helst fÃļlsom kontekst, den havde adgang til. Detaljen, der burde bekymre dig: payloaden gik lige forbi XPIA, Microsofts egen prompt-injektionsklassifikator, som var til stede, kÃļrte og fungerede prÃĶcis som designet.

Bruce Schneier gav os vokabularet til dette tilbage i 2009. Security theater, skrev han, beskriver foranstaltninger, der gÃļr folk mere trygge uden at gÃļre noget for at forbedre deres sikkerhed. FÃļlelsen og virkeligheden er to forskellige ting, og de divergerer.

Sytnet ÃĨr senere har AI industrialiseret divergensen pÃĨ begge sider af ligningen. AI-drevne sikkerhedsvÃĶrktÃļjer sÃĶlges pÃĨ basis af evner, de ikke kan demonstrere under mÃĨling, og sikkerhedsvÃĶrktÃļjer til AI sÃĶlges som lÃļsninger pÃĨ et problem, deres egen dokumentation indrÃļmmer, er ulÃļst. Gartners 2025 hype-cyklus placerede AI-trust, risiko- og sikkerhedsstyring pÃĨ toppen af inflerede forventninger. Analytikerne fortÃĶller dig, hvor vi er. SpÃļrgsmÃĨlet er, hvad vi skal gÃļre ved det.

Gapet mellem datasheet og mÃĨling

Start med, hvad der sker, nÃĨr nogen tester udrullede kontroller i stedet for at lÃĶse deres marketing.

Picus Blue Report 2025 analyserede mere end 160 millioner realverden-angrebs-simulationer, der blev kÃļrt mod produktionsmiljÃļer i fÃļrste halvÃĨr af 2025. Picus sÃĶlger simulationsplatformen, sÃĨ vÃĶgt kilden derefter, men tallene er svÃĶre at afvise. Forebyggelseseffektiviteten lÃĨ i gennemsnit pÃĨ 62%, ned fra 69% ÃĨret fÃļr. Trods logningsdÃĶkning pÃĨ 54% genererede kun 14% af de simulerede angreb en alarm. Angreb, der brugte gyldige legitimationsoplysninger, lykkedes 98% af tiden. Og af de data-eksfiltreringsforsÃļg, der blev simuleret, blokerede kontrollerne pÃĨ plads 3%.

3%. Disse er miljÃļer med moderne, ofte AI-mÃĶrkede sikkerhedsstakke, og eksfiltrationstesten er den, der mapper mest direkte til, hvad en angriber vil gÃļre.

Benchmark-scorene, der vises i vendor-decks, fortjener den samme skepsis. Da vendors begyndte at hÃĶvde perfekte mÃĶrker pÃĨ MITRE ATT&CK-evalueringer, publicerede Forrester-analytiker Allie Mellen en pointerende pÃĨmindelse: evalueringerne har ingen vindere eller tabere, og 100%-kravene hviler typisk pÃĨ urealistiske konfigurationer, cherry-picked sub-resultater eller detectionsindstillinger, der ville begrave en rigtig SOC i stÃļj.

Ingen af dette er nyt, hvilket er den deprimerende del. I 2019 tog forskere ved Skylight Cyber Cylances “rene AI”-antivirus fra hinanden ved at tilfÃļje streng fra videospillet Rocket League til malware-eksempler, hvilket fik klassifikatorens dom til at ÃĶndre sig pÃĨ 100% af de ti mest udbredte malware-familier pÃĨ det tidspunkt og 83% af en bredere samplesÃĶt. Lektionen, at statiske machine-learning-modeller fejler over for modstandere, der studerer dem, blev publiceret for syv ÃĨr siden. Markedets respons var at sende mere statiske machine-learning-modeller.

Guardrail-problemet er vÃĶrre

Hvis AI-drevne detections-oversÃĶlger, er vÃĶrktÃļjerne, der sÃĶlges til at sikre AI selv, i en underligere position: standardiseringsorganet, der definerer truslen, siger, at truslen mÃĨske ikke kan lÃļses.

Prompt-injektion sidder pÃĨ nummer ÃĐt i OWASP Top 10 for LLM-applikationer, og OWASPs egen vejledning er usÃĶdvanligt ÃĨben: givet den stokastiske natur af modellerne, “er det ikke klart, om der er fuldprÃļvede metoder til forebyggelse af prompt-injektion.” Fine-tuning og RAG mitigerer det ikke fuldt ud. Det er problemet, prompt-shield-markedet eksisterer for at lÃļse, beskrevet som muligvis ulÃļseligt af organisationen, der katalogiserede det.

Den empiriske arbejde bakker pessimismen op. Forskere ved Lancaster University og Mindgard testede seks produktions-guardrail-systemer, herunder Microsofts Azure Prompt Shield og Metas Prompt Guard, og opnÃĨede op til 100% undgÃĨelsessucces ved hjÃĶlp af karakter-injektion og adversarial perturbation-teknikker, mens de holdt de underliggende angreb funktionsdygtige. HiddenLayer gik videre og publicerede en enkelt overfÃļrbart “Policy Puppetry”-prompt-skabelon, som de siger bypasser hver stÃļrre model pÃĨ markedet. Den er vendor-forskning og ikke peer-reviewed, sÃĨ behandl “alle” med omsorg, men uafhÃĶngige kanaler reproducerede de centrale pÃĨstande.

Den mest trovÃĶrdige vidne har intet produkt at sÃĶlge. Storbritanniens AI-Sikkerhedsinstitut, der evaluerede fem fÃļrende LLM’er, rapporterede, at “alle modeller var hÃļjst sÃĨrbare over for vores grundlÃĶggende angreb”, med hver model, der overholdt mindst ÃĐn gang ud af fem forsÃļg for nÃĶsten hver skadelig spÃļrgsmÃĨl, nÃĨr interne angreb blev anvendt. GrundlÃĶggende angreb. Ikke nationale handelstraditioner. En regerings-evaluationsorgan, der hÃļfligt noterer, at kejserens inputfilter ikke har noget tÃļj pÃĨ.

Unite.AIs egen dÃĶkning har katalogiseret sÃĨrbarheds-klasserne og injektionsteknikkerne i ÃĨrevis. Ingen af dette er hemmeligt. Det viser bare ikke pÃĨ datasheet.

Den farlige del er fÃļlelsen

Her stopper artiklens titel med at vÃĶre retorisk. Hvis disse vÃĶrktÃļjer blot underleverede, ville tabet vÃĶre budgetmÃĶssigt. Forskningen antyder noget vÃĶrre: den tillid, de genererer, degraderer aktivt adfÃĶrd.

Sikkerhedsforskere kalder det risiko-kompensation eller Peltzman-effekten: beskyttede mennesker tager mere risiko. ChauffÃļrer med sikkerhedssele kÃļrer hurtigere. Og organisationer med AI-sikkerhedsdashboard, viser det sig, stopper med at gÃļre de kedelige ting.

Tallene ligner ubehageligt godt. Ciscos 2025 Cybersecurity Readiness Index, der undersÃļgte 8.000 sikkerhedsledere, fandt, at 86% af organisationerne havde oplevet et AI-relateret sikkerhedsincident i de foregÃĨende 12 mÃĨneder, mens kun 10% betragtede AI som det svÃĶreste, de havde at beskytte, og 60% indrÃļmmede, at de manglede indsigt i, hvordan medarbejderne brugte generativ AI overhovedet. Ikke-ubehageligt universelt; bekymring, en afrundingsfejl.

IBMs 2025 Cost of a Data Breach-rapport kompletterer billedet. Af de organisationer, der led brud pÃĨ AI-modeller eller -applikationer, manglede 97% ordentlige AI-adgangskontroller. En ud af fem brud kunne spores tilbage til skygge-AI, hvilket tilfÃļjede cirka 670.000 dollar til den gennemsnitlige brudomkostning, og 63% af de ramte organisationer havde ingen AI-styringspolitik overhovedet. LÃĶs tallene sammen, og et mÃļnster dukker op: fejlene er kedelige. FravÃĶrende grundlÃĶggende, i organisationer, der fÃļlte sig dÃĶkket.

Dashboardet fungerede ikke fejl. Det leverede sin virkelige produkt, som var tillid.

Hvad den ÃĶrlige version ligner

Ingen af dette argumenterer for, at AI-sikkerhedsvÃĶrktÃļjer er vÃĶrdilÃļse, og den bedste modbevisning fortjener luft. Anthropics Constitutional Classifiers overlevede mere end 3.000 timers red-teaming af 183 forskere uden en universel jailbreak, hvilket reducerede jailbreak-succes fra 86% pÃĨ den uforsvarede model til 4,4%, til en pris af en 0,38-punkts stigning i over-afvisninger og cirka 24% beregnings-overhead. SÃĨ kÃļrte Anthropic en offentlig udfordring, og af 339 deltagere klarede fire alle niveauer, og en fandt en fungerende universel jailbreak alligevel.

Det er den ÃĶrlige form pÃĨ hele feltet i ÃĐt resultat: en velbygget guardrail Ãļgede angriberens omkostninger enormt, havde en mÃĨlbar skat, og faldt alligevel for en tilstrÃĶkkeligt beslutsom menneske. Hvis jeg skulle komprimere denne artikel til en kÃļbsprincip, er det dette: en kontrol, der sÃĶlges som en omkostningsforhÃļjende med offentliggjorte fejlmÃĨl, er vÃĶrd at evaluere; en kontrol, der sÃĶlges som et lÃļst problem, sÃĶlger dig fÃļlelsen.

Kontrol eller tryghedsblanket: tre spÃļrgsmÃĨl

Du kan skille det ene fra det andet uden en forskningsbudget. Tre spÃļrgsmÃĨl, stillet til hvert AI-sikkerhedsvÃĶrktÃļj, du ejer eller er pÃĨ vej til at kÃļbe.

Hvad er dens mÃĨlte bypass-rate i mit miljÃļ? Ikke vendor-benchmark. Din. Kontinuerlig validering og purple-team-Ãļvelser findes prÃĶcis, fordi, som Picus-data viser, udrullede kontroller glider stille mod fejl. Et tal, du ikke har mÃĨlt, er et tal, du tager pÃĨ tro.

Hvad sker der, nÃĨr det fejler? Ikke hvis. OWASPs praktiske vejledning peger samme vej som hvert enkelt incident ovenfor: mindst-privilegeret adgang til modeller, menneskelig godkendelsesporte pÃĨ fÃļlsomme handlinger og segmentering, der antager, at filteret til sidst vil lade noget gÃĨ igennem. EchoLeak var overlevelsesdygtig for organisationer, hvis Copilot simpelthen ikke kunne nÃĨ noget vÃĶrd at stjÃĶle.

Er vendor-kravet et faktum eller en hypotese? Selv vendors indrÃļmmer mere end deres datasheets gÃļr. Vectras egen undersÃļgelse af 2.000 SOC-professionelle, vendor-forskning igen, fandt hold, der kunne hÃĨndtere kun 38% af de alarmer, deres vÃĶrktÃļjer genererede, med 60% siger, at vendors sÃĶlger vÃĶrktÃļjer, der skaber stÃļj i stedet for klarhed, og halvdelen kalder deres vÃĶrktÃļjer mere hindring end hjÃĶlp. NÃĨr industrien selv rapporterer, at “stol pÃĨ datasheet” stopper med at vÃĶre en strategi.

MÃļnsteret overlever patchen

EchoLeak blev fikset i en Patch Tuesday. MÃļnsteret, det demonstrerede, en produktions-guardrail, der filtrerede frontdÃļren, mens angrebet kom ind gennem brevsprÃĶkken, blev ikke, og forskningsrekorden ovenfor siger, at det ikke vil vÃĶre snart.

Schneiers distinktion er sytten ÃĨr gammel og har aldrig vÃĶret mere dyrt at ignorere. FÃļlelsen af sikkerhed er et produkt, og AI-ÃĶraen sÃĶlger det i abonnementsniveauer. Sikkerhedens realitet er en mÃĨling, og ingen kan sÃĶlge det til dig, fordi du selv mÃĨ gÃĨ ud og tage det.

Gary er en ekspertforfatter med over 10 ÃĨrs erfaring inden for softwareudvikling, webudvikling og indholdstrategi. Han specialiserer sig i at skabe hÃļjkvalitets-, engagerende indhold, der driver konverteringer og opbygger mÃĶrkeloyalitet. Han har en passion for at skabe historier, der fanger og informerer publikum, og han sÃļger altid efter nye mÃĨder at engagere brugere pÃĨ.