Cybersikkerhed
Dit AI-sikkerhedsværktøj beskytter dig ikke – det gør dig bare mere tryg

I juni 2025 patched Microsoft (MSFT ) CVE-2025-32711, bedre kendt som EchoLeak: en zero-click-vulnerabilitet i Microsoft 365 Copilot, scored 9,3 på CVSS. En tilpasset e-mail, aldrig åbnet af offeret, kunne få Copilots hentemotor til at stille og udtømme hvilken som helst følsom kontekst, den havde adgang til. Detaljen, der burde bekymre dig: payloaden gik lige forbi XPIA, Microsofts egen prompt-injektionsklassifikator, som var til stede, kørte og fungerede præcis som designet.
Bruce Schneier gav os vokabularet til dette tilbage i 2009. Security theater, skrev han, beskriver foranstaltninger, der gør folk mere trygge uden at gøre noget for at forbedre deres sikkerhed. Følelsen og virkeligheden er to forskellige ting, og de divergerer.
Sytnet år senere har AI industrialiseret divergensen på begge sider af ligningen. AI-drevne sikkerhedsværktøjer sælges på basis af evner, de ikke kan demonstrere under måling, og sikkerhedsværktøjer til AI sælges som løsninger på et problem, deres egen dokumentation indrømmer, er uløst. Gartners 2025 hype-cyklus placerede AI-trust, risiko- og sikkerhedsstyring på toppen af inflerede forventninger. Analytikerne fortæller dig, hvor vi er. Spørgsmålet er, hvad vi skal gøre ved det.
Gapet mellem datasheet og måling
Start med, hvad der sker, når nogen tester udrullede kontroller i stedet for at læse deres marketing.
Picus Blue Report 2025 analyserede mere end 160 millioner realverden-angrebs-simulationer, der blev kørt mod produktionsmiljøer i første halvår af 2025. Picus sælger simulationsplatformen, så vægt kilden derefter, men tallene er svære at afvise. Forebyggelseseffektiviteten lå i gennemsnit på 62%, ned fra 69% året før. Trods logningsdækning på 54% genererede kun 14% af de simulerede angreb en alarm. Angreb, der brugte gyldige legitimationsoplysninger, lykkedes 98% af tiden. Og af de data-eksfiltreringsforsøg, der blev simuleret, blokerede kontrollerne på plads 3%.
3%. Disse er miljøer med moderne, ofte AI-mærkede sikkerhedsstakke, og eksfiltrationstesten er den, der mapper mest direkte til, hvad en angriber vil gøre.
Benchmark-scorene, der vises i vendor-decks, fortjener den samme skepsis. Da vendors begyndte at hævde perfekte mærker på MITRE ATT&CK-evalueringer, publicerede Forrester-analytiker Allie Mellen en pointerende påmindelse: evalueringerne har ingen vindere eller tabere, og 100%-kravene hviler typisk på urealistiske konfigurationer, cherry-picked sub-resultater eller detectionsindstillinger, der ville begrave en rigtig SOC i støj.
Ingen af dette er nyt, hvilket er den deprimerende del. I 2019 tog forskere ved Skylight Cyber Cylances “rene AI”-antivirus fra hinanden ved at tilføje streng fra videospillet Rocket League til malware-eksempler, hvilket fik klassifikatorens dom til at ændre sig på 100% af de ti mest udbredte malware-familier på det tidspunkt og 83% af en bredere samplesæt. Lektionen, at statiske machine-learning-modeller fejler over for modstandere, der studerer dem, blev publiceret for syv år siden. Markedets respons var at sende mere statiske machine-learning-modeller.
Guardrail-problemet er værre
Hvis AI-drevne detections-oversælger, er værktøjerne, der sælges til at sikre AI selv, i en underligere position: standardiseringsorganet, der definerer truslen, siger, at truslen måske ikke kan løses.
Prompt-injektion sidder på nummer ét i OWASP Top 10 for LLM-applikationer, og OWASPs egen vejledning er usædvanligt åben: givet den stokastiske natur af modellerne, “er det ikke klart, om der er fuldprøvede metoder til forebyggelse af prompt-injektion.” Fine-tuning og RAG mitigerer det ikke fuldt ud. Det er problemet, prompt-shield-markedet eksisterer for at løse, beskrevet som muligvis uløseligt af organisationen, der katalogiserede det.
Den empiriske arbejde bakker pessimismen op. Forskere ved Lancaster University og Mindgard testede seks produktions-guardrail-systemer, herunder Microsofts Azure Prompt Shield og Metas Prompt Guard, og opnåede op til 100% undgåelsessucces ved hjælp af karakter-injektion og adversarial perturbation-teknikker, mens de holdt de underliggende angreb funktionsdygtige. HiddenLayer gik videre og publicerede en enkelt overførbart “Policy Puppetry”-prompt-skabelon, som de siger bypasser hver større model på markedet. Den er vendor-forskning og ikke peer-reviewed, så behandl “alle” med omsorg, men uafhængige kanaler reproducerede de centrale påstande.
Den mest troværdige vidne har intet produkt at sælge. Storbritanniens AI-Sikkerhedsinstitut, der evaluerede fem førende LLM’er, rapporterede, at “alle modeller var højst sårbare over for vores grundlæggende angreb”, med hver model, der overholdt mindst én gang ud af fem forsøg for næsten hver skadelig spørgsmål, når interne angreb blev anvendt. Grundlæggende angreb. Ikke nationale handelstraditioner. En regerings-evaluationsorgan, der høfligt noterer, at kejserens inputfilter ikke har noget tøj på.
Unite.AIs egen dækning har katalogiseret sårbarheds-klasserne og injektionsteknikkerne i årevis. Ingen af dette er hemmeligt. Det viser bare ikke på datasheet.
Den farlige del er følelsen
Her stopper artiklens titel med at være retorisk. Hvis disse værktøjer blot underleverede, ville tabet være budgetmæssigt. Forskningen antyder noget værre: den tillid, de genererer, degraderer aktivt adfærd.
Sikkerhedsforskere kalder det risiko-kompensation eller Peltzman-effekten: beskyttede mennesker tager mere risiko. Chauffører med sikkerhedssele kører hurtigere. Og organisationer med AI-sikkerhedsdashboard, viser det sig, stopper med at gøre de kedelige ting.
Tallene ligner ubehageligt godt. Ciscos 2025 Cybersecurity Readiness Index, der undersøgte 8.000 sikkerhedsledere, fandt, at 86% af organisationerne havde oplevet et AI-relateret sikkerhedsincident i de foregående 12 måneder, mens kun 10% betragtede AI som det sværeste, de havde at beskytte, og 60% indrømmede, at de manglede indsigt i, hvordan medarbejderne brugte generativ AI overhovedet. Ikke-ubehageligt universelt; bekymring, en afrundingsfejl.
IBMs 2025 Cost of a Data Breach-rapport kompletterer billedet. Af de organisationer, der led brud på AI-modeller eller -applikationer, manglede 97% ordentlige AI-adgangskontroller. En ud af fem brud kunne spores tilbage til skygge-AI, hvilket tilføjede cirka 670.000 dollar til den gennemsnitlige brudomkostning, og 63% af de ramte organisationer havde ingen AI-styringspolitik overhovedet. Læs tallene sammen, og et mønster dukker op: fejlene er kedelige. Fraværende grundlæggende, i organisationer, der følte sig dækket.
Dashboardet fungerede ikke fejl. Det leverede sin virkelige produkt, som var tillid.
Hvad den ærlige version ligner
Ingen af dette argumenterer for, at AI-sikkerhedsværktøjer er værdiløse, og den bedste modbevisning fortjener luft. Anthropics Constitutional Classifiers overlevede mere end 3.000 timers red-teaming af 183 forskere uden en universel jailbreak, hvilket reducerede jailbreak-succes fra 86% på den uforsvarede model til 4,4%, til en pris af en 0,38-punkts stigning i over-afvisninger og cirka 24% beregnings-overhead. Så kørte Anthropic en offentlig udfordring, og af 339 deltagere klarede fire alle niveauer, og en fandt en fungerende universel jailbreak alligevel.
Det er den ærlige form på hele feltet i ét resultat: en velbygget guardrail øgede angriberens omkostninger enormt, havde en målbar skat, og faldt alligevel for en tilstrækkeligt beslutsom menneske. Hvis jeg skulle komprimere denne artikel til en købsprincip, er det dette: en kontrol, der sælges som en omkostningsforhøjende med offentliggjorte fejlmål, er værd at evaluere; en kontrol, der sælges som et løst problem, sælger dig følelsen.
Kontrol eller tryghedsblanket: tre spørgsmål
Du kan skille det ene fra det andet uden en forskningsbudget. Tre spørgsmål, stillet til hvert AI-sikkerhedsværktøj, du ejer eller er på vej til at købe.
Hvad er dens målte bypass-rate i mit miljø? Ikke vendor-benchmark. Din. Kontinuerlig validering og purple-team-øvelser findes præcis, fordi, som Picus-data viser, udrullede kontroller glider stille mod fejl. Et tal, du ikke har målt, er et tal, du tager på tro.
Hvad sker der, når det fejler? Ikke hvis. OWASPs praktiske vejledning peger samme vej som hvert enkelt incident ovenfor: mindst-privilegeret adgang til modeller, menneskelig godkendelsesporte på følsomme handlinger og segmentering, der antager, at filteret til sidst vil lade noget gå igennem. EchoLeak var overlevelsesdygtig for organisationer, hvis Copilot simpelthen ikke kunne nå noget værd at stjæle.
Er vendor-kravet et faktum eller en hypotese? Selv vendors indrømmer mere end deres datasheets gør. Vectras egen undersøgelse af 2.000 SOC-professionelle, vendor-forskning igen, fandt hold, der kunne håndtere kun 38% af de alarmer, deres værktøjer genererede, med 60% siger, at vendors sælger værktøjer, der skaber støj i stedet for klarhed, og halvdelen kalder deres værktøjer mere hindring end hjælp. Når industrien selv rapporterer, at “stol på datasheet” stopper med at være en strategi.
Mønsteret overlever patchen
EchoLeak blev fikset i en Patch Tuesday. Mønsteret, det demonstrerede, en produktions-guardrail, der filtrerede frontdøren, mens angrebet kom ind gennem brevsprækken, blev ikke, og forskningsrekorden ovenfor siger, at det ikke vil være snart.
Schneiers distinktion er sytten år gammel og har aldrig været mere dyrt at ignorere. Følelsen af sikkerhed er et produkt, og AI-æraen sælger det i abonnementsniveauer. Sikkerhedens realitet er en måling, og ingen kan sælge det til dig, fordi du selv må gå ud og tage det.












