Cybersikkerhet

Din AI-sikkerhetstverktøy beskytter deg ikke – det gjør deg bare mer trygg

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

I juni 2025, rettet Microsoft (MSFT ) CVE-2025-32711, bedre kjent som EchoLeak: en null-klikk-sårbarhet i Microsoft 365 Copilot, som fikk en score på 9,3 på CVSS. En konstruert e-post, som aldri ble åpnet av offeret, kunne få Copilots hentingssystem til å eksfiltrere sensitive data uten å bli oppdaget. Det som bør bekymre deg: lasten gikk rett forbi XPIA, Microsofts egen prompt-injeksjonsklassifiserer, som var til stede, kjørte og fungerte nøyaktig som designet.

Bruce Schneier ga oss vokabularet for dette tilbake i 2009. Sikkerhetsteater, skrev han, beskriver tiltak som gjør folk mer trygge uten å forbedre deres sikkerhet. Følelsen og virkeligheten er to forskjellige ting, og de divergerer.

Seksten år senere har AI industrialisert divergensen, på begge sider av ligningen. AI-drevne sikkerhetstverktøy selges på kapasiteter de ikke kan demonstrere under måling, og sikkerhetstverktøy for AI selges som løsninger på et problem deres egen dokumentasjon innrømmer er uløst. Gartners 2025 hype-syklus plasserte AI-tillit, risiko- og sikkerhetsstyring på toppen av inflerte forventninger. Analytikerne forteller deg hvor vi er. Spørsmålet er hva du skal gjøre med det.

Gapet mellom datasheet og måling

Start med hva som skjer når noen tester deployede kontroller i stedet for å lese deres markedsføring.

Picus Blue Report 2025 analyserte over 160 millioner simuleringsangrep mot produksjonsmiljøer i første halvår 2025. Picus selger simuleringsplattformen, så vekt kilde henholdsvis, men tallene er vanskelige å avvise. Forebyggings-effektiviteten var i gjennomsnitt 62%, ned fra 69% året før. Til tross for logging-dekning på 54%, genererte bare 14% av simuleringsangrepene en advarsel. Angrep med gyldige legitimasjoner lyktes 98% av gangene. Og av datatap-forsøkene som ble simulert, blokkerte kontrollene på plass 3%.

3 prosent. Dette er miljøer med moderne, ofte AI-merkede sikkerhetsstapler, og eksfiltreringstesten er den som kartlegger mest direkte hva en angriper ønsker å gjøre.

Benchmark-poengene som vises i leverandør-decks fortjener samme skepsis. Når leverandører begynte å hevde perfekte poeng på MITRE ATT&CK-evalueringer, publiserte Forrester-analytiker Allie Mellen en påpektende påminnelse: evalueringene har ingen vinnere eller tapere, og 100%-kravene hviler vanligvis på urimelige konfigurasjoner, cherry-picked sub-resultater eller deteksjonsinnstillinger som ville begrave en ekte SOC i støy.

Ingenting av dette er nytt, som er det deprimerende delen. I 2019 tok forskere ved Skylight Cyber Cylances “rene AI”-antivirus fra hverandre ved å legge til strenger fra videospillet Rocket League til malware-eksempler, og snudde klassifiseringsverdictet på 100% av de ti mest vanlige malware-familiene den gang og 83% av et bredere eksemplarsett. Leksjonen, at statiske maskinlæringsmodeller feiler mot motstandere som studerer dem, ble publisert syv år tidligere. Markedets respons var å sende ut flere statiske maskinlæringsmodeller.

Guardrail-problemet er verre

Hvis AI-drevne deteksjonsverktøy overdrar, er verktøyene solgt for å sikre AI selv i en merkeligere posisjon: standardiseringsorganet som definerer trusselen sier at trusselen kanskje ikke kan fikses.

Prompt-injeksjon står på førsteplass i OWASP Top 10 for LLM-applikasjoner, og OWASPs egen veiledning er usedvanlig åpen: gitt den stokastiske naturen til modellene, “er det uklart om det finnes feilfrie metoder for forebygging av prompt-injeksjon.” Fine-tuning og RAG, legger det til, mitigerte det ikke fullstendig. Dette er problemet som prompt-skjold-markedet eksisterer for å løse, beskrevet som muligvis uløst av organisasjonen som katalogiserte det.

Den empiriske arbeidet støtter pesimismen. Forskere ved Lancaster University og Mindgard testet seks produksjons guardrail-systemer, inkludert Microsofts Azure Prompt Shield og Metas Prompt Guard, og oppnådde opp til 100% unngåelsessuksess ved hjelp av karakter-injeksjon og adversarial perturbasjonsteknikker, samtidig som de holdt de underliggende angrepene funksjonelle. HiddenLayer gikk lenger, og publiserte en enkelt overførbar “Policy Puppetry”-prompt-mal som de sier unngår hver større modell på markedet. Dette er leverandør-forskning og ikke fagfellevurdert, så behandl “alle” med omsorg, men uavhengige kilder reproduerte de grunnleggende kravene.

Den mest troverdige vitnet har ingen produkt å selge. Storbritannias AI-sikkerhetsinstitutt, som evaluerte fem ledende LLM-er, rapporterte at “alle modellene var svært sårbare for våre grunnleggende angrep”, med hver modell som samtykket minst en gang i fem forsøk for nesten hver skadelig spørsmål når interne angrep ble brukt. Grunnleggende angrep. Ikke nasjonal tradecraft. En regjerings-evaluering, som høflig noterte at keiserens inndatafilter har ingen klær.

Unite.AIs egen dekning har katalogisert sårbarhetsklassene og injeksjonsteknikkene i årevis. Ingenting av dette er hemmelig. Det dukker bare ikke opp på datasheetene.

Det farlige er følelsen

Her stopper artikkeltittelen å være retorisk. Hvis disse verktøyene bare underleverer, ville tapet være budsjettmessig. Forskningen antyder noe verre: tilliten de genererer degraderer aktivt atferden.

Sikkerhetsforskere kaller det risikokompensasjon, eller Peltzman-effekten: beskyttede mennesker tar mer risiko. Bilførere med sikkerhetsbelter kjører raskere. Og organisasjoner med AI-sikkerhetsskjermer, det viser seg, stopper å gjøre de kjedelige tingene.

Tallene ligner ubehagelig godt. Ciscos 2025 Cybersecurity Readiness Index, som undersøkte 8 000 sikkerhetsledere, fant at 86% av organisasjonene hadde opplevd et AI-relatert sikkerhetsincident i løpet av de siste tolv månedene, mens bare 10% anså AI for det hardeste de måtte beskytte, og 60% innrømmet at de manglet oversikt over hvordan ansatte bruker generativ AI overhodet. Hendelser nesten-universelle; bekymring, en avrundingsfeil.

IBMs 2025 Cost of a Data Breach-rapport fullfører bildet. Av organisasjonene som led brudd på AI-modeller eller -applikasjoner, manglet 97% ordentlige AI-tilgangskontroller. En av fem brudd kunne spores tilbake til skygge-AI, og la til rundt 670 000 dollar til den gjennomsnittlige bruddkosten, og 63% av brekkede organisasjoner hadde ingen AI-styringspolitikk i det hele tatt. Les tallene sammen og et mønster dukker opp: feilene er kjedelige. Fraværende grunnleggende, i organisasjoner som følte seg dekket.

Dashbordet fungerte ikke feil. Det leverte sitt faktiske produkt, som var tillit.

Hva den ærlige versjonen ser ut som

Ingenting av dette argumenterer for at AI-sikkerhetstverktøy er verdiløse, og det beste motbeviset fortjener luft. Anthropics Constitutional Classifiers overlevde mer enn 3 000 timer med red-teaming av 183 forskere uten en universell jailbreak, og reduserte jailbreak-suksessen fra 86% på den uforsvarte modellen til 4,4%, til en pris av en 0,38-punkts økning i over-nektelser og rundt 24% beregningsoverhead. Deretter kjørte Anthropic en offentlig utfordring, og av 339 deltakere, klarte fire å fullføre hver enkelt nivå og en fant en fungerende universell jailbreak likevel.

Dette er den ærlige formen på hele feltet i ett resultat: et velfungerende guardrail økte angriperens kostnad enormt, hadde en målbar skatt, og falt likevel for en tilstrekkelig bestemt menneske. Hvis jeg måtte komprimere denne artikkelen til et kjøpsprinsipp, er det dette: en kontroll solgt som en kostnadsøker med publiserte feilmoduser er verdt å evaluere; en kontroll solgt som et løst problem er solgt deg følelsen.

Kontroll eller komfort-teppe: tre spørsmål

Du kan skille ett fra det andre uten en forskningsbudsjett. Tre spørsmål, stilt til hvert AI-sikkerhetstverktøy du eier eller er på vei å kjøpe.

Hva er dens målte omgåelsesrate i mitt miljø? Ikke leverandørens benchmark. Din. Kontinuerlig validering og lilla-lag-øvelser eksisterer nøyaktig fordi, som Picus-dataene viser, deployede kontroller glir mot feil stille. Et tall du ikke har målt er et tall du tar på tro.

Hva skjer når det feiler? Ikke hvis. OWASPs praktiske veiledning peker samme retning som hver enkelt hendelse ovenfor: minst-privilegeret tilgang for modeller, menneskelig godkjenning på sensitive handlinger og segmentering som antar at filteret til slutt vil slippe noe igjennom. EchoLeak var overlevbart for organisasjoner hvis Copilot bare ikke kunne nå noe verd å stjele.

Er leverandørens krav et faktum eller en hypotese? Selv leverandørene innrømmer mer enn deres datasheet gjør. Vectras egen undersøkelse av 2 000 SOC-proffs, leverandør-forskning igjen, fant at teamene kunne håndtere bare 38% av advarslene deres verktøy genererer, med 60% som sa at leverandører solgte verktøy som skapte støy i stedet for klarhet, og halvparten kalte deres verktøy mer hindring enn hjelp. Når bransjens egne kunder rapporterer det, stopper “tillit datasheet” å være en strategi.

Mønsteret overlever patchen

EchoLeak ble fikset i en Patch Tuesday. Mønsteret det demonstrerte, et produksjons guardrail som trygt filterte frontdøren mens angrepet kom inn gjennom postkassen, ble ikke fikset, og forskningsrekorden ovenfor sier at det ikke kommer til å bli fikset snart.

Schneiers distinksjon er sytten år gammel og har aldri vært mer dyrt å ignorere. Følelsen av sikkerhet er et produkt, og AI-æraen selger det i abonnementsnivåer. Virkeligheten av sikkerhet er en måling, og ingen kan selge det til deg, fordi du må gå og ta det.

Gary er en ekspertforfatter med over 10 års erfaring innen programvareutvikling, webutvikling og innholdstrategi. Han spesialiserer seg på å lage høykvalitets-, engasjerende innhold som driver konverteringer og bygger merkevareloyalitet. Han har en lidenskap for å skape historier som fanger og informerer publikum, og han søker alltid etter nye måter å engasjere brukerne på.