Cyberbezpieczeństwo
Twój narzędzie bezpieczeństwa AI nie chroni Cię – po prostu sprawia, że czujesz się lepiej

W czerwcu 2025 roku Microsoft (MSFT ) naprawił CVE-2025-32711, lepiej znany jako EchoLeak: zero-click vulnerability w Microsoft 365 Copilot, oceniony na 9,3 w CVSS. Sfałszowany e-mail, nigdy nieotwierany przez ofiarę, mógł spowodować, że silnik pobierania Copilot wykradnie cichutko wszelkie wrażliwe konteksty, do których miał dostęp. Szczegół, który powinien Cię niepokoić: ładunek przeszedł prosto obok XPIA, klasyfikatora wstrzyknięcia promtu firmy Microsoft, który był obecny, działał i działał dokładnie zgodnie z projektem.
Bruce Schneier dał nam słownictwo do tego w 2009 roku. Security theater, napisał, opisuje środki, które sprawiają, że ludzie czują się bardziej bezpiecznie, nie poprawiając ich bezpieczeństwa. Poczucie i rzeczywistość są różnymi rzeczami i rozbieżnymi.
Siedemnaście lat później AI zindustrializowało rozbieżność, po obu stronach równania. Narzędzia bezpieczeństwa AI są sprzedawane na podstawie możliwości, których nie mogą udowodnić podczas pomiaru, a narzędzia bezpieczeństwa dla AI są sprzedawane jako rozwiązania problemu, którego własna dokumentacja przyznaje, że może być nierozwiązywalny. Hype cycle Gartnera z 2025 roku umieścił zarządzanie zaufaniem, ryzykiem i bezpieczeństwem AI na szczycie nadmuchanych oczekiwań. Analitycy mówią Ci, gdzie jesteśmy. Pytanie brzmi, co z tym zrobić.
Przerwa między arkuszem danych a pomiarem
Zacznijmy od tego, co się dzieje, gdy ktoś testuje wdrożone kontrolki zamiast czytać ich marketing.
Raport Picus Blue Report 2025 przeanalizował ponad 160 milionów symulacji ataków w środowiskach produkcyjnych w pierwszej połowie 2025 roku. Picus sprzedaje platformę symulacji, więc ważne jest, aby źródło zostało odpowiednio zważone, ale liczby są trudne do zignorowania. Skuteczność zapobiegania wyniosła średnio 62%, w porównaniu z 69% w roku poprzednim. Pomimo pokrycia rejestrowania na poziomie 54%, tylko 14% symulowanych ataków wygenerowało alert. Ataki używające prawidłowych poświadczeń powiodły się 98% razy. A spośród prób wykradzenia danych, kontrolki na miejscu zablokowały 3%.
Trzy procent. Są to środowiska z nowoczesnymi, często oznaczonymi jako AI, stosami bezpieczeństwa, a test wykradzenia danych jest tym, który mapuje się najbardziej bezpośrednio do tego, co chce zrobić atakujący.
Wyniki benchmarków, które pojawiają się w prezentacjach sprzedawców, zasługują na tę samą skepszę. Gdy sprzedawcy zaczęli twierdzić, że uzyskali idealne wyniki w ocenach MITRE ATT&CK, analityk Forrester Allie Mellen opublikował przypomnienie: oceny nie mają zwycięzców ani przegranych, a twierdzenia o 100% opierają się na nierzeczywistych konfiguracjach, wybranych podwynikach lub ustawieniach wykrywania, które byłyby w stanie pogrzebać prawdziwy SOC w hałasie.
To wszystko nie jest nowe, co jest przytłaczające. W 2019 roku naukowcy z Skylight Cyber rozmontowali “czysty AI” antywirus Cylance, dodając ciągi z gry wideo Rocket League do próbek złośliwego oprogramowania, odwracając werdykt klasyfikatora w 100% przypadków wśród dziesięciu najważniejszych rodzin złośliwego oprogramowania w tamtym czasie i 83% szerszego zestawu prób. Lekcja, że statyczne modele machine learning zawodzą wobec przeciwników, którzy ich studiują, została opublikowana siedem lat temu. Reakcja rynku polegała na wysłaniu więcej statycznych modeli machine learning.
Problem barierki jest gorszy
Jeśli wykrywanie AI przeszacowuje, narzędzia sprzedawane do zabezpieczenia samego AI są w dziwniejszej sytuacji: organ standaryzacyjny, który definiuje zagrożenie, mówi, że zagrożenie może nie być do naprawienia.
Prompt injection zajmuje pierwsze miejsce w OWASP Top 10 dla aplikacji LLM, a własne wytyczne OWASP są niezwykle otwarte: biorąc pod uwagę losowy charakter modeli, “nie jest jasne, czy istnieją bezbłędne metody zapobiegania wstrzyknięciu promtu”. Fine-tuning i RAG, dodaje, nie w pełni łagodzą tego problemu. To jest problem, którego rozwiązanie ma za zadanie rozwiązać rynek tarczy promtu, opisany jako możliwie nierozwiązywalny przez organizację, która go skatalogowała.
Prace empiryczne potwierdzają pesymizm. Naukowcy z Uniwersytetu w Lancaster i Mindgard przetestowali sześć systemów barierki w produkcji, w tym Azure Prompt Shield i Prompt Guard od Microsoftu i Meta, i osiągnęli do 100% powodzenia w uniknięciu przy użyciu technik wstrzyknięcia znaków i perturbacji przeciwnych, jednocześnie utrzymując podstawowe ataki w funkcjonalności. HiddenLayer posunął się dalej, publikując pojedynczy, przenoszalny szablon promtu “Policy Puppetry”, który twierdzi, że omija każdy główny model na rynku. To jest badanie sprzedawcy i nie jest przejrzyście, więc traktuj “wszystko” z ostrożnością, ale niezależne źródła odtworzyły podstawowe twierdzenia.
Najbardziej wiarygodny świadek nie ma produktu do sprzedaży. Instytut Bezpieczeństwa AI w Wielkiej Brytanii, oceniając pięć wiodących LLM, doniósł, że “wszystkie modele były bardzo podatne na nasze podstawowe ataki”, przy czym każdy model zgodził się co najmniej raz na pięć prób dla prawie każdego szkodliwego pytania, gdy zastosowano ataki wewnętrzne. Podstawowe ataki. Nie sztuka państwowa. Rządowa jednostka oceny, grzecznie zauważająca, że filtr wejściowy cesarza nie ma ubrania.
Własne relacje Unite.AI skatalogowały klasy podatności i techniki wstrzyknięcia przez lata. Nic z tego nie jest tajemnicą. Po prostu nie pojawia się na arkuszach danych.
Niebezpieczna część to poczucie
To jest miejsce, w którym tytuł tego artykułu przestaje być retoryczny. Jeśli te narzędzia po prostu nie spełniają swoich obowiązków, strata byłaby budżetowa. Badania sugerują coś gorszego: zaufanie, które one generują, aktywnie pogarsza zachowanie.
Badacze bezpieczeństwa nazywają to rekompensatą ryzyka lub efektem Peltzmana: chronieni ludzie podejmują większe ryzyko. Kierowcy z pasami bezpieczeństwa jeżdżą szybciej. I organizacje z tablicami bezpieczeństwa AI, okazuje się, przestają robić nudne rzeczy.
Liczby wyglądają niekomfortanie dobrze. Wskaźnik gotowości bezpieczeństwa Cisco z 2025 roku, ankietujący 8 000 liderów bezpieczeństwa, wykazał, że 86% organizacji doświadczyło incydentu związanego z bezpieczeństwem AI w ciągu ostatnich dwunastu miesięcy, podczas gdy tylko 10% uznało AI za najtrudniejszą rzecz do ochrony, a 60% przyznało, że brakuje im widoczności w tym, jak pracownicy używają generatywnego AI w ogóle. Incydenty prawie powszechne; troska, błąd zaokrąglania.
Raport IBM o koszcie naruszenia danych z 2025 roku uzupełnia obraz. Spośród organizacji, które doświadczyły naruszeń modeli lub aplikacji AI, 97% nie miało odpowiednich kontroli dostępu do AI. Jeden na pięć przypadków naruszeń wiązał się z cieniem AI, co dodawało około 670 000 dolarów do średniego kosztu naruszenia, a 63% organizacji, które doświadczyły naruszeń, nie miało żadnej polityki zarządzania AI. Czytaj te liczby razem i pojawia się wzorzec: awarie są nudne. Brak podstaw, w organizacjach, które czuły się chronione.
Pulpit nie uległ awarii. Wykonał swój rzeczywisty produkt, którym było zaufanie.
Wygląd wersji prawdziwej
Nic z tego nie twierdzi, że narzędzia bezpieczeństwa AI są bezużyteczne, a najlepsze dowody przeciwne zasługują na czas. Badanie Constitutional Classifiers Anthropic przetrwało ponad 3 000 godzin testów czerwonych przeprowadzonych przez 183 naukowców bez powszechnego jailbreaku, zmniejszając powodzenie jailbreaku z 86% w niebronionym modelu do 4,4%, przy koszcie wzrostu o 0,38 punktu w przypadku odmowy i około 24% obciążenia obliczeniowego. Następnie Anthropic przeprowadził publiczne wyzwanie, a spośród 339 uczestników czterech przeszło każdy poziom, a jeden znalazł działający powszechny jailbreak tak czy inaczej.
To jest prawdziwy kształt całego pola w jednym wyniku: dobrze zbudowana barierka znacznie zwiększyła koszt atakującego, pociągała za sobą wymierne opłaty i nadal uległa wystarczająco zdeterminowanemu człowiekowi. Gdyby musiałem skompresować ten artykuł do zasady zakupu, jest to: kontrola sprzedawana jako zwiększająca koszt z opublikowanymi trybami awaryjnymi jest warta oceny; kontrola sprzedawana jako rozwiązany problem sprzedaje Ci poczucie.
Kontrola czy kołderka pocieszenia: trzy pytania
Możesz oddzielić jedną od drugiej bez budżetu badawczego. Trzy pytania, zadawane każdemu narzędziu bezpieczeństwa AI, które posiadasz lub które masz zamiar kupić.
Jaki jest jego zmierzony wskaźnik obejścia w moim środowisku? Nie benchmark sprzedawcy. Twoje. Ciągła walidacja i ćwiczenia zespołu fioletowego istnieją dokładnie dlatego, że, jak pokazują dane Picus, wdrożone kontrolki cichutko zbliżają się do awarii. Liczba, której nie zmierzyłeś, jest liczbą, której ufasz na wiara.
Co się dzieje, gdy awaryjnie? Nie jeśli. Praktyczne wytyczne OWASP wskazują tę samą stronę, co każdy incydent powyżej: dostęp z najniższymi uprawnieniami dla modeli, bramki zatwierdzające ludzi na czynnościach wrażliwych i segmentacja, która zakłada, że filtr ostatecznie puści coś przez. EchoLeak był przetrwalibylny dla organizacji, których Copilot po prostu nie mógł dotknąć niczego wartego kradzieży.
Czy twierdzenie sprzedawcy jest faktem czy hipotezą? Nawet sprzedawcy przyznają więcej niż ich arkusze danych. Własne badanie Vectra wśród 2 000 profesjonalistów SOC, badanie sprzedawcy, wykazało, że zespoły są w stanie poradzić sobie tylko 38% alertów generowanych przez ich narzędzia, przy czym 60% mówi, że sprzedawcy sprzedają narzędzia, które tworzą hałas zamiast klarowności, a połowa nazywa swoje narzędzia większym utrudnieniem niż pomocą. Gdy klienci branży donoszą o tym, “ufaj arkuszom danych” przestaje być strategią.
Wzorzec przetrwał poprawkę
EchoLeak został naprawiony w Patch Tuesday. Wzorzec, który zademonstrował, produkcyjna barierka filtrowania przednich drzwi, podczas gdy atak przyszedł przez szparę, nie został naprawiony i rekord powyżej mówi, że nie będzie to wkrótce.
Distynkcja Schneiera jest siedemnaście lat stara i nigdy nie była droższa w ignorowaniu. Poczucie bezpieczeństwa jest produktem, a era AI sprzedaje je w warstwach subskrypcyjnych. Rzeczywistość bezpieczeństwa jest pomiarem, a nikt nie może jej sprzedać, bo musisz iść i ją wziąć.












