Liderzy opinii

TwÃģj narzędzie bezpieczeństwa AI nie chroni Cię – po prostu sprawia, Åže czujesz się lepiej

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google

W czerwcu 2025 roku Microsoft naprawił CVE-2025-32711, lepiej znany jako EchoLeak: zero-click vulnerability w Microsoft 365 Copilot, oceniony na 9,3 w CVSS. Sfałszowany e-mail, nigdy nieotwierany przez ofiarę, mÃģgł spowodować, Åže silnik pobierania Copilot wykradnie cichutko wszelkie wraÅžliwe konteksty, do ktÃģrych miał dostęp. SzczegÃģł, ktÃģry powinien Cię niepokoić: ładunek przeszedł prosto obok XPIA, klasyfikatora wstrzyknięcia promtu firmy Microsoft, ktÃģry był obecny, działał i działał dokładnie zgodnie z projektem.

Bruce Schneier dał nam słownictwo do tego w 2009 roku. Security theater, napisał, opisuje środki, ktÃģre sprawiają, Åže ludzie czują się bardziej bezpiecznie, nie poprawiając ich bezpieczeństwa. Poczucie i rzeczywistość są rÃģÅžnymi rzeczami i rozbieÅžnymi.

Siedemnaście lat pÃģÅšniej AI zindustrializowało rozbieÅžność, po obu stronach rÃģwnania. Narzędzia bezpieczeństwa AI są sprzedawane na podstawie moÅžliwości, ktÃģrych nie mogą udowodnić podczas pomiaru, a narzędzia bezpieczeństwa dla AI są sprzedawane jako rozwiązania problemu, ktÃģrego własna dokumentacja przyznaje, Åže moÅže być nierozwiązywalny. Hype cycle Gartnera z 2025 roku umieścił zarządzanie zaufaniem, ryzykiem i bezpieczeństwem AI na szczycie nadmuchanych oczekiwań. Analitycy mÃģwią Ci, gdzie jesteśmy. Pytanie brzmi, co z tym zrobić.

Przerwa między arkuszem danych a pomiarem

Zacznijmy od tego, co się dzieje, gdy ktoś testuje wdroÅžone kontrolki zamiast czytać ich marketing.

Raport Picus Blue Report 2025 przeanalizował ponad 160 milionÃģw symulacji atakÃģw w środowiskach produkcyjnych w pierwszej połowie 2025 roku. Picus sprzedaje platformę symulacji, więc waÅžne jest, aby ÅšrÃģdło zostało odpowiednio zwaÅžone, ale liczby są trudne do zignorowania. Skuteczność zapobiegania wyniosła średnio 62%, w porÃģwnaniu z 69% w roku poprzednim. Pomimo pokrycia rejestrowania na poziomie 54%, tylko 14% symulowanych atakÃģw wygenerowało alert. Ataki uÅžywające prawidłowych poświadczeń powiodły się 98% razy. A spośrÃģd prÃģb wykradzenia danych, kontrolki na miejscu zablokowały 3%.

Trzy procent. Są to środowiska z nowoczesnymi, często oznaczonymi jako AI, stosami bezpieczeństwa, a test wykradzenia danych jest tym, ktÃģry mapuje się najbardziej bezpośrednio do tego, co chce zrobić atakujący.

Wyniki benchmarkÃģw, ktÃģre pojawiają się w prezentacjach sprzedawcÃģw, zasługują na tę samą skepszę. Gdy sprzedawcy zaczęli twierdzić, Åže uzyskali idealne wyniki w ocenach MITRE ATT&CK, analityk Forrester Allie Mellen opublikował przypomnienie: oceny nie mają zwycięzcÃģw ani przegranych, a twierdzenia o 100% opierają się na nierzeczywistych konfiguracjach, wybranych podwynikach lub ustawieniach wykrywania, ktÃģre byłyby w stanie pogrzebać prawdziwy SOC w hałasie.

To wszystko nie jest nowe, co jest przytłaczające. W 2019 roku naukowcy z Skylight Cyber rozmontowali “czysty AI” antywirus Cylance, dodając ciągi z gry wideo Rocket League do prÃģbek złośliwego oprogramowania, odwracając werdykt klasyfikatora w 100% przypadkÃģw wśrÃģd dziesięciu najwaÅžniejszych rodzin złośliwego oprogramowania w tamtym czasie i 83% szerszego zestawu prÃģb. Lekcja, Åže statyczne modele machine learning zawodzą wobec przeciwnikÃģw, ktÃģrzy ich studiują, została opublikowana siedem lat temu. Reakcja rynku polegała na wysłaniu więcej statycznych modeli machine learning.

Problem barierki jest gorszy

Jeśli wykrywanie AI przeszacowuje, narzędzia sprzedawane do zabezpieczenia samego AI są w dziwniejszej sytuacji: organ standaryzacyjny, ktÃģry definiuje zagroÅženie, mÃģwi, Åže zagroÅženie moÅže nie być do naprawienia.

Prompt injection zajmuje pierwsze miejsce w OWASP Top 10 dla aplikacji LLM, a własne wytyczne OWASP są niezwykle otwarte: biorąc pod uwagę losowy charakter modeli, “nie jest jasne, czy istnieją bezbłędne metody zapobiegania wstrzyknięciu promtu”. Fine-tuning i RAG, dodaje, nie w pełni łagodzą tego problemu. To jest problem, ktÃģrego rozwiązanie ma za zadanie rozwiązać rynek tarczy promtu, opisany jako moÅžliwie nierozwiązywalny przez organizację, ktÃģra go skatalogowała.

Prace empiryczne potwierdzają pesymizm. Naukowcy z Uniwersytetu w Lancaster i Mindgard przetestowali sześć systemÃģw barierki w produkcji, w tym Azure Prompt Shield i Prompt Guard od Microsoftu i Meta, i osiągnęli do 100% powodzenia w uniknięciu przy uÅžyciu technik wstrzyknięcia znakÃģw i perturbacji przeciwnych, jednocześnie utrzymując podstawowe ataki w funkcjonalności. HiddenLayer posunął się dalej, publikując pojedynczy, przenoszalny szablon promtu “Policy Puppetry”, ktÃģry twierdzi, Åže omija kaÅždy głÃģwny model na rynku. To jest badanie sprzedawcy i nie jest przejrzyście, więc traktuj “wszystko” z ostroÅžnością, ale niezaleÅžne ÅšrÃģdła odtworzyły podstawowe twierdzenia.

Najbardziej wiarygodny świadek nie ma produktu do sprzedaÅžy. Instytut Bezpieczeństwa AI w Wielkiej Brytanii, oceniając pięć wiodących LLM, doniÃģsł, Åže “wszystkie modele były bardzo podatne na nasze podstawowe ataki”, przy czym kaÅždy model zgodził się co najmniej raz na pięć prÃģb dla prawie kaÅždego szkodliwego pytania, gdy zastosowano ataki wewnętrzne. Podstawowe ataki. Nie sztuka państwowa. Rządowa jednostka oceny, grzecznie zauwaÅžająca, Åže filtr wejściowy cesarza nie ma ubrania.

Własne relacje Unite.AI skatalogowały klasy podatności i techniki wstrzyknięcia przez lata. Nic z tego nie jest tajemnicą. Po prostu nie pojawia się na arkuszach danych.

Niebezpieczna część to poczucie

To jest miejsce, w ktÃģrym tytuł tego artykułu przestaje być retoryczny. Jeśli te narzędzia po prostu nie spełniają swoich obowiązkÃģw, strata byłaby budÅžetowa. Badania sugerują coś gorszego: zaufanie, ktÃģre one generują, aktywnie pogarsza zachowanie.

Badacze bezpieczeństwa nazywają to rekompensatą ryzyka lub efektem Peltzmana: chronieni ludzie podejmują większe ryzyko. Kierowcy z pasami bezpieczeństwa jeÅždŞą szybciej. I organizacje z tablicami bezpieczeństwa AI, okazuje się, przestają robić nudne rzeczy.

Liczby wyglądają niekomfortanie dobrze. WskaÅšnik gotowości bezpieczeństwa Cisco z 2025 roku, ankietujący 8 000 liderÃģw bezpieczeństwa, wykazał, Åže 86% organizacji doświadczyło incydentu związanego z bezpieczeństwem AI w ciągu ostatnich dwunastu miesięcy, podczas gdy tylko 10% uznało AI za najtrudniejszą rzecz do ochrony, a 60% przyznało, Åže brakuje im widoczności w tym, jak pracownicy uÅžywają generatywnego AI w ogÃģle. Incydenty prawie powszechne; troska, błąd zaokrąglania.

Raport IBM o koszcie naruszenia danych z 2025 roku uzupełnia obraz. SpośrÃģd organizacji, ktÃģre doświadczyły naruszeń modeli lub aplikacji AI, 97% nie miało odpowiednich kontroli dostępu do AI. Jeden na pięć przypadkÃģw naruszeń wiązał się z cieniem AI, co dodawało około 670 000 dolarÃģw do średniego kosztu naruszenia, a 63% organizacji, ktÃģre doświadczyły naruszeń, nie miało Åžadnej polityki zarządzania AI. Czytaj te liczby razem i pojawia się wzorzec: awarie są nudne. Brak podstaw, w organizacjach, ktÃģre czuły się chronione.

Pulpit nie uległ awarii. Wykonał swÃģj rzeczywisty produkt, ktÃģrym było zaufanie.

Wygląd wersji prawdziwej

Nic z tego nie twierdzi, Åže narzędzia bezpieczeństwa AI są bezuÅžyteczne, a najlepsze dowody przeciwne zasługują na czas. Badanie Constitutional Classifiers Anthropic przetrwało ponad 3 000 godzin testÃģw czerwonych przeprowadzonych przez 183 naukowcÃģw bez powszechnego jailbreaku, zmniejszając powodzenie jailbreaku z 86% w niebronionym modelu do 4,4%, przy koszcie wzrostu o 0,38 punktu w przypadku odmowy i około 24% obciÄ…Åženia obliczeniowego. Następnie Anthropic przeprowadził publiczne wyzwanie, a spośrÃģd 339 uczestnikÃģw czterech przeszło kaÅždy poziom, a jeden znalazł działający powszechny jailbreak tak czy inaczej.

To jest prawdziwy kształt całego pola w jednym wyniku: dobrze zbudowana barierka znacznie zwiększyła koszt atakującego, pociągała za sobą wymierne opłaty i nadal uległa wystarczająco zdeterminowanemu człowiekowi. Gdyby musiałem skompresować ten artykuł do zasady zakupu, jest to: kontrola sprzedawana jako zwiększająca koszt z opublikowanymi trybami awaryjnymi jest warta oceny; kontrola sprzedawana jako rozwiązany problem sprzedaje Ci poczucie.

Kontrola czy kołderka pocieszenia: trzy pytania

MoÅžesz oddzielić jedną od drugiej bez budÅžetu badawczego. Trzy pytania, zadawane kaÅždemu narzędziu bezpieczeństwa AI, ktÃģre posiadasz lub ktÃģre masz zamiar kupić.

Jaki jest jego zmierzony wskaÅšnik obejścia w moim środowisku? Nie benchmark sprzedawcy. Twoje. Ciągła walidacja i ćwiczenia zespołu fioletowego istnieją dokładnie dlatego, Åže, jak pokazują dane Picus, wdroÅžone kontrolki cichutko zbliÅžają się do awarii. Liczba, ktÃģrej nie zmierzyłeś, jest liczbą, ktÃģrej ufasz na wiara.

Co się dzieje, gdy awaryjnie? Nie jeśli. Praktyczne wytyczne OWASP wskazują tę samą stronę, co kaÅždy incydent powyÅžej: dostęp z najniÅžszymi uprawnieniami dla modeli, bramki zatwierdzające ludzi na czynnościach wraÅžliwych i segmentacja, ktÃģra zakłada, Åže filtr ostatecznie puści coś przez. EchoLeak był przetrwalibylny dla organizacji, ktÃģrych Copilot po prostu nie mÃģgł dotknąć niczego wartego kradzieÅžy.

Czy twierdzenie sprzedawcy jest faktem czy hipotezą? Nawet sprzedawcy przyznają więcej niÅž ich arkusze danych. Własne badanie Vectra wśrÃģd 2 000 profesjonalistÃģw SOC, badanie sprzedawcy, wykazało, Åže zespoły są w stanie poradzić sobie tylko 38% alertÃģw generowanych przez ich narzędzia, przy czym 60% mÃģwi, Åže sprzedawcy sprzedają narzędzia, ktÃģre tworzą hałas zamiast klarowności, a połowa nazywa swoje narzędzia większym utrudnieniem niÅž pomocą. Gdy klienci branÅžy donoszą o tym, “ufaj arkuszom danych” przestaje być strategią.

Wzorzec przetrwał poprawkę

EchoLeak został naprawiony w Patch Tuesday. Wzorzec, ktÃģry zademonstrował, produkcyjna barierka filtrowania przednich drzwi, podczas gdy atak przyszedł przez szparę, nie został naprawiony i rekord powyÅžej mÃģwi, Åže nie będzie to wkrÃģtce.

Distynkcja Schneiera jest siedemnaście lat stara i nigdy nie była droÅžsza w ignorowaniu. Poczucie bezpieczeństwa jest produktem, a era AI sprzedaje je w warstwach subskrypcyjnych. Rzeczywistość bezpieczeństwa jest pomiarem, a nikt nie moÅže jej sprzedać, bo musisz iść i ją wziąć.

Gary jest ekspertem od pisania z ponad 10-letnim doświadczeniem w rozwoju oprogramowania, rozwoju sieci web i strategii treści. Specjalizuje się w tworzeniu wysokiej jakości, angaÅžującej treści, ktÃģra napędza konwersje i buduje lojalność marki. Ma pasję do tworzenia historii, ktÃģre fascynują i informują publiczność, i zawsze szuka nowych sposobÃģw, aby zaangaÅžować uÅžytkownikÃģw.