Liderzy opinii

Nadchodząca fala ataków multimodalnych: Kiedy narzędzia AI stają się nową powierzchnią eksploatacji

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Jako duże modele językowe (LLM) ewoluują w systemy multimodalne, które mogą obsługiwać tekst, obrazy, głos i kod, stają się również potężnymi orchestratorami zewnętrznych narzędzi i połączeń. Wraz z tą ewolucją pojawia się rozszerzona powierzchnia ataku, której organizacje muszą być świadome.

Przykładem tego jest inżynieria społeczna, na którą agenci mogą się poddać, ponieważ zostały przeszkolone do działania jak ludzie i mają jeszcze mniej sceptycyzmu. Agent, na przykład, ma małe szanse na rozróżnienie fałszywego e-maila od tego pochodzącego od uznanego detalisty.

Konwergencja multimodalności i dostępu do narzędzi przekształca AI z asystenta w medium ataku. Atakujący mogą teraz używać prostych poleceń tekstowych, aby spowodować nadużycie narzędzi, wykonać nieautoryzowane akcje lub wykradziony wrażliwe dane za pośrednictwem legalnych kanałów. Ponieważ te możliwości są zaprojektowane z myślą o dostępności, a nie obronie, nawet atakujący o niskich umiejętnościach mogą wykorzystywać systemy AI do wykonywania złożonych operacji bez pisania jednej linii kodu.

Jak AI multimodalne stają się łańcuchem eksploatacji

LLM są coraz częściej orchestratorami zewnętrznych systemów, z połączeniami obejmującymi dziś wszystko, od API po e-mail, magazynowanie w chmurze i narzędzia do wykonywania kodu. Te połączenia są często budowane z myślą o dostępności, a nie obronie.

Wadą tego jest to, że może to doprowadzić do fali nowych eksploatacji.

Jednym z nich jest nadużycie narzędzi wywołanych przez polecenia. Na przykład, atakujący mogą użyć obrazu z instrukcjami wstrzyknięcia poleceń w e-mailu. Do wyodrębnienia tekstu z obrazu potrzebne jest narzędzie do rozpoznawania znaków optycznych (OCR). Agent jest instruowany, aby odpowiedzieć na e-mail i dołączyć mapę Google do adresu domu ofiary, tym samym deanonimizując lokalizację ofiary.

Innym mechanizmem jest unikanie barier bezpieczeństwa między modalnościami. Dotyczy to barier, które znajdują się między punktami wejścia i wyjścia narzędzi. Na przykład, analizując dane wyjściowe ekstraktora OCR, mogą nie być wystarczająco silne bariery wokół wstrzyknięć poleceń odkrytych z jego danych wyjściowych.

Istnieją również słabości strukturalne, które mogą być wykorzystane. Jednym z takich problemów jest luźne, zbyt permissive połączenie między modelem a zewnętrznymi narzędziami, które może wywołać – oznacza to, że proste polecenie językowe może spowodować rzeczywiste akcje, takie jak uruchomienie kodu, dostęp do plików lub interakcja z e-mailem. Ponadto, wiele z tych systemów nie ma surowych kontroli dostępu, więc AI może mieć możliwość zapisu, usunięcia lub modyfikacji danych w sposób, który przekracza to, co ludzie byliby w stanie autoryzować. Problem staje się jeszcze poważniejszy, gdy spojrzymy na połączenia i rozszerzenia MCP, które często pojawiają się z prawie żadnymi barierami – po podłączeniu, rozszerzają one zasięg AI do osobistego magazynowania, skrzynek odbiorczych i platform chmurowych z bardzo małą kontrolą. Wszystkie te słabości strukturalne tworzą środowisko, w którym klasyczne problemy bezpieczeństwa – wyciek danych, ucieczka z piaskownicy i nawet zatrucie pamięci – mogą być spowodowane przez nic więcej niż starannie spreparowane polecenie.

Nowe zagrożenia: Co przyjdzie dalej?

W tym nowym normalnym stanie, ataki e-mail i inżynieria społeczna z użyciem AI są nieuchronne. Phishing będzie rosło z powodu użycia LLM przez atakującego; punkt wąskiego gardła jest omijanie normalnych filtrów spamu od dostawców e-mail, takich jak Google. Połączone z AI agenci e-mail zwiększają prawdopodobieństwo powodzenia ataków phishingowych. Prawdopodobnie dojdzie do wzrostu zagrożeń opartych na e-mailu, gdy użytkownicy połączą agenci z Gmail lub Outlook.

Atakujący mogą skierować AI do prowadzenia całych kampanii spamu lub phishingowych. W tym scenariuszu,

Ataki phishingowe AI-to-AI stają się prawdopodobne.

Systemy multimodalne coraz częściej oferują możliwości wykonywania kodu. Ścieżki ucieczki pozwalają atakującym na naruszenie podstawowej infrastruktury. Ucieczki z piaskownicy reprezentują największy koszmar reputacyjny dla dostawców.

Długoterminowe zatrucie pamięci i opóźnione wyzwalacze reprezentują dalsze zagrożenia. Trwała pamięć pozwala na ukryte ładunki, które mogą być aktywowane w przyszłych poleceniach. Wyzwalacze cross-modalne (np. obrazy lub fragmenty tekstu) mogą spowodować zachowania “bomby zegarowej”.

Dlaczego ataki multimodalne są tak dostępne i niebezpieczne

AI udemokratyzowało możliwości ataku. Użytkownicy nie potrzebują już umiejętności programistycznych ani doświadczenia w tworzeniu złośliwego oprogramowania; język naturalny staje się interfejsem dla tworzenia złośliwego oprogramowania lub wycieku danych. Oznacza to, że nawet osoby nieposiadające umiejętności technicznych mogą generować złośliwe oprogramowanie lub prowadzić kampanie za pomocą poleceń.

AI umożliwia również przyspieszenie i skalowanie szkodliwych operacji. Agenci multimodalni mogą zautomatyzować pracę, która wcześniej wymagała wysiłku ekspertów. Kod, e-maile, badania i rozpoznanie mogą być produkowane natychmiast.

Nadmierna ufność użytkowników i niezamierzone narażenie przyczyniają się do potencjału szkodliwości AI. Użytkownicy często nie rozumieją, do czego AI ma dostęp, a ustawienia domyślne coraz częściej automatycznie włączają integracje AI. Wiele osób nie zdaje sobie sprawy, że przyznali AI nadmierny dostęp do e-maili lub dokumentów.

Zasady i kontrolki bezpieczeństwa multimodalnego

Organizacje muszą wprowadzić środki bezpieczeństwa przeciwko atakom multimodalnym. Zespoły bezpieczeństwa będą musiały ograniczyć dostęp do narzędzi domyślnie. Kontrolki opt-in powinny zastąpić automatycznie włączone integracje. Powinny również stosować dostęp z najniższymi uprawnieniami do wszystkich systemów połączonych z AI i usunąć dostęp do zapisu/usunięcia. Powinno to obejmować reguły cross-origin i białe listy domen (whitelisting infrastruktury, a nie na poziomie LLM).

Innym kluczowym krokiem jest budowanie jawnych barier bezpieczeństwa dla wywoływania narzędzi. Zastąpienie naturalnych wyzwań językowych strukturalnymi, typowanymi walidacjami poleceń. Bariery powinny być zarówno punktami wejścia, jak i wyjścia.

Dodatkowe ważne zasady i kontrolki obejmują:

  • Wprowadzenie silnych przepływów zatwierdzania dla wrażliwych operacji.
  • Unikanie umieszczania danych użytkownika w trwałej pamięci modelu. Zastosowanie automatycznej sanitacji pamięci i kontroli pochodzenia.
  • Wzmocnienie i izolacja środowisk wykonywania kodu.
  • Monitorowanie podejrzanych zachowań i prób ucieczki.
  • Wzmacnianie edukacji użytkowników i transparentności.
  • Dodanie większej liczby potwierdzeń użytkownika, gdy agent wykonuje ryzykowne zadania.
  • Uwypuklenie, kiedy narzędzia AI dostają się do e-maili, plików lub zasobów chmurowych.
  • Ostrzeganie użytkowników o połączeniach o wysokim ryzyku.

Powodzenie przeciwko atakom multimodalnym

Technologie AI szybko przekształciły się w agenci operacji biznesowych, tworząc sytuację, w której język naturalny staje się formą eksploatacji. Konwergencja multimodalności i dostępu do narzędzi otwiera powierzchnię ataku, zmieniając AI z asystenta w medium ataku. Ataki multimodalne wykorzystują luźne połączenie między LLM a zewnętrznymi systemami, które kontrolują, takimi jak API, magazynowanie plików i platformy automatyki.

Wraz z ewolucją zagrożeń, organizacje muszą przyjąć strategie, które wyraźnie uwzględniają ścieżki ataków multimodalnych. Wzmacnianie obrony przy użyciu najlepszych praktyk powyżej jest niezbędne, aby zapobiec niezamierzonemu użyciu narzędzi AI jako ogniwa w łańcuchu eksploatacji atakującego.

Amanda Rousseau jest starszym badawcą bezpieczeństwa sztucznej inteligencji w firmie Straiker oraz doświadczonym inżynierem odwrotnego inżynierii oprogramowania malware, który wcześniej służył w zespole Red Team w firmie Facebook oraz w zespole Offensive Research & Security Engineering (MORSE) w firmie Microsoft, po wcześniejszych rolach w firmach Endgame, FireEye oraz w Centrum Przestępstw Cybernetycznych Departamentu Obrony USA.