Myslitelé

Přichází vlna multimodálních útoků: Když se nástroje AI stanou novou exploitační plochou

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Jako se velké jazykové modely (LLM) vyvíjí do multimodálních systémů, které mohou zpracovat text, obrázky, hlas a kód, stávají se také mocnými orchestrátory externích nástrojů a konektorů. S touto evolucí přichází rozšířená plocha útoku, které si organizace musí být vědomy.

Jedním z příkladů je sociální inženýrství, na které mohou agenti být zranitelní, protože byli vyškoleni, aby jednali jako lidé, a mají ještě méně skepticismu. Agent je například nepravděpodobně schopen určit rozdíl mezi padělaným e-mailem a e-mailem od legitimního prodejce.

Konvergence multimodality a přístupu k nástrojům transformuje AI z asistenta na médium pro útok. Útočníci mohou nyní použít jednoduché textové příkazy k aktivaci zneužití nástrojů, provedení neautorizovaných akcí nebo vyčerpání citlivých dat prostřednictvím legitimních kanálů. Tyto schopnosti jsou navrženy pro přístupnost, ne pro obranu, a proto mohou i nízko-kvalifikovaní útočníci využívat systémy AI k provádění komplexních operací bez nutnosti psát jediný řádek kódu.

Jak se multimodální AI stává exploitační řetězcem

LLM se stále více stávají orchestrátory externích systémů, s integracemi, které dnes zahrnují vše od API po e-mail, cloudové úložiště a nástroje pro spouštění kódu. Tyto konektory jsou často postaveny pro přístupnost, ne pro obranu.

Nevýhodou tohoto je, že může vést k vlně nových exploitačních útoků.

Jedním z nich je zneužití nástrojů řízených příkazy. Například útočník by mohl použít obrázek s instrukcemi pro vkládání příkazů do e-mailu. Nástroj pro rozpoznávání optických znaků (OCR) je potřebný k extrahování textu z obrázku. Agent je instruován, aby odpověděl na e-mail a připojil mapu Google k domácí adrese cíle, a tím de-anonymizoval umístění oběti.

Dalším mechanismem je obcházení bezpečnostních zábran mezi režimy. To se týká zábran, které sedí mezi vstupními a výstupními body nástrojů. Například analýza výstupu extraktoru OCR může mít nedostatečně silné zábrany proti vkládání příkazů objevených z jeho výstupu.

Existují také strukturální slabosti, které lze využít. Jedním z takových problémů jsou volné, příliš permissive vazby mezi modelem a externími nástroji, které může volat – což znamená, že jednoduchý přirozený jazykový příkaz může aktivovat reálné akce, jako je spuštění kódu, přístup k souborům nebo interakce s e-mailem. Navíc mnohé z těchto systémů postrádají přísné kontrolní mechanismy, takže AI může mít schopnost zapisovat, mazat nebo modifikovat data daleko za hranicemi toho, co by člověk kdy autorizoval. Problém se stává ještě vážnějším, když se podíváme na konektory a rozšíření MCP, která často přicházejí s téměř žádnými zábranami; jednou připojená, rozšiřují dosah AI do osobního úložiště, schránek a cloudových platforem s velmi málo dohledem. Společně tyto strukturální slabosti vytvářejí prostředí, ve kterém klasické bezpečnostní problémy – vyčerpání, úniky z pískoviště a dokonce i otrávení paměti – mohou být aktivovány prostřednictvím nic více než chytrě vytvořeného příkazu.

Vznikající hrozby: Co přijde dál?

V tomto novém normálu jsou útoky na e-mail a sociální inženýrství pomocí AI blízké. Phishingové útoky se zvýší kvůli použití LLM útočníkem; bod zúžení je obcházení běžných spamových filtrů od e-mailových poskytovatelů, jako je Google. Připojení agentů k inboxu zvyšuje pravděpodobnost úspěchu phishingových útoků. Existuje vysoká pravděpodobnost, že dojde k nárůstu e-mailových hrozeb, protože uživatelé připojují agenty k Gmailu nebo Outlooku.

Útočníci mohou řídit AI, aby spustili celé spamové nebo spear-phishingové kampaně. V tomto scénáři

je AI-phishing zcela reálný.

Multimodální systémy stále více nabízejí schopnosti spouštění kódu. Únikové cesty umožňují útočníkům proniknout do základního infrastruktury. A úniky z pískoviště představují největší noční můru pro výrobce.

Dlouhodobé otrávení paměti a odložené spouštěče představují další hrozby. Trvalá paměť umožňuje skrytým paylodům aktivovat se na budoucích příkazech. Křížové spouštěče (například obrázky nebo textové fragmenty) by mohly spustit časované chování.

Proč jsou multimodální útoky tak přístupné a nebezpečné

AI demokratizovala útočné schopnosti. Uživatelé již nepotřebují znalosti programování nebo vytváření malwaru; přirozený jazyk se stává rozhraním pro vytváření malwaru nebo vyčerpání dat. To znamená, že i netechničtí jednotlivci mohou generovat malware nebo spouštět kampaně prostřednictvím příkazů.

AI také umožňuje urychlit a zesílit škodlivé operace. Multimodální agenti mohou automatizovat práci, která dříve vyžadovala odborné úsilí. Kód, e-maily, výzkum a průzkum mohou být produkovány okamžitě.

Nadměrná důvěra uživatelů a neúmyslné vystavení přispívají k potenciálu poškození AI. Uživatelé často nerozumí, co AI může přístup, a výchozí nastavení stále více automaticky povolují integrace AI. Mnozí lidé si neuvědomují, že poskytli AI nadměrný přístup k e-mailům nebo dokumentům.

Zásady a kontroly pro multimodální bezpečnost

Organizace musí zavést bezpečnostní opatření proti multimodálním útokům. Bezpečnostní týmy budou muset omezit přístup k nástrojům výchozím nastavením. Opt-in kontroly by měly nahradit automaticky povolené integrace. Měli by také aplikovat princip least privilege na všechny systémy připojené k AI a odebrat přístup pro zápis/mažání. To by mělo zahrnovat pravidla pro křížové původ a whitelistování domén (whitelistování infrastruktury, ne LLM).

Dalším klíčovým krokem je vybudování explicitních zábran pro vyvolání nástrojů. Nahraďte přirozené jazykové příkazy strukturovanou, typovanou validací příkazů. Zábrany by měly být vstupními i výstupními body.

Další důležité zásady a kontroly zahrnují:

  • Vynucení silných schvalovacích pracovních postupů pro citlivé operace.
  • Vyhnout se umístění uživatelských dat do trvalé paměti modelu. Aplikujte automatizovanou sanitaci paměti a kontroly původu.
  • Zpevnění a izolace prostředí pro spouštění kódu.
  • Monitorování podezřelého chování a pokusů o únik.
  • Zesílení vzdělávání uživatelů a transparentnosti.
  • Přidání dalšího uživatelského potvrzení, když agent provádí rizikové úkoly.
  • Zobrazení, kdy AI nástroje přistupují k e-mailům, souborům nebo cloudovým zdrojům.
  • Varování uživatelů před vysokorizikovými konektory.

Úspěch proti multimodálním útokům

Technologie AI se rychle proměnily v agenty obchodních operací, vytvářející situaci, ve které přirozený jazyk sám se stává formou exploitační plochy. Konvergence multimodality a přístupu k nástrojům otevírá útočnou plochu, měnící AI z asistenta na médium pro útoky. Multimodální útoky využívají volné integrace mezi LLM a externími systémy, které ovládají, jako jsou API, úložiště souborů a automatizační platformy.

Jak se hrozby vyvíjejí, organizace musí přijmout strategie, které explicitně zohledňují multimodální útočné cesty. Zesílení obrany pomocí výše uvedených nejlepších postupů je nezbytné k prevenci AI nástrojů, aby se neúmyslně staly odkazy v útočníkovi exploitačním řetězci.

Amanda Rousseau je hlavní výzkumník bezpečnosti AI ve společnosti Straiker a zkušený inženýr pro reverzní analýzu malwaru, který dříve působil v týmu Facebook’s Red Team a Microsoft’s Offensive Research & Security Engineering (MORSE), poté co pracoval v společnostech Endgame, FireEye a U.S. DoD Cyber Crime Center.