Tankeledare

Den kommande vågen av multimodala attacker: När AI-verktyg blir den nya exploateringsytan

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Såsom stora språkmodeller (LLM) utvecklas till multimodala system som kan hantera text, bilder, röst och kod, blir de också kraftfulla orkestrerare av externa verktyg och kopplingar. Med denna utveckling kommer en utökad angreppsyta som organisationer behöver vara medvetna om.

Ett exempel på detta är social ingenjörskonst, som agenter kan falla offer för eftersom de tränades för att agera som människor gör och de har ännu mindre skepsis. En agent är till exempel inte sannolikt att kunna avgöra skillnaden mellan en spoofad e-post och en från en legitim återförsäljare.

Konvergensen av multimodalitet och verktygsåtkomst förvandlar AI från assistent till ett medium för attacker. Angripare kan nu använda enkla textprompt för att utlösa verktygsmisbruk, utföra obehöriga åtgärder eller exfiltrera känsliga data genom legitima kanaler. Eftersom dessa funktioner är utformade för tillgänglighet, inte försvar, kan även lågkvalificerade motståndare utnyttja AI-system för att utföra komplexa operationer utan att skriva en enda rad kod.

Hur multimodal AI blir en exploateringskedja

LLM blir alltmer orkestrerare av externa system, med integreringar idag som inkluderar allt från API:er till e-post, molnlagring och kodkörningsverktyg. Dessa kopplingar är ofta byggda för tillgänglighet, inte försvar.

Nackdelen med detta är att det kan leda till en våg av nya exploateringar.

En är prompt-driven verktygsmisbruk. Till exempel kunde en angripare använda en bild med prompt-injektionsinstruktioner infogade i en e-post. Ett optiskt teckenigenkänningsverktyg (OCR) behövs för att extrahera texten från bilden. Agenten instrueras att svara på e-posten och bifoga en Google-karta till offrets hemadress, vilket avanonymiserar offrets plats.

En annan mekanism är korsmodala skyddsrälsundvikande. Detta relaterar till skyddsrälsar som sitter mellan ingångs- och utgångspunkterna för verktyg. Till exempel, när man analyserar utdata från en OCR-extraktor, kan det inte finnas tillräckligt starka skyddsrälsar runt prompt-injektioner som upptäckts från dess utdata.

Det finns också strukturella svagheter som kan utnyttjas. Ett sådant problem är de lösa, alltför tillåtande bindningarna mellan modellen och de externa verktyg den kan anropa – vilket innebär att en enkel naturlig-språksprompt kan utlösa riktiga åtgärder som att köra kod, komma åt filer eller interagera med e-post. Dessutom saknar många av dessa system stränga åtkomstkontroller, så AI kan ha möjlighet att skriva, ta bort eller modifiera data långt utöver vad en människa någonsin skulle auktorisera. Problemet blir ännu allvarligare när man tittar på kopplingar och MCP-stilens tillägg, som ofta kommer med nästan inga skyddsrälsar; när de är anslutna, expanderar de AI:s räckvidd till personlig lagring, inkorgar och molnplattformar med mycket liten tillsyn. Tillsammans skapar dessa strukturella svagheter en miljö där klassiska säkerhetsproblem – exfiltration, sandbox-undflykter och till och med minnesförgiftning – kan utlösas genom inte mer än en smart konstruerad prompt.

Nya hot: Vad kommer härnäst?

I denna nya normala är AI-aktiverade e-post- och sociala ingenjörskonstattacker nära förestående. Phishing-volymen kommer att öka på grund av användningen av LLM av angriparen; flaskhalsen är att kringgå vanliga spamfilter från e-postleverantörer som Google. Inkorgsanslutna AI-agenter ökar sannolikheten för att phishingattacker lyckas. Det kommer troligen att finnas en ökning av e-postbaserade hot när användare ansluter agenter till Gmail eller Outlook.

Angripare kan instruera AI att köra hela spam- eller spear-phishing-kampanjer. I detta scenario,

AI-till-AI-phishing blir plausibelt.

Multimodala system erbjuder alltmer kodkörningsfunktioner. Undflyktsvägar tillåter angripare att bryta igenom den underliggande infrastrukturen. Och sandbox-undflykter representerar det största ryktesmässiga mardrömmen för leverantörer.

Långsiktig minnesförgiftning och fördröjda utlösare representerar ytterligare hot. Bestående minne tillåter dolda payload att aktiveras på framtida prompt. Korsmodala utlösare (t.ex. bilder eller textsnuttar) kunde utlösa tidsbombsbeteenden.

Varför multimodala attacker är så tillgängliga och farliga

AI har demokratiserat attackförmågor. Användare behöver inte längre kodnings- eller malware-utvecklingsfärdigheter; naturligt språk blir gränssnittet för malware-skapande eller dataexfiltration. Detta innebär att även icke-tekniska individer kan generera malware eller köra kampanjer via prompt.

AI möjliggör också accelerationen och skalan av skadliga operationer. Multimodala agenter kan automatisera arbete som tidigare krävde expertinsats. Kod, e-post, forskning och spaning kan produceras omedelbart.

Användarövertron och oavsiktlig exponering bidrar till AI:s skadepotential. Användare förstår ofta inte vad AI kan komma åt, och standardinställningar aktiverar alltmer AI-integrationer. Många människor inser inte att de har gett AI för stor åtkomst till e-post eller dokument.

Principer och kontroller för multimodal säkerhet

Organisationer måste införa säkerhetsåtgärder mot multimodala attacker. Säkerhetsteam måste begränsa verktygsåtkomst som standard. Opt-in-kontroller bör ersätta automatiskt aktiverade integrationer. De bör också tillämpa minst-privilegierad åtkomst till alla AI-anslutna system och ta bort skriva/tillåta åtkomst. Detta bör inkludera korsursprungsregler och domänvitlistning (infrastrukturvitlistning och inte LLM-nivåvitlistning).

En annan viktig steg är att bygga explicita skyddsrälsar för verktygsanrop. Ersätt naturlig-språkstrigger med strukturerad, typad kommandovalidering. Skyddsrälsar bör vara både indata- och utdatatillslutningspunkter.

Ytterligare viktiga principer och kontroller inkluderar:

  • Tvinga starka godkännandeprocesser för känsliga operationer.
  • Undvik att placera användardata i bestående modellminne. Tillämpa automatisk minnessanering och provenienskontroller.
  • Förhärda och isolera kodkörningsmiljöer.
  • Övervaka misstänkta beteenden och undflyktsförsök.
  • Stärk användarutbildning och transparens.
  • Lägg till mer användarbekräftelse när agenten utför riskfyllda uppgifter.
  • Gör det tydligt när AI-verktyg kommer åt e-post, filer eller molnresurser.
  • Varna användare om högriskkopplingar.

Att lyckas mot multimodala attacker

AI-teknologier har snabbt förvandlats till agenter för affärsverksamhet, vilket skapar en situation där naturligt språk i sig blir en form av exploatering. Konvergensen av multimodalitet och verktygsåtkomst öppnar upp angreppsytan, vilket förvandlar AI från en assistent till ett medium för attacker. Multimodala attacker utnyttjar den lösa integrationen mellan LLM och de externa system de kontrollerar, såsom API:er, fil lagring och automatiseringsplattformar.

Såsom hoten utvecklas, måste organisationer anta strategier som uttryckligen tar hänsyn till multimodala attackvägar. Att stärka försvar med de bästa metoderna ovan är avgörande för att förhindra att AI-verktyg oavsiktligt fungerar som länkar i en angripares exploateringskedja.

Amanda Rousseau är en Principal AI-säkerhetsforskare på Straiker och en veteran malware-reverse engineer som tidigare tjänstgjort i Facebooks Red Team och Microsofts Offensiva Forskning och Säkerhetsingenjörskap (MORSE)-team, efter tidigare roller på Endgame, FireEye och den amerikanska försvarsdepartementets cyberbrottscentrum.