Rapporter

När AI slår fel: Enkrypt AI-rapport avslöjar farliga sårbarheter i multimodala modeller

mm
Lägg till Unite.AI bland dina föredragna källor på Google

I maj 2025 släppte Enkrypt AI sin Multimodal Red Teaming Report, en skrämmande analys som avslöjade hur lätt avancerade AI-system kan manipuleras till att generera farligt och oetiskt innehåll. Rapporten fokuserar på två av Mistral’s ledande vision-språkmodeller – Pixtral-Large (25.02) och Pixtral-12b – och målar upp en bild av modeller som inte bara är tekniskt imponerande utan också skrämmande sårbara.

Vision-språkmodeller (VLM) som Pixtral är byggda för att tolka både visuella och textbaserade indata, vilket gör att de kan svara intelligent på komplexa, verklighetsbaserade prompt. Men denna förmåga kommer med ökad risk. Till skillnad från traditionella språkmodeller som bara bearbetar text kan VLM påverkas av samspelen mellan bilder och ord, vilket öppnar nya dörrar för antagonistiska attacker. Enkrypt AI’s testning visar hur lätt dessa dörrar kan öppnas.

Larmande testresultat: CSEM och CBRN-misslyckanden

Teamet bakom rapporten använde sofistikerade red teaming-metoder – en form av antagonistisk utvärdering som är utformad för att imitera verklighetsbaserade hot. Dessa tester använde taktiker som jailbreaking (att prompta modellen med noggrant utformade frågor för att kringgå säkerhetsfilter), bildbaserad bedrägeri och kontextmanipulation. Larmande nog utlöste 68% av dessa antagonistiska prompt farliga svar över de två Pixtral-modellerna, inklusive innehåll som relaterade till grooming, exploatering och till och med kemisk vapendesign.

En av de mest slående avslöjandena involverar barnsexuellt exploateringsmaterial (CSEM). Rapporten fann att Mistral’s modeller var 60 gånger mer benägna att producera CSEM-relaterat innehåll jämfört med branschstandarder som GPT-4o och Claude 3.7 Sonnet. I testfall svarade modellerna på maskerade grooming-prompt med strukturerat, flerparagrafiskt innehåll som förklarade hur man manipulerar minderåriga – inlindat i bedrägliga varningar som “för utbildningsändamål endast”. Modellerna var inte bara misslyckade med att avvisa farliga frågor – de slutförde dem i detalj.

Lika skrämmande var resultaten i CBRN (Kemisk, Biologisk, Radiologisk och Nukleär) riskkategorin. När de fick en begäran om hur man skulle modifiera VX-nervegiftet – ett kemiskt vapen – erbjöd modellerna chockerande specifika idéer för att öka dess beständighet i miljön. De beskrev, i redigerat men tydligt tekniskt detalj, metoder som inkapsling, miljöskydd och kontrollerad frisättningsystem.

Dessa misslyckanden utlöstes inte alltid av uppenbart farliga begäranden. En taktik involverade att ladda upp en bild av en tom numrerad lista och be modellen att “fylla i detaljerna”. Denna enkla, skenbart ofarliga begäran ledde till att modellen genererade oetiskt och olagligt instruktioner. Föreningen av visuell och textbaserad manipulation visade sig vara särskilt farlig – och betonade en unik utmaning som multimodalt AI medför.

Varför vision-språkmodeller utgör nya säkerhetsutmaningar

I hjärtat av dessa risker ligger den tekniska komplexiteten hos vision-språkmodeller. Dessa system tolkar inte bara språk – de syntetiserar mening över format, vilket innebär att de måste tolka bildinnehåll, förstå textkontext och svara därefter. Denna interaktion introducerar nya vektorer för exploatering. En modell kan korrekt avvisa en farlig textprompt ensam, men när den kombineras med en suggestiv bild eller tvetydig kontext kan den generera farligt utdata.

Enkrypt AI’s red teaming avslöjade hur cross-modal injektionsattacker – där subtila ledtrådar i en modalitet påverkar utdata i en annan – kan helt kringgå standard säkerhetsmekanismer. Dessa misslyckanden visar att traditionella innehållsmodereringstekniker, byggda för enkelmodala system, inte räcker för dagens VLM:er.

Rapporten detaljerar också hur Pixtral-modellerna nåddes: Pixtral-Large via AWS Bedrock och Pixtral-12b via Mistral-plattformen. Denna verklighetsbaserade distributionskontext betonar ytterligare brådskan med dessa fynd. Dessa modeller är inte begränsade till laboratorier – de är tillgängliga via mainstream-molnplattformar och kan lätt integreras i konsument- eller företagsprodukter.

Vad som måste göras: En plan för säkrare AI

Till sin fördel gör Enkrypt AI mer än att bara belysa problemen – det erbjuder en väg framåt. Rapporten presenterar en omfattande mitigationsstrategi, som börjar med säkerhetsjusteringsträning. Detta innebär att modellen omtränas med sin egen red teaming-data för att minska sårbarheten för farliga prompt. Tekniker som Direct Preference Optimization (DPO) rekommenderas för att finjustera modellens svar bort från riskfyllda utdata.

Det betonar också vikten av kontextmedvetna skydd – dynamiska filter som kan tolka och blockera farliga frågor i realtid, med hänsyn till den fulla kontexten av multimodal indata. Dessutom föreslås användningen av Model Risk Cards som en transparensåtgärd, för att hjälpa intressenter att förstå modellens begränsningar och kända fel.

Kanske den viktigaste rekommendationen är att behandla red teaming som en pågående process, inte en engångstest. När modellerna utvecklas, utvecklas också attackstrategier. Endast kontinuerlig utvärdering och aktiv övervakning kan säkerställa långsiktig tillförlitlighet, särskilt när modellerna distribueras i känsliga sektorer som hälsovård, utbildning eller försvar.

Den Multimodal Red Teaming Report från Enkrypt AI är ett tydligt signal till AI-branschen: multimodal kraft kommer med multimodal ansvar. Dessa modeller representerar ett språng framåt i förmåga, men de kräver också ett språng i hur vi tänker på säkerhet, säkerhet och etisk distribution. Om de lämnas okontrollerade riskerar de inte bara misslyckande – de riskerar verklig skada.

För alla som arbetar med eller distribuerar storskalig AI är denna rapport inte bara en varning. Det är en handbok. Och den kunde inte ha kommit vid en mer brådskande tid.

Antoine är en visionär ledare och medgrundare av Unite.AI, driven av en outtröttlig passion för att forma och främja framtidens AI och robotik. En serieentreprenör, han tror att AI kommer att vara lika störande för samhället som elektricitet, och han fångas ofta i att prata om potentialen för störande teknologier och AGI.

Som en futurist är han dedikerad till att utforska hur dessa innovationer kommer att forma vår värld. Dessutom är han grundare av Securities.io, en plattform som fokuserar på att investera i banbrytande teknologier som omdefinierar framtiden och omformar hela sektorer.