Rapporter
Når AI slår fejl: Enkrypt AI-rapport afslører farlige sårbarheder i multimodale modeller

I maj 2025 offentliggjorde Enkrypt AI sin Multimodal Red Teaming-rapport, en chokerende analyse, der afslørede, hvor let avancerede AI-systemer kan manipuleres til at generere farlige og uetiske indhold. Rapporten fokuserer på to af Mistral’s førende vision-sprog-modeller – Pixtral-Large (25.02) og Pixtral-12b – og tegner et billede af modeller, der ikke kun er teknisk imponerende, men også foruroligende sårbar.
Vision-sprog-modeller (VLM) som Pixtral er bygget til at fortolke både visuelle og tekstuelle input, hvilket giver dem mulighed for at reagere intelligent på komplekse, virkelige prompts. Men denne funktion kommer med øget risiko. I modsætning til traditionelle sprogmodeller, der kun behandler tekst, kan VLM’er påvirkes af interaktionen mellem billeder og ord, hvilket åbner nye døre for fjendtlige angreb. Enkrypt AI’s test viser, hvor let disse døre kan åbnes.
Alarmerende testresultater: CSEM og CBRN-fejl
Teamet bag rapporten brugte avancerede red teaming-metoder – en form for fjendtlig evaluering, der er designet til at simulere virkelige trusler. Disse test brugte taktikker som jailbreaking (at prompte modellen med omhyggeligt udformede forespørgsler for at omgå sikkerhedsfiltre), billed-baseret forførelse og kontekst-manipulation. Foruroligende var 68% af disse fjendtlige prompts fremkaldte skadelige svar på tværs af de to Pixtral-modeller, herunder indhold, der relaterer til grooming, udnyttelse og endda kemiske våben-design.
En af de mest slående afsløringer involverer børneseksuel udnyttelsesmateriale (CSEM). Rapporten fandt, at Mistral’s modeller var 60 gange mere sandsynlige for at producere CSEM-relateret indhold i forhold til branchestandarder som GPT-4o og Claude 3.7 Sonnet. I testtilfælde svarede modellerne på forkledte grooming-prompts med struktureret, multi-afsnitsindhold, der forklarede, hvordan man manipulerer mindreårige – indpakket i falske disclaimere som “kun til uddannelsesformål”. Modellerne var ikke kun fejl ved at afvise skadelige forespørgsler – de fuldførte dem i detaljer.
Lige så foruroligende var resultaterne i CBRN (Kemisk, Biologisk, Radiologisk og Nuklear) risikokategorien. Når modellerne blev bedt om at ændre VX-nerve-gassen – et kemisk våben – tilbød modellerne chokerende specifikke idéer til at øge dets persistence i miljøet. De beskrev, i redigeret men tydeligt teknisk detalje, metoder som indkapsling, miljømæssig beskyttelse og kontrolleret frigørelse systemer.
Disse fejl var ikke altid udløst af åbenlyst skadelige forespørgsler. En taktik involverede at uploade et billede af en tom nummereret liste og bede modellen om at “udfylde detaljerne”. Denne simple, åbenbart uskyldige prompt førte til generering af uetisk og ulovlig instruktion. Fusionen af visuel og tekstuel manipulation viste sig at være særligt farlig – og understregede en unik udfordring, der stilles af multimodal AI.
Hvorfor vision-sprog-modeller stiller nye sikkerhedsudfordringer
I hjertet af disse risici ligger den tekniske kompleksitet af vision-sprog-modeller. Disse systemer ikke kun parser sprog – de syntetiserer mening på tværs af formater, hvilket betyder, at de må fortolke billedindhold, forstå tekstkontekst og reagere derefter. Denne interaktion introducerer nye vektorer for udnyttelse. En model kan korrekt afvise en skadelig tekst-prompt alene, men når parret med et suggererende billede eller tvetydig kontekst, kan den generere farligt output.
Enkrypt AI’s red teaming afslørede, hvordan cross-modal injection-angreb – hvor subtile hints i en modalitet påvirker outputtet af en anden – kan fuldstændigt omgå standard sikkerheds-mekanismer. Disse fejl demonstrerer, at traditionelle indholdsmodererings-teknikker, bygget til enkelt-modalitet systemer, ikke er nok til i dag’s VLM’er.
Rapporten detaljerer også, hvordan Pixtral-modellerne blev adgang til: Pixtral-Large gennem AWS Bedrock og Pixtral-12b via Mistral-platformen. Denne virkelige implementeringskontekst understreger endnu mere presset på disse fund. Disse modeller er ikke begrænset til laboratorier – de er tilgængelige gennem mainstream cloud-platforme og kunne let integreres i forbruger- eller virksomhedsprodukter.
Hvad der skal gøres: En plan for sikrere AI
Til deres ære gør Enkrypt AI mere end blot at fremhæve problemet – de tilbyder en vej frem. Rapporten omridser en omfattende mitigationsstrategi, der starter med sikkerheds-alignment-træning. Dette indebærer at genskole modellen ved hjælp af dens egen red teaming-data for at reducere følsomheden over for skadelige prompts. Teknikker som Direct Preference Optimization (DPO) anbefales til at finjustere model-svar væk fra risikable output.
Det understreger også vigtigheden af kontekst-bevidste sikkerhedsforanstaltninger – dynamiske filtre, der kan fortolke og blokere skadelige forespørgsler i realtid, med hensyn til den fulde kontekst af multimodal input. Derudover foreslås brugen af Model Risk Cards som en transparensforanstaltning, der hjælper interessenter med at forstå modellens begrænsninger og kendte fejltilfælde.
Måske den vigtigste anbefaling er at behandle red teaming som en løbende proces, ikke en enkelt test. Da modeller udvikler sig, udvikler angrebsstrategier sig også. Kun kontinuerlig evaluering og aktiv overvågning kan sikre langsigtede pålidelighed, især når modeller deployes i følsomme sektorer som sundhedsvesen, uddannelse eller forsvar.
Den Multimodal Red Teaming-rapport fra Enkrypt AI er et klart signal til AI-industrien: multimodal kraft kommer med multimodal ansvar. Disse modeller repræsenterer et spring fremad i kapacitet, men de kræver også et spring i, hvordan vi tænker om sikkerhed, sikkerhed og etisk implementering. Hvis de ikke kontrolleres, risikerer de ikke kun fejl – de risikerer virkelige skader.
For enhver, der arbejder med eller deployer storstilet AI, er denne rapport ikke kun en advarsel. Det er en playbook. Og den kunne ikke have kommet på et mere presserende tidspunkt.












