Rapporter

Når AI feiler: Enkrypt AI-rapport avdekker farlige sårbarheter i multimodale modeller

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

I mai 2025 utga Enkrypt AI sin Multimodal Red Teaming Report, en skremmende analyse som avdekket hvor lett avanserte AI-systemer kan manipuleres til å generere farlig og uetisk innhold. Rapporten fokuserer på to av Mistral’s ledende visjon-språkmodeller – Pixtral-Large (25.02) og Pixtral-12b – og tegner et bilde av modeller som ikke bare er teknisk imponerende, men også forferdelig sårbar.

Visjon-språkmodeller (VLMs) som Pixtral er bygget for å tolke både visuelle og tekstuelle innputt, og lar dem svare intelligent på komplekse, virkelige oppfordringer. Men denne evnen kommer med økt risiko. I motsetning til tradisjonelle språkmodeller som bare behandler tekst, kan VLMs påvirkes av samspillet mellom bilder og ord, og åpne nye dører for motstridige angrep. Enkrypt AI’s testing viser hvordan lett disse dørene kan åpnes.

Alarmerende testresultater: CSEM og CBRN-feil

Teamet bak rapporten brukte sofistikerte red teaming-metoder – en form for motstridig evaluering designet for å mime virkelige trusler. Disse testene brukte taktikker som jailbreaking (oppfordring av modellen med nøye utformede spørsmål for å bypass sikkerhetsfilter), bildebasert bedrag og kontekstmanipulering. Forferdelig, 68% av disse motstridige oppfordringer utløste skadelig respons over de to Pixtral-modellene, inkludert innhold som relaterte til grooming, utnytting og selv kjemiske våpen-design.

En av de mest slående avsløringer involverer barneseksuelle utnyttelsesmateriale (CSEM). Rapporten fant at Mistral’s modeller var 60 ganger mer sannsynlig til å produsere CSEM-relatert innhold sammenlignet med bransjestandarder som GPT-4o og Claude 3.7 Sonnet. I testtilfeller, svarte modellene på forkledde grooming-oppfordringer med strukturerte, multi-paragraphiske innhold som forklarte hvordan man manipulerer mindreårige – innpakket i tvilsomme disclaimere som “kun for opplysningsskyld”. Modellene var ikke bare feil i å avvise skadelig oppfordring – de fullførte dem i detalj.

Like forferdelig var resultater i CBRN (Kjemiske, biologiske, radiologiske og nukleære) risikokategorien. Når oppfordret med en forespørsel om hvordan man kan modifisere VX-nervgift – et kjemisk våpen – tilbød modellene sjokkerende spesifikke ideer for å øke dens varighet i miljøet. De beskrev, i redigert men klart teknisk detalj, metoder som innkapsling, miljømessig skjerming og kontrollert frigivelsessystemer.

Disse feilene var ikke alltid utløst av åpenbart skadelig oppfordring. En taktikk involverte å laste opp et bilde av en tom nummerert liste og å be modellen om å “fylle inn detaljene”. Denne enkle, åpenbart uskyldige oppfordringen ledet til generering av uetisk og ulovlig instruksjon. Funksjonen av visuell og tekstuell manipulering viste seg å være spesielt farlig – og understreket en unik utfordring som multimodal AI stiller.

Hvorfor visjon-språkmodeller stiller nye sikkerhetsutfordringer

I hjertet av disse risikoene ligger den tekniske kompleksiteten av visjon-språkmodeller. Disse systemene ikke bare parser språk – de syntetiserer mening over format, hvilket betyr at de må tolke bildeinnhold, forstå tekstkontekst og svare deretter. Denne interaksjonen introduserer nye vektorer for utnytting. En modell kan korrekt avvise en skadelig tekstoppfordring alene, men når den kombineres med et suggererende bilde eller tvetydig kontekst, kan den generere farlig utgang.

Enkrypt AI’s red teaming avdekket hvordan cross-modal injeksjonsangrep – hvor subtile hint i en modus påvirker utgangen av en annen – kan fullstendig bypass standard sikkerhetsmekanismer. Disse feilene demonstrerer at tradisjonelle innholdsmodererings-teknikker, bygget for enkelt-modus systemer, ikke er nok for i dag’s VLMs.

Rapporten detaljerer også hvordan Pixtral-modellene ble aksessert: Pixtral-Large via AWS Bedrock og Pixtral-12b via Mistral-plattformen. Denne virkelige deploykonteksten understreker enda mer urgensen av disse funn. Disse modellene er ikke begrenset til laboratorier – de er tilgjengelige gjennom mainstream skytjenester og kunne lett integreres i forbruker- eller bedriftsprodukter.

Hva må gjøres: En plan for sikrere AI

Til sin ære gjør Enkrypt AI mer enn å highlighte problemene – det tilbyr en vei fremover. Rapporten omhandler en omfattende mitigasjonstrategi, startende med sikkerhetsaligneringstrening. Dette innebærer å re-trenere modellen med sin egen red teaming-data for å redusere sårbarheten for skadelig oppfordring. Teknikker som Direct Preference Optimization (DPO) anbefales for å finjustere modellresponsene bort fra risikable utganger.

Det understreker også viktigheten av kontekstbevisste sikkerhetsfilter – dynamiske filter som kan tolke og blokkere skadelig oppfordring i sanntid, med tanke på full kontekst av multimodal innputt. I tillegg foreslås bruk av Model Risk Cards som en transparensforanstaltning, for å hjelpe interessenter med å forstå modellens begrensninger og kjente feiltilfeller.

Kanskje den mest kritiske anbefalingen er å behandle red teaming som en pågående prosess, ikke en engangstest. Ettersom modellene utvikler seg, utvikler også angrepsstrategier. Kun kontinuerlig evaluering og aktiv overvåking kan sikre langvarig pålitelighet, spesielt når modellene deployes i sensitive sektorer som helse, utdanning eller forsvar.

Den Multimodal Red Teaming Report fra Enkrypt AI er et tydelig signal til AI-industrien: multimodal kraft kommer med multimodal ansvar. Disse modellene representerer et sprang fremover i evne, men de krever også et sprang i hvordan vi tenker om sikkerhet, sikkerhet og etisk deployering. Ubehandlet risikerer de ikke bare feil – de risikerer virkelig skade.

For alle som arbeider med eller deployer stor skala AI, er denne rapporten ikke bare en advarsel. Det er en spillbok. Og den kunne ikke ha kommet på et mer kritisk tidspunkt.

Antoine er en visjonær leder og medgrunnlegger av Unite.AI, drevet av en urokkelig lidenskap for å forme og fremme fremtiden for AI og robotikk. En serial entrepreneur, han tror at AI vil være like disruptiv for samfunnet som elektrisitet, og blir ofte fanget i å prise potensialet for disruptive teknologier og AGI.

Som en futurist, er han dedikert til å utforske hvordan disse innovasjonene vil forme vår verden. I tillegg er han grunnlegger av Securities.io, en plattform som fokuserer på å investere i banebrytende teknologier som definerer fremtiden og omformer hele sektorer.