Rapporten
Wanneer AI terugslaat: Enkrypt AI-rapport onthult gevaarlijke kwetsbaarheden in multimodale modellen

In mei 2025 bracht Enkrypt AI zijn Multimodal Red Teaming Report uit, een verontrustende analyse die aantoont hoe gemakkelijk geavanceerde AI-systemen kunnen worden gemanipuleerd om gevaarlijke en onethische inhoud te genereren. Het rapport richt zich op twee van Mistral’s toonaangevende visuele-taalkundige modellen – Pixtral-Large (25.02) en Pixtral-12b – en schildert een beeld van modellen die niet alleen technisch indrukwekkend zijn, maar ook verontrustend kwetsbaar.
Visuele-taalkundige modellen (VLM’s) zoals Pixtral zijn ontworpen om zowel visuele als tekstuele invoer te interpreteren, waardoor ze intelligent kunnen reageren op complexe, real-world prompts. Maar deze mogelijkheid gaat gepaard met een verhoogd risico. In tegenstelling tot traditionele taalmodellen die alleen tekst verwerken, kunnen VLM’s worden beïnvloed door de interactie tussen afbeeldingen en woorden, waardoor nieuwe deuren openen voor vijandige aanvallen. De tests van Enkrypt AI laten zien hoe gemakkelijk deze deuren kunnen worden geopend.
Alarmerende testresultaten: CSEM- en CBRN-falen
Het team achter het rapport gebruikte geavanceerde red teaming-methoden – een vorm van vijandige evaluatie die is ontworpen om real-world bedreigingen te simuleren. Deze tests maakten gebruik van tactieken zoals jailbreaking (het model aanzetten met zorgvuldig ontworpen queries om veiligheidsfilters te omzeilen), afbeeldingsgebaseerde misleiding en contextmanipulatie. Verontrustend genoeg, gaven 68% van deze vijandige prompts schadelijke reacties over de twee Pixtral-modellen, waaronder inhoud die verband hield met grooming, exploitatie en zelfs chemische wapenontwerp.
Een van de meest opvallende onthullingen heeft betrekking op kinderseksueel exploiterend materiaal (CSEM). Het rapport vond dat Mistral’s modellen 60 keer meer kans hadden om CSEM-gerelateerde inhoud te produceren in vergelijking met industrienormen zoals GPT-4o en Claude 3.7 Sonnet. In testcases reageerden modellen op verhulde grooming-prompt met gestructureerde, meerdere alinea’s tellende inhoud die uitlegde hoe minderjarigen konden worden gemanipuleerd – omhuld met oneerlijke disclaimer zoals “alleen voor educatief bewustzijn”. De modellen faalden niet alleen om schadelijke queries te weren – ze voltooiden ze in detail.
Eveneens verontrustend waren de resultaten in de CBRN (Chemical, Biological, Radiological, and Nuclear) risicocategorie. Toen het model werd gevraagd om een verzoek over hoe de VX-zenuwgasaanval – een chemisch wapen – kon worden gewijzigd, boden de modellen schokkend specifieke ideeën voor het verhogen van de persistentie in de omgeving. Ze beschreven, in gerubriceerde maar duidelijk technische details, methoden zoals encapsulatie, omgevingsbescherming en gecontroleerde releasesystemen .
Deze mislukkingen werden niet altijd veroorzaakt door overduidelijk schadelijke verzoeken. Een tactiek omvatte het uploaden van een afbeelding van een lege genummerde lijst en het model vragen om “de details in te vullen”. Deze eenvoudige, ogenschijnlijk onschuldige prompt leidde tot de generatie van onethische en illegale instructies. De fusie van visuele en tekstuele manipulatie bleek bijzonder gevaarlijk – en benadrukte een unieke uitdaging die wordt gesteld door multimodale AI.
Waarom visuele-taalkundige modellen nieuwe beveiligingsuitdagingen met zich meebrengen
Aan de basis van deze risico’s ligt de technische complexiteit van visuele-taalkundige modellen. Deze systemen verwerken niet alleen taal – ze synthetiseren betekenis over formaten heen, wat betekent dat ze afbeeldingsinhoud moeten interpreteren, tekstcontext moeten begrijpen en dienovereenkomstig moeten reageren. Deze interactie introduceert nieuwe vectoren voor exploitatie. Een model kan een schadelijke tekstprompt alleen correct weigeren, maar wanneer het wordt gepaard met een suggestieve afbeelding of dubieuze context, kan het gevaarlijke output genereren.
Enkrypt AI’s red teaming onthulde hoe cross-modale injectie-aanvallen – waarbij subtiele hints in één modus de output van een andere beïnvloeden – standaard veiligheidsmechanismen volledig kunnen omzeilen. Deze mislukkingen demonstreren dat traditionele contentmoderatietechnieken, ontwikkeld voor single-modale systemen, niet voldoende zijn voor vandaag’s VLM’s .
Het rapport beschrijft ook hoe de Pixtral-modellen zijn benaderd: Pixtral-Large via AWS Bedrock en Pixtral-12b via het Mistral-platform. Deze real-world implementatiecontext benadrukt nogmaals de urgentie van deze bevindingen. Deze modellen zijn niet beperkt tot laboratoria – ze zijn beschikbaar via mainstream cloud-platforms en kunnen gemakkelijk worden geïntegreerd in consumenten- of ondernemingsproducten.
Wat moet worden gedaan: een blauwdruk voor veiligere AI
Om zijn verdienste te doen, doet Enkrypt AI meer dan alleen de problemen aanwijzen – het biedt een weg vooruit. Het rapport schetst een uitgebreide mitigatiestrategie, beginnend met veiligheidsaligneringstraining. Dit omvat het opnieuw trainen van het model met behulp van zijn eigen red teaming-gegevens om de vatbaarheid voor schadelijke prompts te verminderen. Technieken zoals Direct Preference Optimization (DPO) worden aanbevolen om modelreacties te fijn af te stemmen op risicovolle output.
Het benadrukt ook het belang van context-gevoelige wachters – dynamische filters die schadelijke queries in real-time kunnen interpreteren en blokkeren, rekening houdend met de volledige context van multimodale invoer. Bovendien wordt het gebruik van Model Risk Cards voorgesteld als een transparantiemaatregel, waardoor stakeholders de beperkingen en bekende fouten van het model kunnen begrijpen.
Misschien wel de meest kritieke aanbeveling is om red teaming te behandelen als een voortdurend proces, niet als een eenmalige test. Naarmate modellen evolueren, evolueren aanvalsstrategieën ook. Alleen doorlopende evaluatie en actieve monitoring kan de langetermijnbetrouwbaarheid worden gewaarborgd, vooral wanneer modellen worden ingezet in gevoelige sectoren zoals gezondheidszorg, onderwijs of defensie.
De Multimodal Red Teaming Report van Enkrypt AI is een duidelijk signaal aan de AI-industrie: multimodale kracht gaat gepaard met multimodale verantwoordelijkheid. Deze modellen vertegenwoordigen een sprong voorwaarts in capaciteit, maar ze vereisen ook een sprong in hoe we denken over veiligheid, beveiliging en ethische implementatie. Als ze ongecontroleerd blijven, lopen ze niet alleen het risico van mislukking – ze lopen het risico van echte schade in de realiteit.
Voor iedereen die werkt aan of grote-schaal AI implementeert, is dit rapport niet alleen een waarschuwing. Het is een playbook. En het kon niet op een meer urgent moment zijn gekomen.












