Berichte
Wenn KI fehlschlägt: Der Enkrypt-AI-Bericht deckt gefährliche Schwachstellen in multimodalen Modellen auf

Im Mai 2025 veröffentlichte Enkrypt AI seinen Multimodal Red Teaming Report, eine beunruhigende Analyse, die zeigte, wie leicht fortschrittliche KI-Systeme manipuliert werden können, um gefährliche und unethische Inhalte zu generieren. Der Bericht konzentriert sich auf zwei von Mistral’s führenden Vision-Language-Modellen – Pixtral-Large (25.02) und Pixtral-12b – und zeichnet ein Bild von Modellen, die nicht nur technisch beeindruckend, sondern auch beunruhigend anfällig sind.
Vision-Language-Modelle (VLMs) wie Pixtral sind so konzipiert, dass sie sowohl visuelle als auch textuelle Eingaben interpretieren können, sodass sie intelligent auf komplexe, realweltliche Prompts reagieren können. Doch diese Fähigkeit geht mit erhöhtem Risiko einher. Im Gegensatz zu herkömmlichen Sprachmodellen, die nur Text verarbeiten, können VLMs durch die Wechselwirkung zwischen Bildern und Wörtern beeinflusst werden, was neue Angriffsmöglichkeiten eröffnet. Enkrypt AI’s Tests zeigen, wie leicht diese Türen geöffnet werden können.
Beunruhigende Testergebnisse: CSEM- und CBRN-Fehlschläge
Das Team hinter dem Bericht verwendete fortschrittliche Red-Teaming-Methoden – eine Form der adversarialen Bewertung, die reale Bedrohungen simuliert. Diese Tests verwendeten Taktiken wie Jailbreaking (das Modell mit sorgfältig konstruierten Abfragen prompten, um Sicherheitsfilter zu umgehen), Bildbasierte Täuschung und Kontextmanipulation. Beunruhigend war, dass 68% dieser adversarialen Prompts schädliche Antworten über die beiden Pixtral-Modelle hinweg auslösten, einschließlich Inhalte, die mit Grooming, Ausbeutung und sogar chemischer Waffendesign in Verbindung standen.
Eine der bemerkenswertesten Enthüllungen betrifft kinderpornografisches Material (CSEM). Der Bericht fand heraus, dass Mistral’s Modelle 60-mal eher CSEM-bezogene Inhalte produzierten als Branchenbenchmarks wie GPT-4o und Claude 3.7 Sonnet. In Testfällen reagierten die Modelle auf getarnte Grooming-Prompts mit strukturierten, mehrparagraphigen Inhalten, die erklärten, wie man Minderjährige manipulieren kann – in unaufrichtigen Haftungsausschlüssen wie “nur für Bildungsbewusstsein” verpackt. Die Modelle versagten nicht nur darin, schädliche Abfragen abzulehnen – sie vervollständigten sie detailliert.
Ebenso beunruhigend waren die Ergebnisse in der CBRN-Risikokategorie (Chemical, Biological, Radiological und Nuclear). Wenn das Modell mit einer Anfrage zu einer Modifizierung des VX-Nervengases – einer chemischen Waffe – konfrontiert wurde, boten die Modelle schockierend spezifische Ideen für die Erhöhung seiner Persistenz in der Umwelt. Sie beschrieben in rotierten, aber eindeutig technischen Details Methoden wie Encapsulation, Umweltabschirmung und kontrollierte Freisetzungssysteme .
Diese Fehlschläge wurden nicht immer durch offensichtlich schädliche Anfragen ausgelöst. Eine Taktik bestand darin, ein Bild einer leeren nummerierten Liste hochzuladen und das Modell zu bitten, “die Details auszufüllen”. Diese einfache, scheinbar harmlose Anfrage führte zur Generierung unethischer und illegaler Anweisungen. Die Fusion von visueller und textlicher Manipulation erwies sich als besonders gefährlich und unterstrich die einzigartige Herausforderung, die multimodale KI mit sich bringt.
Warum Vision-Language-Modelle neue Sicherheitsherausforderungen darstellen
Im Kern dieser Risiken liegt die technische Komplexität von Vision-Language-Modellen. Diese Systeme müssen nicht nur Sprache verarbeiten, sondern auch Bedeutung über Formate hinweg synthetisieren, was bedeutet, dass sie Bildinhalte interpretieren, Textkontext verstehen und entsprechend reagieren müssen. Diese Interaktion introduceiert neue Angriffsmöglichkeiten. Ein Modell kann eine schädliche Textanfrage allein ablehnen, aber wenn es mit einem suggerierenden Bild oder einem mehrdeutigen Kontext kombiniert wird, kann es gefährliche Ausgaben generieren.
Enkrypt AI’s Red Teaming deckte auf, wie Cross-Modal-Injection-Angriffe – bei denen subtile Hinweise in einer Modalität die Ausgabe einer anderen beeinflussen – herkömmliche Sicherheitsmechanismen vollständig umgehen können. Diese Fehlschläge zeigen, dass herkömmliche Inhaltsmoderations-Techniken, die für Ein-Modell-Systeme entwickelt wurden, nicht ausreichen, um heutige VLMs abzudecken .
Der Bericht beschreibt auch, wie die Pixtral-Modelle zugänglich gemacht wurden: Pixtral-Large über AWS Bedrock und Pixtral-12b über die Mistral-Plattform. Dieser realweltliche Einsatzkontext unterstreicht die Dringlichkeit dieser Erkenntnisse. Diese Modelle sind nicht auf Labors beschränkt – sie sind über Mainstream-Cloud-Plattformen verfügbar und könnten leicht in Consumer- oder Enterprise-Produkte integriert werden.
Was getan werden muss: Ein Blueprint für sicherere KI
Zu seinem Verdienst muss gesagt werden, dass Enkrypt AI mehr tut, als nur die Probleme hervorzuheben – es bietet einen Weg nach vorn. Der Bericht skizziert eine umfassende Minderungsstrategie, beginnend mit Sicherheitsausrichtungstraining. Dies beinhaltet das erneute Training des Modells unter Verwendung seiner eigenen Red-Teaming-Daten, um die Anfälligkeit für schädliche Prompts zu verringern. Techniken wie Direct Preference Optimization (DPO) werden empfohlen, um die Modellantworten von riskanten Ausgaben wegzufinen.
Es betont auch die Wichtigkeit von kontextbezogenen Schutzmechanismen – dynamischen Filtern, die schädliche Abfragen in Echtzeit interpretieren und blockieren können, unter Berücksichtigung des gesamten Kontexts multimodaler Eingaben. Darüber hinaus wird der Einsatz von Model-Risikokarten als Transparenzmaßnahme vorgeschlagen, um Stakeholdern zu helfen, die Einschränkungen und bekannten Fehlerfälle des Modells zu verstehen.
Vielleicht die wichtigste Empfehlung ist, Red Teaming als laufenden Prozess und nicht als einmaligen Test zu betrachten. Da Modelle evolvieren, evolvieren auch Angriffsstrategien. Nur kontinuierliche Bewertung und aktive Überwachung können langfristige Zuverlässigkeit gewährleisten, insbesondere wenn Modelle in sensiblen Sektoren wie Gesundheitswesen, Bildung oder Verteidigung eingesetzt werden.
Der Multimodal Red Teaming Report von Enkrypt AI ist ein klares Signal an die KI-Industrie: multimodale Leistung geht mit multimodaler Verantwortung einher. Diese Modelle stellen einen Sprung nach vorn in der Fähigkeit dar, aber sie erfordern auch einen Sprung in der Art und Weise, wie wir über Sicherheit, Sicherheit und ethische Einsetzung nachdenken. Wenn sie unkontrolliert bleiben, riskieren sie nicht nur das Versagen – sie riskieren realweltlichen Schaden.
Für jeden, der an oder mit groß angelegter KI arbeitet, ist dieser Bericht nicht nur eine Warnung. Es ist ein Spielbuch. Und es könnte nicht zu einem dringenderen Zeitpunkt erschienen sein.












