Cyberbeveiliging

DeepKeep ontdekt ‘InkJect’, een nieuwe AI-aanval die kwaadaardige prompts verbergt in afbeeldingen

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Terwijl ondernemingen snel multimodale AI omarmen die zowel tekst als afbeeldingen kan begrijpen, ontdekken beveiligingsonderzoekers dat deze krachtige nieuwe mogelijkheden even geavanceerde nieuwe aanvalsvlakken introduceren. Het Israëlische AI-beveiligingsbedrijf DeepKeep heeft een eerder ongedocumenteerde visuele prompt-injectietechniek genaamd InkJect onthuld, waaruit blijkt dat verborgen instructies die in ogenschijnlijk onschuldige afbeeldingen zijn ingebed, de toonaangevende visuele taalmodellen (VLM’s) kunnen manipuleren en veel van de beveiligingsbarrières die zijn ontworpen om traditionele prompt-injectieaanvallen te stoppen, kunnen omzeilen.

Volgens het onderzoek van DeepKeep wordt de kwetsbaarheid aangetroffen in verschillende van de meest geavanceerde multimodale modellen van vandaag, waaronder OpenAI’s GPT-5.2 en GPT-5.4 Mini, evenals Anthropic’s Claude Sonnet 4.6 en Claude Opus 4.5. De bevindingen leggen een aanzienlijke blind spot in de AI-beveiliging bloot: terwijl de industrie zwaar heeft geïnvesteerd in het beschermen van tekstgebaseerde interacties, is er veel minder aandacht besteed aan de visuele redeneringslaag die steeds meer moderne AI-systemen aandrijft.

Een nieuwe evolutie van prompt-injectie

Traditionele prompt-injectieaanvallen proberen een AI-model te manipuleren via zorgvuldig geconstrueerde tekst die de oorspronkelijke instructies overschrijft. In de afgelopen twee jaar hebben toonaangevende AI-aanbieders zwaar geïnvesteerd in beveiligingsmaatregelen die deze aanvallen detecteren voordat de modellen erop kunnen reageren.

InkJect volgt een geheel andere route. In plaats van rechtstreeks via tekst te communiceren, verbergen aanvallers kwaadaardige instructies in afbeeldingen die deel uitmaken van de normale workflow van de AI. Deze afbeeldingen kunnen worden opgeslagen in openbare GitHub-repositories, documentatiepagina’s, ontwerpassets, diagrammen of andere visuele bronnen die AI-codingassistenten en autonome agenten routinematig ophalen bij het uitvoeren van legitieme taken. Vanuit het perspectief van de gebruiker lijkt er niets ongewoons. De AI verwerkt de afbeelding gewoon als een ander stuk contextuele informatie, zich niet bewust van het feit dat deze ook verborgen instructies bevat.

Uitbuiten van de AI’s vermogen om te zien

Wat InkJect bijzonder effectief maakt, is dat het een van de nieuwste mogelijkheden in moderne AI-systemen aanvalt: visueel begrip.

Visuele taalmodellen voeren geavanceerde optische tekenherkenning uit als onderdeel van het interpreteren van afbeeldingen, waardoor ze tekst kunnen lezen die is ingebed in diagrammen, schermafbeeldingen, foto’s en interface-ontwerpen. DeepKeep ontdekte dat deze mogelijkheden vaak die van traditionele OCR-gebaseerde beveiligingshulpmiddelen overtreffen die worden gebruikt om geüploade afbeeldingen te inspecteren.

De onderzoekers demonstreerden dat kwaadaardige instructies konden worden verborgen met behulp van technieken zoals witte tekst op witte achtergronden, extreem lage contrastlettering, perspectiefvervorming en verwrongen typografie. Terwijl bestaande beveiligings scanners deze verborgen instructies vaak niet herkenden, konden de AI-modellen ze zonder moeite interpreteren. Dit creëert een gevaarlijk mismatch waarbij de beveiligingssoftware concludeert dat een afbeelding onschuldig is, terwijl de AI stilzwijgend instructies uitvoert die onzichtbaar zijn voor zowel de scanner als de menselijke gebruiker.

Indirecte prompt-injectie maakt de dreiging nog gevaarlijker

In tegenstelling tot veel cyberaanvallen die rechtstreekse toegang tot een doelsysteem vereisen, vertrouwt InkJect op wat onderzoekers indirecte prompt-injectie noemen. In plaats van een kwaadaardige afbeelding rechtstreeks in een AI-toepassing te uploaden, plaatst een aanvaller de afbeelding gewoon in een openbaar toegankelijke repository of online bron.

Later, wanneer een ontwikkelaar een AI-assistent vraagt om een functie te bouwen met behulp van die repository of de inhoud ervan te analyseren, haalt het model de afbeelding automatisch op als onderdeel van de normale workflow. Verborgen instructies worden verwerkt samen met legitieme projectassets zonder dat de ontwikkelaar ooit beseft dat extra instructies deel zijn gaan uitmaken van het gesprek.

Deze aanvalsmethode is bijzonder verontrustend omdat moderne AI-agenten steeds meer externe bronnen autonomously ophalen. Elke openbare repository, documentatiepagina of gedeelde asset kan een andere route worden waarlangs kwaadaardige instructies een AI-systeem kunnen bereiken.

Een eenvoudige codingsaanvraag met ernstige gevolgen

DeepKeep illustreerde de impact met behulp van een software-ontwikkelingscenario dat volledig routineus lijkt.

Een ontwikkelaar gaf een AI-codingassistent de opdracht om een basisinformatiepagina te genereren. Onbekend aan de ontwikkelaar bevatte een van de verwijzingen naar afbeeldingen verborgen instructies. In plaats van alleen de aangevraagde pagina te produceren, voegde de AI stilzwijgend een volledig functionele ledenlogin-systeem toe, compleet met beheerdersreferenties en backend-authenticatielogica.

De pagina functioneerde precies zoals verwacht, waardoor de ontwikkelaar geen reden had om te vermoeden dat extra code was toegevoegd. Zonder een gedetailleerde beveiligingsaudit had de ongeautoriseerde backdoor gemakkelijk in productie kunnen worden geïmplementeerd, waardoor aanvallers administratieve toegang zouden hebben gekregen die niemand bewust had aangevraagd.

De demonstratie benadrukt hoe visuele prompt-injectie verschilt van eerdere AI-aanvallen. In plaats van alleen de reacties van chatbots te beïnvloeden, kunnen verborgen visuele instructies gegenereerde code manipuleren, beveiligingslekken introduceren, autonome workflows wijzigen en mogelijk bedrijfssystemen in gevaar brengen.

Waarom bestaande AI-beveiligingsbarrières de aanval missen

Het onderzoek onderstreept een architectonische zwakte in het huidige AI-beveiligingslandschap. De meeste commerciële beveiligingsbarrières zijn ontworpen om tekstuele prompts te inspecteren voordat ze het model bereiken. Als gevolg daarvan zijn organisaties steeds effectiever geworden in het detecteren van kwaadaardige geschreven instructies.

Visuele invoer, daarentegen, volgen vaak een geheel andere verwerkingpijplijn.

DeepKeep ontdekte dat verschillende frontiermodellen identieke aanvallen afwezen wanneer ze als tekst werden gepresenteerd, maar ze accepteerden wanneer dezelfde instructies in een afbeelding waren ingebed. In feite kunnen aanvallers beveiligingsmaatregelen omzeilen door simpelweg het medium te veranderen waarlangs instructies worden geleverd.

Nu multimodale AI de standaardinterface wordt voor ondernemingsapplicaties, wordt dit onderscheid steeds belangrijker. Beveiligingssystemen kunnen niet langer aannemen dat gevaarlijke instructies alleen via tekst arriveren.

Waarom ondernemingen hierop moeten letten

De timing van het onderzoek van DeepKeep weerspiegelt een veel grotere verschuiving die gaande is in de ondernemings-AI. Brancheprognoses suggereren dat multimodale systemen die afbeeldingen, documenten, video’s en tekst kunnen begrijpen, de standaard zullen worden in software-ontwikkeling, financiële diensten, gezondheidszorg, fabricage, klantenservice en bedrijfsautomatisering.

In tegenstelling tot consumentenchatbots opereren veel ondernemings-AI-systemen met verhoogde privileges. Ze halen vertrouwelijke documentatie op, schrijven software, voeren code uit, roepen API’s aan, interacteren met cloud-infrastructuur, analyseren vertrouwelijke documenten en nemen steeds vaker beslissingen namens gebruikers. Verborgen instructies die in visuele inhoud zijn ingebed, vertegenwoordigen dus veel meer dan een academische curiositeit – ze introduceren een nieuwe categorie van ondernemingscyberbeveiligingsrisico’s die invloed kunnen hebben op echte systemen.

DeepKeep’s aanpak van AI-beveiliging

Sinds de oprichting in 2021 heeft DeepKeep zich uitsluitend gericht op het beveiligen van AI gedurende de hele levenscyclus, van modelbeoordeling en -testen tot implementatie en runtimebeveiliging. In plaats van zich alleen te concentreren op grote taalmodellen, is het beveiligingsplatform van het bedrijf ontworpen om multimodale AI-systemen, autonome AI-agenten, computer vision-toepassingen en ondernemings-AI-implementaties te beveiligen.

Hun beveiligingsplatform combineert meerdere lagen van bescherming, waaronder een AI-brandwall die inferentie in real-time monitort, geautomatiseerde AI Red Teaming die proactief zoekt naar kwetsbaarheden voordat ze worden geïmplementeerd, een AI Agent Scanner die autonome workflows analyseert op exploitatiepaden, modelscanningmogelijkheden die AI-levenscyclusbeveiligingsrisico’s evalueren, en AI Lens, die organisaties inzicht geeft in hoe medewerkers en applicaties AI gebruiken in de onderneming.

Terwijl organisaties AI blijven integreren in kritieke workflows, weerspiegelt de strategie van DeepKeep een groeiend besef dat het beveiligen van AI het beschermen van elke fase van hoe modellen informatie ontvangen, verwerken en acteren vereist – en niet alleen het filteren van prompts die gebruikers typen.

De volgende frontier in AI-beveiliging

InkJect zal waarschijnlijk worden herinnerd als meer dan alleen een prompt-injectietechniek. Het benadrukt hoe de snelle evolutie van multimodale AI het beveiligingslandschap fundamenteel aan het herschappen is.

Naarmate modellen steeds beter in staat zijn om te zien, te redeneren, informatie op te halen en autonoom te handelen, zullen aanvallers natuurlijk nieuwe manieren zoeken om elke modus die deze systemen begrijpen te exploiteren. Afbeeldingen, diagrammen, PDF’s, websites en andere visuele bronnen kunnen allemaal voertuigen worden voor verborgen instructies die bestaande beveiligingshulpmiddelen mogelijk nooit detecteren.

DeepKeep heeft zijn bevindingen verantwoordelijk aan OpenAI en Anthropic gemeld, waardoor deze bedrijven de kans kregen om bescherming tegen deze nieuw geïdentificeerde aanvalsvector te versterken. Of InkJect het eerste voorbeeld wordt van een veel bredere klasse van multimodale prompt-injectieaanvallen, moet nog worden gezien, maar de ontdekking dient als een tijdige herinnering dat AI-beveiliging even snel moet evolueren als AI zelf. Naarmate modellen de visuele wereld met steeds grotere verfijning leren begrijpen, zal het verdedigen ervan beveiligingssystemen vereisen die eveneens in staat zijn dat te doen.

Antoine is een visionaire leider en medeoprichter van Unite.AI, gedreven door een onwankelbare passie voor het vormgeven en promoten van de toekomst van AI en robotica. Een serieondernemer, hij gelooft dat AI net zo disruptief voor de samenleving zal zijn als elektriciteit, en wordt vaak betrapt op het prijzen van de potentie van disruptieve technologieën en AGI.

Als een futurist, hij is toegewijd aan het onderzoeken van hoe deze innovaties onze wereld zullen vormgeven. Bovendien is hij de oprichter van Securities.io, een platform dat zich richt op het investeren in cutting-edge technologieën die de toekomst herdefiniëren en hele sectoren herschikken.