Cybersikkerhet

DeepKeep avdekker ‘InkJect’, en ny AI-angrep som skjuler skadelige instruksjoner inne i bilder

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Som bedrifter raskt omfavner multimodale AI-kapasiteter som kan forstå både tekst og bilder, oppdager sikkerhetsforskere at disse nye kapabilitetene introduserer like sofistikerte nye angrepsflater. Det israelske AI-sikkerhetsselskapet DeepKeep har avdekket en tidligere udokumentert visuell prompt-injeksjonsteknikk kalt InkJect, som viser at skjulte instruksjoner innenfor åpenbart harmløse bilder kan manipulere ledende visjon-språkmodeller (VLMs) og omgå mange av sikkerhetsforanstaltningene som er designet for å stoppe tradisjonelle prompt-injeksjonsangrep.

Ifølge DeepKeeps forskning, berører sårbarheten flere av dagens mest avanserte multimodale modeller, inkludert OpenAIs GPT-5.2 og GPT-5.4 Mini, samt Anthropics Claude Sonnet 4.6 og Claude Opus 4.5. Funndene avdekker en betydelig blindsoner i AI-sikkerheten: mens bransjen har investert tungt i å beskytte tekstbaserte interaksjoner, har langt mindre oppmerksomhet blitt gitt til den visuelle resonneringslaget som stadig mer driver moderne AI-systemer.

En ny utvikling av prompt-injeksjon

Tradisjonelle prompt-injeksjonsangrep prøver å manipulere en AI-modell gjennom nøye konstruert tekst som overstyrer dens opprinnelige instruksjoner. De siste to årene har ledende AI-tilbydere investert tungt i sikkerhetsforanstaltninger som oppdager disse angrepene før modellene kan handle på dem.

InkJect tar en helt annen rute. I stedet for å kommunisere direkte gjennom tekst, skjuler angripere skadelige instruksjoner innenfor bilder som blir en del av AI-systemets normale arbeidsflyt. Disse bildene kan være lagret innenfor offentlige GitHub-repositorier, dokumentasjonssider, design-ressurser, diagrammer eller andre visuelle ressurser som AI-kodingassistenter og autonome agenter vanligvis henter mens de fullfører legitime oppgaver. Fra brukerens perspektiv, ser ingenting uvanlig ut. AI-systemet prosesserer bare bildet som en annen del av kontekstuell informasjon, uvitende om at det også inneholder skjulte kommandoer.

Utnytting av AI-systemets evne til å se

Hva gjør InkJect særlig effektivt, er at det tar sikte på en av de nyeste kapabilitetene i moderne AI-systemer: visuell forståelse.

Visjon-språkmodeller utfører sofistikert optisk tegngjenkjenning som en del av å tolke bilder, og lar dem lese tekst innenfor diagrammer, skjermbilder, fotografier og grensesnittsdesign. DeepKeep oppdaget at disse kapabilitetene ofte overstiger dem til tradisjonelle OCR-baserte sikkerhetstverktøy som brukes til å inspisere lastede opp bilder.

Forskerne demonstrerte at skadelige instruksjoner kunne skjules ved hjelp av teknikker som hvit tekst på hvite bakgrunner, ekstremt lav-kontrastbokstaver, perspektivforvrengning og forvrengt typografi. Mens eksisterende sikkerhetsscannere ofte ikke kunne gjenkjenne disse skjulte kommandoene, tolket AI-modellene dem uten vanskeligheter. Dette skaper en farlig misforståelse hvor sikkerhetssoftware konkluderer med at bildet er harmløst, mens AI-systemet stille henter ut og kjører instruksjoner som er usynlige for både skanneren og den menneskelige brukeren.

Indirekt prompt-injeksjon gjør trusselen enda farligere

I motsetning til mange cyberangrep som krever direkte tilgang til et målsystem, avhenger InkJect av hva forskerne beskriver som indirekt prompt-injeksjon. I stedet for å laste opp et skadelig bilde direkte inn i en AI-applikasjon, plasserer en angriper bare bildet innenfor en offentlig tilgjengelig repository eller online-ressurs.

Senere, når en utvikler ber en AI-assistent om å bygge en funksjon som bruker denne repository eller analyserer dens innhold, henter modellen automatisk bildet som en del av sin normale arbeidsflyt. Skjulte instruksjoner prosesseres sammen med legitime prosjektressurser uten at utvikleren noen gang innser at ekstra kommandoer har kommet inn i samtalen.

Dette angrepsmetoden er særlig bekymringsverdig fordi moderne AI-agenter stadig henter eksterne ressurser autonomt. Hver offentlig repository, dokumentasjonsside eller delt ressurs kan potensielt bli en annen åpning for skadelige instruksjoner som kan nå et AI-system.

En enkel kodingforespørsel med alvorlige konsekvenser

DeepKeep illustrerte impakten ved hjelp av et programvareutviklingsscenario som ser helt rutinemessig ut.

En utvikler instruerte en AI-kodingassistent om å generere en grunnleggende informasjonsnettsted. Uvitende for utvikleren, inneholdt ett av de refererte bildene skjulte instruksjoner. I stedet for å produsere bare det forespurte nettstedet, la AI-systemet stille til en fullt fungerende medlem-innloggingsystem komplett med administrator-credensialer og backend-autentiseringslogikk.

Nettstedet fungerte nøyaktig som forventet, og ga utvikleren ingen grunn til å mistenke at ekstra kode var blitt innført. Uten en detaljert sikkerhetsgranskning, kunne den uautoriserte bakdøren lett ha blitt deployert til produksjon, og gitt angripere administrator-tilgang som ingen bevisst hadde bedt om.

Demonstrasjonen understreker hvordan visuell prompt-injeksjon skiller seg fra tidligere AI-angrep. I stedet for å bare påvirke chatbot-svar, kan skjulte visuelle instruksjoner manipulere generert kode, innføre sikkerhetssårbarheter, endre autonome arbeidsflyter og potensielt kompromittere bedriftssystemer.

Hvorfor eksisterende AI-sikkerhetstiltak mangler å gripe angrepet

Forskningen understreker en arkitektonisk svakhet i dagens AI-sikkerhetslandskap. De fleste kommersielle sikkerhetstiltak har blitt designet rundt å inspisere tekstbaserte instruksjoner før de når modellen. Som følge av dette har organisasjoner blitt stadig mer effektive i å oppdage skadelige skrevne instruksjoner.

Visuelle inndata, derimot, følger ofte en helt annen prosesseringspipeline.

DeepKeep fant ut at flere frontmodeller avviste identiske angrep når de ble presentert som tekst, men aksepterte dem når de samme instruksjonene ble innenfor et bilde. I praksis kan angripere omgå beskyttelsen ved å endre mediumet instruksjonene leveres gjennom.

Da multimodal AI blir standardgrensesnittet for bedriftsapplikasjoner, blir denne forskjellen stadig viktigere. Sikkerhetssystemer kan ikke lenger anta at farlige instruksjoner ankommer bare gjennom tekst.

Hvorfor bedrifter bør være oppmerksomme

Tidspunktet for DeepKeeps forskning reflekterer en mye større forandring som skjer over hele bedrifts-AI. Bransje-prognoser antyder at multimodale systemer som kan forstå bilder, dokumenter, video og tekst vil bli standard over hele programvareutvikling, finansielle tjenester, helse, produksjon, kundeservice og forretningsautomatisering.

I motsetning til forbruker-chatboter, opererer mange bedrifts-AI-systemer med forhøyede privilegier. De henter proprietær dokumentasjon, skriver kode, kjører kode, kaller API-er, interagerer med sky-infrastruktur, analyserer konfidensielle dokumenter og tar stadig mer beslutninger på vegne av brukerne. Skjulte instruksjoner innenfor visuell innhold representerer derfor langt mer enn en akademisk nysgjerrighet – de introduserer en ny kategori bedrifts-sikkerhetsrisiko som kan påvirke virkelige systemer.

DeepKeeps tilnærming til AI-sikkerhet

Grunnlagt i 2021, har DeepKeep konsentrert seg eksklusivt om å sikre AI gjennom hele dens livssyklus, fra modell-evaluering og testing til deployering og kjøretidssikkerhet. I stedet for å konsentrere seg bare om store språkmodeller, er selskapets plattform designet for å sikre multimodale AI-systemer, autonome AI-agenter, datavisjonsapplikasjoner og bedrifts-AI-deployeringer.

Deres sikkerhetsplattform kombinerer flere lag med beskyttelse, inkludert en AI-brannmur som overvåker inferens i sanntid, automatisert AI Red Teaming som proaktivt søker etter sårbarheter før deployering, en AI-Agent Scanner som analyserer autonome arbeidsflyter for utnyttelsesveier, modell-scanning-kapasiteter som vurderer AI-levirkedjer for sikkerhetsrisiko, og AI-Lens, som gir organisasjoner synlighet i hvordan ansatte og applikasjoner bruker AI over hele bedriften.

Da organisasjoner fortsetter å integrere AI i kritiske arbeidsflyter, reflekterer DeepKeeps strategi en økende erkjennelse av at å sikre AI krever å beskytte hver fase av hvordan modeller mottar, prosesserer og handler på informasjon – ikke bare å filtere instruksjonene brukerne skriver.

Neste grense i AI-sikkerhet

InkJect vil sannsynligvis bli husket som mer enn bare en annen prompt-injeksjonsteknikk. Den understreker hvordan den raske utviklingen av multimodal AI fundamentalt omdefinerer sikkerhetslandskapet.

Så lenge modellene blir stadig mer kapable til å se, resonnere, hente informasjon og handle autonomt, vil angripere naturlig søke nye måter å utnytte hver modalitet disse systemene forstår. Bilder, diagrammer, PDF-er, nettsteder og andre visuelle ressurser kan alle bli kjøretøy for skjulte instruksjoner som eksisterende sikkerhetstverktøy kanskje aldri oppdager.

DeepKeep har ansvarlig avdekket funnene til både OpenAI og Anthropic, og gitt selskapene en mulighet til å styrke beskyttelsen mot denne nyoppdagede angrepsvektoren. Om InkJect blir det første eksemplet på en mye bredere klasse multimodale prompt-injeksjonsangrep, eller ikke, er uvisst, men oppdagelsen tjener som en rett tidig påminnelse om at AI-sikkerhet må utvikle seg like raskt som AI selv. Da modellene lærer å forstå den visuelle verden med stadig større sofistikasjon, vil å forsvare dem kreve sikkerhetssystemer som er i stand til å gjøre det samme.

Antoine er en visjonær leder og medgrunnlegger av Unite.AI, drevet av en urokkelig lidenskap for å forme og fremme fremtiden for AI og robotikk. En serial entrepreneur, han tror at AI vil være like disruptiv for samfunnet som elektrisitet, og blir ofte fanget i å prise potensialet for disruptive teknologier og AGI.

Som en futurist, er han dedikert til å utforske hvordan disse innovasjonene vil forme vår verden. I tillegg er han grunnlegger av Securities.io, en plattform som fokuserer på å investere i banebrytende teknologier som definerer fremtiden og omformer hele sektorer.