Kybernetická bezpečnost

DeepKeep odhalil “InkJect”, novou AI útok, který skrývá škodlivé příkazy uvnitř obrázků

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Podniky rychle přijímají multimodální AI schopnou porozumět textu i obrázkům, bezpečnostní výzkumníci objevují, že tyto nové schopnosti zavedou stejně sofistikované nové útočné plochy. Izraelská AI bezpečnostní společnost DeepKeep odhalila dříve nedokumentovanou vizuální prompt injekční techniku nazvanou InkJect, která demonstruje, že skryté instrukce vložené uvnitř zdánlivě neškodných obrázků mohou manipulovat s vedoucími vizuální-jazykovými modely (VLMs) a přitom obcházet mnoho bezpečnostních zábran navržených k zastavení tradičních prompt injekčních útoků.

Podle DeepKeepova výzkumu je zranitelnost ovlivněna několika z dnešních nej pokročilejších multimodálních modelů, včetně OpenAI GPT-5.2 a GPT-5.4 Mini, spolu s Anthropic Claude Sonnet 4.6 a Claude Opus 4.5. Zjištění odhalují významnou slepou skvrnu v AI bezpečnosti: zatímco průmysl investoval značně do ochrany textových interakcí, mnohem méně pozornosti bylo věnováno vizuálnímu rozlišovacímu vrstvě, která stále více pohání moderní AI systémy.

Nová evoluce prompt injekce

Tradiční prompt injekční útoky se snaží manipulovat AI modelem pomocí pečlivě vytvořeného textu, který přepsává jeho původní instrukce. V průběhu posledních dvou let vedoucí AI poskytovatelé investovali značně do zábran, které detekují tyto útoky předtím, než modely mohou jednat.

InkJect jde zcela jinou cestou. Místo přímé komunikace prostřednictvím textu útočníci skrývají škodlivé instrukce uvnitř obrázků, které se stávají součástí AI běžné pracovní postupu. Tyto obrázky mohou být uloženy v veřejných GitHub repozitářích, dokumentačních stránkách, designových assetech, diagramech nebo jiných vizuálních zdrojích, které AI kódovací asistenti a autonomní agenti běžně získávají při plnění legitimních úkolů. Z uživatelské perspektivy nic neobvyklého není. AI prostě zpracovává obrázek jako další kus kontextuální informace, aniž by si byl vědom, že obsahuje skryté příkazy.

Využití AI schopnosti vidět

Co činí InkJect zvlášť účinným, je to, že cílí na jednu z nejnovějších schopností moderních AI systémů: vizuální porozumění.

Vizuální-jazykové modely provádějí sofistikované optické rozpoznávání znaků jako součást interpretace obrázků, což jim umožňuje číst text vložený do diagramů, screenshotů, fotografií a rozhraní. DeepKeep zjistil, že tyto schopnosti často přesahují ty tradičních OCR-založených bezpečnostních nástrojů používaných k prohlížení nahrávaných obrázků.

Výzkumníci demonstrovali, že škodlivé instrukce mohly být skryty pomocí technik, jako je bílý text na bílém pozadí, extrémně nízkokontrastní písmo, perspektivní zkreslení a zkroucené typografie. Zatímco stávající bezpečnostní skenery často selhaly při rozpoznání těchto skrytých příkazů, AI modely samy je interpretují bez potíží. To vytváří nebezpečný nesoulad, kdy bezpečnostní software uzavírá, že obrázek je neškodný, zatímco AI tiše extrahuje a provádí instrukce neviditelné pro skener i uživatele.

Nepřímá prompt injekce činí hrozbu ještě nebezpečnější

Na rozdíl od mnoha kybernetických útoků, které vyžadují přímý přístup k cílovému systému, InkJect spoléhá na to, co výzkumníci popisují jako nepřímou prompt injekci. Místo nahrání škodlivého obrázku přímo do AI aplikace útočník jednoduše umístí obrázek do veřejně přístupného repozitáře nebo online zdroje.

Později, když vývojář požádá AI asistenta o sestavení funkce pomocí tohoto repozitáře nebo analýzu jeho obsahu, model automaticky získá obrázek jako součást svého běžného pracovního postupu. Skryté instrukce jsou zpracovány spolu s legitimními projektovými assety bez toho, aby si vývojář uvědomil, že další příkazy vstoupily do konverzace.

Tento útočný postup je zvlášť znepokojivý, protože moderní AI agenti stále více získávají externí zdroje autonomně. Každý veřejný repozitář, dokumentační stránka nebo sdílený asset potenciálně stává další cestou, kterou mohou škodlivé instrukce dosáhnout AI systému.

Jednoduchá kódovací žádost s vážnými důsledky

DeepKeep ilustroval dopad pomocí scénáře softwarového vývoje, který vypadá zcela rutinně.

Vývojář instruoval AI kódovacího asistenta, aby vygeneroval základní informační webovou stránku. Neznámý vývojáři, jeden z odkazovaných obrázků obsahoval skryté instrukce. Místo toho, aby produkoval pouze požadovanou webovou stránku, AI potichu přidalo plně funkční členství do přihlašovacího systému včetně administrátorských přihlašovacích údajů a backendové autentizační logiky.

Webová stránka fungovala přesně podle očekávání, což vývojáři nedalo žádný důvod podezřívat, že další kód byl vložen. Bez podrobné bezpečnostní audity by neoprávněný backdoor mohl být snadno nasazen do produkce, poskytující útočníkům administrativní přístup, o kterém nikdo nevěděl.

Demonstrace zdůrazňuje, jak se vizuální prompt injekce liší od předchozích AI útoků. Místo toho, aby ovlivňovaly pouze chatbot odpovědi, skryté vizuální instrukce mohou manipulovat generovaným kódem, zavádět bezpečnostní zranitelnosti, měnit autonomní pracovní postupy a potenciálně ohrozit podnikové systémy.

Proč stávající AI zábrany minou útok

Výzkum podtrhuje architektonickou slabost v dnešním AI bezpečnostním prostředí. Většina komerčních zábran byla navržena kolem prohlížení textových promptů předtím, než dosáhnou modelu. Jako výsledek, organizace se staly stále účinnějšími při detekci škodlivých psaných instrukcí.

Vizuální vstupy, nicméně, často následují zcela jinou zpracovatelskou pipeline.

DeepKeep zjistil, že několik frontových modelů odmítlo identické útoky, když byly prezentovány jako text, ale přijaly je, když tyto instrukce byly vloženy do obrázku. Skutečně, útočníci mohou obcházet ochrany jednoduše změnou média, kterým jsou instrukce doručeny.

Jak se multimodální AI stává standardním rozhraním pro podnikové aplikace, toto rozlišení se stává stále důležitějším. Bezpečnostní systémy již nemohou předpokládat, že nebezpečné instrukce dorazí pouze prostřednictvím textu.

Proč by podniky měly věnovat pozornost

Čas DeepKeepova výzkumu odráží mnohem větší posun, který probíhá napříč podnikovým AI. Průmyslové předpovědi naznačují, že multimodální systémy schopné porozumět obrázkům, dokumentům, videu a textu se stanou standardem napříč softwarovým vývojem, finančními službami, zdravotnictvím, výrobou, zákaznickou podporou a obchodním automationem.

Na rozdíl od spotřebitelských chatbotů mnohé podnikové AI systémy fungují s zvýšenými oprávněními. Získávají proprietární dokumentaci, píší software, spouštějí kód, volají API, interagují s cloudovou infrastrukturou, analyzují důvěrné dokumenty a stále více rozhodují jménem uživatelů. Skryté instrukce vložené do vizuálního obsahu tedy představují mnohem více než akademickou zvědavost – zavádějí novou kategorii podnikové kybernetické hrozby schopné ovlivňovat reálné systémy.

DeepKeepův přístup k AI bezpečnosti

Založený v roce 2021, DeepKeep se soustředil výhradně na zajištění AI po celou dobu jeho životnosti, od modelové evaluace a testování po nasazení a runtime ochranu. Místo toho, aby se soustředil pouze na velké jazykové modely, společnost platforma je navržena k zajištění multimodálních AI systémů, autonomních AI agentů, počítačových vizuálních aplikací a podnikových AI nasazení.

Jeho bezpečnostní platforma kombinuje několik vrstev ochrany, včetně AI Firewall, který monitoruje inference v reálném čase, automatizovaného AI Red Teaming, který proaktivně hledá zranitelnosti před nasazením, AI Agent Scanner, který analyzuje autonomní pracovní postupy pro exploatační cesty, modelové skenovací schopnosti, které hodnotí AI dodavatelské řetězce pro bezpečnostní rizika, a AI Lens, který poskytuje organizacím přehled o tom, jak zaměstnanci a aplikace používají AI napříč podnikem.

Jak organizace pokračují v integraci AI do kritických pracovních postupů, DeepKeepova strategie odráží rostoucí uznání, že zajištění AI vyžaduje ochranu každého stadia, jak modely přijímají, zpracovávají a jednají na základě informací – ne pouze filtrování promptů, které uživatelé zadávají.

Další hranice AI bezpečnosti

InkJect je pravděpodobně bude zapamatován jako více než jen další prompt injekční technika. Zdůrazňuje, jak rychlá evoluce multimodálního AI fundamentálně mění kybernetickou hrozbu.

Jak se modely stávají stále schopnějšími porozumět, rozumět, získávat informace a jednat autonomně, útočníci přirozeně hledají nové způsoby, jak využít každou modalitu, kterou tyto systémy rozumí. Obrázky, diagramy, PDF, webové stránky a další vizuální zdroje mohou všechny stát se vozidly pro skryté instrukce, které stávající bezpečnostní nástroje nemusí nikdy detekovat.

DeepKeep odpovědně zveřejnil svá zjištění oběma OpenAI a Anthropic, poskytujícím společnostem příležitost posílit ochranu proti této nově identifikované útočné vektoru. Zda se InkJect stane prvním příkladem mnohem širší třídy multimodálních prompt injekčních útoků, zůstává být viděno, ale jeho objev slouží jako včasný připomínka, že AI bezpečnost musí evoluce stejně rychle jako AI samo. Jak se modely učí rozumět vizuálnímu světu s stále větší sofistikovaností, jejich obrana bude vyžadovat bezpečnostní systémy schopné dělat totéž.

Antoine je vizionářský líder a spoluzakladatel Unite.AI, který je poháněn neotřesitelnou vášní pro formování a propagaci budoucnosti umělé inteligence a robotiky. Jako sériový podnikatel věří, že umělá inteligence bude mít na společnost stejně disruptivní vliv jako elektřina, a často se chvála na potenciál disruptivních technologií a AGI.