Кібербезпека

DeepKeep відкриває “InkJect” – новий тип атак на штучний інтелект, який ховає шкідливі команди всередині зображень

mm
Додайте Unite.AI до бажаних джерел у Google

Відповідно як підприємства швидко приймають багатомодальний штучний інтелект, здатний розуміти як текст, так і зображення, дослідники безпеки виявляють, що ці потужні нові можливості вводять однаково складні нові поверхні атак. Ізраїльська компанія з безпеки штучного інтелекту DeepKeep представила раніше не задокументований візуальний метод ін’єкції промпта під назвою InkJect, демонструючи, що приховані інструкції, вбудовані всередині зображень, які здаються безпечними, можуть маніпулювати провідними моделями мови та зору (VLMs) та обходити багато засобів безпеки, призначених для зупинки традиційних атак ін’єкції промпта.

Відповідно до дослідження DeepKeep, вразливість впливає на кілька найбільш просунутих багатомодальних моделей сьогодні, включаючи GPT-5.2 та GPT-5.4 Mini від OpenAI, а також Claude Sonnet 4.6 та Claude Opus 4.5 від Anthropic. Результати демонструють значиму сліпоту в безпеці штучного інтелекту: хоча галузь вклала багато коштів у захист текстових взаємодій, значно менше уваги було приділено візуальному шару розуміння, який усе більше підтримує сучасні системи штучного інтелекту.

Нова еволюція ін’єкції промпта

Традиційні атаки ін’єкції промпта намагаються маніпулювати моделлю штучного інтелекту за допомогою ретельно створеного тексту, який перевищує її первинні інструкції. За останні два роки провідні постачальники штучного інтелекту вклали багато коштів у засоби безпеки, які виявляють ці атаки до того, як моделі зможуть діяти відповідно до них.

InkJect йде зовсім іншим шляхом. Замість прямого спілкування через текст атакувальники приховують шкідливі інструкції всередині зображень, які стають частиною звичайного робочого процесу штучного інтелекту. Ці зображення можуть бути збережені всередині публічних репозиторіїв GitHub, сторінок документації, дизайнерських активів, діаграм або інших візуальних ресурсів, які асистенти штучного інтелекту та автономні агенти регулярно отримують під час виконання легітимних завдань. З точки зору користувача, нічого не здається незвичайним. Штучний інтелект просто обробляє зображення як іншу частину контекстної інформації, не знаючи, що воно також містить приховані команди.

Використання можливостей штучного інтелекту з баченням

Що робить InkJect особливо ефективним, так це те, що воно націлюється на одну з нових можливостей сучасних систем штучного інтелекту: візуальне розуміння.

Моделі мови та зору виконують складний оптичний розпізнавання символів під час інтерпретації зображень, що дозволяє їм читати текст, вбудований у діаграми, знімки екрана, фотографії та інтерфейси. DeepKeep виявила, що ці можливості часто перевищують можливості традиційних засобів безпеки на основі розпізнавання символів, які використовуються для перевірки завантажених зображень.

Дослідники продемонстрували, що шкідливі інструкції можна було б приховати за допомогою технік, таких як білий текст на білому фоні, текст з дуже низьким контрастом, спотворення перспективи та викривлений шрифт. Хоча існуючі засоби безпеки часто не визнавали цих прихованих команд, самі моделі штучного інтелекту інтерпретували їх без труднощів. Це створює небезпечну невідповідність, коли програмне забезпечення безпеки вважає, що зображення безпечне, тоді як штучний інтелект тихо витягує та виконує інструкції, які невидимі як для сканера, так і для користувача.

Непряма ін’єкція промпта робить загрозу ще більш небезпечною

На відміну від багатьох кібератак, які вимагають прямого доступу до системи-цілі, InkJect використовує той, що дослідники називають непрямою ін’єкцією промпта. Замість завантаження шкідливого зображення безпосередньо в додаток штучного інтелекту атакувальник просто розміщує зображення всередині публічно доступного репозиторію або онлайн-ресурсу.

Пізніше, коли розробник просить асистента штучного інтелекту створити функцію, використовуючи цей репозиторій або проаналізувати його вміст, модель автоматично отримує зображення як частину свого звичайного робочого процесу. Приховані інструкції обробляються поряд з легітимними активами проекту без того, щоб розробник усвідомлював, що додаткові команди ввійшли в розмову.

Цей метод атаки особливо небезпечний, оскільки сучасні агенти штучного інтелекту усе більше автономно отримують зовнішні ресурси. Кожен публічний репозиторій, сторінка документації або спільний актив потенційно стає ще одним шляхом, яким шкідливі інструкції можуть досягти системи штучного інтелекту.

Проста кодова запит з серйозними наслідками

DeepKeep проілюструвала вплив, використовуючи сценарій розробки програмного забезпечення, який здається цілком звичайним.

Розробник наказав асистенту штучного інтелекту створити базову інформаційну веб-сторінку. Невідомо розробнику, одне з посилань на зображення містило приховані інструкції. Замість того, щоб створити лише запитану веб-сторінку, штучний інтелект тихо додав повністю функціональну систему входу учасників із адміністративними обліковими даними та логікою автентифікації на боці сервера.

Веб-сторінка функціонувала точно так, як очікувалося, не давши розробнику жодних підстав підозрювати, що додатковий код був вставлений. Без детального аудиту безпеки несанкціоновані задні двері могли б легко бути розгорнуті у виробництві, надавши атакувальникам адміністративний доступ, про який ніхто свідомо не запитував.

Демонстрація підкреслює, як візуальна ін’єкція промпта відрізняється від попередніх атак на штучний інтелект. Замість того, щоб лише впливати на відповіді чат-бота, приховані візуальні інструкції можуть маніпулювати згенерованим кодом, вводити уразливості безпеки, змінювати автономні робочі процеси та потенційно компрометувати корпоративні системи.

Чому існуючі засоби безпеки штучного інтелекту не помічають атаку

Дослідження підкреслює архітектурну слабкість у сучасному ландшафті безпеки штучного інтелекту. Більшість комерційних засобів безпеки були розроблені навколо інспекції текстових промптів до того, як вони досягнуть моделі. Як результат, організації стали дедалі ефективнішими у виявленні шкідливих написаних інструкцій.

Візуальні входи, однак, часто слідують зовсім іншому каналу обробки.

DeepKeep виявила, що кілька передових моделей відхиляли ідентичні атаки, коли вони були представлені у вигляді тексту, але приймали їх, коли ті самі інструкції були вбудовані всередині зображення. По суті, атакувальники можуть обходити засоби захисту, просто змінюючи середовище, через яке інструкції доставляються.

Оскільки багатомодальний штучний інтелект стає стандартним інтерфейсом для корпоративних додатків, ця відмінність стає дедалі важливішою. Системи безпеки вже не можуть припускати, що небезпечні інструкції надходять лише через текст.

Чому підприємства повинні звернути увагу

Тимінг дослідження DeepKeep відображає значно більшу зміну, яка відбувається в галузі корпоративного штучного інтелекту. Прогнози галузі свідчать про те, що багатомодальні системи, здатні розуміти зображення, документи, відео та текст, стануть стандартними у розробці програмного забезпечення, фінансових послугах, охороні здоров’я, виробництві, підтримці клієнтів та бізнес-автоматизації.

На відміну від споживчих чат-ботів, багато корпоративних систем штучного інтелекту працюють з підвищеними привілеями. Вони отримують конфіденційну документацію, пишуть програмний код, викликають API, взаємодіють з інфраструктурою хмари, аналізують конфіденційні документи та дедалі більше приймають рішення від імені користувачів. Приховані інструкції, вбудовані у візуальний контент, представляють набагато більше, ніж академічний інтерес — вони вводять нову категорію корпоративних кіберризик, здатних впливати на реальні системи.

Підхід DeepKeep до безпеки штучного інтелекту

Заснована у 2021 році, DeepKeep зосередилася виключно на забезпеченні безпеки штучного інтелекту протягом усього його життєвого циклу, від оцінки моделей та тестування до розгортання та захисту під час виконання. Замість того, щоб зосереджуватися лише на великих моделях мови, платформа компанії розроблена для захисту багатомодальних систем штучного інтелекту, автономних агентів штучного інтелекту, застосунків комп’ютерного зору та корпоративних розгортань штучного інтелекту.

Її платформа безпеки поєднує кілька шарів захисту, включаючи брандмауер штучного інтелекту, який моніторить висновок в режимі реального часу, автоматичне червоне командування штучного інтелекту, яке активно шукає вразливості до розгортання, сканер агентів штучного інтелекту, який аналізує автономні робочі процеси на наявність шляхів експлуатації, можливості сканування моделей, які оцінюють ланцюжки постачання штучного інтелекту на наявність ризиків безпеки, та лінзу штучного інтелекту, яка надає організаціям можливість бачити, як співробітники та програми використовують штучний інтелект по всій компанії.

Оскільки організації продовжують інтегрувати штучний інтелект у критично важливі робочі процеси, стратегія DeepKeep відображає зростаюче визнання того, що забезпечення безпеки штучного інтелекту вимагає захисту кожного етапу отримання, обробки та виконання інформації моделями — а не просто фільтрації промптів, введених користувачами.

Наступний рубіж у безпеці штучного інтелекту

InkJect, ймовірно, буде пам’ятатися як не просто ще один метод ін’єкції промпта. Він підкреслює, як швидка еволюція багатомодального штучного інтелекту фундаментально змінює ландшафт кібербезпеки.

Відповідно як моделі стають дедалі здатнішими бачити, розуміти, отримувати інформацію та діяти автономно, атакувальники природно шукатимуть нові способи експлуатації кожної модальності, яку ці системи розуміють. Зображення, діаграми, PDF, веб-сайти та інші візуальні ресурси можуть усі стати засобами для прихованих інструкцій, які існуючі засоби безпеки можуть ніколи не виявити.

DeepKeep відповідально розкрила свої висновки компанії OpenAI та Anthropic, давши їм можливість посилити захист проти цього нового виявленого вектора атаки. Чи стане InkJect першим прикладом набагато ширшого класу багатомодальних атак ін’єкції промпта, залишається невідомим, але його відкриття служить своєчасним нагадуванням про те, що безпека штучного інтелекту повинна еволюціонувати так само швидко, як і сам штучний інтелект. Коли моделі вчаться розуміти візуальний світ з дедалі більшою складністю, захист їх буде вимагати систем безпеки, здатних робити те саме.

Антуан є видним лідером і засновником Unite.AI, який рухається незмінною пристрастю до формування та просування майбутнього штучного інтелекту та робототехніки. Як серійний підприємець, він вважає, що штучний інтелект буде таким же революційним для суспільства, як і електрика, і часто захоплюється потенціалом революційних технологій і штучного інтелекту загального призначення.

Як футуролог, він присвячений вивченню того, як ці інновації будуть формувати наш світ. Крім того, він є засновником Securities.io, платформи, орієнтованої на інвестиції в передові технології, які переінакшують майбутнє і змінюють цілі сектори.