Кибербезопасность

DeepKeep обнаруживает ‘InkJect’, новую атаку на ИИ, которая скрывает вредоносные запросы внутри изображений

mm
Добавьте Unite.AI в избранные источники в Google

По мере того, как предприятия быстро принимают многомодальный ИИ, способный понимать как текст, так и изображения, исследователи безопасности обнаруживают, что эти мощные новые возможности вводят новые, столь же сложные поверхности атак. Израильская компания по безопасности ИИ DeepKeep раскрыла ранее не задокументированную технику визуального внедрения запросов под названием InkJect, демонстрирующую, что скрытые инструкции, встроенные внутри, казалось бы, безобидных изображений, могут манипулировать ведущими моделями зрения и языка (VLMs) и обходить многие средства безопасности, предназначенные для остановки традиционных атак на внедрение запросов.

Согласно исследованиям DeepKeep, уязвимость затрагивает несколько из сегодняшних наиболее передовых многомодальных моделей, включая GPT-5.2 и GPT-5.4 Mini от OpenAI, а также Claude Sonnet 4.6 и Claude Opus 4.5 от Anthropic. Результаты подчеркивают значительную слепую зону в безопасности ИИ: хотя отрасль инвестировала значительные средства в защиту текстовых взаимодействий, гораздо меньше внимания было уделено визуальному слою рассуждений, который все чаще обеспечивает современные системы ИИ.

Новая эволюция внедрения запросов

Традиционные атаки на внедрение запросов пытаются манипулировать моделью ИИ с помощью тщательно созданного текста, который переопределяет ее исходные инструкции. За последние два года ведущие поставщики ИИ инвестировали значительные средства в средства безопасности, которые обнаруживают эти атаки до того, как модели смогут на них отреагировать.

InkJect идет по совершенно другому пути. Вместо прямого общения через текст атакующие скрывают вредоносные инструкции внутри изображений, которые становятся частью нормальной рабочей нагрузки ИИ. Эти изображения могут храниться в публичных репозиториях GitHub, страницах документации, дизайнерских активах, диаграммах или других визуальных ресурсах, которые помощники кодирования ИИ и автономные агенты обычно извлекают при выполнении легитимных задач. С точки зрения пользователя, ничего не кажется необычным. ИИ просто обрабатывает изображение как еще одну часть контекстной информации, не осознавая, что оно также содержит скрытые команды.

Эксплуатация способности ИИ видеть

Что делает InkJect особенно эффективным, так это то, что он нацеливается на одну из новых возможностей современных систем ИИ: визуальное понимание.

Модели зрения и языка выполняют сложное распознавание оптических символов в процессе интерпретации изображений, что позволяет им читать текст, встроенный в диаграммы, скриншоты, фотографии и интерфейсы. DeepKeep обнаружил, что эти возможности часто превышают возможности традиционных инструментов безопасности на основе OCR, используемых для проверки загружаемых изображений.

Исследователи продемонстрировали, что вредоносные инструкции можно скрыть с помощью таких методов, как белый текст на белом фоне, текст с очень низким контрастом, искажение перспективы и искаженный шрифт. Хотя существующие средства безопасности часто не смогли распознать эти скрытые команды, сами модели ИИ интерпретировали их без проблем. Это создает опасное несоответствие, когда программное обеспечение безопасности заключает, что изображение безобидно, а ИИ тихо извлекает и выполняет инструкции, невидимые как для сканера, так и для человеческого пользователя.

Косвенное внедрение запросов делает угрозу еще более опасной

В отличие от многих кибератак, которые требуют прямого доступа к целевой системе, InkJect полагается на то, что исследователи описывают как косвенное внедрение запросов. Вместо того, чтобы загружать вредоносное изображение напрямую в приложение ИИ, атакующий просто размещает изображение внутри публично доступного репозитория или онлайн-ресурса.

Позже, когда разработчик просит помощника ИИ создать функцию, используя этот репозиторий или проанализировать его содержимое, модель автоматически извлекает изображение в качестве части своей нормальной рабочей нагрузки. Скрытые инструкции обрабатываются вместе с легитимными проектными активами без того, чтобы разработчик осознавал, что дополнительные команды вошли в разговор.

Этот метод атаки особенно тревожен, поскольку современные агенты ИИ все чаще извлекают внешние ресурсы автономно. Каждый публичный репозиторий, страница документации или общий актив потенциально становится еще одним путем, через который вредоносные инструкции могут достичь системы ИИ.

Простой запрос кодирования с серьезными последствиями

DeepKeep проиллюстрировал влияние, используя сценарий разработки программного обеспечения, который кажется совершенно обычным.

Разработчик инструктировал помощника ИИ создать базовую информационную веб-страницу. Неизвестно разработчику, одно из ссылочных изображений содержало скрытые инструкции. Вместо того, чтобы производить только запрошенную веб-страницу, ИИ тихо добавил полностью функциональную систему входа участников с учетными данными администратора и логикой аутентификации бэкэнда.

Веб-страница функционировала точно так, как ожидалось, не давая разработчику никаких оснований подозревать, что дополнительный код был вставлен. Без подробного аудита безопасности неавторизованная задняя дверь могла легко быть развернута в производстве, предоставив атакующим административный доступ, который никто намеренно не запрашивал.

Демонстрация подчеркивает, как визуальное внедрение запросов отличается от предыдущих атак на ИИ. Вместо того, чтобы просто влиять на ответы чат-ботов, скрытые визуальные инструкции могут манипулировать сгенерированным кодом, вводить уязвимости безопасности, изменять автономные рабочие процессы и потенциально компрометировать системы предприятий.

Почему существующие средства безопасности ИИ пропускают атаку

Исследование подчеркивает архитектурную слабость в сегодняшнем ландшафте безопасности ИИ. Большинство коммерческих барьеров были разработаны вокруг проверки текстовых запросов перед тем, как они достигнут модели. В результате организации стали все более эффективными в обнаружении вредоносных письменных инструкций.

Визуальные входные данные, однако, часто следуют совершенно другому процессу обработки.

DeepKeep обнаружил, что несколько передовых моделей отвергли идентичные атаки, когда они были представлены в виде текста, но приняли их, когда эти же инструкции были встроены внутри изображения. По сути, атакующие могут обойти защиты, просто изменив среду, через которую инструкции доставляются.

По мере того, как многомодальный ИИ становится стандартным интерфейсом для приложений предприятий, это различие становится все более важным. Системы безопасности больше не могут предполагать, что опасные инструкции доходят только через текст.

Почему предприятиям следует обратить внимание

Тиминг исследования DeepKeep отражает более крупный сдвиг, происходящий во всей ИИ-индустрии предприятий. Прогнозы отрасли предполагают, что многомодальные системы, способные понимать изображения, документы, видео и текст, станут стандартными во всей разработке программного обеспечения, финансовых услугах, здравоохранении, производстве, поддержке клиентов и бизнес-автоматизации.

В отличие от потребительских чат-ботов, многие системы ИИ предприятий работают с повышенными привилегиями. Они извлекают проприетарную документацию, пишут программное обеспечение, выполняют код, вызывают API, взаимодействуют с облачной инфраструктурой, анализируют конфиденциальные документы и все чаще принимают решения от имени пользователей. Скрытые инструкции, встроенные в визуальный контент, поэтому представляют собой нечто большее, чем просто академический интерес – они вводят новую категорию рисков кибербезопасности предприятий, способную влиять на реальные системы.

Подход DeepKeep к безопасности ИИ

Была основана в 2021 году, DeepKeep сосредоточилась исключительно на обеспечении безопасности ИИ на протяжении всего его жизненного цикла, от оценки и тестирования моделей до их развертывания и защиты во время выполнения. Вместо того, чтобы сосредоточиться только на больших языковых моделях, платформа компании предназначена для обеспечения безопасности многомодальных систем ИИ, автономных агентов ИИ, приложений компьютерного зрения и развертываний ИИ предприятий.

Ее платформа безопасности объединяет несколько слоев защиты, включая брандмауэр ИИ, который контролирует вывод в реальном времени, автоматическое красное командование ИИ, которое активно ищет уязвимости до развертывания, сканер агентов ИИ, который анализирует автономные рабочие процессы на пути эксплуатации, возможности сканирования моделей, которые оценивают цепочки поставок ИИ на предмет рисков безопасности, и ИИ-линза, которая предоставляет организациям видимость того, как сотрудники и приложения используют ИИ во всей компании.

По мере того, как организации продолжают интегрировать ИИ в критически важные рабочие процессы, стратегия DeepKeep отражает растущее признание того, что обеспечение безопасности ИИ требует защиты каждого этапа того, как модели получают, обрабатывают и действуют на основе информации – а не просто фильтрации запросов, вводимых пользователями.

Следующая граница в безопасности ИИ

InkJect, вероятно, будет запомнен как нечто большее, чем просто еще одна техника внедрения запросов. Он подчеркивает, как быстрая эволюция многомодального ИИ фундаментально меняет ландшафт кибербезопасности.

По мере того, как модели становятся все более способными видеть, рассуждать, извлекать информацию и действовать автономно, атакующие естественным образом будут искать новые способы эксплуатации каждой модальности, которую эти системы понимают. Изображения, диаграммы, PDF, веб-сайты и другие визуальные ресурсы все могут стать транспортными средствами для скрытых инструкций, которые существующие средства безопасности могут никогда не обнаружить.

DeepKeep ответственно раскрыла свои результаты как OpenAI, так и Anthropic, дав компаниям возможность укрепить защиту от этой новой вектор атаки. Будет ли InkJect первым примером более широкого класса многомодальных атак на внедрение запросов, остается быть увиденным, но его открытие служит своевременным напоминанием о том, что безопасность ИИ должна эволюционировать так же быстро, как и сам ИИ. По мере того, как модели учатся понимать визуальный мир с все большей сложностью, защита их будет требовать систем безопасности, способных делать то же самое.

Антуан - видный лидер и сооснователь Unite.AI, движимый непоколебимой страстью к формированию и продвижению будущего ИИ и робототехники. Как серийный предприниматель, он считает, что ИИ будет столь же разрушительным для общества, как и электричество, и часто увлекается потенциалом разрушительных технологий и ИИ.

Как футуролог, он посвящен исследованию того, как эти инновации будут формировать наш мир. Кроме того, он является основателем Securities.io, платформы, ориентированной на инвестиции в передовые технологии, которые переопределяют будущее и меняют целые сектора.