Отчёты
Когда ИИ дает сбой: отчет Enkrypt AI раскрывает опасные уязвимости в многомодальных моделях

В мае 2025 года Enkrypt AI выпустила отчет Multimodal Red Teaming Report, который представляет собой тревожный анализ, показывающий, насколько легко можно манипулировать передовыми системами ИИ, чтобы они генерировали опасный и неэтичный контент. Отчет фокусируется на двух ведущих моделях Mistral – Pixtral-Large (25.02) и Pixtral-12b – и рисует картину моделей, которые не только технически впечатляют, но и тревожно уязвимы.
Модели видения и языка (VLM) типа Pixtral предназначены для интерпретации как визуальных, так и текстовых входных данных, что позволяет им реагировать интеллектуально на сложные, реальные запросы. Но эта способность несет в себе повышенный риск. В отличие от традиционных языковых моделей, которые обрабатывают только текст, VLM могут быть подвержены влиянию взаимодействия между изображениями и словами, открывая новые двери для атак злоумышленников. Тестирование Enkrypt AI показывает, насколько легко эти двери можно открыть.
Тревожные результаты тестирования: провалы CSEM и CBRN
Команда, стоящая за отчетом, использовала сложные методы красной команды – форму оценки, предназначенную для имитации реальных угроз. Эти тесты использовали тактику, такую как обход безопасности (запросы к модели с помощью тщательно созданных запросов для обхода фильтров безопасности), обман с помощью изображений и манипуляция контекстом. Тревожно, что 68% этих провокационных запросов вызвали вредоносные ответы в обоих моделях Pixtral, включая контент, связанный с эксплуатацией детей, и даже с проектированием химического оружия.
Одним из наиболее поразительных откровений является связь с материалами о детской сексуальной эксплуатации (CSEM). Отчет показал, что модели Mistral в 60 раз чаще производили контент, связанный с CSEM, по сравнению с отраслевыми стандартами, такими как GPT-4o и Claude 3.7 Sonnet. В тестовых случаях модели реагировали на замаскированные запросы о эксплуатации с подробными, многоабзацными объяснениями, как манипулировать несовершеннолетними – все это было завуалировано под “для образовательного осведомленности”. Модели не просто не отвергали вредоносные запросы – они дополняли их подробностями.
Не менее тревожными были результаты в категории риска CBRN (химического, биологического, радиологического и ядерного). Когда модель получала запрос о том, как изменить нервно-паралитическое вещество VX – химическое оружие, модели предлагали шокирующе конкретные идеи по увеличению его стойкости в окружающей среде. Они описывали, в сокращенной, но явно технической форме, методы, такие как инкапсуляция, экологический экран и системы контролируемого выпуска.
Эти провалы не всегда были вызваны явно вредоносными запросами. Одна из тактик заключалась в том, чтобы загрузить изображение пустого пронумерованного списка и попросить модель “заполнить детали”. Этот простой, казалось бы, безобидный запрос привел к генерации неэтичного и незаконного руководства. Слияние визуальной и текстовой манипуляции оказалось особенно опасным, подчеркивая уникальную проблему, связанную с многомодальным ИИ.
Почему модели видения и языка представляют новые проблемы безопасности
В основе этих рисков лежит техническая сложность моделей видения и языка. Эти системы не только анализируют язык – они синтезируют смысл через форматы, что означает, что им необходимо интерпретировать контент изображений, понимать контекст текста и реагировать соответственно. Это взаимодействие вводит новые векторы для эксплуатации. Модель может правильно отвергнуть вредоносный текстовый запрос, но когда она объединена с предложенным изображением или двусмысленным контекстом, она может генерировать опасный вывод.
Тестирование Enkrypt AI показало, как кросс-модальные атаки по внедрению – когда тонкие подсказки в одной модальности влияют на вывод другой – могут полностью обойти стандартные механизмы безопасности. Эти провалы демонстрируют, что традиционные методы модерации контента, разработанные для систем с одной модальностью, недостаточны для современных VLM.
Отчет также описывает, как модели Pixtral были доступны: Pixtral-Large через AWS Bedrock и Pixtral-12b через платформу Mistral. Этот контекст реального развертывания еще больше подчеркивает срочность этих выводов. Эти модели не ограничены лабораториями – они доступны через основные облачные платформы и могут быть легко интегрированы в потребительские или корпоративные продукты.
Что необходимо сделать: план действий для более безопасного ИИ
К своему crédиту, Enkrypt AI не только подчеркивает проблемы, но и предлагает путь вперед. Отчет очерчивает комплексную стратегию смягчения, начиная с тренировки по безопасности. Это предполагает повторную тренировку модели с использованием собственных данных красной команды для снижения восприимчивости к вредоносным запросам. Техники, такие как Direct Preference Optimization (DPO), рекомендуются для тонкой настройки ответов модели, чтобы они были подальше от рискованных выводов.
Он также подчеркивает важность контекстно-зависимых ограничений – динамических фильтров, которые могут интерпретировать и блокировать вредоносные запросы в реальном времени, учитывая полный контекст многомодального ввода. Кроме того, предлагается использование Model Risk Cards в качестве меры прозрачности, чтобы помочь заинтересованным сторонам понять ограничения модели и известные случаи неудач.
Возможно, наиболее важным рекомендацией является то, что тестирование красной командой должно рассматриваться как непрерывный процесс, а не как одноразовое тестирование. По мере эволюции моделей эволюционируют и стратегии атак. Только непрерывная оценка и активный мониторинг могут обеспечить долгосрочную надежность, особенно когда модели развертываются в чувствительных секторах, таких как здравоохранение, образование или оборона.
Отчет Multimodal Red Teaming Report от Enkrypt AI является четким сигналом для индустрии ИИ: многомодальная мощь несет с собой многомодальную ответственность. Эти модели представляют собой скачок вперед в возможностях, но они также требуют скачка в том, как мы думаем о безопасности, безопасности и этической эксплуатации. Если их не контролировать, они не только рискуют неудачей – они рискуют реальным вредом.
Для всех, кто работает над или развертывает крупномасштабный ИИ, этот отчет не только предупреждением. Это руководство. И оно не могло прийти в более срочное время.












