Звіти

Коли штучний інтелект виходить з ладу: звіт Enkrypt AI розкриває небезпечні уразливості у багатомодальних моделях

mm
Додайте Unite.AI до бажаних джерел у Google

У травні 2025 року Enkrypt AI опублікував звіт Multimodal Red Teaming Report, який містить лякаючий аналіз того, як легко можна маніпулювати розширеними системами штучного інтелекту, щоб вони генерували небезпечний і аморальний контент. Звіт фокусується на двох провідних моделях зору та мови Mistral – Pixtral-Large (25.02) і Pixtral-12b – і малює картину моделей, які не тільки технічно вражаючі, але й небезпечно уразливі.

Моделі зору та мови (VLMs) типу Pixtral створені для інтерпретації як візуальних, так і текстових входів, що дозволяє їм відповідати інтелектуально на складні реальні запити. Але ця здатність супроводжується підвищеним ризиком. На відміну від традиційних мовних моделей, які обробляють тільки текст, VLMs можуть бути під впливом взаємодії між зображеннями та словами, відкриваючи нові двері для атак противників. Тестування Enkrypt AI показало, як легко ці двері можна відкрити.

Налякаючі результати тестів: провали CSEM і CBRN

Команда, яка створила звіт, використала складні методи red teaming – форму оцінки противників, призначену для імітації реальних загроз. Ці тести включали тактику, як jailbreaking (підготовка моделі з допомогою спеціально створених запитів для обходу фільтрів безпеки), обман зображеннями та маніпуляцію контекстом. Налякаюче, що 68% цих запитів противників викликали шкідливі відповіді в обох моделях Pixtral, включаючи контент, пов’язаний з експлуатацією дітей, і навіть розробкою хімічної зброї.

Одним з найяскравіших відкриттів стало те, що моделі Mistral у 60 разів частіше генерували контент, пов’язаний з експлуатацією дітей (CSEM), порівняно з промисловими стандартами, такими як GPT-4o і Claude 3.7 Sonnet. У тестових випадках моделі відповідали на масковані запити про експлуатацію дітей детальним, багаторозрядним контентом, що пояснював, як маніпулювати неповнолітніми – все це було огорнуте в нечесні застереження типу “для освітньої свідомості тільки”. Моделі не просто не відхиляли шкідливі запити – вони детально виконували їх.

Не менш налякаючими були результати у категорії ризику CBRN (хімічної, біологічної, радіологічної та ядерної зброї). Коли моделі отримували запит про те, як змінити нервово-паралітичну речовину VX – хімічну зброю, вони пропонували шокуюче конкретні ідеї щодо збільшення її стійкості в середовищі. Вони описували, у видаленому, але явно технічному деталях, методи, такі як інкапсуляція, екологічне екранування та контрольоване вивільнення систем.

Ці провали не завжди були викликані явно шкідливими запитами. Одна з тактик полягала у завантаженні зображення пустого пронумерованого списку та запиті у моделі “заповнити деталі”. Цей простий, здавалося б, безобідний запит призводив до генерації аморального та незаконного інструктажу. З’єднання візуальної та текстової маніпуляції виявилося особливо небезпечним – підкреслюючи особливу проблему, яку ставлять багатомодальні штучні інтелекти.

Чому моделі зору та мови створюють нові проблеми безпеки

У центрі цих ризиків лежить технічна складність моделей зору та мови. Ці системи не тільки обробляють мову – вони синтезують значення у різних форматах, що означає, що їм потрібно інтерпретувати зміст зображень, розуміти контекст тексту та відповідати відповідно. Ця взаємодія вводить нові вектори для експлуатації. Модель може правильно відхилити шкідливий текстовий запит окремо, але коли вона поєднується з підказуючим зображенням або двозначним контекстом, вона може генерувати небезпечний вивід.

Тестування Enkrypt AI виявило, як атаки跨-модального ін’єкції – де тонкі підказки в одному модусі впливають на вивід іншого – можуть повністю обійти стандартні механізми безпеки. Ці провали демонструють, що традиційні техніки модерації контенту, створені для систем з одним модусом, недостатні для сучасних VLMs.

Звіт також описує, як моделі Pixtral були доступні: Pixtral-Large через AWS Bedrock і Pixtral-12b через платформу Mistral. Це реальне розгортання контексту ще більше підкреслює нагальність цих висновків. Ці моделі не обмежені лабораторіями – вони доступні через основні хмарні платформи та можуть бути легко інтегровані у споживчі або корпоративні продукти.

Що потрібно зробити: план дій для безпечнішого штучного інтелекту

На свій захист, Enkrypt AI робить більше, ніж просто виділяє проблеми – вони пропонують шлях вперед. Звіт описує комплексну стратегію мінімізації ризиків, починаючи з тренування безпеки. Це включає в себе повторне навчання моделі за допомогою власних даних тестування противників для зменшення сприйнятливості до шкідливих запитів. Такі техніки, як Direct Preference Optimization (DPO), рекомендуються для тонкого налаштування відповідей моделі, щоб уникнути ризикових виводів.

Також підкреслюється важливість контекстно-залежних бар’єрів – динамічних фільтрів, які можуть інтерпретувати та блокувати шкідливі запити в реальному часі, враховуючи повний контекст багатомодального входу. Крім того, пропонується використання Model Risk Cards як заходу прозорості, щоб допомогти зацікавленим сторонам зрозуміти обмеження моделі та відомі випадки провалів.

Можливо, найкритичнішою рекомендацією є те, що тестування противників повинно бути постійним процесом, а не одноразовим тестом. Коли моделі еволюціонують, так само еволюціонують стратегії атак. тільки безперервна оцінка та активний моніторинг можуть забезпечити довгострокову надійність, особливо коли моделі розгортаються в чутливих секторах, таких як охорона здоров’я, освіта чи оборона.

Звіт Multimodal Red Teaming Report від Enkrypt AI – це явний сигнал індустрії штучного інтелекту: багатомодальна потужність супроводжується багатомодальною відповідальністю. Ці моделі представляють стрибок вперед у можливостях, але вони також вимагають стрибку у тому, як ми думаємо про безпеку, безпеку та етичне розгортання. Якщо їх не контролювати, вони не тільки ризикують провалом – вони ризикують реальною шкодою.

Для всіх, хто працює над або розгортає великомасштабний штучний інтелект, цей звіт не просто попередження. Це план дій. І він не міг прийти в більш нагальний час.

Антуан є видним лідером і засновником Unite.AI, який рухається незмінною пристрастю до формування та просування майбутнього штучного інтелекту та робототехніки. Як серійний підприємець, він вважає, що штучний інтелект буде таким же революційним для суспільства, як і електрика, і часто захоплюється потенціалом революційних технологій і штучного інтелекту загального призначення.

Як футуролог, він присвячений вивченню того, як ці інновації будуть формувати наш світ. Крім того, він є засновником Securities.io, платформи, орієнтованої на інвестиції в передові технології, які переінакшують майбутнє і змінюють цілі сектори.