Лидеры мнений

Скрытая угроза агентов ИИ требует новой модели безопасности

mm
Добавьте Unite.AI в избранные источники в Google

Системы агентского ИИ стали мейнстримом за последний год. Они используются для различных функций, включая аутентификацию пользователей, передачу капитала, запуск рабочих процессов соблюдения нормативных требований и координацию в средах предприятий с минимальным человеческим надзором.

Однако возникает более тихая проблема с увеличением автономности, не на уровне подсказок или политик, а на уровне доверия к инфраструктуре. Агентские системы получают внутреннюю власть, продолжая работать в вычислительных средах, которые никогда не были разработаны для защиты автономных принимающих решения от инфраструктуры под ними.

Традиционная безопасность предполагает, что программное обеспечение является пассивным, но агентские системы не являются таковыми. Они рассуждают, запоминают и действуют непрерывно, автономно и с делегированной властью.

Не стоит забывать, что агенты ИИ, скорее всего, будут иметь доступ к личным данным, основанным на их случае использования, таким как электронные письма и записи звонков, среди прочего.

Кроме того, хотя аппаратные средства защиты, такие как конфиденциальные виртуальные машины и безопасные анклавы, существуют, они еще не являются стандартной основой для большинства развертываний агентского ИИ. В результате многие агенты по-прежнему выполняются в средах, где чувствительные данные подвергаются воздействию основной инфраструктуры во время выполнения.

Агенты – внутренние, а не инструменты

Команды безопасности уже знают, насколько сложно сдерживать внутренние угрозы, вопрос, подчеркнутый в отчете Verizon 2025 года о нарушении данных, который показывает, что вторжение в систему было ответственным за более 53% подтвержденных нарушений в прошлом году. В 22% этих случаев злоумышленники использовали украденные учетные данные для получения доступа, что подчеркивает, насколько часто они успешно используют законные идентификаторы вместо использования технических уязвимостей.

Теперь рассмотрим агента, который состоит из логических подсказок, инструментов и плагинов, учетных данных, а также политик. Не только он может запускать код и просматривать веб-страницы, но и запрашивать CRM, читать электронные письма и отправлять тикеты, среди многих других вещей. То, что сочетание функций принесло, – это традиционные поверхности атаки в современный интерфейс.

Опасность, исходящая от таких внутренних угроз, не является спекулятивной. Проект Open Web Application Security (OWASP) теперь перечисляет “внедрение подсказки” в качестве критической уязвимости для приложений LLM, отмечая его особую опасность для агентских систем, которые объединяют действия. Команда Threat Intelligence Microsoft также опубликовала рекомендации, предупреждающие, что системы ИИ с доступом к инструментам могут быть подвергнуты воздействию для выполнения кражи данных, если меры безопасности не будут архитектурно обеспечены.

Эти отчеты предоставляют своевременное напоминание о том, что агенты, имеющие законный доступ к системам и данным, могут быть обращены против их владельцев. Однако ландшафт рисков для агентских систем не является единичным. Угрозы на уровне приложения, такие как внедрение подсказки и злоупотребление инструментами, возникают из-за неспособности модели различать доверенные инструкции и ввод пользователя, конструктивного ограничения, которое никакое количество укрепления памяти не может исправить.

Другая и не менее важная проблема существует на уровне инфраструктуры: некоторые агенты выполняются в открытом тексте памяти, что означает, что чувствительная информация, такая как истории чатов, ответы API и документы, может быть видна во время обработки и может остаться доступной позже. OWASP идентифицирует этот риск как раскрытие чувствительной информации (LLM02) и утечку системных подсказок (LLM07) и предлагает использовать контекстную изоляцию, сегментацию пространства имен и sandboxing памяти в качестве важных мер безопасности.

Поэтому пользователи не должны рассматривать эти агенты как простые приложения, учитывая, что они являются динамическими, рассуждающими исполнителями, требующими модели безопасности, которая учитывает их уникальную природу как нечеловеческих сущностей с властью. Этот подход должен включать как программные средства контроля для ограничения действий модели, так и аппаратные средства защиты для сохранения безопасности данных во время их использования.

Архитектура доверия имеет критический недостаток

Текущие практики безопасности фокусируются на защите данных в состоянии покоя и при передаче. Последний рубеж, данные в использовании, остается почти полностью открытым. Когда агент ИИ рассуждает над конфиденциальным набором данных для одобрения кредита, анализа медицинских записей или выполнения сделки, эти данные обычно расшифровываются и обрабатываются в открытом тексте внутри памяти сервера.

В стандартных облачных моделях любой, кто имеет достаточный контроль над инфраструктурой, включая администраторов гипервизора или атакующих-соседей, потенциально может заглянуть в то, что происходит во время выполнения рабочей нагрузки. Для агентов ИИ это воздействие особенно опасно, поскольку им необходимо доступ к чувствительной информации для выполнения своих задач, что потенциально может стать поверхностью атаки.

Как продемонстрировала Lumia Security, атакующие с доступом к локальной машине могут получить JWT и сеансовые ключи直接 из памяти процесса приложений ChatGPT, Claude и Copilot для настольных компьютеров. Эти украденные учетные данные могут позволить им притворяться другим пользователем, украсть историю разговора и внедрить подсказки в текущие сессии, которые могут изменить поведение агента или внедрить ложные воспоминания.

Примером этого может служить инцидент с сбросом памяти AWS CodeBuild в июле 2025 года. Атакующие тайно добавили вредоносный код в проект, и когда система запустила его, код заглянул в память компьютера и украл скрытые токены входа, хранящиеся там. С помощью этих токенов атакующие могли изменить код проекта и потенциально получить доступ к другим системам.

Для финансовых учреждений скрытное манипулирование является существенным. Банки, страховые компании и инвестиционные фирмы уже поглощают средние затраты на нарушение данных более 10 миллионов долларов, и они понимают, что целостность имеет значение так же, как и конфиденциальность. Согласно недавнему отчету Informatica, “парадокс доверия” был объяснен следующим образом: организации развертывают автономные агенты быстрее, чем могут проверить их выводы. Результатом является автоматизация, которая может внедрить ошибки или предвзятость непосредственно в основные процессы, работающие на скорости машины.

Конфиденциальное вычисление и случай изоляции

Постепенные исправления не решат проблему, хотя более строгие меры контроля доступа и лучший мониторинг могут помочь. Однако ни один из них не может изменить основную проблему. Проблема является архитектурной, и пока вычисления происходят в открытой памяти, агенты будут уязвимы в момент, когда они имеют наибольшее значение, который является рассуждением.

Конфиденциальное вычисление, определенное Консорциумом конфиденциального вычисления (CCC) как защита данных в использовании с помощью аппаратных доверенных сред выполнения (TEE), напрямую решает основной недостаток.

Для агентов ИИ это аппаратное изоляция является трансформационной, поскольку она позволяет учетным данным агента, его весам модели, проприетарным подсказкам и чувствительным данным пользователя, которые он обрабатывает, оставаться зашифрованными не только на диске или по сети, но и активно в памяти во время выполнения. Разделение окончательно разрывает традиционную модель, в которой контроль над инфраструктурой гарантирует контроль над рабочей нагрузкой.

Удаленная аттестация предоставляет верифицирующие криптографические доказательства того, что конкретный запрос на вывод был выполнен внутри аппаратной доверенной среды выполнения, будь то CPU или GPU. Доказательство генерируется из аппаратных измерений и доставляется вместе с ответом, позволяя независимую верификацию того, где и как выполнялась рабочая нагрузка.

Записи аттестации не раскрывают код, который был выполнен. Вместо этого каждая рабочая нагрузка связана с уникальным идентификатором рабочей нагрузки или идентификатором транзакции, и запись аттестации TEE связана с этим идентификатором. Аттестация подтверждает, что вычисление было выполнено внутри доверенной среды без раскрытия ее содержимого.

Настройка создает новую основу для соблюдения и аудитability, позволяя связать действия агента с конкретной версией кода, которая была аттестирована, и известным набором входных данных.

К ответственной автономии

Последствия для описанной выше системы распространяются за пределы базовой безопасности. Рассмотрите законы, регулирующие финансы, здравоохранение и личную информацию. Многие юрисдикции применяют правила суверенитета данных, которые ограничивают, где может быть обработана информация. В Китае Закон о защите личной информации и Закон о безопасности данных требуют, чтобы определенные категории данных, важные личные данные, например, хранились внутри страны и проверялись перед передачей за рубеж.

Аналогично, несколько стран Персидского залива, таких как ОАЭ и Саудовская Аравия, приняли аналогичные подходы, особенно для финансовых, государственных и критически важных инфраструктурных данных.

Конфиденциальное вычисление может укрепить безопасность и аудитability, защищая данные во время их обработки и позволяя аттестацию среды выполнения. Однако оно не меняет, где происходит обработка. Где правила суверенитета данных требуют местной обработки или налагают условия на трансграничные передачи, доверенные среды выполнения могут поддерживать механизмы соблюдения, а не заменять юридические требования.

Кроме того, конфиденциальное вычисление позволяет безопасно сотрудничать в многоагентных системах, где агенты из разных организаций или внутри разных отделов часто должны делиться информацией или проверять выводы без раскрытия проприетарных данных.

И когда эта технология сочетается с архитектурой нулевого доверия, результатом является гораздо более прочная основа. Нулевое доверие непрерывно проверяет идентификацию и доступ, в то время как конфиденциальное вычисление защищает память аппаратуры от несанкционированного извлечения и предотвращает восстановление чувствительной информации в открытом тексте.

Вместе они защищают то, что действительно имеет значение, например, логические рассуждения, чувствительные входные данные и криптографические ключи, которые авторизуют действия.

Новая базовая линия для автономных систем

Если каждое взаимодействие подвергает людей риску раскрытия, они не позволят ИИ заниматься такими вещами, как медицинские записи или принятием финансовых решений. Аналогично, компании не будут автоматизировать свои наиболее важные задачи, если это может привести к регулирующим проблемам или потере важных данных.

Серьезные разработчики признают, что исправления на уровне приложения сами по себе являются недостаточными в средах с высокими гарантиями.

Когда агенты наделяются финансовой властью, регулируемыми данными или межорганизационной координацией, инфраструктурное воздействие становится более чем теоретической проблемой. И без конфиденциального выполнения в таких контекстах многие агенты остаются мягкой целью, с их ключами, которые можно украсть, и их логикой, которая может быть изменена. Размер современных нарушений показывает точно, куда ведет этот путь.

Конфиденциальность и целостность не являются необязательными функциями, которые можно добавить после развертывания. Они должны быть архитектурно обеспечены с самого начала. Следовательно, для того чтобы агентский ИИ мог масштабироваться безопасно, аппаратная конфиденциальность не может быть рассмотрена как простое конкурентное преимущество, а как базовую линию.

Ахмад Шадид является основателем фонда O, швейцарской исследовательской лаборатории искусственного интеллекта, ориентированной на создание и исследование частной инфраструктуры ИИ, o.capital, квант-фонда, торгующего на Nasdaq, и основателем и бывшим генеральным директором io.net, в настоящее время крупнейшей децентрализованной сети вычислительной инфраструктуры ИИ на основе Solana.