Лидеры мнений

Почему меры безопасности чат-ботов являются неправильной границей безопасности

mm
Добавьте Unite.AI в избранные источники в Google

Предприятия ИИ давно вышли за рамки стадии доказательства концепции. 23% организаций уже масштабируют агентные системы ИИ где-то в своей компании, и 62% хотя бы экспериментируют с агентами ИИ. Это не исследовательские проекты. Это производственные развертывания, встроенные в рабочие процессы, которые затрагивают кодовые репозитории, данные клиентов, внутренние API и операционную инфраструктуру.

Ответ отрасли на этот рост в основном был сосредоточен на том, что происходит до запуска агента. Поставщики и исследователи вложили энергию в меры безопасности до развертывания: публикацию политик масштабирования, укрепление базовых моделей, фильтрацию входных данных, обеспечение безопасности цепочки поставок ИИ и выравнивание во время обучения. Крупные поставщики ИИ сделали существенные инвестиции в инструменты безопасности для разработчиков, укрепляя центральное предположение: если модель и ее входные данные контролируются, то риски после запуска можно сдержать.

Это разумный инстинкт, но все более неполный.

Промпт не является границей безопасности

Меры безопасности, которые работают на уровне интерфейса модели, в основном приносят пользу командам, которые контролируют код приложения, конфигурацию модели и основную инфраструктуру. Они предлагают гораздо меньше защиты защитникам, которые должны защищать системы ИИ, которые они не построили и не могут изменить. Это значительная слепая зона, и противники уже нашли ее.

Последний отчет об интеллекте угроз OpenAI документирует именно эту динамику. Акторы угроз активно злоупотребляют ChatGPT и подобными инструментами в производственных средах, не изобретая новых методов атак, а встраивая ИИ в существующие рабочие процессы, чтобы работать быстрее. Разведка становится более эффективной. Социальная инженерия масштабируется. Разработка вредоносного ПО ускоряется. Поверхность атаки не изменилась фундаментально; скорость и объем эксплуатации изменились.

Более показательно, как реагировали нападающие, когда эти инструменты оттолкнули их. OpenAI наблюдала, как акторы угроз быстро мутировали свои промпты, сохраняя основную цель, но меняя поверхностные вариации, чтобы обойти фронтальные контроли. Это закономерность, которую практики безопасности видели раньше. Статические защиты, будь то сигнатура антивируса или фильтрация входных данных, не выдерживают против противников, которые итерируются быстрее, чем обновления правил могут следовать.

Проблема усугубляется, когда агенты получают автономию. Современные агенты ИИ не работают в одном обмене. Они выполняют многоступенчатые последовательности действий, вызывая легитимные инструменты и разрешения способами, которые кажутся совершенно нормальными в изоляции. Агент, использующий действительные учетные данные для перечисления внутренних API, не запускает сигнал тревоги. Агент, получающий доступ к чувствительным хранилищам данных во время того, что выглядит как обычный рабочий процесс, не генерирует никаких немедленных сигналов. Каждое отдельное действие проходит проверку; опасность живет в комбинации и последовательности.

Когда угроза перемещается вниз по течению

Команды безопасности, защищающие развертывания ИИ сегодня, сталкиваются с структурным несоответствием. Инструменты, доступные им, в основном построены для рассуждений о том, что модель может сказать. Фактический риск, который им нужно управлять, заключается в том, что делает агент в системах, сетях и идентификаторах после того, как ему были предоставлены разрешения и он был выпущен в производственной среде.

Меры безопасности на основе промпта разделяют фундаментальные слабости более ранних подходов к безопасности, основанных на правилах. Они хрупкие, потому что зависят от предсказания моделей атак заранее. Они реактивные, потому что требуют, чтобы кто-то наблюдал и кодифицировал угрозу до того, как защита сработает. И они отстают от противников, которые приняли итерацию с помощью ИИ в качестве стандартной практики. Защитник, полагающийся на фильтрацию входных данных, чтобы поймать актора угрозы, который использует языковую модель для генерации свежих вариаций промпта, находится в фундаментально проигрышной позиции.

Фактическая уязвимость возникает после развертывания. Действия агентов распространяются по средам способами, которые нельзя полностью предвидеть до запуска. Агенты встречают краевые случаи, взаимодействуют с источниками данных, с которыми они не были разработаны для работы, получают входные данные от систем вне исходной архитектуры и принимают решения, которые накапливаются со временем. Тестирование до запуска – это снимок; производство – это непрерывный поток. Защита только снимка означает принятие того, что все, что происходит в потоке, фактически не контролируется.

Сдвиг границы безопасности к поведению агента

Создание устойчивости ИИ требует другого подхода, и цель должна заключаться не в защите интерфейса модели. Она должна заключаться в обнаружении намерений нападающего через наблюдаемые последствия действий агента. Это существенное различие. Намерение не всегда появляется в том, что говорит агент или какие входные данные он получает.

Обеспечение безопасности систем ИИ должно выходить за рамки проверок на соответствие и оценок прочности для непрерывной оценки того, как агенты ведут себя, когда взаимодействуют с реальными инструментами, реальными API и реальными данными. Статическая оценка на момент развертывания необходима, но недостаточна. Окружающая среда угроз, в которой работает агент, постоянно меняется. Поведение агента необходимо контролировать с той же непрерывностью.

Это проблема, которую нельзя решить с помощью укрепления промпта. Обнаружение злонамеренного намерения, когда оно возникает через последовательности действий, требует моделей, способных понимать сложное, последовательное поведение в операционных средах. Модели глубокого обучения, предназначенные для анализа поведения, могут делать это способами, которые системы, основанные на правилах, и традиционное инструментирование SIEM не могут. Они учатся, что такое нормальное поведение во всей контексте активности агента, и обнаруживают отклонения, которые указывают на то, что что-то изменилось, даже когда никое отдельное действие не запускает традиционный сигнал.

Подlying логика сохраняется независимо от контекста развертывания: безопасность, закрепленная на уровне промпта, последовательно проиграет нападающим, действующим на уровне действий. Защита должна переместиться туда, где фактически живет угроза.

Что должны делать команды безопасности сейчас

Для лидеров безопасности, пытающихся опередить это, несколько практических сдвигов могут закрыть разрыв между текущим положением защит и тем, где им нужно быть.

Оцените безопасность ИИ во всей структуре приложения. Базовая модель – это один слой. Не менее важным является то, как агенты ведут себя после развертывания в производство, какие инструменты они вызывают, какие разрешения они используют и как эти выборы меняются со временем. Оценки безопасности, которые останавливаются на границе модели, оставляют операционную поверхность в значительной степени неисследованной.

Применяйте принцип наименьших привилегий на уровне агента. Агенты ИИ должны иметь доступ только к инструментам, API и данным, необходимым для их назначенной функции. Это ограничение важно даже тогда, когда выходные данные агента кажутся безобидными. Ограничение объема снижает радиус действия скомпрометированного агента и создает более четкие поведенческие базовые показатели, которые делают обнаружение аномалий более эффективным.

Относитесь к агентам как к идентификаторам, которые генерируют телеметрию. Каждое действие, которое выполняет агент, является данным. Команды безопасности должны строить логические правила обнаружения вокруг цепочек действий, инициированных агентом, а не только промптов, которые предшествуют им. Этот сдвиг меняет мониторинг с того, что кто-то попросил агента сделать, на то, что агент фактически сделал, где намерение нападающего становится видимым.

Инвестируйте в непрерывный поведенческий мониторинг с моделями обнаружения, предназначенными специально для этой задачи. Обнаружение злонамеренного намерения, когда оно возникает через последовательности действий, требует специализированной возможности. Конвенциональные инструменты мониторинга были построены для моделей активности, сгенерированных человеком. Поведение агента, с его скоростью, объемом и многоступенчатой структурой, требует инфраструктуры обнаружения, разработанной с учетом этого контекста.

Приоритизируйте коллективную оборону. Техники атак с помощью ИИ развиваются быстрее, чем любая отдельная организация может отслеживать. Совместные исследования, открытая сотрудничество и обмен информацией о угрозах являются неопциональными дополнениями к стратегии безопасности ИИ; они являются основными входами. Защитники, которые остаются актуальными, – это те, кто вносит вклад в и использует коллективные знания.

Поведенческая безопасность действительно дает результат

Для команд безопасности, которые делают этот сдвиг, операционная отдача является конкретной. Закрепление обнаружения в поведении агента, а не в выходных данных модели, позволяет ранее выявлять злонамеренные намерения, даже когда атаки являются скрытными, адаптивными или зашифрованными. Нападающие, которые успешно мутируют свои промпты мимо фильтров входных данных, все равно должны действовать. Эти действия оставляют следы. Обнаружение поведения находит эти следы до того, как ущерб распространится.

Возможно, наиболее значимо, что этот подход дает организациям достоверный путь к развертыванию агентов ИИ в масштабе без принятия пропорционального риска безопасности. Вопрос, который держит многие предприятия назад, не в том, могут ли агенты ИИ доставить ценность; это в том, могут ли они быть развернуты с достаточной уверенностью, что постур безопасности не ухудшается по мере роста развертывания. Поведенческая безопасность, основанная на том, как агенты фактически работают, а не на входных данных, которые они получают, обеспечивает эту уверенность способом, который контроли на основе промпта не может.

Граница безопасности была проведена не в том месте, и эта ошибка имела смысл, когда ИИ был инструментом, который ждал входных данных. Он больше не ждет. Агентные системы действуют, связываются, эскалируют и накапливаются по средам, которых никто не предвидел до развертывания. Организации, которые признают это раньше, будут теми, кто фактически масштабирует ИИ с уверенностью. Все остальные будут тратить следующие несколько лет на обнаружение, нарушение за нарушением, что контроль над тем, что говорит модель, никогда не был тем же, что и контроль над тем, что она делает.

Mayank Kumar - основатель и ведущий инженер по ИИ в компании DeepTempo, где он руководит разработкой фундаментальной модели языка журналов (LogLM). Обладая сильной академической и исследовательской базой в области генеративного и многомодального ИИ, он привносит специализированные знания в создание моделей, специфичных для определенных областей, которые улучшают обнаружение и реагирование на угрозы в кибербезопасности.