Лидеры мнений

Почему компании ИИ спешат признавать уязвимости в безопасности

mm
Добавьте Unite.AI в избранные источники в Google

В почти любой другой отрасли фраза «наш продукт проник в системы другой компании» — это тот тип инцидента, который организация будет изо всех сил пытаться замолчать. Однако по мере того как ИИ стремительно развивается, его сбои в безопасности становятся регулярными заголовками, и компании теперь объясняют непреднамеренную деятельность ИИ в тщательно подготовленных блог‑постах.

Это растущее ощущение рутины должно служить тревожным сигналом для бизнес‑лидеров.

По мере того как модели ИИ становятся более способными, более автономными и глубже интегрируются в бизнес‑операции, раскрытие информации превратилось в одну из самых ценных валют отрасли. Компании понимают, что клиенты не могут самостоятельно проверять каждое заявление о безопасности продвинутой модели, поэтому признание провала сигнализирует о том, что организация будет публично исследовать свои ошибки. Но прозрачность не есть подотчётность. Раскрытие никогда не может заменить профилактику, которая станет ещё более критичной по мере созревания моделей ИИ.

Когда одно раскрытие провоцирует следующее

За последние несколько недель паттерн стал очевидным. Модели, оцениваемые OpenAI, получили непреднамеренный доступ к живым системам, включая производственную инфраструктуру Hugging Face. OpenAI определила собственного агента как ответственного и раскрыла инцидент. Это признание подтолкнуло Anthropic к изучить более 141 000 запусков оценок, выявив три случая, когда модели Claude получили доступ к интернету и нарушили производственные системы трёх организаций. 

Затем последовала Meta, которая не начала с публичного обзора. Пресса первой сообщила об инциденте, и только после этого Meta подтвердила, что ошибка конфигурации во время внешнего тестирования позволила одной из её моделей выйти в интернет и воспользоваться уязвимостью в сервисе третьей стороны. Meta заявила, что проводит расследование и позже поделится дополнительной информацией.

Эти инциденты не были одинаковыми, и модели работали в необычных условиях оценки. В некоторых случаях обычные средства защиты были уменьшены или отключены, чтобы измерить чистые кибервозможности. Но более широкое урок труднее отвергнуть: всё более автономные системы вышли за границы, которые их операторы считали установленными.

Прозрачность может стать конкурентным преимуществом (или может?)

Щедрая интерпретация состоит в том, что компании, работающие в сфере ИИ, развивают зрелую культуру раскрытия информации. Кибербезопасность десятилетиями училась тому, что секретность часто усугубляет ущерб. Организации, которые быстро сообщают об инцидентах, объясняют, что произошло, и помогают другим учиться, обычно завоевывают больше доверия, чем те, кто умалчивает или откладывает сообщение. 

Раскрытие Anthropic продемонстрировало, как это выглядит. Оно описало масштаб своего обзора, признало собственные ошибки, связалось с пострадавшими организациями и изложило планируемые изменения контроля. Компания подходила к исправлениям так, будто ответственность лежит только на ней, хотя конфигурация тестирования сторонней организации также сыграла роль. Продуктивное раскрытие не требует притворяться, что одна организация вызвала каждый сбой. Оно требует принятия ответственности за те контроли, которые находятся в вашей сфере влияния.

Признание может сделать больше, чем построить доверие

Тем не менее раскрытие никогда не бывает полностью альтруистичным. Публичное признание может выполнять несколько стратегических задач одновременно.

Во‑первых, оно может продемонстрировать возможности. «Наша модель вышла за пределы теста и скомпрометировала реальную систему» — тревожное признание, но также служит доказательством того, что модель обладает необычной мощью. Инцидент становится, намеренно или нет, демонстрацией продукта.

Во‑вторых, оно позволяет компании сформировать повествование до того, как регуляторы, клиенты или журналисты сделают это за неё. Организация определяет терминологию, объясняет условия тестирования и формирует представление о решении.

В‑третьих, повторяющиеся раскрытия могут привести к нормализации такого поведения. Если каждая крупная лаборатория ИИ сообщает, что агент пересёк границу и скомпрометировал живую систему, отрасль может начать воспринимать такое поведение как неизбежный побочный эффект прогресса.

Это не может стать нормой. CISOs, с которыми я разговариваю, хотят знать, почему превентивные контроли не остановили действие. Они спрашивают, кто разрешил доступ модели, какие границы были установлены, как контролировались её действия и мог ли кто‑нибудь остановить её до того, как она достигла третьей стороны. Это вопросы подотчётности, а не коммуникационные вопросы.

Раскрытие — начало подотчётности

Кибербезопасность уже поняла, что объявление об инциденте не равно его обработке. Достоверное раскрытие объясняет, что произошло, кто пострадал, как реагирующие сдержали ситуацию, какие контроли не сработали и что предотвратит аналогичную активность в следующий раз.

Для агентов ИИ этот стандарт должен быть более строгим. Агенты не следуют предсказуемым путям. Они рассуждают, выбирают инструменты и адаптируются к контексту. Законная цель не гарантирует, что каждый шаг к ней законен. Организациям нужны превентивные контроли, регулирующие, к чему агент может получить доступ, какие инструменты он может вызвать и какие действия выполнять, а также непрерывный мониторинг реальных действий агента.

Эта работа должна начаться до развертывания. Руководители должны требовать моделирование угроз для агентных рабочих процессов, доступ с минимальными привилегиями, явные ограничения внешней связности, независимую проверку тестовых окружений, реал‑тайм принудительное применение политик и чёткие точки человеческого вмешательства. Нельзя добавить профилактику после первого публичного инцидента.

Руководителям следует сейчас решить, что будет дальше

Каждый бизнес, внедряющий агентов ИИ, в конечном итоге может столкнуться со своей версией этого момента. Организация может обнаружить, что агент получил доступ к информации, к которой не должен был, действовал за пределами своих полномочий или неожиданно достиг внешней системы.

Сейчас решите, что вы будете раскрывать, кому и при каких условиях. Ещё важнее определить подотчётность, сопутствующую этому. Кто несёт ответственность за действия агента? Кто может ограничить его доступ? Какие доказательства вы сохраните? Какой контроль вы добавите до того, как система снова будет онлайн?

Спешка в публикации провалов ИИ может сигнализировать о более здоровой и открытой отрасли. Но признание не может быть всей историей.

Доверие не строится лишь на признании. Оно строится на контролях, которые должны были предотвратить инцидент, на действиях, предпринятых сразу же после него, и на доказательствах того, что тот же сбой просто не повторится.

Адам Эли — генеральный менеджер AI Agent Security в Check Point, где он руководит командой AI Security. До этой должности мистер Эли работал CISO в Fidelity Investments, а затем возглавил цифровое подразделение Fidelity, включая группы AI‑продукт & COE.

Он также занимал должности, включая заместителя CISO и CISO eCommerce в Walmart, соучредил Bluebox Security, приобретённую в 2016 году, и занимал аналогичные позиции в Salesforce и The Walt Disney Company.

В дополнение к этим ролям мистер Эли входил в совет директоров финтех‑компании Akoya и ранее преподавал курс Enterprise Risk Management в Колумбийском университете.