Интервью
Бо Ли, генеральный директор Virtue AI – Интервью

Бо Ли, генеральный директор Virtue AI, является известным исследователем и предпринимателем, специализирующимся на безопасности и защите систем искусственного интеллекта. Она возглавляет Virtue AI, а также является профессором Университета Иллинойса в Урбане-Шампейне, где ее исследования сосредоточены на безопасности машинного обучения, надежном ИИ и устойчивости к атакам. Ее карьера охватывает как академию, так и промышленность, что позволяет ей переводить передовые исследования ИИ в практические применения, которые помогают организациям создавать более безопасные и устойчивые технологии ИИ.
Virtue AI – это компания, которая фокусируется на защите и управлении системами ИИ, используемыми в корпоративных средах. Ее платформа предоставляет возможности, такие как автоматическое тестирование на проникновение, реальные ограничители и непрерывный мониторинг для выявления уязвимостей, таких как инъекция запросов, галлюцинации и утечка данных. Интегрируясь напрямую в процессы разработки и развертывания ИИ, компания помогает организациям безопасно масштабировать использование крупных языковых моделей и приложений ИИ, сохраняя при этом высокие стандарты безопасности и управления.
Что мотивировало вас перейти от чисто академической карьеры к основанию и руководству Virtue AI, и какую проблему вы чувствовали, что промышленность не решала в достаточной степени?
Традиционные инструменты безопасности были разработаны для предсказуемых приложений с фиксированными путями. Они никогда не были предназначены для систем, которые рассуждают, адаптируются и действуют автономно. Мои сооснователи и я увидели пробел между тем, что фундаментальные исследования безопасности ИИ произвели, и тем, что у предприятий на самом деле было доступно. Исследования существовали. Производственная реальность не существовала. Это то, что мы решили изменить.
Virtue AI фокусируется на безопасности, безопасности и соблюдении требований для крупных языковых моделей и автономных агентов. Какую из этих областей вы считаете, что предприятия недооценивают больше всего сегодня?
Предприятия понимают все эти области в некоторой степени, особенно безопасность, но все еще существует большая разница.
Предприятия начали серьезно относиться к безопасности моделей, по крайней мере на поверхностном уровне. Но агенты – это другая проблема. Им предоставляется доступ к наиболее чувствительным частям инфраструктуры предприятия: выполнение кода, вызовы API, просмотр веб-страниц и принятие цепных решений, которые затрагивают данные, финансы и операции. Большинство команд безопасности не подготовлены к рассуждениям о такой системе. Инструменты, которые у них есть, не были разработаны для этого.
Риск не является теоретическим. Безопасность, специально разработанная для агентных систем, без нее небольшие сбои быстро накапливаются. Агент, который уже выполнил плохой вызов API или экспонировал данные, не ждал, пока ваша система журналирования догонит.
Непрерывное тестирование на проникновение является центральным в подходе Virtue AI. Какие виды сбоев или рисков обычно выявляются только после того, как системы уже запущены в производстве?
Большинство серьезных.
В контролируемой среде вы тестируете модель и агентов. В производстве вы тестируете систему – и это разные вещи. Как только модель подключена к инструментам, трубопроводам извлечения данных, вводам пользователей и другим агентам, пространство поведения расширяется способами, которые тестирование до развертывания не может захватить. “Безопасно настроенный” агент может действовать очень по-разному, когда он подключен к реальным базам данных, новым серверам или другим агентам. Система становится недетерминированной. Она начинает принимать решения на основе контекста, который не существовал во время оценки.
Это когда вы обнаруживаете сбои, которые действительно имеют значение.
Как вы думаете о измерении “безопасности ИИ” на практике, особенно когда системы эволюционируют через тонкую настройку, извлечение и использование инструментов?
На практике безопасность ИИ не может быть измерена с помощью одного статического эталона, поскольку современные системы ИИ непрерывно эволюционируют через тонкую настройку, дополнение извлечения и взаимодействие с инструментами или агентами. Вместо этого безопасность должна быть оценена как системное свойство на протяжении всего жизненного цикла приложения ИИ. Это включает в себя стресс-тестирование моделей и агентов с помощью различных атак тестирования на проникновение, мониторинг реального поведения, такого как запросы, вызовы инструментов и действия, и оценку результатов по определенным политикам риска (например, злоупотребление, галлюцинации, утечка данных или несанкционированные действия).
Например, наша премированная статья (Лучшая статья в Национальном агентстве безопасности и NeurIPS), DecodingTrust, обеспечила комплексное тестирование безопасности и безопасности для фундаментальных моделей. Наша платформа DecodingTrust-Agent построила реалистичный симулятор агентов, который размещает различные среды с родными агентами тестирования на проникновение для выполнения динамического, адаптивного и непрерывного тестирования на проникновение.
Важно отметить, что измерение безопасности должно быть непрерывным и адаптивным, поскольку обновления запросов, источников извлечения или инструментов могут ввести новые уязвимости. На практике это означает сочетание автоматического тестирования на проникновение, ограничений во время выполнения и наблюдаемости для измерения не только реакций модели, но и безопасности всей системы ИИ, работающей в реальном мире.
Ваш исследовательский фон охватывает устойчивость, конфиденциальность и атакуемость. Какая из этих областей оказалась наиболее трудной для перевода в реальные оборонительные меры?
Перевод исследования устойчивости, конфиденциальности и атакуемости в реальные оборонительные меры на самом деле очень осуществим. Фактически, многие направлений исследований в моей группе напрямую вдохновлены практическими проблемами безопасности, наблюдаемыми в развернутых системах ИИ. Реальная трудность заключается не в построении оборонительных мер, а в обеспечении надежных гарантий безопасности в динамичных реальных средах.
В академических исследованиях наша группа добилась значительного прогресса, такого как сертифицированная устойчивость и гарантии конфиденциальности, но эти результаты обычно полагаются на предположения, которые могут не полностью соответствовать сложным производственным системам. Современные приложения ИИ непрерывно эволюционируют через новые данные, тонкую настройку, трубопроводы извлечения и интеграцию инструментов, что может ввести новые уязвимости со временем.
В результате эффективная безопасность ИИ не может полагаться на одноразовую защиту – она требует непрерывного тестирования на проникновение, обнаружения рисков и адаптивных ограничений, которые эволюционируют вместе с системой. Это именно философия Virtue AI: сочетание нашего долгосрочного исследования безопасности ИИ с автоматическим крупномасштабным тестированием на проникновение и реальным временем защиты для непрерывного выявления возникающих рисков и обновления оборонительных мер, обеспечивая практическую и масштабируемую безопасность для реальных систем ИИ.
Что делает обеспечение безопасности автономных агентов ИИ фундаментально другим, чем обеспечение безопасности традиционного программного обеспечения или даже чат-ботов?
Агенты не являются статическими программами. Они не следуют предсказуемым путям и не остаются в пределах периметра, который вы нарисовали для них при развертывании.
Традиционная безопасность предполагает фиксированные пути выполнения, стабильные API и детерминированное поведение. Автономные агенты нарушают все эти предположения. Они рассуждают о том, что делать дальше, выбирают инструменты на основе контекста и производят эффекты в нескольких системах за один раз.
Вы не можете сканировать запрос, укрепить модель или отслеживать один вызов API и считать работу выполненной. Вам необходимо обеспечить безопасность агента как полной системы – его рассуждения, использования инструментов, среды и того, что происходит после этого.
Это основная проблема, которую не могут решить точки контроля. Они не были разработаны для этого.
Где существующие инструменты безопасности не справляются, когда агенты могут действовать во многих системах, инструментах и источниках данных одновременно?
Они оставляют вас слепым к тому, как агент фактически действовал в целом.
Большинство инструментов были разработаны для приложений с четкими периметрами и стабильным поведением. Они могут рассказать вам, как выглядит один вызов API. Они не могут рассказать вам, как агент рассуждал о пяти вызовах инструментов, чтобы произвести результат, которого никто не намеревался.
Пробел видимости – это проблема. Если вы не можете увидеть полную цепочку действий и решений, вы не можете управлять ею и не можете проверить после этого.
Как реальные ограничители снижают риск по сравнению с мониторингом или журналированием в одиночку?
Журналирование рассказывает вам, что пошло не так после того, как ущерб уже нанесен. Это полезно для судебной экспертизы и соблюдения требований, но оно не останавливает ничего.
С автономными агентами задержка между действием и обнаружением может быть действительно дорогостоящей. Агент, который уже выполнил плохой вызов API или экспонировал данные, не ждал, пока ваша система журналирования догонит.
Реальные ограничители перехватывают действие до его выполнения. Если агент попытается сделать что-то, не соответствующее политике, оно блокируется или помечается до выполнения, а не после.
Сочетание также имеет значение. Реальное предотвращение плюс единая последовательная точка принудительного выполнения через все взаимодействия агента с инструментами – это другой профиль риска, чем пассивный мониторинг отдельных компонентов.
Virtue AI была основана глубоко техническими исследователями. Как это формирует решения о продуктах по сравнению с более коммерчески ориентированными стартапами ИИ?
Безопасность и управление ИИ фундаментально является глубокой технической проблемой. Системы, которые мы защищаем, такие как крупные языковые модели, многомодальные модели и агентные системы, сами построены на передовых исследованиях. Без сильной основы в области безопасности ИИ невозможно разработать эффективные решения безопасности для них.
В многих случаях самая большая проблема в безопасности ИИ заключается в том, когда продвинутый алгоритм тестирования на проникновение выявляет уязвимости агентов ИИ в исследовательской статье – как перевести этот инсайт в защиту, готовую к производству, которая может надежно защитить реальные системы в масштабе? В Virtue AI закрытие этого разрыва между исследованиями и развертыванием является核心 того, как мы работаем и что мы имеем опыт.
Поскольку Virtue AI была основана исследователями, которые провели десятилетия, работая над устойчивостью ИИ, обучением с противодействием и надежным ИИ, наши исследовательские и инженерные команды работают над одними и теми же проблемами одновременно. Наши исследователи постоянно изучают новые архитектуры моделей, агентные рабочие процессы и эволюционирующие методы атак, в то время как наши инженерные команды интегрируют эти идеи напрямую в производственные системы.
Когда мы выявляем новую уязвимость – например, новый шаблон инъекции запроса или стратегию манипулирования агентом – она может быстро быть переведена в новые модели обнаружения, ограничители или стратегии тестирования на проникновение. Это происходит непрерывно, а не только на квартальном продукте.
В результате наши продукты остаются как передовыми, так и готовыми к производству, помогая организациям защищать свои системы ИИ, когда они их строят и развертывают. Многие из наших клиентов говорят нам, что именно этот исследовательский подход позволяет им двигаться быстрее, сохраняя при этом безопасность и соблюдение требований.
Напротив, чисто коммерчески ориентированные команды часто оптимизируют то, о чем клиенты просят сегодня, что может привести к инкрементальным функциям, но может отставать от быстро эволюционирующего ландшафта угроз систем ИИ. В безопасности ИИ угрозы эволюционируют так же быстро, как и сама технология. Основание, ориентированное на исследования, позволяет нам предвидеть новые риски раньше и строить защиты до того, как они станут широко распространенными проблемами.
Какое самое распространенное заблуждение у предприятий о безопасности ИИ, когда они впервые приходят в Virtue AI?
Одним из наиболее распространенных заблуждений у предприятий, когда они впервые приходят в Virtue AI, является то, что безопасность ИИ может быть решена просто применением традиционных инструментов кибербезопасности или основных фильтров модерации контента.
На самом деле системы ИИ вводят совершенно новые поверхности угроз, такие как инъекция запросов, побеги, галлюцинации, обусловленные злоупотреблением, утечка данных через системы извлечения и манипулирование агентами через инструменты или внешние API. Эти риски возникают из поведения и рассуждений модели самих по себе, а не только из окружающей инфраструктуры.
В результате защита систем ИИ требует механизмов безопасности, которые понимают модель ИИ и агентов, входные, выходные и процессы принятия решений на протяжении всего жизненного цикла приложения ИИ, что требует фундаментальных исследовательских возможностей в области ИИ.
Это почему мы подчеркиваем родную для ИИ безопасность: сочетание автоматического тестирования на проникновение для выявления уязвимостей, реальных ограничений для принудительного выполнения политики и системной наблюдаемости для мониторинга запросов, вызовов инструментов и действий агентов.
Как только предприятия видят, насколько риски ИИ отличаются от традиционных рисков программного обеспечения, они быстро понимают, что защита ИИ требует фундаментально новой стека безопасности.
Наконец, что означает “ответственное развертывание ИИ” для вас на практике – не в теории, а внутри предприятия, которое отправляет продукты сегодня?
Быстрее и безопаснее не являются противоположностями, хотя большинство предприятий считают их так. Предположение заключается в том, что серьезная безопасность замедляет вас – больше циклов проверки, больше ворот, больше трения перед тем, как что-то отправляется.
На практике предприятия, которые развертывают агентов с уверенностью, являются теми, кто строит безопасность в процесс, а не прикрепляет ее в конце: автоматическое тестирование на проникновение до развертывания, реальные ограничители, когда агент уже активен, и централизованная видимость на протяжении всего жизненного цикла агента.
Это не упражнение по соблюдению требований. Это то, что действительно позволяет вам двигаться быстро, потому что вы не обнаруживаете в производстве то, что должны были поймать раньше.
Ответственное развертывание, в конкретных терминах, означает, что вы знаете, что могут сделать ваши агенты, вы можете видеть, что они делают, и вы можете остановить их, когда что-то идет не так.
Ответственное развитие ИИ позволяет непрерывному, крупномасштабному развертыванию систем ИИ с уверенностью, а не замедляет инновации ИИ.
Спасибо за отличное интервью, читатели, которые хотят узнать больше, должны посетить Virtue AI.












