Інтерв’ю
Бо Лі, генеральний директор Virtue AI – Серія інтерв’ю

Бо Лі, генеральний директор Virtue AI, є відомим дослідником і підприємцем, який спеціалізується на безпеці та безпеці штучного інтелекту. Він очолює Virtue AI, а також є професором Університету Іллінойсу в Урбані-Шампейні, де його дослідження зосереджені на безпеці машинного навчання, довірчих штучних інтелектів та адверсарній стійкості. Його кар’єра охоплює як академію, так і промисловість, що дозволяє йому перекладати передові дослідження штучного інтелекту у практичні застосування, які допомагають організаціям створювати безпечніші та більш стійкі технології штучного інтелекту.
Virtue AI – це компанія, яка зосереджена на захисті та управлінні системами штучного інтелекту, які використовуються в корпоративних середовищах. Її платформа забезпечує можливості, такі як автоматизоване червоне командування, реальні перилі, та безперервний моніторинг для виявлення уразливостей, таких як ін’єкція запиту, галюцинації та витік даних. Інтегруючи безпосередньо в процеси розробки та розгортання штучного інтелекту, компанія допомагає організаціям безпечно розширювати використання великих мовних моделей та застосунків, що працюють на штучному інтелекті, зберігаючи при цьому високі стандарти безпеки та управління.
Що мотивувало вас перейти від чисто академічної кар’єри до заснування та керівництва Virtue AI, і яку проблему ви відчували, що промисловість не вирішувала у масштабі?
Традиційні інструменти безпеки були створені для передбачуваних застосунків з фіксованими шляхами. Вони ніколи не були призначені для систем, які мислять, адаптуються та діють автономно. Мої співзасновники та я побачили розрив між тим, що фундаментальні дослідження безпеки штучного інтелекту мали створити, і тим, що підприємства насправді мали у своєму розпорядженні. Дослідження існувало. Реальність виробництва не існувала. Це те, що ми вирішили змінити.
Virtue AI зосереджується на безпеці, безпеці та відповідності вимогам для великих мовних моделей та автономних агентів. Яку з цих областей, на вашу думку, підприємства недооцінюють найбільше сьогодні?
Підприємства розуміють всі ці області до певної міри, особливо безпеку, але все ще існує велика прогалина.
Підприємства почали серйозно ставитися до безпеки моделей,至少 на поверхневому рівні. Але агенти – це інша проблема. Їм надається доступ до найбільш чутливих частин корпоративної інфраструктури: виконання коду, виклики API, перегляд веб-сторінок та прийняття ланцюгових рішень, які торкаються даних, фінансів та операцій. Більшість команд з безпеки не готовані мислити про такі системи. Інструменти, які у них є, не були створені для цього.
Ризик не є теоретичним. Без безпеки, спеціально створеної для агентських систем, маленькі невдачі швидко накопичуються. Агент, який вже виконав поганий виклик API або витік даних, не чекав, поки ваша система реєстрації оновиться.
Безперервне червоне командування є центральним у підході Virtue AI. Які види невдач чи ризиків з’являються лише тоді, коли системи вже живуть у виробництві?
Більшість серйозних.
У контрольованому середовищі ви тестуєте модель та агентів. У виробництві ви тестуєте систему – і ці речі різні. Як тільки модель підключена до інструментів, трубопроводів введення даних, введення користувача та інших агентів, поведінковий простір розширюється способами, які не захоплюються тестуванням до розгортання. “Безпечно сконфігурований” агент може поводитися зовсім інакше, коли він підключений до реальних баз даних, нових серверів MCP або інших агентів. Система стає недетермінованою. Вона починає приймати рішення на основі контексту, який не існував під час оцінки.
Це те місце, де ви знаходитьесь найбільш серйозні невдачі.
Як ви думаєте про вимірювання “безпеці штучного інтелекту” на практиці, особливо коли системи еволюціонують через тонке налаштування, введення даних та використання інструментів?
На практиці безпека штучного інтелекту не може бути виміряна через один статичний бенчмарк, оскільки сучасні системи штучного інтелекту безперервно еволюціонують через тонке налаштування, введення даних та взаємодію з інструментами чи агентами. Замість цього безпека повинна бути оцінена як властивість системи на рівні всього життєвого циклу застосунку штучного інтелекту. Це включає в себе тестування моделей та агентів з різними атаками червоного командування, моніторинг реального часу поведінки, таких як запити, виклики інструментів та дії, та оцінку результатів проти визначених ризикових політик (наприклад, зловживання, галюцинації, витік даних або необгрунтовані дії).
Наприклад, наш нагороджений папір (Найкраща робота в Національному агентстві безпеки та NeurIPS), DecodingTrust, надав комплексне тестування безпеки та безпеки для фундаментальних моделей. Наша платформа DecodingTrust-Agent створила реалістичний симулятор агентів, який приймає різноманітні середовища з рідними агентами червоного командування для виконання динамічного, адаптивного та безперервного тестування червоного командування.
Важливо, що вимірювання безпеки повинно бути безперервним та адаптивним, оскільки оновлення запитів, джерел введення даних або інструментів можуть вводити нові уразливості. На практиці це означає поєднання автоматизованого червоного командування, засобів безпеки в реальному часі та спостережуваності для вимірювання не тільки відповідей моделі, але й безпеки кінцевої системи штучного інтелекту, що працює в реальному світі.
Ваші дослідження охоплюють стійкість, конфіденційність та адверсарні атаки. Яку з цих областей було доведено найважче перекладати у реальні оборонні засоби?
Переклад дослідження у галузі стійкості, конфіденційності та адверсарних атак у реальні оборонні засоби насправді дуже здійсненний. Насправді багато дослідницьких напрямків у моїй групі безпосередньо натхнені практичними проблемами безпеки, спостережуваними у розгорнутих системах штучного інтелекту. Реальна трудність лежить не у створенні оборонних засобів, а у забезпеченні надійних гарантій безпеки у динамічних реальних середовищах.
У академічних дослідженнях моя група зробила сильні кроки, такі як сертифікована стійкість та гарантії конфіденційності, але ці результати зазвичай залежать від припущень, які можуть не повністю відповідати складним виробничим системам. Сучасні застосунки штучного інтелекту безперервно еволюціонують через нові дані, тонке налаштування, введення даних та інтеграцію інструментів, що може вводити нові уразливості з часом.
Як наслідок, ефективна безпека штучного інтелекту не може покладатися на один раз захисту – це вимагає безперервного червоного командування, відкриття ризиків та адаптивних перилі, які еволюціонують поряд із системою. Це саме філософія, яка лежить в основі Virtue AI: поєднання наших довгострокових досліджень у галузі безпеки штучного інтелекту з автоматизованим великомасштабним червоним командуванням та захистом у реальному часі для безперервного виявлення нових ризиків та оновлення захисту, що дозволяє практичну та масштабну безпеку для реальних систем штучного інтелекту.
Що робить забезпечення автономних агентів штучного інтелекту фундаментально іншим, ніж забезпечення традиційного програмного забезпечення або навіть чат-ботів?
Агенти не є статичними програмами. Вони не слідують передбачуваним шляхам, і вони не залишаються в межах периметру, який ви намалювали для них під час розгортання.
Традиційна безпека припускає фіксовані шляхи виконання, стабільні API та детерміновану поведінку. Автономні агенти порушують всі ці припущення. Вони мислять про те, що робити далі, вибирають інструменти на основі контексту та виробляють ефекти у декілька систем за один раз.
Ви не можете сканувати запит, загострити модель або моніторити один виклик API та вважати роботу зробленою. Ви повинні забезпечити агента як повну систему – його міркування, використання інструментів, середовище та те, що відбувається вниз по течії.
Це центральна проблема, яку не можуть вирішити точки контролю. Їх ніколи не створювали для цього.
Де існуючі інструменти безпеки не дотягують, коли агенти можуть діяти у багатьох системах, інструментах та джерелах даних одночасно?
Вони залишають вас сліпим до того, як агент фактично працював кінцевим.
Більшість інструментів були створені для застосунків з чіткими периметрами та стабільною поведінкою. Вони можуть сказати вам, яким був один виклик API. Вони не можуть сказати вам, як агент мислив своїм шляхом через п’ять викликів інструментів, щоб виробити результат, якого ніхто не мав намір.
Пробіл видимості – це проблема. Якщо ви не можете побачити повну ланцюжок дій та рішень, ви не можете керувати ним, і ви не можете проводити аудит після факту.
Як перилі у реальному часі зменшують ризик порівняно з моніторингом або реєстрацією?
Реєстрація говорить вам, що пішло не так після того, як шкода вже зроблена. Це корисно для судової медицини та відповідності вимогам, але воно не зупиняє нічого.
З автономними агентами затримка між дією та виявленням може бути真正ньою. Агент, який вже виконав поганий виклик API або витік даних, не чекав, поки ваша система реєстрації оновиться.
Перилі у реальному часі перехоплюють дію до виконання. Якщо агент намагається зробити щось поза політикою, його блокують або прапорять до того, як воно запуститься, а не після.
Комбінація також важлива. Перилі у реальному часі плюс одна послідовна точка виконання через усі взаємодії агента з інструментами – це інший ризковий профіль, ніж пасивний моніторинг окремих компонентів.
Virtue AI була заснована глибоко технічними дослідниками. Як це формує рішення про продукт порівняно з більш комерційно орієнтованими стартапами штучного інтелекту?
Безпека та управління штучним інтелектом фундаментально є глибокою технічною проблемою. Системи, які ми захищаємо – такі як великі мовні моделі, багатомодальні моделі та агентські системи – самі побудовані на основі передових досліджень. Без сильної фундаментальної експертизи штучного інтелекту майже неможливо розробити ефективні рішення безпеки для них.
У багатьох випадках найбільша проблема безпеки штучного інтелекту виникає, коли передова атака червоного командування виявляє уразливості агентів штучного інтелекту у дослідницькій роботі – як перекладити цей інсайт у захист виробництва, який може надійно захистити реальні системи?
У Virtue AI закриття цього розриву між дослідженнями та розгортанням є центральним у тому, як ми працюємо та що ми маємо досвіду.
Оскільки Virtue AI була заснована дослідниками, які провели десятиліття, працюючи над стійкістю штучного інтелекту, адверсарним навчанням та довірчими штучними інтелектами, наші дослідницькі та інженерні команди працюють над одними й тими ж проблемами одночасно. Наші дослідники безперервно вивчають нові архітектури моделей, нові робочі потоки агентів та еволюційні атаки, тоді як наші інженерні команди інтегрують ці знання безпосередньо у виробничі системи.
Коли ми виявляємо нову уразливість – такий як новий шаблон ін’єкції запиту або стратегію маніпулювання агентом – це може швидко бути перекладено у нові моделі виявлення, перилі чи стратегії червоного командування. Це відбувається безперервно, а не лише на квартальному продуктивному шляху.
Як наслідок, наші продукти залишаються як передовими, так і готовими до підприємства, допомагаючи організаціям захищати свої системи штучного інтелекту, коли вони їх будують та розгортають. Багато наших клієнтів кажуть нам, що саме цей дослідницький підхід дозволяє їм рухатися швидше, зберігаючи при цьому безпеку та відповідність вимогам.
Натомість чисто комерційно орієнтовані команди часто оптимізують те, про що клієнти запитують сьогодні, що може привести до інкрементних функцій, але може відставати від швидко еволюючого ландшафту загроз систем штучного інтелекту. У безпеці штучного інтелекту загрози еволюціонують так само швидко, як і сама технологія. Фундамент, заснований на дослідженнях, дозволяє нам передбачати нові ризики раніше та будувати захист до того, як вони стають поширеними проблемами.
Яка найпоширеніша омана підприємств щодо безпеки штучного інтелекту, коли вони вперше приходять до Virtue AI?
Одна з найпоширеніших оман підприємств, коли вони вперше приходять до Virtue AI, полягає в тому, що безпека штучного інтелекту може бути вирішена просто застосуванням традиційних інструментів безпеки або базових фільтрів контенту.
На практиці системи штучного інтелекту вводять зовсім нові поверхні загроз, такі як ін’єкція запиту, втечі, галюцинації, витік даних через системи введення даних та маніпулювання агентом через інструменти чи зовнішні API. Ці ризики виникають з поведінки та міркування моделі самої по собі, а не лише з оточуючої інфраструктури.
Як наслідок, захист систем штучного інтелекту вимагає механізмів безпеки, які розуміють введення, виведення та процеси прийняття рішень моделі та агентів на всьому життєвому циклі застосунку штучного інтелекту, що вимагає фундаментальних дослідницьких можливостей штучного інтелекту.
Це саме те, чому ми підкреслюємо безпеку, роджену штучним інтелектом: поєднання автоматизованого червоного командування для відкриття уразливостей, перилі у реальному часі для виконання політики та системної спостережуваності для моніторингу запитів, викликів інструментів та дій агентів.
Як тільки підприємства бачать, наскільки ризики штучного інтелекту відрізняються від традиційних ризиків програмного забезпечення, вони швидко розуміють, що забезпечення безпеки штучного інтелекту вимагає фундаментально нового стека безпеки.
Нарешті, що означає “відповідальне розгортання штучного інтелекту” для вас на практиці – не в теорії, а всередині підприємства, яке відправляє продукти сьогодні?
Швидше та безпечніше не є протилежностями, хоча більшість підприємств вважають їх такими. Припущення полягає в тому, що серйозна безпека сповільнює вас – більше циклів огляду, більше воріт, більше тертя перед тим, як щось відправляється.
На практиці підприємства, які розгортають агентів з увереністю, є тими, хто будує безпеку в процес, а не прикріплює її в кінці: автоматизоване червоне командування до розгортання, реальні засоби контролю, коли агент вже живий, та централізована видимість на всьому життєвому циклі агента.
Це не комплаєнс-ексерсис. Це те, що дозволяє вам рухатися швидко, тому що ви не виявляєте у виробництві те, що мали б виявити раніше.
Відповідальне розгортання, у конкретних термінах, означає, що ви знаєте, що можуть робити ваші агенти, ви можете бачити, що вони роблять, і ви можете зупинити їх, коли щось піде не так.
Відповідальне розвиток штучного інтелекту дозволяє безперервне, великомасштабне розгортання систем штучного інтелекту з увереністю, а не сповільнюючи інновації штучного інтелекту.
Дякую за велике інтерв’ю, читачам, які бажають дізнатися більше, слід відвідати Virtue AI.












