Кібербезпека

Simbian Запускає Бенчмарк Кібербезпеки, Показуючи Велику Пропасть У Можливостях Безпеки Штучного Інтелекту

mm
Додайте Unite.AI до бажаних джерел у Google

Новий бенчмарк, випущений компанією Simbian, викликає сумніви щодо одного з найбільш поширених припущень у сфері штучного інтелекту: що ті самі моделі, які можуть виявляти уразливості, також можуть захистити від них.

Компанія представила новий Бенчмарк Кібербезпеки, розроблений лабораторією Simbian Research Lab, який оцінює, як добре ведуть себе провідні великомасштабні моделі мови (LLM) у реальних сценаріях кібербезпеки. Результати вражаючі. Хоча сучасні системи штучного інтелекту все більш ефективні у виявленні та використанні слабкостей, вони суттєво програють, коли їм доручають виявлення та зупинку активних атак.

Моделі Фронтиру Не Здатні Перейти Мінімальний Бар’єр Захисту

Бенчмарк був протестований на провідних моделях, включаючи Claude Opus 4.6, GPT-5, Gemini 3.1 Pro та інші у симульованих корпоративних середовищах.

Жодна з моделей не досягла проходного балу.

Claude Opus 4.6, яка показала найкращий результат у тесті, виявила лише частину доказів атак по тактиці MITRE ATT&CK, тоді як багато моделей не змогли ідентифікувати цілі категорії зловмисної діяльності. Незалежні академічні дослідження, що підтверджують ці висновки, показують, що навіть топ-моделі мають труднощі з відкритим пошуком загроз, виявляючи лише малий відсоток зловмисних подій у реалістичних сценаріях.

Ця пропаст підкреслює критичну обмеженість. Системи штучного інтелекту сьогодні можуть видатно відповідати на структуровані питання або розв’язувати обмежені проблеми, але вони слабшають, коли їм потрібно розслідувати складні, еволюційні ланцюги атак без керівництва.

Перехід До Реалістичної, Агентської Оцінки

Що відрізняє цей бенчмарк, так це його конструкція.

На відміну від попередніх тестів кібербезпеки, які спираються на питання з декількома варіантами відповідей або статичні набори даних, підхід Simbian використовує реальні телеметричні дані та розміщує моделі у агентському циклі розслідування. Замість того, щоб бути повідомленим про те, що шукати, штучний інтелект повинен досліджувати журнали, формувати гіпотези та визначати загрози незалежно.

Це відображає, як діють люди-експерти з безпеки у реальних Центрах операцій з безпеки.

Бенчмарк включає десятки тактик атак на різних стадіях, змушуючи моделі зв’язувати сигнали у часі та системах. Використовуючи мутацію контексту та детерміністичне оцінювання, він також зменшує ризик того, що моделі просто запам’ятовують шаблони.

Цей перехід до реалізму суттєвий. У розробці штучного інтелекту створення бенчмарку, який точно відображає реальну складність, часто є першим кроком до розв’язання самої проблеми.

Розростання Пропасті Між Нападальними І Захисними Штучними Інтелектами

Висновки підкріплюють ширшу тенденцію, що з’являється у галузі.

Штучний інтелект швидко покращується у нападальних кіберзадачах. Недавні дослідження показують, що моделі фронтиру вже можуть виконувати багатокрокові атаки у симульованих середовищах та все частіше роблять це з мінімальними інструментами. У той же час, оборонні можливості відстають.

Ця дисбаланс створює зростаючу асиметрію. Нападники можуть використовувати автоматизацію та масштабування, тоді як захисники все ще сильно залежать від людського досвіду та фрагментованого інструментарію. Навіть коли штучний інтелект виявляє уразливість, він може неправильно тлумачити її серйозність або не діяти належним чином, підкреслюючи пропасть між виявленням та розумінням.

Чому “З Боку” Штучний Інтелект Не Достатньо

Висновок Simbian полягає не в тому, що штучний інтелект не може захистити системи, а в тому, що він не може зробити цього самотужки.

Бенчмарк свідчить про те, що великомасштабні моделі мови (LLM) потребують того, що компанія описує як “складний гарнес”—комбінацію зовнішньої інтелекту, структурованих робочих процесів та системної інтеграції—для ефективної роботи в середовищах безпеки.

Це відповідає більш широким дослідженням, які показують, що додавання інструментів, пам’яті та контексту суттєво покращує продуктивність штучного інтелекту у завданнях кібербезпеки.

У виробничих середовищах Simbian стверджує, що досягла суттєво вищої точності виявлення, поєднавши моделі з цими додатковими шарами. Імплікація очевидна: суцільна здатність моделі є лише однією з частин пазла.

Нова Категорія Бенчмарку Для Безпеки Штучного Інтелекту

Випуск Бенчмарку Кібербезпеки став важливим кроком у тому, як системи штучного інтелекту оцінюються для реального розгортання.

Зосереджуючись на доказах, пов’язаних з пошуком загроз, а не на відповідях на питання, він переформулює проблему з інтелекту на виконання. Він також вводить вартість як вимірювану фактор, підкреслюючи компроміси між продуктивністю та ефективністю серед моделей.

Оскільки штучний інтелект продовжує змінювати кібербезпеку, бенчмарки, подібні до цього, можуть стати необхідними інструментами для розуміння не лише того, що можуть зробити моделі, а й де вони провалюються—і чому.

Наразі висновок очевидний. Навіть попри швидкий прогрес у сфері штучного інтелекту, повністю автономна кібербезпека залишається недосяжною. Наступна фаза інновацій, ймовірно, буде залежати менше від створення більших моделей та більше від розробки систем, які поєднують штучний інтелект із структурованою інтелектуальністю, контекстом та людським наглядом.

Антуан є видним лідером і засновником Unite.AI, який рухається незмінною пристрастю до формування та просування майбутнього штучного інтелекту та робототехніки. Як серійний підприємець, він вважає, що штучний інтелект буде таким же революційним для суспільства, як і електрика, і часто захоплюється потенціалом революційних технологій і штучного інтелекту загального призначення.

Як футуролог, він присвячений вивченню того, як ці інновації будуть формувати наш світ. Крім того, він є засновником Securities.io, платформи, орієнтованої на інвестиції в передові технології, які переінакшують майбутнє і змінюють цілі сектори.