Кибербезопасность

Simbian Запускает Бенчмарк Кибербезопасности, Раскрывая Крупный Провал В Возможностях Безопасности Искусственного Интеллекта

mm
Добавьте Unite.AI в избранные источники в Google

Новый бенчмарк, выпущенный компанией Simbian, бросает вызов одному из наиболее широко распространенных предположений в области искусственного интеллекта: что те же модели, которые способны находить уязвимости, также могут защитить от них.

Компания представила новый Бенчмарк Кибербезопасности, разработанный лабораторией Simbian Research Lab, который оценивает, насколько хорошо ведущие модели крупномасштабного языкового моделирования (LLM) работают в реальных сценариях кибербезопасности. Результаты поразительны. Хотя современные системы искусственного интеллекта все более эффективны в обнаружении и эксплуатации уязвимостей, они испытывают значительные трудности, когда им поручают выявление и остановку активных атак.

Модели Фронтира Не Соответствуют Минимальному Стандарту Защиты

Бенчмарк протестировал ведущие модели, включая Claude Opus 4.6, GPT-5, Gemini 3.1 Pro, и другие в симулированных корпоративных средах.

Ни одна из моделей не получила проходной балл.

Claude Opus 4.6, которая показала лучший результат в тесте, обнаружила только часть доказательств атак по тактикам MITRE ATT&CK, в то время как многие модели не смогли выявить целые категории вредоносной деятельности. Независимые академические исследования, подтверждающие эти результаты, показали, что даже лучшие модели испытывают трудности с открытым поиском угроз, обнаруживая только небольшую часть вредоносных событий в реалистичных сценариях.

Этот разрыв подчеркивает критическое ограничение. Системы искусственного интеллекта сегодня могут отлично справляться с ответами на структурированные вопросы или решением изолированных проблем, но они терпят неудачу, когда им необходимо расследовать сложные, развивающиеся цепочки атак без руководства.

Сдвиг В сторону Реалистичного, Основанного На Агентах Оценки

То, что отличает этот бенчмарк, – это его конструкция.

В отличие от предыдущих тестов кибербезопасности, которые полагаются на вопросы с несколькими вариантами ответов или статические наборы данных, подход Simbian использует реальные телеметрические данные и помещает модели в агентский цикл расследования. Вместо того, чтобы им говорили, что искать, искусственный интеллект должен исследовать журналы, формулировать гипотезы и выявлять угрозы самостоятельно.

Это отражает, как работают человеческие аналитики безопасности в реальных Центрах операций безопасности.

Бенчмарк включает в себя десятки тактик атак на различных стадиях, заставляя модели связывать сигналы во времени и системах. Благодаря мутации контекста и детерминированному подсчету баллов он также снижает риск того, что модели просто запомнят закономерности.

Этот сдвиг в сторону реализма значим. В разработке искусственного интеллекта создание бенчмарка, точно отражающего реальную сложность, часто является первым шагом к решению самой проблемы.

Растущий Разрыв Между Нападением И Защитой Искусственного Интеллекта

Результаты подтверждают более широкую тенденцию, которая возникает в отрасли.

Искусственный интеллект быстро улучшается в задачах кибербезопасности. Недавние исследования показывают, что модели фронтира уже могут выполнять многоступенчатые атаки в симулированных средах и все чаще делают это с минимальным инструментарием. В то же время возможности обороны отстают.

Этот дисбаланс создает все более широкую асимметрию. Нападающие могут использовать автоматизацию и масштаб, в то время как защитники все еще сильно полагаются на человеческий опыт и фрагментированное инструментарий. Даже когда искусственный интеллект выявляет уязвимость, он может неправильно интерпретировать ее серьезность или не предпринимать соответствующих действий, подчеркивая разрыв между обнаружением и пониманием.

Почему “Вobox” Искусственный Интеллект Не Оправдывает Ожиданий

Вывод Simbian заключается не в том, что искусственный интеллект не может защитить системы, а в том, что он не может сделать это в одиночку.

Бенчмарк предполагает, что модели крупномасштабного языкового моделирования (LLM) требуют того, что компания описывает как “сложную упряжь” – сочетание внешней разведки, структурированных рабочих процессов и системной интеграции – для эффективной работы в средах безопасности.

Это соответствует более широким исследованиям, показывающим, что добавление инструментов, памяти и контекста значительно улучшает производительность искусственного интеллекта в задачах кибербезопасности.

В производственных средах Simbian утверждает, что достигла существенно более высокой точности обнаружения, сочетая модели с этими дополнительными слоями. Импликация ясна: сыкая возможность модели является только частью головоломки.

Новая Категория Бенчмарка Для Безопасности Искусственного Интеллекта

Выпуск Бенчмарка Кибербезопасности знаменует собой важный шаг в том, как системы искусственного интеллекта оцениваются для реального развертывания.

Сосредоточившись на доказательствах, основанном поиске угроз, а не на ответах на вопросы, он переформулирует проблему с интеллекта на выполнение. Он также вводит стоимость как измеримый фактор, подчеркивая компромиссы между производительностью и эффективностью моделей.

По мере того, как искусственный интеллект продолжает менять кибербезопасность, такие бенчмарки могут стать важными инструментами для понимания не только того, что могут сделать модели, но и где они терпят неудачу – и почему.

На данный момент вывод прост. Несмотря на быстрый прогресс в искусственном интеллекте, полностью автономная кибербезопасность остается недоступной. Следующая фаза инноваций, вероятно, будет зависеть меньше от построения более крупных моделей и больше от проектирования систем, которые сочетают искусственный интеллект с структурированной разведкой, контекстом и человеческим надзором.

Антуан - видный лидер и сооснователь Unite.AI, движимый непоколебимой страстью к формированию и продвижению будущего ИИ и робототехники. Как серийный предприниматель, он считает, что ИИ будет столь же разрушительным для общества, как и электричество, и часто увлекается потенциалом разрушительных технологий и ИИ.

Как футуролог, он посвящен исследованию того, как эти инновации будут формировать наш мир. Кроме того, он является основателем Securities.io, платформы, ориентированной на инвестиции в передовые технологии, которые переопределяют будущее и меняют целые сектора.