Взгляд Anderson

Машиностроительное обучение извлекает данные об атаках из многословных отчетов о угрозах

mm
Добавьте Unite.AI в избранные источники в Google
NLP mining

Новые исследования из Университета Чикаго иллюстрируют конфликт, возникший в течение последних десяти лет между преимуществами SEO длинного контента и трудностями, с которыми системы машинного обучения сталкиваются при извлечении необходимых данных из него.

При разработке системы анализа NLP для извлечения важной информации об угрозах из отчетов о киберугрозах (CTI), исследователи из Чикаго столкнулись с тремя проблемами: отчеты обычно очень длинные, с только небольшим разделом, посвященным фактическому поведению атак; стиль плотный и грамматически сложный, с обширной домен-специфической информацией, которая предполагает предварительные знания читателя; и материал требует знания междоменных отношений, которое должно быть «запомнено», чтобы понять его в контексте (постоянная проблема, отмечают исследователи).

Многословные отчеты об угрозах

Основная проблема – многословность. Например, чикагская статья отмечает, что среди 42-страничного отчета ClearSky за 2019 год о угрозе для вредоносного ПО DustySky (также известного как NeD Worm), только 11 предложений фактически касаются и описывают поведение атак.

Вторым препятствием является сложность текста и, по сути, длина предложения: исследователи замечают, что среди 4020 отчетов о угрозах из центра отчетов о угрозах Microsoft (MSFT ) среднее предложение состоит из 52 слов – только девять меньше средней длины предложения 500 лет назад (в контексте того, что длина предложения снизилась на 75% с тех пор).

Однако статья утверждает, что эти длинные предложения по сути являются «сжатыми абзацами» сами по себе, полными клауз, наречий и прилагательных, которые окутывают основной смысл информации; и что предложения часто не имеют базовой конвенциональной пунктуации, на которую системы NLP, такие как spaCy, Stanford и NLTK, полагаются для вывода намерения или извлечения фактических данных.

NLP для извлечения важной информации об угрозах

Машинный процесс, разработанный чикагскими исследователями для решения этой проблемы, называется EXTRACTOR, и использует методы NLP для генерации графов, которые извлекают и суммируют поведение атак из длинных, дискурсивных отчетов. Процесс отбрасывает историческую, повествовательную и даже географическую орнаментацию, которая создает увлекательную и исчерпывающую «историю» за счет четкого определения информационной нагрузки.

Источник: https://arxiv.org/pdf/2104.08618.pdf

Источник: https://arxiv.org/pdf/2104.08618.pdf

Поскольку контекст является такой проблемой в многословных и длинных отчетах о киберугрозах, исследователи выбрали BERT (Bidirectional Encoder Representations from Transformer) языковую модель представления над моделью Word2Vec от Google или GloVe от Stanford.

BERT оценивает слова из их окружающего контекста и также развивает встраивания для подслов (т. е. launch, launching и launches все сводятся к launch). Это помогает EXTRACTOR справиться с технической лексикой, которая не присутствует в модели обучения BERT, и классифицировать предложения как «продуктивные» (содержащие соответствующую информацию) или «непродуктивные».

Увеличение местного словаря

Неизбежно, что некоторая конкретная доменная информация должна быть интегрирована в конвейер NLP, связанный с таким материалом, поскольку очень важные формы слов, такие как IP-адреса и технические имена процессов, не должны быть отброшены.

Поздние части процесса используют BiLSTM (Bidirectional LSTM) сеть для решения проблемы многословности, выведения семантических ролей для частей предложения, прежде чем удалять непродуктивные слова. BiLSTM хорошо подходит для этого, поскольку может коррелировать долгосрочные зависимости, которые появляются в длинных документах, где требуется больше внимания и удержания, чтобы вывести контекст.

EXTRACTOR определяет семантические роли и отношения между словами, с ролями, сгенерированными аннотациями PropBank.

EXTRACTOR определяет семантические роли и отношения между словами, с ролями, сгенерированными аннотациями PropBank.

В тестах EXTRACTOR (частично финансируемый DARPA) был найден способным соответствовать человеческому извлечению данных из отчетов DARPA. Система также была запущена против большого количества неструктурированных отчетов из Microsoft Security Intelligence и TrendMicro Threat Encyclopedia, успешно извлекая важную информацию в большинстве случаев.

Исследователи признают, что производительность EXTRACTOR, вероятно, уменьшится, когда будет попытка извлечь действия, которые происходят в течение нескольких предложений или абзацев, хотя переподготовка системы для учета других отчетов указана как способ вперед. Однако это по сути является откатом к человеческой маркировке по прокси.

Длина == Авторитет?

Интересно отметить продолжающееся напряжение между тем, как алгоритмы SEO Google, кажется, все чаще вознаграждают длинный контент в последние годы (хотя официальные советы по этому вопросу противоречивы), и проблемами, с которыми исследователи ИИ (включая многие крупные инициативы исследований Google) сталкиваются при декодировании намерения и фактических данных из этих все более дискурсивных и длинных статей.

Это можно утверждать, что, вознаграждая длинный контент, Google предполагает последовательное качество, которое оно не обязательно может определить или количественно оценить через процессы NLP, кроме как считать количество авторитетных сайтов, которые на него ссылаются (метрика «мясной»); и что это не необычно видеть посты объемом 2500 слов или более, получающие видимость в SERPS, независимо от повествовательного «блота», пока дополнительный контент в целом понятен и не нарушает другие рекомендации.

Где рецепт?

Следовательно, слово счетчики растут, частично из-за настоящего желания хорошего длинного контента, но также потому, что «историзация» нескольких фактов может повысить длину статьи до идеальных стандартов SEO, и позволить незначительному контенту конкурировать на равных с более качественным контентом.

Одним из примеров этого являются сайты рецептов, часто жалующихся на сайте Hacker News за то, что они предваряют основную информацию (рецепт) большим количеством автобиографического или фантастического контента, предназначенного для создания «опыта рецепта» и для того, чтобы толкнуть то, что в противном случае было бы очень низким словом, в SEO-дружественную область 2500+ слов.

Несколько чисто процедурных решений появились для извлечения фактических рецептов из многословных сайтов рецептов, включая открытые парсеры рецептов и извлекатели рецептов для Firefox и Chrome. Машиностроительное обучение также занимается этим, с различными подходами из Японии, США и Португалии, а также исследованиями из Стэнфорда и других.

В отношении отчетов о киберугрозах, рассмотренных чикагскими исследователями, общая практика многословных отчетов об угрозах может быть частично обусловлена необходимостью отразить масштаб достижения (которое может быть кратко описано в абзаце) путем создания очень длинной повествовательной истории вокруг него и использования длины слова в качестве прокси для масштаба усилий, независимо от применимости.

Во-вторых, в климате, где исходный источник истории часто теряется из-за плохих практик цитирования популярными новостными изданиями, производство большего объема слов, чем любой журналист мог бы повторить, гарантирует победу в SERPS по чистой длине слова, предполагая, что многословность – теперь растущая проблема для NLP – действительно вознаграждается таким образом.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai