Погляд Anderson

Машинне навчання витягує дані про атаки з розгорнутих звітів про загрози

mm
Додайте Unite.AI до бажаних джерел у Google
NLP mining

Нові дослідження університету Чикаго ілюструють конфлікт, який виник за останні десять років між вигодами SEO довгих звітів та труднощами, з якими системи машинного навчання мають у витяганні основних даних з них.

Під час розробки системи аналізу NLP для витягання основної інформації про загрози з звітів про кібернетичні загрози (CTI), дослідники університету Чикаго столкнулися з трьома проблемами: звіти зазвичай дуже довгі, з лише невеликою частиною, присвяченою фактичній поведінці атаки; стиль густий і граматично складний, з великою кількістю галузевої інформації, яка припускає попередню підготовку читача; і матеріал вимагає знання взаємозв’язків між областями, яке повинно бути “запам’ятане”, щоб зрозуміти його у контексті (це персистентна проблема, на яку вказують дослідники).

Розгорнуті звіти про загрози

Основною проблемою є розгорнутість. Наприклад, у статті університету Чикаго зазначається, що серед 42-сторінкового звіту ClearSky 2019 року звіту про загрозу щодо зловмисного ПО DustySky (також відомого як NeD Worm), лише 11 речень фактично стосуються поведінки атаки.

Другою перешкодою є складність тексту, а саме довжина речень: дослідники спостерігають, що серед 4020 звітів про загрози з центру звітів про загрози Microsoft (MSFT ) середня довжина речення становить 52 слова – лише дев’ять менше середньої довжини речення 500 років тому (в контексті того, що довжина речень зменшилася на 75% з тих пір).

Однак, у статті стверджується, що ці довгі речення є фактично “стиснутими абзацами” самих по собі, повними клауз, прислівників і прикметників, які ховають основний зміст інформації; і що речення часто не мають базової конвенційної пунктуації, на яку системи NLP, такі як NLP, spaCy, Stanford і NLTK, покладаються для визначення намірів або витягання фактичних даних.

NLP для витягання основної інформації про загрози

Машинний процес, розроблений дослідниками університету Чикаго для вирішення цієї проблеми, називається EXTRACTOR, і використовує техніки NLP для генерації графів, які витягують і підсумовують поведінку атаки з довгих звітів. Процес відкидає історичні, нарративні та навіть географічні прикраси, які створюють цікаву і вичерпну “історію” за рахунок чіткого пріоритету інформаційного вантажу.

Джерело: https://arxiv.org/pdf/2104.08618.pdf

Джерело: https://arxiv.org/pdf/2104.08618.pdf

Оскільки контекст є таким викликом у розгорнутих звітах про загрози, дослідники обрали BERT (Bidirectional Encoder Representations from Transformer) мовну модель над Word2Vec від Google або GloVe від Stanford.

BERT оцінює слова з їхнього оточення і також розвиває ембеддинги для підслів (тобто launch, launching і launches всі спрощуються до launch). Це допомагає EXTRACTOR справлятися з технічною лексикою, яка не присутня у тренувальній моделі BERT, і класифікувати речення як “продуктивні” (містять актуальну інформацію) або “непродуктивні”.

Повышення місцевого словника

Невід’ємно, деякі конкретні галузі знань повинні бути інтегровані в трубопровід NLP, який займається матеріалом цього типу, оскільки дуже важливі форми слів, такі як IP-адреси та технічні імена процесів, не повинні бути відкинуті.

Пізніші частини процесу використовують BiLSTM (Bidirectional LSTM) мережу для боротьби з розгорнутістю слів, виводячи семантичні ролі для частин речень, перш ніж видалити непродуктивні слова. BiLSTM добре підходить для цього, оскільки він може корелювати довгострокові залежності, які з’являються в розгорнутих документах, де потрібна більша увага і пам’ять, щоб вивести контекст.

EXTRACTOR визначає семантичні ролі та відносини між словами, з ролями, згенерованими анотаціями Proposition Bank (PropBank).

EXTRACTOR визначає семантичні ролі та відносини між словами, з ролями, згенерованими анотаціями Proposition Bank (PropBank).

У тестах EXTRACTOR (частково профінансований DARPA) був здатний відповідати витяганню даних людини з звітів DARPA. Система також була запущена проти великої кількості неструктурованих звітів з Microsoft Security Intelligence і TrendMicro Threat Encyclopedia, успішно витягуючи основну інформацію в більшості випадків.

Дослідники визнають, що продуктивність EXTRACTOR, ймовірно, зменшилася б, коли б вони намагалися витягнути дії, які відбуваються протягом кількох речень або абзаців, хоча переозброєння системи для підтримки інших звітів вказується як шлях вперед. Однак це фактично повернення до людського маркування за посередництвом.

Довжина == Авторитет?

Цікаво відзначити триваючу напруженість між тим, як алгоритми SEO Google, здається, віддавали перевагу довгим звітам за останні роки (хоча офіційна порада щодо цього спірна), і труднощами, з якими дослідники штучного інтелекту (включаючи багато великих ініціатив досліджень Google) стикаються при декодуванні намірів і фактичних даних з цих все більш розгорнутих і довгих статей.

Це можна вважати тим, що, винагороджуючи довгі звіти, Google припускає постійну якість, яку він ще не може ідентифікувати або кількісно оцінити через процеси NLP, крім підрахунку кількості авторитетних сайтів, які посилаються на нього (це “м’ясна” метрика, у більшості випадків); і що це не дивно бачити публікації об’ємом 2 500 слів або більше, які займають провідні позиції в результатах пошуку, незалежно від нарративної “розгорнутості”, поки додатковий контент є загалом зрозумілим і не порушує інші директиви.

Де рецепт?

Відповідно, об’єм слів зростає, частково через справжнє бажання доброго довгого контенту, але також тому, що “storифікація” кількох небагатьох фактів може підвищити довжину статті до ідеальних стандартів SEO, і дозволити слабкому контенту конкурувати рівноправно з контентом вищого рівня.

Одним із прикладів цього є сайти з рецептами, часто скаржаться на спільноті Hacker News за те, що вони передують основній інформації (рецепту) великою кількістю автобіографічного або фантастического контенту, призначеного для створення історії-дрівенового “рецепт-досвіду”, і для підвищення того, що інакше було б дуже низьким об’ємом слів, до SEO-дружнього регіону 2 500+ слів.

Були розроблені чисто процедурні рішення для витягання фактичних рецептів з розгорнутих сайтів з рецептами, включаючи відкритий код витягувачі рецептів, і витягувачі рецептів для Firefox і Chrome. Штучний інтелект також займається цим, з різними підходами з Японії, Сполучених Штатів і Португалії, а також дослідженнями Стенфордського університету та інших.

У випадку звітів про загрози, розглянутих дослідниками університету Чикаго, загальна практика розгорнутих звітів про загрози може бути частково викликана необхідністю відображення масштабу досягнення (яке інакше часто можна підсумувати в одному абзаці) шляхом створення дуже довгої розповіді навколо нього, і використання довжини слова як заміни масштабу зусиль, незалежно від застосовності.

Другою причиною є клімат, у якому первинне джерело історії часто згублене через погані практики цитування популярними джерелами новин, і створення більшої кількості слів, ніж будь-який журналіст міг би повторити, гарантує перемогу в результатах пошуку за рахунок чистої довжини слова, припускаючи, що розгорнутість – тепер зростаюче виклик для NLP – справді винагороджується в цьому спосіб.

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai