Andersonův úhel
Strojové učení extrahuje data o útocích z rozsáhlých zpráv o hrozbách

Nový výzkum z Univerzity of Chicago ilustruje konflikt, který vznikl v posledních deseti letech mezi výhodami dlouhých článků z hlediska optimalizace pro vyhledávače a obtížemi, se kterými se systémy strojového učení potýkají při získávání základních dat z nich.
Při vývoji systému pro analýzu NLP pro extrakci základních informací o hrozbách z reportů o kybernetických hrozbách (CTI) se výzkumníci z Chicaga setkali s třemi problémy: reporty jsou obvykle velmi dlouhé, s pouze malou částí věnovanou skutečnému chování při útoku; styl je hustý a gramaticky složitý, s rozsáhlými informacemi specifickými pro danou oblast, které předpokládají předchozí znalosti čtenáře; a materiál vyžaduje znalosti vztahů mezi různými oblastmi, které je třeba “zapamatovat”, aby je bylo možné pochopit v kontextu (trvalý problém, jak uvádějí výzkumníci).
Zprávy o hrozbách s mnoha slovy
Hlavním problémem je verbální bohatost. Například Chicagská studie uvádí, že z 42stránkového reportu ClearSky z roku 2019 o malwaru DustySky (také známém jako NeD Worm) se pouze 11 vět skutečně zabývá a popisuje chování při útoku.
Druhým překážkou je složitost textu a efektivní délka vět: výzkumníci pozorují, že z 4020 reportů o hrozbách z centra Microsoftu pro reporty o hrozbách má průměrná věta 52 slov – pouze devět méně než průměrná délka věty před 500 lety (v kontextu skutečnosti, že délka vět klesla o 75% od té doby).
Nicméně studie tvrdí, že tyto dlouhé věty jsou vlastně “komprimované odstavce” samy o sobě, plné podvětných vět, přídavných jmen a příslovcí, které zahalují základní význam informací; a že věty často postrádají základní konvenční interpunkci, na které systémy NLP jako spaCy, Stanford a NLTK spoléhají, aby odvodily záměr nebo extrahovaly tvrdá data.
NLP pro extrakci významných informací o hrozbách
Potrubí strojového učení, které výzkumníci z Chicaga vyvinuli pro řešení tohoto problému, se nazývá EXTRACTOR, a používá techniky NLP pro generování grafů, které zkracují a souhrnně popisují chování při útoku z rozsáhlých, diskursivních reportů. Proces odstraňuje historické, narativní a dokonce i geografické ozdoby, které vytvářejí zajímavý a vyčerpávající “příběh” na úkor jasně stanovených priorit informací.
Pokud je kontext takovým problémem ve verbálních a prolixních reportech CTI, výzkumníci zvolili BERT (Bidirectional Encoder Representations from Transformer) jazykový model pro reprezentaci slov z jejich okolního kontextu, a také vyvinuli vnoření pro subwords (tj. spuštění, spouštění a spouští všechny odvozují od spuštění). To pomáhá EXTRACTORU zvládat technické slovníky, které nejsou přítomny v BERTově tréninkovém modelu, a klasifikovat věty jako “produktivní” (obsahující příslušné informace) nebo “neproduktivní”.
Zvyšování lokálního slovníku
Nepochybně musí být do potrubí NLP pro zpracování tohoto druhu materiálu integrována určitá specifická doménová znalost, protože velmi relevantní formy slov, jako jsou IP adresy a technické názvy procesů, nesmí být odstraněny.
Pozdější části procesu používají BiLSTM (Bidirectional LSTM) síť pro řešení slovní verbality, odvozování semantických rolí pro části vět, a poté odstraňování neproduktivních slov. BiLSTM je vhodný pro tento úkol, protože může korelovat vzdálené závislosti, které se objevují ve verbálních dokumentech, kde je zapotřebí větší pozornost a retence, aby se odvodil kontext.

EXTRACTOR definuje semantické role a vztahy mezi slovy, s rolemi generovanými anotacemi Proposition Bank (PropBank).
V testech byl EXTRACTOR (částečně financovaný DARPA) shledán schopen odpovídat lidské extrakci dat z reportů DARPA. Systém byl také spuštěn proti velkému množství nestrukturovaných reportů z Microsoft (MSFT ) Security Intelligence a TrendMicro Threat Encyclopedia, úspěšně extrahující významné informace ve většině případů.
Výzkumníci uznávají, že výkon EXTRACTORU je pravděpodobně oslaben, když se snaží zkrátit akce, které se vyskytují napříč několika větami nebo odstavci, ačkoli rekonfigurace systému pro přizpůsobení jiných reportů je naznačena jako cesta vpřed. Nicméně, toto je vlastně návrat k lidsky vedenému označení.
Délka == Autorita?
Je zajímavé poznamenat, že pokračující napětí mezi tím, jak algoritmy Googlu pro optimalizaci pro vyhledávače zdánlivě odměňují dlouhý obsah v posledních letech (ačkoli oficiální rady v tomto ohledu jsou protichůdné), a výzvy, kterým čelí výzkumníci AI (včetně mnoha výzkumných iniciativ Googlu) při dekódování záměru a skutečných dat z těchto stále diskursivnějších a delších článků.
Je možné, že Googlu odměňuje delší obsah, protože předpokládá konzistentní kvalitu, kterou dosud nemůže identifikovat nebo kvantifikovat prostřednictvím procesů NLP, kromě počtu autoritativních stránek, které na něj odkazují (metrika “masožravosti” ve většině případů); a že není neobvyklé vidět příspěvky o 2 500 slovech nebo více, které dosahují SERPS prominence, bez ohledu na narativní “nafouknutí”, pokud je dodatečný obsah obecně srozumitelný a nedojde k porušení jiných pokynů.
Kde je recept?
V důsledku toho počet slov se zvyšuje, částečně kvůli skutečnému zájmu o dobrý dlouhý obsah, ale také proto, že “vyprávění” několika skrovných faktů může zvýšit délku příspěvku na ideální standardy optimalizace pro vyhledávače, a umožnit lehkomyslnému obsahu soutěžit rovnocenně s vyšším úsilím.
Jedním z příkladů jsou webové stránky s recepty, často stěžují si na komunitě Hacker News za to, že předchází základní informace (recept) spoustou autobiografických nebo pohádkových obsahů, určených k vytvoření “zkušenosti s receptem”, a aby zvýšily to, co by jinak byla velmi nízká délka příspěvku, do SEO-přátelské oblasti 2 500+ slov.
Byly vyvinuty některé čistě procedurální řešení pro extrakci skutečných receptů z verbálních webových stránek s recepty, včetně open source extraktoru receptů, a extraktoru receptů pro Firefox a Chrome. Strojové učení se také zabývá touto problematikou, s různými přístupy z Japonska, USA a Portugalska, jakož i výzkum ze Stanfordu a dalších.
Co se týče reportů o hrozbách, na které se výzkumníci z Chicaga zaměřili, obecná praxe verbálních reportů o hrozbách může být částečně způsobena potřebou odrážet rozsah úspěchu (který lze jinak často shrnout v odstavci) vytvořením velmi dlouhého narativu kolem něj, a použitím délky textu jako proxy pro rozsah úsilí, bez ohledu na použitelnost.
Zadruhé, v klimatu, kde původní zdroj příběhu je často ztracen z důvodu špatných citačních praktik populárních zpravodajských serverů, produkce většího objemu slov, než by mohl replikovat jakýkoli reportér, zajišťuje výhru v SERPS pouze díky objemu slov, předpokládá-li se, že verbální bohatost – nyní rostoucí výzva pro NLP – je skutečně odměňována tímto způsobem.













