Andersons hoek
Machine Learning Extracts Aanvalsgegevens uit Omstandige Bedreigingsrapporten

Nieuw onderzoek van de Universiteit van Chicago illustreert het conflict dat de afgelopen tien jaar is ontstaan tussen de SEO-voordelen van lange inhoud en de moeilijkheid die machine learning-systemen hebben om essentiële gegevens te verzamelen uit deze inhoud.
Bij het ontwikkelen van een NLP-analyse systeem om essentiële bedreigingsinformatie te extraheren uit Cyber Threat Intelligence (CTI)-rapporten, stuitte het team van de Universiteit van Chicago op drie problemen: de rapporten zijn meestal erg lang, met slechts een klein gedeelte gewijd aan het daadwerkelijke aanvalsgedrag; de stijl is dicht en grammaticaal complex, met uitgebreide domeinspecifieke informatie die ervan uitgaat dat de lezer reeds kennis heeft van het onderwerp; en het materiaal vereist kennis van cross-domeinrelaties, die moet worden ‘onthouden’ om het in context te begrijpen (een persistent probleem, zoals de onderzoekers opmerken).
Omstandige Bedreigingsrapporten
Het primaire probleem is omstandigheid. Zo merkt het artikel van de Universiteit van Chicago op dat onder de 42 pagina’s tellende rapportage van ClearSky uit 2019 over de DustySky (ook bekend als NeD Worm)-malware, slechts 11 zinnen daadwerkelijk over het aanvalsgedrag gaan.
Het tweede obstakel is de complexiteit van de tekst, en effectief, de zinslengte: de onderzoekers observeren dat onder 4020 bedreigingsrapporten van Microsoft’s (MSFT ) bedreigingsrapportcentrum, de gemiddelde zin 52 woorden telt – slechts negen minder dan de gemiddelde zinslengte 500 jaar geleden (in de context dat de zinslengte 75% is afgenomen sindsdien).
Echter, het artikel stelt dat deze lange zinnen in wezen ‘gecomprimeerde alinea’s’ zijn, vol met bijzinnen, bijwoorden en bijvoeglijke naamwoorden die de kernbetekenis van de informatie verhullen; en dat de zinnen vaak ontbreken aan de basisconventionele interpunctie waarop NLP-systemen zoals spaCy, Stanford en NLTK vertrouwen om intentie af te leiden of harde gegevens te extraheren.
NLP om Saliente Bedreigingsinformatie te Extraheren
De machine learning-pijplijn die de onderzoekers van de Universiteit van Chicago hebben ontwikkeld om dit aan te pakken, heet EXTRACTOR, en gebruikt NLP-technieken om grafieken te genereren die aanvalsgedrag uit lange, discursieve rapporten distilleren en samenvatten. Het proces verwijdert de historische, narratieve en zelfs geografische ornamentatie die een aantrekkelijk en uitgebreid ‘verhaal’ creëert ten koste van het duidelijk prioriteren van de informatieve lading.
Aangezien context zo’n uitdaging vormt in omstandige en prolixe CTI-rapporten, kozen de onderzoekers voor de BERT (Bidirectional Encoder Representations from Transformer)-taalrepresentatiemodel boven Google’s Word2Vec of Stanford’s GloVe (Global Vectors for Word Representation).
BERT evalueert woorden uit hun omringende context, en ontwikkelt ook embeddings voor subwoorden (d.w.z. launch, launching en launches allemaal terug naar launch). Dit helpt EXTRACTOR om technische woordenschat te hanteren die niet aanwezig is in BERT’s trainingsmodel, en om zinnen te classificeren als ‘productief’ (bevattende pertinente informatie) of ‘niet-productief’.
Locaal Vocabulaire Uitbreiden
Onvermijdelijk moet enige specifieke domeinkennis worden geïntegreerd in een NLP-pijplijn die met materiaal van deze soort omgaat, aangezien zeer pertinente woordvormen zoals IP-adressen en technische procesnamen niet terzijde mogen worden geschoven.
Later delen van het proces gebruiken een BiLSTM (Bidirectional LSTM)-netwerk om woordomstandigheid aan te pakken, door semantische rollen voor zinsdelen af te leiden, voordat niet-productieve woorden worden verwijderd. BiLSTM is goed geschikt voor dit, aangezien het langeafstandsafhankelijkheden kan correleren die optreden in omstandige documenten, waar meer aandacht en retentie nodig is om context af te leiden.

EXTRACTOR definieert semantische rollen en relaties tussen woorden, met rollen gegenereerd door Proposition Bank (PropBank)-annotaties.
In tests werd EXTRACTOR (deels gefinancierd door DARPA) in staat geacht om menselijke gegevensextractie uit DARPA-rapporten te evenaren. Het systeem werd ook getest tegen een grote hoeveelheid ongestructureerde rapporten van Microsoft Security Intelligence en de TrendMicro Threat Encyclopedia, en slaagde erin om pertinente informatie te extraheren in de meeste gevallen.
De onderzoekers geven toe dat de prestaties van EXTRACTOR waarschijnlijk zullen afnemen wanneer het probeert om acties te distilleren die zich over meerdere zinnen of alinea’s uitstrekken, hoewel het opnieuw inrichten van het systeem om andere rapporten te accommoderen een mogelijke oplossing is. Echter, dit is in wezen een terugval naar menselijke labeling per proxy.
Lengte == Autoriteit?
Het is interessant om op te merken dat de spanning tussen de manier waarop Google’s arcane SEO-algoritmes de afgelopen jaren steeds meer lange inhoud lijken te belonen (hoewel officieel advies op dit punt contradictoir is), en de uitdagingen die AI-onderzoekers (inclusief veel Google-onderzoeksinitiatieven) ondervinden bij het decoderen van intentie en daadwerkelijke gegevens uit deze steeds discursievere en langere artikelen.
Het is aanvechtbaar dat Google, door lange inhoud te belonen, een consistente kwaliteit veronderstelt die het nog niet noodzakelijkerwijs kan identificeren of kwantificeren via NLP-processen, behalve door het aantal autoriteitsites te tellen dat ernaar linkt (een ‘meatware’-metriek, in de meeste gevallen); en dat het daarom niet ongebruikelijk is om artikelen van 2.500 woorden of meer te zien die SERPS-prominentie bereiken, ongeacht narratieve ‘bloat’, zolang de extra inhoud maar breed verstaanbaar is en andere richtlijnen niet schendt.
Waar is het Recept?
Consequentelijk stijgen de woordtellingen, deels vanwege een echte behoefte aan goede lange inhoud, maar ook omdat ‘storifying’ van een paar schamele feiten de lengte van een stuk kan verhogen tot ideale SEO-standaarden, en toelaat dat lichte inhoud gelijkwaardig concurreert met meer inspanningsvolle output.
Een voorbeeld hiervan zijn receptensites, vaak geklaagd over in de Hacker News-gemeenschap voor het voorafgaan van de kerninformatie (het recept) met autobiografische of willekeurige inhoud ontworpen om een verhaalgedreven ‘receptervaring’ te creëren, en om wat anders een zeer lage woordtelling zou zijn, op te tillen naar het SEO-vriendelijke gebied van 2.500+ woorden.
Een aantal zuiver procedurele oplossingen zijn ontwikkeld om daadwerkelijke recepten te extraheren uit omstandige receptensites, inclusief open source receptenschrapers, en receptextractors voor Firefox en Chrome. Machine learning is ook betrokken bij dit, met verschillende benaderingen uit Japan, de VS en Portugal, evenals onderzoek van Stanford, onder anderen.
Wat betreft de bedreigingsinformatierapporten die door de onderzoekers van de Universiteit van Chicago zijn behandeld, kan de algemene praktijk van omstandige bedreigingsrapportage deels te wijten zijn aan de noodzaak om de omvang van een prestatie te weerspiegelen (die anders vaak in een alinea kan worden samengevat) door een zeer lange narratief te creëren eromheen, en woordlengte te gebruiken als een proxy voor de omvang van de inspanning die eraan is besteed, ongeacht toepasbaarheid.
Ten tweede, in een klimaat waarin de oorspronkelijke bron van een verhaal vaak verloren gaat door slechte citatiepraktijken van populaire nieuwsuitzendingen, garandeert het produceren van een grotere hoeveelheid woorden dan elke her-rapporterende journalist kan repliceren een SERPS-overwinning door pure woordvolume, onder de veronderstelling dat omstandigheid – nu een groeiende uitdaging voor NLP – op deze manier werkelijk wordt beloond.
e de oorspronkelijke bron van een verhaal vaak verloren gaat door slechte citatiepraktijken van populaire nieuwsuitzendingen, produceren van een hoger volume aan woorden dan elke her-rapporterende journalist kan repliceren, garandeert een SERPS-overwinning door pure woordvolume, onder de veronderstelling dat omstandigheid – nu een groeiende uitdaging voor NLP – op deze manier werkelijk wordt beloond.













