Η γωνία του Anderson
Η Μηχανική Μάθηση Εξάγει Δεδομένα Επίθεσης Από Περιγραφικές Αναφορές Απειλών

Νέα έρευνα από το Πανεπιστήμιο του Σικάγου δείχνει τη σύγκρουση που έχει προκύψει τα τελευταία δέκα χρόνια μεταξύ των οφελών του SEO για το περιεχόμενο μεγάλου μήκους και της δυσκολίας που αντιμετωπίζουν τα συστήματα μηχανικής μάθησης στην εξαγωγή των απαραίτητων δεδομένων από αυτό.
Στη διάρκεια της ανάπτυξης ενός συστήματος ανάλυσης NLP για την εξαγωγή των απαραίτητων πληροφοριών απειλής από αναφορές Πληροφοριών για τις Κυβερνοαπειλές (CTI), οι ερευνητές του Σικάγου αντιμετώπισαν τρία προβλήματα: οι αναφορές είναι συνήθως πολύ μεγάλες, με μόνο một μικρό τμήμα αφιερωμένο στην πραγματική συμπεριφορά της επίθεσης, η γραφή είναι πυκνή και γραμματικά σύνθετη, με εκτενείς domaine-ειδικές πληροφορίες που προϋποθέτουν προηγούμενη γνώση από τον αναγνώστη και το υλικό απαιτεί γνώση σχέσεων μεταξύ των τομέων, η οποία πρέπει να «θυμηθεί» για να κατανοηθεί στο контέκστ.
Περιγραφικές Αναφορές Απειλών
Το основικό πρόβλημα είναι η περιφρόνηση. Για παράδειγμα, η αναφορά του Σικάγου σημειώνει ότι μεταξύ των 42 σελίδων της αναφοράς απειλής του 2019 για το malware DustySky (aka NeD Worm), μόνο 11 προτάσεις ασχολούνται πραγματικά με τη συμπεριφορά της επίθεσης.
Το δεύτερο εμπόδιο είναι η σύνθετη δομή του κειμένου και, αποτελεσματικά, το μήκος της πρότασης: οι ερευνητές παρατηρούν ότι μεταξύ 4020 αναφορών απειλής από το κέντρο αναφορών απειλής της Microsoft (MSFT ), η μέση πρόταση αποτελείται από 52 λέξεις – μόνο εννέα λιγότερες από το μέσο μήκος πρότασης 500 χρόνια πριν (στο контέκστ του γεγονότος ότι το μήκος της πρότασης έχει μειωθεί 75% από τότε).
Ωστόσο, η αναφορά υποστηρίζει ότι αυτές οι μεγάλες προτάσεις είναι ουσιαστικά «συμπιεσμένα παραγράφους» από μόνα τους, γεμάτες με προτάσεις, επιθέσεις και επιρρήματα που κρύβουν την πυρήνα της πληροφορίας και ότι οι προτάσεις συχνά λείπουν της βασικής συμβατικής στίξης η οποία NLP συστήματα όπως spaCy, Stanford και NLTK βασίζονται για να εξαγάγουν στοιχεία ή να εξαγάγουν σκληρά δεδομένα.
NLP Για την Εξαγωγή των Απαραίτητων Πληροφοριών Απειλής
Το σύστημα μηχανικής μάθησης που έχουν αναπτύξει οι ερευνητές του Σικάγου για να αντιμετωπίσουν αυτό το πρόβλημα ονομάζεται EXTRACTOR και χρησιμοποιεί τεχνικές NLP για να δημιουργήσει γραφικά που αποστάζουν και συνοψίζουν τη συμπεριφορά της επίθεσης από αναφορές μεγάλου μήκους. Η διαδικασία απορρίπτει την ιστορική, αφηγηματική και sogar γεωγραφική διακόσμηση που δημιουργεί μια ενδιαφέρουσα και εξαντλητική «ιστορία» με το τίμημα της σαφούς προτεραιότητας της πληροφοριακής φόρτωσης.
Καθώς το контέκστ είναι ένα τόσο μεγάλο πρόβλημα στις περιγραφικές αναφορές απειλής, οι ερευνητές επέλεξαν το BERT (Bidirectional Encoder Representations from Transformer) μοντέλο αναπαράστασης γλώσσας над το Word2Vec της Google ή το GloVe (Global Vectors for Word Representation) του Stanford.
BERT αξιολογεί τις λέξεις από το περιβάλλον контέκστ και επίσης αναπτύσσει εμφυτεύσεις για υπο-λέξεις (π.χ. launch, launching και launches όλες οι λέξεις προέρχονται από launch). Αυτό βοηθά το EXTRACTOR να αντιμετωπίσει την τεχνική ορολογία που δεν είναι παρόν στην εκπαίδευση του BERT και να ταξινομήσει τις προτάσεις ως «παραγωγικές» (περιέχουν σχετικές πληροφορίες) ή «μη παραγωγικές».
Αύξηση της Τοπικής Λεξιλογίας
Απαραίτητα, κάποια ειδική γνώση του τομέα πρέπει να ενσωματωθεί σε μια διαδικασία NLP που ασχολείται με υλικό αυτού του είδους, поскольку πολύ σημαντικές λέξεις όπως οι διευθύνσεις IP και τα ονόματα τεχνικών διαδικασιών δεν πρέπει να απορριφθούν.
Αργότερα, η διαδικασία χρησιμοποιεί ένα BiLSTM (Bidirectional LSTM) δίκτυο για να αντιμετωπίσουν τη λεκτική περιφρόνηση, να εξαγάγουν σημαντικές ρόλους για τα τμήματα της πρότασης, πριν απομακρύνουν τις μη παραγωγικές λέξεις. BiLSTM είναι κατάλληλο για αυτό, поскольку μπορεί να συσχετίσει τις μακροχρόνιες εξαρτήσεις που εμφανίζονται σε περιγραφικά έγγραφα, όπου απαιτείται μεγαλύτερη προσοχή και διατήρηση για να εξαγάγει το контέκστ.

EXTRACTOR ορίζει σημαντικές ρόλους και σχέσεις μεταξύ των λέξεων, με ρόλους που παράγονται από Proposition Bank (PropBank) annotations.
Σε δοκιμές, το EXTRACTOR (μερικώς χρηματοδοτούμενο από το DARPA) βρέθηκε ικανό να ταιριάζει με την ανθρώπινη εξαγωγή δεδομένων από αναφορές του DARPA. Το σύστημα επίσης τρέχθηκε ενάντια σε ένα μεγάλο όγκο αναφορών χωρίς cấu trúc από την Microsoft Security Intelligence και το TrendMicro Threat Encyclopedia, εξαγώντας επιτυχώς τις σημαντικές πληροφορίες στην πλειοψηφία των περιπτώσεων.
Οι ερευνητές παραδέχονται ότι η απόδοση του EXTRACTOR είναι πιθανό να μειωθεί όταν προσπαθεί να εξαγάγει ενέργειες που συμβαίνουν σε πολλές προτάσεις ή παραγράφους, αν και η αναβάθμιση του συστήματος για να προσαρμοστεί σε άλλες αναφορές υποδεικνύεται ως ένας τρόπος προς τα εμπρός. Ωστόσο, αυτό είναι ουσιαστικά η επιστροφή στην ανθρώπινη οδηγία με ενδιάμεσο.
Μήκος == Εξουσία;
Είναι ενδιαφέρον να σημειωθεί η συνεχής ένταση μεταξύ του τρόπου με τον οποίο οι αλγόριθμοι SEO της Google φαίνεται να έχουν αumented το περιεχόμενο μεγάλου μήκους τα τελευταία χρόνια (αν και η επίσημη συμβουλή σε αυτό το σημείο είναι αντίθετη), και τις προκλήσεις που αντιμετωπίζουν οι ερευνητές AI (συμπεριλαμβανομένων πολλών μεγάλων ερευνητικών πρωτοβουλιών της Google) στην αποκωδικοποίηση της πρόθεσης και των πραγματικών δεδομένων από αυτά τα ολοένα και πιο περιγραφικά και μεγάλου μήκους άρθρα.
Είναι επιχειρήσιμο ότι, ανταποδοτώντας το περιεχόμενο μεγάλου μήκους, η Google υποθέτει μια συνεχή ποιότητα που δεν είναι能够 να αναγνωρίσει ή να ποσοτικοποιήσει ακόμη μέσω διαδικασιών NLP, εκτός από το να μετράει τον αριθμό των εξουσιοδότησεων που συνδέονται με αυτό (ένα «κρέας» μέτρο, στις περισσότερες περιπτώσεις) και ότι δεν είναι ασυνήθιστο να βλέπουμε αναρτήσεις 2.500 λέξεων ή περισσότερο να επιτύχουν SERPS προώθηση ανεξάρτητα από την αφηγηματική «φούσκα», εφόσον το επιπλέον περιεχόμενο είναι γενικά κατανοητό και δεν παραβιάζει άλλες οδηγίες.
Πού είναι η Συνταγή;
Συνεπώς, οι μετρήσεις των λέξεων αυξάνονται, εν μέρει λόγω μιας γνήσιας επιθυμίας για καλό περιεχόμενο μεγάλου μήκους, αλλά επίσης λόγω της «ιστοριοποίησης»了一些 λίγων γεγονότων μπορεί να αυξήσει το μήκος ενός κειμένου στα ιδανικά πρότυπα SEO και να επιτρέψει στο ελαφρύ περιεχόμενο να ανταγωνιστεί ισότιμα με υψηλότερη προσπάθεια.
Ένα παράδειγμα αυτού είναι οι ιστοσελίδες συνταγών, συχνά κατηγορούμενες από την κοινότητα Hacker News για το ότι προηγούνται της κεντρικής πληροφορίας (της συνταγής) με πολλές αυτοβιογραφικές ή φανταστικές πληροφορίες που σχεδιάζονται για να δημιουργήσουν μια αφηγηματική «εμπειρία συνταγής» και να ωθήσουν το τι θα ήταν αλλιώς ένα πολύ χαμηλό μέτρο λέξεων στο SEO-φιλικό 2.500+ λέξεις περιοχή.
Μια σειρά από απολύτως διαδικαστικές λύσεις έχουν προκύψει για την εξαγωγή των πραγματικών συνταγών από περιγραφικές ιστοσελίδες συνταγών, συμπεριλαμβανομένων ανοιχτών πηγών recipe scrapers και εξαγωγέων συνταγών για Firefox και Chrome. Η μηχανική μάθηση επίσης ασχολείται με αυτό, με διάφορες προσεγγίσεις από Ιαπωνία, ΗΠΑ και Πορτογαλία, καθώς και έρευνα από το Stanford, μεταξύ άλλων.
Σχετικά με τις αναφορές πληροφοριών απειλής που αντιμετωπίζουν οι ερευνητές του Σικάγου, η γενική πρακτική της περιγραφικής αναφοράς απειλής μπορεί να οφείλεται εν μέρει στην ανάγκη να αντανακλούν το μέγεθος μιας επιτεύξης (η οποία μπορεί να συνοψιστεί σε μια παράγραφο) δημιουργώντας μια πολύ μεγάλη αφήγηση γύρω από αυτό και χρησιμοποιώντας το μήκος της λέξης ως πρόσωπο για το μέγεθος της προσπάθειας που συμμετέχει, ανεξάρτητα από την εφαρμοσιμότητα.
Δεύτερον, σε ένα κλίμα όπου η αρχική πηγή μιας ιστορίας συχνά χάνεται λόγω κακών πρακτικών αναφοράς από δημοφιλείς ειδησεογραφικές πηγές, η παραγωγή ενός μεγαλύτερου όγκου λέξεων από οποιοδήποτε δημοσιογράφο που θα μπορούσε να αναπαραγάγει εγγυάται μια νίκη SERPS με το μέσο μήκος της λέξης, υποθέτοντας ότι η περιφρόνηση – τώρα μια αυξανόμενη πρόκληση για την NLP – πραγματικά ανταποδίδεται με αυτόν τον τρόπο.













