Anderson’un Açısı
Makine Öğrenimi, Uzun ve Detaylı Tehdit Raporlarından Saldırı Verilerini Çıkarır

Chicago Üniversitesi’nden yapılan yeni bir araştırmada, son on yılda uzun içeriklerin SEO avantajları ile bu içeriklerden önemli verileri çıkarmada makinelerin karşılaştığı zorluklar ortaya konuyor.
Cyber Threat Intelligence (CTI) raporlarından önemli tehdit bilgilerini çıkarmak için geliştirilen NLP analiz sistemi, Chicago araştırmacıları tarafından üç problemle karşılaşıldı: raporlar genellikle çok uzundur ve sadece küçük bir bölümü gerçek saldırı davranışıyla ilgilidir; stil yoğun ve gramer olarak karmaşıktır, okuyucunun önceden bilgi sahibi olması gereken geniş alanbilgi içerir ve materyal, anlamak için ‘hafızada tutulması’ gereken alanlararası ilişki bilgilerini gerektirir (bir süregelen problem, araştırmacılar not ediyor).
Uzun ve Detaylı Tehdit Raporları
Birinci problem,Verbosity’dir. Örneğin, Chicago makalesi, ClearSky’in 2019 yılında 42 sayfalık tehdit raporunda, sadece 11 cümle gerçekten saldırı davranışıyla ilgili ve onu açıklıyor.
İkinci engel, metin karmaşıklığı ve etkili olarak cümle uzunluğudur: araştırmacılar, Microsoft’ (MSFT ) un tehdit rapor merkezi tarafından sağlanan 4020 tehdit raporunda, ortalama cümle 52 kelimeden oluşuyor – sadece dokuz kısa 500 yıl önce (cümle uzunluğunun %75 oranında azaldığı gerçeğinin bağlamında).
Ancak, makale, bu uzun cümlelerin esasen ‘sıkıştırılmış paragraflar’ olduğunu, çok sayıda cümle içi unsur, sıfat ve zarf içerdiğini ve temel anlamı gizlediğini ve cümlelerin genellikle NLP sistemlerinin anlam çıkarmak veya veri çıkarmak için güvendiği temel geleneksel noktalama işaretlerini içermediğini iddia ediyor. NLP sistemleri gibi spaCy, Stanford ve NLTK.
NLP ile Önemli Tehdit Bilgilerini Çıkarmak
Chicago araştırmacıları tarafından geliştirilen ve bu sorunu çözmek için kullanılan makine öğrenimi pipeline’ı EXTRACTOR olarak adlandırılmaktadır ve NLP tekniklerini kullanarak, uzun ve karmaşık raporlardan saldırı davranışını özetleyen grafikler oluşturur. Bu işlem, tarihsel, anlatısal ve coğrafi süslemeleri atlar ve sadece bilgi yükünü önceliklendirir.
Bu tür uzun ve karmaşık CTI raporlarında bağlamın zorluğu nedeniyle araştırmacılar, BERT (Bidirectional Encoder Representations from Transformer) dil temsil modelini, Google’ ın Word2Vec veya Stanford’un GloVe (Global Vectors for Word Representation) yerine seçtiler.
BERT, kelimeleri çevreleyen bağlamdan değerlendirir ve ayrıca gömme için alt kelimeler (örneğin, launch, launching ve launches hepsi launch‘e indirgenir) oluşturur. Bu, EXTRACTOR’un teknik sözcük dağarcığını BERT’nin eğitim modelinde mevcut olmayan kelimelerle başa çıkabilmesini ve cümleleri ‘verimli’ (ilgili bilgi içeren) veya ‘verimsiz’ olarak sınıflandırabilmesini sağlar.
Yerel Sözcük Dağarcığını Artırmak
Bu tür materyallerle çalışan NLP pipeline’ına bazı özel alan bilgilerinin entegre edilmesi kaçınılmazdır, çünkü IP adresleri ve teknik işlem adları gibi önemli kelime formları atılmamalıdır.
Sürecin sonraki kısımları, BiLSTM (Bidirectional LSTM) ağı kullanır ve kelime verbositesini ele alır, cümle parçaları için anlamsal roller türetir ve sonra verimsiz kelimeleri kaldırır. BiLSTM, bu tür uzun belgelerde görülen uzun mesafeli bağımlılıkları ilişkilendirebildiği için bu iş için uygun bir seçimdir ve bağlamı çıkarmak için daha fazla dikkat ve hatırlama gereklidir.

EXTRACTOR, kelimeler arasındaki anlamsal rolleri ve ilişkileri tanımlar, roller Proposition Bank (PropBank) anotasyonları tarafından oluşturulur.
Testlerde, EXTRACTOR (kısmen DARPA tarafından finanse edildi), DARPA raporlarından insan tarafından çıkarılan verileri eşleştirebilecek kapasiteye sahip bulundu. Sistem ayrıca, Microsoft Güvenlik Zekası ve TrendMicro Tehdit Ansiklopedisi’nden büyük miktarda yapılandırılmamış raporlara karşı çalıştırıldı ve většesinde önemli bilgileri başarıyla çıkardı.
Araştırmacılar, EXTRACTOR’un performansı, birden fazla cümle veya paragraf boyunca gerçekleşen eylemleri özette sunmaya çalışırken muhtemelen azalabileceğini kabul ediyorlar, ancak bu konuda sistemin yeniden düzenlenmesinin bir yol olarak önerildiğini belirtiyorlar. Ancak bu, esasen insan tarafından yürütülen etiketleme işlemine geri dönmektir.
Uzunluk == Otorite mi?
Google’ın karmaşık SEO algoritmalarının, son yıllarda uzun içerikleri giderek daha fazla ödüllendirdiği (resmi tavsiyelerin bu konuda çelişkili olduğu) ve AI araştırmacılarının (çoğu büyük Google araştırma girişimi dahil) bu uzun ve karmaşık makalelerden anlam ve gerçek verileri çıkarmada karşılaştıkları zorluklar arasındaki devam eden gerilimi not etmek intéressantr.
Uzun içerikleri ödüllendirmekte, Google’un, henüz NLP süreçleriyle tanımlayamadığı veya ölçemeyeceği bir kaliteyi varsaydığı ve genellikle sadece o içeriklere bağlantı veren otorite sitelerinin sayısını sayarak ölçtüğü söylenebilir; ve bu nedenle, 2.500 kelimeden fazla olan yazıların, anlatı ‘şişkinliği’ olmadan, diğer rehberlere göre daha üstün bir SERPS konumuna ulaştığı görülebilir.
Tarif Nerede?
Sonuç olarak, kelime sayıları artıyor, kısmen iyi uzun içeriklere olan gerçek bir arzudan, ancak aynı zamanda SEO standartlarına uygun uzunluğu elde etmek için birkaç az фактın ‘hikayeleştirilmesi’ ve düşük çaba gerektiren içeriklerin daha yüksek çaba gerektiren içeriklerle eşit bir şekilde yarışabilmesi için.
Bir örnek, sıklıkla şikayet edilen tarif siteleridir. Bu siteler, temel bilgileri (tarifi) autobiografik veya fantastik içerikle süsleyerek ve bu şekilde SEO dostu 2.500+ kelime bölgesine ulaşarak ‘tarif deneyimi’ yaratmaya çalışırlar.
Sadece tarifleri çıkarmak için çeşitli prosedürel çözümler geliştirilmiştir, bunlar arasında açık kaynaklı tarif kazıyıcıları ve Firefox ve Chrome için tarif çıkarıcıları bulunur. Makine öğrenimi de bu konuda çalışmaktadır ve çeşitli yaklaşımlar Japonya, ABD ve Portekiz’den ve Stanford’dan araştırmalar yapılmaktadır.
Tehdit istihbarat raporlarına gelince, Chicago araştırmacılarının ele aldığı genel uygulama, muhtemelen bir başarıyı yansıtmak için gereken ölçek tarafından belirlenir ve bu, genellikle bir paragrafı aşan bir uzunluğa sahip uzun bir anlatı oluşturarak word-length’i ölçek için bir proxy olarak kullanılmasıdır, uygulanabilirlikten bağımsız olarak.
İkincisi, bir haber kaynağının kökeninin genellikle kaynak gösterme uygulamalarının kötü olması nedeniyle popüler haber ajansları tarafından kaybedildiği bir ortamda, herhangi bir yeniden raporlama gazetecisinin yeniden üretemeyeceği kadar yüksek bir kelime hacmi üretmek, SERPS’te bir galibiyet garantisi sağlar, varsayıldığı üzere, verbosity – şimdi NLP için bir büyüyen zorluk – gerçekten bu şekilde ödüllendiriliyorsa.













