มุมมองของ Anderson
การเรียนรู้ของเครื่องจักรที่ช่วยให้สามารถดึงข้อมูลการโจมตีจากรายงานภัยคุกคามที่มีคำพูดมาก

การวิจัยใหม่จากมหาวิทยาลัยชิคาโก้แสดงให้เห็นถึงความขัดแย้งระหว่างประโยชน์ของ SEO ที่ได้รับจากเนื้อหาที่ยาวและความยากที่ระบบการเรียนรู้ของเครื่องจักรมีในการดึงข้อมูลที่จำเป็นจากเนื้อหานั้น
ในการพัฒนาระบบวิเคราะห์ NLP เพื่อดึงข้อมูลภัยคุกคามที่สำคัญจากรายงาน Cyber Threat Intelligence (CTI) นักวิจัยจากชิคาโก้พบกับปัญหา 3 ประการ: รายงานมักจะยาวมาก โดยมีเพียงส่วนเล็กๆ ที่อุทิศให้กับการโจมตีจริง; สไตล์เป็นภาษาที่ซับซ้อนและมีคำศัพท์เฉพาะทางที่ต้องใช้ความรู้ก่อนหน้า; และวัสดุเหล่านี้ต้องการความรู้ความสัมพันธ์ระหว่างโดเมนซึ่งต้อง “จดจำ” เพื่อเข้าใจในบริบท (ปัญหาที่ ยังคงอยู่ นักวิจัยกล่าว)
รายงานภัยคุกคามที่มีคำพูดมาก
ปัญหาหลักคือความยาวของรายงาน ตัวอย่างเช่น ในรายงานของ ClearSky ในปี 2019 สำหรับ มัลแวร์ DustySky (หรือ NeD Worm) มีเพียง 11 ประโยคที่เกี่ยวข้องกับการโจมตีจริง
อุปสรรคที่สองคือความซับซ้อนของข้อความ และความยาวของประโยค: นักวิจัยสังเกตเห็นว่าในรายงานภัยคุกคาม 4020 รายการจากศูนย์รายงานภัยคุกคามของ Microsoft (MSFT ) ประโยคโดยเฉลี่ยประกอบด้วย 52 คำ ซึ่งไม่ห่างไกลจากความยาวประโยคเฉลี่ย 500 ปีที่แล้ว (ในบริบทที่ความยาวประโยค ลดลง 75% ตั้งแต่นั้น)
อย่างไรก็ตาม วิทยานิพนธ์ยืนยันว่าประโยคเหล่านี้เป็น “ประโยคที่ถูกบีบอัด” ซึ่งมีคำศัพท์มากมายและขาดการ пунк์ตะอีกด้วย และประโยคเหล่านี้มักจะขาดการ пунк์ตะที่พื้นฐานซึ่งระบบ NLP เช่น NLP เช่น spaCy, Stanford และ NLTK พึ่งพาในการอนุมานหรือดึงข้อมูล
NLP เพื่อดึงข้อมูลภัยคุกคามที่สำคัญ
ระบบการเรียนรู้ของเครื่องจักรที่นักวิจัยจากชิคาโก้พัฒนาขึ้นเพื่อแก้ไขปัญหานี้เรียกว่า EXTRACTOR ซึ่งใช้เทคนิค NLP เพื่อสร้างกราฟที่รวมและสรุปการโจมตีจากรายงานที่ยาวและซับซ้อน
เนื่องจากบริบทเป็นปัญหาที่สำคัญในรายงานภัยคุกคามที่ยาวและซับซ้อน นักวิจัยจึงเลือก BERT (Bidirectional Encoder Representations from Transformer) เป็นโมเดลการแสดงภาษาแทน Google’s Word2Vec หรือ Stanford’s GloVe (Global Vectors for Word Representation)
BERT ประเมินคำจากบริบทโดยรอบ และพัฒนา การฝังตัว สำหรับคำย่อย (เช่น launch, launching และ launches ล้วนมาจาก launch) ซึ่งช่วยให้ EXTRACTOR สามารถจัดการกับคำศัพท์ทางเทคนิคที่ไม่มีอยู่ในโมเดลการฝึกอบรมของ BERT และสามารถจำแนกประโยคเป็น ‘ผลผลิต’ (มีข้อมูลที่เกี่ยวข้อง) หรือ ‘ไม่ผลผลิต’
การเพิ่มคำศัพท์ท้องถิ่น
โดยไม่ต้องสงสัยว่าบางส่วนของข้อมูลโดเมนจำเป็นต้องรวมเข้ากับระบบ NLP ที่จัดการกับวัสดุประเภทนี้ เนื่องจากคำศัพท์ที่เกี่ยวข้องอย่างมาก เช่น ที่อยู่ IP และชื่อกระบวนการทางเทคนิคไม่ควรทิ้งไป
ส่วนหลังของกระบวนการนี้ใช้ BiLSTM (Bidirectional LSTM) เพื่อจัดการกับความยาวของคำ โดยอนุมานบทบาททางวากยสัมพันธ์สำหรับส่วนของประโยค ก่อนที่จะลบคำที่ไม่ผลผลิต BiLSTM เหมาะสมสำหรับสิ่งนี้ เนื่องจากสามารถสัมพันธ์กับความสัมพันธ์ที่มีระยะห่างไกลที่ปรากฏในเอกสารที่ยาวและซับซ้อน ซึ่งต้องการความสนใจและความจำมากขึ้นเพื่ออนุมานบริบท

EXTRACTOR นิยามบทบาททางวากยสัมพันธ์และความสัมพันธ์ระหว่างคำ โดยมีบทบาทที่สร้างขึ้นโดย Proposition Bank (PropBank) annotations
ในการทดสอบ EXTRACTOR (ที่ได้รับการสนับสนุนบางส่วนจาก DARPA) พบว่าสามารถจับคู่กับการดึงข้อมูลของมนุษยาจากรายงานของ DARPA ระบบนี้ยังถูกทดสอบกับรายงานที่ไม่มีโครงสร้างจำนวนมากจาก Microsoft Security Intelligence และ TrendMicro Threat Encyclopedia โดยสามารถดึงข้อมูลที่เกี่ยวข้องได้มากในกรณีส่วนใหญ่
นักวิจัยยอมรับว่าประสิทธิภาพของ EXTRACTOR อาจลดลงเมื่อพยายามดึงข้อมูลที่เกิดขึ้นข้ามหลายประโยคหรือย่อหน้า แต่การปรับระบบให้เหมาะสมกับรายงานอื่นๆ เป็นวิธีที่ดีในการแก้ไขปัญหานี้
ความยาว == อำนาจ?
เป็นเรื่องที่น่าสนใจที่จะสังเกตเห็นความตึงเครียดระหว่างวิธีที่อัลกอริทึม SEO ของ Google ดูเหมือนจะ ให้รางวัลเนื้อหาที่ยาว ในช่วงไม่กี่ปีที่ผ่านมา (แม้ว่าคำแนะนำอย่างเป็นทางการในเรื่องนี้ จะขัดแย้งกัน) และความท้าทายที่นักวิจัย AI ต้องเผชิญในการถอดรหัสความตั้งใจและข้อมูลจริงจากบทความที่ยาวและซับซ้อนเหล่านี้
เป็นเรื่องที่สามารถโต้แย้งได้ว่าการให้รางวัลเนื้อหาที่ยาวของ Google ถือว่าเป็นคุณภาพที่สม่ำเสมอซึ่งยังไม่สามารถระบุหรือวัดได้ ยกเว้นการนับจำนวนไซต์ที่เชื่อมโยงเข้ามา (มาตรการ “肉” ส่วนใหญ่); และว่าไม่ใช่เรื่องแปลกที่จะเห็นโพสต์ที่มี 2,500 คำหรือมากกว่านั้นที่ได้รับการจัดอันดับ SERPS โดยไม่คำนึงถึง “การบวม” ของเรื่องราว ตราบเท่าที่เนื้อหาพิเศษนั้นเข้าใจได้และไม่ละเมิดแนวทางใดๆ
สูตรอยู่ที่ไหน?
ดังนั้น จำนวนคำที่ใช้ในการเขียนบล็อก จึงเพิ่มขึ้น โดยส่วนหนึ่งมาจาก ความต้องการเนื้อหาที่ยาวและดี แต่ยังมาจาก “การสร้างเรื่องราว” ที่สามารถเพิ่มความยาวของเนื้อหาได้ และทำให้เนื้อหาที่มีเพียงเล็กน้อยสามารถแข่งขันกับเนื้อหาที่มีคุณภาพสูงได้
ตัวอย่างหนึ่งคือเว็บไซต์สูตรอาหาร ซึ่ง บ่อยครั้ง ร้องเรียน ใน ชุมชน Hacker News สำหรับการเพิ่มเนื้อหาอัตชีวประวัติหรือเนื้อหาที่ไม่เกี่ยวข้องเพื่อสร้าง “ประสบการณ์การทำอาหาร” และเพิ่มความยาวของเนื้อหาให้ถึงมาตรฐาน SEO ที่ 2,500 คำหรือมากกว่านั้น
มีวิธีแก้ปัญหาที่เป็นกระบวนการเพื่อดึงสูตรอาหารที่แท้จริงออกจากเว็บไซต์สูตรอาหารที่ยาวและซับซ้อน รวมถึง เครื่องดึงสูตรอาหาร และเครื่องดึงสูตรอาหารสำหรับ Firefox และ Chrome การเรียนรู้ของเครื่องจักรยังเกี่ยวข้องกับเรื่องนี้ โดยมีการเข้าใกล้ต่างๆ จาก ญี่ปุ่น, สหรัฐอเมริกา และ โปรตุเกส รวมถึงการวิจัยจาก Stanford และอื่นๆ
ในกรณีของรายงานภัยคุกคามที่นักวิจัยจากชิคาโก้กล่าวถึง การใช้รายงานที่ยาวและซับซ้อนอาจเป็นเพราะความจำเป็นที่จะสะท้อนถึงขนาดของความสำเร็จ (ซึ่งสามารถสรุปได้ในย่อหน้าเดียว) โดยการสร้างเรื่องราวที่ยาวและใช้ความยาวของคำเป็นแทนของความพยายามที่เกี่ยวข้อง โดยไม่คำนึงถึงความเกี่ยวข้อง
อีกอย่างหนึ่ง ในสภาพแวดล้อมที่ที่มาของเรื่องราวมักจะ สูญเสียไปกับการอ้างอิงที่ไม่ดี ของสำนักข่าวที่ได้รับความนิยม การผลิตปริมาณคำที่มากกว่าที่นักข่าวที่รายงานซ้ำสามารถทำได้ รับประกันชัยชนะ SERPS โดยปริมาณคำ โดยสมมติว่าความยาวของคำ – ซึ่งเป็นความท้าทายที่เพิ่มขึ้นสำหรับ NLP – ได้รับการตอบแทนในลักษณะนี้
e the originating source of a story is often lost to bad citation practices by popular news outlets, producing a higher volume of words than any re-reporting journalist could replicate guarantees a SERPS win by sheer word-volume, assuming that verbosity – now a growing challenge to NLP – is really rewarded in this way.













