Góc nhìn Anderson

Máy Học Tập Lấy Dữ Liệu Tấn Công Từ Báo Cáo Đe DọaVerbose

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google
NLP mining

Nghiên cứu mới từ Đại học Chicago minh họa mâu thuẫn đã phát sinh trong 10 năm qua giữa lợi ích SEO của nội dung dài và khó khăn mà các hệ thống học máy gặp phải khi thu thập dữ liệu thiết yếu từ nó.

Trong việc phát triển một hệ thống phân tích NLP để trích xuất thông tin đe dọa thiết yếu từ các báo cáo Trí tuệ Đe dọa mạng (CTI), các nhà nghiên cứu Chicago đã gặp phải ba vấn đề: các báo cáo thường rất dài, chỉ có một phần nhỏ dành cho hành vi tấn công thực tế; phong cách dày đặc và phức tạp về mặt ngữ pháp, với thông tin chuyên ngành rộng lớn giả định kiến thức trước của người đọc; và tài liệu yêu cầu kiến thức mối quan hệ giữa các lĩnh vực, phải được ‘ghi nhớ’ để hiểu trong ngữ cảnh (một vấn đề dai dẳng, các nhà nghiên cứu lưu ý).

Báo Cáo Đe DọaVerbose

Vấn đề chính là tính dài dòng. Ví dụ, bài báo của Chicago lưu ý rằng trong báo cáo đe dọa 42 trang của ClearSky năm 2019 cho malware DustySky (còn được gọi là NeD Worm), chỉ 11 câu thực sự liên quan và phác thảo hành vi tấn công.

Nguyên nhân thứ hai là sự phức tạp của văn bản, và hiệu quả, độ dài câu: các nhà nghiên cứu quan sát thấy rằng trong số 4020 báo cáo đe dọa từ trung tâm báo cáo đe dọa của Microsoft (MSFT ), câu trung bình bao gồm 52 từ – chỉ ngắn hơn 9 từ so với độ dài câu trung bình 500 năm trước (trong bối cảnh độ dài câu đã giảm 75% kể từ đó).

Tuy nhiên, bài báo cho rằng những câu dài này về cơ bản là ‘các đoạn văn nén’ trong chính chúng, đầy đủ các mệnh đề, trạng từ và tính từ che giấu ý nghĩa cốt lõi của thông tin; và rằng các câu thường thiếu dấu câu cơ bản mà các hệ thống NLP như spaCy, Stanford và NLTK dựa vào để suy ra ý định hoặc trích xuất dữ liệu cứng.

NLP Để Trích Xuất Thông Tin Đe Dọa Quan Trọng

Dòng ống học máy mà các nhà nghiên cứu Chicago đã phát triển để giải quyết vấn đề này được gọi là EXTRACTOR, và sử dụng các kỹ thuật NLP để tạo ra các đồ thị tóm tắt và tóm tắt hành vi tấn công từ các báo cáo dài dòng, diễn dịch. Quá trình loại bỏ các trang trí lịch sử, tường thuật và thậm chí địa lý tạo ra một ‘câu chuyện’ hấp dẫn và đầy đủ chi tiết, nhưng lại làm lu mờ thông tin quan trọng.

Nguồn: https://arxiv.org/pdf/2104.08618.pdf

Nguồn: https://arxiv.org/pdf/2104.08618.pdf

Vì ngữ cảnh là một thách thức trong các báo cáo đe dọa dài dòng và phức tạp, các nhà nghiên cứu đã chọn mô hình đại diện ngôn ngữ BERT (Bidirectional Encoder Representations from Transformer) thay vì mô hình Word2Vec của Google hoặc GloVe (Global Vectors for Word Representation) của Stanford.

BERT đánh giá các từ dựa trên ngữ cảnh xung quanh và cũng phát triển các bản nhúng cho các từ con (tức là launch, launchinglaunches đều được rút gọn thành launch). Điều này giúp EXTRACTOR đối phó với từ vựng kỹ thuật không có trong mô hình đào tạo BERT và phân loại câu thành ‘sinh sản’ (chứa thông tin quan trọng) hoặc ‘không sinh sản’.

Tăng Cường Từ Vựng Địa Phương

Tất yếu, một số kiến thức chuyên ngành nhất định phải được tích hợp vào đường ống NLP khi xử lý tài liệu loại này, vì các dạng từ quan trọng như địa chỉ IP và tên quy trình kỹ thuật không được loại bỏ.

Phần sau của quá trình sử dụng mạng BiLSTM (Bidirectional LSTM) để giải quyết sự dài dòng của từ, suy ra vai trò ngữ nghĩa cho các phần câu, trước khi loại bỏ các từ không sinh sản. BiLSTM rất phù hợp cho việc này, vì nó có thể liên kết các phụ thuộc dài trong tài liệu dài dòng, nơi cần sự chú ý và ghi nhớ lớn hơn để suy ra ngữ cảnh.

EXTRACTOR định nghĩa vai trò ngữ nghĩa và mối quan hệ giữa các từ, với vai trò được tạo ra bởi chú thích Proposition Bank (PropBank).

EXTRACTOR định nghĩa vai trò ngữ nghĩa và mối quan hệ giữa các từ, với vai trò được tạo ra bởi chú thích Proposition Bank (PropBank).

Trong các thử nghiệm, EXTRACTOR (được tài trợ một phần bởi DARPA) đã được chứng minh là có khả năng khớp với việc trích xuất dữ liệu của con người từ các báo cáo của DARPA. Hệ thống cũng được chạy trên một lượng lớn báo cáo không cấu trúc từ Microsoft Security Intelligence và Encyclopedia Threat của TrendMicro, thành công trong việc trích xuất thông tin quan trọng trong đa số trường hợp.

Các nhà nghiên cứu thừa nhận rằng hiệu suất của EXTRACTOR có thể giảm khi cố gắng cô đọng các hành động xảy ra trên nhiều câu hoặc đoạn, mặc dù việc tái công cụ hóa hệ thống để phù hợp với các báo cáo khác được chỉ ra là một cách tiến bộ ở đây. Tuy nhiên, đây về cơ bản là việc quay lại việc gắn nhãn do con người thông qua đại lý.

Chiều Dài == Uy Tín?

Điều thú vị cần lưu ý là sự căng thẳng đang diễn ra giữa cách các thuật toán SEO bí ẩn của Google dường như đã đã tăng cường nội dung dài trong những năm gần đây (mặc dù lời khuyên chính thức về vấn đề này là mâu thuẫn), và các thách thức mà các nhà nghiên cứu AI (bao gồm nhiều đề án nghiên cứu của Google) phải đối mặt khi giải mã ý định và dữ liệu thực từ những bài viết dài dòng và phức tạp này.

Có thể lập luận rằng bằng cách thưởng cho nội dung dài, Google đang giả định một chất lượng nhất quán mà nó không nhất thiết có thể xác định hoặc định lượng được thông qua các quy trình NLP, ngoại trừ việc đếm số lượng trang web có thẩm quyền liên kết đến nó (một ‘thiết bị đo’ dựa trên con người); và rằng điều này không bất thường khi thấy các bài đăng có 2.500 từ hoặc nhiều hơn đạt được vị trí SERPS nổi bật bất kể ‘phồng’ câu chuyện, miễn là nội dung thêm vào là thông minh và không vi phạm các hướng dẫn khác.

Ở Đâu Là Công Thức?

Do đó, số từ đang tăng, một phần do sự mong muốn真正 nội dung dài, nhưng cũng vì ‘câu chuyện hóa’ một số sự kiện có thể làm tăng chiều dài của một bài viết lên đến tiêu chuẩn SEO lý tưởng, và cho phép nội dung yếu cạnh tranh công bằng với nội dung có nỗ lực cao hơn.

Một ví dụ về điều này là các trang web công thức, thường phàn nàn về trong cộng đồng Hacker News vì đặt nội dung cốt lõi (công thức) sau một lượng lớn nội dung tự sự hoặc nội dung tùy ý được thiết kế để tạo ra một ‘trải nghiệm công thức’ và đẩy chiều dài của bài viết lên vùng 2.500 từ hoặc nhiều hơn.

Một số giải pháp thủ tục thuần túy đã xuất hiện để trích xuất công thức thực sự từ các trang web công thức dài dòng, bao gồm công cụ trích xuất công thức mã nguồn mở và trích xuất công thức cho FirefoxChrome. Học máy cũng quan tâm đến vấn đề này, với các phương pháp tiếp cận từ Nhật Bản, MỹBồ Đào Nha, cũng như nghiên cứu từ Stanford, trong số những người khác.

Về các báo cáo trí tuệ đe dọa được các nhà nghiên cứu Chicago giải quyết, việc thực hành báo cáo đe dọa dài dòng có thể là do một phần nhu cầu phản ánh quy mô của một thành tựu (có thể thường được tóm tắt trong một đoạn) bằng cách tạo ra một câu chuyện dài xung quanh nó, và sử dụng chiều dài từ như một đại diện cho quy mô nỗ lực liên quan, bất kể tính khả dụng.

Thứ hai, trong một khí hậu nơi nguồn gốc của một câu chuyện thường bị mất do các thực hành trích dẫn kém của các hãng tin phổ biến, việc tạo ra một lượng từ lớn hơn bất kỳ nhà báo nào có thể sao chép lại đảm bảo một chiến thắng SERPS bằng khối lượng từ thuần túy, giả sử rằng tính dài dòng – hiện là một thách thức ngày càng tăng đối với NLP – thực sự được thưởng trong cách này.

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai