Anderson의 관점
기계 학습은冗長한 위협 보고서에서 공격 데이터를 추출합니다

시카고 대학의 새로운 연구는 지난 10년 동안 장기 콘텐츠의 SEO 이점과 기계 학습 시스템이 그로부터 필수 데이터를 추출하는 어려움 사이에 발생한 갈등을 보여줍니다.
시카고 연구자들은 사이버 위협 인텔리전스(CTI) 보고서에서 필수 위협 정보를 추출하기 위한 NLP 분석 시스템을 개발하면서 세 가지 문제에 직면했습니다. 보고서가 일반적으로 매우 길고 실제 공격 동작에 대한 작은 섹션만 포함하며, 스타일이 밀도 있고 문법적으로 복잡하여 도메인 특정 정보를 광범위하게 포함하고 있으며, 이는 독자가 이전에 알고 있는 것을 전제로 하며, 이 자료는 문맥에서 이해하기 위해 교차 도메인 관계 지식을 ‘기억’해야 합니다(연구자들은 지적함).
冗長한 위협 보고서
주된 문제는冗長함입니다. 예를 들어, 시카고 논문은 ClearSky의 2019년 42페이지의 DustySky(aka NeD Worm) 악성 코드 위협 보고서 중 실제 공격 동작을 설명하는 문장이 11개뿐임을 지적합니다.
두 번째 장애물은 텍스트의 복잡성과 효과적으로 문장 길이입니다. 연구자들은 Microsoft (MSFT ) 의 위협 보고 센터의 4020개의 위협 보고서 중 평균 문장이 52개의 단어로 구성되어 있음을 관찰했으며, 이는 500년 전(그 당시 문장 길이가 75% 감소한 이후)의 평균 문장 길이보다 9개 단어만 적습니다.
그러나 이 논문은 이러한 긴 문장이 본질적으로 ‘압축된 단락’이며, 어구, 부사, 형용사로 구성되어 있으며 핵심 의미를 가리고 있으며, 이러한 문장이 종종 NLP 시스템이 의도나 하드 데이터를 추론하는 데 사용하는 기본적인 전통적인 구두점이 부족하다고 주장합니다.
NLP를 사용하여 중요한 위협 정보 추출
시카고 연구자들이 개발한 기계 학습 파이프라인은 EXTRACTOR라고 하며, NLP 기술을 사용하여 긴 보고서에서 공격 동작을 요약하고 추출하는 그래프를 생성합니다. 이 프로세스는 정보적 페이로드를 명확하게 우선순위에 두는 비용으로 역사적, 내러티브, 지리적 장식과 같은 것을 버립니다.
Verbose하고 prolix한 CTI 보고서에서 문맥이如此 큰 도전이기 때문에, 연구자들은 Google의 Word2Vec 또는 Stanford의 GloVe 대신 BERT(Bidirectional Encoder Representations from Transformer) 언어 표현 모델을 선택했습니다.
BERT는 주변 문맥에서 단어를 평가하고, 또한 subwords(예: launch, launching, launches)에 대한 임베딩을 개발합니다(즉, launch, launching, launches는 모두 launch로 축소됨). 이는 EXTRACTOR가 기술 용어가 포함된 경우에 도움이 되며, 문장을 ‘생산적’으로 분류할 수 있습니다(관련 정보가 포함됨).
로컬 어휘 증가
이와 같은 종류의 자료를 다루는 NLP 파이프라인에 일부 도메인 인사이트를 통합해야 합니다. 왜냐하면 IP 주소와 기술 프로세스 이름과 같은 매우 관련된 단어 형태가 버려져서는 안되기 때문입니다.
이후 과정에서는 BiLSTM(Bidirectional LSTM) 네트워크를 사용하여 단어冗長함을 다루고, 문장 부분에 대한 의미 역할을 파생하며, 비생산적 단어를 제거합니다. BiLSTM은 이러한冗長한 문서에서 나타나는 장거리 의존성을 상관관계를 설정할 수 있기 때문에 잘 적합합니다. 여기서 더 많은 주의와 유지가 필요하여 문맥을 추론합니다.
테스트에서 EXTRACTOR는 DARPA 보고서에서 인간이 추출한 데이터와 일치하는 능력을 보여주었습니다. 시스템은 또한 Microsoft Security Intelligence와 TrendMicro Threat Encyclopedia의大量의 비정형 보고서에 대해 성공적으로 중요한 정보를 추출했습니다.
연구자들은 EXTRACTOR의 성능이 여러 문장이나 단락에 걸쳐 발생하는 동작을 요약하려고 할 때 감소할 가능성이 있다고 인정합니다. 그러나 이 경우에는 시스템을 다른 보고서에 맞게 재구성하는 것이 앞으로 나아가는 방향입니다. 그러나 이것은 본질적으로 인간 주도 레이블링을 대리하는 것입니다.
길이 == 권위?
Google의 미지의 SEO 알고리즘이 최근 몇 년 동안 점점 더 긴 콘텐츠를 보상하는 방식과, AI 연구자들이 이러한 콘텐츠에서 의도와 실제 데이터를 해독하는 어려움 사이에 계속되는 긴장감은 흥미롭습니다(많은 주요 Google 연구 이니셔티브를 포함하여).
Google가 긴 콘텐츠를 보상하는 것은 일관된 품질을 가정하는 것일 수 있으며, 이는 NLP 프로세스를 통해 아직 식별하거나 양화할 수 없는 것으로 보입니다. 그러나 이는 링크하는 권위 사이트의 수를 세는 ‘육체적’ 지표를 통해 수행되며, 이는 대부분의 경우입니다. 따라서 2,500단어 이상의 게시물이 ‘스토리’의 Narrative ‘부풀림’에 관계없이 SERPS 프로미넌스를 얻는 것은 놀라운 일이 아닙니다.
레시피는 어디에?
따라서, 단어 수는 증가하고 있으며, 이는 좋은 장기 콘텐츠에 대한 진정한 바람 때문이기도 하지만, 몇 가지 사실을 ‘스토리화’하여 길이를 이상적인 SEO 표준으로 높이고, 약간의 콘텐츠를 더 많은 노력으로 경쟁할 수 있도록 하는 것도 이유입니다.
레시피 사이트는 예입니다. 이러한 사이트는 종종 핵심 정보(레시피)를 자서전적 또는 환상적인 콘텐츠로 둘러싸여 있으며, 이는 이야기 주도형 ‘레시피 경험’을 만들고, 그렇지 않으면 매우 낮은 단어 수를 SEO 친화적인 2,500단어 이상의 지역으로 밀어 올리기 위한 것입니다.
레시피 사이트에서 실제 레시피를 추출하기 위한 순수한 절차적 솔루션이出现했습니다. 오픈 소스 레시피 스크레이퍼와 Firefox 및 Chrome용 레시피 추출기가 포함됩니다. 또한 일본, 미국, 포르투갈 등에서 다양한 접근 방식이 있으며, 스탠퍼드 연구도 포함됩니다.
시카고 연구자들이 다루는 위협 인텔리전스 보고서와 관련하여冗長한 위협 보고의 일반적인 관행은 성과를 반영하는 데 필요한 규모(일반적으로 단락으로 요약할 수 있음)를 만들기 위해 매우 긴 내러티브를 생성하고, 노력의 규모를 나타내는 대리인으로 단어 길이를 사용하는 데 일부归因될 수 있습니다.
둘째, 뉴스 아웃レット에서 나쁨 인용 관행으로 인해 이야기의 원래 출처가 종종 손실되는 경우에, 어떤 재보고 저널리스트도 복제할 수 있는 단어의 더 높은 볼륨을 생성하면, 단순히 단어 볼륨으로 SERPS 승리를 보장하며,冗長함이 실제로 이러한 방식으로 보상된다면, 이는 NLP에 대한 새로운 도전입니다.














