Andersonの視点
マシンラーニングによる攻撃データの抽出から冗長な脅威レポート

シカゴ大学での新しい研究は、過去10年間に、長文コンテンツのSEOの利点と、マシンラーニングシステムがそれから必要なデータを抽出することの難しさの間で生じた矛盾を示しています。
シカゴの研究者は、サイバーセキュリティ脅威インテリジェンス(CTI)レポートから重要な脅威情報を抽出するために、NLP分析システムを開発しました。しかし、彼らは3つの問題に直面しました。レポートは通常非常に長く、実際の攻撃行動にのみ少量のセクションが割り当てられていることです。スタイルは密度が高く、文法的に複雑で、読者に事前に知識があることを前提としたドメイン固有の情報が広範囲にわたり、文脈で理解するためにそれらを「暗記」する必要があります(恒久的な問題であると研究者は指摘しています)。
冗長な脅威レポート
主な問題は冗長性です。たとえば、シカゴの論文では、ClearSkyの2019年の42ページの脅威レポート(DustySky(別名NeD Worm)マルウェア)の中で、11文のみが実際に攻撃行動を扱い、概要を示しています。
2番目の障害はテキストの複雑さであり、実質的には文の長さです。研究者は、Microsoft (MSFT ) の脅威レポートセンターの4020の脅威レポートの中で、平均文は52ワードで構成されており、500年前(文の長さが75%減少したという事実の文脈で)と9語だけ短いものであることを観察しています。
しかし、論文では、これらの長い文は本質的に「圧縮されたパラグラフ」であり、節、副詞、形容詞で構成されており、情報の核となる意味を覆い隠しており、また、NLPシステム(NLP)が意図を推測したり、ハードデータを抽出するために依存する基本的な従来の句読点が欠けていることが多いと主張しています。
NLPによる重要な脅威情報の抽出
シカゴの研究者がこれに対処するために開発したマシンラーニングパイプラインは、EXTRACTORと呼ばれ、NLP技術を使用して、長文のレポートから攻撃行動を要約し、濃縮するグラフを生成します。プロセスでは、歴史的、物語的、地理的な装飾が除去され、情報ペイロードを明確に優先する代わりに、魅力的で詳細な「物語」を作成するために生じるものです。
コンテキストは冗長で長いCTIレポートで大きな課題であるため、研究者は、BERT(Bidirectional Encoder Representations from Transformer)言語表現モデルを、GoogleのWord2VecまたはStanfordのGloVe(Global Vectors for Word Representation)よりも選択しました。
BERTは、単語をその周囲のコンテキストから評価し、さらにサブワード(例:launch、launching、launchesはすべてlaunchに還元される)に対する埋め込みを開発します。これにより、EXTRACTORは、BERTのトレーニングモデルに存在しない技術用語を処理し、文を「生産的」(関連情報を含む)または「非生産的」に分類することができます。
ローカル語彙の増加
必然的に、このような材料を扱うNLPパイプラインに、特定のドメインの洞察が統合される必要があります。なぜなら、高度に関連するワードフォーム(IPアドレスや技術プロセス名など)は、却下されるべきではないからです。
プロセスの後半では、BiLSTM(Bidirectional LSTM)ネットワークを使用して、単語の冗長性に取り組み、文の部分に対して意味的な役割を導出し、非生産的な単語を削除します。BiLSTMは、このタスクに適しています。なぜなら、冗長な文書で発生する長距離の依存関係を関連付けることができるからです。ここでは、コンテキストを推測するために、より注意深く、保持力が必要です。

EXTRACTORは、PropBank(PropBank)注釈によって生成された役割を使用して、単語間の意味的な役割と関係を定義します。
テストでは、EXTRACTOR(DARPAからの部分的な資金提供)が、DARPAレポートからの人間によるデータ抽出と一致することが示されました。システムはまた、Microsoft Security IntelligenceとTrendMicro Threat Encyclopediaからの大量の構造化されていないレポートに対して実行され、多くの場合に重要な情報を抽出することが成功しました。
研究者は、EXTRACTORのパフォーマンスは、複数の文や段落にわたる行動を濃縮する際に低下する可能性が高いと認めていますが、システムを他のレポートに適応させることは前向きなステップであると示唆しています。ただし、これは本質的に人間によるラベリングに戻ることになります。
長さ == 権威?
注目すべきは、GoogleのSEOアルゴリズムが最近、長文コンテンツを増加的に報酬しているように見えていること(公式のアドバイスは矛盾している)と、AI研究者(多くの主要なGoogleの研究イニシアチブを含む)が、これらの増加的に物語的な長い記事から意図と実際のデータを解読する際に直面する課題の間の継続的な緊張です。
長文コンテンツを報酬することで、Googleは一貫した品質を前提としているが、それをNLPプロセスを通じて識別または量化することはできない(それをリンクする権威サイトの数で計る「肉体的」メトリックに頼る)と主張できます。したがって、物語の「膨張」があっても、追加のコンテンツが広く理解可能で、他のガイドラインに違反していない限り、2500ワード以上の投稿がSERPSの優位性を獲得することは珍しくありません。
レシピはどこにある?
したがって、単語数は増加しています。これは、良い長文コンテンツに対する本物の欲求によるものですが、また、少量の事実を「物語化」することで、記事の長さを理想的なSEO基準まで引き上げ、軽微なコンテンツをより努力のある出力と同等に競争させることができるためです。
例として、レシピサイトは、頻繁に、批判、批難されています。Hacker Newsコミュニティでは、レシピ(レシピ)を提供する前に、多くの自伝的または気まぐれなコンテンツでユーザーを迎え、物語駆動型の「レシピ体験」を作成し、2500語以上のSEOに優しい領域に、通常は非常に低い単語数を押し上げることができます。
冗長なレシピサイトから実際のレシピを抽出するためのいくつかの純粋に手続き的な解決策が登場しています。例えば、オープンソースのレシピスクレイパーや、FirefoxおよびChrome用のレシピ抽出ツールがあります。マシンラーニングもこの分野に関与しており、日本、米国、ポルトガル、およびスタンフォード大学を含むさまざまなアプローチがあります。
シカゴの研究者が対象とした脅威インテリジェンスレポートについては、冗長な脅威レポートの一般的な慣行は、成果の規模(通常は1つの段落でまとめることができる)を反映するために、非常に長い物語を作成する必要性に部分的に起因する可能性があります。また、物語の長さを使用して、関与する労力の規模を代理として使用します。
さらに、ストーリーの元の出典が、人気のあるニュースサイトによる悪い引用慣行のために、しばしば失われてしまう状況では、再報告するジャーナリストが複製することができないよりも高い単語数を生産することは、単語数だけでSERPSの勝利を保証することになります。ここで、冗長性は、実際にはこのように報酬されるという前提で、NLPへの成長する課題となっています。













