Ángulo de Anderson
Aprendizaje automático extrae datos de ataques de informes de amenazas verbosos

Nueva investigación de la Universidad de Chicago ilustra el conflicto que ha surgido en la última década entre los beneficios de SEO de contenido de larga forma y la dificultad que los sistemas de aprendizaje automático tienen para extraer datos esenciales de él.
Al desarrollar un sistema de análisis de NLP para extraer información de amenazas esenciales de los informes de Inteligencia de Amenazas Cibernéticas (CTI), los investigadores de Chicago enfrentaron tres problemas: los informes suelen ser muy largos, con solo una pequeña sección dedicada al comportamiento de ataque real; el estilo es denso y gramaticalmente complejo, con información específica del dominio que presume conocimiento previo por parte del lector; y el material requiere conocimiento de relaciones entre dominios, que debe ser “memorizado” para entenderlo en contexto (un problema persistente, señalan los investigadores).
Informes de amenazas verbosos
El problema principal es la verbosidad. Por ejemplo, el papel de Chicago señala que entre el informe de amenazas de 42 páginas de ClearSky de 2019 para el malware DustySky (también conocido como gusano NeD), solo 11 oraciones tratan y describen el comportamiento de ataque.
El segundo obstáculo es la complejidad del texto, y, efectivamente, la longitud de las oraciones: los investigadores observan que entre 4020 informes de amenazas del centro de informes de amenazas de Microsoft (MSFT ), la oración promedio comprende 52 palabras, solo nueve menos que la longitud promedio de oración hace 500 años (en el contexto de que la longitud de las oraciones ha disminuido un 75% desde entonces).
Sin embargo, el papel sostiene que estas oraciones largas son esencialmente “párrafos comprimidos” en sí mismas, llenas de cláusulas, adverbios y adjetivos que ocultan el significado central de la información; y que las oraciones a menudo carecen de la puntuación convencional básica en la que los sistemas de NLP como spaCy, Stanford y NLTK confían para inferir la intención o extraer datos duros.
NLP para extraer información de amenazas salientes
La tubería de aprendizaje automático que los investigadores de Chicago han desarrollado para abordar esto se llama EXTRACTOR, y utiliza técnicas de NLP para generar gráficos que destilan y resumen el comportamiento de ataque de informes largos y discursivos. El proceso descarta la ornamentación histórica, narrativa y geográfica que crea una “historia” atractiva y exhaustiva a expensas de priorizar claramente la carga de información.
Dado que el contexto es un desafío en los informes de CTI verbosos y prolijos, los investigadores eligieron el modelo de representación de lenguaje BERT (Bidirectional Encoder Representations from Transformer) sobre el Word2Vec de Google o el GloVe (Global Vectors for Word Representation) de Stanford.
BERT evalúa las palabras desde su contexto circundante y también desarrolla incrustaciones para subpalabras (es decir, lanzamiento, lanzando y lanzamientos se reducen todos a lanzamiento). Esto ayuda a EXTRACTOR a hacer frente al vocabulario técnico que no está presente en el modelo de entrenamiento de BERT y a clasificar las oraciones como “productivas” (que contienen información pertinente) o “no productivas”.
Aumentar el vocabulario local
Inevitablemente, alguna perspicacia específica del dominio debe integrarse en una tubería de NLP que lidia con material de este tipo, ya que formas de palabras muy pertinentes como direcciones IP y nombres de procesos técnicos no deben ser descartadas.
Partes posteriores del proceso utilizan una red BiLSTM (Bidirectional LSTM) para abordar la verbosidad de las palabras, derivando roles semánticos para partes de oraciones, antes de eliminar palabras no productivas. BiLSTM es adecuado para esto, ya que puede correlacionar las dependencias de larga distancia que aparecen en documentos verbosos, donde se requiere mayor atención y retención para deducir el contexto.

EXTRACTOR define roles semánticos y relaciones entre palabras, con roles generados por anotaciones de Proposition Bank (PropBank).
En pruebas, EXTRACTOR (parcialmente financiado por DARPA) se encontró capaz de igualar la extracción de datos humanos de los informes de DARPA. El sistema también se ejecutó contra un gran volumen de informes no estructurados de Microsoft Security Intelligence y la Enciclopedia de Amenazas de TrendMicro, extrayendo con éxito información saliente en la mayoría de los casos.
Los investigadores conceden que el rendimiento de EXTRACTOR probablemente disminuirá cuando intente destilar acciones que ocurren a lo largo de varias oraciones o párrafos, aunque re-herramienta el sistema para acomodar otros informes se indica como una forma de avanzar aquí. Sin embargo, esto es esencialmente retroceder a la etiqueta humana liderada por proxy.
Longitud == Autoridad
Es interesante señalar la tensión continua entre la forma en que los algoritmos de SEO de Google parecen haber recompensado el contenido de larga forma en los últimos años (aunque el asesoramiento oficial sobre este tema es contradictorio), y los desafíos que los investigadores de IA (incluidas muchas iniciativas de investigación de Google) enfrentan para decodificar la intención y los datos reales de estos artículos cada vez más discursivos y largos.
Es argumentable que al recompensar el contenido más largo, Google está asumiendo una calidad consistente que no puede identificar o cuantificar aún a través de procesos de NLP, excepto contando la cantidad de sitios de autoridad que enlaza a él (una métrica “de carne”, en la mayoría de los casos); y que no es inusual ver publicaciones de 2.500 palabras o más que alcanzan prominencia en SERPS a pesar del “inflado” narrativo, siempre y cuando el contenido adicional sea ampliamente inteligible y no infrinja otras pautas.
¿Dónde está la receta?
En consecuencia, los recuentos de palabras están aumentando, en parte debido a un deseo genuino de buen contenido de larga forma, pero también porque “historiar” unos pocos hechos escasos puede aumentar la longitud de una pieza a los estándares de SEO ideales, y permitir que el contenido ligero compita igualmente con la salida de mayor esfuerzo.
Un ejemplo de esto es los sitios de recetas, frecuentemente quejados de en la comunidad de Hacker News por anteponer el contenido central (la receta) con escads de contenido autobiográfico o caprichoso diseñado para crear una “experiencia de receta” impulsada por la historia, y para empujar lo que de otro modo sería un recuento de palabras muy bajo hacia la región de 2.500+ palabras de SEO amigable.
Varias soluciones puramente procedimentales han surgido para extraer recetas reales de sitios de recetas verbosos, incluyendo recopiladores de recetas de código abierto y extractores de recetas para Firefox y Chrome. El aprendizaje automático también se ocupa de esto, con varios enfoques de Japón, EE. UU. y Portugal, así como investigaciones de Stanford, entre otros.
En cuanto a los informes de inteligencia de amenazas abordados por los investigadores de Chicago, la práctica general de informes de amenazas verbosos puede deberse en parte a la necesidad de reflejar la escala de un logro (que a menudo se puede resumir en un párrafo) creando una narrativa muy larga alrededor de ella, y utilizando la longitud de las palabras como proxy para la escala del esfuerzo involucrado, independientemente de la aplicabilidad.
En segundo lugar, en un clima en el que la fuente original de una historia a menudo se pierde debido a malas prácticas de citación por parte de los medios de comunicación populares, producir un mayor volumen de palabras que cualquier periodista de reinforme pueda replicar garantiza una victoria en SERPS por mera volumen de palabras, asumiendo que la verbosidad, ahora un desafío creciente para el NLP, es realmente recompensado de esta manera.













