Ángulo de Anderson

Más allá del ‘Modo de lector’ con aprendizaje automático

mm
Añade Unite.AI a tus fuentes preferidas en Google

Investigadores de Corea del Sur han utilizado el aprendizaje automático para desarrollar un método mejorado para extraer el contenido real de las páginas web, de modo que el “mobiliario” de una página web, como barras laterales, pies de página y encabezados de navegación, así como bloques de anuncios, desaparezcan para el lector.

Aunque dicha funcionalidad está incorporada en la mayoría de los navegadores web populares o está disponible a través de extensiones y complementos, estas tecnologías dependen del formato semántico que puede no estar presente en la página web o que puede haber sido comprometido deliberadamente por el propietario del sitio para evitar que el lector oculte la “experiencia completa” de la página.

Una de nuestras propias páginas web 'adelgazada' con la funcionalidad de Vista de lector integral de Firefox.

Una de nuestras propias páginas web ‘adelgazada’ con la funcionalidad de Vista de lector integral de Firefox.

En cambio, el nuevo método utiliza un sistema basado en cuadrícula que itera a través de la página web, evaluando cuán pertinente es el contenido con respecto al objetivo principal de la página.

La tubería de extracción de contenido divide la página en una cuadrícula (fila superior) antes de evaluar la relación de las celdas pertinentes encontradas con otras celdas (medio) y finalmente fusionar las celdas aprobadas (inferior). Fuente: https://arxiv.org/ftp/arxiv/papers/2110/2110.14164.pdf

La tubería de extracción de contenido divide la página en una cuadrícula (fila superior) antes de evaluar la relación de las celdas pertinentes encontradas con otras celdas (medio) y finalmente fusionar las celdas aprobadas (inferior). Fuente: https://arxiv.org/ftp/arxiv/papers/2110/2110.14164.pdf

Una vez que se identifica una celda pertinente, también se evalúa su relación con las celdas cercanas antes de fusionarla en el contenido “core” interpretado.

La idea central del enfoque es abandonar el marcado basado en código como índice de relevancia (es decir, etiquetas HTML que normalmente denotan el comienzo de un párrafo, por ejemplo, que pueden reemplazarse con etiquetas alternativas que “engañarán” a los lectores de pantalla y utilidades como Vista de lector), y deducir el contenido basándose únicamente en su apariencia visual.

El enfoque, llamado Grid-Center-Expand (GCE), ha sido extendido por los investigadores a modelos de Redes Neuronales Profundas (DNN) que explotan la arquitectura de aprendizaje tabular interpretativo de Google, TabNet.

Ir al grano

El documento se titula No lea, solo mire: Extracción de contenido principal de páginas web utilizando características visualmente aparentes, y proviene de tres investigadores de la Universidad de Hanyang, y uno del Instituto de Tecnología de Convergencia, todos ubicados en Seúl.

La extracción mejorada del contenido principal de las páginas web es potencialmente valiosa no solo para el usuario final casual, sino también para los sistemas de máquina que están encargados de ingerir o indexar el contenido de dominio con fines de Procesamiento de Lenguaje Natural (NLP) y otros sectores de la IA.

Como está, si el contenido no relevante se incluye en dichos procesos de extracción, es posible que deba filtrarse manualmente (o etiquetarse), a un gran costo; peor aún, si el contenido no deseado se incluye con el contenido principal, podría afectar cómo se interpreta el contenido principal y el resultado de los sistemas de transformador y codificador/decodificador que confían en contenido limpio.

Un método mejorado, argumentan los investigadores, es especialmente necesario porque los enfoques existentes a menudo fallan con páginas web no inglesas.

Páginas web en francés, japonés y ruso se mencionan como las que obtienen las peores tasas de éxito para los cuatro enfoques de 'Vista de lector' más comunes: Readability.js de Mozilla; DOM Distiller de Google; Web2Text; y Boilernet.

Páginas web en francés, japonés y ruso se mencionan como las que obtienen las peores tasas de éxito para los cuatro enfoques de ‘Vista de lector’ más comunes: Readability.js de Mozilla; DOM Distiller de Google; Web2Text; y Boilernet.

Conjuntos de datos y capacitación

Los investigadores compilaron material de conjunto de datos de palabras clave en inglés en GoogleTrends-2017 y GoogleTrends-2020, aunque observan que, en términos de resultados, no hubo diferencias prácticas entre los dos conjuntos de datos.

Además, los autores recopilaron palabras clave no inglesas de Corea del Sur, Francia, Japón, Rusia, Indonesia y Arabia Saudita. Se agregaron palabras clave chinas de un conjunto de datos de Baidu, ya que Google Trends no podía ofrecer datos chinos.

Pruebas y resultados

Al probar el sistema, los autores encontraron que ofrece el mismo nivel de rendimiento que los modelos de DNN recientes, mientras que proporciona una mejor adaptación a una amplia variedad de idiomas.

Por ejemplo, la arquitectura Boilernet, aunque mantiene un buen rendimiento al extraer contenido pertinente, se adapta mal a los conjuntos de datos chinos y japoneses, mientras que Web2Text, los autores encuentran que tiene un ‘rendimiento relativamente pobre’ en general, con características lingüísticas que no son multilingües y no están adaptadas para extraer el contenido central de las páginas web.

Mozilla’s Readbility.js se encontró que logra un rendimiento aceptable en múltiples idiomas, incluido el inglés, incluso como un método basado en reglas. Sin embargo, los investigadores encontraron que su rendimiento disminuye notablemente en los conjuntos de datos japoneses y franceses, lo que destaca las limitaciones de intentar analizar las características de una región específica enteramente mediante enfoques basados en reglas.

Mientras que Google’s DOM Distiller, que combina heurísticas y enfoques de aprendizaje automático, se encontró que funciona bien en general.

Tabla de resultados para los métodos probados durante el proyecto, incluyendo el módulo GCE de los investigadores. Los números más altos son mejores.

Tabla de resultados para los métodos probados durante el proyecto, incluyendo el módulo GCE de los investigadores. Los números más altos son mejores.

Los investigadores concluyen que ‘GCE no necesita mantenerse al día con el entorno web en constante cambio porque se basa en la naturaleza humana—características verdaderamente globales y multilingües’.

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]