Angle d’Anderson
Au-delà du « mode lecteur » avec l’apprentissage automatique

Des chercheurs de Corée du Sud ont utilisé l’apprentissage automatique pour développer une méthode améliorée d’extraction du contenu réel des pages Web, de sorte que les « meubles » d’une page Web – tels que les sidebars, les pieds de page et les en-têtes de navigation, ainsi que les blocs publicitaires – disparaissent pour le lecteur.
Une telle fonctionnalité est soit intégrée à la plupart des navigateurs Web populaires, soit facilement disponible via des extensions et des plug-ins, mais ces technologies reposent sur une mise en forme sémantique qui peut ne pas être présente dans la page Web, ou qui peut avoir été délibérément compromise par le propriétaire du site pour empêcher le lecteur de masquer l’« expérience complète » de la page.

L’une de nos propres pages Web « allégée » avec la fonctionnalité Reader View intégrée de Firefox.
Au lieu de cela, la nouvelle méthode utilise un système basé sur une grille qui parcourt la page Web, en évaluant la pertinence du contenu par rapport à l’objectif principal de la page.

Le pipeline d’extraction de contenu divise d’abord la page en une grille (ligne supérieure) avant d’évaluer la relation des cellules pertinentes trouvées avec d’autres cellules (milieu) et enfin de fusionner les cellules approuvées (bas). Source: https://arxiv.org/ftp/arxiv/papers/2110/2110.14164.pdf
Une fois qu’une cellule pertinente est identifiée, sa relation avec les cellules voisines est également évaluée avant d’être fusionnée dans le contenu « principal » interprété.
L’idée centrale de l’approche est d’abandonner la balise basée sur le code comme indice de pertinence (c’est-à-dire les balises HTML qui désigneraient normalement le début d’un paragraphe, par exemple, qui peuvent être remplacées par des balises alternatives qui « tromperont » les lecteurs d’écran et les utilitaires tels que Reader View), et de déduire le contenu uniquement en fonction de son apparence visuelle.
L’approche, appelée Grid-Center-Expand (GCE), a été étendue par les chercheurs à des modèles de réseaux de neurones profonds (DNN) qui exploitent l’architecture d’apprentissage tabulaire interprétable de Google, TabNet.
Allez au but
L’article est intitulé Ne lisez pas, regardez simplement: Extraction du contenu principal des pages Web à l’aide de fonctionnalités visuellement apparentes, et provient de trois chercheurs de l’Université Hanyang, et d’un chercheur de l’Institut de technologie de convergence, tous situés à Séoul.
L’extraction améliorée du contenu principal des pages Web est potentiellement précieuse non seulement pour l’utilisateur final, mais également pour les systèmes de machine chargés d’ingérer ou d’indexer le contenu de domaine à des fins de traitement automatique des langues (TAL), et d’autres secteurs de l’IA.
Comme cela se présente, si le contenu non pertinent est inclus dans de tels processus d’extraction, il peut nécessiter un filtrage (ou une étiquetage) manuel, à grands frais; pire, si le contenu indésirable est inclus avec le contenu principal, il peut affecter la façon dont le contenu principal est interprété, et le résultat des systèmes de transformateur et d’encodeur/décodeur qui reposent sur un contenu propre.
Une méthode améliorée, selon les chercheurs, est particulièrement nécessaire car les approches existantes échouent souvent avec les pages Web non anglaises.

Les pages Web françaises, japonaises et russes sont notées comme ayant les taux de réussite les plus bas pour les quatre approches les plus courantes de « Reader View »: Readability.js de Mozilla; DOM Distiller de Google; Web2Text; et Boilernet.
Jeux de données et formation
Les chercheurs ont compilé des données de jeu à partir de mots clés anglais dans les jeux de données GoogleTrends-2017 et GoogleTrends-2020, bien qu’ils observent qu’il n’y a pas de différences pratiques entre les deux jeux de données.
De plus, les auteurs ont recueilli des mots clés non anglais de Corée du Sud, de France, du Japon, de Russie, d’Indonésie et d’Arabie saoudite. Des mots clés chinois ont été ajoutés à partir d’un jeu de données Baidu, car Google Trends ne pouvait pas fournir de données chinoises.
Tests et résultats
Lors des tests du système, les auteurs ont constaté qu’il offre le même niveau de performance que les modèles de réseaux de neurones profonds (DNN) récents, tout en offrant une meilleure prise en charge d’une plus grande variété de langues.
Par exemple, l’architecture Boilernet, bien qu’elle maintienne de bonnes performances dans l’extraction de contenu pertinent, s’adapte mal aux jeux de données chinois et japonais, tandis que Web2Text, les auteurs constatent qu’il a des « performances relativement faibles » dans l’ensemble, avec des fonctionnalités linguistiques qui ne sont pas multilingues et ne conviennent pas à l’extraction de contenu principal des pages Web.
Mozilla’s Readbility.js a été trouvé pour atteindre des performances acceptables dans plusieurs langues, y compris l’anglais, même en tant que méthode basée sur des règles. Cependant, les chercheurs ont constaté que ses performances ont chuté de manière notable sur les jeux de données japonais et français, mettant en évidence les limites de la tentative de parser les caractéristiques d’une région spécifique uniquement par des approches basées sur des règles.
Pendant ce temps, DOM Distiller de Google, qui combine des heuristiques et des approches d’apprentissage automatique, a été trouvé pour performer bien dans l’ensemble.

Tableau des résultats pour les méthodes testées lors du projet, y compris le module GCE des chercheurs. Des nombres plus élevés sont meilleurs.
Les chercheurs concluent que ‘GCE n’a pas besoin de suivre l’environnement Web en constante évolution car il repose sur la nature humaine – des fonctionnalités vraiment globales et multilingues’.












