Andersons vinkel

Ud over ‘Læsevisning’ med maskinlæring

mm
Føj Unite.AI til dine foretrukne kilder på Google

Forskere fra Sydkorea har brugt maskinlæring til at udvikle en forbedret metode til at trække den faktiske indhold ud af websteder, således at “møblerne” på en websted – såsom sidebjælker, fodere og navigationsoverskrifter samt annonceringsblokke – forsvinder for læseren.

Selvom sådant funktionsdygtighed er enten indbygget i de fleste populære webbrowser eller også let tilgængelig via udvidelser og plugins, afhænger disse teknologier af semantisk formatering, som måske ikke er til stede på webstedet eller som måske er blevet bevidst kompromitteret af webstedsejeren for at forhindre læseren i at skjule “den fulde oplevelse” af webstedet.

En af vores egne websteder 'slanket' med Firefox's integrale Læsevisning.

En af vores egne websteder ‘slanket’ med Firefox’s integrale Læsevisning.

I stedet bruger den nye metode et grid-baseret system, der itererer gennem webstedet og vurderer, hvor relevant indholdet er i forhold til webstedets kerneformål.

Indholdstrækningens pipeline deler først webstedet op i et grid (øverste række) før den vurderer forholdet mellem fundne relevante celler og andre celler (mellem) og til sidst sammenfører de godkendte celler (nederst). Kilde: https://arxiv.org/ftp/arxiv/papers/2110/2110.14164.pdf

Indholdstrækningens pipeline deler først webstedet op i et grid (øverste række) før den vurderer forholdet mellem fundne relevante celler og andre celler (mellem) og til sidst sammenfører de godkendte celler (nederst). Kilde: https://arxiv.org/ftp/arxiv/papers/2110/2110.14164.pdf

Når en relevant celle er identificeret, vurderes dens forhold til nærliggende celler også, før den sammenføres med den fortolkede “kerneindhold”.

Den centrale idé bag tilgangen er at opgive kode-baseret markup som et indeks for relevans (dvs. HTML-tags, der normalt ville angive begyndelsen af en afsnit, for eksempel, som kan erstattes af alternative tags, der vil “narre” skærm-læsere og værktøjer som Læsevisning), og udlede indholdet udelukkende på basis af dets visuelle udseende.

Tilgangen, der kaldes Grid-Center-Expand (GCE), er blevet udvidet af forskerne til Deep Neural Network (DNN)-modeller, der udnytter Googles TabNet, en fortolkende tabel-læringarkitektur.

Kom til sagen

Den artikel har titlen Læs ikke, blot se: Hovedindholdstrækning fra websteder ved hjælp af visuelt tydelige funktioner og kommer fra tre forskere ved Hanyang University og en fra Institute of Convergence Technology, alle beliggende i Seoul.

Forbedret trækning af webstedets kerneindhold er potentielt værdifuldt ikke kun for den almindelige slutbruger, men også for maskinsystemer, der er tildelt opgaven med at indtage eller indekserer domæneindhold til formålet med Naturlig Sprogbehandling (NLP) og andre sektorer i AI.

Som det er nu, hvis ikke-relevant indhold er inkluderet i sådanne trækproceser, kan det kræve manuel filtrering (eller mærkning) til stor omkostning; værre, hvis det uønskede indhold er inkluderet med kerneindholdet, kan det påvirke, hvordan kerneindholdet fortolkes, og resultatet af transformer- og encoder/decoder-systemer, der afhænger af rent indhold.

En forbedret metode, argumenterer forskerne, er særligt nødvendig, fordi eksisterende tilgange ofte fejler med ikke-engelske websteder.

Franske, japanske og russiske websteder er noteret for at score værst i succesrater for de fire mest almindelige 'Læsevisning'-tilgange: Mozillas Readability.js; Googles DOM Distiller; Web2Text; og Boilernet.

Franske, japanske og russiske websteder er noteret for at score værst i succesrater for de fire mest almindelige ‘Læsevisning’-tilgange: Mozillas Readability.js; Googles DOM Distiller; Web2Text; og Boilernet.

Dataset og træning

Forskerne samlede datasetmateriale fra engelske nøgleord i GoogleTrends-2017 og GoogleTrends-2020-dataset, selvom de observerer, at der ikke var nogen praktiske forskelle mellem de to dataset.

Derudover samlede forfatterne ikke-engelske nøgleord fra Sydkorea, Frankrig, Japan, Rusland, Indonesien og Saudi-Arabien. Kinesiske nøgleord blev tilføjet fra et Baidu-dataset, da Google Trends ikke kunne tilbyde kinesiske data.

Test og resultater

Ved at teste systemet fandt forfatterne, at det tilbød det samme niveau af præstation som seneste DNN-modeller, mens det tilbød bedre tilpasning til en bredere variation af sprog.

For eksempel tilbød Boilernet-arkitekturen, mens den opretholdt god præstation i at trække relevant indhold, tilpassede sig dårligt til kinesiske og japanske dataset, mens Web2Text, fandt forfatterne, havde “relativt dårlig præstation” overalt, med sprogfunktioner, der ikke var multilinguale, og som ikke var egnede til at trække central indhold fra websteder.

Mozillas Readbility.js blev fundet at opnå acceptabel præstation på tværs af multiple sprog, herunder engelsk, selv som en regel-baseret metode. Forskerne fandt dog, at dens præstation faldt bemærkelsesværdigt på japanske og franske dataset, hvilket understreger begrænsningerne ved at forsøge at parse karakteristika af en bestemt region udelukkende ved regel-baserede tilgange.

Imens blev Googles DOM Distiller, der kombinerer heuristikker og maskinlærings-tilgange, fundet at fungere godt over hele linjen.

Tabel over resultater for metoder testet under projektet, herunder forskernes eget GCE-modul. Højere tal er bedre.

Tabel over resultater for metoder testet under projektet, herunder forskernes eget GCE-modul. Højere tal er bedre.

Forskerne konkluderer, at ‘GCE behøver ikke at følge med den hurtigt skiftende web-miljø, fordi det afhænger af menneskelig natur – ægte globale og multilinguale funktioner’.

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai