Andersons vinkel

Bortom “Läsläget” med maskinlärande

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Forskare från Sydkorea har använt maskinlärande för att utveckla en förbättrad metod för att extrahera faktiskt innehåll från webbsidor så att “möblerna” på en webbsida – såsom sidofält, fotterr och navigeringshuvuden, samt annonsblock – försvinner för läsaren.

Även om sådan funktionalitet antingen är inbyggd i de flesta populära webbläsare eller också är lätt tillgänglig via tillägg och plugin-program, så förlitar sig dessa tekniker på semantisk formatering som kanske inte finns på webbsidan eller som kan ha komprometterats av webbplatsens ägare i syfte att förhindra att läsaren döljer den “fullfeta” upplevelsen av sidan.

En av våra egna webbsidor 'avsmalnad' med Firefox integrala Läslägen-funktion.

En av våra egna webbsidor ‘avsmalnad’ med Firefox integrala Läslägen-funktion.

I stället använder den nya metoden ett gridbaserat system som itererar genom webbsidan och utvärderar hur relevant innehållet är till sidans kärnmål.

Innehållsextraktionspipelinen delar först sidan i ett grid (övre rad) innan den utvärderar relationen mellan funna relevanta celler och andra celler (mitten) och slutligen slår samman de godkända cellerna (nedersta).

Innehållsextraktionspipelinen delar först sidan i ett grid (övre rad) innan den utvärderar relationen mellan funna relevanta celler och andra celler (mitten) och slutligen slår samman de godkända cellerna (nedersta). Källa: https://arxiv.org/ftp/arxiv/papers/2110/2110.14164.pdf

När en relevant cell identifieras utvärderas dess relation till närliggande celler innan den slås samman med den tolkade “kärninnehållet”.

Den centrala idén bakom tillvägagångssättet är att överge kodbaserad markup som en index för relevans (dvs. HTML-taggar som normalt skulle ange början på en paragraf, till exempel, som kan ersättas av alternativa taggar som kommer att “lura” skärmläsare och verktyg som Läslägen) och härleda innehållet enbart utifrån dess visuella utseende.

Tillvägagångssättet, som kallas Grid-Center-Expand (GCE), har utvidgats av forskarna till Deep Neural Network (DNN)-modeller som utnyttjar Googles TabNet, en tolkande tabellär lärandearkitektur.

Kom till punkten

Artikeln heter Läs inte, bara titta: Extrahering av huvudinnehåll från webbsidor med visuellt uppenbara funktioner och kommer från tre forskare vid Hanyang University och en från Institute of Convergence Technology, alla belägna i Seoul.

En förbättrad extrahering av webbsidans kärninnehåll är potentiellt värdefull inte bara för den vanliga slutanvändaren, utan också för maskinsystem som är uppgift att inta eller indexera domäninnehåll för naturlig språkbehandling (NLP) och andra sektorer inom AI.

Som det är nu, om icke-relevant innehåll ingår i sådan extraheringsprocess, kan det behöva filtreras manuellt (eller märkas), till stor kostnad; värre, om det oönskade innehållet ingår i det centrala innehållet, kan det påverka hur det centrala innehållet tolkas, och resultatet av transformer- och encoder/decoder-system som förlitar sig på rent innehåll.

En förbättrad metod, hävdar forskarna, är särskilt nödvändig eftersom befintliga tillvägagångssätt ofta misslyckas med icke-engelska webbsidor.

Franska, japanska och ryska webbsidor noteras som de som presterar sämst i framgångsgrad för de fyra vanligaste 'Läslägen'-tillvägagångssätten: Mozillas Readability.js; Googles DOM Distiller; Web2Text; och Boilernet.

Franska, japanska och ryska webbsidor noteras som de som presterar sämst i framgångsgrad för de fyra vanligaste ‘Läslägen’-tillvägagångssätten: Mozillas Readability.js; Googles DOM Distiller; Web2Text; och Boilernet.

Datamängder och utbildning

Forskarna sammanställde datamaterial från engelska nyckelord i GoogleTrends-2017 och GoogleTrends-2020-datamängden, även om de observerar att det inte fanns några praktiska skillnader mellan de två datamängderna.

Dessutom samlade författarna in icke-engelska nyckelord från Sydkorea, Frankrike, Japan, Ryssland, Indonesien och Saudiarabien. Kinesiska nyckelord lades till från en Baidu-datamängd, eftersom Google Trends inte kunde erbjuda kinesiska data.

Testning och resultat

Vid testning av systemet fann författarna att det erbjuder samma nivå av prestanda som nyliga DNN-modeller, samtidigt som det erbjuder bättre anpassning för en bredare variation av språk.

Till exempel, Boilernet-arkitekturen, som upprätthåller god prestanda vid extrahering av relevant innehåll, anpassar sig dåligt till kinesiska och japanska datamängder, medan Web2Text, enligt författarna, har “relativt dålig prestanda” överallt, med lingvistiska funktioner som inte är flerspråkiga och som inte är lämpliga för att extrahera centralinnehåll från webbsidor.

Mozillas Readbility.js visade sig uppnå acceptabel prestanda över flera språk, inklusive engelska, även som en regelbaserad metod. Men forskarna fann att dess prestanda föll märkbart på japanska och franska datamängder, vilket betonar begränsningarna med att försöka tolka egenskaper hos en specifik region enbart med regelbaserade tillvägagångssätt.

Medan Googles DOM Distiller, som kombinerar heuristiker och maskinlärande-tillvägagångssätt, visade sig fungera bra över hela linjen.

Tabell över resultat för metoder som testades under projektet, inklusive forskarnas eget GCE-modul. Högre nummer är bättre.

Tabell över resultat för metoder som testades under projektet, inklusive forskarnas eget GCE-modul. Högre nummer är bättre.

Forskarna drar slutsatsen att ‘GCE behöver inte hålla jämna steg med den snabbt föränderliga webbmiljön eftersom det förlitar sig på mänsklig natur – äkta globala och flerspråkiga funktioner’.

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai