Unghiul lui Anderson
Dincolo de “Modul de citire” cu învățarea automată

Cercetători din Coreea de Sud au utilizat învățarea automată pentru a dezvolta o metodă îmbunătățită de extragere a conținutului real din paginile web, astfel încât “mobilierul” unei pagini web – cum ar fi barele laterale, subsolurile și anteturile de navigare, precum și blocurile publicitare – dispar pentru cititor.
Deși o astfel de funcționalitate este încorporată în majoritatea browserelor web populare sau este disponibilă cu ușurință prin extensii și plug-in-uri, aceste tehnologii se bazează pe formatarea semantică care poate să nu fie prezentă în pagina web sau care ar putea fi compromisă intenționat de către proprietarul site-ului pentru a preveni cititorul să ascundă “experiența completă” a paginii.

Una dintre paginile noastre web ‘slabite’ cu funcționalitatea integrală Reader View a Firefox.
În schimb, noua metodă utilizează un sistem bazat pe o grilă care parcurge pagina web, evaluând cât de pertinent este conținutul în raport cu scopul principal al paginii.

Pipeline-ul de extragere a conținutului împarte mai întâi pagina într-o grilă (rândul superior) înainte de a evalua relația dintre celulele pertinente găsite și alte celule (mijloc) și, în final, de a combina celulele aprobate (jos). Sursă: https://arxiv.org/ftp/arxiv/papers/2110/2110.14164.pdf
Odată ce o celulă pertinentă este identificată, relația sa cu celulele din apropiere este evaluată și înainte de a fi combinată în conținutul “core” interpretat.
Idea centrală a abordării este de a abandona marcajul bazat pe cod ca indice de relevanță (de exemplu, etichetele HTML care ar indica în mod normal începutul unui paragraf, care pot fi înlocuite cu etichete alternative care vor “înșela” cititoarele de ecran și utilitățile precum Reader View) și de a deduce conținutul numai pe baza aspectului său vizual.
Abordarea, numită Grid-Center-Expand (GCE), a fost extinsă de către cercetători în modele de rețele neuronale profunde (DNN) care exploatează TabNet-ul lui Google, o arhitectură tabulară interpretativă.
Ajungeți la esență
Articolul științific se intitulează Nu citiți, doar priviți: extragerea conținutului principal din paginile web utilizând caracteristici vizual aparente și provine de la trei cercetători de la Universitatea Hanyang și unul de la Institutul de Tehnologie Convergentă, toți situati în Seul.
Extragerea îmbunătățită a conținutului principal al paginii web este potențial valoroasă nu numai pentru utilizatorul final, ci și pentru sistemele de mașini care sunt însărcinate cu ingurgitarea sau indexarea conținutului de domeniu în scopuri de Procesare a Limbajului Natural (NLP) și alte sectoare din IA.
În prezent, dacă conținutul nerelevant este inclus în astfel de procese de extragere, poate fi necesar să fie filtrat manual (sau etichetat), la o mare cheltuială; mai rău, dacă conținutul nedorit este inclus cu conținutul principal, poate afecta modul în care conținutul principal este interpretat și rezultatul sistemelor de transformare și encoder/decoder care se bazează pe conținut curat.
O metodă îmbunătățită, susțin cercetătorii, este mai necesară, deoarece abordările existente adesea eşuează cu paginile web non-englезe.

Paginile web în franceză, japoneză și rusă sunt notate ca având cele mai slabe rate de succes pentru cele patru abordări ‘Reader View’ mai comune: Readability.js de la Mozilla; DOM Distiller de la Google; Web2Text; și Boilernet.
Date și antrenament
Cercetătorii au compilat materialul de date din cuvintele cheie în engleză din GoogleTrends-2017 și GoogleTrends-2020, deși observă că, în ceea ce privește rezultatele, nu au existat diferențe practice între cele două seturi de date.
În plus, autorii au adunat cuvinte cheie non-englезe din Coreea de Sud, Franța, Japonia, Rusia, Indonezia și Arabia Saudită. Cuvintele cheie chineze au fost adăugate dintr-un set de date Baidu, deoarece Google Trends nu a putut oferi date chineze.
Testare și rezultate
La testarea sistemului, autorii au constatat că oferă același nivel de performanță ca și modelele DNN recente, oferind în același timp o mai bună adaptare la o varietate mai largă de limbi.
De exemplu, arhitectura Boilernet, care menține o performanță bună în extragerea conținutului pertinent, se adaptează prost la seturile de date chineze și japoneze, în timp ce Web2Text are, după cum au constatat autorii, o “performanță relativ slabă” în general, cu caracteristici lingvistice care nu sunt multilingve și nu sunt potrivite pentru extragerea conținutului central din paginile web.
Mozilla’s Readbility.js a fost găsită a avea o performanță acceptabilă în multiple limbi, inclusiv engleza, chiar și ca o metodă bazată pe reguli. Cu toate acestea, cercetătorii au constatat că performanța sa a scăzut semnificativ pe seturile de date japoneze și franceze, subliniind limitările încercării de a parsa caracteristicile unei regiuni specifice în întregime prin abordări bazate pe reguli.
Între timp, DOM Distiller de la Google, care combină euristica și abordările de învățare automată, a fost găsit a avea o performanță bună în general.

Tabelul rezultatelor pentru metodele testate în cadrul proiectului, inclusiv modulul GCE al cercetătorilor. Numerele mai mari sunt mai bune.
Cercetătorii concluzionează că ‘GCE nu are nevoie să țină pasul cu mediul web în schimbare rapidă, deoarece se bazează pe natura umană – caracteristici cu adevărat globale și multilingve’.












