Andersonův úhel
Mimo “Režim čtenáře” s využitím strojového učení

Výzkumníci z Jižní Koreje použili strojové učení k vývoji vylepšené metody pro extrakci skutečného obsahu webových stránek, aby “nábytek” webové stránky – jako jsou postranní panely, patičky a navigační záhlaví, stejně jako bloky reklam – zmizel pro čtenáře.
Although taková funkčnost je buď vestavěna do většiny populárních webových prohlížečů, nebo je snadno dostupná prostřednictvím rozšíření a pluginů, tyto technologie spoléhají na semantické formátování, které nemusí být přítomno na webové stránce, nebo které mohlo být úmyslně narušeno vlastníkem stránky, aby se zabránilo čtenáři skrýt “plnou” zkušenost stránky.

Jedna z našich vlastních webových stránek ‘ztenčená’ pomocí vestavěné funkčnosti Reader View ve Firefoxu.
Místo toho nová metoda používá gridový systém, který prochází webovou stránkou a vyhodnocuje, jak je obsah relevantní k hlavnímu účelu stránky.

Pipeline extrakce obsahu nejprve rozdělí stránku do gridu (horní řádek) před vyhodnocením vztahu nalezených relevantních buněk k ostatním buňkám (střed) a nakonec spojí schválené buňky (dole). Zdroj: https://arxiv.org/ftp/arxiv/papers/2110/2110.14164.pdf
Jakmile je identifikována relevantní buňka, její vztah s okolními buňkami je také vyhodnocen předtím, než je sloučena do interpretovaného “hlavního obsahu”.
Centrální myšlenka přístupu spočívá v opuštění kódového značení jako indexu relevance (tj. HTML značek, které by normálně označovaly začátek odstavce, například, které lze nahradit alternativními značíky, které “oklamou” čtečky obrazovky a utility, jako je Reader View), a odvodit obsah pouze na základě jeho vizuálního vzhledu.
Tento přístup, nazvaný Grid-Center-Expand (GCE), byl prodloužen výzkumníky do modelů hlubokých neuronových sítí (DNN), které využívají Google’s TabNet, interpretativní tabulkovou architekturu.
Dostání se k věci
Článek článek je nazvaný Nečtěte, pouze se podívejte: Extrakce hlavního obsahu z webových stránek pomocí vizuálně zjevných funkcí a pochází od tří výzkumníků z Hanyang University a jednoho z Institute of Convergence Technology, všechny umístěné v Soulu.
Vylepšená extrakce hlavního obsahu webové stránky je potenciálně cenná nejen pro koncového uživatele, ale také pro strojové systémy, které jsou povinny přijímat nebo indexovat obsah domény pro účely zpracování přirozeného jazyka (NLP) a dalších odvětví umělé inteligence.
Jak stojí, pokud je nezbytný obsah zahrnut do takových extrakčních procesů, může být nutné jej ručně filtrovat (nebo označovat), za velké náklady; horší, pokud je nežádoucí obsah zahrnut s hlavním obsahem, může ovlivnit, jak je hlavní obsah interpretován, a výsledek transformátorů a encoder/decoder systémů, které spoléhají na čistý obsah.
Výzkumníci argumentují, že vylepšená metoda je zvláště nezbytná, protože stávající přístupy často selhávají u neanglických webových stránek.

Francouzské, japonské a ruské webové stránky jsou označeny jako ty, které dosahují nejhorších úspěchů u čtyř nejčastějších ‘Reader View’ přístupů: Mozilla’s Readability.js; Google’s DOM Distiller; Web2Text; a Boilernet.
Datové sady a trénování
Výzkumníci sestavili materiál datové sady z anglických klíčových slov v GoogleTrends-2017 a GoogleTrends-2020 datové sady, ačkoli pozorují, že z hlediska výsledků nebyly mezi nimi žádné praktické rozdíly.
Navíc autoři shromáždili neanglická klíčová slova z Jižní Koreje, Francie, Japonska, Ruska, Indonésie a Saúdské Arábie. Čínská klíčová slova byla přidána z Baidu datové sady, protože Google Trends nemohly nabídnout čínská data.
Testování a výsledky
Při testování systému autoři zjistili, že nabízí stejnou úroveň výkonu jako nedávné modely DNN, zatímco poskytuje lepší ubytování pro širší jazyky.
Například Boilernet architektura, zatímco zachovává dobré výsledky při extrakci relevantního obsahu, přizpůsobuje se špatně čínským a japonským datovým sadám, zatímco Web2Text, autoři zjistili, že má “relativně špatný výkon” obecně, s lingvistickými funkcemi, které nejsou multilingvní, a nejsou vhodné pro extrakci centrálního obsahu z webových stránek.
Mozilla’s Readbility.js dosáhl přijatelného výkonu napříč několika jazyky, včetně angličtiny, i jako pravidlový přístup. Nicméně výzkumníci zjistili, že jeho výkon poklesl výrazně u japonských a francouzských datových sad, což zdůrazňuje omezení pokusu o analýzu charakteristik konkrétní oblasti entirely pravidlovými přístupy.
Zatímco Google’s DOM Distiller, který kombinuje heuristické a strojové učení přístupy, byl nalezen jako dobře fungující napříč všemi.

Tabulka výsledků pro testované metody, včetně vlastního modulu GCE výzkumníků. Vyšší čísla jsou lepší.
Výzkumníci dospěli k závěru, že ‘GCE nemusí držet krok s rychle se měnícím webovým prostředím, protože spoléhá na lidskou povahu – skutečně globální a multilingvní funkce’.












