Kąt Andersona
Poza trybem czytania z użyciem uczenia maszynowego

Naukowcy z Korei Południowej wykorzystali uczenie maszynowe do opracowania ulepszonej metody ekstrakcji rzeczywistej treści ze stron internetowych, tak aby “meble” strony internetowej, takie jak paski boczne, stopki i nagłówki nawigacyjne, a także bloki reklamowe, zniknęły dla czytelnika.
Mimo że taka funkcjonalność jest wbudowana w większość popularnych przeglądarek internetowych lub jest łatwo dostępna za pomocą wtyczek i rozszerzeń, te technologie opierają się na sformatowaniu semantycznym, które może nie być obecne na stronie internetowej lub które mogło zostać celowo naruszone przez właściciela strony w celu uniemożliwienia czytelnikowi ukrycia “pełnej” wersji strony.

Jedna z naszych własnych stron internetowych ‘zminimalizowana’ za pomocą wbudowanej funkcjonalności Reader View w przeglądarce Firefox.
Zamiast tego, nowa metoda wykorzystuje system oparty na siatce, który przechodzi przez stronę internetową, oceniając, jak istotna jest treść dla podstawowego celu strony.

Potok ekstrakcji treści najpierw dzieli stronę na siatkę (górny rząd), a następnie ocenia relację znalezionych istotnych komórek z innymi komórkami (środkowy) i w końcu łączy zatwierdzone komórki (dół). Źródło: https://arxiv.org/ftp/arxiv/papers/2110/2110.14164.pdf
Gdy zostanie zidentyfikowana istotna komórka, jej relacja z sąsiednimi komórkami jest również oceniana, zanim zostanie połączona z interpretowaną “treścią podstawową”.
Głównym pomysłem tego podejścia jest porzucenie kodu opartego na znacznikach jako wskaźniku istotności (tj. tagów HTML, które zwykle oznaczają początek akapitu, na przykład, które mogą być zastąpione przez tagi alternatywne, które “oszukają” czytniki ekranu i narzędzia takie jak Reader View) i ustalenie treści wyłącznie na podstawie jej wyglądu wizualnego.
Podejście to, nazwane Grid-Center-Expand (GCE), zostało rozszerzone przez naukowców na modele Deep Neural Network (DNN), które wykorzystują architekturę TabNet firmy Google, interpretatywną architekturę tablicową.
Do rzeczy
Artykuł artykuł nosi tytuł Nie czytaj, tylko spójrz: Ekstrakcja głównej treści ze stron internetowych przy użyciu widocznych cech i pochodzi od trzech naukowców z Uniwersytetu Hanyang oraz jednego z Instytutu Konwergencji Technologii, wszystkich zlokalizowanych w Seulu.
Poprawiona ekstrakcja treści podstawowej ze stron internetowych jest potencjalnie cenna nie tylko dla użytkownika końcowego, ale także dla systemów maszynowych, które są odpowiedzialne za pobieranie lub indeksowanie treści domen dla celów Przetwarzania Języka Naturalnego (NLP) i innych sektorów sztucznej inteligencji.
Jak jest teraz, jeśli nieistotna treść jest uwzględniona w takim procesie ekstrakcji, może wymagać ręcznego filtrowania (lub oznaczania), co jest bardzo kosztowne; co gorsza, jeśli niepożądana treść jest uwzględniona wraz z treścią podstawową, może wpłynąć na to, jak treść podstawowa jest interpretowana, i na wynik systemów transformatora i kodera/dekodera, które polegają na czystej treści.
Ulepszona metoda, argumentują naukowcy, jest szczególnie niezbędna, ponieważ istniejące podejścia często zawodzą w przypadku stron internetowych w języku nieangielskim.

Strony internetowe w języku francuskim, japońskim i rosyjskim są wymienione jako te, które uzyskały najgorsze wyniki w przypadku czterech najbardziej popularnych podejść ‘Reader View’: Mozilla’s Readability.js; Google’s DOM Distiller; Web2Text; i Boilernet.
Zestawy danych i szkolenie
Naukowcy skompilowali materiał ze zbioru danych GoogleTrends-2017 i GoogleTrends-2020, chociaż zauważają, że nie ma praktycznych różnic między tymi dwoma zbiorami danych.
Ponadto autorzy zebrali nieangielskie słowa kluczowe z Korei Południowej, Francji, Japonii, Rosji, Indonezji i Arabii Saudyjskiej. Słowa kluczowe w języku chińskim zostały dodane z zestawu danych Baidu, ponieważ Google Trends nie mógł zapewnić danych w języku chińskim.
Testowanie i wyniki
Podczas testowania systemu autorzy stwierdzili, że oferuje on ten sam poziom wydajności, co niedawne modele DNN, przy jednoczesnym zapewnieniu lepszej obsługi szerszego zakresu języków.
Na przykład, architektura Boilernet, chociaż utrzymuje dobrą wydajność w ekstrakcji istotnej treści, dostosowuje się słabo do zestawów danych chińskich i japońskich, podczas gdy Web2Text, jak stwierdzili autorzy, ma “relatywnie słabą wydajność” ogólnie, z cechami językowymi, które nie są wielojęzyczne i nie nadają się do ekstrakcji treści podstawowej ze stron internetowych.
Mozilla’s Readbility.js został uznany za osiąganie akceptowalnej wydajności w wielu językach, w tym angielskim, nawet jako metoda oparta na regułach. Jednak autorzy stwierdzili, że jego wydajność spadła znacznie w przypadku zestawów danych japońskich i francuskich, co podkreśla ograniczenia prób parsowania cech określonego regionu wyłącznie za pomocą podejść opartych na regułach.
Tymczasem Google’s DOM Distiller, który łączy heurystyki i podejścia oparte na uczeniu maszynowym, został uznany za dobrą wydajność ogólnie.

Tabela wyników dla metod przetestowanych w ramach projektu, w tym własnego modułu GCE autorów. Wyższe liczby są lepsze.
Naukowcy stwierdzili, że ‘GCE nie musi nadążać za szybko zmieniającym się środowiskiem internetowym, ponieważ opiera się na naturze ludzkiej – prawdziwie globalnych i wielojęzycznych cechach’.












