Погляд Anderson
За межами «Режиму читача» з допомогою машинного навчання

Дослідники з Південної Кореї використали машинне навчання для розробки покращеного методу видобування фактичного вмісту з веб-сторінок, щоб «мебль» веб-сторінки – такий як бічні панелі, підвал та навігаційні заголовки, а також блоки реклами – зникав для читача.
Хоча така функціональність або вбудована в більшість популярних веб-браузерів, або легко доступна через розширення та плагіни, ці технології покладаються на семантичне форматування, яке може бути відсутнім на веб-сторінці або яке було свідомо скомпрометоване власником сайту, щоб запобігти читачеві приховувати «повний» досвід сторінки.

Одна з наших власних веб-сторінок «відмінена» з допомогою функціональності Reader View у Firefox.
Натомість новий метод використовує систему на основі сітки, яка проходить через веб-сторінку, оцінюючи, наскільки актуальний вміст для основної мети сторінки.

Поток видобування вмісту спочатку розділяє сторінку на сітку (верхній рядок), потім оцінює відносини знайдених актуальних клітинок до інших клітинок (середній рядок) і, нарешті, з’єднує затверджені клітинки (низ). Джерело: https://arxiv.org/ftp/arxiv/papers/2110/2110.14164.pdf
Як тільки актуальна клітинка ідентифікується, її відносини з сусідніми клітинками також оцінюються перед тим, як бути об’єднаною у витлумачений «основний вміст».
Центральна ідея підходу полягає у відмові від кодового розмітки як індексу актуальності (тобто HTML-тегів, які зазвичай позначають початок абзацу тощо, які можуть бути замінені на альтернативні теги, які «обмануть» програму читання екрана та утиліти, такі як Reader View) і виведення вмісту виключно на основі його візуального вигляду.
Підхід, названий Grid-Center-Expand (GCE), був розширений дослідниками до моделей глибокого навчання (DNN), які використовують Google’s TabNet, інтерпретативну табличну архітектуру навчання.
До суті
Стаття стаття називається Не читайте, просто дивіться: Видобування основного вмісту з веб-сторінок за допомогою візуально очевидних особливостей і походить від трьох дослідників університету Ханьян, та одного від Інституту конвергенції технологій, усі розташовані в Сеулі.
Покращене видобування основного вмісту веб-сторінки потенційно цінне не лише для кінцевого користувача, але також для машинних систем, які зайняті споживанням або індексуванням вмісту домену для цілей обробки природної мови (NLP) та інших секторів штучного інтелекту.
Як воно є, якщо неактуальний вміст включений до таких процесів видобування, його може бути necesario вручну фільтрувати (або маркувати), за велику ціну; гірше, якщо нежаданий вміст включений з основним вмістом, це може вплинути на те, як основний вміст інтерпретується, і результат трансформера та систем кодувача/декодера, які покладаються на чистий вміст.
Покращений метод, дослідники стверджують, особливо необхідний, оскільки існуючі підходи часто не працюють з неанглійськими веб-сторінками.

Французькі, японські та російські веб-сторінки відзначаються як ті, які мають найгірші показники успіху для чотирьох найбільш поширених підходів «Режиму читача»: Mozilla’s Readability.js; Google’s DOM Distiller; Web2Text; і Boilernet.
Дані та навчання
Дослідники скомпільовали матеріал даних з англійських ключових слів у GoogleTrends-2017 та GoogleTrends-2020 наборі даних, хоча вони відзначають, що, у термінах результатів, не було практичної різниці між двома наборами даних.
Крім того, автори зібрали неанглійські ключові слова з Південної Кореї, Франції, Японії, Росії, Індонезії та Саудівської Аравії. Китайські ключові слова були додані з Baidu набору даних, оскільки Google Trends не могла надати китайські дані.
Тестування та результати
Під час тестування системи автори виявили, що вона пропонує той самий рівень продуктивності, що й недавні моделі DNN, при цьому забезпечуючи краще розміщення для більш широкого різноманіття мов.
Наприклад, Boilernet архітектура, хоча й підтримує хорошу продуктивність у видобуванні актуального вмісту, погано адаптується до китайських та японських наборів даних, тоді як Web2Text, автори знаходять, має «відносно погану продуктивність» у цілому, з лінгвістичними особливостями, які не є багатомовними, і не підходять для видобування центрального вмісту з веб-сторінок.
Mozilla’s Readbility.js була виявлена як така, що досягає прийнятної продуктивності по декількох мовам, включаючи англійську, навіть як правило-орієнтований метод. Однак дослідники виявили, що її продуктивність значно знижується на японських та французьких наборах даних, підкреслюючи обмеження спроби розібрати характеристики певного регіону виключно правилами-орієнтованими підходами.
Тим часом Google’s DOM Distiller, який поєднує евристику та машинне навчання підходи, був виявлений як такий, що працює добре по всьому діапазону.

Таблиця результатів для методів, протестованих під час проекту, включаючи власний модуль GCE дослідників. Вищі числа кращі.
Дослідники роблять висновок, що «GCE не потребує підтримувати швидко змінювану веб-довірчу, оскільки воно покладається на людську природу – справжні глобальні та багатомовні особливості».












