Взгляд Anderson

За пределами «Режима чтения» с помощью машинного обучения

mm
Добавьте Unite.AI в избранные источники в Google

Исследователи из Южной Кореи использовали машинное обучение для разработки улучшенного метода извлечения фактического содержания из веб-страниц, чтобы «мебель» веб-страницы – такая как боковые панели, футеры и заголовки навигации, а также блоки рекламы – исчезала для читателя.

Хотя такая функциональность либо встроена в большинство популярных веб-браузеров, либо легко доступна через расширения и плагины, эти технологии полагаются на семантическое форматирование, которое может не присутствовать на веб-странице или которое может быть намеренно скомпрометировано владельцем сайта, чтобы предотвратить сокрытие читателем «полного» опыта страницы.

Одна из наших собственных веб-страниц «слимmed' с помощью встроенной функции Reader View Firefox.

Одна из наших собственных веб-страниц «слимmed’ с помощью встроенной функции Reader View Firefox.

Вместо этого новый метод использует систему на основе сетки, которая проходит через веб-страницу, оценивая, насколько актуально содержание для основной цели страницы.

Конвейер извлечения содержания сначала делит страницу на сетку (верхний ряд), затем оценивает связь найденных актуальных ячеек с другими ячейками (средний) и, наконец, объединяет утвержденные ячейки (низ).

Конвейер извлечения содержания сначала делит страницу на сетку (верхний ряд), затем оценивает связь найденных актуальных ячеек с другими ячейками (средний) и, наконец, объединяет утвержденные ячейки (низ). Источник: https://arxiv.org/ftp/arxiv/papers/2110/2110.14164.pdf

Как только актуальная ячейка идентифицируется, ее связь с соседними ячейками также оценивается, прежде чем она объединяется с интерпретированным «основным содержанием».

Центральная идея подхода заключается в отказе от кодового форматирования в качестве индекса актуальности (т. е. HTML-тегов, которые обычно обозначают начало абзаца и т. д., которые могут быть заменены альтернативными тегами, которые «обманут» экранные читатели и утилиты, такие как Reader View) и вывод содержания исключительно на основе его визуального вида.

Подход, называемый Grid-Center-Expand (GCE), был расширен исследователями в модели глубоких нейронных сетей (DNN), которая использует интерпретативную табличную архитектуру Google TabNet.

Суть дела

Статья под названием «Не читайте, просто смотрите: Извлечение основного содержания из веб-страниц с помощью визуально очевидных функций» написана тремя исследователями из Университета Ханьян и одним из Института конвергенции технологий, все из которых находятся в Сеуле.

Улучшение извлечения основного содержания веб-страниц потенциально ценно не только для конечного пользователя, но и для машинных систем, которые должны потреблять или индексировать содержание домена для целей обработки естественного языка (NLP) и других секторов ИИ.

Как оно есть, если нерелевантное содержание включено в такие процессы извлечения, его может потребоваться вручную фильтровать (или помечать), что очень дорого; хуже, если нежелательное содержание включено с основным содержанием, оно может повлиять на то, как основное содержание интерпретируется, и на результат трансформера и систем кодирования/декодирования, которые полагаются на чистое содержание.

Улучшенный метод, утверждают исследователи, особенно необходим, потому что существующие подходы часто не работают с веб-страницами на неанглийском языке.

Французские, японские и русские веб-страницы отмечены как имеющие худшие показатели успеха для четырех наиболее распространенных подходов «Режима чтения»: Mozilla's Readability.js, Google's DOM Distiller, Web2Text и Boilernet.

Французские, японские и русские веб-страницы отмечены как имеющие худшие показатели успеха для четырех наиболее распространенных подходов «Режима чтения»: Mozilla’s Readability.js, Google’s DOM Distiller, Web2Text и Boilernet.

Датасеты и обучение

Исследователи собрали материал датасета из английских ключевых слов в GoogleTrends-2017 и GoogleTrends-2020 датасете, хотя они отмечают, что по результатам между двумя датасетами нет практических различий.

Кроме того, авторы собрали неанглийские ключевые слова из Южной Кореи, Франции, Японии, России, Индонезии и Саудовской Аравии. Китайские ключевые слова были добавлены из Baidu датасета, поскольку Google Trends не мог предоставить китайские данные.

Тестирование и результаты

При тестировании системы авторы обнаружили, что она предлагает тот же уровень производительности, что и недавние модели DNN, при этом обеспечивая лучшую поддержку более широкого диапазона языков.

Например, Boilernet архитектура, сохраняя хорошую производительность при извлечении актуального содержания, плохо адаптируется к китайским и японским датасетам, в то время как Web2Text авторы обнаружили, что имеет «относительно плохую производительность» в целом, с лингвистическими функциями, которые не являются многоязычными и не подходят для извлечения центрального содержания из веб-страниц.

Mozilla’s Readbility.js было обнаружено, что оно достигает приемлемой производительности на нескольких языках, включая английский, даже как правило-ориентированный метод. Однако исследователи обнаружили, что его производительность значительно снижается на японских и французских датасетах, подчеркивая ограничения попыток парсинга характеристик конкретного региона исключительно с помощью правил-ориентированных подходов.

Между тем Google’s DOM Distiller, который сочетает в себе эвристику и подходы машинного обучения, было обнаружено, что оно работает хорошо во всех отношениях.

Таблица результатов для методов, протестированных в рамках проекта, включая собственный модуль GCE исследователей. Более высокие числа лучше.

Таблица результатов для методов, протестированных в рамках проекта, включая собственный модуль GCE исследователей. Более высокие числа лучше.

Исследователи заключили, что «GCE не нужно поддерживать быстро меняющуюся веб-среду, потому что оно полагается на человеческую природу – действительно глобальные и многоязычные функции».

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai