Andersonの視点
マシンラーニングによる「リーダーモード」の向上

韓国の研究者は、マシンラーニングを使用して、ウェブページから実際のコンテンツを抽出する方法を改善しました。ウェブページの「家具」であるサイドバー、フッター、ナビゲーションヘッダー、および広告ブロックが読者から消えるようにします。
このような機能は、ほとんどの人気のあるウェブブラウザに組み込まれています。あるいは、拡張機能やプラグインを介して容易に利用できます。しかし、これらのテクノロジーは、ウェブページに存在しない可能性のある、またはサイト所有者によって「フルファット」エクスペリエンスを防ぐために故意に妥協されたセマンティックフォーマットに依存しています。

私たちのウェブページの1つをFirefoxのReader View機能で「スリム」にしました。
代わりに、新しい方法は、ウェブページをグリッドに分割し、ページの中心的な目的に関連するコンテンツを評価するシステムを使用します。

コンテンツ抽出パイプラインは、ページをグリッドに分割(上行)し、関連するセルの関係を評価(中)し、最終的に承認されたセルを結合します(下)。ソース:https://arxiv.org/ftp/arxiv/papers/2110/2110.14164.pdf
関連するセルが識別されると、その近くのセルとの関係も評価され、最終的に解釈された「中心コンテンツ」に結合されます。
このアプローチの中心的な考え方は、関連性のインデックスとしてのコードベースのマークアップを放棄し、コンテンツをその視覚的な外見に基づいてのみ推論することです。
このアプローチは、Grid-Center-Expand (GCE) と呼ばれ、研究者によって Google の TabNet を利用する Deep Neural Network (DNN) モデルに拡張されています。
要点
論文 は、見るだけでよい:視覚的に明らかな特徴を使用したウェブページからの主要コンテンツ抽出 と題され、韓国のハニャン大学の 3 人の研究者と、ソウルの融合技術研究所の 1 人の研究者によって執筆されています。
ウェブページの中心コンテンツの抽出を改善することは、カジュアルなエンドユーザーにとってだけでなく、自然言語処理 (NLP) や AI の他の分野でドメインコンテンツをインデックス化またはインジェストするタスクを担当するマシンシステムにとっても潜在的に価値があります。
現状、関連しないコンテンツが含まれる場合、それを手動でフィルタリング(またはラベル付け)する必要がありますが、コストがかかります。さらに、望ましくないコンテンツが中心コンテンツと一緒に含まれると、中心コンテンツの解釈や、クリーンなコンテンツに依存するトランスフォーマーとエンコーダ/デコーダシステムの結果に影響を与える可能性があります。
研究者は、既存のアプローチは、特に非英語のウェブページでしばしば失敗するため、改善された方法が特に必要であると主張しています。

フランス語、日本語、ロシア語のウェブページは、4 つの最も一般的な「リーダービュー」アプローチ(Mozilla の Readability.js、Google の DOM Distiller、Web2Text、Boilernet)で最も低い成功率を示しています。
データセットとトレーニング
研究者は、GoogleTrends-2017 と GoogleTrends-2020 データセットから英語キーワードのデータセットをコンパイルしました。ただし、2 つのデータセット間には結果として実用的には違いがないと観察しています。
さらに、著者は、韓国、フランス、日本、ロシア、インドネシア、サウジアラビアからの非英語キーワードを収集しました。中国語キーワードは、Baidu データセット から追加されました。Google Trends では中国語データを提供できなかったためです。
テストと結果
システムをテストした結果、最近の DNN モデルと同等のパフォーマンスを提供しながら、より幅広い言語に対応できることがわかりました。
たとえば、Boilernet アーキテクチャは、関連するコンテンツを抽出する際に良いパフォーマンスを維持していますが、中国語と日本語のデータセットに適応できません。一方、Web2Text は、著者によると、全体的に「比較的低いパフォーマンス」を持っており、多言語に適した言語特性を持たないため、ウェブページからの中心コンテンツの抽出に適していません。
Mozilla の Readbility.js は、英語を含む複数の言語で適切なパフォーマンスを達成しました。ただし、日本語とフランス語のデータセットではパフォーマンスが著しく低下したため、特定の地域の特徴をルールベースのアプローチのみで解析することの限界が強調されました。
一方、Google の DOM Distiller は、ヒューリスティックとマシンラーニングアプローチを組み合わせて、全体的に良好なパフォーマンスを示しました。
研究者は、「GCE は、人間の性質に基づいているため、急速に変化するウェブ環境に追随する必要がない。真正にグローバルで多言語対応の特徴を持っているからだ。」 と結論付けています。













