Anderson의 관점
기계 학습으로 개선된 ‘리더 모드’

한국의 연구자들은 기계 학습을 사용하여 웹 페이지에서 실제 콘텐츠를 추출하는 방법을 개선했습니다. 이렇게 하면 웹 페이지의 ‘가구’라고 부르는 사이드바, 푸터, 네비게이션 헤더 및 광고 블록이 읽기 편하게 제거됩니다.
이러한 기능은 대부분의 인기 있는 웹 브라우저에 내장되어 있거나 확장자 및 플러그인을 통해 쉽게 사용할 수 있습니다. 그러나 이러한 기술은 웹 페이지에 항상 존재하지 않거나 사이트 소유자가 페이지의 ‘전체 경험’을 숨기지 않도록 의도적으로 손상시킨 시맨틱 형식을 의존합니다.

파이어폭스의 내장 Reader View 기능으로Slimmed down된 우리自己的 웹 페이지
대신, 새로운 방법은 웹 페이지를 평가하면서 핵심 콘텐츠와 관련된 콘텐츠를 식별하는 그리드 기반 시스템을 사용합니다.

콘텐츠 추출 파이프라인은 페이지를 그리드로 나누고(상단 행) 발견된 관련 셀을 다른 셀과 관련하여 평가한 다음(중간) 승인된 셀을 병합합니다(하단). 출처: https://arxiv.org/ftp/arxiv/papers/2110/2110.14164.pdf[/em>
관련 셀이 식별되면 근처 셀과의 관계도 평가된 후 해석된 ‘核心 콘텐츠’에 병합됩니다.
접근 방식의 핵심 아이디어는 관련성의 지표로 코드 기반 마크업을 포기하고 시각적 외관만으로 콘텐츠를 추론하는 것입니다.
이 접근 방식, Grid-Center-Expand (GCE)은 연구자들이 Google의 TabNet을 활용하는 Deep Neural Network (DNN) 모델로 확장되었습니다.
핵심으로 이동
논문은 읽지 말고, 그냥看看: 시각적으로 명백한 특징을 사용한 웹 페이지의 주요 콘텐츠 추출이라고 제목이 붙여졌으며, 서울에 위치한 한양대학교의 세 명의 연구자와 수렴 기술 연구소의 한 명의 연구자에 의해 작성되었습니다.
웹 페이지의 핵심 콘텐츠를 추출하는 것이 개선되면 캐주얼 사용자뿐만 아니라 자연어 처리(NLP) 및 기타 AI 분야에서 도메인 콘텐츠를 처리하거나 색인화하는 기계 시스템에도 유용할 것입니다.
현재, 관련 콘텐츠가 포함되지 않은 경우 수동으로 필터링(또는 레이블링)해야 하므로 많은 비용이 발생할 수 있습니다. 더 나쁜 경우, 원치 않는 콘텐츠가 핵심 콘텐츠와 함께 포함되면 핵심 콘텐츠의 해석과 클린 콘텐츠에 의존하는 트랜스포머 및 인코더/디코더 시스템의 결과에 영향을 줄 수 있습니다.
연구자들은 기존 접근 방식이 종종 비영어 웹 페이지에서 실패하기 때문에 개선된 방법이 특히 필요하다고 주장합니다.

프랑스어, 일본어 및 러시아어 웹 페이지는 네 가지 가장 일반적인 ‘리더 보기’ 접근 방식에서 성공률이 가장 낮습니다. Mozilla의 Readability.js; Google의 DOM Distiller; Web2Text; 및 Boilernet.
데이터셋 및 훈련
연구자들은 GoogleTrends-2017 및 GoogleTrends-2020 데이터셋에서 영어 키워드를 수집했습니다. 그러나 두 데이터셋 사이에 실제 결과는 없었습니다.
또한, 저자들은 한국, 프랑스, 일본, 러시아, 인도네시아 및 사우디아라비아에서 비영어 키워드를 수집했습니다. 중국어 키워드는 Baidu 데이터셋에서 추가되었습니다. Google Trends에서 중국어 데이터를 제공할 수 없기 때문입니다.
테스트 및 결과
시스템을 테스트하는 동안, 저자들은 최근 DNN 모델과 동일한 수준의 성능을 제공하는 반면, 더广い 언어를 수용할 수 있음을 발견했습니다.
예를 들어, Boilernet 아키텍처는 관련 콘텐츠를 추출하는 데 良好한 성능을 유지하지만, 중국어 및 일본어 데이터셋에 적응하지 못합니다. 반면에 Web2Text는 전반적으로 ‘상대적으로 나쁨’ 성능을 보이며, 다국어에 적합하지 않으며 웹 페이지의 핵심 콘텐츠를 추출하는 데 적합하지 않은 언어 특징을 가지고 있습니다.
Mozilla의 Readbility.js는 영어를 포함한 여러 언어에서 良好한 성능을 보였습니다. 그러나 일본어 및 프랑스어 데이터셋에서 성능이 현저히 저하되는 것으로 나타났습니다. 이는 특정 지역의 특성을 완전히 규칙 기반 접근 방식으로 파싱하는 데의 한계를 강조합니다.
한편, Google의 DOM Distiller는 휴리스틱과 기계 학습 접근 방식을 결합하여 전반적으로 良好한 성능을 보였습니다.
연구자들은 ‘GCE는 빠르게 변화하는 웹 환경을 따라가지 않아도 되므로 인간의 본성, 즉真正로 全球化되고 다국어 지원되는 특징에 의존한다’고 결론지었습니다.













