Anderson의 관점

브라우저 행동에 기반한 광고 차단을 위한 기계 학습 방법

mm
Unite.AI를 Google의 선호 소스에 추가

스위스와 미국의 연구자들은 웹사이트 광고 자료의 탐지를 위한 새로운 기계 학습 접근 방식을 개발했습니다. 이 접근 방식은 광고 자료의 내용이나 네트워크 행동을 분석하는 대신 브라우저와의 상호작용에 기반합니다. 이러한 접근 방식은 CNAME 클로킹(아래 참조)에 직면하여 장기적으로 효과적이지 못한 두 가지 접근 방식을 대체합니다.

WebGraph라는 프레임워크는 그래프 기반의 AI 광고 차단 접근 방식을 사용하여 광고 콘텐츠를 탐지합니다. 이 접근 방식은 네트워크 광고의 필수적인 활동, 즉 텔레메트리 시도와 로컬 브라우저 저장소에 집중합니다. 이러한 활동은 광고 차단 시스템을 피하는 유일한 방법입니다.

이전의 접근 방식은 WebGraph보다 약간 높은 탐지율을 달성했지만, 모두 회피 기술에 취약합니다. 반면에 WebGraph는 적대적 반응에 대한 강건성에서 거의 100%의 완전성을 달성합니다.

이 연구는 스위스 연방 공과 대학의 두 명의 연구자와 캘리포니아 대학교 데이비스와 아이오와 대학교의 연구자들이 함께 수행했습니다.

AdGraph를 넘어서

이 연구는 2020년에 Brave 브라우저와 함께 시작된 AdGraph 연구의 발전입니다. AdGraph는 두 개의 연구자가 참여한 새로운 논문의 일부입니다.

AdGraph는 광고 콘텐츠를 탐지하기 위해 URL에서 파생된 콘텐츠 특징을 사용합니다. 그러나 이러한 특징은 광고 탐지 시스템의 존재를 탐지하려는 적대자에게 단일한 실패 지점을 제공합니다. AdGraph는 콘텐츠 특징에 의존하기 때문에 필터 목록 기반의 접근 방식과 같은 약점을 공유합니다.

CNAME 클로킹

웹사이트의 자체 도메인에서 발신되는 자료는 ‘신뢰할 수 있는’ 범주에 속합니다. 높은 권위의 웹사이트에서는 광고 캠페인을 실행하는 것이 유용합니다. 이러한 광고는 웹사이트 자체에서 호스팅되는 것으로 보이기 때문에 필터 기반의 광고 차단 목록과 даже 2020年的 AdGraph 접근 방식에도 면역입니다.

그러나 이러한 광고 캠페인은 협상하기 어렵고 비용이 많이 들며, 25년간 개발된 네트워크 광고 모델의 핵심 원칙에 반합니다. 이 모델에서는 第三자 플랫폼이 호스트 사이트에 직접 코드를 삽입하고, 마이크로초 단위로 광고 슬롯을 경매합니다.

대부분의 광고 차단 시스템은 웹 페이지의 第三자 자료(즉, ‘외부’ 도메인에 호스팅되는 요소)를 기반으로 작동합니다. 따라서 광고주는 CNAME 클로킹 기술을 사용하여 추적기를 속여서 호스트 사이트의 하위 도메인이 실제 사이트의 일부인 것처럼 보이게 합니다.

URL에 대한 신뢰를 할인

CNAME 클로킹 기술은 광고 제공 과정에서 사용되는 URL을 조작합니다. URL 체인을 신뢰하는 광고 차단 시스템은 조작과 회피에 취약합니다. 따라서 WebGraph는 제공된 URL을 임의로 변경하여 패턴을 찾습니다.

시스템은 두 가지 일반적인 구성에 대해 고려해야 합니다. 하나는 호스트가 광고주와 직접 공모하는 경우이고, 다른 하나는 광고주가 제한된 협력을 제공하는 경우입니다.

리스트 기반의 접근 방식,包括 AdGraph,에서 성공적인 URL 조작은 거의 완전한 승리입니다. 이는 광고 콘텐츠를 ‘로컬’ 출처로 만들고, 거의 모든 광고 차단 시도를 피할 수 있습니다.

웹그래프는 광고 시스템이 정보를 공유하는 다양한 방법, 즉 웹 트래커, 아이프레임과 웹 ‘리스너’를 사용하여 호스트 페이지의 상태를 폴링하는 것을 중점으로 합니다. 이러한 활동에는 쿠키나 HTML5 기반의 로컬 저장소에 변수를 저장하는 것이 포함됩니다.

웹그래프는 Mozilla의 Web Privacy Measurement(OpenWPM 프레임워크)를 사용하여 이러한 활동을 추적합니다. 이것은 JavaScript 계층과 네트워크 계층에서 모든 활동을 캡처합니다.

결과

연구자들은 OpenWPM의 확장 버전을 사용하여 Alexa 상위 100,000개 사이트 중 10,000개와 1,000개에서 100,000개 사이의 랜덤 샘플 9,000개를 크롤링했습니다. 그래프 표현을 저장하고, 결과를 AdGraph의 원래 설계에 기반한 의사 결정 트리 분류기에 전달했습니다. 이 분류기는 인기 있는 광고 필터 목록을 기준으로 사용했습니다.

시스템은 92.33%의 정확도를 달성했습니다. 그러나 새로운 시스템의 적대적 저항에 대한 강건성은 거의 완전한 실패에서 8%의 취약성으로 증가했습니다.

미래 방향

논문은 광고 네트워크가 웹그래프 접근 방식의 탐지를 피하기 위해 시스템을 크게 재구성해야 할 것이라고 주장합니다. 이러한 변경은 현재 第三자 광고주와 호스트 사이트 간의 신뢰 관계를 재검토해야 할 것입니다.

논문은 또한 웹그래프가 상태 없는 추적 기술, 즉 브라우저 지문(캔버스 요소)을 사용하는 것을 고려하지 않는다 고述합니다. 연구자들은 웹그래프를 이러한 상호작용과 로컬 저장소 시그니처를 고려하도록 확장할 수 있다고 제안합니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai