Anderson의 관점

광고 차단을 막는 기술과 기계 학습으로의 대응

mm
Unite.AI를 Google의 선호 소스에 추가

미국과 파키스탄의 새로운 연구 이니셔티브는 기계 학습 기반의 방법을 개발하여 광고 차단과 다른 개인 정보 보호 기술에 저항하는 웹사이트를 식별하고, 이러한 웹사이트가 광고와 실제 콘텐츠의 출처를 혼합하는 기술을 해체하는 방법을 연구했습니다. 이를 통해 콘텐츠가 광고가 차단되면 표시되지 않는 문제를 해결할 수 있습니다.

새로운 광고 차단 기술은 기존의 수동적인 접근 방식과는 달리, 자동으로 광고와 스크립트 资源을 분리하는 방법을 제공할 수 있습니다. 연구진은 100,000개의 웹사이트를 대상으로 한 대규모 연구에서, 17%의 도메인, 48%의 호스트 이름, 6%의 스크립트, 9%의 콘텐츠 전송 방법이 광고 추적 기능과 실제 콘텐츠 전송 프로세스를 혼합하는 것을 발견했습니다. 이러한 경우, 사용자가 광고 차단이나 추적 방지 소프트웨어를 사용하는 경우, 콘텐츠가 표시되지 않습니다.

대부분의 경우, 이는 단순히 광고가 다시 표시되는 것을 의미하지 않습니다. 사용자는 또한 최근 몇 년간 개인 정보 보호 캠페인에 불을 지핀 크로스 도메인 추적 시스템으로 돌아가야 합니다. 새로운 연구는 이러한 혼합된 웹 资源을 98%의 정확도로 분리하는 시스템을 제공하여, 광고 차단과 추적 방지 솔루션이 이러한 资源을 분리하여 콘텐츠 접근을 다시 활성화할 수 있습니다.

새로운 논문은 TrackerSift: Mixed Tracking and Functional Web Resources의 분리라는 제목으로, 미국의 버지니아 테크와 UC 데이비스, 파키스탄의 FAST NUCES와 라호르 매니지먼트 사이언스 대학교의 연구진에 의해 작성되었습니다.

광고 차단 전쟁

광고 차단 시스템은 일반적으로 웹페이지의 광고 콘텐츠가 특정한 도메인에서 출처해야 하는 필요성에 의존합니다. 이러한 도메인은 일반적으로 광고 기술 플랫폼의 도메인 이름이나 IP 주소로, ‘제3자 광고’로 분류할 수 있습니다. 이를 통해 이러한 출처에서 콘텐츠를 렌더링하지 않는 블록리스트를 개발할 수 있습니다.

또한, 광고 관련 资源의 이름, such as 스크립트,을 블록리스트에 추가하여 이러한 资源이 실행되지 않도록 할 수 있습니다. 이러한 资源의 이름은 일반적으로 일관된命名 규칙을 따르므로, 이러한 资源을 식별하고 블록리스트에 추가할 수 있습니다.

웹페이지에 표시되는 광고는 일반적으로 마지막 몇 밀리초 동안에 동적 경매 프로세스를 통해 선택됩니다. 이는 페이지의 키워드, 캠페인 대상 지표, 기타 요인에 기반하여 결정됩니다. 따라서, 이러한 광고를 호스트 도메인에 저장하는 것은 실제로 광고 차단기를 방해할 것입니다.

최근, 웹사이트는 광고 차단을 막기 위해 CNAME 클로킹을 사용하고 있습니다. 이는 ‘진짜’ 도메인의 서브도메인을 광고 서버의 프록시로 사용하는 것입니다. 예를 들어, content.example.com은 example.com에 광고를 제공할 것입니다. 그러나, 이 서브도메인은 다른 목적으로 사용되지 않으며, 호스트 웹사이트가 아닌 광고주가 관리합니다.

그러나, 이러한 방법은 서브도메인의 콘텐츠를 광고로 식별하거나, 네트워크 분석 기술을 사용하여 서브도메인의 비정상적인 관계를 식별하여 차단할 수 있습니다.

TrackerSift

연구진의 논문은 TrackerSift라는 플랫폼을 제안합니다. 이는 웹사이트에서 가져온 네트워크 资源을 분석하여, 이러한 资源을 ‘콘텐츠’와 ‘광고’로 재분류하는 것입니다. TrackerSift는 기본적으로 네트워크 요청을 기록합니다. 예를 들어, 콘텐츠 전송 네트워크 또는 광고 플랫폼에서 가져온 광고 콘텐츠입니다. 그런 다음, 가져온 资源의 콘텐츠를 분석하여, 코드 수준에서 다양한 유형의 코드 호출과 절차의 기능을 구분합니다.

TrackerSift의 분석 계층, 추적 资源(빨간색)에서 필요한 기능 资源(초록색)까지. 콘텐츠 혼합 资源(노란색)은 더 깊은 분석을 수행합니다.

TrackerSift의 분석 계층, 추적 资源(빨간색)에서 필요한 기능 资源(초록색)까지. 콘텐츠 혼합 资源(노란색)은 더 깊은 분석을 수행합니다. 출처: https://arxiv.org/pdf/2108.13923.pdf

데이터

TrackerSift를 구동하는 데이터셋을 얻기 위해, 연구진은 2018년 Tranco top-million 목록에서 100,000개의 랜덤으로 선택된 웹사이트를 크롤링했습니다. Selenium 브라우저 자동화와 Google Chrome을 사용하여 이 작업을 수행했습니다.

웹 크롤링 네트워크는 북미의 대학 사이트를 기반으로 하여, 13개의 노드 클러스터로 구성되었습니다. 각 노드는 112개의 코어, 52테라바이트의 저장소, 823기가바이트의 운영 RAM을 갖추고 있었습니다. 각 노드는 Docker 컨테이너에 기반하여, 100,000개의 웹페이지 중 일부를 크롤링하는 데 지정되었습니다. 프로그램적으로 지속 가능성을 위해 일시적으로 중지되며, 새로운 도메인을 로드할 때 모든 쿠키와 식별자를 삭제하여, 이전 세션이나 상태가 다음 도메인의 읽기 가능성에 영향을 미치지 않도록 했습니다.

혼합 스크립트

결과는广泛하게 사용되는 스크립트 번들링을 보여줍니다. 여기서 광고 플랫폼과 콘텐츠 호스트는 의도적으로 콘텐츠 기반 스크립트와 광고 기반 스크립트를 ‘über스크립트’로 결합하여, 이러한 스크립트가 차단되면 콘텐츠 표시를 방해합니다. 예를 들어, pressl.co는 WebPack 자바스크립트 결합 플랫폼을 통해 번들링된 웹 스크립트를 제공합니다. 이 스크립트에는 페이스북 추적 픽셀이 포함되어 있으며, 실제 콘텐츠 렌더링을 위한 코드도 포함되어 있습니다.

또한, 논문은 일부 도메인이 웹 페이지의 코드에 직접 스크립트를 삽입하는 경우가 많으며, 이는 광고 차단 프레임워크가 스크립트의 기능을 해결해야 하며, 단순히 스크립트의 출처 URL에 따라 스크립트를 로드하지 못하도록 해야 함을 나타냅니다.

이러한 방법을 지역화하면, 이러한 코드를 콘텐츠와 광고 카테고리로 분할하여, 광고 차단 환경에서 콘텐츠 표시를 복원하는 경로가 명확해집니다.

기존의 광고 차단 솔루션, such as NoScript, AdGuard, uBlock Origin, Firefox Smartblock은 이러한 결합된 스크립트를 분할하여 차단 가능한 구성 요소 스크립트로 분해하는 서리게이트 스크립트를 사용합니다. 그러나, 이러한 스크립트는 수동으로 다시 작성되어야 하며, 이는 차단기와 이러한 기술을 깨는 끊임없는 냉전을 의미합니다. 반면, TrackerSift는 혼합된 콘텐츠 분해를 위한 잠재적인 프로그래밍 방식을 제공합니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai