Góc nhìn Anderson
Chiến tranh Adblock với Máy học

Một sáng kiến nghiên cứu mới từ Mỹ và Pakistan đã phát triển một phương pháp dựa trên máy học để xác định các trang web kháng lại các công nghệ chặn quảng cáo và bảo vệ quyền riêng tư, cũng như phân tích các kỹ thuật mà các trang web này sử dụng để “trộn” nguồn gốc của quảng cáo và nội dung thực sự, khiến nội dung không thể xem được nếu quảng cáo bị chặn.
Các công nghệ chặn quảng cáo mới được phát triển từ những phát hiện này có thể chấm dứt các vụ việc mà nội dung trung tâm của một bài viết không thể xem được khi quảng cáo bị chặn, cung cấp một phương pháp tự động để tách nguồn quảng cáo và nguồn nội dung, thay vì phương pháp thủ công hiện đang được sử dụng bởi các framework chặn quảng cáo phổ biến.
Các tác giả đã thực hiện một nghiên cứu quy mô lớn về “nguồn tài nguyên hỗn hợp” trên 100.000 trang web, phát hiện ra rằng 17% tên miền, 48% tên miền chủ, 6% tập lệnh và 9% phương pháp phân phối nội dung cố ý trộn chức năng theo dõi (tức là quảng cáo) với các quá trình cung cấp nội dung thực sự. Trong những trường hợp như vậy, nội dung bài viết sẽ biến mất đối với người dùng đang sử dụng phần mềm chặn quảng cáo hoặc chống theo dõi, buộc người dùng phải tắt các biện pháp này để xem nội dung.
Trong hầu hết các trường hợp, điều này không chỉ có nghĩa là quảng cáo sẽ được hiển thị lại, mà còn người dùng sẽ bị buộc quay lại các hệ thống theo dõi xuyên miền mà đã gây ra sự phẫn nộ của các nhà vận động bảo vệ quyền riêng tư trong những năm gần đây.
Nghiên cứu mới này cung cấp một hệ thống có thể tách các thành phần của các nguồn tài nguyên “hỗn hợp” này với độ chính xác 98%, cho phép các giải pháp chặn quảng cáo và chống theo dõi có cơ hội phân tách các luồng trong các phiên bản phần mềm sau này, và một lần nữa cho phép truy cập nội dung trên các trang web bị chặn quảng cáo.
Bài báo mới có tiêu đề TrackerSift: Untangling Mixed Tracking và Functional Web Resources, và đến từ các nhà nghiên cứu tại Virginia Tech và UoC Davis ở Mỹ, và FAST NUCES và Đại học Quản lý Lahore (LUMS) ở Pakistan.
Chiến tranh Adblock
Các hệ thống chặn quảng cáo thường dựa trên nhu cầu nội dung quảng cáo trên một trang web phải đến từ các tên miền và/hoặc địa chỉ IP chuyên dụng – thường là các nền tảng công nghệ quảng cáo với tên miền và/hoặc địa chỉ IP có thể được phân loại là “quảng cáo của bên thứ ba”, cho phép phát triển các danh sách chặn sẽ không hiển thị nội dung từ những nguồn gốc đó trong một trang web.
Ngoài ra, các tên của tài nguyên quảng cáo cụ thể, chẳng hạn như tập lệnh, có thể được thêm vào danh sách chặn để chúng không chạy ngay cả trong trường hợp nguồn gốc của chúng đã được che giấu một cách cố ý. Các lược đồ đặt tên của các tập lệnh được tạo ra một cách hệ thống thường nhất quán, cho phép nhận ra và chặn.
Vì một quảng cáo được hiển thị trên một trang web thường được chọn trong vài mili giây cuối cùng của quá trình tải trang qua quy trình đấu giá động (dựa trên từ khóa tìm thấy trên trang, chỉ số mục tiêu chiến dịch và nhiều yếu tố khác), nên không thực tế để lưu trữ quảng cáo trên tên miền chủ, điều này về lý thuyết sẽ cản trở các công cụ chặn quảng cáo ẩn nội dung thương mại.
Ngày càng nhiều trang web đang chống lại việc chặn quảng cáo thông qua CNAME Cloaking – sử dụng các tên miền con của tên miền “chính thức” làm proxy cho máy chủ quảng cáo (tức là, content.example.com sẽ cung cấp quảng cáo cho example.com, ngay cả khi tên miền con không có mục đích nào khác ngoài việc cung cấp quảng cáo, và không được duy trì bởi trang web chủ, mà bởi nhà quảng cáo của nó).
Tuy nhiên, phương pháp này có thể được định lượng và chặn bằng cách phân biệt nội dung của tên miền con là quảng cáo, hoặc sử dụng các kỹ thuật phân tích mạng để xác định mối quan hệ không thường xuyên và bất thường của tên miền con với tên miền chính.
TrackerSift
Bài báo của các tác giả đề xuất TrackerSift, một nền tảng để phân tích các nguồn tài nguyên mạng được các trang web yêu cầu, và sau đó phân loại lại các nguồn tài nguyên hỗn hợp thành “nội dung” và “quảng cáo”. Ở mức phân tích chung nhất, TrackerSift ghi lại các yêu cầu mạng cơ bản cho các nguồn tài nguyên, chẳng hạn như nội dung quảng cáo được lấy từ một Mạng phân phối nội dung (CDN) hoặc một nền tảng quảng cáo; nhưng sau đó nó phân tích sâu hơn vào nội dung của các nguồn tài nguyên được lấy, thực hiện phân tích mã cấp độ và phân biệt các chức năng của các loại gọi mã và thủ tục khác nhau.

TrackerSift’s analysis hierarchy, from tracking resources (red) through to necessary functional resources (green). Mixed resources, which are likely to lead to content obfuscation (yellow) are subjected to deeper analysis. Source: https://arxiv.org/pdf/2108.13923.pdf
Dữ liệu
Để có được tập dữ liệu cung cấp năng lượng cho TrackerSift, các tác giả đã thu thập 100.000 trang web được chọn ngẫu nhiên từ danh sách Tranco top-million năm 2018. Selenium tự động hóa trình duyệt được sử dụng cùng với Google Chrome để thực hiện nhiệm vụ.
Mạng thu thập web được xây dựng trên các trang web của các trường đại học ở Bắc Mỹ, bao gồm một cụm 13 nút với 112 lõi, 52 terabyte lưu trữ và 823 gigabyte RAM hoạt động trong toàn bộ hệ thống.
Mỗi nút được đặt trong một container Docker và dành riêng cho việc thu thập một tập hợp con của 100.000 trang web được chọn, với các khoảng thời gian chương trình pause để đảm bảo tính bền vững, và xóa hoàn toàn tất cả các cookie và định danh khi tải một tên miền mới, để đảm bảo rằng các phiên và trạng thái trước đó không ảnh hưởng đến khả năng đọc của tên miền tiếp theo.
Tập lệnh hỗn hợp
Kết quả cho thấy việc sử dụng rộng rãi tập lệnh hỗn hợp, nơi các nền tảng quảng cáo và chủ sở hữu nội dung cố ý kết hợp các tập lệnh dựa trên nội dung và quảng cáo thành “tập lệnh siêu” sẽ cản trở việc hiển thị nội dung nếu bị chặn. Ví dụ, các tác giả lưu ý rằng pressl.co cung cấp một tập lệnh web được kết hợp thông qua nền tảng kết hợp JavaScript WebPack, chứa một pixel theo dõi của Facebook, và cũng mã cho phép hiển thị nội dung thực sự.
Ngoài ra, bài báo lưu ý rằng một số tên miền sẵn sàng nhúng tập lệnh trực tiếp vào mã của trang web, khiến các framework chặn quảng cáo phải giải quyết chức năng trong các tập lệnh, thay vì chỉ ngăn chặn tập lệnh tải dựa trên URL nguồn bên thứ ba.
Bằng cách xác định các phương pháp này, con đường rõ ràng cho việc tách mã một cách hệ thống thành các loại nội dung và quảng cáo, và khả năng khôi phục hiển thị nội dung trong môi trường bị chặn quảng cáo.
Mặc dù các giải pháp chặn quảng cáo hiện có, chẳng hạn như NoScript, AdGuard, uBlock Origin và Firefox Smartblock sử dụng các tập lệnh thay thế mà tách các tập lệnh hỗn hợp này thành các tập lệnh thành phần có thể bị chặn, nhưng chúng phụ thuộc vào viết lại tập lệnh thủ công, dẫn đến một cuộc chiến lạnh liên tục giữa các công cụ chặn và các kỹ thuật thay đổi liên tục mà phá vỡ chúng. Ngược lại, TrackerSift cung cấp một phương pháp chương trình hóa tiềm năng cho việc phân tách nội dung hỗn hợp.












