Siber Güvenlik

Adblock Engellemeyle Mücadele Eden Makine Öğrenimi

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Amerika Birleşik Devletleri ve Pakistan’dan yeni bir araştırma girişimi, adblock ve diğer gizlilik koruyucu teknolojilere karşı dirençli web sitelerini tanımlamak ve bu sitelerin reklam ve gerçek içerik kaynaklarını “karıştırma” tekniklerini ayrıştırmak için makine öğrenimi tabanlı bir yöntem geliştirdi. Bu, içerik görüntülenebilir olmadığında, engellenen reklamların neden olduğu içerik engelleme sorunlarını çözmek için yeni bir approach sunuyor.

Yeni adblock teknolojileri, bu bulgulardan yararlanarak, bir makaledeki merkezi içeriğin engellenen reklamlar nedeniyle görüntülenemez olması gibi olayların son bulmasını sağlayabilir. Bu, manuel bir yaklaşım yerine, otomatik bir yöntem kullanarak reklam ve komut kaynaklarını ayırabilir.

Araştırmacılar, 100.000 web sitesini inceleyerek, %17’sinin reklam ve gerçek içerik kaynaklarını karıştırma eğiliminde olduğunu buldu. Bu, kullanıcıların reklam engelleme veya anti-izleme yazılımları kullanırken, web sitelerinin bazı içeriklerini görüntüleyememesine neden oluyor.

Bu durum, sadece reklamların görünür olmasını sağlamakla kalmaz, aynı zamanda kullanıcıların tekrar çapraz alan izleme sistemlerine dönmelerine neden olur. Bu sistemler, son yıllarda gizlilik savunucularını kızdırmıştır.

Yeni araştırma, %98 doğruluk oranıyla bu “karışık” web kaynaklarını ayırabilen bir sistem sunuyor. Bu, reklam engelleme ve anti-izleme çözümlerinin, gelecekteki sürümlerinde bu kaynakları ayırmalarına ve içerik erişimini yeniden sağlamalarına olanak tanıyacak.

Yeni makale, TrackerSift: Karışık İzleme ve İşlevsel Web Kaynaklarını Ayırma başlığını taşıyor ve Virginia Tech, UoC Davis, FAST NUCES ve Lahore Üniversitesi’nden (LUMS) araştırmacılardan geliyor.

Adblock Savaşları

Adblock sistemleri genellikle, web sayfasındaki reklam içeriğinin belirli, adanmış alan adlarından veya IP adreslerinden gelmesi gerektiği ihtiyacına dayanır. Bu, reklam teknoloji platformlarının üçüncü taraf reklamcılık olarak sınıflandırılabilmesi için domain adları ve/veya IP adreslerine sahip olmalarına dayanır. Böylece, bu kaynaklardan gelen içeriği web sayfası içinde göstermeyen engelleme listeleri geliştirilebilir.

Ayrıca, reklam kaynaklarının adları, komut dosyaları gibi, engelleme listelerine eklenebilir, böylece bu kaynaklar çalışmaz. Bu tür sistemsel olarak oluşturulan komut dosyalarının adlandırma şemaları genellikle tutarlıdır, bu da tanınmalarını ve engellenmelerini sağlar.

Web sayfasında görünen bir reklam genellikle, sayfa yüklenirken son birkaç milisaniyede, dinamik ihale süreçleri aracılığıyla seçilir. Bu, sayfa içindeki anahtar kelimelere, kampanya hedef metriclerine ve diğer birçok faktöre dayanır. Bu nedenle, reklamları ana domaine depolamak pratik değildir, çünkü bu, teoride, reklam engelleme yazılımlarının ticari içeriği gizlemesini engelleyecektir.

Artık, web siteleri, CNAME Cloaking kullanarak reklam engelleme karşıtı önlemler almaya başladılar. Bu, “gerçek” domaine ait alt alan adlarını, reklam sunucuları olarak kullanmaya dayanır. Örneğin, content.example.com, example.com’a reklamlar sunabilir, ancak bu alt alan adı başka bir amaç için değil, yalnızca reklamcılar tarafından yönetilir.

Ancak, bu yöntemi nicel olarak belirlemek ve engelleme listelerine eklemek mümkün. Ayrıca, ağ analiz tekniklerini kullanarak, alt alan adının ana domaine olan anomali ve düzensiz ilişkisini tanımlamak da mümkündür.

TrackerSift

Makale, TrackerSift adlı bir platform öneriyor. Bu platform, web siteleri tarafından alınan ağ kaynaklarını analiz ediyor ve bunları “içerik” ve “reklam” olarak yeniden sınıflandırıyor. En genel analiz düzeyinde, TrackerSift, temel ağ isteklerini, örneğin bir İçerik Dağıtım Ağı (CDN) veya reklam platformundan alınan reklam içeriğini kaydediyor. Ardından, alınan kaynakların içeriğini, kod düzeyinde analiz ederek ve çeşitli kod çağrıları ve prosedürlerin işlevlerini ayırt ederek daha derin bir analiz gerçekleştiriyor.

TrackerSift'in analiz hiyerarşisi, izleme kaynaklarından (kırmızı) gerekli işlevsel kaynaklara (yeşil) kadar. İçerik bulanıklığına (sarı) neden olabilecek karışık kaynaklar daha derin bir analiz için tabi tutuluyor.

TrackerSift’in analiz hiyerarşisi, izleme kaynaklarından (kırmızı) gerekli işlevsel kaynaklara (yeşil) kadar. İçerik bulanıklığına (sarı) neden olabilecek karışık kaynaklar daha derin bir analiz için tabi tutuluyor. Kaynak: https://arxiv.org/pdf/2108.13923.pdf

Veri

TrackerSift’i güçlendiren veri setini elde etmek için, araştırmacılar 2018 Tranco top-million listesinden 100.000 rastgele web sitesini taramışlardır. Selenium tarayıcı otomatikleştirme ve Google Chrome kullanılarak bu görev gerçekleştirilmiştir.

Web tarama ağı, Kuzey Amerika’daki üniversite sitelerine dayanan, 13 düğümlü bir küme olarak kuruldu. Bu küme, 112 çekirdek, 52 terabayt depolama ve tüm sistem boyunca 823 gigabayt işletim RAM’ine sahipti.

Her düğüm, bir Docker kabına dayanıyordu ve seçilen 100.000 web sayfasının bir alt kümesini taramak için ayrılmıştı. Sürdürülebilirlik için programlı aralar ve her yeni domaine yüklenirken tüm çerezleri ve tanımlayıcıları silme işlemi gerçekleştirildi. Bu, önceki oturumların ve durumların bir sonraki domaine erişimi etkilememesini sağladı.

Karışık Komut Dosyaları

Sonuçlar, reklam platformları ve içerik barındırıcıların, içerik tabanlı ve reklam tabanlı komut dosyalarını “überscript”lere birleştirmelerine yol açan geniş çaplı bir “komut dosyası birleştirme” kullanımını gösteriyor. Bu, içerik görüntülenmesini engeller. Örneğin, araştırmacılar, pressl.co’nun WebPack JavaScript birleştirme platformu kullanılarak birleştirilmiş bir web komut dosyası sunduğunu belirtiyorlar. Bu komut dosyası, bir Facebook izleme pikseli ve gerçek içeriği görüntülemeyi sağlayan kod içeriyor.

Ayrıca, makale, bazı alan adlarının web sayfalarının koduna doğrudan komut dosyaları eklemeye istekli olduğunu not ediyor. Bu, reklam engelleme çerçevelerinin yalnızca üçüncü taraf kaynak URL’sine göre komut dosyasını yüklemeyi engelleme yerine, komut dosyasının içindeki işlevselliği ele alması gerektiği anlamına geliyor.

Bu yöntemleri yerel olarak belirlemek, böyle bir kodun içerik ve reklam kategorilerine ayrılmasının ve engellenen ortamlarda içerik görüntülenmesinin potansiyel olarak yeniden sağlanmasının yolunu açıyor.

Mevcut reklam engelleme çözümleri, NoScript, AdGuard, uBlock Origin ve Firefox Smartblock, bu birleştirilmiş komut dosyalarını ayırarak bileşen komut dosyalarına dönüştüren vekil komut dosyaları kullanıyor. Ancak bu, manuel olarak komut dosyalarının yeniden yazılmasına dayanır. Bu, engelleme ve her zaman değişen tekniklerin arasında süregiden bir soğuk savaşa neden olur. Buna karşılık, TrackerSift, karışık içerik ayrıştırması için programlı bir yöntem sunuyor.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai