Unghiul lui Anderson

Lupta împotriva blocării reclamelor cu învățare automată

mm
Adaugă Unite.AI la sursele tale preferate pe Google

O nouă inițiativă de cercetare din Statele Unite și Pakistan a dezvoltat o metodă bazată pe învățare automată pentru identificarea site-urilor web care sunt rezistente la blocarea reclamelor și la alte tehnologii de protecție a confidențialității, precum și pentru deconstruirea tehnicilor utilizate de aceste site-uri pentru a “amesteca” originea reclamelor și a conținutului real, astfel încât conținutul să nu fie vizibil dacă reclamele sunt blocate.

Noi tehnologii de blocare a reclamelor dezvoltate din aceste descoperiri ar putea pune capăt incidentelor în care conținutul central al unui articol nu este vizibil atunci când reclamele sunt blocate, oferind o metodă automată de separare a resurselor de reclame și scripturi, în locul abordării manuale utilizate în prezent de cadrele populare de blocare a reclamelor.

Autorii au efectuat un studiu pe scară largă a “resurselor mixte” pe 100.000 de site-uri web, constatând că 17% din domenii, 48% din nume de gazdă, 6% din scripturi și 9% din metode de livrare a conținutului își amestecă deliberat funcționalitatea de urmărire (adică publicitate) cu procesele care livrează conținut real. În astfel de cazuri, conținutul articolului va dispărea pentru utilizatorii care utilizează software de blocare a reclamelor sau anti-urmărire, forțând utilizatorul să dezactiveze aceste măsuri pentru a vizualiza conținutul.

În majoritatea cazurilor, acest lucru nu înseamnă doar că reclamele vor fi vizibile din nou, ci și că utilizatorii vor fi forțați să revină în sistemele de urmărire transversală care au inflamat campaniile pentru confidențialitate în ultimii ani.

Noua cercetare oferă un sistem care poate separa componentele acestor “resurse mixte” cu o acuratețe de 98%, permițând soluțiilor de blocare a reclamelor și anti-urmărire să dezlegate fluxurile în iterațiile viitoare ale software-ului și să reactiveze accesul la conținut pe paginile blocate.

Articolul nou se intitulează TrackerSift: Dezlegarea resurselor mixte de urmărire și funcționale web și provine de la cercetători de la Virginia Tech și UoC Davis din Statele Unite, și FAST NUCES și Universitatea de Management din Lahore (LUMS) din Pakistan.

Războiul împotriva blocării reclamelor

Sistemele de blocare a reclamelor se bazează, în general, pe necesitatea ca conținutul publicitar dintr-o pagină web să provină din domenii dedicate și specifice – în general, platforme de publicitate cu nume de domeniu și/sau adrese IP care pot fi clasificate ca “publicitate de parte terță”, permițând dezvoltarea de liste de blocare care nu vor afișa conținut din aceste origini în interiorul unei pagini web.

În plus, numele resurselor specifice publicității, cum ar fi scripturile, pot fi adăugate la liste de blocare astfel încât acestea să nu ruleze chiar și în cazurile în care originile lor au fost intenționat obscure.

Deoarece o reclamă prezentată într-o pagină web este adesea aleasă în ultimii câțiva milisecunde ale încărcării paginii prin procese de licitație dinamică (pe baza cuvintelor cheie găsite în pagină, metrici de țintă ale campaniei și multe alte factori), nu este practic să stochezi reclame pe domeniul gazdă, ceea ce, în teorie, ar împiedica blocarea reclamelor să ascundă conținutul comercial.

În mod tot mai frecvent, site-urile web se luptă împotriva blocării reclamelor prin CNAME Cloaking – utilizarea subdomeniilor domeniului “autentic” ca proxy pentru servere de publicitate (de exemplu, content.example.com va serve reclame pentru example.com, chiar dacă subdomeniul nu are niciun alt scop decât să servească reclame și nu este întreținut de site-ul web gazdă, ci de către advertiserii săi).

Cu toate acestea, această metodă poate fi cuantificată și blocată prin distingerea conținutului subdomeniului ca publicitate sau prin utilizarea tehnicilor de analiză a rețelei pentru a identifica relația anormală și neregulată a subdomeniului cu domeniul principal.

TrackerSift

Articolul autorilor propune TrackerSift, o platformă pentru analizarea resurselor de rețea solicitate de site-urile web și apoi recategorizarea resurselor mixte în “conținut” și “publicitate”. La nivelul de analiză cel mai general, TrackerSift înregistrează solicitări de rețea de bază pentru resurse, cum ar fi conținutul publicitar solicitat de la o rețea de livrare a conținutului (CDN) sau o platformă de publicitate; dar apoi se concentrează asupra conținutului resurselor solicitate, efectuând o analiză la nivel de cod și distingând funcțiile diferitelor tipuri de apeluri de cod și proceduri.

TrackerSift's analysis hierarchy, from tracking resources (red) through to necessary functional resources (green). Mixed resources, which are likely to lead to content obfuscation (yellow) are subjected to deeper analysis. Source: https://arxiv.org/pdf/2108.13923.pdf

TrackerSift’s analysis hierarchy, from tracking resources (red) through to necessary functional resources (green). Mixed resources, which are likely to lead to content obfuscation (yellow) are subjected to deeper analysis. Source: https://arxiv.org/pdf/2108.13923.pdf

Date

Pentru a obține setul de date care alimentează TrackerSift, autorii au scurs 100.000 de site-uri web alese aleator din lista Tranco top-million din 2018. Selenium browser automation a fost utilizat împreună cu Google Chrome pentru a efectua această sarcină.

Rețeaua de web-crawling a fost bazată pe site-urile universitare din America de Nord, alcătuită dintr-un cluster de 13 noduri cu 112 nuclee, 52 de terabiți de stocare și 823 de gigabiți de RAM operațională în întregul sistem.

Fiecare nod a fost bazat într-un container Docker și dedicat pentru a scana o submulțime a celor 100.000 de pagini web selectate, cu pauze programatice pentru durabilitate și ștergerea completă a tuturor cookie-urilor și identificatorilor atunci când se încărca un nou domeniu, pentru a se asigura că sesiunile și stările anterioare nu influențează citirea domeniului următor.

Scripturi mixte

Rezultatele arată o utilizare extinsă a scripturilor împachetate, în care platformele de publicitate și gazdele de conținut concatenează intenționat scripturi bazate pe conținut și scripturi bazate pe publicitate în “superscripturi” care vor împiedica afișarea conținutului dacă sunt blocate. De exemplu, autorii notează că pressl.co servește un script web împachetat prin platforma de concatenare JavaScript WebPack, care conține un pixel de urmărire Facebook și, de asemenea, cod care permite renderizarea conținutului real.

În plus, articolul notează că o serie de domenii sunt dispuse să încorporeze scripturi direct în codul paginilor web, făcând necesar ca cadrele de blocare a reclamelor să abordeze funcționalitatea din interiorul scripturilor, și nu doar să prevină încărcarea scriptului pe baza URL-ului său de parte terță.

Prin localizarea acestor metode, calea este clară pentru divizarea sistematică a acestor coduri în categorii de conținut și publicitate, și pentru restaurarea potențială a afișării conținutului în medii blocate.

Deși soluțiile existente de blocare a reclamelor, cum ar fi NoScript, AdGuard, uBlock Origin și Firefox Smartblock, utilizează scripturi substitutive care descompun astfel de scripturi împachetate în scripturi componente blocabile, acestea depind de rescrierea manuală a scripturilor, ceea ce duce latr-un război rece continuu între blocatori și tehnicile care le încalcă. În schimb, TrackerSift oferă o metodă programatică potențială pentru descompunerea conținutului mixt.

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai