Andersonin kulma
Konenäön menetelmä mainosten estämiseen paikallisen selaimen käyttäytymisen perusteella

Tutkijat Sveitsissä ja Yhdysvalloissa ovat kehittäneet uuden konenäön lähestymistavan verkkosivujen mainosmateriaalin havaitsemiseen, joka perustuu siihen, miten mainosmateriaali vuorovaikuttaa selaimen kanssa, sen sijaan, että analysoisi sen sisältöä tai verkkokäyttäytymistä – kaksi lähestymistapaa, jotka ovat osoittautuneet tehottomiksi pitkällä aikavälillä CNAME-peittämisen (ks. alla) vastaiskuissa.
WebGraph-niminen kehys käyttää verkkopohjaisen AI-mainostenestoratkaisun graafipohjaisen lähestymistavan mainosmateriaalin havaitsemiseen keskittymällä sellaisiin olennaisiin toimintoihin verkkomainonnassa – mukaan lukien telemetria-yritykset ja paikallinen selaimen tallennus –, joita vain tehokas kiertotapa olisi olla osallistumatta näihin toimintoihin.
Vaikka aiemmat lähestymistavat ovat saavuttaneet hieman korkeammat havaintoasteet kuin WebGraph, ne kaikki ovat alttiita kiertotekniikoille, kun taas WebGraph pystyy lähestymään 100 %:n luotettavuutta vastaiskuisten vastauksien edessä, mukaan lukien monimutkaisemmat hypoteettiset vastaukset, jotka voivat syntyä tämän uuden mainostenestoratkaisun edessä.
Tutkimus on johtanut kahden tutkijan Sveitsin liittovaltion teknillisestä korkeakoulusta yhteistyössä Kalifornian yliopiston Davisin ja Iowan yliopiston tutkijoiden kanssa.
WebGraphin jälkeen
Tutkimus on kehitys 2020 vuoden tutkimushankkeesta Brave-selaimen kanssa nimeltä AdGraph, jossa oli mukana kaksi tutkijaa uudesta tutkimuksesta.

Vertailu AdGraphin ja WebGraphin välillä, jossa on viivat, jotka edustavat arkkitehtuurisia innovaatioita aiemmassa lähestymistavassa. Lähde: https://arxiv.org/pdf/2107.11309.pdf
AdGraph perustuu (mainos)sisällön ominaisuuksiin, jotka on johdettu URL-osoitteiden analyysistä, avainasiana mainosmateriaalin havaitsemiseen. Kuitenkin nämä ominaisuudet edustavat yhtä mahdollista epäonnistumisen kohtaa vihollisille, jotka pyrkivät havaitsemaan ad-havaintajärjestelmien läsnäolon ja kehittämään menetelmiä niiden kiertämiseksi. Tämä riippuvuus sisällön ominaisuuksista tekee AdGraphin periaatteessa mekanisoituneen version manuaalisesti kohdennetuista suodatusluetteloihin perustuvista lähestymistavoista, jakaa heidän heikkoutensa.
CNAME-peittäminen
Materiaali, joka on peräisin verkkosivun omasta verkkotunnuksesta, kuuluu “luotettavaan” luokkaan, niin kauan kuin itse verkkotunnus on luotettava. Korkean auktoriteetin verkkosivuilla on arvokas etu juosta mainoskampanjoita, jotka sisältävät materiaalia, joka näyttää olevan isäntäverkkosivun itsensä isäntänä, koska tällainen mainonta on immuuni suodatuspohjaisille mainostenestolistoille ja jopa AdGraphin lähestymistavalle vuonna 2020.
Kuitenkin mukautetut kampanjat ovat vaikeita neuvotella, kalliita toteuttaa ja vastakkaisia verkkomainonnan periaatteille, jotka on kehitetty viimeisen 25 vuoden aikana, jossa kolmannen osapuolen alusta upottaa koodia suoraan isäntäverkkosivulle, yleensä “huutokauppaamalla” mainospaikkaa mikrosekunteja vastaan avainsanan haluttavuuden ja muiden tekijöiden perusteella.
Koska lähes kaikki mainostenestojärjestelmät keskittyvät kolmannen osapuolen materiaaliin verkkosivuilla (ts. alueet, jotka ovat isäntäverkkotunnusta), mainostajat ovat taistelleet takaisin CNAME-peittämistekniikoilla viimeisen viiden vuoden aikana. CNAME-peittäminen pettää seurantajärjestelmiä uskomaan, että isäntäverkkosivun aliverkkotunnus (ts. tieto.esimerkki.com sen sijaan, että esimerkki.com) on aito liite sivustolle, kun se itse asiassa on välittäjämainonnan tarjoamismekanismi, joka on järjestetty kolmannen osapuolen mainostajien kanssa.
Maaliskuussa 2021 yksi tutkimus paljasti, että CNAME-peittämistapaukset lisääntyivät 22 %:lla vuosina 2018-2020, ja lähes 10 % Tranco-top 10 000 -verkkosivuista käytti vähintään yhtä CNAME-pohjaista seurantaa lokakuussa 2020.
Luottamuksen puute URL-osoitteissa
CNAME-pettämistekniikat ovat manipulaatioita mainonnanjakoprosessissa mukana olevista URL-osoitteista. Mikä tahansa mainostenestojärjestelmä, joka luottaa URL-ketjuun, on altis manipuloinnille ja kiertämiselle. Sen vuoksi WebGraph muuttaa satunnaisesti toimittuja URL-osoitteita prosessissa (mukaan lukien kyselymerkkijonot, parametreja ja parametrinimet), etsien käytön malleja sen sijaan, että etsisi tiettyjä kiellettyjä tai hyväksyttyjä URL-osoitteita.
Järjestelmän on otettava huomioon kaksi yleistä konfiguraatiota mainonnanjakorakenteessa: yksi, jossa isäntä on suoraan yhteistyössä mainostajan kanssa; ja toinen (yleisempi) skenaario, jossa mainostaja tarjoaa rajoitetun yhteistyön tarpeen vuoksi suojella itsensä asiakkaiden manipuloinnilta.
Luettelopohjaisissa lähestymistavoissa, mukaan lukien AdGraph, onnistunut URL-manipulaatio mainonnanjakojärjestelmässä on melkein täydellinen voitto, antaen “paikallisen” alkuperän mainokselle ja siten välttäen melkein kaikki systemaattiset yritykset estää mainosmateriaalia.
Mikä on jäljellä, jonka avulla voidaan tunnistaa? WebGraph keskittyy sen sijaan mainonnanjakojärjestelmien tarpeeseen jakaa tietoa eri puolipidettävillä tavoilla, kuten verkkoseurantajat, viestintä iframe- ja verkkokuuntelijoiden välillä, jotka ovat jatkuvasti kyselyssä isäntäverkkosivun tilasta toiminnasta, joka on merkittävää verkkomittareiden kannalta mainoksille. Tällainen toiminta sisältää muuttujien tallentamisen evästeisiin tai HTML5-pohjaisiin paikallisiin tietovarastoihin.
WebGraph käyttää Mozillan Web Privacy Measurement (OpenWPM-kehystä) seuratakseen tällaista toimintaa Firefoxissa. Se kaappaa kaiken toiminnan JavaScript-tasolla ja kaikki lähtevät verkkopyynnöt ja niiden vastaukset verkkotason tasolla.
Tämä lisätty tarkastelu tuo uudet “tietovirta” -reunat aiemmin AdGraphin ehdottamaan verkkoverkostoon, mahdollistaen WebGraphille eksplisiittisesti tallentaa ja mittaamaan tietojen jakamismalleja paikallisen toiminnan perusteella, ja riippumatta alkuperä- ja määränpää-URL-osoitteista telemetria- tai muiden tyyppisten viestintäkanavien välillä mainonnanjakojärjestelmissä.
Tulokset
Tutkijat käyttivät laajennettua OpenWPM:ää järjestelmällisesti tarkastamaan 10 000 verkkosivua, jotka otettiin Alexa-top 100 000 -sivuilta, ja satunnaisotanta 9 000 sivusta, jotka olivat sijoittuneet 1k-100k, tallentamaan niiden graafiset edustukset ennen kuin tulokset annettiin päätöspuuhun, joka mallinnettiin AdGraphin alkuperäisen suunnitelman mukaan, ja käytti suosittuja mainossuodatusluetteloita perustotuuksina. Tällä tavoin rakennettiin tietokanta keskimmäisen mallin koulutukseen.
Järjestelmä saavutti vertailukelpoiset tulokset AdGraphiin, 92,33 %:n tarkin. Kuitenkin uuden järjestelmän kestävyys vastaiskuisten torjuntaa kohtaan nousee lähes täydellisestä epäonnistumisesta AdGraphissa ainoastaan 8 %:iin WebGraphissa.
Tulevaisuuden suunnat
Tutkimus väittää, että mainonnanjakoverkostojen on muutettava merkittävästi järjestelmiään voidakseen välttää havaitsemisen WebGraph-lähestymistavan edessä, ja ehdottaa, että tällaiset muutokset edellyttäisivät tarkastelua nykyistä varovaisuutta kolmannen osapuolen mainostajien ja isäntäverkkosivujen välillä, joilla heidän mainoksensa näkyvät.
Tutkimus toteaa myös, että WebGraph ei ottaa huomioon tilittömiä seurantatekniikoita, kuten selainjäljen seurantaa (Canvas-elementin kautta), jotka käyttävät API:ja, joita järjestelmä ei tällä hetkellä seuraa. Tutkijat ehdottavat, että WebGraph voidaan laajentaa tulevaisuudessa ottaen huomioon myös nämä tyypit vuorovaikutuksia ja paikallisia tallennusmerkintöjä.












