Regulering

Bør rekommendasjonssystemer være fritatt fra post-sporingsalderen?

mm
Legg til Unite.AI blant dine foretrukne kilder på Google
Idiocracy Costco

Siden first-party data-innsamling blir det nye navigasjonslys for markedsførere og dataforhandlere, risikerer den økte oppmerksomheten på ‘lukkede’ datainnsamlingssystemer å trekke ett av maskinlæringens mest frenetiske forskningsområder ned i kontrovers og større regulering.

Handlinger som blir utført av FAANG-aktører og FOSS-produsenter i de neste 12-18 månedene, er satt til å lukke ned kulturen av tverrdomene-sporing som omga user-analytikk-systemer over de siste tjue årene, og kulminerte i Cambridge Analytica-skandalene og, deretter, uimotståelig folkelig etterspørsel etter økt nett-privatliv.

Uansett om implementeringen holder mål, og uansett hvilken grad mer generelle sporingsystemer (slik som Google’s FLOC og Apple’s SKAdNetwork) kan berolige forbruker-irritasjon og tilfredsstille annonserere, denne nye bølgen av bekymring for bruker-privatliv gjelder bare for tverrdomene-data-utvinning i en ‘offentlig’ kontekst, og ikke for lukkede eller proprietære forbruker-miljøer, og de tilpassede rekommendasjonssystemene som driver engasjement der.

Rik data i lukkede hager

Plattformer som Netflix, Disney+, HBO Max, Roku og Amazon -økosystemet (inkludert Prime Video og produktanbefalinger), som bruker tilpassede maskinlærings-rekommendasjonssystemer, er blant innholdstjenestene som nå vokser og trekker seg tilbake mens strømmingsindustrien balkaniserer.

Siden tredjeparts-datainnsamling trekker seg tilbake, ser det ut til at fordelen disse større strømmings-aktørene beholder i form av finmasket tilgang til kunde-bruksdata, sannsynligvis vil inspirere misunnelse og etterligning, og en fornyet fokus på first-party-rammer som en måte å kløve tilbake hyper-personlig målretting fra de mer generelle nye analytiske systemene.

Hvis dette skjer, er det ikke sannsynlig å være like demokratisk eller meritokratisk som tidligere kriterier for inngang, fordi den største fordelen vil falle til leverandører med det mest omfattende nettverket av first-party-plattformer; med nok utviklingsressurser til å tilby sikre lokale autentiserings-systemer; og som kan håndtere, analysere og monovere høy-volum-data lokalt.

Dette vil fokusere offentlig skråning på privatliv-aspektene ved ‘lukkede’ rekommendasjonssystemer på en måte som de har kunnet unngå til nå, fordi de tidligere har vært unntakstilfeller, og har nydt unntak-privilegier, som opererer i en kontekst hvor sluttbrukeren uttrykkelig har valgt å godta aggressive datainnsamling-praksiser som ikke generelt er tillatt i åpne nettverk.

En videre retur til hermetiske first-party-miljøer

En økt fokus på first-party-data synes å være sannsynlig å bringe en retur til de domene-spesifikke autentiserings-systemene som forhåndsgikk populariteten til tredjeparts-metoder tilbudt av Google (0Auth 2.0), Facebook og Twitter, samt andre populære bolt-på sosiale plattformer som Disqus.

For ti år siden løste den vidstrakte adopsjonen av disse tredjeparts-autentiserings-plattformene mange sikkerhetsproblemer for domener med begrensede utviklingsressurser, men gjorde det også vanskeligere å oppnå samme granularitet av handlebare bruker-data som et dedikert og lokalt first-party-autentiserings- og overvåkningssystem tillater. Da gjorde det ikke så mye, fordi tverrdomene-sporing kunne brolegge denne data-gapen.

Logg inn som løsning på en eksistensiell krise

Nå ligger fordelen i å sikre at en bruker er logget inn, selv om det ikke finnes eksplisitte mekanismer for å monovere dem. Et eksempel på dette er den voksende antallet medie-utgivelser som krever en innlogging for å vise innhold, selv der det ikke finnes en betalingsmur på plass. For eksempel, eksperimenterer The Guardian nå med innloggings-krav for artikkel-visninger som kommer fra Google-søk:

Skjermbilde av en 'logg inn-mur' for en Guardian-artikkel-visning som har kommet fra en Google-søk. Dette kan ikke fanges i web-arkiv-snapshot, siden begrensningen genereres enten av refererende-headers eller IP-baserte systemer som avslører Google som opphavet til klikket.

Skjermbilde av en ‘logg inn-mur’ for en Guardian-artikkel-visning som har kommet fra en Google-søk. Dette kan ikke fanges i web-arkiv-snapshot, siden begrensningen genereres enten av refererende-headers eller IP-baserte systemer som avslører Google som opphavet til klikket.

Begrensninger av denne typen kan være vanskelige å fastslå for en enkelt viser, siden de kan variere over geolokasjoner eller andre omstendigheter. For eksempel, er ovennevnte Guardian-artikkel ikke begrenset på noen måte når den navigeres til fra innenfor Guardian-nettstedet (selv om leseren ikke er logget inn), eller når den aksesseres direkte. Å kreve en innlogging fra en Google-henvisning er en billig metode for å generere en etterspørsels-drevet økning i medlemskap uten å alienere ‘forhåndskapt’ lesere.

Til tross for at det alltid har vært datainnsamling- fordeler i denne type first-party-engasjement (dvs. en ‘lokal’ innlogging), synes fallet av tverrdomene-sporing å være sannsynlig å elevere praksisen fra ‘fordelaktig’ til en eksistensiell nødvendighet for å unngå de sparsere markedsdata-strømmene til FLOC og SKAdNetwork.

Impulsen mot first-party-data-innsamling

Beviset for en first-party-data-‘gull-rush’ er tykt på bakken. Ifølge en industrinsider på Forbes, vil fallet av tredjeparts-cookies føre til nye muligheter for selskaper til å kuratere og selge annenpart-data, hvor de har nok first-party-infrastruktur til å effektivt bli data-forhandlere i egen rett.

Analyse andre steder forutser at detaljhandlere (som investerer tungt i maskinlærings-rekommendasjonssystemer) vil blir de nye ‘media-mogulene’.

I en blogg-innlegg, exemplifiserer moneterings-plattformen Setupad intensjonen til annonse-industrien til ikke å gi etter for fødererte, data-begrensede systemer som FLOC, uttale at ‘atferdsmessig målretting er svaret på fremtidens suksess for annonserere’, og at first-party-innsamling er det absolutt nødvendige forutsetningen for dette.

Atferdsmessig målretting er hva som forårsaket den nåværende tektoniske skiftet i forbruker-privatliv først, og det er hva markedsførings- og profesjonell influenser-industriene ønsker å vinne tilbake – ved proxy, ved list eller ved noen andre midler, uansett om det kan trekke rekommendasjonssystem-forskning-sektoren ned i mudderet med det.

First-party-‘klubben’

Foruten kravet til dyre infrastruktur, samt sikkerhets- og utviklingsressurser, indikerer en annen faktor hvorfor bare større bekymringer sannsynligvis vil blomstre i alderen av first-party-data-innsamlingssystemer: et selskap vil trenge overbevisende marked-erobring for å tvinge forbrukere tilbake til de lokale innloggings-systemene som de var glade for å forlate for ti år siden.

Dette er en risikabelt bevegelse, selv for en stor spiller, og minnet om Digg’s undergang i 2010 fortsatt hærer SEO- og markedsførings-verdenen. Jo mer overbevisende et selskaps marked-erobring er, jo mindre skadelig vil denne bevegelsen være, med mer powerful selskaper i stand til å vær mot dalene og tilpasse seg bedre til first-party-økosystemet enn mindre bekymringer.

Effekter på rekommendasjonssystem-forskning

Siden denne situasjonen utvikler seg, kan den true den relative ‘fri pass’ som regulatorisk tilsyn har gitt til maskinlærings-rekommendasjonssystem-forskning fra selskaper som Google, Amazon (AMZN ) og Netflix.

Til en viss grad, forutser EU’s nye forslag for AI-lovgivning større skråning av rekommendasjonssystemer i alle fall. Til tross for at det er uklart om utkastets bestemmelse mot ‘subliminale teknikker utenfor en persons bevissthet for å materielt forstyrre en persons atferd’ vil gjelde for rekommendasjonssystemer, er det forventet at annonserere og rekommendasjonssystem-forskere vil lobbye for unntak-behandling.

Men det kan være vanskelig å gjøre et tilfelle for å ringfence rekommendasjonssystem-forskning i tilfelle at ‘hage’-tilnærmingen blir den nye industrien-standarden, og de akademiske beitemarkene som har vert rekommendasjonssystem-forskning-sektoren blir en høy-volum-hotbed for massivt kommersialisert first-party-atferd-forskning-utvikling.

Stor investering i first-party-data-arbeidsflyter kan være den eneste håpet for å gjenskape de samme typen høy-effektive ‘psykiske’ annonser og politiske propaganda som karakteriserte Cambridge Analytica-æraen; men for regulatorene, kan det se ut som at døden av tredjeparts-cookies bare flyttet ‘uærlige’ praksiser av gatene og inn i lukkede lokaler. Hvis den ytre effekten av disse aktivitetene vekker offentlig sinne igjen, kan det vise seg å være en liten tilflukt.

Skribent innen maskinlæring, domenespesialist i menneskelig bildesyntese. Tidligere leder for forskningsinnhold hos Metaphysic.ai, frem til oppløsningen i DNEG's Brahma.ai.
Website: martinanderson.ai
Contact: martin@martinanderson.ai