Andersons vinkel

Forskning: Anti-spam-algoritmer viste politisk bias under 2020 USA-valget

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

I henhold til en ny studie viste spamfilteralgoritmer (SFAs) fra tre av verdens største e-posttjenesteleverandører politisk bias under USAs valg i 2020, med Google’s Gmail som hellet mot venstre, og Microsoft Outlook og Yahoo Mail som favoriserte e-poster fra høyreorienterte kandidater.

Rapporten sier:

‘Våre observasjoner avdekket at alle SFAs viste politisk bias i månedene før 2020-valget i USA. Gmail hellet mot venstre (demokrater), mens Outlook og Yahoo hellet mot høyre (republikanere). Gmail markerte 59,3% flere e-poster fra høyreorienterte kandidater som spam sammenlignet med venstreorienterte kandidater, mens Outlook og Yahoo markerte 20,4% og 14,2% flere e-poster fra venstreorienterte kandidater som spam sammenlignet med høyreorienterte kandidater.’

Forfatterens analyse viser, ifølge dem, ‘aggregat-bias’ i SFA-aktivitet.

Rapporten erkjenner også muligheten for ‘dyrket’ spam-merking, der aktører som søker å tie ned motstandens stemmer kunne søke eller få tilgang til offisielle kommunikasjoner fra ‘fiendtlige’ parter og tilhørighet med intensjonen om å rapportere kommunikasjonen som spam, og dermed påvirke algoritmer som bestemmer sannsynligheten for spam-oppdrag fra en bestemt avsender.

Men, forskerne observerer, dette forklarer ikke de merkede variasjonene i måten ulike e-posttjenesteleverandører ser ut til å ha konfigurert handlinger basert på tilbakemeldinger fra slutbrukere:

‘Det er også mulig at SFAs for e-posttjenestene lærte av valg av noen velgere som markerte bestemte kampanje-e-poster som spam og startet å markere disse/slike kampanje-e-poster som spam for andre velgere. Mens vi ikke har noen grunn til å tro at det var bevisste forsøk fra disse e-posttjenestene på å skape disse bias for å påvirke velgerne, er det likevel en faktum at deres SFAs har lært å markere flere e-poster fra en politisk tilhørighet som spam sammenlignet med den andre.’

‘Ettersom disse fremtredende e-posttjenestene er aktivt brukt av en betydelig del av velgerne og siden mange av velgerne i dag avhenger av informasjonen de ser (eller ikke ser) online, kan slike bias ha en uunnselig innvirkning på valgresultatene.’

Rapporten hele rapporten har tittelen En glimt inn i de politiske bias i e-post-spamfilteralgoritmer under USAs valg 2020, og kommer fra fire forskere ved Department of Computer Science ved North Carolina State University.

Rundt husene

Forskerne studerte en periode på fem måneder fra juli 2020 til slutten av november samme år, hvor de opprettet 102 nye e-postadresser på de tre e-postplattformene, og abonnerte på to presidentkandidaters, 78 senatorer og 156 huskandidaters e-postvarslinglister.

For å diskontere demografiske faktorer, ble e-postkontoene opprettet med varierende demografiske faktorer for hver (fiktiv) slutbruker, og delt i to strømmer: den første studerte generelle bias-trender i spamfilteralgoritmer over alle kombinerede e-posttjenester for president-, senator- og huskandidater; og den andre undersøkte måtene ulike e-postinteraksjoner (slik som å markere eller avmarkere som spam av slutbrukeren) syntes å påvirke atferden til algoritmiske spamfiltre.

Flere nøkkelobservasjoner kom i fokus under studiet. Forfatterne rapporterer at Gmail ‘hellet mot venstre’, mens Outlook og Yahoo hellet mot høyre. Yahoo beholdt 55,2% av alle politiske e-poster i brukerens innboks, mens Outlook filtrerte 71,8% av e-poster fra politiske kandidater av alle slag.

‘Gmail beholdt imidlertid de fleste e-poster fra venstreorienterte kandidater i innboksen (< 10,12% markert som spam) mens [de sendte] de fleste e-poster fra høyreorienterte kandidater til spam-mappen (opptil 77,2% markert som spam). ‘

‘Vi observerte videre at prosentandelen av e-poster markert av Gmail som spam fra høyreorienterte kandidater økte jevnt som valgdatoen nærmet seg, mens prosentandelen av e-poster markert som spam fra venstreorienterte kandidater forble omtrent den samme.’

Valg av kandidater

Mens presidentkandidatene som ble abonnert på for studiet var begrenset til Joe Biden og Donald Trump, tok forskerne omsorg å velge representative valg når det gjaldt å abonnere på e-postkommunikasjon fra senator- og huskandidater, av flere grunner.

Først og fremst har delstatene varierende antall seter i huset, basert på delstatens befolkningstall. For det andre varierer antall senatorer og huskandidater over de to største politiske partier over delstatene. Videre var visse kandidater bare representert av offisielle.gov-nettsider, som er lovmessig forbudt fra å sende kampanje-e-poster; og til slutt var noen av kandidatenes abonnementslister beskyttet av CAPTCHAs, som ikke kunne automatiseres av forskernes tilpassede datainnsamlingsramme.

Fordeling av politisk tilhørighet av e-postabonnementer fra senator- og huskandidater. Kilde: https://arxiv.org/pdf/2203.16743.pdf

Fordeling av politisk tilhørighet av e-postabonnementer fra senator- og huskandidater. Kilde: https://arxiv.org/pdf/2203.16743.pdf

For å utjevne den resulterende ubalansen mellom demokratiske og republikanske kandidater, abonnerte forskerne på kampanje-e-postinformasjon fra det maksimale antall kandidater i hver delstat hvor venstre- og høyrekandidater var like i antall, unntatt i delstater som Alaska, som bare hadde én republikansk senator-kandidat.

Til sammen hadde forfatterne å regne med 11 slike delstater, og endte til slutt opp med alle 50 delstater representert. 78 av abonnementene over 36 delstater utgjorde 44 demokratiske og 34 republikanske senator-kandidatlister, mens det var 156 abonnementer over 42 delstater for huskandidater – 81 demokrater og 75 republikanere.

Analyse av data

Forskerne samlet inn 318 108 e-poster over de tre e-posttjenestene i studiets aktive datainnsamlingsperiode, som ble avkortet etter 20. november på grunn av den raske nedgangen i e-postvolum etter denne datoen. Datainnholdet som ble samlet inn for hver e-post inkluderte MIME-Version, Content Type, Subject, From, To, Date, Message-ID, Delivered-To, Received-SPF og Received-By.

På grunn av utfordringene med å representere både politiske partikommunikasjoner rettferdig, ble Propensity Score Analyse (PSA) valgt som den statistiske metoden for dataene. PSA genererer covariater fra ubalanserte data som equaliserer distribusjoner i ekstraordinære omstendigheter hvor kontrollgrupper og tradisjonelle statistiske splitt ikke er lett anvendelige.

Forfatterne konkluderer med at SFAs for e-posttjenestene som ble studert, viser politisk bias, og at tidlig relativ konsistens over tjenestene divergerer til mer spesifikt atferd over tid.

Gmail markerer en høyere prosent (67,6%) av høyreorienterte politiske e-poster som spam, sammenlignet med bare 8,2% av venstreorienterte e-poster, men reagerer mer dynamisk på brukerinteraksjoner som fjerner e-poster fra spam-mappen enn sine kolleger. Outlook markerer 95,8% av venstreorienterte politiske e-poster som spam, sammenlignet med 75,4% for høyreorienterte e-poster, og Yahoo markerer 14,2% flere venstreorienterte e-poster som spam enn høyreorienterte e-poster.

Kumulativ distribusjon av prosentandelen av demokratiske (blå) og republikanske (rød) e-poster som ble markert som spam i hver av de 22 e-postkontoene i hver tjeneste.

Kumulativ distribusjon av prosentandelen av demokratiske (blå) og republikanske (rød) e-poster som ble markert som spam i e-postkontoer i hver tjeneste.

Videre viser resultater at over studieperioden, Gmail reagerer ganske generisk på en økning i e-postvolum over alle politiske tilhørigheter ved å øke markeringen av e-poster som spam, uavhengig av opphav. Yahoo rapporterte konsekvent venstreorienterte e-poster som spam mens kampanjene progrederte, samtidig som de reduerte antall høyreorienterte e-poster som ble markert som spam. Outlook syntes å være minst påvirket av økende e-postvolum fra noen politiske partier, og beholdt en generell høyreorientert bias.

Prosentandelen av e-poster markert som spam over begge politiske partier og alle tre e-posttjenester over de 153 dagene i studieperioden.

Prosentandelen av e-poster markert som spam over begge politiske partier og alle tre e-posttjenester over de 153 dagene i studieperioden.

Respons til brukerinteraksjon

Når vi markerer en spam-e-post som ‘Ikke spam’, er intensjonen å trene e-postsystmet til ikke å flagge lignende e-poster i fremtiden, selv om den underliggende typen regel (e-postbasert, innholdsbasert osv.) ikke alltid er helt tydelig.

Studiets resultater viste at av de tre e-posttjenestene som ble undersøkt, bare Gmail reagerte merkbart på en ‘ikke spam’-inndata fra brukeren. I kontrast hadde denne brukerdrivete spam-til-innboks-interaksjonen (S→I) en svært begrenset langtidsvirkning i Outlook og Yahoo.

Forskerne observerer:

‘[På grunn] av S→I-interaksjonen, reduerte den politiske biasen i Gmail betydelig. Imidlertid økte den uventet i både Outlook og Yahoo, fordi ingen av de to tjenestene reagerte merkbart på brukerens ønske om ikke å markere e-poster som spam som de to tjenestene markerte som spam.’

Konklusjon

Forfatterne konkluderer med at Gmail reagerer ‘merkbart’ på brukerinteraksjon i sammenligning med Outlook og Yahoo, til tross for sin egen venstreorienterte predisposisjon.

Forfatterne sier:

‘ Mens den politiske biasen i Gmail forble uendret etter lesinginteraksjonen, reduerte den betydelig på grunn av I→S- og S→I-interaksjonene.’

Og fortsetter:

‘Mens de politiske biasene endret seg i respons til ulike interaksjoner, beholdt Gmail sin venstreorienterte bias, mens Outlook og Yahoo beholdt sin høyreorienterte bias i alle scenarier.’

Forskerne erkjenner en generell forventning hos slutbrukeren om at spamfiltre kan og vil tilpasse sin atferd basert på brukerintervensjon (slik som å flytte en e-post fra spam-mappen til innboksen, eller å markere en e-post som ‘ikke spam’), men at denne mekanismen ikke er pålitelig, og ikke er konsistent over de tre e-posttjenestene som ble studert.

Rapporten sier:

‘[Vi] fant ingen konsistente handlinger som kunne anbefales til brukerne for å hjelpe dem å redusere biasen i måten SFA behandler politiske e-poster som sendes til dem på.’

 

Først publisert 4. april 2022.

Skribent innen maskinlæring, domenespesialist i menneskelig bildesyntese. Tidligere leder for forskningsinnhold hos Metaphysic.ai, frem til oppløsningen i DNEG's Brahma.ai.
Website: martinanderson.ai
Contact: martin@martinanderson.ai