Andersons vinkel

Å avdekke våre ‘skjulte besøk’ med mobiltelefondata og maskinlæring

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Forskere fra Kina og USA har samarbeidet om en studie som bruker maskinlæringsteknikker for å avdekke de ‘skjulte besøkene’ vi gjør når vi beveger oss rundt i landet, men ikke gjør nok telefonoppringer eller bruker mobiltelefonen vår tilstrekkelig for å danne et fullstendig bilde av våre bevegelser fra telekommunikasjonsdata.

Studien, med tittelen Identifisering av skjulte besøk fra sparsomt call detaljert registreringsdata, er ledet av Zhan Zhao fra University of Hong Kong, sammen med Haris N. Koutsopoulos fra Northeastern University i Boston og Jinhua Zhao ved MIT.

Utgangspunktet for studien er å bruke mobiltilkoblingsdata (inkludert mobildata, SMS og telefonoppringer) fra høyt aktive brukere til å utvikle en modell som kan gjette bevegelsesmønsterene til mindre aktive brukere mer nøyaktig.

En grov skisse for å trekke ut reiseinformasjon fra Call Detail Record (CD) data. Kilde: https://arxiv.org/pdf/2106.12885.pdf

En grov skisse for å trekke ut reiseinformasjon fra Call Detail Record (CD) data. Kilde: https://arxiv.org/pdf/2106.12885.pdf

Selv om forskerne innrømmer at det finnes personvernimplikasjoner i å utvikle slike studier, og til tross for prosjektets uttalte mål om å få en mer detaljert og granulert beskrivelse av brukerens reiser, hevder de at målet er å få en bedre generell bildet av bevegelse.

De bemerker også at Call Detail Record (CDR) data, som driver slike studier, har lav romlig oppløsning og er utsatt for ‘posisjonsstøy’ på grunn av brukerens endrede posisjon i forhold til mobiltelefonsignalet fra tårnene de passerer, og foreslår at denne begrensningen i seg selv er en form for personvernsbeskyttelse:

‘Målet med vår studie er reisedeteksjon og OD-estimering[*], som gjøres på aggregert nivå, ikke individnivå. De utviklede modellene kan deployeres direkte på database-servere til telekommunikasjonsselskaper, uten behov for dataoverføring. Videre, sammenlignet med andre former for stor data, som sosiale medier eller kredittkortstransaksjonsdata, er CDR-data relativt mindre intrusivt i forhold til personlig personvern. I tillegg hjelper lokaliseringsfeilen med å maskere den eksakte brukerposisjonen, og gir en ekstra lag med personvernsbeskyttelse.’

Forløpte tidsintervaller (ETIs)

Når vi reiser rundt med mobiltelefoner (ikke nødvendigvis smarttelefoner), blir begrensningene i CDR-data som et verktøy for å definere posisjon tydelig. Forløpte tidsintervaller (ETIs), perioder i en reise hvor mobilbrukeren ikke gjør eller mottar samtaler, er en kritisk markør for å holde spor av våre bevegelser – et intervall av ‘stille’ som er langt nok til at vi midlertidig faller av radaren.

Forskere bemerker at dette forstyrrer evnen til analytiske systemer til å gjøre antagelser om A>B-reiser, siden sparsomheten i data kan skjule en ‘uobservert tur’. Den nye metoden adresserer dette ved å analysere den romlig-tidslige konteksten til ETIs, samt ‘den enkelte brukerens karakteristika’.

Datasett

Forskere utviklet sin kjerne-treningssammenstilling med data fra en stor mobiltelefonselskap i en kinesisk by med en befolkning på 6 millioner mennesker. Data inneholdt over to milliarder mobiltelefontransaksjoner generert av tre millioner brukere i november 2013, og inneholder bare stemmeoppringer og data-tilgang (data-bruk). SMS-data ble ikke brukt, noe som gjorde det vanskeligere å håndtere sparsomheten i data.

Data inneholdt en kryptert unik ID; et Location Area Code (LAC); et tidsstempel; et mobiltelefon-ID, som ble samlet med LAC for å individuere mobiltelefonsignalet som ble brukt i transaksjonen; og et Hendelses-ID (utgående/innkommende samtale, eller data-bruk).

Prosess-tre for identifisering av skjulte besøk.

Prosess-tre for identifisering av skjulte besøk.

Dette ble krysset med en mobiltelefonsignaltårn-database, som tillot forskerne å spørre om lengde- og breddekoordinatene til tårnet som var assosiert med kommunikasjonshendelsen. Forskerne kunne identifisere 9000 mobiltelefonsignaltårn i datasett.

Forskere observerer at det er vanskelig å gjette reisemål bare ved hjelp av samtaledata, siden disse typene data toppar i morgen og ettermiddag, som korrelerer med reisemønster uansett. Siden telefonoppringer forutgår reise (og kan utløse en reise), kan dette føre til forvrengning i mål-estimering.

Mobilbruksmønster over løpet av en dag.

Mobilbruksmønster over løpet av en dag.

Tilsvarende begrensninger gjelder for bruker-initiert data-brukstransaksjoner, som meldingsapper, og andre typer interaksjon. Men det er ‘automatisert’ data-bruk som hjelper med å identifisere oss – det systematiske avhøring av API-er for nye meldinger eller andre typer data, inkludert meldingslister, GPS og generell telemetri over installerte apper.

Behandling

Forskere tilnærmet problemet med en bred rekke populære maskinlæring-klassifisatorer, inkludert logistisk regresjon, støttevektor-maskin (SVM), tilfeldig skog og en gradient-boost-ensemble-tilnærming. Alle klassifisatorene ble implementert i Python via scikit-learn, på standardinnstillinger.

Av disse tilnærmingene fant forskerne at logistisk regresjon ga det høyeste antallet tolkbare modellparametere.

Forskerne oppdaget også at jo lenger ETI, jo større sannsynlighet for at et skjult besøk har funnet sted, og at en større forekomst av skjulte besøk skjer om morgenen.

Videre fant forskerne at når en brukers CDR-data lett avslører et høyt antall mål eller veipunkter, er det minst sannsynlig at et skjult besøk har funnet sted. Generelt stemmer dette overens med studiens generelle prinsipp – at de ‘støyende’ eller mest aktive brukerne maler et detaljert bilde av sine bevegelser, fra hvilket atferden til mindre aktive brukere kan sluttes.

I konklusjonen forutser forskerne at deres tilnærming kan brukes for andre typer transit-data, inkludert smartkort-data og geolokalisert sosiale medier-informasjon.

Forskningen ble finansiert av Energy Foundation China og China Sustainable Transportation Center.

 

* Opphav-Destinasjon

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai