Andersonův úhel

Odhalení našich ‘skrytých návštěv’ pomocí dat z mobilních telefonů a strojového učení

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Vědci z Číny a Spojených států spolupracovali na výzkumu, který využívá techniky strojového učení k odhalení našich ‘skrytých návštěv’, když se pohybujeme po zemi, ale neděláme dostatek telefonních hovorů nebo nepoužíváme naše telefony dostatečně, aby se z nich dala vytvořit úplná obraz o našich pohybech.

Článek, nazvaný Identifikace skrytých návštěv z řídkých záznamů o podrobnostech hovorů, je veden Zhanem Zhaem z Univerzity v Hongkongu, který spolupracuje s Harisem N. Koutsopoulosem z Northeastern University v Bostonu a Jinhuaem Zhaem z MIT.

Předpoklad výzkumu spočívá v tom, že se použijí záznamy o mobilní konektivitě (včetně mobilních dat, SMS a hlasových hovorů) vysoce aktivních uživatelů k vytvoření modelu, který může přesněji odhadnout pohybové vzorce méně aktivních uživatelů.

Schéma pro extrakci informací o cestách z dat o podrobnostech hovorů. Zdroj: https://arxiv.org/pdf/2106.12885.pdf

Schéma pro extrakci informací o cestách z dat o podrobnostech hovorů. Zdroj: https://arxiv.org/pdf/2106.12885.pdf

Ačkoli vědci připouštějí, že existují důsledky pro soukromí při vývoji takové práce, a navzdory prohlášení o cíli projektu získat větší a podrobnější informace o cestách uživatelů, tvrdí, že cílem je získat lepší obecný obraz o pohybu.

Také poznamenávají, že data o podrobnostech hovorů, která pohání takové studie, mají nízkou prostorovou rozlišitelnost a jsou náchylná k ‘šumu polohy’ kvůli změně polohy uživatele vzhledem k věžím mobilních telefonů, které procházejí, a navrhnou, že toto omezení samo o sobě je forma ochrany soukromí:

‘Cílová aplikace našeho studia je detekce cest a odhadování OD[*], které se provádějí na agregované úrovni, ne na individuální úrovni. Vyvinuté modely lze přímo nasadit na databázové servery telefonních operátorů, bez potřeby přenosu dat. Kromě toho, ve srovnání s jinými formami velkých dat, jako jsou sociální sítě nebo transakční data z kreditních karet, jsou data o podrobnostech hovorů relativně méně invazivní z hlediska osobních údajů. Kromě toho jejich chyba lokalizace pomáhá maskovat přesné umístění uživatelů, poskytující další vrstvu ochrany soukromí.’

Intervaly uplynulého času (ETI)

Když se pohybujeme s mobilními telefony (ne nutně smartphony), stávají se omezení dat o podrobnostech hovorů jako nástroje pro definici polohy zřejmými. Intervaly uplynulého času (ETI), období cesty, během kterých mobilní uživatelé neuskutečňují ani nepřijímají hovory, jsou kritickým ukazatelem pro sledování našich pohybů – interval ‘ticha’ dostatečně dlouhý na to, aby nás dočasně vyřadil z mapy.

Vědci poznamenávají, že to interferuje s schopností analytických systémů učinit předpoklady o cestách A>B, protože řídkost dat by mohla skrývat ‘nespatřenou cestu’. Nová metoda řeší tento problém analýzou prostorově-časového kontextu ETI, stejně jako ‘individuální charakteristiky uživatele’.

Dataset

Vědci vyvinuli svůj základní tréninkový soubor s daty poskytnutými významným mobilním operátorem v čínském městě s populací 6 milionů lidí. Data obsahovala více než dvě miliardy mobilních telefonních transakcí generovaných třemi miliony uživatelů v listopadu 2013 a obsahovala pouze záznamy o hlasových hovorech a přístupu k datům (používání dat). Data SMS nebyla použita, což ztížilo řešení řídkosti dat.

Data obsahovala zašifrované jedinečné ID; kód oblasti (LAC); časové razítko; ID mobilního telefonu, které bylo seskupeno s LAC, aby se identifikovala věž mobilního telefonu použitého v transakci; a ID události (odchozí/příchozí hovor, nebo použití dat).

Procesní strom pro identifikaci skrytých návštěv.

Procesní strom pro identifikaci skrytých návštěv.

Tato informace byla zkřížena s databází operací věží mobilních telefonů, což umožnilo výzkumníkům dotázat se na zeměpisné šířky a délky souřadnic věže spojené s komunikační událostí. Výzkumníci byli schopni identifikovat 9000 věží mobilních telefonů v datovém souboru.

Vědci pozorují, že je obtížné odhadnout cíle cest pouze na základě záznamů o hovorech, protože tyto typy záznamů vyvrcholí ráno a odpoledne, což koreluje s cestovními vzorci. Jelikož telefonní hovory předcházejí cestě (a mohou spustit cestu), může to způsobit zkreslení v odhadu destinace.

Vzorce používání mobilních telefonů během dne.

Vzorce používání mobilních telefonů během dne.

Podobná omezení platí pro transakce iniciované uživatelem, jako jsou aplikace pro zasílání zpráv, a další typy interakcí. Nicméně, ‘automatizované’ použití dat pomáhá identifikovat nás – systematické dotazování API pro nové zprávy nebo jiné typy dat, včetně seznamů zpráv, GPS a obecné telemetrie napříč nainstalovanými aplikacemi.

Zpracování

Výzkumníci přistoupili k problému s širokou škálou populárních klasifikátorů strojového učení, včetně logistické regrese, podpory vektorového stroje (SVM), náhodného lesa a gradientního zesílení. Všechny klasifikátory byly implementovány v Pythonu prostřednictvím scikit-learn, s výchozími nastaveními.

Z těchto přístupů výzkumníci zjistili, že logistická regrese poskytla nejvyšší počet interpretovatelných modelových parametrů.

Také objevili, že čím déle trvá ETI, tím větší je pravděpodobnost, že došlo ke skryté návštěvě, a že vyšší incidence skrytých návštěv se vyskytuje ráno.

Kromě toho, když údaje o podrobnostech hovorů uživatele snadno odhalí vysoké množství destinací nebo mezilehlých bodů, je nejnižší pravděpodobnost, že došlo ke skryté návštěvě. Obecně se to shoduje s obecným principem výzkumu – že ‘nejhlučnější’ nebo nejaktivnější uživatelé vytvářejí podrobný obraz o svých pohybech, z něhož lze odvodit chování méně aktivních uživatelů.

V závěru výzkumníci předpovídají, že jejich přístup lze použít pro jiné typy dat o dopravě, včetně dat z inteligentních karet a geolokalizovaných sociálních médií.

Výzkum byl financován Energy Foundation China a China Sustainable Transportation Center.

ive uživatelé lze odvodit. V závěru výzkumníci předpovídají, že jejich přístup lze použít pro jiné typy dat o dopravě, včetně dat z inteligentních karet a geolokalizovaných sociálních médií. Výzkum byl financován Energy Foundation China a China Sustainable Transportation Center. * Origin-Destination

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai