Andersonův úhel
Odhalení našich ‘skrytých návštěv’ pomocí dat z mobilních telefonů a strojového učení

Vědci z Číny a Spojených států spolupracovali na výzkumu, který využívá techniky strojového učení k odhalení našich ‘skrytých návštěv’, když se pohybujeme po zemi, ale neděláme dostatek telefonních hovorů nebo nepoužíváme naše telefony dostatečně, aby se z nich dala vytvořit úplná obraz o našich pohybech.
Článek, nazvaný Identifikace skrytých návštěv z řídkých záznamů o podrobnostech hovorů, je veden Zhanem Zhaem z Univerzity v Hongkongu, který spolupracuje s Harisem N. Koutsopoulosem z Northeastern University v Bostonu a Jinhuaem Zhaem z MIT.
Předpoklad výzkumu spočívá v tom, že se použijí záznamy o mobilní konektivitě (včetně mobilních dat, SMS a hlasových hovorů) vysoce aktivních uživatelů k vytvoření modelu, který může přesněji odhadnout pohybové vzorce méně aktivních uživatelů.

Schéma pro extrakci informací o cestách z dat o podrobnostech hovorů. Zdroj: https://arxiv.org/pdf/2106.12885.pdf
Ačkoli vědci připouštějí, že existují důsledky pro soukromí při vývoji takové práce, a navzdory prohlášení o cíli projektu získat větší a podrobnější informace o cestách uživatelů, tvrdí, že cílem je získat lepší obecný obraz o pohybu.
Také poznamenávají, že data o podrobnostech hovorů, která pohání takové studie, mají nízkou prostorovou rozlišitelnost a jsou náchylná k ‘šumu polohy’ kvůli změně polohy uživatele vzhledem k věžím mobilních telefonů, které procházejí, a navrhnou, že toto omezení samo o sobě je forma ochrany soukromí:
‘Cílová aplikace našeho studia je detekce cest a odhadování OD[*], které se provádějí na agregované úrovni, ne na individuální úrovni. Vyvinuté modely lze přímo nasadit na databázové servery telefonních operátorů, bez potřeby přenosu dat. Kromě toho, ve srovnání s jinými formami velkých dat, jako jsou sociální sítě nebo transakční data z kreditních karet, jsou data o podrobnostech hovorů relativně méně invazivní z hlediska osobních údajů. Kromě toho jejich chyba lokalizace pomáhá maskovat přesné umístění uživatelů, poskytující další vrstvu ochrany soukromí.’
Intervaly uplynulého času (ETI)
Když se pohybujeme s mobilními telefony (ne nutně smartphony), stávají se omezení dat o podrobnostech hovorů jako nástroje pro definici polohy zřejmými. Intervaly uplynulého času (ETI), období cesty, během kterých mobilní uživatelé neuskutečňují ani nepřijímají hovory, jsou kritickým ukazatelem pro sledování našich pohybů – interval ‘ticha’ dostatečně dlouhý na to, aby nás dočasně vyřadil z mapy.
Vědci poznamenávají, že to interferuje s schopností analytických systémů učinit předpoklady o cestách A>B, protože řídkost dat by mohla skrývat ‘nespatřenou cestu’. Nová metoda řeší tento problém analýzou prostorově-časového kontextu ETI, stejně jako ‘individuální charakteristiky uživatele’.
Dataset
Vědci vyvinuli svůj základní tréninkový soubor s daty poskytnutými významným mobilním operátorem v čínském městě s populací 6 milionů lidí. Data obsahovala více než dvě miliardy mobilních telefonních transakcí generovaných třemi miliony uživatelů v listopadu 2013 a obsahovala pouze záznamy o hlasových hovorech a přístupu k datům (používání dat). Data SMS nebyla použita, což ztížilo řešení řídkosti dat.
Data obsahovala zašifrované jedinečné ID; kód oblasti (LAC); časové razítko; ID mobilního telefonu, které bylo seskupeno s LAC, aby se identifikovala věž mobilního telefonu použitého v transakci; a ID události (odchozí/příchozí hovor, nebo použití dat).

Procesní strom pro identifikaci skrytých návštěv.
Tato informace byla zkřížena s databází operací věží mobilních telefonů, což umožnilo výzkumníkům dotázat se na zeměpisné šířky a délky souřadnic věže spojené s komunikační událostí. Výzkumníci byli schopni identifikovat 9000 věží mobilních telefonů v datovém souboru.
Vědci pozorují, že je obtížné odhadnout cíle cest pouze na základě záznamů o hovorech, protože tyto typy záznamů vyvrcholí ráno a odpoledne, což koreluje s cestovními vzorci. Jelikož telefonní hovory předcházejí cestě (a mohou spustit cestu), může to způsobit zkreslení v odhadu destinace.

Vzorce používání mobilních telefonů během dne.
Podobná omezení platí pro transakce iniciované uživatelem, jako jsou aplikace pro zasílání zpráv, a další typy interakcí. Nicméně, ‘automatizované’ použití dat pomáhá identifikovat nás – systematické dotazování API pro nové zprávy nebo jiné typy dat, včetně seznamů zpráv, GPS a obecné telemetrie napříč nainstalovanými aplikacemi.
Zpracování
Výzkumníci přistoupili k problému s širokou škálou populárních klasifikátorů strojového učení, včetně logistické regrese, podpory vektorového stroje (SVM), náhodného lesa a gradientního zesílení. Všechny klasifikátory byly implementovány v Pythonu prostřednictvím scikit-learn, s výchozími nastaveními.
Z těchto přístupů výzkumníci zjistili, že logistická regrese poskytla nejvyšší počet interpretovatelných modelových parametrů.
Také objevili, že čím déle trvá ETI, tím větší je pravděpodobnost, že došlo ke skryté návštěvě, a že vyšší incidence skrytých návštěv se vyskytuje ráno.
Kromě toho, když údaje o podrobnostech hovorů uživatele snadno odhalí vysoké množství destinací nebo mezilehlých bodů, je nejnižší pravděpodobnost, že došlo ke skryté návštěvě. Obecně se to shoduje s obecným principem výzkumu – že ‘nejhlučnější’ nebo nejaktivnější uživatelé vytvářejí podrobný obraz o svých pohybech, z něhož lze odvodit chování méně aktivních uživatelů.
V závěru výzkumníci předpovídají, že jejich přístup lze použít pro jiné typy dat o dopravě, včetně dat z inteligentních karet a geolokalizovaných sociálních médií.
Výzkum byl financován Energy Foundation China a China Sustainable Transportation Center.
ive uživatelé lze odvodit. V závěru výzkumníci předpovídají, že jejich přístup lze použít pro jiné typy dat o dopravě, včetně dat z inteligentních karet a geolokalizovaných sociálních médií. Výzkum byl financován Energy Foundation China a China Sustainable Transportation Center. * Origin-Destination












