Kąt Andersona

Odkrywanie Naszych “Ukrytych Wizyt” Z Danych Z Telefonu Komórkowego I Sztucznej Inteligencji

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Badacze z Chin i Stanów Zjednoczonych współpracowali nad badaniem, które wykorzystuje techniki sztucznej inteligencji do ustalenia “ukrytych wizyt”, które odbywamy, poruszając się po kraju, ale nie robimy wystarczającej liczby połączeń telefonicznych lub nie używamy wystarczająco często telefonu, aby możliwe było utworzenie pełnego obrazu naszych ruchów na podstawie danych z rejestrów połączeń telefonicznych.

Artykuł artykułu, zatytułowanego Identifying Hidden Visits From Sparse Call Detail Record Data, kierowany jest przez Zhan Zhao z Uniwersytetu w Hongkongu, współpracującego z Harisem N. Koutsopoulos z Northeastern University w Bostonie i Jinhua Zhao z MIT.

Podstawą badań jest wykorzystanie rekordów połączeń komórkowych (w tym danych mobilnych, SMS i połączeń głosowych) bardzo aktywnych użytkowników do opracowania modelu, który może dokładniej odgadnąć wzorce ruchu mniej aktywnych użytkowników.

Schematyczne przedstawienie wyodrębniania informacji o podróży z danych Call Detail Record (CDR). Źródło: https://arxiv.org/pdf/2106.12885.pdf

Schematyczne przedstawienie wyodrębniania informacji o podróży z danych Call Detail Record (CDR). Źródło: https://arxiv.org/pdf/2106.12885.pdf

Mimo że badacze przyznają, iż istnieją implikacje dotyczące prywatności w opracowywaniu takich badań, oraz że celem projektu jest uzyskanie bardziej szczegółowych informacji o podróżach użytkowników, twierdzą, że celem jest uzyskanie lepszego ogólnego obrazu ruchu.

Stwierdzają również, że dane Call Detail Record (CDR), które napędzają takie badania, mają niską rozdzielczość przestrzenną i są podatne na “szum pozycjonowania” ze względu na zmieniającą się pozycję użytkownika w stosunku do wież komórkowych, których używa, i sugerują, że ta ograniczona sama w sobie jest formą ochrony prywatności:

‘Celem naszych badań jest wykrywanie podróży i szacowanie OD[*], które są wykonywane na poziomie agregowanym, a nie indywidualnym. Opracowane modele mogą być bezpośrednio wdrożone na serwerach baz danych operatorów telekomunikacyjnych, bez potrzeby transferu danych. Ponadto, w porównaniu z innymi formami danych, takimi jak dane z mediów społecznościowych lub transakcje kart kredytowych, dane CDR są relatywnie mniej inwazyjne pod względem prywatności osobistej. Dodatkowo, ich błąd lokalizacji pomaga maskować dokładne położenie użytkownika, zapewniając kolejną warstwę ochrony prywatności.’

Interwały Czasu Upływającego (ETI)

Gdy poruszamy się z telefonem komórkowym (niekoniecznie smartfonem), ograniczenia danych CDR jako narzędzia definiującego położenie stają się oczywiste. Interwały czasu upływającego (ETI), okresy podróży, w których użytkownik komórki nie wykonuje ani nie otrzymuje połączeń, są kluczowym wskaźnikiem w śledzeniu naszych ruchów – interwał “ciszy” wystarczająco długi, aby tymczasowo zniknąć z radaru.

Badacze zauważają, że to zakłóca możliwość systemów analitycznych robienia założeń o podróżach z punktu A do punktu B, ponieważ rzadkość danych może ukrywać “nieobserwowaną podróż”. Nowa metoda rozwiązuje to problem, analizując kontekst przestrzenny i czasowy ETI, a także “indywidualne cechy użytkownika”.

Zestaw Danych

Badacze opracowali swój podstawowy zestaw danych z danymi dostarczonymi przez dużego operatora komórkowego w chińskim mieście o populacji 6 milionów ludzi. Dane zawierały ponad 2 miliardy transakcji komórkowych wygenerowanych przez 3 miliony użytkowników w listopadzie 2013 roku i zawierały tylko rekordy połączeń głosowych i danych (użycie danych). Dane SMS nie były używane, co utrudniało rozwiązanie problemu rzadkości danych.

Dane zawierały zaszyfrowane unikalne ID; kod obszaru lokalizacji (LAC); sygnaturę czasową; identyfikator komórki, który był połączony z LAC w celu identyfikacji wieży komórkowej użytej w transakcji; oraz identyfikator zdarzenia (połączenie wychodzące/wchodzące, lub użycie danych).

Drzewo procesu identyfikacji ukrytych wizyt.

Drzewo procesu identyfikacji ukrytych wizyt.

Informacje te były skorelowane z bazą danych operacji wież komórkowych, co pozwoliło badaczom na zapytanie o współrzędne geograficzne wieży komórkowej skojarzonej z zdarzeniem komunikacyjnym. Badacze byli w stanie zidentyfikować 9000 wież komórkowych w zestawie danych.

Badacze obserwują, że trudno jest zgadnąć cele podróży tylko na podstawie rekordów połączeń, ponieważ tego typu rekordy osiągają szczyt w godzinach porannych i popołudniowych, co koreluje z wzorcami podróży. Ponieważ połączenia telefoniczne poprzedzają podróż (i mogą wywołać podróż), może to powodować stronniczość w szacowaniu celu.

Wzorce użycia telefonu komórkowego w ciągu dnia.

Wzorce użycia telefonu komórkowego w ciągu dnia.

Podobne ograniczenia dotyczą transakcji użycia danych inicjowanych przez użytkownika, takich jak aplikacje do wysyłania wiadomości, oraz innych typów interakcji. Jednak “zautomatyzowane” użycie danych pomaga w identyfikacji – systematyczne sondowanie API w celu uzyskania nowych wiadomości lub innych typów danych, w tym list wiadomości, GPS i ogólnych danych telemetrycznych z zainstalowanych aplikacji.

Przetwarzanie

Badacze podejmowali problem z wykorzystaniem szerokiego zakresu popularnych klasyfikatorów sztucznej inteligencji, w tym regresji logistycznej, maszyny wektorowej nośnej (SVM), losowego lasu i podejścia ensemble z wykorzystaniem gradientu. Wszystkie klasyfikatory były wdrożone w Pythonie za pomocą scikit-learn, z ustawieniami domyślnymi.

Spośród tych podejść badacze stwierdzili, że regresja logistyczna daje największą liczbę interpretowalnych parametrów modelu.

Stwierdzili również, że im dłuższy ETI, tym większe prawdopodobieństwo, że nastąpiła ukryta wizyta, oraz że większa liczba ukrytych wizyt występuje rano.

Ponadto, gdy dane CDR użytkownika łatwo ujawniają dużą liczbę miejsc przeznaczenia lub punktów drogi, jest najmniejsze prawdopodobieństwo, że nastąpiła ukryta wizyta. Ogólnie, to zgadza się z ogólną zasadą badań – że “najgłośniejsi” lub najbardziej aktywni użytkownicy malują szczegółowy obraz swoich ruchów, z którego można wywnioskować zachowanie mniej aktywnych użytkowników.

W podsumowaniu, badacze prognozują, że ich podejście może być wykorzystane do innych typów danych transportowych, w tym danych z kart inteligentnych i informacji z mediów społecznościowych zlokalizowanych geograficznie.

Badanie zostało sfinansowane przez Energy Foundation China i China Sustainable Transportation Center.

 

* Pochodzenie-Przeznaczenie

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai