Anderson의 관점
셀폰 데이터와 머신 러닝으로 우리의 ‘숨겨진 방문’을 밝혀내기

중국과 미국의 연구자들이 협력하여 머신 러닝 기법을 사용하여 우리가 국가를 돌아다릴 때 하는 ‘숨겨진 방문’을 파악하는 연구를 진행했습니다. 이 연구는 텔레콤 데이터 기록에서 완전한 이동 패턴을 형성하기 위해 충분한 전화 통화나 폰 사용 기록이 없는 경우에 사용됩니다.
연구 논문 《숨겨진 방문 식별하기》는 홍콩 대학의 Zhan Zhao가 주도하며 보스턴 노스이스트 대학교의 Haris N. Koutsopoulos와 MIT의 Jinhua Zhao가 참여했습니다.
이 연구의 전제는 높은 활동성을 보이는 사용자의 모바일 연결 기록을 사용하여 이동 패턴을 더 정확하게 추측할 수 있는 모델을 개발하는 것입니다.

콜 디테일 레코드 데이터에서 여행 정보 추출하기. 출처: https://arxiv.org/pdf/2106.12885.pdf
연구자들은 이러한 연구가 개인 정보 보호에 대한 영향을 미칠 수 있음을 인정하지만, 목표는 이동에 대한 더 일반적인 그림을 얻는 것이라고 주장합니다.
그들은 또한 콜 디테일 레코드(CDR) 데이터가 낮은 공간 분해능을 가지고 있으며, 사용자가 셀폰 타워와의 상대적인 위치에 따라 발생하는 ‘위치 노이즈’에 취약하다고 지적합니다. 이는 개인 정보 보호의 한 형태로 작용할 수 있습니다.
‘우리의 연구 목표는 여행 감지와 OD 추정[*]입니다. 이는 집계 수준에서 수행되며, 개인 수준에서 수행되지 않습니다. 개발된 모델은 텔레콤 운용사의 데이터베이스 서버에 직접 배포될 수 있으며, 데이터 전송이 필요하지 않습니다. 또한, 다른 형태의 빅데이터와 비교하여 CDR 데이터는 상대적으로 개인 정보 보호에 대한 침해가 적습니다. 또한, 위치 오차는 사용자의 정확한 위치를 숨기는 또 하나의 개인 정보 보호 계층을 제공합니다.’
경과 시간 간격(ETIs)
모바일폰을 사용하여 이동할 때, CDR 데이터의 위치 정의 도구로서의 제한이 명확해집니다. 경과 시간 간격(ETIs)은 이동 중에 전화 통화나 데이터 사용이 없는 기간으로, 우리의 이동을 추적하는 데 중요한 마커입니다.
연구자들은 이 간격이 분석 시스템이 A에서 B로의 여행을 가정하는 능력에 방해가 된다고 지적합니다. 새로운 방법은 ETIs의 시공간적 맥락과 개인의 특성을 분석하여 이 문제를 해결합니다.
데이터셋
연구자들은 중국의 600만 명의 인구가 거주하는 도시에서 주요 셀룰러 서비스 운영자로부터 제공된 데이터를 사용하여 핵심 훈련 세트를 개발했습니다. 이 데이터에는 2013년 11월에 300만 명의 사용자가 생성한 20억 개 이상의 모바일폰 트랜잭션이 포함되어 있으며, 음성 통화와 데이터 접근 기록만을 특징으로 합니다. SMS 데이터는 사용되지 않았으며, 이는 데이터의 희소성을 다루는 것을 더 어렵게 만들었습니다.
데이터에는 암호화된 고유 ID, 위치 영역 코드(LAC), 타임스탬프, 셀폰 ID, 이벤트 ID(발신/수신 통화 또는 데이터 사용)가 포함되어 있습니다.

숨겨진 방문 식별하기 위한 프로세스 트리.
이 정보는 셀 타워 운영 데이터베이스와 교차 참조되어 통신 이벤트와 관련된 타워의 경도와 위도 좌표를 조회할 수 있었습니다. 연구자들은 데이터셋에서 9,000개의 셀 타워를 식별할 수 있었습니다.
연구자들은 단순히 전화 기록만으로 여행 목적지를 추측하는 것이 어려움을 관찰했습니다. 이는 전화 기록이 아침과 오후에 피크를 보이며, 이는 여행 패턴과도 관련이 있기 때문입니다. 또한, 전화 통화는 여행을触발할 수 있으므로, 목적지 추정에 편향을 일으킬 수 있습니다.

일일 모바일 사용 패턴.
사용자 초기 데이터 사용 트랜잭션, 즉 메시징 앱이나 기타 상호작용도 유사한 제한을 받습니다. 그러나, 자동화된 데이터 사용, 즉 설치된 앱의 API 폴링이나 GPS 및 일반 텔레메트리 등이 우리를 식별하는 데 도움이 됩니다.
처리
연구자들은 로지스틱 회귀, 서포트 벡터 머신(SVM), 랜덤 포레스트, 그라디언트 부스팅 앙상블 접근법을 포함한 다양한 기계 학습 분류기를 사용하여 문제를 접근했습니다. 모든 분류기는 Python의 scikit-learn을 통해 기본 설정으로 구현되었습니다.
이러한 접근법 중에서, 연구자들은 로지스틱 회귀가 가장 많은 해석 가능한 모델 매개변수를 산출한다는 것을 발견했습니다.
연구자들은 또한, ETI가 길수록 숨겨진 방문이 발생할 가능성이 더 높으며, 아침에 숨겨진 방문이 더 많이 발생한다는 것을 발견했습니다.
또한, 사용자의 CDR 데이터가 많은 목적지 또는 경유지를 노출하는 경우, 숨겨진 방문이 발생할 가능성이 가장 낮습니다. 일반적으로, 이는 연구의 일반 원칙과 일치합니다. 즉, 가장 활동적인 사용자는 이동 패턴에 대한 자세한 그림을 그리고, 덜 활동적인 사용자의 행동을 추론할 수 있습니다.
결론적으로, 연구자들은 이 접근법이 스마트 카드 데이터 및 지오로케이션 소셜 미디어 정보와 같은 다른 유형의 교통 데이터에도 사용될 수 있다고 예측합니다.
이 연구는 에너지 재단 중국과 중국 지속 가능한 교통 센터의 지원을 받았습니다.












