Anderson의 관점
25년간의 개인정보 보호정책을 머신러닝으로 분석하기

최근 연구에서는 1996년부터 2021년까지 25년 동안 인기 있는 웹사이트에서 50,000개 이상의 개인정보 보호정책을 분석하여 가독성, 유용성, 길이 및 복잡성을 차트화하는 데 머신러닝 분석 기술을 사용했습니다. 연구 결과는 평균 사용자가 개인정보 보호정책을 이해하기 위해 400시간의 ‘연간 독서 시간’을 투자해야 하며, 이는 하루에 1시간 이상입니다. 이는 현대의 개인정보 보호정책이 점점 더 길고, 모호하며, 불분명한 언어를 사용하고 있기 때문입니다.
报告는 다음과 같이 말합니다:
‘평균 정책 길이는 지난 10년 동안 거의 두 배로 증가했으며, 2011년 3월에는 2,159단어, 2021년 3월에는 4,191단어가 사용되었습니다. 2000년 이후 거의 4배로 증가했습니다(1,146단어).’

분석한 코퍼스에서 평균 단어 수와 문장 수를 25년 동안 나타낸 그래프. 출처: https://arxiv.org/pdf/2201.08739.pdf
GDPR과 캘리포니아 소비자 개인정보 보호법(CCPA) 보호가 시행된 후 정책의 길이 증가 속도가 급격히 증가했지만, 연구는 이러한 변동을 ‘작은 효과 크기’로 간주하며, 이는 더广泛한 장기적인 추세와 비교하여 중요하지 않다고 판단합니다. 그러나 GDPR는 정책에서 모호한 언어의 증가를 유발한 것으로 판단됩니다.
250단어/분의 읽기 속도를 가정하면, 연구에 따르면 평균 개인정보 보호정책은 17분이 걸립니다. 인기 있는 정책(즉, 많은 사용자를 가진 정책)은 23분이 걸립니다.
데이터셋에서 가장 긴 정책은 마이크로소프트에서 제공하며, 연구에 따르면 152분이 걸립니다. 이는 여러 가지 변형을 사용하여 Google의 BERT 언어 모델을 사용하여 수행되었습니다.

사용자가 1,462개의 고유한 웹사이트를 방문한다고 가정할 때, 현대의 개인정보 보호정책을 읽기 위한 연간 시간의 증가.
最近의 개인정보 보호정책의verbosity와 모호성의 증가는 규제를 강화하려는 시도에 대한 반응으로, 또한 규제 준수 요구사항을 이용하여 개인정보 보호정책의 범위와 불투명성을 은밀하게 증가시키는 것으로 간주됩니다.
‘전반적으로, 우리의 결과는 최근의 개인정보 보호 규제가 온라인 사용자의 개인정보를 크게 개선하지 못했으며, 오히려 더 많은 불투명한 개인정보 보호정책을 만들어냈음을 보여줍니다. 이러한 정책은 더 많은 침입적인 데이터 관행을 설명합니다.’
최근 몇 년 동안 몇몇 자연어 처리(NLP) 논문이 개인정보 보호정책의 가독성과 다른 측면을 다루었지만, 연구자는 이 프로젝트가 최근 몇십 년 동안 정책 개발에 대한 광범위한 개요를 제공하는 첫 번째 프로젝트라고 믿습니다.
연구 논문은 개인정보 보호정책의 내용과 가독성: 1996-2021이라는 제목으로, 영국 데 몬트포드 대학교의 사이버 기술 연구소의 이사벨 바그너(Isabel Wagner)가 작성했습니다.
회피적 언어
报告는 또한 개인정보 보호정책에서 ‘회피적 단어’의 평균 수가 2018년까지 점진적으로 증가했지만, 2018년 3월에는 227개, 2020년 6월에는 304개로 급격히 증가했다고 밝혔습니다.
연구자는 이 증가가 GDPR의 영향을 받은 것으로 간주하며, 연구에 따르면 연구된 개인정보 보호정책의 72% 이상의 문장에 최소한 하나의 회피적 단어가 포함되어 있습니다.
가독성
세 가지 일반적인 읽기 어려움 지표에서, 연구는 개인정보 보호정책이 ‘시간이 지남에 따라 점점 더 어려워졌음’을 발견했습니다. 연구자들은 2021년에 유효한 정책 중 41%가 중위 Flesch Reading Ease(FRE, 높을수록 좋음) 점수가 31.8점이라고 추정했으며, 연구자는 ‘이 점수는 매우 어려운 텍스트로, 대학 졸업자가 이해하기에 적합합니다’라고 관찰했습니다.
동시에, 정책 중 6.7%만이 45점 이상의 FRE 점수를 달성했으며, 보고서는 ‘이것은 플로리다 주에서 보험 정책에 필요한 읽기 표준’이라고 지적했습니다.
정책 변경 알림
연구는 또한 개인정보 보호정책이 사용자에게 정책 변경에 대한 알림을 어떻게 제공하는지에 대해 다룹니다. 이는 사용자가 동의를 유지하는 의지에 영향을 미칠 수 있습니다.
연구자는 다음과 같이 말합니다:
‘2021년에, 73%의 정책이 정책 변경에 대한 알림을 포함합니다. 이 중 34%는 정책 변경이 정책에 공지될 것이라고 말하며, 37%는 웹사이트에 공지할 것이라고 말하며, 22%는 개인적으로 공지할 것이라고 말합니다(나머지 정책은 알림 유형을 지정하지 않습니다).’
‘결과적으로, 대부분의 사용자는 개인정보 보호정책의 변경에 대해 알지 못할 것입니다. ‘
‘또한, 사용자는 정책이 변경될 때 거의 선택의 여지가 없습니다. 정책 변경을 알리는 정책 중 12%만이 새로운 동의를 제공하며, 34%는 선택을 제공하지 않으며, 54%는 선택을 지정하지 않습니다.’

사용자에게 정책 변경을 알리는 방법에 대한 연구의 결과.
추적에 대한 제한된 선택
연구에 따르면, 사용자 계정 정보에 접근하기 위한 메커니즘은 사용자 프로필 데이터에 접근하기 위한 메커니즘보다 더 다양하게 제공됩니다. 프로필 데이터는 자동화된 및 명백하지 않은 메커니즘을 통해 생성 및 업데이트될 수 있지만, 사용자 계정 데이터는 사용자에 의해 명시적으로 제공되며, 다양한 관할권의 규정에 따라 편집할 수 있어야 합니다.
쿠키 동의와 관련된 선택은 일반적으로 정책에서 다루어지지만, 더 중요한 데이터에 대한 제어는 제공되지 않습니다:
‘[쿠키에 대한] 선택은 사용자를 모든 추적에서 보호하기에 충분하지 않습니다. 컴퓨터 정보, 장치 식별자, 개인 식별자와 같은 다른 데이터에 대한 선택 또는 제어 메커니즘은 거의 제공되지 않습니다. 이러한 데이터는 사용자를 추적하기 위한 지문 인식과 같은 방법을 허용합니다.’

개인정보 보호정책에서 사용자 계정 데이터와 프로필 데이터에 대한 제어 수준의鲜明한 대조.
데이터
연구를 위해 데이터를 수집하기 위해, 연구자는 웹사이트에서 개인정보 보호정책 링크를 크롤링했습니다. 종종 초기 결과를 넘어서서 정책을 링크하는 추가적인 정책을 찾는 것이 필요했습니다.
웨이백 머신을 사용하여 역사적인 정책을 얻었습니다. 그러나 결과를 고려할 때, 로봇.txt 구성 파일을 통해 크롤링이나 아카이빙이 차단된 정책을 고려해야 했습니다.
웨이백 머신의 CDX API를 사용하여 각 식별 가능한 정책에 대해 매월 하나의 스냅샷을 얻었습니다. 이를 위해 파이어폭스를 사용하여 셀레니움을 사용했습니다. PDF 형식의 정책에 대한 광학 문자 인식은 프로젝트에서 고려되지 않았습니다. 이는 프로젝트가 더 많은 수의 사용 가능한 HTML 정책에 국한되었습니다.
프로젝트에서 흥미로운 결과 중 하나는 성인 웹사이트의 명확성과 가독성이 실제로 연구된 기간 동안 개선되었다는 것입니다. 이는 규제와 명확성의 증가에 대한 요구에 대한 예상일 수 있습니다. 이러한 문서를 수집하기 위해, 연구자는 대학의 콘텐츠 차단 프로토콜 때문에 추가적인 크롤링을 수행해야 했습니다.
最初에 1,068,683개의 문서가 수집되었으며, 이는 120,265개의 고유한 문서로, 평균 39.1개의 정책 조항이나 절을 포함하고, 각 링크당 4.4개의 고유한 정책 텍스트를 포함했습니다.
영어만
이 프로젝트는 비영어 개인정보 보호정책을 다루지 못했습니다. 이러한 정책은 데이터 정리 단계에서 PYCLD2 패키지를 사용하여 제거되었습니다.
개인정보 보호정책을 다른 유형의 자료와 구별하기 위해, 프로젝트는 2019년에 위스콘신 대학교와 에콜 폴리테크니크 페데랄 드 로잔의 공동 프로젝트로 개발된 분류기를 사용했습니다.

IS-정책 분류기의 아키텍처. 출처: https://arxiv.org/pdf/1809.08396.pdf
IS-정책 분류기는 원래 논문에서 사용된 1,000개의 문서 코퍼스에서 훈련되었지만, 연구자는 새로운 비정책 문서를 훈련에 사용해야 했습니다. 원래 출처가 사용할 수 없었기 때문입니다.
필터링 후, 데이터는 56,416개의 고유한 개인정보 보호정책으로 줄었습니다.
* 연구 논문의 인용은 여기에서 하이퍼링크로 변환되었습니다. 기울임꼴은 논문에서 가져왔습니다.
最初에 2022년 1월 31일에 게시되었습니다.












