Andersonの視点

25 年間のプライバシーポリシーをマシンラーニングで分析する

mm
Unite.AI を Google の優先ソースに追加

最近の研究では、1996 年から 2021 年までの 25 年間にわたる人気のある Web サイトの 50,000 を超えるプライバシーポリシーを分析し、読みやすさ、有用性、長さ、複雑さを調べた。研究では、平均的な読者が、現代のプライバシーポリシーの増加する単語数、曖昧な言語、不明確な言語の使用に打ち勝つために、年間 400 時間の「年間読書時間」(1 日あたり 1 時間以上)を費やす必要があると結論づけている。

報告書では、次のことが述べられている。

‘平均的なポリシーの長さは、過去 10 年でほぼ 2 倍に増加しており、2011 年 3 月には 2,159 ワード、2021 年 3 月には 4,191 ワードとなり、2000 年以来ほぼ 4 倍に増加した (1,146 ワード)。’

調査対象となったコーパスの平均ワード数と文数の変化(25 年間)。

調査対象となったコーパスの平均ワード数と文数の変化(25 年間)。 ソース: https://arxiv.org/pdf/2201.08739.pdf

GDPR とカリフォルニア州消費者プライバシー法 (CCPA) の保護が施行されたときに、ポリシーの長さの増加率が急上昇したが、研究では、これらの変化を「小さな効果サイズ」と見なしており、長期的な傾向に対しては無視できるものとしている。しかし、GDPR は、ポリシーの言語の曖昧さの増加の原因であると同定されている。

250 ワード/分の読書速度を仮定すると、研究では、平均的なプライバシーポリシーは現在 17 分で読み終えることができると主張している。また、ユーザー数が多いポリシー (国際的またはヨーロッパの Web サイトの EU インスタンスに関連するポリシー) は 23 分で読み終えることができる。

研究対象となったポリシーの中で最も長いポリシーはマイクロソフトのもので、152 分かけて読み終えることができるという。

現代のプライバシーポリシーを読むために必要な年間時間の増加率(1 年に 1,462 のユニークな Web サイトを訪問する読者を仮定)。

現代のプライバシーポリシーを読むために必要な年間時間の増加率(1 年に 1,462 のユニークな Web サイトを訪問する読者を仮定)。

最近のプライバシーポリシーの冗長さと曖昧さの増加は、研究では、規制の試みに対する反応、および規制遵守要件を利用してプライバシーポリシーの範囲と不透明性を拡大するために使用される不誠実な手段として帰属されている。

‘全体として、我々の結果は、最近のプライバシーの規制がオンラインでのユーザーのプライバシーを大幅に改善していないことを示しており、むしろ、より膨張したプライバシーポリシーがより侵入的なデータ処理を記述するものとなっていることを示唆している。’

自然言語処理 (NLP) の研究では、近年、プライバシーポリシーの読みやすさやその他の側面について論じてきたが、著者は、この研究が最初の 25 年間にわたるプライバシーポリシーの発展についての包括的な概要を提供するものであると信じている。

研究論文は、「プライバシーポリシーを時系列で分析する:1996-2021 年のプライバシーポリシーの内容と読みやすさ」 というタイトルで、イギリスの De Montfort 大学のサイバーテクノロジー研究所の Isabel Wagner によって執筆された。

曖昧な言語

報告書では、プライバシーポリシーにおける「曖昧な言葉」(たとえば、受け入れられる重大な主に など、明確な意味を与えない言葉) の平均数が、2018 年まで緩やかに増加していたが、その後、2018 年 3 月の 227 から 2020 年 6 月の 304 に急激に増加したと示している。

著者は、この増加は GDPR の影響によるものであると主張しており、研究では、調査対象となったプライバシーポリシーの 72% の文が少なくとも 1 つの曖昧な言葉を含んでいることが発見された。

読みやすさ

読みやすさの 3 つの一般的な尺度を使用して、研究では、「プライバシーポリシーは、年々、読みにくくなっている」 と結論づけている。著者は、2021 年に利用可能な現在適用可能なポリシーの 41% が、Flesch 読みやすさスコア (FRE、スコアが高いほど読みやすい) の中位値が 31.8 であると推定しており、著者は 「このスコアは、非常に難しいテキストであり、大学院生によってのみ理解される」 と述べている。

同時に、ポリシーのわずか 6.7% が 45 を超える FRE スコア (報告書では、フロリダ州の保険ポリシーで必要とされる読みやすさの基準であると注釈されている) を達成した。

ポリシーの変更に関する通知

研究では、プライバシーポリシーが、将来の更新についてどのように通知するかについての詳細を含める程度を調査した。これは、ユーザーが契約を維持する意欲に影響を与える可能性がある。

著者は、次のことを観察している。

‘2021 年には、ポリシーの 73% がポリシーの変更についての声明を含んでいた。これらのうち、34% はポリシーの変更が通知されることを示唆しており、37% は Web サイトに通知を掲載し、22% は個別の通知 (残りのポリシーは通知の種類を指定していない) を送ることになっていた。’

‘結果として、ほとんどのユーザーは、プライバシーポリシーの変更について気付くことはない。’

‘さらに、ユーザーは、ポリシーが変更されたときに、ほとんどの場合、選択の余地がない。通知を送るポリシーのうち、12% が新しいオプトインを提供しているのに対し、34% は選択の余地を与えず、54% は選択の余地を残している。’

ユーザーにポリシーの変更を通知する方法に関する研究の結果。

ユーザーにポリシーの変更を通知する方法に関する研究の結果。

トラッキングに関する選択肢の制限

研究では、プライバシーポリシーが、ユーザーのアカウント情報へのアクセスよりもユーザーのプロファイルデータへのアクセスについて、より広範なメカニズムを提供していることを示している。プロファイルデータは、自動化されたメカニズムや明らかでないメカニズムを通じて作成および更新される可能性があるのに対し、ユーザーのアカウントデータは、ユーザーによって明示的に与えられ、また、さまざまな管轄区域の規制によって編集されることが求められている。

プライバシーポリシーにおけるクッキーの同意に関する消費者の選択肢 (GDPR の導入以降、国際的およびヨーロッパの Web サイトの EU インスタンスのために数十万のクッキーの同意ポップアップが表示されるようになったため、論争を呼んでいる話題) は、一般的にポリシーで扱われているが、より重要な、しかし、よりアクセスが困難なデータの層を隠している。

‘クッキーの選択肢は、コンピューター情報、デバイス識別子、個人識別子 (フィンガープリントを使用してユーザーを追跡することを可能にする) に対する選択肢やコントロールメカニズムが提供されていないため、ユーザーを追跡することからユーザーを保護するには不十分である。’

プライバシーポリシーが提供する、ユーザーのアカウントデータとプロファイルデータのコントロールレベルの対照的な違い。

プライバシーポリシーが提供する、ユーザーのアカウントデータとプロファイルデータのコントロールレベルの対照的な違い。

データ

研究のために必要なデータを取得するために、著者は Web サイトをクロールしてプライバシーポリシーのリンクを探し、初期の結果を超えて範囲を広げることが必要であったことが多かった (初期のポリシーがさらに多くのポリシーにリンクしている可能性があるため)。

歴史的なポリシーを取得するために、Wayback Machine を使用したが、クロールまたはアーカイブ化から除外されたポリシーを考慮する必要があった (ロボットの構成ファイルによって除外された場合)。

各識別可能な継続的なポリシーについて、CDX API を使用して、Wayback Machine から 1 か月あたり 1 スナップショットを取得し、Firefox と Selenium を使用して、PDF 形式のみで利用可能なポリシーについては、光学式文字認識を実行しなかった (利用可能な HTML ポリシーの数がはるかに多かったため)。

このプロジェクトの 1 つの興味深い結果は、調査対象期間中のポルノグラフィック Web サイトの明確性と読みやすさが実際に改善されたということである。可能な限り多くのドキュメントを収集するために、大学のコンテンツブロッキングプロトコルを迂回するために、住宅用 IP アドレスからの追加のクロールが必要であった。

初期的に、1,068,683 のドキュメントが取得され、120,265 のユニークドキュメントに相当し、平均して 39.1 のポリシー記事または条項と 4.4 のユニークなポリシーテキストが含まれていた。

英語のみ

最近の研究と同様に、このプロジェクトでは、英語以外のプライバシーポリシーを扱うことができなかった。データクリーニングの段階で、これらのポリシーは PYCLD2 パッケージを使用して除外された。

プライバシーポリシーを他の種類の資料と区別するために、プロジェクトでは、2019 年にウィスコンシン大学とスイス連邦工科大学 (EPFL) の共同プロジェクトとして開発された 分類器 を使用した。

IS-POLICY 分類器のアーキテクチャ。

IS-POLICY 分類器のアーキテクチャ。 ソース: https://arxiv.org/pdf/1809.08396.pdf

IS-POLICY 分類器は、もともとの論文と同じ 1,000 ドキュメントのコーパスでトレーニングされたが、著者は、新しい非ポリシードキュメントをトレーニングするために取得する必要があった (元のソースが利用できなかったため)。

フィルタリングの後、データは 56,416 のユニークなプライバシーポリシーに減少した。

* 論文のインライン引用は、ここではハイパーリンクに変換されています。イタリックの切り替えは、論文から来ています。

初めて 2022 年 1 月 31 日に公開されました。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai