Andersonの視点
EUのウェブサイトの97%がGDPRのプライバシー要件に準拠していないとAI研究者は推定 – 特にユーザープロファイリング

米国の研究者は、機械学習技術を使用して、EUに拠点を置く1000以上のウェブサイトのGDPRプライバシーポリシーを調査しました。調査対象となったサイトの97%が、EUの2018年の規制枠組みの要件の少なくとも1つに準拠していないことがわかりました。また、ユーザープロファイリングに関する規制要件に最も準拠していないことがわかりました。
論文では以下のように述べられています:
「プライバシーポリシーは、ユーザーがプライバシーを理解し、制御するための基本的なコミュニケーションチャネルであるため、多くの会社はGDPRが施行された後、プライバシーポリシーを更新しました。しかし、ほとんどのプライバシーポリシーは冗長で、専門用語が多く、会社のデータ処理とユーザーの権利について漠然と記述しているため、GDPRに準拠しているかどうかは不明です。」
以下のように続きます:
「私たちの結果は、GDPRが施行された後でも、ウェブサイトの97%がまだGDPRの要件の少なくとも1つに準拠していないことを示しています。」
この研究は、Automated Detection of GDPR Disclosure Requirements in Privacy Policies using Deep Active Learningというタイトルで、バージニア大学シャーロッツビルの3人の研究者によって行われました。
プライバシーの最後
研究によると、GDPRの規定について、ユーザープロファイリングに関する規制要件に最も準拠していないことがわかりました。著者は、調査対象となったサイトの15.3%のみが、この特定の規則に完全に準拠していることを示しています。

研究のためのGDPRコンプライアンスのグラフ ソース:https://arxiv.org/pdf/2111.04224.pdf
ユーザープロファイリング(ウェブサイトとのユーザーのやり取りを記録し、他のオンラインコンテキストでターゲットにすることが多い)は、ケンブリッジ・アナリティカのスキャンダル以来、テクノロジー界で最も論争の多いトピックの1つになりました。
火曜日、欧州議会の重要な委員会は、新しいデジタル・マーケット・アクト(DMA)の最初の段階を通過しました。この法律では、未成年者に対する行動ターゲティングを禁止し、違反した会社に対して最大で世界的な年間売上の20%の罰金を課します。
この法律は、FacebookやGoogleなどのテクノロジー・ジャイアントの影響力に対する直接的な対応として受け取られているものの、この新しい研究によって示される非準拠の規模は、EUのほとんどの会社(欧州に拠点を置くアメリカの会社を含む)がGDPRの罰金の対象となっていることを示唆しています。
さらに、イタリアは今週、AppleとGoogleに対して、ユーザープロファイリングを含む違反のために、許容される最大額の1000万ユーロ(112万ドル)の罰金を課しました。
データ
研究対象となったサイトは、Quantcastのトップ10,000のサイトからサンプリングされ、英語のプライバシーポリシーは、イギリスに拠点を置くVPNを使用したYandex検索から抽出されました(これにより、ポリシーが地理的ブロックされないことが保証されました)。
EUのウェブサイトは、2018年5月にGDPRが完全に施行されて以来、18の中心的な要件(上記のグラフを参照)をカバーする規定されたプライバシーポリシーを提供する必要があります。
研究者は、2018年8月以降の期間にプライバシーポリシーを抽出し、GDPRが施行される2年前の2016年から少なくとも1年間、ドメインが必要なポリシーを事前に知っていたため、サイトに必要なポリシーを公開するための合理的な時間を与えました。
フィルタリングプロセスにより、9,761のポリシーからなるプライバシーコーパスが生成され、研究者はランダムに1,080のポリシーを選択しました。
事前処理
チームは、2人の法務専門家を雇用して、4人の人間のアノテーターを訓練し、GDPRによって義務付けられている18のプライバシーポリシーのそれぞれをラベル付けしました。
ポリシーのいくつかは、18の要件のうち1つ以上をカバーしていたため、Convolutional Neural Network(CNN)を使用して各ポリシーに関連する言語特徴を検出する必要がありました。
言語に基づいて準拠を識別するモデルを訓練する最初の試みは、80.5%の成功を達成しました。結果を改善するために、研究者は、アクティブ・ラーニングを適用して、ラベル付けされたデータを使用してモデルのパフォーマンスを向上させました。こうすることで、分類器のCNNを89.2%の精度まで訓練でき、F1スコアは0.88(完全な成功の場合は「1」)でした。
ワード・エンベディングがプライバシーポリシーに特有であることを保証するために、研究者はFacebookのFastText Pythonライブラリを使用して、教師なしのワード・エンベディング・モデルを訓練しました。
通常の慣行に従って、最終的なデータは、トレーニングデータとテストデータ(アルゴリズムの精度を判断するために使用されるランダムに選択されたデータ)を80/20の比率で分割しました。アーキテクチャーに人間による測定研究を追加して、結果の品質を評価しました。

クラスファイアのアーキテクチャ
ワークフローの中で、11,271の人間によるプライバシーポリシーのセグメントが生成され、それぞれが2人の法務専門家によって訓練された4人の人間のアノテーターによってレビューされました。意見が一致しない場合は、データを却下しないように75%の合意率が必要でした。

人間によるアノテーション – ポリシーデータのラベル付けを完全に自動化することはできませんでしたが、アクティブ・ラーニングによってプールベースのワークフローが可能になり、プロジェクトが実現可能になりました。
既に述べた結果に加えて、ユーザーは、移植性(会社が保持するデータを移転またはエクスポートする権利)が、プロファイリングと同様にほとんどサポートされていないことも発見しました。
研究者は以下のように結論付けています:
「ユーザーのデータ移植権やデータ保護責任者(DPO)の連絡先情報の提供などの要件は、それぞれ15.5%と16.4%のウェブサイトでカバーされています。他の主要な要件である、ユーザーの苦情申し立て権、同意の撤回、異議申し立て権、適切性の決定は、17〜20%のウェブサイトでカバーされています。」
以下のように続きます:
「ウェブサイトのわずか3%のみが18の要件に完全に準拠していることがわかりました。これらの結果は、多くのウェブサイトがまだGDPRの要件に従っていないことを示しています。」
7pm 26/11/2021 – 最初のグラフのキャプションを明確にしました。 – MA












