Góc nhìn Anderson
Phân tích 25 năm chính sách bảo mật với học máy

Một nghiên cứu gần đây đã sử dụng các kỹ thuật phân tích học máy để theo dõi khả năng đọc, hữu ích, độ dài và phức tạp của hơn 50.000 chính sách bảo mật trên các trang web phổ biến trong một khoảng thời gian bao gồm 25 năm từ 1996 đến 2021. Nghiên cứu kết luận rằng người đọc trung bình sẽ cần phải dành 400 giờ ‘thời gian đọc hàng năm’ (hơn một giờ mỗi ngày) để thâm nhập vào số từ tăng trưởng, ngôn ngữ che giấu và sử dụng ngôn ngữ mơ hồ mà đặc trưng cho các chính sách bảo mật hiện đại của một số trang web được truy cập nhiều nhất.
Báo cáo cho biết:
‘Độ dài chính sách trung bình đã gần như tăng gấp đôi trong thập kỷ qua, với 2159 từ vào tháng 3 năm 2011 và 4191 từ vào tháng 3 năm 2021, và gần như tăng gấp bốn lần kể từ năm 2000 (1146 từ).’

Số từ trung bình và số câu trong tập dữ liệu được nghiên cứu, trong một khoảng thời gian 25 năm. Nguồn: https://arxiv.org/pdf/2201.08739.pdf
Mặc dù tốc độ tăng trưởng về độ dài tăng vọt khi GDPR và Đạo luật Bảo mật Người tiêu dùng California (CCPA) được ban hành, bài báo cho rằng những biến thể này là ‘hệ số ảnh hưởng nhỏ’ và dường như không đáng kể so với xu hướng dài hạn rộng lớn hơn. Tuy nhiên, GDPR được xác định là một nguyên nhân có thể gây ra sự tăng trưởng của ngôn ngữ ‘mơ hồ’ trong các chính sách (xem dưới đây).
Giả sử tốc độ đọc là 250 từ mỗi phút, bài báo cho rằng chính sách bảo mật trung bình hiện nay mất 17 phút để đọc, trong khi các chính sách phổ biến hơn (tức là các chính sách liên quan đến số lượng người dùng cao) mất 23 phút để hoàn thành.
Chính sách dài nhất trong tập dữ liệu, từ Microsoft, yêu cầu 152 phút để tiêu thụ, theo nghiên cứu, đã sử dụng một số phiên bản trên mô hình ngôn ngữ BERT của Google.

Tăng trưởng trong tốc độ giờ hàng năm cần thiết để đọc các chính sách bảo mật hiện đại, giả sử người đọc truy cập 1462 trang web duy nhất mỗi năm.
Phần lớn sự tăng trưởng gần đây về độ dài và mơ hồ trong các chính sách bảo mật được quy cho việc phản ứng lại các nỗ lực trong hai thập kỷ qua để áp dụng các quy định, nhưng cũng do việc sử dụng các yêu cầu tuân thủ quy định một cách không trung thực như một lý do để tăng cường phạm vi và sự không rõ ràng của các chính sách bảo mật.
‘Tổng thể, kết quả của chúng tôi cho thấy rằng các quy định bảo mật gần đây không cải thiện đáng kể quyền riêng tư của người dùng trực tuyến, mà thay vào đó dẫn đến các chính sách bảo mật phình to hơn mô tả nhiều hành vi thu thập dữ liệu xâm phạm hơn.’
Mặc dù một số bài báo về Xử lý Ngôn ngữ Tự nhiên (NLP) đã giải quyết khả năng đọc và các khía cạnh khác của các chính sách bảo mật trong những năm gần đây, tác giả tin rằng đây là dự án đầu tiên của loại này cung cấp một cái nhìn tổng quan rộng lớn như vậy về sự phát triển của chính sách trong những thập kỷ gần đây.
Bài báo này có tiêu đề Chính sách Bảo mật Trên Các Thời Đại: Nội dung và Khả năng Đọc của Chính sách Bảo mật 1996–2021, và đến từ Isabel Wagner tại Viện Công nghệ Sài gòn ở Vương quốc Anh.
Ngôn ngữ Che giấu
Báo cáo cũng cho rằng số từ ‘che giấu’ trung bình (tức là chấp nhận được, quan trọng, chủ yếu, và các từ khác không cung cấp ý nghĩa xác định) trong các chính sách bảo mật tăng đều đặn lên đến năm 2018, nhưng sau đó tăng vọt từ trung vị 227 vào tháng 3 năm 2018 lên 304 vào tháng 6 năm 2020.
Tác giả cho rằng sự tăng trưởng này là do ảnh hưởng của GDPR, và bài báo tìm thấy rằng hơn hai phần ba (72%) câu trong các chính sách bảo mật được nghiên cứu chứa ít nhất một từ che giấu.
Khả năng Đọc
Trên ba biện pháp đọc khó thông thường, nghiên cứu cho thấy rằng ‘các chính sách bảo mật đã trở nên khó đọc hơn theo thời gian’. Các tác giả ước tính rằng 41% chính sách hiện hành có sẵn vào năm 2021 có điểm Flesch Reading Ease (FRE, cao hơn là tốt hơn) trung bình là 31,8, với tác giả quan sát ‘Điểm này cho thấy một văn bản rất khó đọc, tốt nhất nên được hiểu bởi sinh viên đại học’.
Đồng thời, chỉ 6,7% chính sách đạt được điểm FRE trên 45 (điểm đọc tiêu chuẩn yêu cầu cho các chính sách bảo hiểm trong tiểu bang Florida).
Thông báo Thay đổi Chính sách
Công việc cũng giải quyết mức độ mà các chính sách bảo mật bao gồm chi tiết về cách người đồng ý tiềm năng sẽ được thông báo trong trường hợp cập nhật sau này, điều này có thể ảnh hưởng đến ý chí của người dùng để duy trì thỏa thuận.
Tác giả quan sát:
‘Vào năm 2021, 73% chính sách bao gồm một tuyên bố về thay đổi chính sách. Trong số này, 34% tuyên bố rằng các thay đổi sẽ được thông báo bằng một thông báo trong chính sách bảo mật, 37% sẽ đăng một thông báo trên trang web, và 22% sẽ gửi một thông báo cá nhân (các chính sách còn lại để lại loại thông báo không được chỉ định).’
‘Kết quả là, hầu hết người dùng không thể biết về các thay đổi trong chính sách bảo mật.
‘Ngoài ra, người dùng hầu như không có sự lựa chọn có ý nghĩa khi chính sách thay đổi. Trong số các chính sách thông báo cho người dùng về các thay đổi, chỉ 12% cung cấp một sự đồng ý mới, trong khi 34% không cung cấp sự lựa chọn và 54% để lại điều đó không được chỉ định.’

Phát hiện của bài báo về các phương pháp thông báo cho người dùng về các thay đổi chính sách.
Sự Lựa chọn Hạn chế về Theo dõi
Theo nghiên cứu, một loạt các cơ chế rộng lớn hơn được cung cấp trong các chính sách bảo mật để truy cập thông tin tài khoản người dùng hơn là để truy cập dữ liệu hồ sơ. Dữ liệu hồ sơ có thể được tạo và cập nhật thông qua các cơ chế tự động và không rõ ràng, trong khi dữ liệu tài khoản người dùng không chỉ được cấp rõ ràng bởi người dùng, mà còn phải được chỉnh sửa theo các quy định của các khu vực pháp lý khác nhau.
Sự lựa chọn của người tiêu dùng về việc đồng ý cookie trong các chính sách bảo mật (một chủ đề đã thu hút tranh luận sôi nổi kể từ khi GDPR được ban hành và hàng trăm nghìn cửa sổ đồng ý cookie cho các phiên bản EU của các trang web quốc tế và châu Âu) thường được giải quyết trong các chính sách, nhưng che giấu một lớp dữ liệu ít dễ tiếp cận hơn:
‘[Các] lựa chọn về cookie là không đủ để bảo vệ người dùng khỏi tất cả việc theo dõi vì các cơ chế lựa chọn hoặc kiểm soát hiếm khi được cung cấp cho thông tin máy tính, mã định danh thiết bị, và mã định danh cá nhân, cho phép theo dõi người dùng thông qua dấu vân tay.’

Sự tương phản rõ rệt trong mức độ kiểm soát được cấp bởi các chính sách bảo mật giữa dữ liệu hồ sơ (có thể được thu thập bằng phương tiện ngầm hoặc lén lút) và dữ liệu tài khoản người dùng (trong đó một số biện pháp kiểm soát thường được yêu cầu bởi GDPR, Đạo luật Bảo mật Người tiêu dùng California (CCPA) và các cơ chế quốc gia và khu vực tương tự).
Dữ liệu
Để thu thập dữ liệu cho nghiên cứu, tác giả đã thu thập các trang web để tìm kiếm các liên kết đến các chính sách bảo mật, thường phải mở rộng phạm vi ngoài kết quả ban đầu, do số lượng chính sách không toàn diện liên kết đến các chính sách khác (mỗi chính sách có khả năng thay đổi hoặc độc lập với chính sách cha hoặc liên quan).
Công cụ Wayback Machine đã được sử dụng để thu thập các chính sách lịch sử, mặc dù cần phải tính đến các chính sách bị chặn thu thập hoặc lưu trữ thông qua tệp cấu hình robots.txt (một tệp văn bản nhỏ chứa các hướng dẫn cho các tác nhân lập chỉ mục thu thập web về các trang và các thực thể khác mà chúng không nên bao gồm trong một chỉ mục công khai).
Một ảnh chụp mỗi tháng đã được thu thập từ Wayback Machine bằng CDX API cho mỗi chính sách có thể xác định và áp dụng liên tục, sử dụng Firefox dưới Selenium. Việc thực hiện nhận dạng ký tự quang học trên các chính sách chỉ có sẵn ở định dạng PDF không được xem xét cho dự án, dự án này giới hạn ở số lượng chính sách HTML có sẵn (lớn hơn nhiều).
Một kết quả thú vị từ dự án là sự rõ ràng và khả năng đọc của các trang web khiêu dâm đã thực sự cải thiện trong khoảng thời gian được nghiên cứu – có thể là để dự đoán các yêu cầu ngày càng tăng về quy định và sự rõ ràng. Để thu thập các tài liệu này, cần phải thu thập chúng bằng các lần thu thập bổ sung từ địa chỉ IP dân cư, do các giao thức chặn nội dung của trường đại học.
Ban đầu, 1.068.683 tài liệu đã được thu thập, tương đương 120.265 tài liệu duy nhất chứa trung bình 39,1 điều khoản hoặc khoản mục chính sách và 4,4 văn bản chính sách duy nhất cho mỗi liên kết.
Chỉ tiếng Anh
Giống như các nghiên cứu gần đây tương tự, dự án này không thể giải quyết các chính sách bảo mật không phải tiếng Anh, những chính sách này đã bị loại bỏ trong giai đoạn làm sạch dữ liệu bằng gói PYCLD2.
Để phân biệt các chính sách bảo mật với các loại tài liệu khác, dự án đã sử dụng một bộ phân loại được phát triển vào năm 2019 như một sáng kiến chung từ Đại học Wisconsin và École Polytechnique Fédérale de Lausanne.

Cấu trúc của bộ phân loại IS-POLICY. Nguồn: https://arxiv.org/pdf/1809.08396.pdf
Mặc dù bộ phân loại IS-POLICY được đào tạo trên cùng một tập dữ liệu 1.000 tài liệu như trong bài báo gốc, tác giả phải thu thập các tài liệu không phải chính sách mới để đào tạo, vì các nguồn gốc không có sẵn.
Sau khi lọc, dữ liệu đã được giảm xuống còn 56.416 chính sách bảo mật duy nhất.
* Tham chiếu nội tuyến của bài báo được chuyển đổi thành siêu liên kết ở đây, việc bật tắt nghiêng là từ bài báo.
Được xuất bản lần đầu vào ngày 31 tháng 1 năm 2022.












