มุมมองของ Anderson
นักวิจัย AI ประมาณว่า 97% ของเว็บไซต์ในสหภาพยุโรปล้มเหลวในการปฏิบัติตามข้อกำหนดความเป็นส่วนตัวของ GDPR โดยเฉพาะการสร้างโปรไฟล์ผู้ใช้

นักวิจัยในสหรัฐอเมริกาได้ใช้เทคนิคการเรียนรู้ของเครื่องจักรเพื่อศึกษานโยบายความเป็นส่วนตัวของ GDPR ของเว็บไซต์มากกว่า 1,000 แห่งที่เป็นตัวแทนใน EU พวกเขาพบว่า 97% ของเว็บไซต์ที่ศึกษาล้มเหลวในการปฏิบัติตามข้อกำหนดอย่างน้อยหนึ่งข้อของกรอบการทำงานด้านกฎระเบียบของสหภาพยุโรปในปี 2018 และที่พวกเขาปฏิบัติตามน้อยที่สุดคือข้อกำหนดเกี่ยวกับการสร้างโปรไฟล์ผู้ใช้
เอกสารระบุ:
‘[เนื่องจาก] นโยบายความเป็นส่วนตัวเป็นช่องทางสื่อสารที่จำเป็นสำหรับผู้ใช้ในการเข้าใจและควบคุมความเป็นส่วนตัวของตนเอง หลายบริษัทได้อัปเดตนโยบายความเป็นส่วนตัวหลังจาก GDPR มีผลบังคับใช้ อย่างไรก็ตาม นโยบายความเป็นส่วนตัวส่วนใหญ่มีข้อความที่ยาวและเต็มไปด้วยภาษาที่ซับซ้อน และอธิบายแนวปฏิบัติเกี่ยวกับข้อมูลและสิทธิของผู้ใช้ในรูปแบบที่คลุมเครือ ดังนั้น จึงไม่ชัดเจนว่าพวกเขาปฏิบัติตาม GDPR หรือไม่’
มันระบุต่อไป:
‘ผลการวิจัยของเราพบว่า แม้ว่า GDPR จะมีผลบังคับใช้แล้ว 97% ของเว็บไซต์ก็ยังล้มเหลวในการปฏิบัติตามข้อกำหนดอย่างน้อยหนึ่งข้อของ GDPR’
การศึกษา นี้ มีชื่อว่า การตรวจจับการเปิดเผยข้อมูลที่จำเป็นของ GDPR ในนโยบายความเป็นส่วนตัวโดยใช้การเรียนรู้แบบกระตือรือร้น และมาจากนักวิจัยสามคนจากมหาวิทยาลัยเวอร์จิเนียที่ชาร์ลอตส์วิลล์
ความเป็นส่วนตัวสุดท้าย
พื้นที่ที่มีการไม่ปฏิบัติตามมากที่สุดตามการศึกษานี้เกี่ยวข้องกับข้อกำหนดของ GDPR เกี่ยวกับการสร้างโปรไฟล์ผู้ใช้ โดยผู้เขียนระบุว่าเพียง 15.3% ของเว็บไซต์ที่ศึกษาปฏิบัติตามกฎนี้อย่างสมบูรณ์

กราฟแสดงการปฏิบัติตาม GDPR ของเว็บไซต์ที่ศึกษา Source: https://arxiv.org/pdf/2111.04224.pdf
การสร้างโปรไฟล์ผู้ใช้ (โดยที่การโต้ตอบของผู้ใช้กับเว็บไซต์ถูกบันทึกและใช้เพื่อ ‘เป้าหมาย’ ในบริบทออนไลน์อื่น ๆ เช่น การโฆษณา) ได้กลายเป็นหนึ่งในเรื่องที่ถกเถียงกันมากที่สุดในด้านเทคโนโลยีตั้งแต่เรื่องอื้อฉาวของ Cambridge Analytica
เมื่อวันอังคาร คณะกรรมการสำคัญของสภายุโรป ผ่าน การออกกฎหมาย Digital Markets Act (DMA) ระยะแรก ซึ่งจะห้ามการเป้าหมายพฤติกรรมของเด็กและปรับ公司ที่ฝ่าฝืนมากถึง 20% ของยอดขายประจำปีทั่วโลก
แม้ว่ากฎหมายจะถูกมองว่าเป็นการตอบสนองโดยตรงต่อการเติบโตของอิทธิพลของยักษ์เทคโนโลยีเช่น Facebook และ Google แต่การไม่ปฏิบัติตามกฎระเบียบที่แสดงในงานวิจัยใหม่นี้บ่งชี้ว่าบริษัทส่วนใหญ่ใน EU (รวมถึงสำนักงานใน EU ของบริษัทอเมริกันที่ทำธุรกิจในยุโรป) มีความเสี่ยงทางกฎหมายต่อการถูกปรับ GDPR
นอกจากนี้ อิตาลียังได้ปรับ Apple และ Google เป็นเงินสูงสุดที่ 10 ล้านยูโร (11.2 ล้านดอลลาร์สหรัฐฯ) ในสัปดาห์นี้สำหรับการใช้การสร้างโปรไฟล์ผู้ใช้และความผิดอื่น ๆ
ข้อมูล
เว็บไซต์ที่ศึกษาในงานวิจัยใหม่นี้ถูกเลือกจากเว็บไซต์ 10,000 แห่งที่มีคนเยี่ยมชมมากที่สุดใน Quantcast นโยบายความเป็นส่วนตัวภาษาอังกฤษของเว็บไซต์เหล่านี้ถูกดึงออกมาผ่านการค้นหา Yandex บน VPN ในสหราชอาณาจักร (เพื่อให้แน่ใจว่านโยบายไม่ถูกปิดกั้นตามภูมิภาค)
เว็บไซต์ใน EU ต้องให้นโยบายความเป็นส่วนตัวที่กำหนดไว้ ซึ่งครอบคลุม 18 ข้อกำหนดหลัก (ดูกราฟด้านบน) ตั้งแต่ GDPR มีผลบังคับใช้อย่างเต็มรูปแบบในเดือนพฤษภาคม 2018
นักวิจัยได้จำกัดการดึงนโยบายความเป็นส่วนตัวให้แคบลงในระหว่างเดือนสิงหาคม 2018 เป็นต้นไป เพื่อให้เว็บไซต์มีเวลาในการเผยแพร่นโยบายที่จำเป็น (ซึ่งพวกเขามีความรู้ล่วงหน้าอย่างน้อยหนึ่งปีในการพัฒนาของ GDPR ตั้งแต่ปี 2016)
กระบวนการกรองนี้ทำให้เกิดคอร์ปัสนโยบายความเป็นส่วนตัว 9,761 นโยบาย จากนั้น 1,080 นโยบายถูกเลือกแบบสุ่มโดยนักวิจัย
การประมวลผลล่วงหน้า
ทีมงานได้ใช้ผู้เชี่ยวชาญด้านกฎหมายสองคนเพื่อฝึกอบรมผู้ให้ข้อมูลสี่คนเพื่อระบุชี้แจง 18 นโยบายความเป็นส่วนตัวที่กำหนดโดย GDPR
บางส่วนของภาษาที่ใช้ในนโยบายครอบคลุมมากกว่าหนึ่งข้อกำหนด ทำให้ต้องใช้ Convolutional Neural Network (CNN) เพื่อตรวจจับรูปแบบภาษาที่เกี่ยวข้องกับนโยบายแต่ละข้อ
ความพยายามครั้งแรกในการฝึกแบบจำลองเพื่อระบุการปฏิบัติตามข้อกำหนดตามภาษาได้สำเร็จ 80.5% เพื่อปรับปรุงผลลัพธ์เหล่านี้ นักวิจัยได้ใช้ การเรียนรู้แบบกระตือรือร้น เพื่อเพิ่มประสิทธิภาพของแบบจำลองโดยใช้ข้อมูลที่มีการระบุชี้แจงแล้วน้อยลง โดยวิธีนี้สามารถฝึกแบบจำลอง CNN ได้ถึงความแม่นยำ 89.2% โดยมีคะแนน F1 ของ 0.88 (โดยที่ ‘1’ คือความสำเร็จที่สมบูรณ์)
เพื่อให้แน่ใจว่าการฝังตัวของคำจะเฉพาะเจาะจงกับนโยบายความเป็นส่วนตัว นักวิจัยได้ฝึกแบบจำลองการฝังตัวของคำที่ไม่ซ้ำกันโดยใช้ไลบรารี FastText ของ Facebook
ตามมาตรฐานการปฏิบัติ ข้อมูลสุดท้ายจะถูกแบ่งออกเป็น 80/20 ระหว่างข้อมูลฝึกอบรมและข้อมูลทดสอบ (เช่น ข้อมูลที่เลือกแบบสุ่มซึ่งความแม่นยำของอัลกอริทึมจะถูกประเมิน) การศึกษาการวัดแบบมีมนุษย์ในวงจรถูกเพิ่มเข้าไปในสถาปัตยกรรมเพื่อประเมินคุณภาพของผลลัพธ์

สถาปัตยกรรมของระบบจำแนกประเภท
ในระหว่างกระบวนการทำงาน มีการผลิตส่วนนโยบายความเป็นส่วนตัวที่มีการระบุชี้แจงโดยมนุษย์ 11,271 ส่วน ซึ่งแต่ละส่วนจะถูกทบทวนโดยผู้ให้ข้อมูลสี่คนซึ่งได้รับการฝึกอบรมโดยผู้เชี่ยวชาญด้านกฎหมายสองคนในงานวิจัย เมื่อเกิดความไม่เห็นด้วย จะต้องมีอัตราส่วนการเห็นด้วย 75% เพื่อไม่ให้ข้อมูลถูกปฏิเสธ

มนุษย์ในวงจร – ไม่สามารถทำให้กระบวนการระบุชี้แจงข้อมูลนโยบายเป็นอัตโนมัติได้อย่างสมบูรณ์ แต่การเรียนรู้แบบกระตือรือร้นทำให้สามารถใช้กระบวนการทำงานที่มีกลุ่มที่เป็นไปได้
นอกจากผลลัพธ์ที่กล่าวมาแล้ว ผู้ใช้พบว่า การโอนย้ายข้อมูล – สิทธิในการย้ายหรือส่งออกข้อมูลที่บริษัทถือครองภายใต้ GDPR – ได้รับการปฏิบัติที่ไม่ดีเกือบเท่ากับการสร้างโปรไฟล์
นักวิจัยสรุป:
‘[ข้อกำหนด] เช่น สิทธิในการโอนย้ายข้อมูลของผู้ใช้และการให้ข้อมูลติดต่อของเจ้าหน้าที่คุ้มครองข้อมูล (DPO) ถูกครอบคลุมโดย 15.5% และ 16.4% ของเว็บไซต์ตามลำดับ ข้อกำหนดหลักอื่น ๆ เช่น สิทธิของผู้ใช้ในการยื่นคำร้อง การถอนความยินยอม สิทธิในการคัดค้าน และการตัดสินความเหมาะสม ถูกครอบคลุมโดย 17-20% ของเว็บไซต์’
…และต่อไป:
‘ดูเหมือนว่าเพียง 3% ของเว็บไซต์ปฏิบัติตามข้อกำหนดทั้ง 18 ข้อ ผลการวิจัยเหล่านี้บ่งชี้ว่าเว็บไซต์หลายแห่งยังไม่ปฏิบัติตามข้อกำหนดของ GDPR’
19.00 น. 26/11/2021 – อธิบายคำบรรยายกราฟแรก – MA












