มุมมองของ Anderson

การสร้างโมเดล Machine Learning ที่ลืมเรื่องราวของคุณ

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

การลบข้อมูลบางส่วนออกจากโมเดล Machine Learning นั้นคล้ายกับการลบช้อนโต๊ะที่สองออกจากแก้วกาแฟ ข้อมูลนั้นได้กลายเป็นส่วนหนึ่งของโมเดลไปแล้ว หากข้อมูลนั้นเป็นข้อมูลที่สำคัญที่ใช้ในการฝึกอบรมโมเดลในตอนแรก การลบข้อมูลนั้นอาจทำให้โมเดลทำงานเปลี่ยนแปลงไปหรือต้องถูกฝึกอบรมใหม่ซึ่งใช้เวลาและเงิน

อย่างไรก็ตาม ในยุโรป มีการกำหนดให้ บริษัท ต่างๆ ลบข้อมูลของผู้ใช้ตามคำขอ โดยมาตรา 17 ของ General Data Protection Regulation Act (GDPR) กำหนดให้ บริษัท ต่างๆ ลบข้อมูลของผู้ใช้ตามคำขอ เนื่องจากกฎหมายถูกสร้างขึ้นโดยมีสมมติฐานว่าการลบข้อมูลนั้นจะไม่เกินกว่าการลบข้อมูลออกจากฐานข้อมูล กฎหมายที่จะตามมาจาก Draft EU Artificial Intelligence Act จะนำหลักการของ GDPR ไปใช้กับระบบ AI ที่ถูกฝึกอบรมแล้ว

มีการพิจารณากฎหมายเพิ่มเติมทั่วโลกที่จะให้สิทธิ์แก่บุคคลในการขอลบข้อมูลของตนออกจากระบบ Machine Learning ในขณะที่ California Consumer Privacy Act (CCPA) ของปี 2018 ให้สิทธิ์นี้ แก่ผู้อยู่อาศัยในรัฐ

ทำไมจึงสำคัญ

เมื่อโมเดล Machine Learning ถูกฝึกอบรมจากข้อมูลที่มีคุณภาพสูง ลักษณะของข้อมูลนั้นจะถูกทำให้抽象และกว้างขึ้น เนื่องจากโมเดลถูกออกแบบมาเพื่ออนุมานหลักการและ แนวโน้มทั่วไป จากข้อมูล ซึ่งจะทำให้เกิดอัลกอริทึมที่มีประโยชน์ในการวิเคราะห์ข้อมูลที่ไม่จำเพาะ

อย่างไรก็ตาม เทคนิค เช่น model inversion ได้แสดงให้เห็นว่าสามารถระบุข้อมูลที่ใช้ในการฝึกอบรมโมเดลได้ ในขณะที่ membership inference attacks ก็สามารถเปิดเผยข้อมูลที่ใช้ในการฝึกอบรมได้ รวมถึงข้อมูลที่มีความอ่อนไหวที่อาจจะถูกอนุญาตให้ใช้ในการฝึกอบรมโดยมีเงื่อนไขว่าจะต้องไม่ระบุชื่อ

ความสนใจที่เพิ่มขึ้นในการพัฒนานี้ไม่จำเป็นต้องอาศัยการเคลื่อนไหวด้านความเป็นส่วนตัวของประชาชน แต่เมื่ออุตสาหกรรม Machine Learning เติบโตในอีก 10 ปีข้างหน้า และประเทศต่างๆ ต้องเผชิญกับแรงกดดันในการยุติ วัฒนธรรมที่ไม่มีการควบคุม ในการใช้ข้อมูลที่เก็บจากหน้าจอ การสร้างรายได้จากข้อมูลที่มีคุณภาพสูงจะเพิ่มขึ้น และจะมีการจัดตั้งองค์กรที่มีหน้าที่ในการคุ้มครองทรัพย์สินทางปัญญาเพื่อตรวจสอบและวิเคราะห์ข้อมูลที่ใช้ในการฝึกอบรมโมเดล AI ที่มีรายได้สูง

การทำให้โมเดล Machine Learning ลืม

ดังนั้น เราจึงต้องเผชิญกับความท้าทายในการลบข้อมูลที่ไม่ต้องการออกจากโมเดล Machine Learning นี่เป็นปัญหาที่นักวิจัยได้พยายามแก้ไขมาหลายปีแล้ว ในปี 2021 วิจัยที่ได้รับการสนับสนุนจาก EU A Comparative Study on the Privacy Risks of Face Recognition Libraries พบว่าหลายอัลกอริทึมการรู้จำใบหน้าสามารถทำให้เกิดการแบ่งแยกตามเพศหรือเชื้อชาติได้ ในปี 2015 นักวิจัยจากมหาวิทยาลัยโคลัมเบีย เสนอ วิธีการ “machine unlearning” โดยการอัปเดตผลรวมในข้อมูล และในปี 2019 นักวิจัยจากมหาวิทยาลัยสแตนฟอร์ด เสนอ อัลกอริทึมการลบข้อมูลใหม่สำหรับการใช้งาน K-means clustering

ตอนนี้ คอนซอร์เทียมวิจัยจากจีนและสหรัฐฯ ได้เผยแพร่ผลงานใหม่ที่แนะนำมาตรฐานการประเมินความสำเร็จของวิธีการลบข้อมูล โดยใช้ “Forsaken” ซึ่งเป็นวิธีการลบข้อมูลใหม่ที่สามารถลบข้อมูลได้มากกว่า 90% โดยไม่ส่งผลกระทบต่อความแม่นยำของโมเดลมากนัก

ผลงานวิจัยนี้มีชื่อว่า Learn to Forget: Machine Unlearning via Neuron Masking และมีนักวิจัยจากจีนและมหาวิทยาลัยเบิร์คเลย์

วิธีการ “neuron masking” ที่ใช้ใน Forsaken ใช้ mask gradient generator เพื่อกรองข้อมูลที่ไม่ต้องการออกจากโมเดล โดยไม่ต้องอัปเดตโมเดลใหม่หรือเริ่มต้นใหม่ตั้งแต่ต้น

The architecture of the mask gradient generator. Source: https://arxiv.org/pdf/2003.10933.pdf

The architecture of the mask gradient generator. Source: https://arxiv.org/pdf/2003.10933.pdf

จุดเริ่มต้นทางชีววิทยา

นักวิจัยระบุว่าวิธีการนี้ได้รับแรงบันดาลใจจาก กระบวนการชีววิทยา ของ “active forgetting” ซึ่งผู้ใช้จะพยายามลบข้อมูลที่ไม่ต้องการออกจากความทรงจำโดยการควบคุมดอปามีน

Forsaken ใช้กระบวนการนี้โดยการสร้าง mask gradient ที่ซ้ำกันเพื่อลบข้อมูลที่ไม่ต้องการออกจากโมเดล โดยมีการป้องกันไม่ให้กระบวนการนี้เกิดขึ้นอย่างรวดเร็วหรือไม่เหมาะสม

ข้อดีของวิธีการนี้คือสามารถใช้กับโมเดล Machine Learning ที่มีอยู่แล้ว และไม่ต้องเปลี่ยนแปลงโครงสร้างของโมเดลหรือการฝึกอบรม

การจำกัดผลกระทบ

การลบข้อมูลที่ไม่ต้องการออกจากโมเดล Machine Learning อาจส่งผลกระทบต่อการทำงานของโมเดลได้ เพื่อหลีกเลี่ยงปัญหานี้ นักวิจัยได้ใช้ norm regularization ซึ่งเป็นเทคนิคที่ใช้ในการฝึกอบรมโมเดล Machine Learning เพื่อหลีกเลี่ยงการ overtraining

ในการทดสอบ Forsaken นักวิจัยได้ใช้ข้อมูลที่ไม่ได้รวมอยู่ในข้อมูลฝึกอบรม (out-of-distribution data) เพื่อปรับแต่งการทำงานของอัลกอริทึม

การทดสอบบนข้อมูล

วิธีการ Forsaken ถูกทดสอบบนข้อมูลที่มีคุณภาพสูง 8 ชุด และสามารถลบข้อมูลที่ไม่ต้องการออกจากโมเดลได้มากกว่า 90% โดยไม่ส่งผลกระทบต่อความแม่นยำของโมเดลมากนัก

ดูเหมือนว่าจะเป็นไปไม่ได้ที่การฝึกอบรมใหม่บนข้อมูลที่แก้ไขแล้วจะทำได้ดีกว่าวิธีการอื่น เนื่องจากข้อมูลที่ไม่ต้องการนั้นถูกลบออกจากโมเดลแล้ว แต่โมเดลได้สร้างข้อมูลที่ไม่ต้องการนั้นขึ้นมาใหม่ในลักษณะ “holographic” เช่นเดียวกับการที่หยดสีจะเปลี่ยนคุณสมบัติของแก้วน้ำ

ในความเป็นจริง น้ำหนักของโมเดลได้รับผลกระทบจากข้อมูลที่ไม่ต้องการนั้นแล้ว และวิธีเดียวที่จะลบผลกระทบนั้นออกจากโมเดลคือการฝึกอบรมโมเดลใหม่ตั้งแต่ต้น ไม่ใช่การฝึกอบรมใหม่บนข้อมูลที่แก้ไขแล้ว

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai