ผู้นำทางความคิด

เทคนิคการเรียนรู้ของเครื่องจักร 3 แบบที่ช่วยรักษาความเป็นส่วนตัว ซึ่งเป็นปัญหาที่สำคัญที่สุดในรอบทศวรรษนี้

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

โดย Amogh Tarcar นักวิจัยด้าน Machine Learning และ AI จาก Persistent Systems. (PERSISTENT.BO )

ความเป็นส่วนตัวของข้อมูลตามคำแนะนำของนักวิชาการจากหลายสาขา จะเป็น ปัญหาที่สำคัญที่สุดในรอบทศวรรษนี้ โดยเฉพาะอย่างยิ่งสำหรับการเรียนรู้ของเครื่องจักร (ML) ที่ต้องการข้อมูลจำนวนมาก

โดยทั่วไป เทคนิคการเรียนรู้ของเครื่องจักรแบบดั้งเดิมจะรวบรวมข้อมูลจากหลายแหล่งเข้าสู่ศูนย์กลางข้อมูลเดียว เนื่องจากโมเดลการเรียนรู้ของเครื่องจักรมีประสิทธิภาพสูงสุดเมื่อมีข้อมูลจำนวนมาก อย่างไรก็ตาม มีหลายความท้าทายด้านความเป็นส่วนตัวที่เกี่ยวข้องกับเทคนิคนี้ การรวบรวมข้อมูลจากหลายแหล่งนั้นเป็นเรื่องที่ทำได้ยากในปัจจุบันเนื่องจากข้อกังวลด้านกฎระเบียบ เช่น HIPAA, GDPR และ CCPA นอกจากนี้ การรวบรวมข้อมูลเข้าสู่ศูนย์กลางข้อมูลเดียวก็เพิ่มโอกาสและขนาดของการละเมิดข้อมูลและภัยคุกคามด้านความปลอดภัยในรูปแบบของการรั่วไหลของข้อมูล

เพื่อเอาชนะความท้าทายเหล่านี้ ได้มีการพัฒนาสถูปการเรียนรู้ของเครื่องจักรที่ช่วยรักษาความเป็นส่วนตัว (PPML) โดยมีเทคนิคเฉพาะที่ลดความเสี่ยงด้านความเป็นส่วนตัวและรับประกันว่าข้อมูลจะยังคงปลอดภัย นี่คือบางส่วนของเทคนิคที่สำคัญที่สุด:

1. Federated Learning

Federated Learning เป็นเทคนิคการฝึกอบรม ML ที่กลับกับความท้าทายของการรวบรวมข้อมูล โดยไม่ต้องรวบรวมข้อมูลเข้าสู่ศูนย์กลางข้อมูลเดียว แต่รวบรวมโมเดลการเรียนรู้ของเครื่องจักรเองแทน ซึ่งหมายความว่าข้อมูลไม่ต้องออกจากที่เก็บข้อมูลเดิม และช่วยให้หลายฝ่ายสามารถทำงานร่วมกันและสร้างโมเดลการเรียนรู้ของเครื่องจักรร่วมกันโดยไม่ต้องแบ่งปันข้อมูลที่มีความเสี่ยง

มันทำงานโดยเริ่มต้นด้วยโมเดลการเรียนรู้ของเครื่องจักรพื้นฐานที่จะถูกแบ่งปันกับแต่ละโหนดลูกค้า โหนดเหล่านี้จะทำงานฝึกอบรมท้องถิ่นโดยใช้ข้อมูลของตนเอง และอัปเดตโมเดลจะถูกแบ่งปันกับโหนดผู้ประสานงาน ซึ่งจะประมวลผลอัปเดตเหล่านี้และรวมเข้าด้วยกันเพื่อให้ได้โมเดลระดับโลกใหม่ ด้วยวิธีนี้ คุณจะได้รับข้อมูลเชิงลึกจากชุดข้อมูลที่หลากหลายโดยไม่ต้องแบ่งปันชุดข้อมูลเหล่านั้น

Source: Persistent Systems

ในบริบทของการดูแลสุขภาพ นี่เป็นเครื่องมือที่มีประสิทธิภาพและช่วยรักษาความเป็นส่วนตัวในการเก็บข้อมูลผู้ป่วยไว้อย่างปลอดภัยในขณะเดียวกันก็ให้ความฉลาดของฝูงชนแก่นักวิจัย โดยไม่ต้องรวบรวมข้อมูล Federated Learning จะสร้างชั้นความปลอดภัยเพิ่มเติม อย่างไรก็ตาม โมเดลและอัปเดตโมเดลยังคงมีความเสี่ยงด้านความปลอดภัยหากไม่ได้รับการปกป้อง

2. Differential Privacy

โมเดลการเรียนรู้ของเครื่องจักรมักเป็นเป้าหมายของการโจมตีแบบการอนุมานสมาชิก สมมติว่าคุณแบ่งปันข้อมูลสุขภาพของคุณกับโรงพยาบาลเพื่อช่วยพัฒนาวัคซีนป้องกันโรคมะเร็ง โรงพยาบาลจะเก็บข้อมูลของคุณไว้อย่างปลอดภัย แต่ใช้ Federated Learning เพื่อฝึกอบรมโมเดลการเรียนรู้ของเครื่องจักรที่มีอยู่สาธารณะ หลายเดือนต่อมา ผู้โจมตีใช้การโจมตีแบบการอนุมานสมาชิกเพื่อกำหนดว่าข้อมูลของคุณถูกใช้ในการฝึกอบรมโมเดลหรือไม่ จากนั้นพวกเขาจะส่งผลลัพธ์ไปยังบริษัทประกันภัย ซึ่งอาจเพิ่มค่าประกันของคุณตามความเสี่ยงของการเป็นโรคมะเร็ง

Differential Privacy รับประกันว่าการโจมตีของฝ่ายตรงข้ามต่อโมเดลการเรียนรู้ของเครื่องจักรจะไม่สามารถระบุจุดข้อมูลเฉพาะที่ใช้ในการฝึกอบรมได้ ซึ่งจะลดความเสี่ยงในการเปิดเผยข้อมูลที่มีความเสี่ยงในการเรียนรู้ของเครื่องจักร นี่ทำได้โดยการบวก “สัญญาณเสียง” ที่จะทำให้ข้อมูลหรือพารามิเตอร์ของโมเดลการเรียนรู้ของเครื่องจักรเสียหายระหว่างการฝึกอบรม ทำให้ยากต่อการโจมตีและการกำหนดว่าข้อมูลของบุคคลใดบุคคลหนึ่งถูกใช้ในการฝึกอบรมหรือไม่

ตัวอย่างเช่น Facebook ได้เปิดตัว Opacus ซึ่งเป็นไลบรารี่ที่มีความเร็วสูงสำหรับการฝึกอบรมโมเดล PyTorch โดยใช้อัลกอริทึมการเรียนรู้ของเครื่องจักรที่มีความเป็นส่วนตัวที่แตกต่างกัน (DP-SGD) ไฟล์ GIF ด้านล่างแสดงวิธีการใช้สัญญาณเสียงเพื่อปกปิดข้อมูล

 

สัญญาณเสียงนี้ถูกควบคุมโดยพารามิเตอร์ที่เรียกว่า Epsilon หากค่า Epsilon ต่ำ โมเดลจะมีความเป็นส่วนตัวที่สมบูรณ์แบบ แต่จะมีประสิทธิภาพและความแม่นยำที่ต่ำ ในทางกลับกัน หากค่า Epsilon สูง ความเป็นส่วนตัวของข้อมูลจะลดลง แต่ความแม่นยำจะเพิ่มขึ้น เทคนิคคือการหาสมดุลเพื่อเพิ่มประสิทธิภาพทั้งสองด้าน

3. Homomorphic encryption

การเข้ารหัสแบบมาตรฐานไม่เข้ากันกับการเรียนรู้ของเครื่องจักร เนื่องจากเมื่อข้อมูลถูกเข้ารหัสแล้ว โมเดลการเรียนรู้ของเครื่องจักรจะไม่สามารถเข้าใจข้อมูลได้ แต่การเข้ารหัสแบบ Homomorphic เป็นเทคนิคการเข้ารหัสพิเศษที่ช่วยให้สามารถดำเนินการคำนวณบางอย่างได้

Source: OpenMined

พลังของการเข้ารหัสแบบ Homomorphic คือสามารถฝึกอบรมโมเดลการเรียนรู้ของเครื่องจักรได้ในพื้นที่ที่เข้ารหัสทั้งหมด ไม่เพียงแต่ปกป้องเจ้าของข้อมูลเท่านั้น แต่ยังช่วยปกป้องเจ้าของโมเดลการเรียนรู้ของเครื่องจักรอีกด้วย เจ้าของโมเดลสามารถใช้โมเดลการเรียนรู้ของเครื่องจักรกับข้อมูลที่เข้ารหัสได้โดยไม่ต้องเห็นหรือละเมิดข้อมูล

เมื่อนำไปใช้กับ Federated Learning การรวมอัปเดตโมเดลสามารถเกิดขึ้นได้อย่างปลอดภัยเนื่องจากเกิดขึ้นในพื้นที่ที่เข้ารหัสทั้งหมด ซึ่งลดความเสี่ยงของการโจมตีแบบการอนุมานสมาชิกอย่างมาก

ทศวรรษแห่งความเป็นส่วนตัว

เมื่อเราก้าวเข้าสู่ปี 2021 การเรียนรู้ของเครื่องจักรที่ช่วยรักษาความเป็นส่วนตัวเป็นสาขาวิชาที่มีการวิจัยอย่างกระตือรือร้น หากทศวรรษที่แล้วเกี่ยวกับการปลดปล่อยข้อมูล ทศวรรษนี้จะเกี่ยวกับการปลดปล่อยโมเดลการเรียนรู้ของเครื่องจักรโดยการรักษาความเป็นส่วนตัวของข้อมูลที่อยู่ด้านล่างโดยใช้ Federated Learning, Differential Privacy และ Homomorphic encryption เทคนิคเหล่านี้นำเสนอแนวทางใหม่ที่มีแนวโน้มในการพัฒนาวิธีแก้ปัญหาการเรียนรู้ของเครื่องจักรที่ตระหนักถึงความเป็นส่วนตัว

Amogh เป็นนักวิจัยด้าน Machine Learning และเป็นส่วนหนึ่งของ AI Research Lab ที่ Persistent Systems การวิจัยในปัจจุบันของเขาเน้นไปที่ Federated Learning applications และสร้าง NLP tools สำหรับการดึงข้อมูลความรู้