ความปลอดภัยไซเบอร์
วิธีการรักษาความปลอดภัยของข้อมูลการฝึกอบรม AI
ปัญญาประดิษฐ์ (AI) ต้องการข้อมูลและต้องการมากในขณะนี้ การรวบรวมข้อมูลที่จำเป็นไม่ใช่ความท้าทายเสมอไปในสภาพแวดล้อมของปัจจุบัน โดยมีเซตข้อมูลสาธารณะมากมายและข้อมูลที่สร้างขึ้นทุกวัน อย่างไรก็ตาม การรักษาความปลอดภัยเป็นอีกเรื่องหนึ่ง
ขนาดที่ใหญ่ของเซตข้อมูลการฝึกอบรม AI และผลกระทบของโมเดล AI ดึงดูดความสนใจจากนักอาชญากรรมไซเบอร์ เมื่อความพึ่งพา AI เพิ่มขึ้น ทีมที่พัฒนาเทคโนโลยีนี้ควรใช้ความระมัดระวังในการรักษาความปลอดภัยของข้อมูลการฝึกอบรม
ทำไมข้อมูลการฝึกอบรม AI จึงต้องการความปลอดภัยที่ดีกว่า
ข้อมูลที่คุณใช้ในการฝึกอบรมโมเดล AI อาจสะท้อนถึงบุคคล ธุรกิจ หรือเหตุการณ์ในโลกแห่งความเป็นจริง ดังนั้น คุณอาจจัดการข้อมูลที่สามารถระบุถึงบุคคล (PII) ได้จำนวนมาก ซึ่งจะทำให้เกิดการละเมิดความเป็นส่วนตัวที่สำคัญหากถูกเปิดเผย ในปี 2023 Microsoft (MSFT ) ได้ประสบเหตุการณ์นี้โดยไม่ตั้งใจ โดยเปิดเผยข้อมูลส่วนตัว 38 เทระไบต์ระหว่างโครงการวิจัย AI
เซตข้อมูลการฝึกอบรม AI อาจมีความเสี่ยงต่อการโจมตีแบบก่อความเสียหายอีกด้วย นักอาชญากรรมไซเบอร์สามารถเปลี่ยนแปลงความน่าเชื่อถือของโมเดลการเรียนรู้ของเครื่องโดยการแก้ไขข้อมูลการฝึกอบรมหากพวกเขาสามารถเข้าถึงได้ เป็นการโจมตีแบบหนึ่งที่เรียกว่าการปนเปื้อนข้อมูล และนักพัฒนา AI อาจไม่สังเกตเห็นผลกระทบจนกว่าจะสายเกินไป
การวิจัยแสดงให้เห็นว่าการปนเปื้อนเพียง 0.001% ของเซตข้อมูลก็เพียงพอที่จะทำให้โมเดล AI เสียหาย ไม่มีการป้องกันที่เหมาะสม การโจมตีแบบนี้อาจนำไปสู่ผลกระทบที่รุนแรงเมื่อโมเดลถูกนำไปใช้ในโลกแห่งความเป็นจริง ตัวอย่างเช่น โมเดลการขับขี่อัตโนมัติที่ถูกปนเปื้อนอาจไม่สามารถสังเกตเห็นคนเดินถนนได้ หรือเครื่องมือ AI ที่วิเคราะห์ใบสมัครงานอาจให้ผลลัพธ์ที่มีอคติ
ในสถานการณ์ที่น้อยกว่านี้ ผู้โจมตีอาจขโมยข้อมูลที่เป็นความลับจากเซตข้อมูลการฝึกอบรมในการลอบสังการอุตสาหกรรม หรือพวกเขาอาจล็อกผู้ใช้ที่ได้รับอนุญาตออกจากฐานข้อมูลและขอเงินไถ่
เมื่อ AI มีความสำคัญต่อชีวิตและธุรกิจมากขึ้น นักอาชญากรรมไซเบอร์จะมีโอกาสได้รับประโยชน์มากขึ้นจากการโจมตีฐานข้อมูลการฝึกอบรม ความเสี่ยงเหล่านี้จึงกลายเป็นเรื่องที่น่ากังวลมากขึ้น
5 ขั้นตอนในการรักษาความปลอดภัยของข้อมูลการฝึกอบรม AI
เมื่อพิจารณาถึงภัยคุกคามเหล่านี้ ควรให้ความสำคัญกับความปลอดภัยเมื่อฝึกอบรมโมเดล AI มีขั้นตอน 5 ขั้นตอนต่อไปนี้เพื่อติดตาม
1. ลดข้อมูลที่ละเอียดอ่อนในเซตข้อมูลการฝึกอบรม
การลดข้อมูลที่ละเอียดอ่อนในเซตข้อมูลการฝึกอบรมเป็นหนึ่งในมาตรการที่สำคัญที่สุด ข้อมูลที่มีข้อมูลที่สามารถระบุถึงบุคคลหรือข้อมูลที่มีค่าในเซตข้อมูลการฝึกอบรมของคุณน้อยลง จะทำให้เซตข้อมูลการฝึกอบรมของคุณมีความเสี่ยงน้อยลงต่อนักอาชญากรรมไซเบอร์ และหากเกิดการละเมิดความปลอดภัยขึ้น ก็จะทำให้ผลกระทบน้อยลง
โมเดล AI มักไม่ต้องการใช้ข้อมูลในโลกแห่งความเป็นจริงระหว่างการฝึกอบรม ข้อมูลสังเคราะห์เป็นตัวเลือกที่มีค่า โมเดลที่ฝึกอบรมด้วยข้อมูลสังเคราะห์สามารถมีความแม่นยำเท่ากันหรือมากกว่าโมเดลที่ฝึกอบรมด้วยข้อมูลจริง ดังนั้น คุณจึงไม่ต้องกังวลเรื่องปัญหาประสิทธิภาพ เพียงแต่ต้องแน่ใจว่าเซตข้อมูลที่สร้างขึ้นนั้นคล้ายกับและทำงานเหมือนข้อมูลในโลกแห่งความเป็นจริง
ทางเลือกอื่นคือการลบข้อมูลที่ละเอียดอ่อนออกจากเซตข้อมูลที่มีอยู่ เช่น ชื่อคน ที่อยู่ และข้อมูลทางการเงิน เมื่อต้องการใช้ข้อมูลเหล่านี้สำหรับโมเดลของคุณ ควรพิจารณาใช้ข้อมูลที่ไม่เกี่ยวข้องหรือสับเปลี่ยนข้อมูลระหว่างบันทึก
2. จำกัดการเข้าถึงเซตข้อมูลการฝึกอบรม
หลังจากที่คุณรวบรวมเซตข้อมูลการฝึกอบรมแล้ว คุณต้องจำกัดการเข้าถึงเซตข้อมูลการฝึกอบรม ตามหลักการของสิทธิในการเข้าถึงข้อมูลที่น้อยที่สุด ซึ่งระบุว่าผู้ใช้หรือโปรแกรมใดๆ ควรสามารถเข้าถึงข้อมูลได้เฉพาะในส่วนที่จำเป็นต่อการทำงานของตนเท่านั้น ผู้ที่ไม่เกี่ยวข้องกับการฝึกอบรมไม่ต้องการเห็นหรือโต้ตอบกับฐานข้อมูล
จำไว้ว่าการจำกัดสิทธิในการเข้าถึงข้อมูลจะไม่มีผลหากไม่มีการยืนยันตัวตนผู้ใช้ที่เชื่อถือได้ ชื่อผู้ใช้และรหัสผ่านไม่เพียงพอ การยืนยันตัวตนแบบหลายปัจจัย (MFA) เป็นสิ่งจำเป็น เนื่องจากสามารถหยุดการโจมตี 80% ถึง 90% ของการโจมตีบนบัญชี แต่ไม่ใช่วิธีการ MFA ทุกวิธีมีความปลอดภัยเท่ากัน MFA แบบข้อความและแอปมีความปลอดภัยมากกว่าวิธีการอื่นๆ
ควรจำกัดการเข้าถึงซอฟต์แวร์และอุปกรณ์ ไม่ใช่แค่ผู้ใช้เท่านั้น เครื่องมือที่สามารถเข้าถึงเซตข้อมูลการฝึกอบรมได้ควรเป็นโมเดล AI และโปรแกรมที่คุณใช้ในการจัดการข้อมูลระหว่างการฝึกอบรมเท่านั้น
3. 암호化และสำรองข้อมูล
การ 암호化เป็นอีกมาตรการสำคัญในการป้องกัน ข้อมูลการฝึกอบรม AI ไม่สามารถฝึกอบรมบนข้อมูลที่ถูก 암호化ได้ แต่คุณสามารถเข้ารหัสและถอดรหัสข้อมูลระหว่างการวิเคราะห์ จากนั้นเข้ารหัสข้อมูลอีกครั้งเมื่อคุณเสร็จสิ้น หรือคุณสามารถใช้โครงสร้างโมเดลที่สามารถวิเคราะห์ข้อมูลที่เข้ารหัสได้
การสำรองข้อมูลการฝึกอบรมของคุณในกรณีที่เกิดเหตุการณ์ใดๆ กับข้อมูลนั้นเป็นสิ่งสำคัญ การสำรองข้อมูลควรอยู่ในตำแหน่งที่แตกต่างจากตำแหน่งหลัก ขึ้นอยู่กับว่าเซตข้อมูลของคุณมีความสำคัญต่อภารกิจหรือไม่ คุณอาจต้องเก็บสำรองข้อมูลหนึ่งสำเนาไว้แบบออฟไลน์และอีกสำเนาหนึ่งไว้ในคลาวด์ และจำไว้ว่าควรเข้ารหัสการสำรองข้อมูลทั้งหมดด้วย
เมื่อพูดถึงการเข้ารหัส ควรเลือกวิธีการเข้ารหัสอย่างระมัดระวัง มาตรฐานที่สูงกว่านั้นเป็นที่ต้องการเสมอ แต่คุณอาจต้องการพิจารณาใช้การเข้ารหัสที่ต้านทานการโจมตีแบบควอนตัม เนื่องจากการโจมตีแบบควอนตัมมีความเสี่ยงมากขึ้น
4. ติดตามการเข้าถึงและการใช้งาน
แม้ว่าคุณจะปฏิบัติตามขั้นตอนเหล่านี้ แต่นักอาชญากรรมไซเบอร์ก็ยังสามารถฝ่าฝืนการป้องกันของคุณได้ ดังนั้น คุณจึงต้องติดตามรูปแบบการเข้าถึงและการใช้งานเซตข้อมูลการฝึกอบรม AI อย่างต่อเนื่อง
การแก้ปัญหาโดยอัตโนมัติอาจจำเป็นในกรณีนี้ เนื่องจากองค์กรส่วนใหญ่ไม่มีพนักงานเพียงพอในการดูแลการเข้าถึงและรูปแบบการใช้งานตลอด 24 ชั่วโมง การใช้ระบบอัตโนมัติสามารถตอบสนองต่อเหตุการณ์ที่ไม่ปกติได้เร็วขึ้น ซึ่งนำไปสู่ต้นทุนการละเมิดความปลอดภัยที่ลดลง 2.22 ดอลลาร์โดยเฉลี่ย
บันทึกการเข้าถึงเซตข้อมูลทุกครั้ง รวมถึงการร้องขอการเข้าถึง การเปลี่ยนแปลง หรือการโต้ตอบอื่นๆ 除了การดูแลการละเมิดความปลอดภัยแล้ว ควรทบทวนกิจกรรมเหล่านี้เป็นประจำเพื่อหาความผิดปกติในพฤติกรรมของผู้ใช้ที่ได้รับอนุญาต ซึ่งอาจต้องมีการเปลี่ยนแปลงสิทธิในการเข้าถึงหรือการยืนยันตัวตนแบบพฤติกรรมหากคุณใช้ระบบดังกล่าว
5. ประเมินความเสี่ยงใหม่ๆ อย่างสม่ำเสมอ
ในทำนองเดียวกัน ทีมพัฒนา AI ต้องตระหนักว่าความปลอดภัยทางไซเบอร์เป็นกระบวนการที่ต่อเนื่อง ไม่ใช่การแก้ปัญหาครั้งเดียว วิธีการโจมตีจะพัฒนาเร็วมาก และช่องโหว่หรือภัยคุกคามบางอย่างอาจหลุดรอดจากการตรวจจับก่อนที่คุณจะสังเกตเห็น วิธีเดียวที่จะรักษาความปลอดภัยคือการประเมินความปลอดภัยของคุณใหม่ๆ บ่อยๆ
至少หนึ่งครั้งต่อปี ควรทบทวนโมเดล AI ของคุณ เซตข้อมูลการฝึกอบรม และเหตุการณ์ความปลอดภัยที่ส่งผลกระทบต่อทั้งสองอย่าง ตรวจสอบเซตข้อมูลและอัลกอริทึมเพื่อให้แน่ใจว่าทำงานได้อย่างถูกต้องและไม่มีข้อมูลที่ปนเปื้อนหรือทำให้เข้าใจผิด Adjust การควบคุมความปลอดภัยตามความจำเป็นหากคุณสังเกตเห็นสิ่งใดที่ไม่ปกติ
การทดสอบการเจาะระบบ ซึ่งผู้เชี่ยวชาญด้านความปลอดภัยทดสอบการป้องกันของคุณโดยพยายามฝ่าฝืนการป้องกัน เป็นประโยชน์เช่นกัน ผู้เชี่ยวชาญด้านความปลอดภัยทางไซเบอร์ 17% ไม่ทดสอบการเจาะระบบ至少หนึ่งครั้งต่อปี และ 72% ของผู้ที่ทำเช่นนั้นเชื่อว่ามันช่วยหยุดการละเมิดความปลอดภัยในองค์กรของตน
ความปลอดภัยทางไซเบอร์เป็นกุญแจสำคัญในการพัฒนา AI ที่ปลอดภัย
การพัฒนา AI ที่มีจริยธรรมและปลอดภัยมีความสำคัญมากขึ้นเมื่อประเด็นเกี่ยวกับการพึ่งพาเครื่องมือการเรียนรู้ของเครื่องมีความโดดเด่นมากขึ้น การรักษาความปลอดภัยของฐานข้อมูลการฝึกอบรมเป็นขั้นตอนสำคัญในการตอบสนองความต้องการนี้
ข้อมูลการฝึกอบรม AI มีค่าและอ่อนไหวเกินกว่าที่จะเพิกเฉยต่อความเสี่ยงทางไซเบอร์ ติดตามขั้นตอนเหล่านี้ 5 ขั้นตอนในวันนี้เพื่อรักษาความปลอดภัยของโมเดลและเซตข้อมูลของคุณ












