มุมมองของ Anderson

อัตลักษณ์ที่แท้จริงสามารถกู้คืนได้จากชุดข้อมูลสังเคราะห์

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
Sample comparison images from the paper 'Unveiling Synthetic Faces: How Synthetic Datasets Can Expose Real Identities', including original images (top), and inferred images (bottom).

หากปี 2022 เป็นช่วงเวลาที่ศักยภาพที่ก่อให้เกิดการเปลี่ยนแปลงของ AI ที่สร้างขึ้นได้รับความสนใจจากสาธารณชนอย่างกว้างขวาง ปี 2024 เป็นปีที่คำถามเกี่ยวกับความถูกต้องตามกฎหมายของข้อมูลที่อยู่ภายใต้ AI ได้กลายเป็นจุดสนใจหลักสำหรับธุรกิจที่ต้องการใช้ประโยชน์จาก AI

หลักการของการใช้ประโยชน์จากงานที่มีลิขสิทธิ์ในประเทศสหรัฐอเมริกา รวมถึงใบอนุญาตทางวิชาการที่ชัดเจนซึ่งอนุญาตให้ภาควิจัยและภาคธุรกิจใช้ AI ที่สร้างขึ้นได้ ได้กลายเป็นเรื่องที่ไม่เหมาะสมมากขึ้นเมื่อมีหลักฐานที่เพิ่มขึ้นเกี่ยวกับการลอกเลียนแบบ การลอกเลียนแบบ ที่เกิดขึ้น ต่อมา สหรัฐอเมริกาก็ ไม่อนุญาต ให้เนื้อหาที่สร้างโดย AI ได้รับการคุ้มครองลิขสิทธิ์

เรื่องเหล่านี้ยังไม่ได้รับการแก้ไข และไม่น่าจะมีการแก้ไขในเร็วๆ นี้ ในปี 2023 เนื่องจากความกังวลที่เพิ่มขึ้นจากสื่อและประชาชนเกี่ยวกับสถานะทางกฎหมายของผลลัพธ์ที่สร้างโดย AI สำนักงานลิขสิทธิ์สหรัฐฯ ได้เริ่มการสอบสวนระยะยาวเกี่ยวกับด้านนี้ของ AI ที่สร้างขึ้น โดยเผยแพร่ ส่วนแรก (เกี่ยวกับสำเนาดิจิทัล) ในเดือนกรกฎาคม 2024

ในระหว่างนี้ สายธุรกิจยังคงรู้สึกไม่สบายใจเกี่ยวกับความเป็นไปได้ที่โมเดลที่มีราคาแพงที่พวกเขาต้องการใช้ประโยชน์จากอาจทำให้พวกเขาเสี่ยงต่อผลทางกฎหมายเมื่อมีการออกกฎหมายและคำจำกัดความที่ชัดเจนในอนาคต

วิธีแก้ปัญหาที่มีราคาแพงในระยะสั้นคือการทำให้โมเดล AI มีความถูกต้องตามกฎหมายโดยการฝึกอบรมโดยใช้ข้อมูลที่บริษัทมีสิทธิ์ในการใช้ประโยชน์ อาร์กิเทคต์ชัวร์ Firefly ของ Adobe ที่แปลงข้อความเป็นรูปภาพ (และตอนนี้ ข้อความเป็นวิดีโอ) ได้รับการขับเคลื่อนหลักโดย การซื้อ ของชุดข้อมูลรูปภาพสต็อก Fotolia ในปี 2014 เสริม โดยการใช้ข้อมูลสาธารณสมบัติที่หมดลิขสิทธิ์ ในเวลาเดียวกัน ผู้จัดหาสต็อกภาพที่มีอยู่ เช่น Getty และ Shutterstock ได้ ใช้ประโยชน์ จากมูลค่าใหม่ของข้อมูลที่ได้รับอนุญาต โดยมีจำนวนข้อตกลงที่เพิ่มขึ้นในการอนุญาตเนื้อหาหรือพัฒนาระบบ AI ที่เป็นไปตาม IP ของตนเอง

วิธีแก้ปัญหาสังเคราะห์

การลบข้อมูลที่มีลิขสิทธิ์ออกจากพื้นที่ 潜在 ของโมเดล AI นั้น มีปัญหา การผิดพลาดในด้านนี้อาจมีค่าใช้จ่ายสูงสำหรับบริษัทที่ทดลองใช้โซลูชันสำหรับผู้บริโภคและธุรกิจที่ใช้การเรียนรู้ของเครื่อง

วิธีแก้ปัญหาทางเลือกและราคาถูกกว่าสำหรับระบบการมองเห็นของคอมพิวเตอร์ (และ นอกจากนี้ โมเดลภาษาขนาดใหญ่ หรือ LLMs) คือการใช้ ข้อมูลสังเคราะห์ โดยที่ชุดข้อมูลประกอบด้วยตัวอย่างที่สร้างแบบสุ่มของโดเมนเป้าหมาย (เช่น ใบหน้า สัตว์ โบสถ์ หรือแม้แต่ชุดข้อมูลที่ทั่วไปมากขึ้น)

เว็บไซต์ เช่น thispersondoesnotexist.com ได้นำเสนอแนวคิดที่ว่าภาพถ่ายที่ดูเหมือนจริงของ ‘คนไม่มีอยู่จริง’ สามารถสังเคราะห์ได้ (ในกรณีนี้ผ่าน เครือข่าย GANs) โดยไม่มีความสัมพันธ์กับคนจริงที่มีอยู่ในโลกแห่งความเป็นจริง

ดังนั้น หากคุณฝึกระบบการรู้จำใบหน้าหรือระบบที่สร้างขึ้นโดยใช้ตัวอย่างที่เป็นนามธรรมและไม่มีอยู่จริง คุณสามารถทฤษฎีได้ว่าได้มาตรฐานการผลิตที่มีจริงสำหรับโมเดล AI โดยไม่ต้องคำนึงว่าข้อมูลนั้นสามารถใช้ได้ตามกฎหมายหรือไม่

การสร้างสมดุล

ปัญหาก็คือ ระบบที่สร้างข้อมูลสังเคราะห์นั้นได้รับการฝึกอบรมโดยใช้ข้อมูลจริง หากสิ่งเหล่านี้รั่วไหลเข้าสู่ข้อมูลสังเคราะห์ ก็อาจให้หลักฐานที่ว่าข้อมูลที่ถูกจำกัดหรือไม่ได้รับอนุญาตอื่นๆ ได้รับการใช้เพื่อผลประโยชน์ทางการเงิน

เพื่อหลีกเลี่ยงสิ่งนี้ และเพื่อสร้างภาพที่แท้จริง ‘สุ่ม’ ระบบเหล่านี้จำเป็นต้องมีการ ทั่วไป ที่ดี การทำให้ทั่วไป คือการวัดความสามารถของโมเดล AI ที่ได้รับการฝึกอบรมในการเข้าใจแนวคิดระดับสูง (เช่น ‘ใบหน้า’ ‘ชาย’ หรือ ‘‘หญิง’) โดยไม่ต้องอาศัยการทำซ้ำข้อมูลการฝึกอบรมที่แท้จริง

อย่างไรก็ตาม อาจเป็นเรื่องที่ยากสำหรับระบบที่ได้รับการฝึกอบรมในการสร้างหรือรู้จัก รายละเอียดที่ละเอียด หากไม่ได้รับการฝึกอบรมอย่างกว้างขวางบนชุดข้อมูล ซึ่งจะทำให้ระบบเสี่ยงต่อ การจำ: ความโน้มเอียงที่จะทำซ้ำตัวอย่างของข้อมูลการฝึกอบรมที่แท้จริง

สิ่งนี้สามารถบรรเทาได้โดยการตั้งค่าอัตราการเรียนรู้ที่ ผ่อนคลาย มากขึ้น หรือโดยการหยุดการฝึกอบรมที่จุดหนึ่งโดยที่แนวคิดหลักยังคงอ่อนนุ่มและไม่เกี่ยวข้องกับจุดข้อมูลใดจุดหนึ่ง (เช่น ภาพของบุคคลใดบุคคลหนึ่ง ในกรณีของชุดข้อมูลใบหน้า)

อย่างไรก็ตาม วิธีแก้ปัญหาทั้งสองนี้มีแนวโน้มที่จะนำไปสู่โมเดลที่มีรายละเอียดที่ละเอียดอ่อนน้อยกว่า เนื่องจากระบบไม่ได้รับโอกาสในการพัฒนาต่อไปนอกเหนือจาก ‘พื้นฐาน’ ของโดเมนเป้าหมาย และลงไปถึงรายละเอียดเฉพาะ

ดังนั้น ในวรรณกรรมทางวิทยาศาสตร์ อัตราการเรียนรู้ที่สูงมากและตารางการฝึกอบรมที่ครอบคลุมมักถูกนำมาใช้ ในขณะที่นักวิจัยพยายามประนีประนอมระหว่างความสามารถในการใช้งานทั่วไปและรายละเอียดที่ละเอียดอ่อนในโมเดลสุดท้าย โมเดลที่ ‘จดจำ’ เล็กน้อยสามารถทำให้เข้าใจผิดว่าเป็นโมเดลที่ทั่วไปได้ – แม้แต่ในการทดสอบเบื้องต้น

การเปิดเผยใบหน้า

สิ่งนี้นำเราไปสู่งานวิจัยใหม่ที่น่าสนใจจากสวิตเซอร์แลนด์ ซึ่งอ้างว่าเป็นงานแรกที่แสดงให้เห็นว่าภาพที่แท้จริงที่เป็นพลังงานของข้อมูลสังเคราะห์สามารถกู้คืนได้จากภาพที่สร้างขึ้นที่ควรจะเป็น ‘สุ่ม’ ตามทฤษฎี:

ผลลัพธ์ ซึ่งผู้เขียนโต้แย้งว่า ชี้ให้เห็นว่า ‘ผู้สร้างสังเคราะห์’ ได้ ‘จดจำ’ จุดข้อมูลการฝึกอบรมจำนวนมากในระหว่างการค้นหาความละเอียดอ่อนที่มากขึ้น พวกเขายังชี้ให้เห็นว่าระบบที่พึ่งพาข้อมูลสังเคราะห์เพื่อปกป้องผู้ผลิต AI จากผลทางกฎหมายอาจไม่น่าเชื่อถือในเรื่องนี้

นักวิจัยได้ทำการศึกษาอย่างกว้างขวางเกี่ยวกับชุดข้อมูลสังเคราะห์หกชุด ซึ่งแสดงให้เห็นว่าในกรณีทั้งหมด ข้อมูลที่แท้จริง (ที่อาจมีลิขสิทธิ์หรือได้รับการคุ้มครอง) สามารถกู้คืนได้ พวกเขากล่าวว่า:

‘การทดลองของเราแสดงให้เห็นว่าชุดข้อมูลการรู้จำใบหน้าสังเคราะห์ที่มีคุณภาพสูงสุดมีตัวอย่างที่ใกล้เคียงกับตัวอย่างในชุดข้อมูลการฝึกอบรมของโมเดลผู้สร้าง ในบางกรณี ตัวอย่างสังเคราะห์มีการเปลี่ยนแปลงเล็กน้อยจากภาพที่แท้จริง แต่เรายังสามารถสังเกตเห็นว่าตัวอย่างที่สร้างขึ้นมีความแตกต่าง (เช่น โปสที่แตกต่าง สภาพแสง ฯลฯ) ในขณะที่อัตลักษณ์ยังคงเหมือนเดิม ‘

วิธีการ ข้อมูล และผลลัพธ์

ใบหน้าที่ ‘จดจำ’ ในการศึกษานี้ถูกเปิดเผยโดย การโจมตีด้วยการเป็นสมาชิก แม้ว่าแนวคิดนี้จะดูซับซ้อน แต่ก็สามารถอธิบายได้อย่างง่ายดาย: การอนุมานสมาชิกในกรณีนี้หมายถึงกระบวนการในการซักถามระบบจนกว่าจะเปิดเผยข้อมูลที่ตรงกับข้อมูลที่คุณกำลังมองหา หรือมีลักษณะคล้ายคลึงกัน

นักวิจัยได้ศึกษาชุดข้อมูลสังเคราะห์หกชุด ซึ่งมีแหล่งที่มาของชุดข้อมูลจริงที่ทราบ ในการประเมินผลลัพธ์ พวกเขาพบว่าชุดข้อมูลสังเคราะห์เหล่านี้มีลักษณะคล้ายคลึงกับชุดข้อมูลจริง

ผลงานวิจัยนี้ชี้ให้เห็นว่าข้อมูลสังเคราะห์ที่สร้างขึ้นโดยใช้ AI อาจไม่ได้รับการคุ้มครองตามที่คิดไว้ และอาจมีความเสี่ยงต่อการเปิดเผยข้อมูลที่มีลิขสิทธิ์หรือได้รับการคุ้มครอง

สรุป

เมื่อเร็วๆ นี้ ความสนใจของสื่อได้เน้นย้ำถึง ผลตอบแทนที่ลดลง ที่ได้รับจากการฝึกอบรมโมเดล AI โดยใช้ข้อมูลที่สร้างโดย AI

การวิจัยใหม่ของสวิสนี้นำเสนอการพิจารณาที่อาจมีความกดดันมากขึ้นสำหรับจำนวนบริษัทที่ต้องการใช้ประโยชน์จาก AI ที่สร้างขึ้น – การคงอยู่ของรูปแบบข้อมูลที่ได้รับการคุ้มครองลิขสิทธิ์หรือไม่ได้รับอนุญาต แม้ว่าชุดข้อมูลจะถูกออกแบบมาเพื่อต่อสู้กับการปฏิบัตินี้ก็ตาม หากเราต้องให้คำจำกัดความในกรณีนี้ อาจเรียกว่า ‘การล้างใบหน้า’

* อย่างไรก็ตาม การตัดสินใจของ Adobe ที่จะอนุญาตให้ผู้ใช้อัปโหลดภาพที่สร้างโดย AI ไปยัง Adobe Stock ได้ทำลายความ ‘บริสุทธิ์’ ของข้อมูลนี้ตามกฎหมาย Bloomberg ยืนยันในเดือนเมษายน 2024 ว่าภาพที่อัปโหลดโดยผู้ใช้จากระบบ AI ของ MidJourney ได้ถูกนำมาใช้ในความสามารถของ Firefly

โมเดลนี้ไม่ได้ระบุไว้ในเอกสาร

เผยแพร่ครั้งแรกวันพุธที่ 6 พฤศจิกายน 2024

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: [email protected]