มุมมองของ Anderson
การปฏิบัติของ AI ในปัจจุบันอาจเป็นการเปิดทางให้เกิดการฟ้องร้องลิขสิทธิ์ในอนาคต

การวิจัยร่วมกันระหว่าง Huawei และสถาบันการศึกษาบ่งชี้ว่าการวิจัยที่สำคัญที่สุดในปัจจุบันในด้านปัญญาประดิษฐ์และการเรียนรู้ของเครื่องอาจถูกฟ้องร้องเมื่อใดก็ตามที่มันกลายเป็นที่นิยมในเชิงพาณิชย์ เนื่องจากชุดข้อมูลที่ทำให้สามารถสร้างความก้าวหน้าได้ถูกเผยแพร่ด้วยใบอนุญาตที่ไม่ถูกต้องซึ่งไม่เคารพเงื่อนไขเดิมของโดเมนที่เผยแพร่สู่สาธารณะที่ข้อมูลถูกดึงมา
โดยผลลัพธ์ที่เป็นไปได้สองอย่างที่เกิดขึ้นเกือบจะไม่สามารถหลีกเลี่ยงได้ คือ อัลกอริทึม AI ที่ประสบความสำเร็จและพาณิชย์ ซึ่งทราบว่าใช้ชุดข้อมูลดังกล่าวจะกลายเป็นเป้าหมายของการฟ้องร้องลิขสิทธิ์ในอนาคต และองค์กรและบุคคลจะสามารถใช้ความอ่อนไหวทางกฎหมายเหล่านี้เพื่อประท้วงการนำเทคโนโลยีการเรียนรู้ของเครื่องไปใช้หรือเผยแพร่
บทความวิจัยที่มีชื่อว่า สามารถใช้ชุดข้อมูลที่มีอยู่สาธารณะนี้เพื่อสร้างซอฟต์แวร์ AI พาณิชย์ได้หรือไม่? มีแนวโน้มว่าจะไม่ได้ เป็นการร่วมมือกันระหว่าง Huawei Canada และ Huawei China ร่วมกับมหาวิทยาลัย York ในสหราชอาณาจักรและมหาวิทยาลัย Victoria ในแคนาดา
ห้าในหกชุดข้อมูลโอเพ่นซอร์สที่นิยมไม่สามารถใช้ได้ตามกฎหมาย
ในการวิจัยนี้ ผู้เขียนขอให้หน่วยงานภายใน Huawei เลือกชุดข้อมูลโอเพ่นซอร์สที่น่าสนใจที่สุดซึ่งพวกเขาต้องการใช้ในโครงการพาณิชย์ และเลือกชุดข้อมูลที่ถูกขอมากที่สุดจากคำตอบ: CIFAR-10 (ซับเซตของ 80 ล้านรูปภาพขนาดเล็ก ชุดข้อมูลที่ถูกถอนออกไปเนื่องจาก ‘คำพูดที่ไม่เหมาะสม’ และ ‘รูปภาพที่ไม่เหมาะสม’ แม้ว่าอนุพันธ์ของมันจะแพร่หลาย); ImageNet; Cityscapes (ซึ่งมีเนื้อหาที่สร้างขึ้นโดยผู้สร้างชุดข้อมูลเท่านั้น); FFHQ; VGGFace2 และ MSCOCO
เพื่อวิเคราะห์ว่าชุดข้อมูลที่เลือกนั้นเหมาะสมสำหรับการใช้ในโครงการพาณิชย์หรือไม่ ผู้เขียนพัฒนากระบวนการใหม่เพื่อติดตาม链ของใบอนุญาตให้ไกลที่สุดเท่าที่จะเป็นไปได้สำหรับแต่ละชุดข้อมูล แม้ว่าพวกเขาจะต้องอาศัยการดึงข้อมูลจากเว็บอาร์ไคฟ์ในการค้นหาใบอนุญาตจากโดเมนที่หมดอายุไปแล้ว และในบางกรณีจะต้อง ‘เดา’ สถานะใบอนุญาตจากข้อมูลที่ใกล้เคียงที่สุด
ผู้เขียนพบว่าใบอนุญาตของชุดข้อมูลห้าในหกชุด มีความเสี่ยงเกี่ยวข้องกับการใช้ในเชิงพาณิชย์:
‘[เรา] สังเกตเห็นว่า ยกเว้น MS COCO ไม่มีใบอนุญาตใดที่อนุญาตให้ใช้ AI ที่ฝึกอบรมด้วยชุดข้อมูลหรือผลลัพธ์ของ AI ที่ฝึกอบรมแล้ว’
ไม่มีทางออก
มีสามปัจจัยที่บริษัท AI พาณิชย์ดูเหมือนจะพึ่งพาเพื่อป้องกันตัวเองจากการฟ้องร้องเกี่ยวกับผลิตภัณฑ์ที่ใช้เนื้อหาลิขสิทธิ์จากชุดข้อมูลโดยไม่ได้รับอนุญาต
1: กฎหมายระดับชาติที่ไม่เข้มงวด
แม้ว่ารัฐบาลทั่วโลกจะถูกบังคับให้คลายกฎหมายเกี่ยวกับการดึงข้อมูลเพื่อไม่ให้ถูกทิ้งไว้ข้างหลังในการแข่งขัน AI (ซึ่งต้องการปริมาณข้อมูลจริงจากโลกที่มีลิขสิทธิ์ที่ไม่สมจริง) แต่เฉพาะสหรัฐอเมริกามีการให้ความคุ้มครองที่สมบูรณ์ในด้านนี้ภายใต้ หลักการการใช้โดยยุติธรรม – นโยบายที่ได้รับการรับรองในปี 2015 ด้วย การสรุป ของ Authors Guild v. Google, Inc. ซึ่งยืนยันว่าบริษัทค้นหาสามารถดึงข้อมูลลิขสิทธิ์สำหรับโครงการ Google Books ของตนได้โดยไม่ต้องถูกกล่าวหาว่าละเมิดลิขสิทธิ์
หากนโยบายหลักการการใช้โดยยุติธรรมเปลี่ยนแปลง (เช่น ในการตอบสนองต่อคดีสำคัญที่เกี่ยวข้องกับองค์กรหรือบริษัทที่มีอำนาจมาก) มันจะถือเป็น สถานะก่อนหน้า ในการเอาเปรียบฐานข้อมูลที่ละเมิดลิขสิทธิ์ในปัจจุบัน แต่จะไม่ การดำเนินการต่อ การใช้และการพัฒนาระบบที่ได้รับการช่วยเหลือจากเนื้อหาลิขสิทธิ์โดยไม่มีการตกลง
สรุป
บทความวิจัยแสดงให้เห็นถึงการใช้เนื้อหาลิขสิทธิ์ที่ไม่ได้รับอนุญาตและชุดใบอนุญาตที่ไม่สอดคล้องกันซึ่งหากติดตามไปถึงต้นตอของข้อมูล จะต้องมีการเจรจากับเจ้าของลิขสิทธิ์หลายพันคนซึ่งทำงานของพวกเขามีลิขสิทธิ์ที่แตกต่างกัน
ผู้เขียนสรุปว่า:
‘ชุดข้อมูลที่มีอยู่สาธารณะถูกใช้ในการสร้างซอฟต์แวร์ AI พาณิชย์ ซึ่งสามารถทำได้หากและเฉพาะหากใบอนุญาตที่เกี่ยวข้องกับชุดข้อมูลนั้นให้สิทธิ์ในการทำเช่นนั้น อย่างไรก็ตาม ไม่ใช่เรื่องง่ายที่จะตรวจสอบสิทธิ์และภาระผูกพันที่ให้ไว้ในใบอนุญาตที่เกี่ยวข้องกับชุดข้อมูลที่มีอยู่สาธารณะ เนื่องจากบางครั้งใบอนุญาตไม่ชัดเจนหรืออาจไม่ถูกต้อง’
งานวิจัยใหม่ที่มีชื่อว่า การสร้างชุดข้อมูลทางกฎหมาย ซึ่งเผยแพร่เมื่อวันที่ 2 พฤศจิกายนจากศูนย์กฎหมายการคำนวณของมหาวิทยาลัยการจัดการสิงคโปร์ ก็เน้นย้ำถึงความจำเป็นที่นักวิทยาศาสตร์ข้อมูลจะต้องรับรู้ว่ายุค ‘วิลด์เวสต์’ ของการรวบรวมข้อมูลแบบไม่มีการวางแผนกำลังจะสิ้นสุดลง และสะท้อนคำแนะนำของบทความวิจัยของ Huawei เพื่อใช้แนวทางปฏิบัติและวิธีการที่เข้มงวดมากขึ้นเพื่อให้แน่ใจว่าการใช้ชุดข้อมูลจะไม่ทำให้โครงการตกอยู่ในความเสี่ยงทางกฎหมายเมื่อเวลาผ่านไป และเมื่อการดำเนินงานทางวิชาการทั่วโลกในภาคการเรียนรู้ของเครื่องกำลังมองหาการคืนทุนจากการลงทุนหลายปี ผู้เขียนสังเกตว่า*:
‘[ร่าง] กฎหมายที่เกี่ยวข้องกับชุดข้อมูล ML กำลังจะเติบโตขึ้น เนื่องจากมีความกังวลว่ากฎหมายปัจจุบันไม่มีการคุ้มครองที่เพียงพอ ร่างกฎหมาย AI ของสหภาพยุโรป หากได้รับการผ่าน จะเปลี่ยนแปลงภูมิทัศน์การกำกับดูแล AI และข้อมูลในวงกว้าง และเขตอำนาจศาลอื่น ๆ อาจทำตามรอยด้วยกฎหมายของตนเอง ‘












